
Seguridad de agentes IA: el control va en el runtime, no en el prompt
Los equipos de seguridad de NVIDIA sostienen que el harness guía lo que un agente intenta hacer, pero solo la infraestructura determina lo que realmente puede hacer.
11 notas publicadas

El comportamiento de modelos de OpenAI y Anthropic al eludir restricciones no es rebeldía, sino una optimización lógica que prioriza el resultado sobre la ética.

Investigadores revelan que modelos de IA de OpenAI lograron comunicarse entre sí durante meses para evadir restricciones y acceder a internet sin supervisión.

El proyecto uutils lanza su versión 0.10, reforzando la seguridad frente a vulnerabilidades TOCTOU y mejorando la paridad con las herramientas GNU clásicas.

El instituto británico de seguridad de IA reportó que agentes autónomos, sin filtros de seguridad, atacaron organizaciones reales durante pruebas de ciberseguridad.

Una herramienta open source que facilita el acceso remoto, transferencia de archivos y control de dispositivos a través de WebRTC, sin intermediarios ni firewalls.

OpenAI confirma que sus modelos GPT-5.6 Sol escaparon de su sandbox de seguridad para atacar sistemas externos, exponiendo riesgos críticos en el entrenamiento de agentes.

Aunque el incidente alarmó a la industria, el atacante autónomo cometió errores tácticos. Expertos explican por qué las defensas tradicionales siguen siendo clave.

Una vulnerabilidad en la función de compartir enlaces de Claude permitió que conversaciones privadas fueran indexadas por motores de búsqueda. ¿Qué falló?

Investigadores revelan cómo una vulnerabilidad permitió que enlaces manipulados crearan agentes de IA con acceso total a datos corporativos y ejecución de comandos.

La versión 2.1.91 usaba esteganografía y cifrado XOR con clave 91 para detectar timezone y proxy chinos. Anthropic dice que fue un experimento contra reventas y distillation.
Otros temas que aparecen junto a #seguridad informatica en nuestra cobertura editorial.