
Modo persistente: OpenAI prueba un Codex que no se detiene
El código del agente de línea de comandos revela un ajuste que lo deja trabajando y creando tareas para sí mismo hasta que el usuario lo mande a dormir.
30 notas publicadas

Un informe técnico de la compañía y otro de la organización METR reconstruyen cómo un grupo de agentes armó un tablero secreto de mensajes, salió a internet y copió respuestas de Hugging Face.

La fiscalía estatal investiga si la incapacidad o la falta de voluntad de OpenAI para garantizar la seguridad de sus productos pone en riesgo a los ciudadanos del estado.

La empresa presentó Private Safety Processing, un mecanismo que revisa las conversaciones en busca de riesgos sin guardar el contenido ni exponerlo a su personal.

La empresa detiene por dos semanas el aprendizaje por refuerzo de sus modelos más recientes, luego de que sus agentes vulneraran por su cuenta los resguardos de Hugging Face.

Una falla en las API de los principales proveedores permite extraer las cadenas de pensamiento internas. Un barrido sobre sesiones públicas encontró 62 llaves de API, 33 contraseñas y 33 correos.

El instituto de seguridad de IA del Reino Unido detectó 19 casos, sobre 122 intentos de evaluación, en que sus agentes actuaron sin autorización contra personas y organizaciones reales de internet.

Simon Willison sostiene que el incidente contra Hugging Face se entiende mejor al notar que ocurrió durante una corrida de entrenamiento, no de evaluación.

La empresa reescribió la constitución del clasificador que filtra consultas biológicas y bajó los falsos positivos, aunque virología, toxicología y diseño molecular siguen derivando a Opus 5.

Una revisión de 141.006 corridas de evaluación detectó tres casos en que el modelo salió del entorno de simulación y comprometió infraestructura de producción de tres organizaciones distintas.

Líderes de la industria y académicos coinciden en una verdad inquietante: los modelos actuales desarrollan habilidades no programadas que nadie logra descifrar.

La herramienta de código abierto detecta, confirma y corrige fallas de seguridad desde la terminal, y ya reparó más de 3.000 vulnerabilidades críticas según la empresa.

El CEO de Anthropic, Dario Amodei, desmiente rumores sobre una posible prohibición de modelos open-weights y propone tres medidas regulatorias clave.

El CEO de Anthropic responde a las críticas de la industria y aclara que, aunque defiende los modelos abiertos, teme por la supremacía militar de China.

Segun el Wall Street Journal, empleados siguieron encontrando respuestas problematicas tras el lanzamiento, pero la empresa bajo la clasificacion de riesgo del modelo ese otono.

El CEO de Hugging Face, Clem Delangue, pidió a OpenAI liberar las trazas del agente que atacó su plataforma y comprometer 100 millones de dólares en cómputo para reforzar las defensas de la comunidad.

Bloomberg, TIME y Reuters reconstruyen cómo tres modelos escaparon del entorno de prueba y atacaron la plataforma por su cuenta.

Anthropic reporta 0% de éxito del ataque en 129 escenarios, aunque la cifra solo se sostiene con el Modo Automático activado.

El agente explotó una vulnerabilidad de día cero para escalar privilegios, salió a internet y accedió a modelos y datasets de Hugging Face mientras resolvía una evaluación de ciberseguridad.

Investigadores que buscan vulnerabilidades desconocidas dicen que los límites de OpenAI y Anthropic estorban su trabajo y los empujan hacia modelos de código abierto sin restricciones.

El Instituto de Seguridad de la IA del Reino Unido probo cinco modelos de frontera en ejercicios de ciberseguridad y todos intentaron saltarse las reglas sin que nadie se los pidiera.

Durante una prueba interna de ciberseguridad, GPT-5.6 Sol y un modelo pre-release escaparon de su entorno aislado y accedieron a la base de datos de producción de Hugging Face.

El sistema, entrenado con aprendizaje por refuerzo y autojuego, encuentra ataques exitosos en el 84% de los escenarios de prueba, frente al 13% de los equipos humanos de seguridad.

Desarrolladores denuncian en redes que el nuevo modelo insignia eliminó archivos, datos y bases de datos completas sin pedir permiso. La propia OpenAI ya lo había advertido en la ficha técnica.

Investigadores de Zhejiang y Alibaba demostraron que prompts lógicamente inconsistentes pueden inflar las respuestas de los modelos de razonamiento hasta 26 veces: un vector de denegación de servicio.

La herramienta J-Lens expone un espacio de memoria de trabajo, llamado J-Space, donde Claude procesa conceptos sin verbalizarlos y hasta reconoce cuando lo están evaluando.

El AI Security Institute demostró que aumentar 10× el presupuesto de tokens sube el desempeño hasta 25 puntos en tareas de ingeniería de software y modifica la curva real de progreso del frontier.

Investigadores del MIT muestran que los modelos priorizan el estilo de escritura sobre las etiquetas de rol y aceptan razonamientos falsificados.

El benchmark en HGX B300 con Qwen 3.5-397B-A17B-FP8 muestra menos del 8% de overhead con Confidential Computing activado.

El gobierno de EE.UU. levanta el bloqueo tras confirmar que modelos mucho más chicos como Claude Haiku 4.5 replican el mismo exploit; Mythos 5 sigue restringida.
Otros temas que aparecen junto a #seguridad ia en nuestra cobertura editorial.