
Modo persistente: OpenAI prueba un Codex que no se detiene
El código del agente de línea de comandos revela un ajuste que lo deja trabajando y creando tareas para sí mismo hasta que el usuario lo mande a dormir.
21 notas publicadas

Simon Willison pone a prueba la capacidad de GPT-5.6 Sol Ultra para generar videojuegos completos mediante prompts, logrando resultados superiores a sus versiones previas.

El autor puso a prueba el modelo GPT-5.6 Sol Ultra con un prompt complejo de desarrollo, logrando un juego funcional con agentes autónomos y correcciones técnicas.

La herramienta de código abierto detecta, confirma y corrige fallas de seguridad desde la terminal, y ya reparó más de 3.000 vulnerabilidades críticas según la empresa.

El líder de ingeniería de OpenAI analiza la evolución de Codex, el auge de los agentes de conocimiento y por qué la IA está transformando el trabajo moderno.

Un desarrollador reprodujo el accesorio de 230 dólares de OpenAI en un controlador ESP32 de menos de 60, con el código abierto en GitHub para replicarlo.

El controlador compacto creado con Work Louder reemplaza los comandos escritos por joysticks, un dial rotatorio y teclas RGB que muestran el estado de cada agente.

Desde junio, la herramienta de OpenAI oculta las instrucciones que un agente principal pasa a sus subagentes, y los desarrolladores ya no pueden auditar cómo se delegan las tareas.

Un agente de código puede montar el entorno, lanzar experimentos y afinar modelos por su cuenta. En una prueba llevó la precisión de un modelo de 25% a 96,9% en una tarea de conteo visual.

Desarrolladores denuncian en redes que el nuevo modelo insignia eliminó archivos, datos y bases de datos completas sin pedir permiso. La propia OpenAI ya lo había advertido en la ficha técnica.

El agente de programación de OpenAI sumó cerca de un millón de usuarios en un día, mientras Anthropic dejó de publicar cifras comparables de Claude Code.

La nueva guía apunta a usuarios comunes, no a desarrolladores: cuatro bloques opcionales y la idea de decir qué se quiere en vez de detallar cada instrucción.

Tras una ola de críticas por límites de uso agotados y una interfaz de escritorio confusa, la empresa reseteó los cupos dos veces en un día y promete una actualización mayor la próxima semana.

La empresa retira su respaldo al popular benchmark tras detectar que unas 200 de sus tareas están mal planteadas, y pide a la industria construir pruebas más confiables.

Construido sobre Codex y el recién liberado GPT-5.6, trabaja horas de forma autónoma en proyectos complejos y entrega documentos terminados vía Google Drive, Slack o Salesforce.

El dispositivo, que sale el 15 de julio, se parece al Creator Micro 2: un macro pad con 13 switches mecánicos, joystick y sensor táctil pensado para atajos.

Documentos internos vistos por The Information indican que Meta pausó trabajos con esas herramientas de Anthropic y OpenAI para evitar que las salidas terminen en su propio dataset de entrenamiento.

El reporte interno de OpenAI Economic Research detalla cómo el uso de Codex se profundizó entre noviembre de 2025 y junio de 2026 en investigación, soporte, ingeniería y legal.

El nuevo modelo lidera CyberGym (85,6%) y SEC-bench Pro (69,8%); el programa suma 25 partners como Cisco, CrowdStrike, Cloudflare y Palo Alto Networks.

La iniciativa, en alianza con Trail of Bits, usa la suite Codex Security para que ingenieros revisen y parchen vulnerabilidades antes de que lleguen a los mantenedores.

Shortcuts Playground, el plugin que liberó MacStories, convierte a los agentes de IA en constructores de automatizaciones de macOS meses antes de la función oficial.
Otros temas que aparecen junto a #codex en nuestra cobertura editorial.