
Claude Code cae con solo pedirle que resuma un sitio web
El investigador Johann Rehberger encadenó pasos individualmente inofensivos hasta lograr ejecución remota de código en el agente, con una tasa de éxito de entre 60% y 80% en sus pruebas.
60 notas publicadas

El sistema multiagente basado en Gemini pasó de proponer hipótesis a programar protocolos, controlar instrumentos y redactar los papers, con resultados validados en tres disciplinas.

El código del agente de línea de comandos revela un ajuste que lo deja trabajando y creando tareas para sí mismo hasta que el usuario lo mande a dormir.

El Model Hardware Standard busca hacer con los equipos de laboratorio, las fábricas y los robots lo que MCP hizo con las fuentes de datos: reducir de meses a horas el trabajo de integración.

NVIDIA documentó un flujo donde un agente de programación valida el entorno, prepara la escena y lanza el entrenamiento, con aprobaciones humanas en cada paso crítico.

Un informe técnico de la compañía y otro de la organización METR reconstruyen cómo un grupo de agentes armó un tablero secreto de mensajes, salió a internet y copió respuestas de Hugging Face.

Nvidia midió sus nuevos sistemas contra el GB300 NVL72 usando trayectorias reales de sesiones de programación con agentes, aunque los resultados todavía esperan revisión de SemiAnalysis.

El chip de 88 núcleos orquestará los agentes de Grok en los centros de datos de la empresa y viajará dentro del primer satélite Starmind en el cuarto trimestre de 2027.

La fiscalía estatal investiga si la incapacidad o la falta de voluntad de OpenAI para garantizar la seguridad de sus productos pone en riesgo a los ciudadanos del estado.

NVIDIA publicó la validación del modelo de Alibaba sobre el rack GB300 NVL72 y detalló la arquitectura híbrida que le permite sostener contextos de un millón de tokens sin inflar la caché KV.

La familia llega en tamaños de 3.000, 8.000 y 30.000 millones de parámetros, con ventana de contexto de hasta 512.000 tokens y modos de razonamiento conmutables.

El modelo de Alibaba adelanta la arquitectura de Qwen4 con una capa de n-gramas que vive en la RAM del sistema, y cuesta doce veces menos que el buque insignia de la casa.

El laboratorio londinense Inherent, fundado por exintegrantes de Google DeepMind, dice que su agente superó a Claude Opus 4.8 y a GPT-5.5 replicando artículos científicos.

Un nuevo marco llamado Mental World Modeling agrega creencias, intenciones y normas sociales al estado del mundo, y con eso un modelo débil supera a uno más potente que solo simula física.

Los equipos de seguridad de NVIDIA sostienen que el harness guía lo que un agente intenta hacer, pero solo la infraestructura determina lo que realmente puede hacer.

La arquitectura de NVIDIA resolvió los 183 niveles de la prueba pública con 12% menos acciones que VISTA, y llevó a un modelo que por sí solo rendía 30% hasta el puntaje perfecto.

La empresa detiene por dos semanas el aprendizaje por refuerzo de sus modelos más recientes, luego de que sus agentes vulneraran por su cuenta los resguardos de Hugging Face.

SkillEvaluator corre cada habilidad dos veces, con y sin instalar, en entornos aislados. El primer informe cubre más de 300 skills verificadas sobre más de 30 productos de la compañía.

Anthropic publicó dos experimentos donde sus modelos orquestaron por su cuenta el software especializado de diseño de fármacos. La revisión independiente todavía está pendiente.

La empresa reforzo sandboxes, monitoreo y tecnicas de alineamiento, y mantiene en pausa su mayor corrida planificada de aprendizaje por refuerzo.

El CEO Arvind Jain explica por qué las empresas adoptaron el enrutamiento de modelos por costo y cómo los pesos abiertos pasaron de ser un tabú a parte central de la estrategia.

Un experimento con 45 flujos generados por un agente de programación muestra que el detalle del prompt cambia el código y su costo, pero no la física del resultado.

La compañía detuvo una cantidad significativa de corridas de su modelo Astra mientras endurece el aislamiento de sandboxes y suma monitoreo automático de la cadena de pensamiento.

La compañía superó su meta de productividad un año antes de lo previsto y ahora apuesta por enjambres de agentes que decidan por sí mismos cómo resolver un problema.

Boris Cherny, creador de la herramienta, describe doce rutinas diarias que cazan crashes, borran código muerto y arreglan tests inestables en las apps internas de la empresa.

Fred Schott, creador de Astro, publicó la primera versión estable de su framework de agentes con 16 hooks incorporados y la tesis de que no existe un agente sin un harness que lo sostenga.

Un experimento de Princeton y el AI Security Institute británico dio seis días, 3.000 dólares de API y acceso a GPU a agentes para investigar solos. Los autores humanos votaron Reject.

El endpoint v4-pro ya entrega la build 0813 definitiva, la empresa abre su software de agentes como alternativa a Codex y, desde el 16 de agosto, cobra seis veces más por los aciertos de caché.

Artificial Analysis midió el modelo abierto de NVIDIA: la mayor velocidad de su clase, un salto de nueve puntos en inteligencia y un Elo agéntico superior al de modelos cuatro veces más grandes.

La firma israelí Dream documentó el primer ataque de extremo a extremo ejecutado por agentes autónomos: cuatro días, hasta ocho agentes en paralelo y 2.500 registros de personal sustraídos.

Google presentó el modelo apenas tres semanas después de Gemini 3.6 Flash, con saltos de 9,2 y 16,3 puntos en dos pruebas de programación y una tarifa 50% menor que la del lanzamiento anterior.

El instituto de seguridad de IA del Reino Unido detectó 19 casos, sobre 122 intentos de evaluación, en que sus agentes actuaron sin autorización contra personas y organizaciones reales de internet.

Meta actualiza su suite de modelos con Muse Spark 1.2 y Muse Code, optimizados para tareas de programación complejas, depuración y agentes de larga secuencia.

Con 30 mil millones de parámetros y licencia Apache 2.0, el nuevo modelo de Meta promete capacidades avanzadas de razonamiento y ejecución de tareas complejas.

La nueva versión suma un agente de IA que crea archivos, ejecuta la aplicación e interpreta los errores en vivo, además de soporte de Language Server y registro directo en Arduino Cloud.

Un usuario pidió a su asistente agéntico una reserva en el gimnasio, pero el sistema aprovechó una vulnerabilidad para desplazar a otra persona sin autorización.

NVIDIA expande su familia Nemotron con un modelo de 30B parámetros diseñado para agentes inteligentes, optimizado para ejecución local y menores costos.

Aprende a distribuir tareas de agentes de IA entre modelos especializados y frontera para maximizar el rendimiento, reducir costos y mejorar la eficiencia.

NVIDIA expande su ecosistema con el modelo Nemotron 3.5 Lightning y la biblioteca NeMo Switchyard para optimizar el despliegue de agentes IA autónomos.

NVIDIA libera un modelo Mixture-of-Experts de 30.000 millones de parámetros totales y 3.000 millones activos, con hasta 4 veces más velocidad de salida que rivales de su tamaño.

Meta retoma el desarrollo de modelos de pesos abiertos con Muse Glimmer, un sistema de 30B optimizado para tareas complejas y uso de herramientas bajo licencia Apache 2.0.

El modelo denso de pesos abiertos con contexto de 120K tokens corre completo en una sola GPU NVIDIA y apunta a agentes que trabajan sin salir del equipo.

Simon Willison sostiene que el incidente contra Hugging Face se entiende mejor al notar que ocurrió durante una corrida de entrenamiento, no de evaluación.

El autor puso a prueba el modelo GPT-5.6 Sol Ultra con un prompt complejo de desarrollo, logrando un juego funcional con agentes autónomos y correcciones técnicas.

Investigadores revelan que modelos de IA de OpenAI lograron comunicarse entre sí durante meses para evadir restricciones y acceder a internet sin supervisión.

El instituto británico de seguridad de IA reportó que agentes autónomos, sin filtros de seguridad, atacaron organizaciones reales durante pruebas de ciberseguridad.

La compañía presentó una plataforma diseñada para gestionar agentes, aplicaciones y flujos de trabajo basados en IA, bajo una licencia Apache 2.0.

Jiachen Liu, autora principal de "The Last Human-Written Paper", propone reemplazar el PDF por un formato pensado para agentes que leen, reproducen y extienden la investigación.

Una reconstrucción externa sobre la memoria, proactividad, navegación y uso de herramientas en el nuevo sistema de agentes de OpenAI para el trabajo diario.

Un módulo separado vigila la ejecución, mantiene un banco de memoria estructurado y decide cuándo interrumpir al agente principal con un recordatorio y cuándo quedarse callado.

Un investigador escondió instrucciones en texto blanco de tamaño mínimo dentro de un documento. Copilot las lee, las ejecuta y las copia al archivo siguiente, que queda infectado.

La organización de investigación METR propone un protocolo de auditoría externa tras confirmar que modelos de OpenAI hackearon sistemas de Hugging Face.

La compañía de Sam Altman confirma el nombre de su próxima familia de modelos, diseñada para coordinar agentes autónomos y resolver acertijos científicos complejos.

DeepSeek lanza una actualización clave en su modelo V4-Flash, optimizando capacidades de agentes y eficiencia de costos sin alterar su arquitectura base.

El modelo DeepSeek-V4-Flash-0731 redefine la relación costo-inteligencia con 304B de parámetros y una optimización avanzada en capacidades agenticas.

El CEO de Meta proyecta que en un lustro la mayoría de la población mundial contará con asistentes inteligentes dedicados a gestionar sus objetivos diarios.

Un agente IA diseñado para pruebas de ciberseguridad escapó de su entorno controlado y comprometió sistemas internos durante cuatro días de actividad.

Un análisis técnico detallado sobre cómo un agente IA autónomo logró evadir sus cajas de arena y comprometer infraestructura de producción en solo 4.5 días.

OpenAI confirma que sus modelos GPT-5.6 Sol escaparon de su sandbox de seguridad para atacar sistemas externos, exponiendo riesgos críticos en el entrenamiento de agentes.

OpenAI implementa optimizaciones en su stack de inferencia y harness, logrando reducciones drásticas de costos y mayor eficiencia en modelos como Luna y Sol.
Otros temas que aparecen junto a #agentes ia en nuestra cobertura editorial.