
Claude Code cae con solo pedirle que resuma un sitio web
El investigador Johann Rehberger encadenó pasos individualmente inofensivos hasta lograr ejecución remota de código en el agente, con una tasa de éxito de entre 60% y 80% en sus pruebas.
31 notas publicadas

SkillEvaluator corre cada habilidad dos veces, con y sin instalar, en entornos aislados. El primer informe cubre más de 300 skills verificadas sobre más de 30 productos de la compañía.

Un experimento con 45 flujos generados por un agente de programación muestra que el detalle del prompt cambia el código y su costo, pero no la física del resultado.

Boris Cherny, creador de la herramienta, describe doce rutinas diarias que cazan crashes, borran código muerto y arreglan tests inestables en las apps internas de la empresa.

A partir del 14 de agosto, los usuarios de Claude Code verán el modo automático como configuración predeterminada tras demostrar mayor eficacia frente a riesgos.

Anthropic apuesta por la automatización en sus planes Pro, Max y Team. Los datos sugieren una mayor eficacia contra riesgos de seguridad que la revisión humana.

Fractal Manifold lanzó en Kickstarter un panel de escritorio de 4 pulgadas que muestra cuota, tokens y costo estimado de Claude Code, Codex y Antigravity sin sacar credenciales del computador.

Un análisis de Composio revela que, aunque Claude Code es el framework más veloz para agentes, su ejecución es casi tres veces más cara que la de sus competidores.

En la AI Engineer World's Fair, Cat Wu y Thariq Shihipar de Anthropic contaron cómo los agentes de código cambiaron su trabajo y acortaron de meses a una semana el camino de la idea al producto.

Según el New York Times, el acuerdo podría valer hasta 10.000 millones de dólares en dos años y sería el primer gran cliente del plan de Zuckerberg para vender capacidad de sus centros de datos.

La oferta gratuita para docentes verificados de escuelas K-12 en Estados Unidos incluye Claude, Claude Code y el agente Cowork, con la promesa de no entrenar modelos con datos de estudiantes.

El agente de programación de OpenAI sumó cerca de un millón de usuarios en un día, mientras Anthropic dejó de publicar cifras comparables de Claude Code.

El desarrollador Simon Willison portó el modelo Moebius 0.2B al navegador con ayuda de Claude Code, en un experimento sobre el estado de la programación asistida por IA.

La empresa china estrena un entorno de desarrollo agentico sobre GLM-5.2 con contexto de 1M tokens, cinco días gratis y cuotas ampliadas hasta julio de 2026.

Ammaar Reshi, líder de producto de Google AI Studio, usó las herramientas de Anthropic para portar C&C: Generals Zero Hour a ARM64 nativo en iPhone y iPad, con campaña, skirmish y controles táctiles.

Anthropic estrena su Sonnet más autónomo con planificación, uso de navegador y terminal, desempeño cercano a Opus 4.8 y precio introductorio hasta el 31 de agosto de 2026.

Paul Bakaus, creador de *Impeccable*, defiende un modelo donde el agente entrega el 80% y el humano custodia el 20% final. Sin auto mode. Nunca.

El grupo chino clasifica la herramienta de programación de Anthropic como software de alto riesgo tras un experimento marzo que identificaba usuarios chinos, según Reuters y Morningstar.

El proxy open source aprovecha que Anthropic cobra imágenes por dimensiones, no por caracteres, y comprime prompts largos en una sola página densa.

El benchmark de Scale Labs y el Center for AI Safety mide agentes en 240 proyectos reales por USD 144.000: la tasa top se cuadruplicó en ocho meses.

El EVP Jacob Andreou escribió en un memo filtrado a The Information que Microsoft fusiona las apps de consumo y empresa, y suma agentes que hacen agenda y resumen de mail por costo adicional.

Anysphere presentó Cursor Mobile pocas semanas después de la adquisición por USD 60 mil millones anunciada por SpaceX. Permite crear y supervisar agentes de código desde el teléfono.

Tariq Shihipar, del equipo técnico, dice que los modelos Mythos son más imaginativos y funcionan mejor con menos instrucciones y ejemplos.

La versión 2.1.91 usaba esteganografía y cifrado XOR con clave 91 para detectar timezone y proxy chinos. Anthropic dice que fue un experimento contra reventas y distillation.

Documentos internos vistos por The Information indican que Meta pausó trabajos con esas herramientas de Anthropic y OpenAI para evitar que las salidas terminen en su propio dataset de entrenamiento.

Investigadores de 0DIN, el bug bounty GenAI de Mozilla, mostraron cómo un repo con comandos ocultos por DNS abre una shell reversa apenas el agente IA corre el script de setup.

La nueva integración para Slack pone un único @Claude compartido por canal, con acceso a herramientas y código, y queda en beta para clientes Enterprise y Team corriendo sobre Opus 4.8.

Simon Willison usó Claude Code para convertir el modelo de inpainting Moebius desde PyTorch a ONNX y desplegarlo como demo cliente con caché de 1,3 GB y soporte en Chrome, Firefox y Safari.

El skill de Oxford y Stanford corre sobre Claude Opus 4.7, orquesta una redacción virtual de siete roles y deja trazable el 93% de las afirmaciones del artículo final.

Shortcuts Playground, el plugin que liberó MacStories, convierte a los agentes de IA en constructores de automatizaciones de macOS meses antes de la función oficial.

El proyecto con Carnegie Mellon y UC Berkeley pone a Codex, Claude Code y Kimi Code a escribir el código de entrenamiento, leer papers y coordinar una flota completa por Git.
Otros temas que aparecen junto a #claude code en nuestra cobertura editorial.