
Claude Code abrió 388 pull requests en Anthropic y 180 se fusionaron
Boris Cherny, creador de la herramienta, describe doce rutinas diarias que cazan crashes, borran código muerto y arreglan tests inestables en las apps internas de la empresa.
27 notas publicadas

Un experimento reconstruyo SQLite en Rust con enjambres de agentes: los planificadores de frontera solo disenaron y los trabajadores economicos hicieron el grueso, recortando el costo hasta 15 veces.

El nuevo modelo insignia de Anthropic lidera en programacion agentica y trabajo de conocimiento, y cuesta la mitad por token que Fable 5.

Su API cuesta 4,40 dólares por millón de tokens de salida, menos de un quinto que Opus 4.8, y expone lo caro que resultan los hábitos de programación con IA sin presupuesto.

En la AI Engineer World's Fair, Cat Wu y Thariq Shihipar de Anthropic contaron cómo los agentes de código cambiaron su trabajo y acortaron de meses a una semana el camino de la idea al producto.

El agente de terminal subía directorios completos a Google Cloud, incluidas llaves SSH y contraseñas. Tras la reacción, xAI liberó las 844.530 líneas de Rust bajo Apache 2.0.

El modelo de xAI queda detrás de Fable 5 y GPT-5.5 en varios benchmarks de programación, pero cuesta 2 dólares por millón de tokens de entrada y usa 4,2 veces menos tokens que Opus 4.8.

El modelo multimodal para programación agéntica cuesta 1,25 dólares por millón de tokens de entrada y llega tarde frente a OpenAI y Anthropic, pero apuesta por el precio bajo.

La empresa retira su respaldo al popular benchmark tras detectar que unas 200 de sus tareas están mal planteadas, y pide a la industria construir pruebas más confiables.

El modelo abierto chino igualó a Opus 4.8 en un benchmark interno de Databricks a 1,28 dólares por tarea frente a 1,94, y pasa a ser el modelo de trabajo diario de sus desarrolladores.

El Departamento de Comercio autorizó el lanzamiento público luego de que la agencia CAISI corriera pruebas de seguridad adicionales sobre la familia Sol.

La empresa china estrena un entorno de desarrollo agentico sobre GLM-5.2 con contexto de 1M tokens, cinco días gratis y cuotas ampliadas hasta julio de 2026.

Roland Gavrilescu, co-fundador de Introspection y ex xAI, explica en el AI Engineer World's Fair su tesis de autoresearch, agent recipes y por qué los humanos siguen siendo el eje del sistema.

El creador de Datasette relata cómo el modelo de Anthropic encontró cinco *release blockers* en 37 prompts, incluyendo un bug que borraba tablas enteras al cerrar la base.

Pauline Brunet, VP de Forward Deployed Engineering, explica cómo su equipo despliega agentes de ciclo largo dentro de bancos, telcos y fabricantes de chips para transformar el ciclo de desarrollo.

Anysphere presentó Cursor Mobile pocas semanas después de la adquisición por USD 60 mil millones anunciada por SpaceX. Permite crear y supervisar agentes de código desde el teléfono.

El CEO Zach Lloyd presentó en el AI Engineer World's Fair una plataforma para automatizar el ciclo completo de ingeniería de software, desde el triage hasta el despliegue.

El dispositivo, que sale el 15 de julio, se parece al Creator Micro 2: un macro pad con 13 switches mecánicos, joystick y sensor táctil pensado para atajos.

Introspection propone loops externos hechos por agentes; Osmani, Litt y Bakaus responden que la responsabilidad de diseño debe seguir siendo humana.

El nuevo mid-tier trae contexto de 1M tokens, precio promocional de USD 2/10 por millón y benchmarks que lo dejan cerca de Opus 4.8 pero con el doble de costo por tarea.

La compra por USD 60.000 millones abre la duda de si los rivales frontier seguirán vendiendo sus modelos a través de una plataforma controlada por Elon Musk.

El lanzamiento limitado responde a un pedido del gobierno de EE.UU. METR detectó la mayor tasa de cheating de un modelo público evaluado, con time horizon entre 11 y 270 horas según se cuente.

En la nueva benchmark de Epoch AI y METR, GPT-5.5 alcanza 44% y Gemini 3.1 Pro un 32%; una tarea costó USD 2.600 y 19 días de inferencia continua sin intervención humana.

El modelo chino de Zhipu AI resuelve 66% de 103 tareas de programación contra el 67% de Anthropic, pero quema casi el doble de tokens y suma latencia con 99 iteraciones por tarea.

El reporte interno de OpenAI Economic Research detalla cómo el uso de Codex se profundizó entre noviembre de 2025 y junio de 2026 en investigación, soporte, ingeniería y legal.

Anthropic estrena un agente que vive dentro de Slack, vigila canales sin ser invocado, etiqueta a compañeros responsables del código y dispara fixes cuando un A/B test cruza un guardrail.

El laboratorio chino Zhipu AI libera bajo licencia MIT un modelo con ventana de 1 millón de tokens que se queda a 1 punto de Anthropic en FrontierSWE.
Otros temas que aparecen junto a #coding agent en nuestra cobertura editorial.