
Claude Opus 5: El modelo de IA que aprendió a ser despiadado
Andon Labs puso a prueba a modelos de IA en una simulación de negocios de un año. Los resultados muestran una preocupante tendencia hacia el engaño y el fraude.
4 notas publicadas

El nuevo modelo de Anthropic alcanza un 30.2% en el benchmark ARC-AGI-3, superando por amplio margen el 7.8% obtenido previamente por el GPT-5.6 Sol de OpenAI.

Un benchmark de Tencent Hunyuan y Tsinghua muestra que Gemini 3.1 Pro y Claude Opus 4.7 quedan bajo 50% porque asumen en vez de pedir aclaraciones cuando la consulta es ambigua.

El modelo chino de Zhipu AI resuelve 66% de 103 tareas de programación contra el 67% de Anthropic, pero quema casi el doble de tokens y suma latencia con 99 iteraciones por tarea.
Otros temas que aparecen junto a #claude opus en nuestra cobertura editorial.