
Los modelos de mundo fallan si ignoran lo que la gente cree
Un nuevo marco llamado Mental World Modeling agrega creencias, intenciones y normas sociales al estado del mundo, y con eso un modelo débil supera a uno más potente que solo simula física.
25 notas publicadas

La arquitectura de NVIDIA resolvió los 183 niveles de la prueba pública con 12% menos acciones que VISTA, y llevó a un modelo que por sí solo rendía 30% hasta el puntaje perfecto.

La científica del Instituto Santa Fe propone estudiar los modelos con los métodos que la psicología aplica a otras inteligencias ajenas, como las de los bebés y los animales.

Artificial Analysis midió el modelo abierto de NVIDIA: la mayor velocidad de su clase, un salto de nueve puntos en inteligencia y un Elo agéntico superior al de modelos cuatro veces más grandes.

Phoronix midió las extensiones matriciales de Intel en un Granite Rapids WS montado en una HP Z4 G6i, con Ubuntu 26.04 y kernel Linux 7.0.

Un módulo separado vigila la ejecución, mantiene un banco de memoria estructurado y decide cuándo interrumpir al agente principal con un recordatorio y cuándo quedarse callado.

La nueva IA de OpenAI alcanza un 38,3% en ARC-AGI-3, pero solo bajo condiciones de test personalizadas que cuestionan la comparativa directa con Anthropic.

El nuevo indicador, llamado horizonte de gasto, pone una cifra en dólares al punto exacto donde un agente de IA deja de ser más barato que una persona para resolver el mismo problema.

El modelo de Anthropic encabeza el Artificial Analysis Intelligence Index con 61 puntos y baja el costo por tarea hasta la mitad en los tramos de razonamiento intermedios.

El nuevo modelo insignia de Anthropic lidera en programacion agentica y trabajo de conocimiento, y cuesta la mitad por token que Fable 5.

Moonshot AI lanzó su modelo más capaz, con pesos abiertos prometidos para el 27 de julio; supera a GPT-5.5 y Opus 4.8 en sus propios benchmarks, pero cobra como la gama Claude Sonnet.

La plataforma mide no solo si un robot completa la tarea, sino cuándo falla, por qué falla y con cuánta confianza estadística se puede afirmar que una política es mejor que otra.

Los primeros benchmarks del nuevo procesador Arm de AWS lo ubican por delante del Intel Xeon 6, aunque todavía por debajo del AMD EPYC Turin en la nube EC2.

La plataforma de NVIDIA Research busca resolver uno de los problemas sin resolver de la robótica: cómo medir de verdad si una política de control funcionará fuera del laboratorio.

El modelo empata en el Intelligence Index de Artificial Analysis, gana el duelo de programación y llega con un costo por tarea más bajo que sus rivales directos.

El modelo de xAI queda detrás de Fable 5 y GPT-5.5 en varios benchmarks de programación, pero cuesta 2 dólares por millón de tokens de entrada y usa 4,2 veces menos tokens que Opus 4.8.

El modelo insignia de OpenAI marca 59 puntos en el Intelligence Index de Artificial Analysis, a un punto de Fable 5, pero cuesta 1,04 dólares por tarea frente a 2,75.

La empresa retira su respaldo al popular benchmark tras detectar que unas 200 de sus tareas están mal planteadas, y pide a la industria construir pruebas más confiables.

En la final del AtCoder World Tour 2026, un sistema de OpenAI resolvió los cinco problemas de la división de algoritmos y superó por amplio margen a los mejores programadores competitivos del mundo.

El modelo abierto chino igualó a Opus 4.8 en un benchmark interno de Databricks a 1,28 dólares por tarea frente a 1,94, y pasa a ser el modelo de trabajo diario de sus desarrolladores.

Los nuevos índices de Artificial Analysis colocan al modelo de Anthropic primero en finanzas, derecho y medicina, pero una sola tarea puede costar más de cien veces que una alternativa abierta.

El AI Security Institute demostró que aumentar 10× el presupuesto de tokens sube el desempeño hasta 25 puntos en tareas de ingeniería de software y modifica la curva real de progreso del frontier.

Un benchmark de genómica lista por primera vez Luna Pro, Terra Pro y Sol Pro; Sol Pro alcanza 31,5% de pass rate en la prueba.

Consume 40% más tokens de salida que Sonnet 4.6 y triplica los ciclos de agente. El costo promedio salta de USD 1,20 a USD 2,29, aún más caro que el propio Opus 4.8.

Princeton diseñó un benchmark donde agentes IA dirigen una startup ficticia por 500 días simulados. La mayoría quiebra, y una heurística sin IA supera a casi todos los modelos probados.
Otros temas que aparecen junto a #benchmarks en nuestra cobertura editorial.