Saltar al contenido
Etiqueta

#benchmarks

25 notas publicadas

NVIDIA AVO llega al 100% en ARC-AGI-3 con agentes autónomos
IA

NVIDIA AVO llega al 100% en ARC-AGI-3 con agentes autónomos

La arquitectura de NVIDIA resolvió los 183 niveles de la prueba pública con 12% menos acciones que VISTA, y llevó a un modelo que por sí solo rendía 30% hasta el puntaje perfecto.

NVIDIA Developer
Melanie Mitchell: aún no sabemos medir la cognición de la IA
IA

Melanie Mitchell: aún no sabemos medir la cognición de la IA

La científica del Instituto Santa Fe propone estudiar los modelos con los métodos que la psicología aplica a otras inteligencias ajenas, como las de los bebés y los animales.

Quanta Magazine
Nemotron 3.5 Lightning: 670 tokens/s y el nivel de gpt-oss-120b
IA

Nemotron 3.5 Lightning: 670 tokens/s y el nivel de gpt-oss-120b

Artificial Analysis midió el modelo abierto de NVIDIA: la mayor velocidad de su clase, un salto de nueve puntos en inteligencia y un Elo agéntico superior al de modelos cuatro veces más grandes.

The Decoder
AMX acelera la IA en el Xeon 678X sin castigo térmico
Open Source

AMX acelera la IA en el Xeon 678X sin castigo térmico

Phoronix midió las extensiones matriciales de Intel en un Granite Rapids WS montado en una HP Z4 G6i, con Ubuntu 26.04 y kernel Linux 7.0.

Phoronix Tests
Meta suma un segundo agente que hace de memoria del primero
IA

Meta suma un segundo agente que hace de memoria del primero

Un módulo separado vigila la ejecución, mantiene un banco de memoria estructurado y decide cuándo interrumpir al agente principal con un recordatorio y cuándo quedarse callado.

The Decoder
GPT-5.6 Sol: ¿supera a Claude Opus 5 en ARC-AGI-3?
IA

GPT-5.6 Sol: ¿supera a Claude Opus 5 en ARC-AGI-3?

La nueva IA de OpenAI alcanza un 38,3% en ARC-AGI-3, pero solo bajo condiciones de test personalizadas que cuestionan la comparativa directa con Anthropic.

The Decoder
METR mide cuándo un agente de IA sale más caro que un humano
IA

METR mide cuándo un agente de IA sale más caro que un humano

El nuevo indicador, llamado horizonte de gasto, pone una cifra en dólares al punto exacto donde un agente de IA deja de ser más barato que una persona para resolver el mismo problema.

The Decoder
Claude Opus 5 lidera benchmarks y cuesta menos que Fable 5
IA

Claude Opus 5 lidera benchmarks y cuesta menos que Fable 5

El modelo de Anthropic encabeza el Artificial Analysis Intelligence Index con 61 puntos y baja el costo por tarea hasta la mitad en los tramos de razonamiento intermedios.

The Decoder
Claude Opus 5 casi iguala a Fable 5 a mitad de precio
IA

Claude Opus 5 casi iguala a Fable 5 a mitad de precio

El nuevo modelo insignia de Anthropic lidera en programacion agentica y trabajo de conocimiento, y cuesta la mitad por token que Fable 5.

The Decoder
Kimi K3: el modelo abierto de 2,8 billones que reta a Opus 4.8
IA

Kimi K3: el modelo abierto de 2,8 billones que reta a Opus 4.8

Moonshot AI lanzó su modelo más capaz, con pesos abiertos prometidos para el 27 de julio; supera a GPT-5.5 y Opus 4.8 en sus propios benchmarks, pero cobra como la gama Claude Sonnet.

Simon Willison
RoboLab de NVIDIA evalúa robots generalistas en simulación
Robótica

RoboLab de NVIDIA evalúa robots generalistas en simulación

La plataforma mide no solo si un robot completa la tarea, sino cuándo falla, por qué falla y con cuánta confianza estadística se puede afirmar que una política es mejor que otra.

The Robot Report
Graviton5 supera al Xeon Granite Rapids pero no al EPYC Turin
Open Source

Graviton5 supera al Xeon Granite Rapids pero no al EPYC Turin

Los primeros benchmarks del nuevo procesador Arm de AWS lo ubican por delante del Intel Xeon 6, aunque todavía por debajo del AMD EPYC Turin en la nube EC2.

Phoronix Tests
NVIDIA presenta RoboLab para evaluar robots de forma justa
IA

NVIDIA presenta RoboLab para evaluar robots de forma justa

La plataforma de NVIDIA Research busca resolver uno de los problemas sin resolver de la robótica: cómo medir de verdad si una política de control funcionará fuera del laboratorio.

NVIDIA Developer
Muse Spark 1.1 de Meta supera a GLM-5.2 en programación
IA

Muse Spark 1.1 de Meta supera a GLM-5.2 en programación

El modelo empata en el Intelligence Index de Artificial Analysis, gana el duelo de programación y llega con un costo por tarea más bajo que sus rivales directos.

The Decoder
Grok 4.5 es tan barato que los benchmarks importan menos
IA

Grok 4.5 es tan barato que los benchmarks importan menos

El modelo de xAI queda detrás de Fable 5 y GPT-5.5 en varios benchmarks de programación, pero cuesta 2 dólares por millón de tokens de entrada y usa 4,2 veces menos tokens que Opus 4.8.

The Decoder
GPT-5.6 Sol casi iguala a Fable 5 a un tercio del costo
IA

GPT-5.6 Sol casi iguala a Fable 5 a un tercio del costo

El modelo insignia de OpenAI marca 59 puntos en el Intelligence Index de Artificial Analysis, a un punto de Fable 5, pero cuesta 1,04 dólares por tarea frente a 2,75.

The Decoder
OpenAI: casi 30% del test de código SWE-Bench Pro falla
IA

OpenAI: casi 30% del test de código SWE-Bench Pro falla

La empresa retira su respaldo al popular benchmark tras detectar que unas 200 de sus tareas están mal planteadas, y pide a la industria construir pruebas más confiables.

The Decoder
OpenAI vence a todos los humanos en la final de AtCoder
IA

OpenAI vence a todos los humanos en la final de AtCoder

En la final del AtCoder World Tour 2026, un sistema de OpenAI resolvió los cinco problemas de la división de algoritmos y superó por amplio margen a los mejores programadores competitivos del mundo.

The Decoder
Databricks adopta GLM 5.2 como motor de código por defecto
IA

Databricks adopta GLM 5.2 como motor de código por defecto

El modelo abierto chino igualó a Opus 4.8 en un benchmark interno de Databricks a 1,28 dólares por tarea frente a 1,94, y pasa a ser el modelo de trabajo diario de sus desarrolladores.

The Decoder
Claude Fable 5 lidera los benchmarks de industria a un precio alto
IA

Claude Fable 5 lidera los benchmarks de industria a un precio alto

Los nuevos índices de Artificial Analysis colocan al modelo de Anthropic primero en finanzas, derecho y medicina, pero una sola tarea puede costar más de cien veces que una alternativa abierta.

The Decoder
AISI británico: benchmarks fijos subestiman a los agentes IA
IA

AISI británico: benchmarks fijos subestiman a los agentes IA

El AI Security Institute demostró que aumentar 10× el presupuesto de tokens sube el desempeño hasta 25 puntos en tareas de ingeniería de software y modifica la curva real de progreso del frontier.

The Decoder
Paper de OpenAI filtra tres variantes Pro para GPT-5.6
IA

Paper de OpenAI filtra tres variantes Pro para GPT-5.6

Un benchmark de genómica lista por primera vez Luna Pro, Terra Pro y Sol Pro; Sol Pro alcanza 31,5% de pass rate en la prueba.

The Decoder
Claude Sonnet 5 casi duplica el costo real por tarea
IA

Claude Sonnet 5 casi duplica el costo real por tarea

Consume 40% más tokens de salida que Sonnet 4.6 y triplica los ciclos de agente. El costo promedio salta de USD 1,20 a USD 2,29, aún más caro que el propio Opus 4.8.

The Decoder
CEO-Bench: solo 3 modelos IA sobrevivieron 500 días de startup
IA

CEO-Bench: solo 3 modelos IA sobrevivieron 500 días de startup

Princeton diseñó un benchmark donde agentes IA dirigen una startup ficticia por 500 días simulados. La mayoría quiebra, y una heurística sin IA supera a casi todos los modelos probados.

The Decoder

Etiquetas relacionadas

Otros temas que aparecen junto a #benchmarks en nuestra cobertura editorial.