La conversación sobre cómo mejorar los sistemas de inteligencia artificial se está desplazando desde los pesos del modelo hacia el harness: el andamiaje de prompts, herramientas, memoria y contexto que rodea al modelo y define lo que realmente puede hacer. La investigadora Lilian Weng, hoy cofundadora de la startup Thinky, publicó un repaso de 35 papers que reordena ese debate y lo conecta con la auto-mejora recursiva de la IA (RSI, por su sigla en inglés).
Su tesis central es que buena parte de las ganancias de capacidad de un agente no vienen de reentrenar el modelo, sino de rediseñar el andamiaje que lo envuelve. Weng lo resume en una idea que ordena el resto del análisis:
"Aun cuando muchas mejoras del harness terminen internalizándose en el modelo base, la necesidad de especificar objetivos y contexto no va a desaparecer."

¿Qué es exactamente un harness?
En el vocabulario de los agentes, el harness es todo lo que envuelve al modelo sin ser el modelo: las instrucciones, las herramientas que puede invocar, la forma de administrar el contexto, el middleware que intercepta sus pasos y los bucles de evaluación que detectan fallas. Dos equipos pueden usar el mismo modelo base y obtener resultados muy distintos según cómo armen ese andamiaje. Por eso Weng insiste en que la ingeniería del harness ya es una disciplina en sí misma.
¿Por qué se conecta con la auto-mejora recursiva?
El punto más provocador del repaso es reformular la auto-mejora recursiva. En lugar de imaginar un modelo que reescribe sus propios pesos, Weng describe sistemas que se mejoran iterando el andamiaje: corren una evaluación, analizan las fallas, proponen cambios al harness y vuelven a medir. El laboratorio Sakana conecta esa línea con proyectos como The AI Scientist, ShinkaEvolve y la Darwin Godel Machine. El repaso también recopila la literatura de optimización de harnesses, desde el conocido paper ACE hasta tendencias más recientes como los Meta-Harnesses.
Una tendencia que la industria ya adopta
El giro no es solo académico. Figuras como Greg Brockman han empezado a respaldar en público la ingeniería de agentes y harnesses, y LangChain lanzó un curso de Deep Agents junto a un proyecto de harness de código abierto. La idea común es que, ante una nueva clase de modelo, conviene revisar y cambiar los prompts y las restricciones que lo limitan para sacar a la luz comportamientos que de otro modo quedarían ocultos.
Señales concretas del mismo día
Varios lanzamientos ilustran el patrón de arreglar fallas puntuales en vez de solo escalar parámetros. Liquid AI presentó Antidoom, un método de entrenamiento abierto contra los bucles de repetición en modelos de razonamiento pequeños: reporta caídas de 10,2% a 1,4% en LFM2.5-2.6B y de 22,9% a 1% en Qwen3.5-4B bajo muestreo voraz. Por su parte, el trabajo de compresión Puzzle-75B-A9B de NVIDIA reclama cerca de 2 veces más throughput por servidor y elevar la concurrencia con contexto de 1 millón de tokens en una H100 de 1 a 8 solicitudes.




