SevenTnewS

Investigación en IA

La evolución de harness se ve impresionante hasta que la pruebas en tareas no vistas

Se espera que la evolución automática de harness haga mejores a los agentes LLM, pero un nuevo artículo argumenta que muchas de las mejoras reportadas pueden deberse a sobreajuste al conjunto de prueba público. En experimentos, métodos simples de escalado en tiempo de prueba igualaron o superaron a la evolución, y los harness evolucionados mostraron una generalización limitada a tareas no vistas.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-27 · 3 min de lectura

La evolución de harness se ve impresionante hasta que la pruebas en tareas no vistas
Fuentes : Rethinking Harn…

El artículo, disponible en arXiv con el número 2607.12227, es una crítica metodológica directa. Revisa cómo se evalúa típicamente la evolución automática de harness, la práctica de usar retroalimentación de pruebas unitarias para buscar iterativamente mejores configuraciones de harness, y encuentra que el protocolo estándar está fundamentalmente roto.

Las dos preocupaciones centrales son lo suficientemente simples de enunciar. Primero, la evolución de harness es en sí misma un procedimiento de búsqueda que consume cómputo de inferencia y retroalimentación de tareas. Para saber si sus ganancias provienen de un mejor diseño de harness o solo de la búsqueda adicional, hay que compararlo con líneas base igualmente costosas, muestreo paralelo, refinamiento secuencial, que obtienen la misma retroalimentación pero no cambian el harness. El artículo argumenta que esta línea base casi nunca se ejecuta.

Segundo, si se busca en el mismo benchmark sobre el que se reporta, se está midiendo qué tan bien el harness puede adaptarse a ese conjunto específico de tareas, no qué tan transferible es la mejora. El artículo lo señala directamente: las ganancias reportadas corren el riesgo de sobreajustarse a ese conjunto de tareas específico.

Lo que los experimentos realmente encontraron

Gráfico: Evolución de harness vs líneas base en Terminal-Bench 2.1
El artículo reporta que la evolución automática de harness no superó consistentemente al muestreo paralelo ni al refinamiento secuencial bajo presupuestos de inferencia equiparados para estos modelos.

En Terminal-Bench 2.1, usando GPT-5.4 y Claude Opus 4.6, los investigadores compararon la evolución de harness con métodos simples de escalado en tiempo de prueba bajo presupuestos de inferencia equiparados. Los resultados no favorecen la narrativa predominante.

La evolución automática de harness no superó consistentemente al muestreo paralelo simple ni al refinamiento secuencial, incluso cuando la retroalimentación de pruebas unitarias estaba disponible. Cuando las tareas de búsqueda y evaluación se separaron, el harness evolucionado probado en tareas no vistas que no había visto durante la evolución, las mejoras fueron marginales en el mejor de los casos.

Los autores son cuidadosos en no exagerar. Su conclusión no es que la evolución de harness sea ineficaz, sino que sus beneficios deben evaluarse utilizando configuraciones justas, líneas base sólidas con presupuestos comparables y benchmarks que sean genuinamente sensibles al diseño de harness.

Esto se hace eco de trabajos relacionados del equipo de AgentScope, que encontraron que el diseño de harness puede variar las puntuaciones en más de 11 puntos para modelos más pequeños, pero que ese trabajo anterior se trataba de evaluar harness, no de evolucionarlos. El nuevo artículo extiende el mismo principio al proceso de evolución en sí: si los harness importan, entonces aislar adecuadamente su efecto del artefacto de búsqueda también importa.

Por qué esto es importante para el campo

El artículo llega en un momento en que el ecosistema de agentes de IA está luchando por una evaluación confiable. La lista de artículos relacionados señalados por Semantic Scholar es reveladora en sí misma. Están 'Do Agent Optimizers Compound?', 'SEAGym', 'MemoHarness', 'Harness Updating Is Not Harness Benefit', 'Evolving Agents in the Dark', 'Self-Harness' y 'TTHE: Test-Time Harness Evolution', todo un subcampo se está formando en torno a la cuestión de cómo evaluar a los evaluadores.

La crítica también plantea un punto más amplio sobre el pipeline de evaluación de agentes. Como se señaló en nuestra cobertura anterior, el diseño de harness puede variar las puntuaciones en más de 11 puntos para modelos más pequeños. Si la evolución agrega otra capa de búsqueda que no está adecuadamente separada de la medición, el campo corre el riesgo de construir un castillo de naipes donde las puntuaciones reportadas reflejan profundidad de búsqueda y familiaridad con el benchmark, en lugar de la capacidad real del agente.

El código está disponible en https://github.com/rethinking-harness-evolution para cualquiera que quiera replicar los experimentos o extenderlos a otras familias de modelos y conjuntos de tareas.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.