Agentes de programación autónomos · Preprint de arXiv
Harness-of-Harness afirma una mejora del 52,25 % al ejecutar otros agentes de programación
HoH envuelve los harness de agentes de programación existentes en bucles repetidos de planificación, programación y pruebas, y reporta una ganancia relativa media del 52,25 % en tres suites de benchmarks. El resumen deja sin definir la métrica subyacente, el coste de recursos y el desglose por modelo.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-09-25 · 5 min de lectura

El preprint de Harness-of-Harness se publicó en arXiv el 1 de septiembre de 2026 y defiende una división que la mayoría de los artículos sobre agentes evita. En lugar de entregar un agente de programación, envuelve los que ya existen y se hace cargo de lo que hacen después.
HoH organiza las ejecuciones de un harness en bucles de planificación, programación y pruebas, y luego repite esos bucles para que cada pasada parta de lo que dejó la anterior. La afirmación del resumen es que esta capa externa eleva el rendimiento sin tocar el modelo subyacente: una ganancia relativa media del 52,25 % y un máximo del 82,86 %, medidos tras tres iteraciones.
La afirmación: un harness que mejora otros harness
Gran parte del resumen describe lo que HoH se niega a hacer. Acota qué cuenta como salida verificable en lugar de prescribir cómo debe trabajar un agente, y divide el desarrollo en incrementos pequeños que pueden comprobarse. Las pruebas que se realizan mientras se escribe el código se mantienen separadas de un paso de evaluación que se ejecuta por su cuenta.
Después llega el equilibrio que los autores destacan: reparación frente a crecimiento de capacidades. Un bucle que solo corrige defectos mantiene vivo un proyecto sin hacerlo avanzar; un bucle que solo añade funciones acumula averías. Se describe a HoH manteniendo ambos en tensión a lo largo de las iteraciones, exponiendo entregables, herramientas y habilidades de forma progresiva en lugar de hacerlo todo de una vez, y conservando un historial versionado del proyecto para que el registro sobreviva a la ejecución.
¿El 52,25 % de qué?
Las ganancias se midieron en GameCraft-Bench, FrontierSWE y ProgramBench, frente al mismo harness ejecutado de forma independiente. Tres iteraciones produjeron la media; uno de los pares produjo el máximo. Ahí es donde se detiene el resumen.
Nunca nombra la métrica que mejoró. Una ganancia relativa del 52,25 % podría ser una tasa de aprobados, un recuento de tareas completadas o un compuesto que los autores definieron para la ocasión, y el lector no puede saber cuál de ellas es a partir del texto. Tampoco se desglosa el resultado por harness, modelo o benchmark, lo que deja la media como el único número disponible. «Relativa» es la palabra que sostiene todo aquí: una ganancia frente a una línea base baja es un cambio absoluto menor de lo que parece.
| Afirmación del resumen | Lo que el texto especifica realmente |
|---|---|
| Ganancia relativa media del 52,25 % | En tres pares harness-modelo, tras tres iteraciones |
| Ganancia máxima del 82,86 % | El mejor de esos mismos tres pares, tras tres iteraciones |
| Mejora consistente frente a los harness independientes | Se afirma para los tres pares; no se ofrecen cifras por par |
| Desarrollo autónomo de varios días | Un proyecto, más de 70 iteraciones, un shooter en primera persona |
| Coste, presupuesto de tokens, tiempo de reloj | No reportado |
Setenta iteraciones, un shooter en primera persona
El despliegue es la parte que llegará más lejos. A lo largo de más de 70 iteraciones, se dice que HoH produjo un shooter en primera persona con una historia coherente, mecánicas centrales implementadas, una versión jugable por humanos, «gráficos pulidos y audio integrado».
Un shooter pone a prueba cosas que una utilidad de línea de comandos no: estado en tiempo real, gestión de entradas, colisiones, un pipeline de recursos que sobrevive a que un agente reescriba archivos que escribió una hora antes. Que la versión de HoH supere ese listón se afirma, no se mide. El resumen no ofrece tasa de fotogramas, ni número de pruebas de juego, ni comparación con un proyecto de alcance similar hecho por humanos. «Varios días» tampoco es un número de días, y el texto no da ninguna cifra de cómputo ni recuento de intervenciones humanas para la ejecución.
Modelo frente a harness
Los tres pares son Codex con GPT-5.5, OpenCode con DeepSeek-V4-Pro y Pi con MiniMax-M3. Tres harness sobre tres familias de modelos es la forma adecuada para un artículo sobre andamiaje. Si el bucle solo hubiera ayudado al harness en torno al cual se diseñó, toda la idea parecería una receta de prompts con nuevo envoltorio.
El resumen dice que HoH superó cada vez al harness independiente correspondiente, que es la afirmación más fuerte que podía hacer sin publicar el desglose. El esfuerzo es lo que no puede descartar a partir del texto. Un bucle iterativo que se ejecuta más tiempo, prueba más variantes y descarta más fallos tenderá a obtener mejor puntuación en cualquier benchmark, y en el resumen no aparece ningún presupuesto de tokens, cifra de tiempo de reloj ni contabilidad de costes. Queda abierto cuánto del 52,25 % procede de una mejor planificación y cuánto de gastar más de todo.
Lo que el artículo no muestra
Este es un preprint enviado el 1 de septiembre de 2026, y cada número pertenece a sus autores. No se menciona ninguna replicación independiente. Nombrar tres benchmarks públicos plantea la habitual cuestión de la contaminación, ya que las suites que circulan ampliamente pueden acabar en los datos de entrenamiento, y el texto no lo aborda. Falta la contabilidad de recursos para la demostración más larga, la que se lee como más impresionante.
Puede que el resultado se sostenga. Por ahora no está verificado, que es la condición ordinaria de un preprint reciente y una razón para tomarse el 52,25 % con pinzas hasta que alguien lo reproduzca.
El argumento más interesante de HoH está por debajo de su cifra estrella. Si el bucle en torno a un agente de programación es en sí mismo un lugar donde encontrar ganancias, entonces la competencia entre harness importa tanto como la competencia entre modelos. Esa afirmación es la que resolvería la replicación, y todavía no hay mucho que comprobar.
- Fuente : Harness-of-Harness claims a 52.25% lift by running other coding agents — 2026-09-01
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.