SevenTnewSNoticias de IA y tecnología, explicadas

Agentes de programación autónomos · Preprint de arXiv

Harness-of-Harness afirma una mejora del 52,25 % al ejecutar otros agentes de programación

HoH envuelve los harness de agentes de programación existentes en bucles repetidos de planificación, programación y pruebas, y reporta una ganancia relativa media del 52,25 % en tres suites de benchmarks. El resumen deja sin definir la métrica subyacente, el coste de recursos y el desglose por modelo.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-09-25 · 5 min de lectura

Harness-of-Harness afirma una mejora del 52,25 % al ejecutar otros agentes de programación

El preprint de Harness-of-Harness se publicó en arXiv el 1 de septiembre de 2026 y defiende una división que la mayoría de los artículos sobre agentes evita. En lugar de entregar un agente de programación, envuelve los que ya existen y se hace cargo de lo que hacen después.

HoH organiza las ejecuciones de un harness en bucles de planificación, programación y pruebas, y luego repite esos bucles para que cada pasada parta de lo que dejó la anterior. La afirmación del resumen es que esta capa externa eleva el rendimiento sin tocar el modelo subyacente: una ganancia relativa media del 52,25 % y un máximo del 82,86 %, medidos tras tres iteraciones.

La afirmación: un harness que mejora otros harness

Gran parte del resumen describe lo que HoH se niega a hacer. Acota qué cuenta como salida verificable en lugar de prescribir cómo debe trabajar un agente, y divide el desarrollo en incrementos pequeños que pueden comprobarse. Las pruebas que se realizan mientras se escribe el código se mantienen separadas de un paso de evaluación que se ejecuta por su cuenta.

Después llega el equilibrio que los autores destacan: reparación frente a crecimiento de capacidades. Un bucle que solo corrige defectos mantiene vivo un proyecto sin hacerlo avanzar; un bucle que solo añade funciones acumula averías. Se describe a HoH manteniendo ambos en tensión a lo largo de las iteraciones, exponiendo entregables, herramientas y habilidades de forma progresiva en lugar de hacerlo todo de una vez, y conservando un historial versionado del proyecto para que el registro sobreviva a la ejecución.

¿El 52,25 % de qué?

Las ganancias se midieron en GameCraft-Bench, FrontierSWE y ProgramBench, frente al mismo harness ejecutado de forma independiente. Tres iteraciones produjeron la media; uno de los pares produjo el máximo. Ahí es donde se detiene el resumen.

Nunca nombra la métrica que mejoró. Una ganancia relativa del 52,25 % podría ser una tasa de aprobados, un recuento de tareas completadas o un compuesto que los autores definieron para la ocasión, y el lector no puede saber cuál de ellas es a partir del texto. Tampoco se desglosa el resultado por harness, modelo o benchmark, lo que deja la media como el único número disponible. «Relativa» es la palabra que sostiene todo aquí: una ganancia frente a una línea base baja es un cambio absoluto menor de lo que parece.

Afirmación del resumenLo que el texto especifica realmente
Ganancia relativa media del 52,25 %En tres pares harness-modelo, tras tres iteraciones
Ganancia máxima del 82,86 %El mejor de esos mismos tres pares, tras tres iteraciones
Mejora consistente frente a los harness independientesSe afirma para los tres pares; no se ofrecen cifras por par
Desarrollo autónomo de varios díasUn proyecto, más de 70 iteraciones, un shooter en primera persona
Coste, presupuesto de tokens, tiempo de relojNo reportado

Setenta iteraciones, un shooter en primera persona

El despliegue es la parte que llegará más lejos. A lo largo de más de 70 iteraciones, se dice que HoH produjo un shooter en primera persona con una historia coherente, mecánicas centrales implementadas, una versión jugable por humanos, «gráficos pulidos y audio integrado».

Un shooter pone a prueba cosas que una utilidad de línea de comandos no: estado en tiempo real, gestión de entradas, colisiones, un pipeline de recursos que sobrevive a que un agente reescriba archivos que escribió una hora antes. Que la versión de HoH supere ese listón se afirma, no se mide. El resumen no ofrece tasa de fotogramas, ni número de pruebas de juego, ni comparación con un proyecto de alcance similar hecho por humanos. «Varios días» tampoco es un número de días, y el texto no da ninguna cifra de cómputo ni recuento de intervenciones humanas para la ejecución.

Modelo frente a harness

Los tres pares son Codex con GPT-5.5, OpenCode con DeepSeek-V4-Pro y Pi con MiniMax-M3. Tres harness sobre tres familias de modelos es la forma adecuada para un artículo sobre andamiaje. Si el bucle solo hubiera ayudado al harness en torno al cual se diseñó, toda la idea parecería una receta de prompts con nuevo envoltorio.

El resumen dice que HoH superó cada vez al harness independiente correspondiente, que es la afirmación más fuerte que podía hacer sin publicar el desglose. El esfuerzo es lo que no puede descartar a partir del texto. Un bucle iterativo que se ejecuta más tiempo, prueba más variantes y descarta más fallos tenderá a obtener mejor puntuación en cualquier benchmark, y en el resumen no aparece ningún presupuesto de tokens, cifra de tiempo de reloj ni contabilidad de costes. Queda abierto cuánto del 52,25 % procede de una mejor planificación y cuánto de gastar más de todo.

Lo que el artículo no muestra

Este es un preprint enviado el 1 de septiembre de 2026, y cada número pertenece a sus autores. No se menciona ninguna replicación independiente. Nombrar tres benchmarks públicos plantea la habitual cuestión de la contaminación, ya que las suites que circulan ampliamente pueden acabar en los datos de entrenamiento, y el texto no lo aborda. Falta la contabilidad de recursos para la demostración más larga, la que se lee como más impresionante.

Puede que el resultado se sostenga. Por ahora no está verificado, que es la condición ordinaria de un preprint reciente y una razón para tomarse el 52,25 % con pinzas hasta que alguien lo reproduzca.

El argumento más interesante de HoH está por debajo de su cifra estrella. Si el bucle en torno a un agente de programación es en sí mismo un lugar donde encontrar ganancias, entonces la competencia entre harness importa tanto como la competencia entre modelos. Esa afirmación es la que resolvería la replicación, y todavía no hay mucho que comprobar.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.