Evaluación fundamentada vs. no fundamentada
Por qué la autoevaluación de tu modelo de IA falla en la calidad visual
Una nueva investigación introduce la 'fundamentación' como la variable clave que gobierna un tercer eje del cómputo en tiempo de prueba: el escalado de interacción. Los hallazgos muestran que un instrumento determinista que mide el diseño real supera a la evaluación VLM sobre captura de pantalla, arreglando el 40, 74% de los defectos en modalidades visuales mientras la métrica estándar no ve nada.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-07-31 · 4 min de lectura

Cuando un modelo de IA genera una página web, una presentación de diapositivas o una figura científica, ¿cómo sabemos que realmente se ve bien? La respuesta predeterminada del campo es preguntar a otro modelo, un modelo de lenguaje y visión (VLM) que lee una captura de pantalla de la salida. Un nuevo artículo de Pine AI y la Universidad de Washington sostiene que este enfoque no solo es ruidoso, sino estructuralmente ciego.
El juez ciego
El artículo, Interaction Scaling: Grounding the Third Axis of Test-Time Compute, presenta una demostración impactante. En una prueba de 15 representaciones densas de figuras académicas, el juez VLM sobre captura de pantalla calificó 14 como 'perfectas'. Cuando los mismos artefactos fueron medidos por un instrumento de geometría DOM determinista, que lee el cuadro delimitador real de cada elemento, solo tres estaban realmente limpios. El resto tenía títulos de sección impresos uno sobre otro, etiquetas saliéndose de los cuadros y contenido recortado fuera del marco.
'El fallo es mecánico', escriben los autores. Las capturas de pantalla se toman a una resolución fija; el contenido que desborda el lienzo se recorta fuera del marco antes de que la imagen llegue al juez, y las superposiciones pequeñas dentro del marco caen por debajo de su agudeza visual.
Más allá del razonamiento y el muestreo
La contribución central del artículo es reformular la interacción como un tercer eje del cómputo en tiempo de prueba, distinto del razonamiento (cadenas de pensamiento más largas) y del muestreo (selección mejor de N). La variable clave es lo que los autores llaman fundamentación: retroalimentación que proviene de un instrumento que observa la forma o el comportamiento real del artefacto, no de un modelo que expresa una opinión sobre él.
'Un modelo que relee su propia salida no puede aprender nada que no supiera ya', explican los autores. Una crítica proveniente de los mismos pesos que produjeron el artefacto es posprocesamiento, que no añade nueva información sobre la respuesta correcta. La retroalimentación fundamentada, como un rastreo de error de una prueba fallida o un cuadro delimitador medido, importa una observación real en cada ciclo, rompiendo lo que llaman el 'techo interno'.
En experimentos controlados, con un presupuesto de tokens equivalente, tanto el razonamiento solo como la selección mejor de N con un verificador oráculo se estancaron por debajo del 87% de tasa de aprobación en tareas difíciles de codificación. Cada estrategia de interacción siguió escalando. El arnés de proponente y revisor alcanzó una tasa de aprobación perfecta del 100% con varianza de semilla cero.
La cobertura es lo que importa
El marco introduce un principio de cobertura: un canal de retroalimentación ayuda exactamente hasta donde llega el alcance observacional de su instrumento. Esto explica por qué, en el mismo conjunto de código, agregar un linter (fundamentado pero observando solo la forma) no compró nada sobre la crítica desnuda, mientras que la retroalimentación de ejecución convergió aproximadamente 2,5× más barata y a un techo más alto.
El control decisivo vino de intercambiar solo el instrumento del revisor en las modalidades visuales. Cuando un VLM leyó una captura de pantalla, sus ediciones empeoraron la geometría, aumentando los defectos en las diapositivas, porque era ciego al diseño real. Un revisor de geometría determinista, que mide los cuadros delimitadores reales, redujo drásticamente los defectos tanto en diapositivas densas (reducción del 73%) como en figuras académicas (reducción del 74%).
'Un pase de revisión, signo opuesto', señalan los autores, 'decidido enteramente por si la señal cubre el defecto'.
La varianza distribucional es un presupuesto
El artículo también incluye un hallazgo cautelar sobre el entrenamiento. Cuando los autores destilaron la calidad de interacción del arnés en un estudiante de 8 mil millones de parámetros mediante ajuste fino supervisado, el estudiante recuperó aproximadamente la mitad de la capacidad de muestra única del maestro. Pero agregar ajuste fino por refuerzo, que mejoró la consistencia por turno, en realidad perjudicó el rendimiento de pass@k. La razón: la varianza en la distribución de salida es el recurso mismo que el muestreo convierte en calidad. El RFT gastó parte de ese presupuesto.
Implicaciones para el campo
La lección práctica, argumentan los autores, no es 'agregar más bucles' sino 'fundamentar el bucle que agregas'. Para artefactos visuales, esto significa medir el DOM renderizado, nunca una captura de pantalla, tanto en el revisor como en el calificador. El hallazgo tiene implicaciones inmediatas para los muchos artículos recientes que miden la generación visual auto-mejorante con jueces VLM que no pueden ver los defectos en cuestión.
'El escalado de interacción es real, distinto del razonamiento y el muestreo, y predecible a partir de la cobertura', concluyen los autores. 'Una vez que fundamentas la métrica, es claramente visible'.
El código y el sitio web están disponibles en los enlaces del artículo.
- Fuente : Interaction Scaling: Grounding the Third Axis of Test-Time Compute
- Fuente : Interaction Scaling code repository — 2026-06-20
- Fuente : Interaction Scaling project website — 2016-01-01
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.