SevenTnewS

Apertura total y VLM

El experimento Picbreeder de Sakana AI muestra lo que los VLM pasan por alto sobre la creatividad humana

Un equipo liderado por Sakana AI reemplazó a los usuarios humanos de Picbreeder con VLM y descubrió que los archivos sintéticos carecen de la audacia y diversidad de los originales humanos. Sus experimentos con ruido, memoria y miles de personalidades guionizadas revelan tanto la promesa como los límites del uso de modelos grandes para el descubrimiento abierto.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-20 · 6 min de lectura

El experimento Picbreeder de Sakana AI muestra lo que los VLM pasan por alto sobre la creatividad humana
Fuentes : In Search of th…

La apertura total es el santo grial de la creatividad artificial: un sistema que sigue generando artefactos novedosos y significativos sin converger en una única solución. La evolución natural lo logra. La cultura humana lo logra. Los sistemas de IA, en su mayoría, no. Un nuevo artículo de investigadores de Sakana AI, NYU y MIT, aceptado en GECCO 2026, aborda directamente este problema replicando Picbreeder, la plataforma canónica de arte evolutivo impulsada por humanos, con modelos de lenguaje y visión en lugar de sus usuarios humanos.

Los resultados son instructivos. Los archivos generados por VLM son más planos, más repetitivos y menos evocadores que los originales humanos. Pero el estudio, liderado por Sam Earle (NYU) junto con Kai Arulkumaran, Andrew Dai, Akarsh Kumar, Julian Togelius y Sebastian Risi, también prueba sistemáticamente qué intervenciones podrían cerrar la brecha, convirtiéndolo en uno de los intentos más rigurosos hasta la fecha para aislar los ingredientes de la apertura total en sistemas mecánicos.

Qué midió Picbreeder

Picbreeder, lanzado en 2008, permitía a los usuarios evolucionar imágenes de forma colaborativa seleccionando y mutando imágenes generadas por CPPN, ramificándose de las creaciones de otros. Con los años, la comunidad construyó un rico árbol filogenético de imágenes publicadas, rostros, coches, insectos, patrones abstractos, que sirve como punto de referencia de la búsqueda abierta impulsada por humanos. El conjunto de datos compilado por Kumar et al. en 2025, con 9,758 imágenes publicadas y ascendencia completa, proporciona al equipo de Sakana una línea base humana directa para medir.

El experimento central reemplaza a cada usuario humano con un agente VLM (por defecto Gemini 2.5 Pro después de probar varios modelos, incluidos Gemini 3 Pro, variantes de Qwen3-VL y modelos flash). El agente ve una población de 15 imágenes CPPN, selecciona padres durante 20 generaciones y publica una imagen final en el archivo compartido. Las ramas comienzan desde una muestra del archivo existente. Diez agentes se ejecutan en paralelo. El artículo llama a esto una réplica fiel de las condiciones del experimento original, no un intento de replicar sus resultados.

La brecha entre la salida humana y la de VLM es visible a simple vista. El archivo humano tiene más variedad e imágenes más nítidas e intencionadas. Los VLM producen muchos casi duplicados, tienden al colapso de modo, repitiendo un puñado de formas, y a menudo publican ruido gris, abstracto o de alta frecuencia. El artículo intenta cuantificar esto con cuatro métricas: Recuperación Semántica (qué tan bien cubre el archivo las clases de objetos conocidas del conjunto de datos THINGS), Cobertura Visual y Cobertura Semántica (radios de cobertura k en espacios de incrustación) y Equilibrio del Árbol (índice J1 de equilibrio filogenético). La línea base humana lidera en las tres métricas de cobertura y empata en recuperación. La selección aleatoria es la peor.

Tres intervenciones, tres lecciones

Gráfico: Métricas de cobertura: Humano vs. VLM vs. Aleatorio
La línea base humana lidera en las tres métricas de cobertura y empata en recuperación, según el estudio de Sakana AI, siendo la selección aleatoria la peor.

El equipo varió tres parámetros: ruido exploratorio (selección épsilon-avaro), longitud de contexto (cuánto historial de interacción previa ve el VLM) y el número de personalidades de agente distintas generadas mediante rasgos indicados por el LLM.

Exploración vs. calidad

Sin ruido, los archivos VLM sufren un colapso de modo severo, como dice el artículo: muchas variaciones de las mismas formas parecidas a zorros o espinas de pescado. Inyectar ruido épsilon-avaro hasta 0.25 mejora la diversidad sin sacrificar la recuperación, pero niveles de ruido más grandes degradan la calidad de la imagen. Incluso en épsilon=1, donde el VLM solo maneja la ramificación y la calificación, con todas las selecciones aleatorias, el archivo aún supera la línea base aleatoria en varias métricas, lo que sugiere que el VLM puede guiar significativamente incluso con un control mínimo. Pero el Equilibrio del Árbol permanece obstinadamente bajo: los VLM se ramifican repetidamente de las mismas imágenes en lugar de comenzar desde poblaciones aleatorias.

La memoria es un arma de doble filo

La longitud de contexto cero (sin historial) colapsa la recuperación a medida que los agentes publican duplicados. El contexto de 1, viendo el turno actual y el anterior, recupera bien el rendimiento. Pero escalar el contexto a 2, 10 o la sesión completa de 20 generaciones degrada consistentemente las métricas de recuperación y cobertura. Con contexto completo, los agentes a veces producen imágenes de latas de bebida casi fotorrealistas en múltiples semillas, pero el archivo general se vuelve más ruidoso. Los autores sugieren sobrecarga de información y bucles autosicofánticos: el VLM refuerza sus propias preferencias declaradas en lugar de explorar ampliamente.

Muchos agentes, resultados extraños

Escalar el número de personalidades indicadas distintas de 1 a 1,000 aumenta significativamente la Cobertura Semántica y el Equilibrio del Árbol. La Cobertura Semántica más alta de cualquier configuración proviene de la condición de 1,000 agentes. Pero el archivo también se llena de patrones psicodélicos de alta frecuencia e ininterpretables que constituyen del 10 al 20 por ciento de las publicaciones, lo que el artículo llama imágenes adversariales, masajeadas por múltiples agentes tirando en diferentes direcciones. La fricción colaborativa que podría empujar a los agentes hacia saltos audaces en su lugar los empuja hacia el ruido.

La cuadrícula de 1,000 agentes es la más claramente abierta en términos cuantitativos, y simultáneamente la más alienígena en términos cualitativos. Esa tensión puede ser el resultado más profundo del artículo: las métricas diseñadas para capturar la diversidad valorada por los humanos no distinguen entre una forma novedosa refinada y un fallo adversarial que casualmente se asigna a muchas incrustaciones de subtítulos. Los autores señalan esto como una dirección para trabajo futuro, proponiendo una métrica de varianza semántica, cuánto varía el subtítulo de una imagen determinada a través de subtítulos VLM repetidos, para separar los dos.

El ángulo de Sakana

La participación de Sakana AI no es incidental. El laboratorio con sede en Tokio, cofundado por David Ha y Llion Jones, ha construido su agenda de investigación en torno a sistemas biológicamente inspirados y abiertos, desde la fusión evolutiva de modelos hasta redes neuronales autorreplicantes. Este estudio de Picbreeder encaja directamente en ese programa: trata la apertura total no como una propiedad que se mide después del hecho, sino como un conjunto de decisiones de diseño que se pueden sondear reemplazando humanos con modelos.

El artículo tiene cuidado de no afirmar que su sistema sea abierto. Informa qué hace que el sistema impulsado por VLM sea menos abierto que la versión humana y qué decisiones de diseño lo acercan. Esa es una contribución útil. Los resultados sugieren que ninguna solución única, más ruido, más memoria, más agentes, logra la apertura total similar a la humana; la combinación puede ser importante, y el artículo pide explícitamente probar intervenciones juntas a escalas más grandes.

Qué significa para la automatización

La implicación más amplia del estudio es para cualquier proyecto que automatice el descubrimiento creativo o científico con IA. Si los VLM, incluso los de frontera, producen una búsqueda más estrecha que los humanos cuando se colocan en la misma estructura mínima, entonces reemplazar el juicio humano en tuberías abiertas puede requerir un andamiaje cuidadoso. El equipo de Sakana muestra que el andamiaje importa: la cantidad correcta de memoria, la inyección correcta de ruido, la diversidad correcta de perspectivas. Pero también muestra que el andamiaje por sí solo aún no replica la audacia humana, esa cualidad que el artículo llama el factor X, que implica saltos semánticos más grandes y un discernimiento más agudo.

Para los profesionales que construyen sistemas agentivos para generación de contenido, diseño de mundos de juego o exploración de hipótesis científicas, la lección es que la apertura total no es una propiedad del modelo, sino del sistema. El VLM en sí mismo no es el cuello de botella; el diseño de su entorno, memoria, reglas de selección y diversidad de población es donde el comportamiento abierto vive o muere.

El código del equipo de Sakana está disponible en GitHub. Los datos del experimento original de Picbreeder siguen siendo uno de los rastros conductuales más ricos de la evolución guiada por humanos. Conectar ambos, como hace este artículo, es un paso hacia la comprensión de lo que queremos decir con creatividad en primer lugar.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.