VLM
2 published articles
Razonamiento 3D
SceneActBench: Por qué incluso los mejores VLM fallan en acciones 3D
SceneActBench evalúa once configuraciones de VLM en cinco tareas 3D en un bucle de agente unificado. Las puntuaciones generales van de 38.6 a 50.2, sin que ningún modelo se desempeñe de manera consistente. El benchmark expone un punto ciego en los agentes de visión-lenguaje: actuar en escenas completas, no solo describirlas.
2026-07-31
Apertura total y VLM
El experimento Picbreeder de Sakana AI muestra lo que los VLM pasan por alto sobre la creatividad humana
Un equipo liderado por Sakana AI reemplazó a los usuarios humanos de Picbreeder con VLM y descubrió que los archivos sintéticos carecen de la audacia y diversidad de los originales humanos. Sus experimentos con ruido, memoria y miles de personalidades guionizadas revelan tanto la promesa como los límites del uso de modelos grandes para el descubrimiento abierto.
2026-07-20