LLMs y Modelos3 min read
Razonamiento 3D
SceneActBench: Por qué incluso los mejores VLM fallan en acciones 3D
SceneActBench evalúa once configuraciones de VLM en cinco tareas 3D en un bucle de agente unificado. Las puntuaciones generales van de 38.6 a 50.2, sin que ningún modelo se desempeñe de manera consistente. El benchmark expone un punto ciego en los agentes de visión-lenguaje: actuar en escenas completas, no solo describirlas.
2026-07-31