Razonamiento 3D
2 published articles
LLMs y Modelos3 min read
Razonamiento 3D
SceneActBench: Por qué incluso los mejores VLM fallan en acciones 3D
SceneActBench evalúa once configuraciones de VLM en cinco tareas 3D en un bucle de agente unificado. Las puntuaciones generales van de 38.6 a 50.2, sin que ningún modelo se desempeñe de manera consistente. El benchmark expone un punto ciego en los agentes de visión-lenguaje: actuar en escenas completas, no solo describirlas.
2026-07-31
IA4 min read
Benchmark
El GauntletBench de Oxford somete a los agentes de IA a 100 tareas reales. Fallaron el 81% de ellas.
El GauntletBench de Oxford somete a los agentes de IA a 100 tareas desafiantes del mundo real. Los sistemas de frontera apenas alcanzan un 19.1% de éxito, muy por debajo del rendimiento humano. El benchmark se enfoca en capacidades pasadas por alto: percepción temporal, comprensión gráfica y razonamiento 3D en cinco aplicaciones profesionales.
2026-07-01