arXiv
18 published articles
Visión por computadora, modelos del mundo e investigación en IA
PhiZero: enseñar a la IA de video a pensar en física antes de renderizar
PhiZero, un modelo del mundo de CASIA, aprende un compacto "lenguaje físico" discreto a partir de video sin procesar y lo usa para razonar sobre cómo evolucionará una escena antes de renderizar fotogramas. Los autores sostienen que este diseño de razonar-luego-renderizar produce video más físicamente coherente que la predicción directa de píxeles.
2026-07-31
Investigación en IA
VideoCoCo corrige la física rota de los videos de IA pensando en código de Blender
VideoCoCo trata el código ejecutable de Blender como una cadena de pensamiento: un agente de codificación programa una escena, un simulador la reproduce y un motor de video hace que el resultado sea fotorrealista. Esta división ataca el problema de la física del texto a video y logra las mejores puntuaciones medias en PhyGenBench y VBench-2.0.
2026-07-30
Inteligencia Artificial
Los detectores de LLM imperfectos pueden aumentar el uso de IA, no reducirlo
Los detectores imperfectos de LLM pueden distorsionar los incentivos de los usuarios, lo que lleva a un mayor uso de IA y resultados de menor calidad. Los hallazgos del artículo desafían la suposición ingenua de que las herramientas de detección reducen limpiamente el contenido generado por máquinas.
2026-07-26
Benchmark
El abismo entre los LLM y el método científico: un nuevo benchmark revela que los modelos pueden describir datos pero no razonar a través de ellos
SDABench, un nuevo benchmark orientado a capacidades que abarca seis habilidades fundamentales de razonamiento científico y cinco dominios, evalúa 15 LLM y descubre que los modelos son sólidos en el análisis descriptivo, pero fallan en tareas inferenciales y causales. El artículo proporciona un marco de análisis de errores de cinco etapas para localizar fallos.
2026-07-25
Investigación en IA
Cuatro personalidades, una respuesta: por qué el razonamiento heterogéneo acaba de vencer a la mejor IA en la prueba más difícil de la humanidad
PoTRE divide la inferencia en cuatro agentes que trabajan en paralelo, luego reconcilia sus respuestas dinámicamente. Alcanzó un 49.92% en Humanity's Last Exam, superando el mejor resultado oficial anterior. El enfoque funciona con menos tokens que las líneas base escaladas.
2026-07-24
Investigación en IA
Por qué GPT-5.5 domina un benchmark que prueba cómo los agentes se mejoran a sí mismos
EvoPolicyGym aísla una capacidad crítica pero poco estudiada: la capacidad de un agente para refinar una política ejecutable mediante ediciones repetidas con retroalimentación limitada. El benchmark revela a GPT-5.5 como el mejor intérprete en 16 entornos, y proporciona diagnósticos a nivel de trayectoria que exponen cómo diferentes agentes asignan presupuesto y convierten la retroalimentación en parámetros ajustados.
2026-07-11