SevenTnewS

arXiv

18 published articles

Visión y Difusión4 min read

Visión por computadora, modelos del mundo e investigación en IA

PhiZero: enseñar a la IA de video a pensar en física antes de renderizar

PhiZero, un modelo del mundo de CASIA, aprende un compacto "lenguaje físico" discreto a partir de video sin procesar y lo usa para razonar sobre cómo evolucionará una escena antes de renderizar fotogramas. Los autores sostienen que este diseño de razonar-luego-renderizar produce video más físicamente coherente que la predicción directa de píxeles.

2026-07-31

Visión y Difusión4 min read

Investigación en IA

VideoCoCo corrige la física rota de los videos de IA pensando en código de Blender

VideoCoCo trata el código ejecutable de Blender como una cadena de pensamiento: un agente de codificación programa una escena, un simulador la reproduce y un motor de video hace que el resultado sea fotorrealista. Esta división ataca el problema de la física del texto a video y logra las mejores puntuaciones medias en PhyGenBench y VBench-2.0.

2026-07-30

IA3 min read

Inteligencia Artificial

Los detectores de LLM imperfectos pueden aumentar el uso de IA, no reducirlo

Los detectores imperfectos de LLM pueden distorsionar los incentivos de los usuarios, lo que lleva a un mayor uso de IA y resultados de menor calidad. Los hallazgos del artículo desafían la suposición ingenua de que las herramientas de detección reducen limpiamente el contenido generado por máquinas.

2026-07-26

Pruebas y Benchmarks4 min read

Benchmark

El abismo entre los LLM y el método científico: un nuevo benchmark revela que los modelos pueden describir datos pero no razonar a través de ellos

SDABench, un nuevo benchmark orientado a capacidades que abarca seis habilidades fundamentales de razonamiento científico y cinco dominios, evalúa 15 LLM y descubre que los modelos son sólidos en el análisis descriptivo, pero fallan en tareas inferenciales y causales. El artículo proporciona un marco de análisis de errores de cinco etapas para localizar fallos.

2026-07-25

LLMs y Modelos4 min read

Investigación en IA

Cuatro personalidades, una respuesta: por qué el razonamiento heterogéneo acaba de vencer a la mejor IA en la prueba más difícil de la humanidad

PoTRE divide la inferencia en cuatro agentes que trabajan en paralelo, luego reconcilia sus respuestas dinámicamente. Alcanzó un 49.92% en Humanity's Last Exam, superando el mejor resultado oficial anterior. El enfoque funciona con menos tokens que las líneas base escaladas.

2026-07-24

PLN y MLFeatured4 min read

Investigación en IA

Por qué GPT-5.5 domina un benchmark que prueba cómo los agentes se mejoran a sí mismos

EvoPolicyGym aísla una capacidad crítica pero poco estudiada: la capacidad de un agente para refinar una política ejecutable mediante ediciones repetidas con retroalimentación limitada. El benchmark revela a GPT-5.5 como el mejor intérprete en 16 entornos, y proporciona diagnósticos a nivel de trayectoria que exponen cómo diferentes agentes asignan presupuesto y convierten la retroalimentación en parámetros ajustados.

2026-07-11

← PreviousPage 4 / 2 · 18 articlesNext →