arXiv
19 published articles
Destilación de LLM
La destilación de LLM se estanca cuando el contexto se vuelve estático. Este artículo lo hace evolucionar
Los contextos pueden llevar las preferencias de la tarea al entrenamiento de LLM, pero una vez destilados en un estudiante añaden poca supervisión. Flux-OPD de la Universidad de Pekín mantiene el contexto en movimiento con el estudiante y utiliza un término de conflicto para ponderar las correcciones del profesor. El resumen reporta mejoras sobre los paradigmas OPD existentes sin citar cifras.
2026-07-31
Visión por computadora, modelos del mundo e investigación en IA
PhiZero: enseñar a la IA de video a pensar en física antes de renderizar
PhiZero, un modelo del mundo de CASIA, aprende un compacto "lenguaje físico" discreto a partir de video sin procesar y lo usa para razonar sobre cómo evolucionará una escena antes de renderizar fotogramas. Los autores sostienen que este diseño de razonar-luego-renderizar produce video más físicamente coherente que la predicción directa de píxeles.
2026-07-31
Investigación en IA
VideoCoCo corrige la física rota de los videos de IA pensando en código de Blender
VideoCoCo trata el código ejecutable de Blender como una cadena de pensamiento: un agente de codificación programa una escena, un simulador la reproduce y un motor de video hace que el resultado sea fotorrealista. Esta división ataca el problema de la física del texto a video y logra las mejores puntuaciones medias en PhyGenBench y VBench-2.0.
2026-07-30
Inteligencia Artificial
Los detectores de LLM imperfectos pueden aumentar el uso de IA, no reducirlo
Los detectores imperfectos de LLM pueden distorsionar los incentivos de los usuarios, lo que lleva a un mayor uso de IA y resultados de menor calidad. Los hallazgos del artículo desafían la suposición ingenua de que las herramientas de detección reducen limpiamente el contenido generado por máquinas.
2026-07-26
Benchmark
El abismo entre los LLM y el método científico: un nuevo benchmark revela que los modelos pueden describir datos pero no razonar a través de ellos
SDABench, un nuevo benchmark orientado a capacidades que abarca seis habilidades fundamentales de razonamiento científico y cinco dominios, evalúa 15 LLM y descubre que los modelos son sólidos en el análisis descriptivo, pero fallan en tareas inferenciales y causales. El artículo proporciona un marco de análisis de errores de cinco etapas para localizar fallos.
2026-07-25
Investigación en IA
Cuatro personalidades, una respuesta: por qué el razonamiento heterogéneo acaba de vencer a la mejor IA en la prueba más difícil de la humanidad
PoTRE divide la inferencia en cuatro agentes que trabajan en paralelo, luego reconcilia sus respuestas dinámicamente. Alcanzó un 49.92% en Humanity's Last Exam, superando el mejor resultado oficial anterior. El enfoque funciona con menos tokens que las líneas base escaladas.
2026-07-24
Investigación en IA
Por qué GPT-5.5 domina un benchmark que prueba cómo los agentes se mejoran a sí mismos
EvoPolicyGym aísla una capacidad crítica pero poco estudiada: la capacidad de un agente para refinar una política ejecutable mediante ediciones repetidas con retroalimentación limitada. El benchmark revela a GPT-5.5 como el mejor intérprete en 16 entornos, y proporciona diagnósticos a nivel de trayectoria que exponen cómo diferentes agentes asignan presupuesto y convierten la retroalimentación en parámetros ajustados.
2026-07-11