LLMs y Modelos
Grandes modelos de lenguaje: GPT, Claude, Gemini, Mistral y pesos abiertos.
93 published articles
Investigación en IA
Penelope oculta su razonamiento en una sola capa del decodificador para reducir los costos de inferencia
Penelope, un marco de razonamiento latente para Transformers solo decodificador, localiza el cómputo recurrente en un intervalo estrecho del decodificador, reduciendo la latencia de inferencia sin un gran impacto en la precisión. El artículo describe un currículo que traslada el razonamiento de tokens visibles a un bucle GRU interno.
2026-08-04
Investigación en IA
Por qué la probabilidad logarítmica de los tokens es la señal equivocada para monitorear modelos de razonamiento de IA
Novelis Research demuestra que la probabilidad logarítmica de los tokens falla como monitor de decodificador para modelos de razonamiento cuantizados, siendo ciega a los bucles confiados. Introducen un controlador e-CUSUM calibrado que combina señales de incertidumbre y repetición, logrando selectividad en GSM8K con DeepSeek-R1-Distill-Qwen-1.5B.
2026-08-03
Investigación en IA
El LLM que superó todas las fórmulas fijas para la asignación de almacenes de JD.com
Un LLM entrenado mediante aprendizaje por refuerzo guiado por solucionador elige la mejor formulación MIP para cada instancia de asignación de inventario en JD.com. El Hit Ratio@1 saltó del 21% al 50%, y la precisión de asignación realizada superó a cada formulación fija en 12.57 puntos porcentuales.
2026-08-03
Investigación en IA
Por qué tu tutor de IA no puede ver cómo las matemáticas se construyen sobre sí mismas
El K12-Bench de la Universidad de Pekín revela que incluso los mejores modelos de lenguaje apenas entienden cómo se conectan los conceptos escolares. Las puntuaciones del 57% y 46% muestran un punto ciego en la capacidad de la IA para manejar cadenas de requisitos previos, taxonomías de conceptos y anclaje visual, habilidades que los tutores reales utilizan a diario.
2026-08-02
Inteligencia Artificial
La generación de ideas de investigación mejora 3,89 veces con IDEAgent
IDEAgent utiliza linajes, retroalimentación multiobjetivo y memoria secuencial para equilibrar calidad y diversidad en ideas de investigación generadas por LLM. Probado en 32 temas en 8 dominios de CS, logra 3,89 veces el Rendimiento (ideas diversas por encima de un umbral de calidad) de métodos anteriores.
2026-08-02
Razonamiento 3D
SceneActBench: Por qué incluso los mejores VLM fallan en acciones 3D
SceneActBench evalúa once configuraciones de VLM en cinco tareas 3D en un bucle de agente unificado. Las puntuaciones generales van de 38.6 a 50.2, sin que ningún modelo se desempeñe de manera consistente. El benchmark expone un punto ciego en los agentes de visión-lenguaje: actuar en escenas completas, no solo describirlas.
2026-07-31
Destilación de LLM
La destilación de LLM se estanca cuando el contexto se vuelve estático. Este artículo lo hace evolucionar
Los contextos pueden llevar las preferencias de la tarea al entrenamiento de LLM, pero una vez destilados en un estudiante añaden poca supervisión. Flux-OPD de la Universidad de Pekín mantiene el contexto en movimiento con el estudiante y utiliza un término de conflicto para ponderar las correcciones del profesor. El resumen reporta mejoras sobre los paradigmas OPD existentes sin citar cifras.
2026-07-31
Investigación en IA
La espuma en la cadena de pensamiento: un nuevo benchmark revela por qué los LLMs desperdician tokens en razonamientos válidos pero inútiles
Los LLMs a menudo generan cadenas de razonamiento que son correctas pero rellenas con pasos innecesarios. Un nuevo benchmark de diagnóstico y un método de compresión muestran que los evaluadores actuales pasan por alto esta ineficiencia por completo y que la mitad de los pasos de razonamiento escritos por humanos podrían ser comprimibles.
2026-07-31
Resumen de investigación
Los cuellos de botella de razonamiento estructurado superan la magia de los prompts en tareas de inducción de LLM
Una nueva metodología llamada razonamiento Hourglass impone un estricto aislamiento de contexto entre las etapas de inducción, deducción e implementación, pasando solo una regla simbólica comprimida entre ellas. En ARC-AGI-2, aumenta la precisión pass@5 hasta en 14 puntos en comparación con el refinamiento iterativo; en la síntesis de Verilog de ChipBench, casi duplica la precisión con GPT-5.5. Las ablaciones confirman que la topología en sí misma impulsa la mejora.
2026-07-31
Investigación en IA
Un pequeño controlador de monitoreo mejora los puntajes de LLM cuantizados en 4.5 puntos en MATH-500
Una nueva investigación propone un controlador de monitoreo externo para modelos de lenguaje pequeños cuantizados que detecta trayectorias de razonamiento repetitivas o degenerantes y activa una reversión y una redecodificación restringida. La precisión mejoró en 4.5 puntos porcentuales en un amplio conjunto de evaluación, pero los autores enfatizan que los hallazgos no son confirmatorios.
2026-07-30
IA para juegos
Los tres problemas que ningún motor de juego con IA había resuelto hasta ahora: consistencia, navegabilidad, evaluación
MAGIC es un pipeline de cuatro etapas que convierte un único prompt en un proyecto de Unity jugable con múltiples escenas conectadas. Impone la accesibilidad de los portales con un validador de relleno por inundación e introduce un agente de evaluación que realmente recorre cada transición, complementando décadas de métricas que solo examinaban interiores individuales.
2026-07-30
Investigación en IA
Los agentes de IA mantenían la memoria fuera del modelo. Metis la pone dentro
Metis de MemTensor es el primer prototipo de modelos fundacionales de memoria: historia comprimida en la red troncal, leída mediante atención de memoria y actualizada en una sola pasada hacia adelante. Desafía la era de los almacenes vectoriales en la memoria de los agentes. Los límites se reconocen, pero aún no se cuantifican.
2026-07-30