SevenTnewS

LLMs y Modelos

Grandes modelos de lenguaje: GPT, Claude, Gemini, Mistral y pesos abiertos.

93 published articles

3 min read

Investigación en IA

Penelope oculta su razonamiento en una sola capa del decodificador para reducir los costos de inferencia

Penelope, un marco de razonamiento latente para Transformers solo decodificador, localiza el cómputo recurrente en un intervalo estrecho del decodificador, reduciendo la latencia de inferencia sin un gran impacto en la precisión. El artículo describe un currículo que traslada el razonamiento de tokens visibles a un bucle GRU interno.

2026-08-04

3 min read

Investigación en IA

Por qué la probabilidad logarítmica de los tokens es la señal equivocada para monitorear modelos de razonamiento de IA

Novelis Research demuestra que la probabilidad logarítmica de los tokens falla como monitor de decodificador para modelos de razonamiento cuantizados, siendo ciega a los bucles confiados. Introducen un controlador e-CUSUM calibrado que combina señales de incertidumbre y repetición, logrando selectividad en GSM8K con DeepSeek-R1-Distill-Qwen-1.5B.

2026-08-03

3 min read

Investigación en IA

El LLM que superó todas las fórmulas fijas para la asignación de almacenes de JD.com

Un LLM entrenado mediante aprendizaje por refuerzo guiado por solucionador elige la mejor formulación MIP para cada instancia de asignación de inventario en JD.com. El Hit Ratio@1 saltó del 21% al 50%, y la precisión de asignación realizada superó a cada formulación fija en 12.57 puntos porcentuales.

2026-08-03

2 min read

Investigación en IA

Por qué tu tutor de IA no puede ver cómo las matemáticas se construyen sobre sí mismas

El K12-Bench de la Universidad de Pekín revela que incluso los mejores modelos de lenguaje apenas entienden cómo se conectan los conceptos escolares. Las puntuaciones del 57% y 46% muestran un punto ciego en la capacidad de la IA para manejar cadenas de requisitos previos, taxonomías de conceptos y anclaje visual, habilidades que los tutores reales utilizan a diario.

2026-08-02

3 min read

Inteligencia Artificial

La generación de ideas de investigación mejora 3,89 veces con IDEAgent

IDEAgent utiliza linajes, retroalimentación multiobjetivo y memoria secuencial para equilibrar calidad y diversidad en ideas de investigación generadas por LLM. Probado en 32 temas en 8 dominios de CS, logra 3,89 veces el Rendimiento (ideas diversas por encima de un umbral de calidad) de métodos anteriores.

2026-08-02

3 min read

Razonamiento 3D

SceneActBench: Por qué incluso los mejores VLM fallan en acciones 3D

SceneActBench evalúa once configuraciones de VLM en cinco tareas 3D en un bucle de agente unificado. Las puntuaciones generales van de 38.6 a 50.2, sin que ningún modelo se desempeñe de manera consistente. El benchmark expone un punto ciego en los agentes de visión-lenguaje: actuar en escenas completas, no solo describirlas.

2026-07-31

4 min read

Destilación de LLM

La destilación de LLM se estanca cuando el contexto se vuelve estático. Este artículo lo hace evolucionar

Los contextos pueden llevar las preferencias de la tarea al entrenamiento de LLM, pero una vez destilados en un estudiante añaden poca supervisión. Flux-OPD de la Universidad de Pekín mantiene el contexto en movimiento con el estudiante y utiliza un término de conflicto para ponderar las correcciones del profesor. El resumen reporta mejoras sobre los paradigmas OPD existentes sin citar cifras.

2026-07-31

4 min read

Investigación en IA

La espuma en la cadena de pensamiento: un nuevo benchmark revela por qué los LLMs desperdician tokens en razonamientos válidos pero inútiles

Los LLMs a menudo generan cadenas de razonamiento que son correctas pero rellenas con pasos innecesarios. Un nuevo benchmark de diagnóstico y un método de compresión muestran que los evaluadores actuales pasan por alto esta ineficiencia por completo y que la mitad de los pasos de razonamiento escritos por humanos podrían ser comprimibles.

2026-07-31

4 min read

Resumen de investigación

Los cuellos de botella de razonamiento estructurado superan la magia de los prompts en tareas de inducción de LLM

Una nueva metodología llamada razonamiento Hourglass impone un estricto aislamiento de contexto entre las etapas de inducción, deducción e implementación, pasando solo una regla simbólica comprimida entre ellas. En ARC-AGI-2, aumenta la precisión pass@5 hasta en 14 puntos en comparación con el refinamiento iterativo; en la síntesis de Verilog de ChipBench, casi duplica la precisión con GPT-5.5. Las ablaciones confirman que la topología en sí misma impulsa la mejora.

2026-07-31

3 min read

Investigación en IA

Un pequeño controlador de monitoreo mejora los puntajes de LLM cuantizados en 4.5 puntos en MATH-500

Una nueva investigación propone un controlador de monitoreo externo para modelos de lenguaje pequeños cuantizados que detecta trayectorias de razonamiento repetitivas o degenerantes y activa una reversión y una redecodificación restringida. La precisión mejoró en 4.5 puntos porcentuales en un amplio conjunto de evaluación, pero los autores enfatizan que los hallazgos no son confirmatorios.

2026-07-30

5 min read

IA para juegos

Los tres problemas que ningún motor de juego con IA había resuelto hasta ahora: consistencia, navegabilidad, evaluación

MAGIC es un pipeline de cuatro etapas que convierte un único prompt en un proyecto de Unity jugable con múltiples escenas conectadas. Impone la accesibilidad de los portales con un validador de relleno por inundación e introduce un agente de evaluación que realmente recorre cada transición, complementando décadas de métricas que solo examinaban interiores individuales.

2026-07-30

4 min read

Investigación en IA

Los agentes de IA mantenían la memoria fuera del modelo. Metis la pone dentro

Metis de MemTensor es el primer prototipo de modelos fundacionales de memoria: historia comprimida en la red troncal, leída mediante atención de memoria y actualizada en una sola pasada hacia adelante. Desafía la era de los almacenes vectoriales en la memoria de los agentes. Los límites se reconocen, pero aún no se cuantifican.

2026-07-30

← PreviousPage 2 / 8 · 93 articlesNext →