eficiencia de inferencia
2 published articles
LLMs y Modelos3 min read
Investigación en IA
Penelope oculta su razonamiento en una sola capa del decodificador para reducir los costos de inferencia
Penelope, un marco de razonamiento latente para Transformers solo decodificador, localiza el cómputo recurrente en un intervalo estrecho del decodificador, reduciendo la latencia de inferencia sin un gran impacto en la precisión. El artículo describe un currículo que traslada el razonamiento de tokens visibles a un bucle GRU interno.
2026-08-04
IA4 min read
Inteligencia Artificial
Por qué la cadena de pensamiento de tu IA está desperdiciando tokens y cómo el parada óptima lo soluciona
Investigadores del MIT proponen OS-Pruner, un complemento que detiene dinámicamente el razonamiento de cadena de pensamiento cuando una mayor computación no vale el costo de tokens. Las pruebas muestran una reducción de longitud del 20 al 60% con un sacrificio mínimo de precisión.
2026-07-29