LLMs y Modelos3 min read
Investigación en IA
Penelope oculta su razonamiento en una sola capa del decodificador para reducir los costos de inferencia
Penelope, un marco de razonamiento latente para Transformers solo decodificador, localiza el cómputo recurrente en un intervalo estrecho del decodificador, reduciendo la latencia de inferencia sin un gran impacto en la precisión. El artículo describe un currículo que traslada el razonamiento de tokens visibles a un bucle GRU interno.
2026-08-04