LLM & Modèles3 min read
Recherche en IA
Penelope cache son raisonnement dans une seule couche de décodeur pour réduire les coûts d'inférence
Penelope, un framework de raisonnement latent pour Transformers à décodeur seul, localise le calcul récurrent dans un interval étroit du décodeur, réduisant la latence d'inférence sans perte majeure de précision. L'article décrit un curriculum qui déplace le raisonnement des tokens visibles vers une boucle GRU interne.
2026-08-04