efficacité d'inférence
2 published articles
LLM & Modèles3 min read
Recherche en IA
Penelope cache son raisonnement dans une seule couche de décodeur pour réduire les coûts d'inférence
Penelope, un framework de raisonnement latent pour Transformers à décodeur seul, localise le calcul récurrent dans un interval étroit du décodeur, réduisant la latence d'inférence sans perte majeure de précision. L'article décrit un curriculum qui déplace le raisonnement des tokens visibles vers une boucle GRU interne.
2026-08-04
IA4 min read
Intelligence Artificielle
Pourquoi la chaîne de pensée de votre IA gaspille des jetons, et comment l'arrêt optimal y remédie
Des chercheurs du MIT proposent OS-Pruner, un plug-in qui arrête dynamiquement le raisonnement par chaîne de pensée lorsque des calculs supplémentaires ne valent pas le coût en jetons. Les tests montrent une réduction de longueur de 20 à 60 % avec un sacrifice de précision minime.
2026-07-29