calcul à l'inférence
2 published articles
Recherche en IA
Penelope cache son raisonnement dans une seule couche de décodeur pour réduire les coûts d'inférence
Penelope, un framework de raisonnement latent pour Transformers à décodeur seul, localise le calcul récurrent dans un interval étroit du décodeur, réduisant la latence d'inférence sans perte majeure de précision. L'article décrit un curriculum qui déplace le raisonnement des tokens visibles vers une boucle GRU interne.
2026-08-04
Évaluation ancrée vs. non ancrée
Pourquoi l’auto-évaluation de votre modèle d’IA échoue sur la qualité visuelle
Une nouvelle recherche introduit l’« ancrage » comme variable clé régissant un troisième axe du calcul au moment du test : le dimensionnement par interaction. Les résultats montrent qu’un instrument déterministe mesurant la disposition réelle surpasse l’évaluation VLM sur capture d’écran, corrigeant 40 % des défauts sur les diapositives denses et 74 % des défauts sur les figures académiques, alors que la métrique standard ne voit rien.
2026-07-31