efficacité des tokens
4 published articles
Scaling au moment du test
Le routage CoBa égalise le vote majoritaire best-of-16 avec 58,9 % de jetons en moins
CoBa, une politique de routage à calcul équilibré issue d'un nouvel article arXiv, égalise le vote majoritaire best-of-16 à moins de 0,01 point près tout en réduisant de 58,9 % les jetons pondérés par paramètres. Sur 3 129 évaluations couvrant MATH-500, AIME et AMC, elle bat également nettement le décodage à échantillon unique, même si un léger avantage du best-of-16 subsiste lorsque le budget n'est pas une contrainte.
2026-08-19
Codage IA
OpenCode parie que l'efficacité des tokens gagnera, en ajoutant Ling 3.0 Flash gratuitement
OpenCode propose désormais gratuitement Ling 3.0 Flash d'inclusionAI, quelques jours après sa sortie. Cette décision prolonge une stratégie attentive aux coûts, qui parie que l'efficacité des tokens gagnera la course du codage IA.
2026-08-07
Codage IA
Le nouveau modèle Ling 3.0 Flash débarque gratuitement sur OpenCode
OpenCode propose désormais Ling 3.0 Flash gratuitement, un modèle économe en tokens d'inclusionAI qui pourrait rendre le codage IA moins cher pour les développeurs. Cet ajout intervient quelques jours après la sortie du modèle.
2026-07-24
Modèles d'IA
Google publie Gemini 3.6 Flash, un modèle léger et une variante cybersécurité
Les nouveaux modèles Gemini de Google ciblent les agents d'IA de production avec une meilleure efficacité des tokens et une latence réduite. Le 3.6 Flash réduit l'utilisation de tokens de 17 % par rapport à son prédécesseur. Le 3.5 Flash-Lite atteint 350 tokens de sortie par seconde. Une variante axée sur la cybersécurité est réservée aux partenaires vérifiés.
2026-07-22