Le cheval de trait de Google, plus étoffé dans la mise à jour 3.7
Gemini 3.7 Flash divise son prix par deux, puis le justifie
Le Gemini 3.7 Flash de Google sort à la moitié du prix de lancement du 3.6 Flash, tout en revendiquant des gains sur les benchmarks de codage, de développement web et de travail cognitif. La sortie intervient trois semaines après le Flash précédent et s'accompagne d'un nouvel argument prix-performance pour les développeurs d'agents.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-08-16 · 3 min de lecture

Google a dévoilé Gemini 3.7 Flash le 13 août 2026, et cette mise à jour commence par quelque chose que les versions Flash commencent rarement par : une baisse de prix. Le modèle coûte 0,75 $ par million de jetons d'entrée et 3,75 $ par million de jetons de sortie, à un prix d'introduction valable jusqu'à la fin de l'année, soit la moitié du prix initial du Gemini 3.6 Flash, lancé trois semaines plus tôt. Google positionne le 3.7 Flash comme son cheval de trait pour le codage et les agents.
Le calendrier est délibéré. Google a maintenu une cadence rapide dans toute la gamme Gemini cette année, la génération 3.6 Flash étant arrivée en juillet aux côtés d'un Flash-Lite plus léger et plus rapide. Le passage rapide à la 3.7 ressemble moins à une découverte qu'à une habitude. Google attribue cette rapidité aux retours des développeurs et à des améliorations algorithmiques qu'il dit vouloir reporter dans les futurs modèles. La cadence avait déjà attiré l'attention : une fuite suggérait que Google testait une version du 3.6 Flash tandis que le modèle pro attendu restait absent, selon le précédent rapport sur la fuite.
Benchmarks, et une baisse de prix de 50 %
L'histoire la plus parlante se trouve dans les chiffres que Google a publiés par rapport au Flash précédent. L'entreprise annonce 43,6 % sur FrontierCode 1.1 Main, contre 34,4 % auparavant, et 65,3 % sur DeepSWE v1.1 contre 49,0 %, un écart qu'elle présente comme une meilleure précision du code au premier passage et des résultats plus proches de la production. Le schéma se vérifie au-delà du codage : GPA.pdf passe de 22,0 % à 34,0 % sur le travail de la connaissance à forte composante documentaire, AutomationBench de 17,0 % à 30,4 % sur les flux de travail d'entreprise réels, et WebDev Arena passe de 1538 à 1588 Elo.
| Benchmark | 3.7 Flash | 3.6 Flash |
|---|---|---|
| FrontierCode 1.1 Main | 43,6 % | 34,4 % |
| DeepSWE v1.1 | 65,3 % | 49,0 % |
| GDP.pdf | 34,0 % | 22,0 % |
| AutomationBench | 30,4 % | 17,0 % |
| WebDev Arena (Elo) | 1588 | 1538 |
Ce sont les chiffres de Google, et les réserves habituelles sur les benchmarks maison s'appliquent. Lus dans leur ensemble, ils racontent néanmoins une histoire précise : l'entreprise affirme des gains d'agents cohérents en codage, en développement web et dans les documents, puis facture beaucoup moins cher par jeton pour ces gains. Légèrement meilleur sur un benchmark, environ deux fois meilleur sur un autre, à moitié prix. Cette combinaison est rare sur un marché où bon marché rime généralement avec lent, léger ou imprécis. C'est aussi un marché où les affirmations concurrentielles sur les benchmarks évoluent vite : le Grok 4.6 de xAI a égalé GPT-5.6 Sol à 61 sur un indice composite avant que ses scores par composante ne se séparent, selon la répartition des scores.
Ce que le prix révèle sur l'économie des agents
Le mot de Google pour le 3.7 Flash est délibéré. « Workhorse » est une tentative de séduire les charges de travail d'agents à volume élevé, le genre de cas où le coût par million de jetons s'accumule dans des boucles répétées. L'entreprise s'appuie sur ce cadrage : le modèle est conçu pour la planification en plusieurs étapes et les appels d'outils, et Google affirme qu'il suit les instructions avec une plus grande fidélité, ce qui se traduit par moins de nouvelles tentatives et une supervision manuelle réduite dans les flux de travail d'ingénierie. L'argument n'est pas exclusif à Google. Meta a visé son Muse Glimmer de 30B directement sur les charges de travail d'agents et l'a lancé pour fonctionner en moins de 20 Go, selon l'article consacré au Muse Glimmer.
C'est le cadrage du prix d'introduction qui rend cette sortie stratégique. Une baisse de prix permanente serait perçue comme une histoire de coûts de revient ; une baisse temporaire plante un drapeau. C'est, dit Google, ce qu'il faut pour convaincre les développeurs d'adopter sa pile d'agents, et la page de benchmarks fait partie de cet argumentaire. Une réduction de moitié est agressive même dans une année de tarification agressive des jetons : le GLM-5.2 de Zhipu est devenu viral à 0,07 $ par million de jetons, soit une baisse de 95 % que des internautes ont qualifiée de « presque gratuit », un commentaire affirmant que le prix avait déjà décuplé, selon le feuilleton tarifaire du GLM-5.2. À ce stade, les scores importent moins que le prix et la cadence. Si cela devient la routine, Gemini 3.7 Flash est moins une annonce produit qu'une déclaration sur la régularité avec laquelle son successeur arrivera.
- Source : Introducing Gemini 3.7 Flash
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.