SevenTnewS

Model Studio

Les tarifs hors pointe de Qwen3.7 réduisent les coûts API de 80 %, et les développeurs américains bénéficient des meilleures heures

Les tarifs hors pointe de Qwen3.7 d'Alibaba offrent jusqu'à 80 % de réduction sur les appels API pendant les heures couvrant la journée de travail américaine et européenne. Voici comment cela se compare à GPT-5.5, Claude et Gemini, et quelles charges de travail en bénéficient le plus.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-05-20 · Dernière mise à jour : 2026-07-30 · 1 min de lecture

Les tarifs hors pointe de Qwen3.7 réduisent les coûts API de 80 %, et les développeurs américains bénéficient des meilleures heures

Le Model Studio d'Alibaba vient de rendre moins cher l'utilisation de l'IA de pointe. À partir du 23 juin, chaque appel API à Qwen3.7-Max et Qwen3.7-Plus entre 22h00 et 08h00 heure de Beijing bénéficie d'une réduction automatique pouvant aller jusqu'à 80 %. Pas d'inscription, pas de coupons, pas de changement de code. Le même modèle, la même latence, le même SLA, juste une facture moins élevée.

Les chiffres sont frappants. Aux tarifs hors pointe, Qwen3.7-Max coûte 0,50 $ par million de tokens d'entrée et 1,50 $ par million de tokens de sortie. Cela est 10 fois moins cher en entrée et 20 fois moins cher en sortie que les 5 $ et 30 $ standard de GPT-5.5. Qwen3.7-Plus, le cheval de bataille multimodal, descend à 0,128 $ en entrée et 0,512 $ en sortie, soit environ un neuvième du prix de sortie de GPT-5.4-mini. Même face à des rivaux de gamme économique comme Claude Haiku 4.5 à 1 $ en entrée / 5 $ en sortie, l'écart hors pointe est important.

Mais la véritable histoire est l'arbitrage de fuseaux horaires. La nuit de Pékin est le jour de l'Amérique du Nord. Pour les développeurs de la côte ouest américaine, les heures creuses s'étendent de 7h00 à 17h00 Pacific, soit essentiellement toute la journée de travail. Sur la côte est, c'est de 10h00 à 20h00. Les équipes européennes bénéficient de l'après-midi et de la soirée. Ainsi, un développeur appelant l'API à 10h depuis San Francisco paie automatiquement 80 % de moins, sans modifier une seule ligne de code. Pour les équipes APAC, la fenêtre tombe pendant la nuit, ce qui convient toujours aux tâches par lots et aux pipelines planifiés.

Ce modèle de tarification s'applique naturellement aux charges de travail asynchrones qui n'ont pas besoin de réponses en temps réel. Le traitement de documents, l'extraction de données structurées à partir de factures et de contrats, la génération de données synthétiques pour entraîner des modèles plus petits, et les agents de revue de code à grande échelle qui analysent les pull requests pendant la nuit, tous bénéficient de la mise en file d'attente des tâches pour les exécuter pendant les heures creuses. Un pipeline par lots qui traite des millions de tokens par jour peut facilement voir ses factures mensuelles passer de 2 000 $ à moins de 250 $ sur Qwen3.7-Max, ou moins de 65 $ sur Qwen3.7-Plus.

Le timing est stratégique. DeepSeek devrait lancer DeepSeek V4 en juillet avec des tarifs hors pointe similaires, et la tendance parmi les laboratoires d'IA chinois est claire : réduire les coûts d'inférence pour gagner en adoption. Microsoft aurait déjà testé un modèle chinois pour Copilot afin de réduire les coûts de 600 millions de dollars, selon The Information. La décision d'Alibaba sous-cote non seulement les laboratoires de pointe américains mais aussi des concurrents comme DeepSeek, dont les tarifs hors pointe culminent à 1,74 $ par million de tokens de sortie, toujours plus que Qwen3.7-Max hors pointe.

L'inconvénient ? La promotion ne court que jusqu'au 30 juillet 2026. Après cela, les prix reviendront probablement aux tarifs standard. Pour l'instant, c'est une offre simple : le même SLA, pas de réservation de capacité, et pas d'inscription. Les équipes construisant des flux de travail d'agents, de l'inférence par lots ou des pipelines de données devraient tester dans cette fenêtre. L'avantage de coût est réel, mais il est aussi temporaire.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.