Vingt-trois jours. C’est le temps qu’il a fallu à Google pour remplacer son propre modèle par un autre, moins cher et plus performant. Gemini 3.7 Flash a été publié le 13 août 2026, exactement 23 jours après Gemini 3.6 Flash, sorti le 21 juillet. Et la promesse tient : le tarif d’entrée est bel et bien divisé par deux par rapport à la version précédente.
Google a fixé Gemini 3.7 Flash à 0,75 dollar par million de tokens en entrée et 3,75 dollars par million de tokens en sortie, soit la moitié du prix initial de Gemini 3.6 Flash. Un tarif cassé, littéralement, pour un modèle qui vise en priorité les développeurs et les entreprises qui font tourner des agents IA en boucle, ces programmes qui enchaînent planification, appels d’outils et relances jusqu’à obtenir un résultat. Plus l’agent tourne longtemps, plus la facture grimpe : diviser le prix par deux change directement l’équation économique de ces usages intensifs.
À retenir
- Google brise son propre modèle en 23 jours avec une version moitié moins chère
- Les benchmarks explosent : +9,2 points sur FrontierCode, quasi-doublement sur AutomationBench
- Mais les vrais rivaux chinois coûtent encore 3 à 5 fois moins cher — la bataille fait rage
Une baisse qui cache une petite subtilité
Le détail que peu d’articles ont relevé au lancement : Google a discrètement aligné Gemini 3.6 Flash sur ce même tarif d’introduction, si bien que les deux modèles facturent le même prix jusqu’au 31 décembre. la “baisse de 50 %” concerne toute la gamme Flash actuelle, pas uniquement la nouveauté. Un choix habile qui évite de pousser tout le monde vers la dernière version du jour au lendemain, tout en laissant le temps aux équipes techniques de migrer sereinement.
Le rabais a une date d’expiration, et c’est le point à ne pas rater si on bâtit un produit dessus. Jusqu’au 31 décembre 2026, Gemini 3.7 Flash coûte 0,75 dollar par million de tokens en entrée et 3,75 dollars en sortie, avant que les prix officiels ne doublent au 1er janvier 2027, pour revenir à 1,50 et 7,50 dollars. Pour une start-up qui budgétise un service sur plusieurs mois, mieux vaut donc calculer ses coûts sur le tarif de 2027, pas sur la promotion de lancement. C’est l’éternel jeu du prix d’appel, sauf que dans l’IA générative, la fenêtre promotionnelle dure des mois entiers, ce qui change la donne pour qui veut tester le modèle sans engagement long terme.
Des progrès qui ne se limitent pas au tarif
Le prix cassé aurait pu masquer un modèle à peine retouché. Ce n’est pas le cas. Sur le benchmark FrontierCode 1.1, le score grimpe à 43,6 % contre 34,4 % pour son prédécesseur, et le DeepSWE v1.1 passe de 49,0 % à 65,3 %. Sur AutomationBench, qui mesure la capacité d’un agent à mener une tâche automatisée de bout en bout, le score bondit de 17,0 % à 30,4 %, presque un doublement.
Ces chiffres ne viennent pas seulement de Google. Artificial Analysis, cabinet indépendant qui évalue les modèles d’IA, lui attribue un score de 56 contre 52 pour la version 3.6, et le classe premier sur 186 modèles évalués en matière de vitesse de génération, à 340,1 tokens par seconde. Une vitesse record qui compte doublement pour les usages agentiques : plus une réponse arrive vite, moins l’attente pèse sur l’expérience utilisateur finale.
Le plus frappant, c’est la méthode. Google attribue ce délai inhabituellement court à des retours de développeurs et à des innovations algorithmiques plutôt qu’à un modèle plus volumineux, et le modèle reste explicitement bâti sur la base de Gemini 3.6 Flash. Pas de nouvelle architecture géante entraînée à prix d’or, donc, mais un affinage ciblé qui produit des gains mesurables en trois semaines. Une manière de dire que la course à l’IA ne se joue plus uniquement à coups de puissance de calcul brute.
Le revers de la médaille : accès restreint et concurrence agressive
Tout le monde ne pourra pas en profiter tout de suite. Google exclut l’Espace économique européen, le Royaume-Uni, la Suisse et le Nigeria du seul accès grand public au modèle, réservé à la fonctionnalité Spark de l’application Gemini. En Europe, il faudra donc patienter, ou passer par l’API pour les développeurs qui veulent intégrer le modèle directement dans leurs outils.
Et malgré la baisse spectaculaire, Google reste loin d’être le moins cher du marché. GPT-5.6 Luna d’OpenAI coûte 0,20 dollar en entrée et 1,20 dollar en sortie, et DeepSeek V4-Flash descend à 0,14 dollar et 0,28 dollar, des tarifs bien inférieurs à celui de Google. Ce qui remet les choses en perspective : la baisse de 50 % ne fait pas de Gemini 3.7 Flash le champion des prix, elle le rend simplement compétitif dans un marché où les tarifs s’effondrent presque chaque mois. Les acteurs chinois, en particulier, jouent une carte radicalement différente en misant sur des coûts d’infrastructure très inférieurs.
Cette bataille des prix dépasse d’ailleurs largement l’API. Côté abonnements grand public, Google a aussi revu ses tarifs Ultra ces derniers mois, avec une offre haut de gamme ramenée à 219,99 euros par mois et une nouvelle formule intermédiaire à 99,99 euros. Un signal clair : la firme de Mountain View a choisi la vitesse et le prix comme armes principales face à OpenAI et aux modèles ouverts chinois, quitte à cannibaliser ses propres sorties à peine trois semaines après leur mise en ligne. La question qui reste ouverte, c’est combien de temps ce rythme de lancement pourra tenir sans finir par lasser les développeurs censés suivre la cadence.
Sources : stephanelarue.com | menow.fr


