Daniel Reyes, YuSMP Group
Daniel Reyes Ingénieur principal (IA/ML), YuSMP Group · Agents IA et systèmes LLM appliqués pour les équipes américaines et européennes
Illustration isométrique d'un noyau de modèle IA lumineux émettant des flux de symboles de code et de nœuds de tâches d'agents reliés par des lignes de données ambrées et bleues, sur fond bleu marine profond

En bref

Gemini 3.7 Flash est arrivé le 13 août 2026, trois semaines après 3.6 Flash, avec une amélioration de 16 points sur DeepSWE et un tarif promotionnel qui divise le coût par token par deux jusqu'au 31 décembre 2026. À 0,75 $ par million de tokens d'entrée et 3,75 $ par million de tokens de sortie, il est désormais moins cher que 3.6 Flash (1,50 $ / 7,50 $) tout en affichant des performances mesurables supérieures sur les benchmarks de codage et d'automatisation. Il se classe premier sur FrontierCode 1.1 Main — devant Claude Sonnet 5 et GPT-5.6 Terra — et obtient 34 % sur GDP.pdf (compréhension de documents d'entreprise), contre 28 % pour Sonnet 5 et 24,7 % pour GPT-5.6 Terra.

La bonne réponse est la même qu'à chaque lancement de modèle : routez une fraction du trafic réel de vos agents vers 3.7 Flash, mesurez le coût par tâche réussie et le taux de révision sur vos propres workloads, et ne le promouvez qu'aux endroits où la qualité se maintient.

Ce que Google a livré

Gemini 3.7 Flash est positionné comme le « modèle de travail le plus intelligent » de Google pour le codage et les agents, arrivant 23 jours après 3.6 Flash. Le modèle conserve la même fenêtre de contexte d'un million de tokens et jusqu'à 64 000 tokens de sortie que son prédécesseur, mais offre une meilleure précision au premier essai, une adhérence améliorée aux instructions et une planification multi-étapes plus méthodique. Il utilise la même architecture transformer de type mixture-of-experts que 3.6 Flash.

La disponibilité est large dès le premier jour. L'accès développeur se fait via l'API Gemini et Google AI Studio ; Android Studio intègre 3.7 Flash pour l'assistance au codage dans l'IDE ; Google Antigravity le prend en charge pour les workflows orientés agents ; et la plateforme Gemini Enterprise Agent offre aux entreprises un chemin de déploiement encadré. Pour les utilisateurs grand public, il se déploie via Gemini Spark pour les abonnés AI Pro et Ultra dans plus de 160 pays. Les équipes qui construisent déjà des pipelines d'agents IA sur la stack Google peuvent y accéder aujourd'hui sans migration requise.

Google indique que le modèle « s'adapte mieux aux obstacles, clarifie l'intention si nécessaire et suit les instructions avec une plus grande fidélité », et « consacre davantage d'effort à la planification multi-étapes et aux appels d'outils ». Pour les workloads agentiques, ces améliorations se traduisent par moins d'appels d'outils échoués et moins de cycles de révision par tâche complétée — ce qui compte davantage pour le coût que le seul tarif par token.

Résultats des benchmarks et concurrence

Les résultats des benchmarks sont remarquables car 3.7 Flash ne se contente pas d'améliorer 3.6 Flash — il surpasse également les modèles de pointe actuels d'Anthropic et d'OpenAI sur plusieurs tâches liées au codage.

DeepSWE v1.1 (génie logiciel long-horizon) : 65,3 % pour 3.7 Flash contre 49,0 % pour 3.6 Flash — un gain de 16,3 points. Ce benchmark mesure la capacité d'un agent à réaliser des tâches d'ingénierie multi-étapes de bout en bout, ce qui en fait l'un des indicateurs les plus pertinents pour les équipes qui construisent des pipelines de codage automatisés.

FrontierCode 1.1 Main (qualité du code en production sur 100 tâches dans plusieurs langages) : 43,6 % contre 34,4 %. Google revendique la première place au classement général, devant Claude Sonnet 5 et GPT-5.6 Terra. Ce benchmark met l'accent sur la correction à la compilation, le style du code et la complétion des tâches plutôt que sur la simple prédiction de tokens, ce qui le rend plus représentatif des performances réelles en production que les évaluations de raisonnement général.

GDP.pdf (compréhension de documents d'entreprise) : 34,0 % contre 22,0 % pour 3.6 Flash, à comparer à 28 % pour Claude Sonnet 5 et 24,7 % pour GPT-5.6 Terra. Pour les équipes qui construisent des pipelines traitant des contrats, des documents de conformité ou des rapports financiers en parallèle du code, cela a son importance.

AutomationBench (automatisation des workflows d'entreprise) : 30,4 % contre 17,0 % — un quasi-doublement qui reflète une meilleure orchestration multi-outils et une planification multi-étapes améliorée.

Arena.ai WebDev (tâches de développement web) : Elo 1 588 contre 1 538 pour 3.6 Flash.

L'écart concurrentiel est étroit en points de pourcentage absolus, mais la direction est constante : 3.7 Flash est actuellement le modèle de codage le plus performant au niveau efficacité, tous fournisseurs confondus. Pour les équipes qui évaluent leurs choix de modèles dans le cadre de projets d'intégration GenAI, c'est désormais le référentiel à tester.

Tarification : coût divisé par deux jusqu'à fin 2026

Le changement de tarification est celui qui a l'impact opérationnel le plus immédiat. Gemini 3.7 Flash se lance à 0,75 $ par million de tokens d'entrée et 3,75 $ par million de tokens de sortie — exactement la moitié des 1,50 $ d'entrée et 7,50 $ de sortie de Gemini 3.6 Flash. Ce tarif promotionnel est confirmé jusqu'au 31 décembre 2026, après quoi les tarifs remontent aux tarifs standard équivalents à ceux de 3.6 Flash (1,50 $ d'entrée / 7,50 $ de sortie) à partir du 1er janvier 2027.

Pour les équipes disposant de flottes d'agents à fort volume, le calcul est simple : si vos workloads maintiennent leur qualité sur 3.7 Flash, les mêmes tâches coûtent désormais deux fois moins cher. Une équipe dépensant 10 000 $ par mois en tokens d'agents 3.6 Flash pourrait n'en dépenser que 5 000 $ avec 3.7 Flash jusqu'à fin d'année, ou maintenir la même dépense et réaliser le double de workload. Ces économies se cumulent sur chaque exécution d'agent qui se complète avec succès en moins de tokens — et les améliorations des benchmarks suggèrent que 3.7 Flash complète effectivement les tâches long-horizon en moins d'étapes.

La réinitialisation des tarifs standard en janvier 2027 mérite d'être intégrée dans la planification. Les équipes qui optimisent leurs stacks d'agents autour du tarif promotionnel doivent modéliser dès maintenant l'impact du changement tarifaire de janvier, ou prévoir une réévaluation avant la fin de l'année lorsque le prochain niveau efficacité sera probablement disponible de toute façon, compte tenu du rythme de publication trimestriel de Google cet été.

Ce que cela signifie pour les équipes françaises

Pour les équipes françaises et européennes qui développent des fonctionnalités produit intégrant des agents IA — revue de code automatisée, triage de pipelines CI, extraction de données multi-étapes — Gemini 3.7 Flash représente la première baisse de prix significative accompagnée d'une amélioration de la qualité au niveau efficacité. La bonne approche n'est pas de basculer d'un coup, mais de router une fraction représentative du trafic réel, de mesurer le coût par tâche réussie et le taux d'échec, et de ne promouvoir le modèle qu'aux endroits où les chiffres se maintiennent. Les workloads agentiques sont spécifiques à votre base de code, vos outils et votre conception de prompts ; les benchmarks vous donnent une indication, pas une garantie.

Les équipes de l'UE ont une étape supplémentaire. Le modèle est disponible mondialement via l'API Gemini et, pour les entreprises, via Vertex AI et la plateforme Gemini Enterprise Agent. Mais la disponibilité n'est pas équivalente à la conformité. Les workloads qui traitent des données personnelles — courants dans les pipelines FinTech, HealthTech et LegalTech — nécessitent que la région de traitement spécifique, les conditions de gestion des données et les configurations de journalisation soient confirmées au regard du RGPD et de l'AI Act de l'UE avant que les agents n'accèdent aux données de production. Google propose des endpoints en région UE via Vertex AI ; assurez-vous que votre déploiement utilise l'un d'eux si la résidence des données est un enjeu.

Le schéma plus large à surveiller : Google a livré trois mises à jour Gemini au niveau efficacité en environ deux mois (3.5 Flash, 3.6 Flash, 3.7 Flash), tandis que Gemini 3.5 Pro — le niveau flagship — reste retardé. Gemini 3.5 Pro a été mis à jour pour la dernière fois en février 2026 et n'est toujours pas sorti au moment de la rédaction de cet article, selon Bloomberg. La course concurrentielle se joue actuellement sur l'efficacité et le prix, non sur la capacité de pointe. Pour les responsables techniques qui évaluent leur stratégie de modèles IA, cela signifie que l'économie du travail agentique à fort volume s'améliore plus vite que l'intelligence brute des modèles, et que la stack gagnante est celle capable d'échanger la couche de routage à moindre coût lors de la prochaine mise à jour.

Comment l'évaluer ce trimestre

La fenêtre de tarif promotionnel jusqu'à fin d'année en fait un moment pratique pour conduire une véritable évaluation, et non une simple projection rapide. Voici le processus qui évite l'écueil classique consistant à basculer tout le trafic sur la seule foi des benchmarks.

  1. Définissez le coût par tâche réussie sur votre workload. Mesurez les tokens, les dollars et le taux de complétion des tâches sur de vraies exécutions d'agents, pas le tarif liste par token ou le score de benchmark.
  2. Routez une fraction, pas tout le trafic. Envoyez 10 à 20 % des vraies exécutions d'agents vers 3.7 Flash et comparez avec votre modèle actuel en parallèle pendant une à deux semaines.
  3. Suivez les taux de révision et d'échec. Un modèle qui complète les tâches de codage avec moins d'auto-corrections économise des cycles de génération entiers — surveillez cette métrique en parallèle du coût par token.
  4. Confirmez la région et la conformité pour les workloads UE. Vérifiez l'endpoint de résidence des données, la portée de la journalisation et les obligations au titre de l'AI Act avant que les agents ne traitent des données réglementées.
  5. Plafonnez les dépenses par agent. Un modèle moins cher invite à augmenter le volume d'exécutions. Définissez des plafonds de dépenses par agent et par jour avant de promouvoir vers tout le trafic, afin que les gains d'efficacité ne soient pas absorbés par la croissance du volume.
  6. Modélisez la repricing de janvier. Les tarifs standard à partir du 1er janvier 2027 équivalent aux tarifs actuels de 3.6 Flash. Anticipez l'impact dès maintenant pour éviter les mauvaises surprises budgétaires en fin d'année.

Questions fréquentes

Qu'est-ce que Gemini 3.7 Flash ?

Gemini 3.7 Flash est le dernier modèle de niveau efficacité de Google, lancé le 13 août 2026. Il est optimisé pour le génie logiciel, les workflows d'agents IA et la planification multi-étapes, et est disponible via l'API Gemini, Google AI Studio, Android Studio, Google Antigravity, la plateforme Gemini Enterprise Agent et Gemini Spark dans plus de 160 pays.

En quoi Gemini 3.7 Flash diffère-t-il de Gemini 3.6 Flash ?

Gemini 3.7 Flash obtient 65,3 % sur DeepSWE, contre 49,0 % pour 3.6 Flash, et 43,6 % sur la qualité du code en production FrontierCode 1.1, contre 34,4 %. L'automatisation des workflows d'entreprise (AutomationBench) plus que double à 30,4 % contre 17,0 %. Le tarif est également divisé par deux pendant la période promotionnelle : 0,75 $ d'entrée / 3,75 $ de sortie par million de tokens, contre 1,50 $ / 7,50 $ pour 3.6 Flash.

Quel est le coût de Gemini 3.7 Flash ?

0,75 $ par million de tokens d'entrée et 3,75 $ par million de tokens de sortie jusqu'au 31 décembre 2026. À partir du 1er janvier 2027, le tarif passe à 1,50 $ d'entrée et 7,50 $ de sortie par million de tokens, correspondant aux tarifs standard actuels de 3.6 Flash.

Gemini 3.7 Flash est-il disponible dans l'UE et en France ?

Oui, via l'API Gemini, la plateforme Gemini Enterprise Agent et Vertex AI. Les équipes de l'UE traitant des données personnelles ou réglementées doivent confirmer l'endpoint de résidence des données, la configuration de journalisation et la conformité au RGPD et à l'AI Act de l'UE avant d'utiliser le modèle dans des pipelines agentiques en production. La CNIL publie des recommandations spécifiques sur l'utilisation des systèmes d'IA — consultez-les avant tout déploiement sur des données de production.

Faut-il migrer nos agents de codage de 3.6 Flash vers 3.7 Flash maintenant ?

Testez avant de basculer. Routez 10 à 20 % du trafic réel de vos agents vers 3.7 Flash, mesurez le coût par tâche complétée, le taux de révision et le taux de réussite des tâches, et ne le promouvez qu'aux endroits où la qualité se maintient sur votre vraie base de code et votre outillage. Les scores de benchmarks sont indicatifs ; les économies ne sont réelles que sur vos workloads spécifiques.

Sources

Google — Introducing Gemini 3.7 Flash: our most intelligent workhorse model (source primaire), 13 août 2026
Bloomberg — Google Unveils Gemini 3.7 Flash Model as Gemini 3.5 Pro Delay Persists, 13 août 2026
Axios — Google’s Gemini 3.7 Flash arrives before Gemini 3.5 Pro, 13 août 2026
SiliconAngle — Google launches Gemini 3.7 Flash for coding, AI agent projects, 13 août 2026