L'essentiel
Le 21 juillet 2026, Google a poussé ses dernières améliorations de modèle vers le bas — vers le tier bon marché, pas vers le modèle phare. Gemini 3.6 Flash est tarifé à 1,50 $ par million de tokens en entrée et 7,50 $ par million en sortie (contre 9,00 $ pour 3.5 Flash), et Google indique qu'il consomme environ 17 % moins de tokens en sortie en général et jusqu'à 65 % moins sur les tâches d'ingénierie logicielle longue durée. Il est sorti avec 3.5 Flash-Lite et un 3.5 Flash Cyber axé sur la sécurité — mais pas le très attendu Gemini 3.5 Pro.
Pour les équipes qui font tourner des agents de codage, le coût effectif par tâche accomplie baisse plus vite que le prix catalogue seul. La bonne réaction n'est pas de changer de modèle du jour au lendemain, mais de router une partie du trafic réel vers 3.6 Flash, de mesurer le taux de réussite des tâches et le coût total sur ses propres charges de travail, et de le promouvoir uniquement là où la qualité se maintient.
Ce que Google a réellement livré
Trois modèles, tous orientés vers le coût et la vitesse plutôt que vers un nouveau modèle phare frontier. Gemini 3.6 Flash est la sortie principale : Google le positionne pour l'orchestration multi-étapes, le refactoring de code full-stack et le raisonnement général, avec des taux d'échec de compilation et de révision plus faibles que son prédécesseur et une fenêtre de contexte d'1M tokens. À côté, sont arrivés Gemini 3.5 Flash-Lite, une variante plus légère et moins chère, et Gemini 3.5 Flash Cyber, une version axée sécurité. Tous sont disponibles immédiatement via l'API Gemini, Google AI Studio et Android Studio, ainsi que dans l'application Gemini grand public.
Les chiffres derrière l'argumentaire portent sur l'efficacité, pas seulement sur un prix plus bas. Gemini 3.6 Flash est affiché à 1,50 $ par million de tokens en entrée et 7,50 $ par million en sortie, une baisse par rapport aux 9,00 $ en sortie de 3.5 Flash. Google rapporte qu'il consomme environ 17 % moins de tokens en sortie que 3.5 Flash sur l'Artificial Analysis Index, et sur DeepSWE — un benchmark mesurant à quel point un agent accomplit des tâches d'ingénierie multi-étapes de bout en bout — la consommation de tokens baisse jusqu'à 65 % tandis que le score de qualité monte à 49 % contre 37 %. Pour quiconque architecte des systèmes LLM et données appliqués, cette combinaison de moins de tokens et moins d'appels d'outils par tâche est ce qui fait bouger les budgets, car elle se cumule sur chaque exécution d'agent.
Pour les entreprises, la disponibilité s'étend à Vertex AI et à l'application Gemini Enterprise, où 3.6 Flash tourne dans la région globale et un administrateur active un basculement de fonctionnalité pour l'activer, y compris dans les agents de workflow Agent Designer.
Pourquoi l'efficacité en tokens compte plus que le prix ?
Parce que pour un agent, la facture est déterminée par les tokens consommés par tâche accomplie, pas par le tarif par token sur une page de prix. Un agent de codage longue durée planifie, appelle des outils, lit des résultats et recommence ; un seul travail « corriger ce bug » peut brûler des centaines de milliers de tokens sur de nombreux tours. Un modèle qui atteint le même résultat en moins d'étapes de raisonnement et moins d'appels d'outils réduit les coûts doublement — moins de tokens à un prix inférieur — et réduit aussi la latence, ce qui rend un agent utilisable plutôt que lent.
C'est pourquoi le chiffre de 65 % sur le long horizon compte plus que la baisse de prix catalogue. Sur des prompts courts et uniques, la différence entre modèles est modeste. Sur le travail d'ingénierie multi-étapes pour lequel les agents sont réellement déployés, de petites économies par tour se multiplient en grandes économies par tâche, et un modèle qui révise moins souvent son propre code évite des cycles entiers de génération inutile.
Le contrepoids est que les affirmations d'efficacité sont mesurées sur les benchmarks choisis par Google. DeepSWE et l'Artificial Analysis Index sont des proxys raisonnables, mais ils ne sont pas votre dépôt, votre chaîne d'outils ou vos prompts. Les économies sont des preuves directionnelles à tester, pas une garantie.
Que signifie l'absence de 3.5 Pro pour la planification ?
Cela signifie que les dernières améliorations Gemini sont, pour l'instant, une histoire de tier Flash. Le modèle Pro phare de Google a été mis à jour pour la dernière fois en février, et cette sortie n'incluait pas 3.5 Pro. Le responsable produit de Google DeepMind, Logan Kilpatrick, a indiqué que l'entreprise teste 3.5 Pro avec des partenaires et espère qu'il « arrivera bientôt », et Bloomberg avait rapporté des retards internes. Les équipes qui attendent un saut Pro frontier pour justifier une décision de plateforme devraient planifier autour du tier qui existe réellement aujourd'hui.
Il y a aussi un signal stratégique dans le séquençage. Pousser l'efficacité et les coûts vers le Flash — tandis que le modèle frontier glisse — suit une tendance sectorielle : la concurrence qui détermine l'adoption réelle porte de plus en plus sur le prix, la latence et l'accès, pas sur la position dans les classements. Pour la plupart des charges de travail agentiques, un modèle moins cher qui est « suffisamment bon » et rapide l'emporte sur un modèle marginalement plus fort qui coûte plusieurs fois plus par tâche.
Ce que cela signifie pour le marché français
En France, l'adoption des agents IA en production s'accélère — portée notamment par la dynamique French Tech et les investissements du plan France 2030 dans l'IA souveraine. La baisse du coût par token de Gemini 3.6 Flash élargit l'accès à des architectures d'agents multi-étapes que seules les grandes entreprises pouvaient jusqu'ici absorber financièrement. Pour les scale-ups françaises qui construisent des outils de développement assisté (génération de tests, revue de code, CI/CD intelligent), le passage à un modèle plus économique peut changer la viabilité du produit.
Cependant, le contexte réglementaire français impose une attention particulière. La CNIL rappelle régulièrement que tout traitement de données personnelles par un système d'IA, y compris par des agents autonomes, doit respecter le RGPD — avec une base légale explicite, une durée de conservation définie et un droit d'accès garanti. Par ailleurs, l'AI Act européen peut qualifier certains systèmes d'agents autonomes de systèmes à haut risque selon leur domaine d'application (RH, crédit, santé, infrastructures critiques). Avant de déployer Gemini 3.6 Flash dans un pipeline de production, les équipes françaises doivent vérifier la région de traitement sur Vertex AI et s'assurer que les journaux d'inférence ne transitent pas hors de l'EEE.
Ce que cela signifie pour les équipes US & EU
Pour les équipes déjà construites sur Gemini, 3.6 Flash est un chemin de mise à niveau direct pour les charges de travail d'agents — mais la démarche productive est de le traiter comme une décision de routage, pas un changement global. Pointez une part du trafic réel vers le nouveau modèle, comparez le taux de réussite des tâches, le taux de révision et le coût total avec votre configuration actuelle, et promouvez-le uniquement là où il gagne.
Les équipes EU ont une étape supplémentaire. Gemini 3.6 Flash est disponible dans la région globale et via Vertex AI et Gemini Enterprise, mais disponibilité ne signifie pas conformité. Les charges de travail qui touchent des données personnelles ou réglementées — courantes dans la FinTech et la santé — doivent faire confirmer la région spécifique, les modalités de traitement et de journalisation contre le RGPD et l'AI Act de l'UE avant qu'un agent puisse toucher des données de production.
La leçon durable se situe au-dessus de tout modèle individuel. Les prix, les tiers et les classements continueront de changer ; les équipes qui restent bon marché et rapides sont celles dont le stack d'agents est agnostique au modèle — des prompts propres, une couche de routage, des évaluations et des plafonds de coûts — de sorte que le passage au prochain modèle efficace est un changement de configuration, pas une reconstruction.
Comment l'évaluer ce trimestre
Traitez le lancement comme une incitation à faire une comparaison contrôlée, pas à remplacer entièrement votre modèle. Voici la version actionnable.
- Définir le coût par tâche réussie. Mesurez les tokens et les euros par travail accompli sur votre charge de travail, pas le prix par token ou les scores de benchmarks.
- Router une part, ne pas basculer. Envoyez une fraction du trafic réel d'agents vers 3.6 Flash et comparez-le côte à côte avec votre modèle actuel.
- Suivre les taux de révision et d'échec. Un modèle qui révise moins souvent son propre code économise des cycles entiers de génération — observez cela, pas seulement la latence.
- Confirmer la région et la conformité. Pour les données EU ou réglementées, vérifiez la résidence des données, la journalisation et les obligations de l'AI Act avant que des agents touchent la production.
- Plafonner les dépenses par agent. Des tokens moins chers invitent plus d'exécutions ; définissez des budgets et des alertes pour que les gains d'efficacité ne soient pas absorbés par un volume plus élevé.
- Garder le stack agnostique au modèle. Placer une couche de routage et des évaluations entre vos agents et tout fournisseur unique pour que le prochain changement soit une modification de configuration.
Bien utilisé, un tier efficacité moins cher est un vrai gain de marge pour les produits agentiques. Utilisé imprudemment, c'est un titre de benchmark qui n'atteint jamais votre compte de résultat. La différence, c'est la discipline d'évaluation que vous construisez autour du changement.
Questions fréquentes
Qu'a lancé Google le 21 juillet 2026 ?
Trois modèles axés sur l'efficacité : Gemini 3.6 Flash, Gemini 3.5 Flash-Lite et un Gemini 3.5 Flash Cyber axé sécurité. Gemini 3.6 Flash, conçu pour l'orchestration multi-étapes, le refactoring full-stack et le travail agentique, est disponible via l'API Gemini, Google AI Studio, Android Studio, l'application Gemini et, pour les entreprises, Vertex AI et Gemini Enterprise. La sortie n'incluait pas Gemini 3.5 Pro.
Dans quelle mesure Gemini 3.6 Flash est-il moins cher ?
Il est affiché à 1,50 $ par million de tokens en entrée et 7,50 $ par million en sortie, contre 9,00 $ en sortie pour 3.5 Flash. Google indique également environ 17 % moins de tokens en sortie en général et jusqu'à 65 % moins sur les tâches longues DeepSWE, de sorte que le coût effectif par tâche d'agent accomplie baisse plus vite que le seul prix affiché.
Gemini 3.5 Pro est-il disponible ?
Non. Le tier Pro phare de Google a été mis à jour pour la dernière fois en février et 3.5 Pro n'était pas inclus dans cette sortie. Google dit tester 3.5 Pro avec des partenaires et espère qu'il arrivera bientôt ; Bloomberg a rapporté des retards internes. Pour l'instant, les derniers gains Gemini se trouvent au tier Flash.
Les équipes doivent-elles migrer leurs agents de codage vers Gemini 3.6 Flash ?
Testez d'abord. Routez une partie du trafic réel vers 3.6 Flash, comparez le taux de réussite, le taux de révision et le coût total sur vos propres charges de travail avec votre modèle actuel, et promouvez-le uniquement là où la qualité se maintient. Le choix du modèle doit être une décision de routage mesurée, pas un remplacement unique.
Gemini 3.6 Flash est-il disponible dans l'UE et en France ?
Oui, dans la région globale via l'API Gemini et, pour les entreprises, via Vertex AI et Gemini Enterprise avec un basculement administrateur. Les équipes françaises traitant des données personnelles ou réglementées doivent confirmer la région, les modalités de traitement et la journalisation au regard du RGPD et de l'AI Act de l'UE avant que des agents touchent les données de production.
Sources
TechCrunch — Google releases three new Gemini models, but no 3.5 Pro, 21 juillet 2026
CNBC — Google expands Gemini lineup with cheaper models, 21 juillet 2026
Google — Introducing Gemini 3.6 Flash, 3.5 Flash-Lite and 3.5 Flash Cyber (source primaire)