La réponse courte
Les entreprises américaines basculent une part croissante de leur volume de tokens IA vers des modèles chinois à poids ouverts — DeepSeek, le Qwen d’Alibaba et le GLM de Zhipu — parce qu’ils tournent environ 60 à 90 % moins cher que les meilleurs modèles OpenAI et Anthropic pour un travail comparable. Les données d’OpenRouter rapportées par CNBC le 7 juillet 2026 montrent que les fournisseurs chinois alimentent plus de 30 % des tokens routés aux États-Unis chaque semaine depuis le 8 février 2026, culminant près de 46 %, contre une moyenne d’environ 11 % sur les douze mois précédents.
La lecture concrète pour les responsables d’ingénierie : le coût du modèle est désormais une variable architecturale de premier plan, et l’option capable la moins chère ne vient de plus en plus pas d’un labo américain. Le hic, c’est que la voie API directe de ces modèles passe souvent par la Chine, ce qui soulève des questions de résidence des données et de conformité pour les équipes réglementées. Le bon mouvement consiste à capter la baisse de prix tout en gardant les données dans votre propre juridiction — ce que la nature à poids ouverts de ces modèles rend possible.
Que se passe-t-il réellement ?
Pendant la majeure partie des deux dernières années, l’hypothèse par défaut pour une charge de production sérieuse était un modèle frontière d’un labo américain — OpenAI ou Anthropic. Cette hypothèse s’érode vite. Au premier semestre 2026, une vague de modèles capables à poids ouverts venus de Chine a comblé assez l’écart de qualité sur le code et les tâches générales pour que le prix devienne le facteur décisif, et le prix est là où ils l’emportent nettement. Le résultat est une migration mesurable de vrai trafic de production, pas seulement des expériences d’amateurs.
Le signal le plus clair vient d’OpenRouter, un service de routage qui s’intercale entre les applications et des dizaines de fournisseurs de modèles. Comme l’a rapporté CNBC le 7 juillet 2026, la part des tokens routés aux États-Unis vers des modèles chinois est restée au-dessus de 30 % chaque semaine depuis le 8 février 2026 et a bondi jusqu’à 46 %. Un an plus tôt, ce chiffre tournait autour de 11 % en moyenne, et au premier semestre 2025 il était aussi bas que 4,5 %. Pour toute équipe qui exécute de l’inférence à fort volume — le type qui domine le coût dans les charges IA et données — c’est un changement structurel dans la destination des tokens.
Ce n’est pas non plus une histoire de fournisseur unique. Les gains se répartissent entre DeepSeek, le Qwen d’Alibaba, Zhipu (désormais sous la marque Z.ai), MiniMax, le Kimi de Moonshot et d’autres. Dès avril 2026, la part hebdomadaire combinée des grands fournisseurs chinois sur OpenRouter avait franchi 45 % du volume total, contre moins de 2 % un an auparavant. Le marché est passé de « résultat de benchmark intéressant » à « ligne de la facture d’infrastructure » en une douzaine de mois environ.
Quelle est l’ampleur du basculement ?
Commençons par l’écart de prix brut. Les propres analystes d’OpenRouter situent les modèles chinois à poids ouverts environ 60 à 90 % moins chers que les principaux modèles Anthropic et OpenAI. Dans une comparaison illustrative pour un volume de travail similaire, le Claude d’Anthropic est ressorti autour de 4 811 $, OpenAI autour de 3 357 $ et le GLM de Zhipu autour de 544 $. Des chiffres comme ceux-là ne survivent pas sans être contestés à une revue budgétaire trimestrielle — dès qu’une option de qualité comparable est disponible à un dixième du coût, la finance commence à demander pourquoi chaque appel passe par la strate coûteuse.
Les courbes d’adoption collent au récit du prix. Le GLM 5.2 de Z.ai, publié en juin 2026, a connu l’adoption la plus rapide de tous les modèles que Vercel a suivis cette année : le volume de tokens quotidien a crû d’environ 27x et le nombre de clients l’utilisant d’environ 80x lors de sa première semaine complète. La part de tokens de DeepSeek sur Vercel a bondi de moins de 1 % à environ 17 % rien qu’en mai. Et le basculement se produit à l’échelle d’entreprises entières : la startup d’assistant IA Lindy a déplacé 100 % de son trafic du Claude d’Anthropic vers DeepSeek en juin, son PDG s’attendant à économiser des millions de dollars à mesure que la courbe de coût chutait.
Les développeurs individuels racontent la même histoire en miniature. Des praticiens cités dans le reportage décrivent le passage d’environ 10 $ de l’heure d’usage de Claude à moins de 50 cents de l’heure sur DeepSeek, ou la réservation des modèles américains premium pour les 10 % de tâches les plus difficiles tout en routant les 90 % de routine vers des modèles chinois moins chers. Le schéma est constant : garder un modèle haut de gamme pour le travail qui en a vraiment besoin, et envoyer tout le reste vers l’option la moins chère qui franchit le seuil.
Pourquoi les équipes changent-elles ?
La raison affichée est le coût, mais la raison plus profonde est que le coût a cessé d’être justifié par un fossé de qualité. Quand le meilleur modèle américain était clairement en avance sur les tâches qui vous importaient, payer une prime était rationnel. En 2026, les modèles chinois à poids ouverts sont assez proches sur les charges courantes de code, de rédaction et d’usage d’outils pour que la prime ressemble davantage à une taxe qu’à un investissement pour la masse des appels. Ce recadrage — du « meilleur modèle » au « modèle le moins cher qui franchit mon seuil de qualité par tâche » — est le glissement mental qui pilote la migration.
La deuxième raison est l’optionalité. Parce que ces modèles sont à poids ouverts, les équipes ne sont pas enfermées dans la feuille de route, la tarification ou la disponibilité d’un fournisseur unique. Vous pouvez les faire tourner derrière votre propre interface, les affiner sur votre domaine, ou les remplacer quand quelque chose de mieux apparaît — la même logique de portabilité qui rend l’affinage de modèles ouverts attractif pour les équipes qui veulent une capacité durable et possédée plutôt qu’une dépendance à la consommation. Dans une année où l’accès à la frontière est devenu échelonné et où les prix ont bougé dans les deux sens, cette optionalité vaut de l’argent réel.
Quels sont les risques de conformité et de données ?
C’est ici que l’enthousiasme a besoin d’une couche de gouvernance. La façon la moins chère d’essayer ces modèles — appeler une API hébergée qui tourne en Chine — est aussi la plus risquée pour quiconque manipule des données réglementées ou sensibles. Envoyer des dossiers clients, des données de santé ou des détails financiers vers un point de terminaison à l’étranger soulève des préoccupations de résidence des données, de sécurité, de censure et de géopolitique, et ce n’est pas hypothétique : les législateurs américains ont déjà ouvert des enquêtes sur des entreprises américaines qui ont routé des charges via des modèles chinois. Pour une plateforme FinTech ou healthtech, cette voie peut entrer en collision directe avec le RGPD, HIPAA et les engagements internes de traitement des données.
La nuance importante — et la raison pour laquelle c’est une opportunité plutôt qu’un avertissement — est que le modèle et le lieu d’hébergement sont des décisions distinctes. DeepSeek, Qwen et GLM publient leurs poids, donc vous n’êtes pas obligé d’utiliser une API hébergée en Chine pour utiliser le modèle. Vous pouvez récupérer les poids ouverts et faire tourner l’inférence dans votre propre environnement sur un cloud US ou UE, en gardant les données dans la juridiction de bout en bout. C’est la même discipline qui sous-tend un bon travail de conformité RGPD : la question qu’un régulateur pose n’est pas seulement « quel modèle » mais « où sont allées les données ». Répondez à cela par l’auto-hébergement et l’argument du coût survit intact à la revue de conformité.
Ce que cela signifie pour les équipes logicielles US & UE
La première leçon est que le choix du modèle est désormais une discipline d’ingénierie des coûts, pas un choix de fournisseur ponctuel. Avec des modèles capables disponibles sur une fourchette de prix de 10x, le schéma durable est une couche de routage indépendante du fournisseur qui envoie chaque charge vers le modèle le moins cher qui franchit son seuil de qualité. Les équipes qui codent en dur un modèle et un prix laissent une grosse ligne récurrente sur la table — et sont exposées quand ce fournisseur change de tarification ou de disponibilité.
La deuxième leçon est que les poids ouverts changent le calcul du déploiement. La question intéressante pour 2026 n’est pas seulement « modèle américain ou modèle chinois » mais « API hébergée ou poids auto-hébergés ». Auto-héberger un modèle ouvert sur votre propre pile cloud et DevOps ajoute du travail opérationnel — capacité GPU, service, supervision — mais convertit une dépendance à la consommation, transfrontalière, en un actif que vous contrôlez, avec une résidence des données que vous pouvez prouver. Pour les secteurs réglementés, cet arbitrage favorise de plus en plus l’auto-hébergement.
La troisième leçon est que la provenance devient un artefact d’audit. À mesure que l’approvisionnement en modèles devient plus hétérogène, ce qui importe n’est pas seulement que vous avez utilisé de l’IA, mais quel modèle, quelle version et où il a tourné est arrivé en production pour chaque fonctionnalité. Enregistrez cette cartographie, gardez vos preuves d’évaluation, et soyez prêt à expliquer le chemin d’hébergement. Les équipes qui iront le plus vite sont celles dont l’architecture traite le modèle comme un composant interchangeable et bien documenté plutôt que comme une hypothèse permanente et invisible.
Que faire ce trimestre
Voici la version livrable. Traitez le basculement de coût des modèles chinois comme une incitation à rendre votre pile IA à la fois moins chère et plus défendable.
- Ajoutez une couche de routage. Placez une interface indépendante du fournisseur devant vos appels LLM afin que modèle, strate et fournisseur soient de la configuration, pas du code.
- Comparez sur votre propre travail. Testez DeepSeek, Qwen et GLM contre votre fournisseur actuel sur vos vraies tâches et métriques de qualité — pas sur des classements publics.
- Dimensionnez chaque appel. Réservez les modèles américains premium pour les charges les plus difficiles ; routez les tâches de routine à fort volume vers le modèle le moins cher qui franchit le seuil.
- Décidez modèle et hébergement séparément. Pour les données réglementées ou sensibles, faites tourner les poids ouverts dans votre propre environnement US ou UE au lieu d’appeler une API à l’étranger.
- Cartographiez le chemin de conformité. Documentez la résidence des données pour chaque fonctionnalité IA et vérifiez-la au regard du RGPD, de HIPAA et de vos engagements clients avant de monter en usage.
- Enregistrez la provenance. Consignez quel modèle, version et chemin d’hébergement est en production pour chaque fonctionnalité, et gardez les preuves d’évaluation récupérables pour les audits.
Rien de tout cela n’est un conseil juridique, et vos obligations exactes dépendent de votre secteur et de votre juridiction. Mais le signal stratégique est clair : le prix d’une IA capable baisse vite, une grande partie de la baisse vient des modèles à poids ouverts, et les équipes qui en profitent sont celles qui peuvent les adopter sans importer de risque. Traitez le modèle comme interchangeable, gardez les données là où les règles l’exigent, et les économies sont à vous.
Foire aux questions
Pourquoi les entreprises américaines adoptent-elles les modèles IA chinois ?
Surtout le coût. Les modèles chinois à poids ouverts comme DeepSeek, Qwen et GLM tournent environ 60 à 90 % moins cher que les principaux modèles OpenAI et Anthropic pour un travail comparable, tout en comblant une grande partie de l’écart de qualité sur le code et les tâches générales. Selon les données d’OpenRouter rapportées par CNBC le 7 juillet 2026, les fournisseurs chinois alimentent plus de 30 % des tokens routés aux États-Unis chaque semaine depuis le 8 février 2026, contre environ 11 % un an plus tôt.
Combien les modèles IA chinois sont-ils moins chers qu’OpenAI et Anthropic ?
OpenRouter estime environ 60 à 90 % moins cher. Dans une comparaison illustrative pour un volume de travail similaire, le Claude d’Anthropic a coûté environ 4 811 $, OpenAI environ 3 357 $ et le GLM de Zhipu environ 544 $. Les économies réelles dépendent de votre charge de travail, de la mise en cache et de votre seuil de qualité, mais la baisse du coût par token est importante.
Est-il sûr d’utiliser des modèles IA chinois pour des données réglementées ?
Cela dépend de la façon dont vous les déployez. Envoyer des données réglementées vers une API hébergée en Chine soulève des préoccupations de résidence des données, de sécurité et de géopolitique et a déjà suscité un examen du Congrès américain. Parce que DeepSeek, Qwen et GLM sont à poids ouverts, un schéma plus sûr consiste à faire tourner les poids sur votre propre infrastructure US ou UE afin que les données ne quittent jamais votre juridiction. Traitez le lieu d’hébergement, et pas seulement le modèle, comme la décision de conformité.
DeepSeek et Qwen sont-ils open source ?
Ils sont à poids ouverts : les poids entraînés sont publiés sous des licences permissives, de sorte que vous pouvez les télécharger et les faire tourner sur vos propres serveurs ou un cloud de votre choix. Ce n’est pas la même chose que des données d’entraînement et un code entièrement ouverts, mais c’est suffisant pour auto-héberger, affiner et garder l’inférence dans votre propre environnement — la propriété qui permet aux équipes réglementées de capter les économies sans envoyer de données vers une API à l’étranger.
Que devraient faire les équipes logicielles face au basculement de coût des modèles ?
Placez une couche de routage indépendante du fournisseur devant vos appels LLM, comparez les modèles chinois à poids ouverts sur vos propres tâches, et pour les données réglementées, hébergez les poids ouverts dans votre propre environnement US ou UE plutôt que d’appeler une API à l’étranger. Suivez le coût des tokens par fonctionnalité, gardez une solution de repli capable câblée, et documentez quel modèle et quel chemin d’hébergement chaque fonctionnalité utilise pour les audits.
Sources
CNBC — Chinese AI models are gaining ground with U.S. companies as OpenAI, Anthropic costs surge
Rest of World — When Americans choose Chinese AI
Forbes — China’s DeepSeek V4 and Qwen reshape the open-source AI race