En bref
Le 13 août 2026, DeepSeek a fait passer son modèle V4 Pro de préversion à disponibilité générale, en déployant le point de contrôle 0813 sur son application, son interface web et ses plateformes API. Le modèle est un système Mixture-of-Experts de 1 600 milliards de paramètres qui active 49 milliards de paramètres par token, prend en charge une fenêtre de contexte d'un million de tokens et se classe troisième sur l'Artificial Analysis Intelligence Index parmi 106 modèles. Les poids open-source sous licence MIT permettent aux équipes de l'auto-héberger sans redevances. Une hausse tarifaire significative entre en vigueur à 16 h 00 UTC le 16 août — les coûts de sortie augmentent de 4,5x, passant de 0,87 à 3,96 dollars par million de tokens aux heures de pointe.
Pour les équipes qui travaillent déjà avec des workflows de développement assistés par IA, V4 Pro 0813 est le modèle open-weight pour le codage agentique le plus performant disponible à ce jour. L'urgence tient à l'échéance tarifaire : les équipes souhaitant établir des projections de coûts avant de s'engager doivent agir d'ici la fin du 15 août.
Ce que DeepSeek a réellement publié
La version GA apporte trois changements substantiels par rapport à la préversion. Premièrement, DeepSeek annonce des « capacités agentiques significativement améliorées » — l'aptitude du modèle à utiliser des outils, à exécuter du code de façon autonome et à accomplir des workflows en plusieurs étapes sans intervention humaine. Deuxièmement, les niveaux d'effort de réflexion ont été étendus à trois paramètres (bas, élevé, maximal), permettant aux développeurs d'adapter le budget de calcul à la complexité de la tâche plutôt que de choisir entre activé et désactivé. Troisièmement, l'API prend désormais en charge le format OpenAI Responses API nativement, avec une intégration Codex intégrée.
Ce dernier point a des conséquences pratiques immédiates pour les équipes déjà en production. Les bases de code existantes qui appellent le SDK OpenAI peuvent rediriger les requêtes vers DeepSeek V4 Pro en changeant simplement l'URL de base et la clé API — aucune refactorisation structurelle des prompts, des définitions d'outils ni des boucles d'agents n'est nécessaire. Les méthodes d'appel restent identiques à celles de la préversion, de sorte que toute intégration déjà en cours de test continue de fonctionner.
L'architecture du modèle reste la même qu'annoncée en avril : 1 600 milliards de paramètres totaux avec une conception Mixture-of-Experts n'activant que 49 milliards de paramètres lors de l'inférence. La fenêtre de contexte est d'un million de tokens (environ 1 500 pages de texte). La longueur de sortie maximale est de 384 000 tokens. Le modèle prend en charge les modes avec et sans raisonnement, en entrée et sortie texte uniquement — sans modalité multimodale en entrée.
Quelles sont ses capacités ?
Sur l'Artificial Analysis Intelligence Index — une évaluation indépendante couvrant le raisonnement, le codage, le suivi d'instructions et les tâches en plusieurs étapes — V4 Pro 0813 obtient un score de 53 sur 100, le plaçant troisième parmi 106 modèles évalués. Ce résultat est bien supérieur à la médiane des modèles open-weight, fixée à 27, et reste compétitif avec les meilleurs systèmes propriétaires.
Sur les benchmarks agentiques publiés par DeepSeek : Terminal Bench 2.1 (tâches agentiques à horizon long) obtient 87,9 ; DeepSWE (résolution de problèmes d'ingénierie logicielle) obtient 62,7 ; NL2Repo (génération de code en langage naturel à l'échelle d'un dépôt) obtient 61,5. Ces chiffres sont auto-déclarés. Au 13 août 2026, aucun évaluateur tiers majeur n'avait publié de réplication indépendante du point de contrôle exact 0813 — traitez les données fournisseur comme indicatives mais non confirmées.
La vitesse s'établit à 80,8 tokens par seconde sur l'infrastructure d'Artificial Analysis, au-dessus de la médiane du marché de 66,3. Une remise de 97 % sur les cache-hits s'applique aux préfixes de prompts répétés — pertinent pour les équipes effectuant des inférences batch sur des prompts similaires ou des pipelines RAG avec un contexte partagé.
La hausse tarifaire à ne pas ignorer
Le signal opérationnel le plus important de la version GA est la restructuration tarifaire qui prend effet à 16 h 00 UTC le 16 août 2026. Tarifs actuels fixes : 0,435 dollar par million de tokens en entrée sur un cache miss, 0,003625 dollar par million sur un cache hit, et 0,87 dollar par million de tokens en sortie. Nouveaux tarifs de pointe : 1,32 dollar par million de tokens en entrée et 3,96 dollars par million de tokens en sortie — soit une multiplication par 4,5 sur la sortie. Les tarifs hors heures de pointe sont fixés à la moitié du tarif de pointe, récompensant les équipes capables de planifier leurs traitements batch pendant ces fenêtres.
Pour donner un ordre de grandeur, aux tarifs actuels, V4 Pro est environ 57 fois moins cher sur la sortie que Claude Opus 4 au prix catalogue. Après le 16 août, cet écart se réduit, mais le modèle reste substantiellement moins coûteux que la plupart des API propriétaires fermées aux heures creuses. La remise sur les cache-hits est inchangée et demeure le levier de contrôle des coûts le plus puissant pour les workloads à requêtes répétées.
Les équipes qui n'ont pas encore réalisé d'audit mensuel de leurs volumes de tokens doivent le faire avant la fin du 15 août. La facture post-hausse pour un workload agentique à fort volume — boucles SWE-agent, pipelines RAG, automatisation de la revue de code — peut être significativement plus élevée que les projections actuelles basées sur les tarifs pré-GA.
Ce que cela signifie pour les équipes françaises
Trois décisions deviennent concrètes avec le statut de disponibilité générale.
API contre auto-hébergement — angle RGPD. La disponibilité générale confirme la stabilité de production du modèle et son support. Pour les équipes soumises à des exigences strictes en matière de résidence des données, les appels API vers l'infrastructure DeepSeek (hébergée en Chine) déclenchent l'évaluation des transferts RGPD au titre des articles 44 et suivants — la Chine ne bénéficiant d'aucune décision d'adéquation de la Commission européenne. Pour les équipes traitant des données à caractère personnel ou des données métier sensibles, l'auto-hébergement des poids MIT sur une infrastructure UE est une décision de conformité autant que financière. OVHcloud, basé à Roubaix et disposant de régions de données françaises certifiées, constitue une option d'hébergement GPU naturellement conforme au RGPD pour les équipes souhaitant conserver leur inférence dans le périmètre européen sans gérer leur propre matériel.
CNIL et souveraineté numérique. La CNIL a publié des recommandations sur l'utilisation des systèmes d'IA, notamment sur la transparence algorithmique et les conditions de licéité des transferts de données vers des pays tiers. Dans le cadre de la Stratégie Nationale pour l'Intelligence Artificielle (SNIA) et de l'initiative French Tech, les modèles open-weight sous licence MIT s'inscrivent directement dans l'objectif de souveraineté numérique française : les poids sont accessibles, auditables et peuvent être déployés sur infrastructure souveraine. Les équipes travaillant sur des projets du secteur public ou soumis à la doctrine cloud de l'État français (SecNumCloud) doivent évaluer l'hébergement souverain comme prérequis, indépendamment de la performance du modèle.
Comparaison Mistral AI. Les équipes françaises familières avec Mistral Large ou Mistral Medium trouveront une philosophie architecturale similaire dans V4 Pro — Mixture-of-Experts, poids ouverts sous licence MIT, API compatible OpenAI. Après la hausse tarifaire du 16 août, V4 Pro API reste moins coûteux que la plupart des API propriétaires fermées, mais l'API Mistral, hébergée sur infrastructure européenne, constitue une alternative souveraine à considérer sérieusement pour les cas d'usage réglementés ou pour les équipes qui préfèrent une chaîne d'approvisionnement IA entièrement ancrée dans l'UE. Les deux modèles peuvent coexister dans une couche de routage intelligente.
Impact tarifaire en euros. La hausse de prix (sortie : 0,87 → 3,96 $/M tokens) représente environ 0,80 → 3,64 €/M tokens au taux de change actuel. Les workloads batch devraient être planifiés hors heures de pointe pour bénéficier du tarif réduit de moitié. Pour un pipeline RAG générant 10 millions de tokens de sortie par mois, le surcoût mensuel dépasse 280 euros — un calcul à effectuer impérativement avant le 16 août.
ETI et startups de la French Tech. L'API de DeepSeek, compatible nativement avec le SDK OpenAI, abaisse considérablement la barrière d'évaluation pour les équipes techniques des ETI et des startups de la French Tech qui déploient des outils de codage assisté par IA. Un test A/B sur un use case réel — revue de code, génération de tests, refactorisation — ne nécessite que quelques heures d'intégration et quelques dizaines d'euros de tokens. Pour les équipes qui construisent des couches d'intégration GenAI abstrayant le fournisseur de modèle, V4 Pro devient un backend routable aux côtés des API propriétaires, sélectionné par tâche selon le coût, la latence et la capacité.
Règlement européen sur l'IA — classification. V4 Pro est un modèle d'IA à usage général (GPAI). Les obligations GPAI du règlement européen sur l'IA s'appliquent aux fournisseurs de tels modèles, pas nécessairement aux déployeurs. Cela dit, si votre produit utilise V4 Pro dans une application à haut risque relevant de l'Annexe III — recrutement, notation de crédit, infrastructure critique — vous portez des obligations en tant que déployeur. L'auto-hébergement ne transfère pas les obligations de niveau fournisseur ; il détermine quelle partie est responsable de quelle couche.
Comment l'évaluer ce trimestre
La démarche structurée : faire tourner V4 Pro 0813 dans votre harnais d'évaluation existant sur la distribution de tâches spécifiques que vos agents traitent — pas sur des prompts de classement généraux. Mesurer le taux de réussite des tâches, le nombre de tokens de sortie par tâche (les modèles verbeux coûtent plus cher à l'échelle), le temps total écoulé par workflow, et le coût mensuel estimé aux tarifs post-16-août. Comparer à votre modèle actuel, pas aux benchmarks.
Pour les équipes sans harnais d'évaluation, le minimum pratique est le suivant : choisir cinq tâches représentatives, les exécuter chacune dix fois sur les deux modèles, noter les sorties en aveugle, et calculer le coût par réussite notée aux tarifs post-hausse. Ce point de données de 50 échantillons vaut mieux que n'importe quelle position sur un classement pour prédire la performance sur votre base de code.
Conservez votre couche d'intégration indépendante du modèle. V4 Pro est la meilleure option open-weight aujourd'hui ; ce classement évoluera. L'équipe qui a construit une couche de routage peut basculer vers un meilleur modèle le trimestre prochain sans reconstruction.
FAQ
Qu'est-ce que DeepSeek V4 Pro 0813 et quand est-il passé en disponibilité générale ?
DeepSeek V4 Pro 0813 est le point de contrôle de disponibilité générale du modèle phare de DeepSeek, officiellement publié le 13 août 2026 sur l'application DeepSeek, l'interface web et l'API. Le modèle était en préversion depuis le lancement de la série V4 en avril 2026. Les méthodes d'appel restent inchangées par rapport à la préversion — les intégrations existantes continuent de fonctionner sans modification du code.
Les poids open-source sont-ils toujours sous licence MIT ?
Oui. La série V4 a été publiée avec des poids sous licence MIT autorisant l'auto-hébergement et l'utilisation commerciale sans redevances. Le point de contrôle GA 0813 conserve cette licence. Les équipes opérant dans des environnements réglementés doivent vérifier la portée exacte avec leur conseil juridique, notamment au regard des obligations chinoises en matière de résidence des données qui peuvent s'appliquer à l'origine du modèle, mais la licence elle-même est véritablement permissive.
Comment V4 Pro 0813 se compare-t-il aux autres modèles frontier pour le codage agentique ?
Selon Artificial Analysis, V4 Pro 0813 se classe troisième parmi 106 modèles sur l'Intelligence Index, bien au-dessus de la médiane des modèles open-weight. Sur les benchmarks agentiques publiés par DeepSeek : Terminal Bench 2.1 obtient 87,9, DeepSWE obtient 62,7 et NL2Repo obtient 61,5. La réplication indépendante tierce du point de contrôle exact 0813 était en attente au 13 août 2026 — traitez les données fournisseur de façon prudente jusqu'à leur confirmation par des tiers.
Quelle est la hausse tarifaire du 16 août et comment les équipes doivent-elles s'y préparer ?
À 16 h 00 UTC le 16 août 2026, DeepSeek introduit une facturation par plage horaire. Le tarif de sortie en heures de pointe passe de 0,87 à 3,96 $ par million de tokens — soit une multiplication par 4,5. Les tarifs hors heures de pointe sont fixés à la moitié du tarif de pointe. Les remises sur les cache-hits restent fortement réduites (97 %). En euros, cela représente environ 0,80 à 3,64 €/M tokens au taux actuel. Les équipes doivent auditer leurs volumes mensuels de tokens, calculer la facture post-hausse et décider si elles préfèrent décaler leurs traitements batch vers les heures creuses ou évaluer l'auto-hébergement via les poids MIT.
Que signifie la compatibilité native avec l'API OpenAI Responses pour les équipes ?
Toute base de code appelant déjà le SDK OpenAI peut rediriger ses requêtes vers DeepSeek V4 Pro en changeant l'URL de base et la clé API — sans refactorisation structurelle des prompts requise. Cela abaisse considérablement le coût d'évaluation : les équipes peuvent effectuer des tests A/B entre DeepSeek et leurs fournisseurs de modèles actuels sans modifier leur couche agent ou d'outillage.
Sources : Documentation API DeepSeek — api-docs.deepseek.com (notes de version officielles, 13 août 2026) ; Artificial Analysis — Benchmarks et tarifs DeepSeek V4 Pro 0813 ; Quartz / QZ — DeepSeek officially launches V4-Pro AI model in August 2026 (13 août 2026).