Daniel Reyes, YuSMP Group
Daniel Reyes Principal Engineer, IA/ML, YuSMP Group · systèmes agentiques et de recherche augmentée en production pour des équipes aux États-Unis et dans l’UE
Une petite puce lumineuse posée sur un bureau sombre projette des faisceaux bleus et ambrés vers de hautes piles de documents papier, illustrant un traitement IA rapide, peu coûteux et à grand volume

Le lancement en bref

Le 7 octobre 2026, Anthropic a lancé Claude Haiku 5.5, le niveau compact et rapide de sa famille Claude 5.5, et a baissé de 90 % son prix catalogue par rapport à Haiku 4.5 pour les requêtes de moins de 100 000 tokens. En tenant compte de la taille réelle des requêtes et de la consommation de tokens, Anthropic estime que les charges de travail réelles coûtent environ 75 % de moins.

Le modèle est disponible sous le nom d’API claude-haiku-5-5 sur la Claude Platform, AWS, Google Cloud et Microsoft Azure. Il clôt la génération 5.5, ouverte par Opus 5.5 le 22 septembre puis Sonnet 5.5 le 28 septembre.

Pour les équipes qui s’appuient déjà sur les modèles Claude d’Anthropic, l’effet concret est double : des tâches jusqu’ici confiées à Sonnet pour des raisons de qualité peuvent désormais tenir sur Haiku, et des pipelines à fort volume, jugés trop chers pour un LLM, deviennent rentables.

Combien coûte Claude Haiku 5.5 ?

Haiku 5.5 introduit une tarification à deux paliers selon la longueur du prompt. Jusqu’à 100 000 tokens, une requête coûte 0,10 $ par million de tokens en entrée et 0,50 $ par million de tokens en sortie. Au-delà de ce seuil, le tarif monte à 0,50 $ et 2,50 $, soit encore moitié moins que Haiku 4.5. La mise en cache des prompts suit le même découpage, avec des lectures de cache à 0,01 $ par million de tokens dans la tranche basse.

Selon VentureBeat, environ 90 % des requêtes relèvent du palier le moins cher. C’est cohérent avec ce que nous observons en production : la plupart des appels de classification, d’extraction et de routage sont courts, tandis que les appels à long contexte se concentrent dans quelques flux riches en documents. Le tarif de base est exactement celui de GPT-6 Luna d’OpenAI ; la surtaxe long contexte de Luna ne s’applique toutefois qu’à partir de 272 000 tokens, ce qui compte si votre pipeline envoie régulièrement de gros documents.

Anthropic a aussi divisé par deux le prix des lectures de cache de Sonnet 5.5, de 0,20 $ à 0,10 $ par million de tokens. SiliconANGLE estime que cela réduit d’environ 20 % le coût des charges agentiques typiques, qui relisent à chaque tour le même prompt système et les mêmes définitions d’outils.

Quels progrès par rapport à Haiku 4.5 ?

D’après les résultats publiés par Anthropic, l’écart est important, surtout sur les tâches agentiques. Haiku 5.5 atteint 72,4 % sur les tâches d’utilisation d’ordinateur d’OSWorld 2.1, contre 15,7 % pour Haiku 4.5, et 39,2 % sur Terminal-Bench 4.0, où son prédécesseur obtenait zéro. Sur le benchmark de travail intellectuel GDPval-AA, il obtient 1 620 contre 735.

Les retours clients vont dans le même sens. Asana a mesuré une latence par tâche réduite de plus de 30 % et une inférence jusqu’à 2,5 fois plus rapide ; Box fait état de scores supérieurs de 11 points à Haiku 4.5 pour une latence environ deux fois moindre. Le modèle hérite aussi du paramètre d’effort réglable des grands modèles 5.5, ce qui permet d’arbitrer entre latence et précision à chaque appel.

Prenez ces chiffres comme une hypothèse de départ. Ils sont communiqués par l’éditeur, plusieurs dépendent du niveau d’effort utilisé, et Anthropic n’a pas publié de débit en tokens par seconde. Seul votre propre jeu d’évaluation fait foi.

Pourquoi Anthropic baisse-t-il ses prix maintenant ?

Parce que le prix des petits modèles est devenu un terrain de concurrence. Yahoo Finance replace ce lancement dans une guerre des prix de l’IA qui s’intensifie : les grands comptes réclament des factures d’inférence plus basses et testent de plus en plus des modèles open-weight de laboratoires américains et chinois. En s’alignant sur le tarif de base de GPT-6 Luna, Anthropic supprime l’argument le plus simple pour changer de fournisseur sur le seul critère du coût.

Le calendrier coïncide aussi avec la préparation de l’introduction en bourse attendue d’Anthropic. Trois mises à jour de modèles en 15 jours, chacune moins chère que la précédente, montrent que l’entreprise veut capter les charges à fort volume, et pas seulement le trafic premium de raisonnement.

Ce que cela change pour les équipes logicielles aux États-Unis et dans l’UE

Le routage de modèles mérite d’être revu. Beaucoup de systèmes en production envoient tout vers un modèle intermédiaire, parce que le petit modèle échouait sur les cas limites. Avec un prix catalogue en baisse de 90 % et une utilisation d’outils bien plus solide, un routeur qui oriente les appels simples vers Haiku et fait remonter les cas difficiles vers Sonnet ou Opus peut réduire fortement la dépense LLM sans baisse visible de qualité. L’économie ne se matérialise que si vous mesurez les taux d’escalade et les modes d’échec par type de tâche.

De nouveaux cas d’usage deviennent rentables. À 0,10 $ le million de tokens en entrée, étiqueter chaque ticket de support, résumer chaque transcription d’appel ou pré-qualifier chaque document déposé devient assez bon marché pour être fait par défaut. Les architectures à sous-agents, où un orchestrateur répartit des dizaines de petits appels, deviennent elles aussi beaucoup moins coûteuses.

Le seuil de 100 000 tokens est un paramètre d’architecture. Au-delà de 100 000 tokens, chaque token coûte cinq fois plus cher. Une recherche augmentée (RAG) qui n’envoie que les passages pertinents, combinée à une mise en cache systématique du contexte stable, maintient la plupart des appels dans le palier bas. Déverser des dépôts de code entiers ou des liasses de contrats dans la fenêtre de contexte a désormais un signal prix clair contre lui.

Achats et résidence des données ne changent pas. Comme Haiku 5.5 est disponible dès le premier jour sur AWS, Google Cloud et Azure, les équipes européennes peuvent conserver leur région cloud, leur accord de traitement des données (DPA) et leur facturation. Vérifiez que la région que vous utilisez propose bien le modèle avant de planifier une migration, et gardez l’épinglage de version du modèle afin qu’un changement silencieux d’alias ne modifie pas le comportement de traitements soumis au RGPD.

Qu’est-ce que cela change pour le marché français ?

En France, le petit modèle bon marché n’est pas une nouveauté : Mistral AI a fait de ce segment un argument de souveraineté auprès des ETI et des grands groupes. La baisse de Haiku 5.5 resserre l’écart de prix entre modèles américains et européens, si bien que le choix se jouera moins sur le coût au million de tokens que sur la qualité mesurée sur vos données en français, la latence et le cadre contractuel. Pour un DSI, c’est l’occasion de mettre plusieurs fournisseurs en concurrence derrière une même couche de routage plutôt que de s’enfermer chez un seul.

Côté conformité, le tarif ne change rien aux obligations : tout traitement de données personnelles reste soumis au RGPD, avec analyse d’impact quand le risque l’exige, et la CNIL a publié des recommandations dédiées aux systèmes d’IA qu’il vaut la peine de relire avant un déploiement. Pour les administrations et les opérateurs sensibles soumis à la doctrine « cloud au centre », les régions publiques des hyperscalers ne suffisent pas toujours ; les offres de cloud de confiance qualifiées ou en cours de qualification SecNumCloud, comme S3NS ou Bleu, ne proposent pas nécessairement le même catalogue de modèles – à vérifier au cas par cas. Les banques et assureurs, de leur côté, doivent inscrire tout nouveau service d’IA dans leur registre des prestataires TIC au titre de DORA.

Comment évaluer une bascule

  1. Prélevez une semaine de trafic réel par type de tâche et rejouez-le sur Haiku 5.5 à deux niveaux d’effort, en le notant par rapport à vos réponses de référence.
  2. Mesurez la répartition des tokens. Calculez la part des appels qui dépassent 100 000 tokens ; ce sont eux qu’il faut traiter en priorité par la recherche augmentée ou le cache.
  3. Ajoutez un chemin d’escalade fondé sur la confiance vers Sonnet ou Opus plutôt qu’une bascule brutale, et journalisez chaque escalade.
  4. Revérifiez l’appel d’outils et les sorties structurées sur vos propres schémas ; les gains aux benchmarks ne garantissent pas un comportement JSON identique.
  5. Épinglez la version du modèle dans la configuration et déployez derrière un feature flag, avec un tableau de bord coût et qualité.

Questions fréquentes

Combien coûte Claude Haiku 5.5 ?

Pour les prompts jusqu’à 100 000 tokens, Claude Haiku 5.5 coûte 0,10 $ par million de tokens en entrée et 0,50 $ par million de tokens en sortie. Au-delà de 100 000 tokens, le tarif passe à 0,50 $ en entrée et 2,50 $ en sortie. Les lectures de cache coûtent 0,01 $ par million de tokens dans la tranche basse. Haiku 4.5 coûtait 1 $ en entrée et 5 $ en sortie.

Où Claude Haiku 5.5 est-il disponible ?

Anthropic a lancé Haiku 5.5 le 7 octobre 2026 sur la Claude Platform sous l’identifiant claude-haiku-5-5, ainsi que sur Amazon Web Services, Google Cloud et Microsoft Azure. Les équipes en France doivent vérifier la disponibilité dans la région cloud précise qu’elles utilisent, par exemple Paris.

Claude Haiku 5.5 est-il meilleur que Haiku 4.5 ?

Selon les benchmarks publiés par Anthropic, oui, et nettement sur les tâches agentiques : 72,4 % contre 15,7 % sur OSWorld 2.1 et 39,2 % contre 0 % sur Terminal-Bench 4.0. Ces chiffres sont communiqués par l’éditeur ; les équipes doivent les valider sur leurs propres jeux d’évaluation avant de basculer.

Faut-il migrer nos charges de production de Sonnet vers Haiku 5.5 ?

Pas en bloc. L’approche la plus sûre est un routeur qui envoie les appels simples et volumineux, comme la classification, l’extraction et la synthèse, vers Haiku 5.5 et fait remonter les requêtes difficiles vers Sonnet ou Opus, en suivant qualité et coût par type de tâche.

Sources

Anthropic — Introducing Claude Haiku 5.5 (7 octobre 2026)
CNBC — Anthropic unveils a new, cheaper Haiku model (7 octobre 2026)
Yahoo Finance — Anthropic reveals Haiku 5.5 model as AI pricing war intensifies (7 octobre 2026)
VentureBeat — Anthropic launches Claude Haiku 5.5 with 90% API price reduction, matching GPT-6 Luna (7 octobre 2026)
SiliconANGLE — Anthropic releases Claude Haiku 5.5 small model and halves Sonnet 5.5 cache read prices (7 octobre 2026)