Der Launch in Kürze
Am 7. Oktober 2026 hat Anthropic Claude Haiku 5.5 veröffentlicht, die kleine und schnelle Stufe der Claude-5.5-Familie, und den Listenpreis für Anfragen unter 100.000 Tokens gegenüber Haiku 4.5 um 90 % gesenkt. Rechnet man reale Anfragegrößen und Tokenverbrauch ein, schätzt Anthropic die Kosten realer Workloads auf rund 75 % weniger.
Das Modell ist unter dem API-Namen claude-haiku-5-5 auf der Claude Platform, bei AWS, Google Cloud und Microsoft Azure verfügbar. Es schließt die 5.5-Generation ab, die am 22. September mit Opus 5.5 und am 28. September mit Sonnet 5.5 begann.
Für Teams, die bereits mit Anthropics Claude-Modellen arbeiten, heißt das konkret: Aufgaben, die bisher aus Qualitätsgründen an Sonnet gingen, passen jetzt womöglich auf Haiku, und Pipelines mit hohem Volumen, die sich mit einem LLM bislang nicht rechneten, werden wirtschaftlich.
Was kostet Claude Haiku 5.5?
Haiku 5.5 führt einen zweistufigen Preis nach Prompt-Länge ein. Anfragen bis 100.000 Tokens kosten 0,10 $ pro Million Input-Tokens und 0,50 $ pro Million Output-Tokens. Oberhalb dieser Schwelle steigt der Tarif auf 0,50 $ und 2,50 $ – immer noch die Hälfte dessen, was Haiku 4.5 kostete. Prompt Caching folgt derselben Aufteilung, Cache-Lesezugriffe kosten in der unteren Stufe 0,01 $ pro Million Tokens.
Laut VentureBeat fallen rund 90 % der Anfragen in die günstigere Stufe. Das deckt sich mit unserer Erfahrung aus dem Produktivbetrieb: Die meisten Aufrufe für Klassifikation, Extraktion und Routing sind kurz, Long-Context-Aufrufe ballen sich in wenigen dokumentenlastigen Abläufen. Der Basispreis entspricht genau dem von OpenAIs GPT-6 Luna; dessen Long-Context-Aufschlag greift allerdings erst ab 272.000 Tokens, was zählt, wenn Ihre Pipeline regelmäßig große Dokumente verschickt.
Zusätzlich hat Anthropic die Cache-Lesezugriffe bei Sonnet 5.5 von 0,20 $ auf 0,10 $ pro Million Tokens halbiert. SiliconANGLE schätzt, dass das typische agentische Workloads, die in jeder Runde denselben System-Prompt und dieselben Tool-Definitionen erneut lesen, um etwa 20 % verbilligt.
Wie viel besser ist es als Haiku 4.5?
Nach den von Anthropic veröffentlichten Ergebnissen ist der Abstand groß, vor allem bei agentischen Aufgaben. Haiku 5.5 erreicht 72,4 % bei den Computer-Use-Aufgaben von OSWorld 2.1 gegenüber 15,7 % für Haiku 4.5 und 39,2 % bei Terminal-Bench 4.0, wo der Vorgänger null Punkte erzielte. Im Wissensarbeits-Benchmark GDPval-AA kommt es auf 1.620 gegenüber 735.
Kundenberichte weisen in dieselbe Richtung. Asana hat über 30 % geringere Aufgabenlatenz und bis zu 2,5-fach schnellere Inferenz gemessen; Box meldet Werte 11 Punkte über Haiku 4.5 bei etwa halber Latenz. Das Modell erhält zudem die einstellbare Effort-Stufe der größeren 5.5-Modelle, sodass Teams pro Aufruf zwischen Latenz und Genauigkeit abwägen können.
Betrachten Sie diese Zahlen als Ausgangshypothese. Es sind Herstellerangaben, mehrere hängen von der gewählten Effort-Stufe ab, und einen Durchsatz in Tokens pro Sekunde hat Anthropic nicht veröffentlicht. Maßgeblich ist allein Ihr eigenes Evaluationsset.
Warum senkt Anthropic gerade jetzt die Preise?
Weil die Preise kleiner Modelle zur Wettbewerbsfront geworden sind. Yahoo Finance ordnet den Launch in einen sich verschärfenden KI-Preiskampf ein: Unternehmenskunden drängen auf niedrigere Inferenzrechnungen und testen zunehmend Open-Weight-Modelle aus den USA und China als Alternative. Mit dem Basispreis von GPT-6 Luna fällt das einfachste Argument weg, allein der Kosten wegen den Anbieter zu wechseln.
Auch das Timing passt zur Vorbereitung des erwarteten Börsengangs von Anthropic. Drei Modell-Updates in 15 Tagen, jedes günstiger als sein Vorgänger, zeigen: Das Unternehmen will Workloads mit hohem Volumen gewinnen, nicht nur den Premium-Reasoning-Traffic.
Was es für Softwareteams in den USA und der EU bedeutet
Das Modell-Routing verdient einen neuen Blick. Viele Produktivsysteme schicken alles an ein mittleres Modell, weil die kleine Stufe an Randfällen scheiterte. Mit 90 % niedrigerem Listenpreis und deutlich stärkerer Tool-Nutzung kann ein Router, der einfache Aufrufe an Haiku und schwierige an Sonnet oder Opus weiterleitet, die LLM-Ausgaben spürbar senken, ohne sichtbaren Qualitätsverlust. Die Ersparnis entsteht aber nur, wenn Sie Eskalationsraten und Fehlerbilder je Aufgabentyp messen.
Neue Anwendungsfälle werden rentabel. Bei 0,10 $ pro Million Input-Tokens wird es günstig genug, standardmäßig jedes Support-Ticket zu verschlagworten, jedes Gesprächsprotokoll zusammenzufassen oder jeden Dokumenten-Upload vorzuprüfen. Auch Subagenten-Muster, bei denen ein Orchestrator Dutzende kleiner Aufrufe verteilt, werden erheblich billiger.
Die 100.000-Token-Schwelle ist eine Architekturgröße. Prompts über 100.000 Tokens kosten pro Token das Fünffache. Retrieval, das nur die relevanten Abschnitte schickt, und konsequentes Caching des stabilen Kontexts halten die meisten Aufrufe in der günstigen Stufe. Ganze Repositories oder Vertragskonvolute ins Kontextfenster zu kippen, hat jetzt ein klares Preissignal gegen sich.
Beschaffung und Datenresidenz bleiben gleich. Da Haiku 5.5 vom ersten Tag an bei AWS, Google Cloud und Azure verfügbar ist, können EU-Teams ihre bestehende Cloud-Region, ihren Auftragsverarbeitungsvertrag und ihre Abrechnung weiter nutzen. Prüfen Sie vor einer Migration, ob die konkrete Region das Modell führt, und behalten Sie das Pinning der Modellversion bei, damit eine stille Alias-Änderung das Verhalten DSGVO-relevanter Abläufe nicht verschiebt.
Was bedeutet das für den DACH-Markt?
Im Mittelstand scheitern viele KI-Projekte weniger an der Technik als am Business Case: Dokumentenklassifikation, Rechnungs- und Belegprüfung oder die Vorqualifizierung von Service-Tickets rechneten sich bei Haiku-4.5-Preisen oft nur knapp. Mit einem Zehntel des Listenpreises verschiebt sich diese Rechnung – gerade für deutschsprachige Texte, die im Schnitt mehr Tokens verbrauchen als englische. Wir empfehlen, bestehende Pilotprojekte, die am Budget hängen geblieben sind, mit den neuen Preisen neu zu kalkulieren.
Regulatorisch ändert sich durch den günstigeren Tarif nichts, die Pflichten bleiben dieselben: Personenbezogene Daten verlangen eine Rechtsgrundlage nach DSGVO und einen Auftragsverarbeitungsvertrag mit dem Cloud-Anbieter, und für Banken, Versicherer und andere von der BaFin beaufsichtigte Finanzunternehmen gehört ein neues Modell bzw. ein neuer KI-Dienst in das Informationsregister für IKT-Drittdienstleister nach DORA. Wer Haiku 5.5 über einen bereits vertraglich eingebundenen Hyperscaler bezieht, statt einen neuen Anbieter aufzunehmen, hält diesen Aufwand gering. Prüfen Sie dennoch vorab, ob das Modell in Ihrer EU-Region tatsächlich bereitsteht, bevor Sie Daten dorthin routen.
So prüfen Sie einen Wechsel
- Nehmen Sie eine Woche realen Traffic je Aufgabentyp und spielen Sie ihn auf zwei Effort-Stufen gegen Haiku 5.5 ab, bewertet gegen Ihre bestehenden Referenzantworten.
- Messen Sie den Token-Mix. Ermitteln Sie, welcher Anteil der Aufrufe über 100.000 Tokens liegt; genau diese sollten Sie zuerst per Retrieval oder Caching entschärfen.
- Bauen Sie einen konfidenzbasierten Eskalationspfad zu Sonnet oder Opus statt eines harten Umschaltens ein und protokollieren Sie jede Eskalation.
- Prüfen Sie Tool-Calling und strukturierte Ausgaben mit Ihren eigenen Schemas erneut; Benchmark-Gewinne garantieren kein identisches JSON-Verhalten.
- Pinnen Sie die Modellversion in der Konfiguration und rollen Sie hinter einem Feature-Flag mit Kosten- und Qualitäts-Dashboard aus.
Häufige Fragen
Was kostet Claude Haiku 5.5?
Für Prompts bis 100.000 Tokens kostet Claude Haiku 5.5 0,10 $ pro Million Input-Tokens und 0,50 $ pro Million Output-Tokens. Oberhalb von 100.000 Tokens liegt der Preis bei 0,50 $ Input und 2,50 $ Output. Cache-Lesezugriffe kosten in der unteren Stufe 0,01 $ pro Million Tokens. Haiku 4.5 kostete 1 $ Input und 5 $ Output.
Wo ist Claude Haiku 5.5 verfügbar?
Anthropic hat Haiku 5.5 am 7. Oktober 2026 auf der Claude Platform unter der Modell-ID claude-haiku-5-5 sowie bei Amazon Web Services, Google Cloud und Microsoft Azure veröffentlicht. Teams im DACH-Raum sollten die Verfügbarkeit in genau der Cloud-Region prüfen, die sie nutzen, etwa in Frankfurt.
Ist Claude Haiku 5.5 besser als Haiku 4.5?
Laut den von Anthropic veröffentlichten Benchmarks ja, bei agentischen Aufgaben sogar deutlich: 72,4 % gegenüber 15,7 % bei OSWorld 2.1 und 39,2 % gegenüber 0 % bei Terminal-Bench 4.0. Es handelt sich um Herstellerangaben; vor einem Wechsel sollten Teams auf eigenen Evaluationsdaten testen.
Sollten wir Produktiv-Workloads von Sonnet auf Haiku 5.5 verlagern?
Nicht pauschal. Sicherer ist ein Router, der einfache Aufrufe mit hohem Volumen wie Klassifikation, Extraktion und Zusammenfassung an Haiku 5.5 schickt und schwierige Anfragen an Sonnet oder Opus eskaliert, wobei Qualität und Kosten je Aufgabentyp gemessen werden.
Quellen
Anthropic — Introducing Claude Haiku 5.5 (7. Oktober 2026)
CNBC — Anthropic unveils a new, cheaper Haiku model (7. Oktober 2026)
Yahoo Finance — Anthropic reveals Haiku 5.5 model as AI pricing war intensifies (7. Oktober 2026)
VentureBeat — Anthropic launches Claude Haiku 5.5 with 90% API price reduction, matching GPT-6 Luna (7. Oktober 2026)
SiliconANGLE — Anthropic releases Claude Haiku 5.5 small model and halves Sonnet 5.5 cache read prices (7. Oktober 2026)