Daniel Reyes, YuSMP Group
Daniel Reyes Principal Engineer, IA/ML, YuSMP Group · sistemi agentici e di retrieval in produzione per team negli Stati Uniti e nell’UE
Un piccolo microchip luminoso su una scrivania scura proietta fasci di luce blu e ambra verso alte pile di documenti cartacei, a illustrare un’elaborazione IA rapida, economica e su grandi volumi

Il lancio in sintesi

Il 7 ottobre 2026 Anthropic ha rilasciato Claude Haiku 5.5, il livello piccolo e veloce della famiglia Claude 5.5, tagliando del 90% il prezzo di listino rispetto a Haiku 4.5 per le richieste sotto i 100.000 token. Considerando le dimensioni reali delle richieste e il consumo di token, Anthropic stima che i carichi di lavoro reali costino circa il 75% in meno.

Il modello è disponibile con il nome API claude-haiku-5-5 su Claude Platform, AWS, Google Cloud e Microsoft Azure. Completa la generazione 5.5, avviata con Opus 5.5 il 22 settembre e Sonnet 5.5 il 28 settembre.

Per i team che già lavorano con i modelli Claude di Anthropic, l’effetto pratico è che attività finora affidate a Sonnet per motivi di qualità potrebbero ora stare su Haiku, e pipeline ad alto volume troppo costose per un LLM diventano sostenibili.

Quanto costa Claude Haiku 5.5?

Haiku 5.5 introduce un prezzo a due fasce in base alla lunghezza del prompt. Le richieste fino a 100.000 token costano 0,10 $ per milione di token in input e 0,50 $ per milione di token in output. Oltre questa soglia la tariffa sale a 0,50 $ e 2,50 $, comunque la metà di quanto costava Haiku 4.5. Il prompt caching segue la stessa suddivisione, con letture dalla cache a 0,01 $ per milione di token nella fascia inferiore.

Secondo VentureBeat, circa il 90% delle richieste rientra nella fascia più economica. È coerente con ciò che vediamo in produzione: la maggior parte delle chiamate di classificazione, estrazione e routing è breve, mentre le chiamate a contesto lungo si concentrano in pochi flussi ricchi di documenti. Il prezzo base coincide esattamente con quello di GPT-6 Luna di OpenAI; il sovrapprezzo per il contesto lungo di Luna scatta però più tardi, a 272.000 token, un dettaglio che conta se la vostra pipeline invia spesso documenti voluminosi.

Anthropic ha inoltre dimezzato il costo delle letture dalla cache di Sonnet 5.5, da 0,20 $ a 0,10 $ per milione di token. Secondo le stime di SiliconANGLE, questo riduce di circa il 20% i carichi agentici tipici, che a ogni turno rileggono lo stesso prompt di sistema e le stesse definizioni degli strumenti.

Quanto è migliore di Haiku 4.5?

Stando ai risultati pubblicati da Anthropic, il divario è ampio, soprattutto sui compiti agentici. Haiku 5.5 ottiene il 72,4% sui compiti di computer use di OSWorld 2.1 contro il 15,7% di Haiku 4.5, e il 39,2% su Terminal-Bench 4.0, dove il predecessore si fermava a zero. Sul benchmark di lavoro intellettuale GDPval-AA totalizza 1.620 contro 735.

Le testimonianze dei clienti vanno nella stessa direzione. Asana ha misurato una latenza per attività inferiore di oltre il 30% e un’inferenza fino a 2,5 volte più veloce; Box riporta punteggi superiori di 11 punti rispetto a Haiku 4.5 con circa metà della latenza. Il modello eredita anche il livello di effort regolabile dei modelli 5.5 più grandi, così i team possono bilanciare latenza e accuratezza a ogni chiamata.

Considerate questi numeri un’ipotesi di partenza. Sono dichiarati dal produttore, diversi dipendono dal livello di effort usato e Anthropic non ha pubblicato il throughput in token al secondo. L’unico benchmark che conta è il vostro set di valutazione.

Perché Anthropic taglia i prezzi proprio ora?

Perché il prezzo dei modelli piccoli è diventato un fronte competitivo. Yahoo Finance inquadra il lancio in una guerra dei prezzi dell’IA sempre più accesa: le grandi aziende spingono per bollette di inferenza più basse e testano sempre più spesso modelli open-weight di laboratori statunitensi e cinesi. Allineandosi al prezzo base di GPT-6 Luna, Anthropic elimina l’argomento più semplice per cambiare fornitore solo per ragioni di costo.

Anche la tempistica è coerente con la preparazione dell’attesa quotazione in borsa di Anthropic. Tre aggiornamenti di modello in 15 giorni, ciascuno più economico del precedente, indicano che l’azienda vuole conquistare i carichi ad alto volume, non solo il traffico premium di ragionamento.

Cosa significa per i team software negli Stati Uniti e nell’UE

Il routing dei modelli merita una revisione. Molti sistemi in produzione inviano tutto a un modello di fascia media perché quello piccolo falliva sui casi limite. Con un prezzo di listino ridotto del 90% e un uso degli strumenti molto più solido, un router che manda le chiamate semplici a Haiku e scala quelle difficili a Sonnet o Opus può ridurre nettamente la spesa per gli LLM senza un calo di qualità visibile. Il risparmio si concretizza solo se misurate tassi di escalation e modalità di errore per tipo di attività.

Nuovi casi d’uso superano la soglia di convenienza. A 0,10 $ per milione di token in input, etichettare ogni ticket di assistenza, riassumere ogni trascrizione di chiamata o pre-analizzare ogni documento caricato diventa abbastanza economico da farlo di default. Anche i pattern a sub-agenti, in cui un orchestratore distribuisce decine di piccole chiamate, diventano molto meno costosi.

La soglia dei 100.000 token è un parametro architetturale. Oltre i 100.000 token ogni token costa cinque volte di più. Un retrieval che invia solo i passaggi rilevanti, insieme a un caching aggressivo del contesto stabile, mantiene la maggior parte delle chiamate nella fascia economica. Riversare interi repository o fascicoli contrattuali nella finestra di contesto ha ora un chiaro segnale di prezzo contro.

Approvvigionamento e residenza dei dati restano invariati. Poiché Haiku 5.5 è disponibile fin dal primo giorno su AWS, Google Cloud e Azure, i team europei possono continuare a usare la propria regione cloud, l’accordo sul trattamento dei dati (DPA) e la fatturazione esistenti. Prima di pianificare una migrazione verificate che la regione che usate offra il modello, e mantenete il pinning della versione del modello, così che un cambio silenzioso di alias non alteri il comportamento di flussi rilevanti ai fini del GDPR.

Cosa cambia per il mercato italiano?

Il tessuto produttivo italiano è fatto in larga parte di PMI, dove un progetto di IA generativa si regge o cade sul costo per pratica gestita: smistamento delle email e delle PEC in ingresso, controllo di DDT e fatture, classificazione dei ticket di assistenza. A prezzi di Haiku 4.5 molti di questi casi restavano al palo dopo il pilota; con un listino ridotto a un decimo il conto torna, anche perché l’italiano consuma in media più token dell’inglese a parità di testo. Il consiglio pratico è riprendere i progetti fermi per budget e ricalcolarli con i nuovi prezzi, misurando la qualità sui documenti reali in italiano.

Il prezzo più basso non cambia gli obblighi. Il trattamento di dati personali resta soggetto al GDPR, e il Garante per la protezione dei dati personali si è già mostrato tra le autorità europee più attive sui servizi di IA generativa: informative, basi giuridiche e valutazioni d’impatto vanno preparate prima del rilascio, non dopo. Per la pubblica amministrazione contano anche i requisiti di qualificazione dei servizi cloud dell’Agenzia per la Cybersicurezza Nazionale (ACN), mentre banche e assicurazioni devono registrare ogni nuovo servizio di IA nel registro dei fornitori ICT previsto da DORA. Prima di instradare dati verso Haiku 5.5, verificate che il modello sia effettivamente disponibile nella regione cloud UE che usate.

Come valutare il passaggio

  1. Prendete una settimana di traffico reale per tipo di attività e riproducetela su Haiku 5.5 con due livelli di effort, valutandola rispetto alle vostre risposte di riferimento.
  2. Misurate il mix di token. Calcolate quale quota di chiamate supera i 100.000 token: sono quelle da sistemare per prime con retrieval o caching.
  3. Aggiungete un percorso di escalation basato sulla confidenza verso Sonnet o Opus invece di uno switch netto, e registrate ogni escalation.
  4. Ricontrollate tool calling e output strutturati sui vostri schemi: i progressi nei benchmark non garantiscono un comportamento JSON identico.
  5. Fissate la versione del modello nella configurazione e rilasciate dietro un feature flag, con una dashboard di costi e qualità.

Domande frequenti

Quanto costa Claude Haiku 5.5?

Per i prompt fino a 100.000 token, Claude Haiku 5.5 costa 0,10 $ per milione di token in input e 0,50 $ per milione di token in output. Oltre i 100.000 token il prezzo sale a 0,50 $ in input e 2,50 $ in output. Le letture dalla cache costano 0,01 $ per milione di token nella fascia inferiore. Haiku 4.5 costava 1 $ in input e 5 $ in output.

Dove è disponibile Claude Haiku 5.5?

Anthropic ha rilasciato Haiku 5.5 il 7 ottobre 2026 su Claude Platform con l’ID modello claude-haiku-5-5, oltre che su Amazon Web Services, Google Cloud e Microsoft Azure. I team in Italia dovrebbero verificare la disponibilità nella specifica regione cloud che utilizzano, per esempio Milano.

Claude Haiku 5.5 è migliore di Haiku 4.5?

Secondo i benchmark pubblicati da Anthropic sì, e con ampio margine sui compiti agentici: 72,4% contro 15,7% su OSWorld 2.1 e 39,2% contro 0% su Terminal-Bench 4.0. Sono dati dichiarati dal produttore: prima di cambiare modello, i team dovrebbero verificarli sui propri set di valutazione.

Conviene spostare i carichi di produzione da Sonnet a Haiku 5.5?

Non in blocco. L’approccio più sicuro è un router che invia le chiamate semplici e ad alto volume, come classificazione, estrazione e sintesi, a Haiku 5.5 e scala le richieste difficili a Sonnet o Opus, monitorando qualità e costi per tipo di attività.

Fonti

Anthropic — Introducing Claude Haiku 5.5 (7 ottobre 2026)
CNBC — Anthropic unveils a new, cheaper Haiku model (7 ottobre 2026)
Yahoo Finance — Anthropic reveals Haiku 5.5 model as AI pricing war intensifies (7 ottobre 2026)
VentureBeat — Anthropic launches Claude Haiku 5.5 with 90% API price reduction, matching GPT-6 Luna (7 ottobre 2026)
SiliconANGLE — Anthropic releases Claude Haiku 5.5 small model and halves Sonnet 5.5 cache read prices (7 ottobre 2026)