Daniel Reyes, YuSMP Group
Daniel Reyes Principal Engineer (IA/ML), YuSMP Group · Sistemi di IA e ML applicati per team di prodotto USA e UE
Illustrazione astratta di una curva dei costi in forte salita che supera una fila di quadranti indicatori su uno sfondo blu navy profondo, a rappresentare l'impennata della spesa per l'IA agentica

La risposta breve

L'IA agentica ha rotto il modello di budget per postazione. Uber ha esaurito l'intero budget IA 2026 in circa quattro mesi dopo aver distribuito Claude Code a circa 5.000 ingegneri, e il 2 luglio 2026 Anthropic ha risposto con nuovi strumenti di analisi e controllo dei costi per Claude Enterprise — dashboard che mostrano il costo per team e per utente, avvisi di soglia di spesa, permessi per modello e un'API Analytics. La lezione non è che uno strumento è costoso. È che gli agenti autonomi misurano i token, li consumano su una scala che la chat non ha mai raggiunto e rendono inaffidabili le vecchie previsioni finanziarie.

La soluzione non è un modello più economico né un budget più grande. È trattare la spesa per l'IA agentica come una disciplina di governance e ingegneria — tetti, attribuzione, instradamento dei modelli e limiti di sforzo messi in atto prima che gli agenti scalino, non dopo che arriva la fattura.

Cosa è successo davvero?

Due eventi, a pochi giorni di distanza, raccontano la stessa storia da estremi opposti. Prima lo shock di domanda: Uber ha distribuito Claude Code di Anthropic alla sua organizzazione di ingegneria a dicembre 2025, l'adozione è salita da circa un terzo degli ingegneri a febbraio a circa l'84% classificato come utenti di coding agentico a marzo, ed entro aprile l'azienda aveva speso l'intero budget IA 2026 — a quattro mesi dall'inizio dell'anno. Uber ha limitato l'uso degli strumenti IA da parte dei dipendenti il 2 giugno 2026, una mossa coperta da Bloomberg, TechCrunch, Forbes e Fortune. Il costo medio si attestava intorno ai 150–250 dollari per ingegnere al mese, ma i power user che orchestravano agenti in parallelo arrivavano a 500–2.000 dollari, e lo stesso responsabile tecnologico di Uber ha descritto di aver speso circa 1.200 dollari in una singola sessione di due ore.

Poi la risposta dal lato dell'offerta. Il 2 luglio 2026, Anthropic ha rilasciato nuovi strumenti di analisi e controllo dei costi per Claude Enterprise mirati esattamente a quel problema: una dashboard admin che mostra utilizzo e costo per gruppo e per utente, avvisi di soglia di spesa che scattano al 75% e al 90% di un limite, modelli predefiniti e permessi che stabiliscono con quale modello iniziano le conversazioni, visibilità della spesa per utente e un'API Analytics che esporta verso strumenti di observability come Datadog e CloudZero. Quando il vendor rilascia la governance della spesa nello stesso ciclo di notizie in cui un cliente di punta limita pubblicamente l'uso, il mercato ti sta dicendo dove sta il dolore. Se stai avviando lo sviluppo di agenti IA in produzione, la governance dei costi è ora parte della costruzione, non un ripensamento.

Perché le bollette agentiche si comportano così diversamente?

La causa profonda è un disallineamento del modello di prezzo. Il SaaS tradizionale è fatturato per postazione: prevedibile, lineare, facile da stimare. L'IA agentica è fatturata a token, e un agente autonomo consuma token su una curva completamente diversa. Una ricerca di GitHub pubblicata a maggio 2026 ha rilevato che un task di coding agentico può usare nell'ordine di 1.000 volte più token di una normale query a turno singolo, perché l'agente attinge un ampio contesto, chiama strumenti, ragiona su più passaggi e può continuare a girare a lungo dopo che una persona ha distolto lo sguardo. Un ingegnere che accetta suggerimenti di autocompletamento e un ingegnere che orchestra agenti in parallelo su un monorepo stanno agli estremi opposti di una forbice di 1.000× pur occupando la stessa riga in un foglio di calcolo per postazione.

Uber ha peggiorato la dinamica classificando gli ingegneri in classifiche interne in base all'uso di Claude Code — trasformando il consumo di token in un gioco di status. È un monito sugli incentivi, non solo sugli strumenti: premia le persone per bruciare token e lo faranno. Il punto più profondo è che la spesa degli agenti è variabile, guidata dal carico di lavoro e spesso invisibile finché non viene misurata. È esattamente la disciplina che i team di IA, ML & dati devono integrare fin dal primo giorno — strumentare dove vanno i token, per team, per progetto e per agente, così che il costo sia un segnale ingegneristico visibile anziché una sorpresa di fine trimestre.

È solo un problema di Uber?

No — Uber è semplicemente il dato più pubblico. Lo State of FinOps 2026 della FinOps Foundation ha riferito che la maggioranza delle aziende ha visto i costi dell'IA superare le proiezioni iniziali, e che la responsabilità della gestione della spesa per l'IA si è estesa da circa un terzo dei professionisti FinOps nel 2025 a quasi tutti nel 2026. Il SaaS Management Index 2026 di Zylo ha rilevato che la maggior parte dei responsabili IT ha incontrato addebiti inattesi dovuti al pricing IA a consumo. Axios ha riferito di un'azienda che ha speso mezzo miliardo di dollari in un solo mese dopo aver distribuito accessi IA senza alcun tetto d'uso. E a giugno 2026 il CEO di OpenAI ha dichiarato a CNBC che il costo era passato da un tema che quasi mai emergeva alla seconda preoccupazione più comune tra i clienti.

I numeri prospettici sono altrettanto netti. Le previsioni 2026 di Gartner avvertono che una quota significativa dei progetti di IA agentica sarà cancellata entro il 2027 per soli sforamenti di costo — non per fallimento tecnico, non per mancanza di valore, ma per bollette che hanno superato il business case. Quando quattro segnali diversi — un cliente di punta, il lancio di un prodotto da parte di un vendor, un'indagine di settore e una previsione di analisti — convergono sullo stesso problema nel giro di poche settimane, è uno spostamento strutturale, non un caso isolato.

Cosa significa per i team software USA & UE

Togliete i titoli e restano tre implicazioni. La prima è una correzione di previsione: qualsiasi budget che modella l'IA agentica come SaaS per postazione è già sbagliato. Il costo va modellato su token e carichi di lavoro, con un'ampia banda di varianza e un tetto rigido, perché la differenza tra un utente leggero e uno pesante non è 3× — può essere di tre ordini di grandezza. Finanza e ingegneria hanno bisogno di una visione condivisa di questa curva prima che gli agenti scalino, non dopo.

La seconda è che la governance è ora una funzionalità di ingegneria, non una casella di acquisto. I controlli che Anthropic ha appena rilasciato — tetti, avvisi di soglia, permessi per modello, attribuzione dei costi, un'API Analytics — sono le stesse primitive che i team cloud hanno costruito in un decennio di FinOps. I team che trattano la spesa degli agenti come una preoccupazione ingegneristica di primo piano, con attribuzione per progetto e per agente e modelli più economici instradati verso il lavoro di routine, faranno girare gli agenti su larga scala in modo sostenibile. I team che aggiungono i controlli dopo il primo shock passeranno il trimestre successivo in gestione dell'emergenza. Per i settori regolamentati questo si somma: in una FinTech o in un'azienda sanitaria, un accesso agenti non controllato non è solo un rischio di budget ma anche di governance dei dati, perché ogni chiamata autonoma tocca sistemi di cui il GDPR e le regole di settore vi ritengono responsabili.

La terza è una lezione build-versus-scale. Non serve l'impronta di 5.000 ingegneri di Uber per sbattere contro questo muro; un team di fascia media che dà a cinquanta ingegneri un accesso agenti non governato può bruciare un budget trimestrale altrettanto velocemente, in proporzione. Il vantaggio va ora ai team che sperimentano con le protezioni attive dal primo giorno — tetti, limiti di sforzo, attribuzione — e solo dopo scalano, anziché scalare prima e strumentare dopo la fattura.

Cosa fare questo trimestre

Ecco la versione operativa. Trattate l'episodio Uber e la risposta di Anthropic come conferma del mercato, poi mettete in atto le protezioni prima di scalare.

  1. Ponete tetti e avvisi a ogni livello. Impostate tetti di spesa a livello di organizzazione, team e utente, e attivate avvisi di soglia (75% / 90%) affinché gli sforamenti emergano in tempo reale, non a fine mese.
  2. Attribuite il costo per team, progetto e agente. Strumentate la spesa di token per vedere esattamente dove va. Non si può governare ciò che non si può attribuire; cablate il costo degli agenti nello stack di observability che già gestite.
  3. Instradate i modelli per task. Inviate il lavoro di routine a basso rischio verso modelli più economici e riservate i modelli premium ai problemi davvero difficili. I permessi per modello e i controlli di sforzo sono ora leve standard — usateli.
  4. Eliminate gli incentivi perversi. Non classificate le persone in base all'uso e non premiate il consumo di token. Misurate i risultati consegnati, non i token consumati.
  5. Modellate la varianza, non la media. Fate budget per un'ampia forbice tra utenti leggeri e pesanti, con un tetto rigido, invece di una singola cifra per postazione.
  6. Sperimentate con le protezioni, poi scalate. Dimostrate la curva dei costi su un pilota circoscritto con tetti e attribuzione attivi dal primo giorno, ed espandete solo quando i numeri si comportano bene.

Nulla di tutto questo è consulenza finanziaria o legale, e i vostri obblighi esatti dipendono dai vostri dati, dal settore e dalla giurisdizione. Ma il segnale strategico è difficile da ignorare: il settore dell'IA ha appena passato un ciclo di notizie ad ammettere che la spesa degli agenti è il nuovo problema difficile. Il vantaggio va ai team che trattano il costo come una disciplina ingegneristica — strumentato, con tetti e attribuito — mentre scalano, non dopo che arriva la fattura.

Domande frequenti

Perché le bollette dell'IA agentica sono molto più alte del previsto?

Perché gli agenti misurano i token, non le postazioni, e li consumano su una scala che gli strumenti di chat precedenti non hanno mai raggiunto. Una ricerca di GitHub di maggio 2026 ha rilevato che un task di coding agentico può usare nell'ordine di 1.000 volte più token di una query a turno singolo. In Uber il costo medio era di 150–250 dollari per ingegnere al mese, mentre i power user arrivavano a 500–2.000 dollari e il responsabile tecnologico ha riferito di aver speso circa 1.200 dollari in una singola sessione di due ore. Un budget per postazione non può prevedere questa forbice.

Cosa ha annunciato Anthropic per Claude Enterprise il 2 luglio 2026?

Nuovi strumenti di analisi e controllo dei costi: una dashboard che mostra utilizzo e costo per gruppo e per utente, metriche di Claude Code e un'API Analytics che esporta verso strumenti come Datadog e CloudZero; più modelli predefiniti e permessi, avvisi di soglia di spesa al 75% e 90%, visibilità della spesa per utente e un'API Admin, basandosi sui tetti di spesa e sui controlli di sforzo esistenti.

La spesa incontrollata per l'IA agentica è un problema di Claude o di tutto il settore?

Di tutto il settore. Lo State of FinOps 2026 ha rilevato che la maggior parte delle aziende ha superato le proiezioni sui costi dell'IA, e la responsabilità FinOps della spesa per l'IA è passata da circa un terzo dei professionisti a quasi tutti in un anno. A giugno 2026 il CEO di OpenAI ha dichiarato a CNBC che il costo era diventato la seconda preoccupazione più comune che sente, e Gartner avverte che una gran parte dei progetti di IA agentica sarà cancellata entro il 2027 per sforamenti di costo.

Un prezzo per token più basso non lo risolve?

No. I prezzi per token sono scesi nettamente — le analisi di settore stimano il costo combinato dei modelli di frontiera in calo di circa due terzi su base annua — ma l'adozione e i token per task crescono più velocemente di quanto scendano i prezzi unitari, così le bollette totali continuano a salire. È la governance, non l'attesa di modelli più economici, a mantenere l'IA agentica sostenibile su larga scala.

Come dovrebbe un team controllare la spesa per l'IA agentica prima di scalare?

Trattatela come una disciplina FinOps e ingegneristica: attivate tetti di spesa e avvisi di soglia a livello di org, team e utente; attribuite il costo per team, progetto e agente; instradate i modelli più economici verso il lavoro di routine e riservate i modelli premium ai task difficili; impostate limiti di sforzo e contesto; ed evitate incentivi che premiano il consumo di token. Costruite le protezioni prima di scalare, non dopo l'arrivo della fattura.

Fonti

Anthropic — New analytics and cost controls for Claude Enterprise (fonte primaria, 2 luglio 2026)
Bloomberg — Uber caps usage of AI tools like Claude Code to cut costs
TechCrunch — Uber caps employee AI spending after blowing through budget in four months
Forbes — Uber burns its 2026 AI budget in four months on Claude Code
Fortune — Uber's COO questions whether the AI spend is worth it