Daniel Reyes, YuSMP Group
Daniel Reyes Ingegnere principale (IA/ML), YuSMP Group · Agenti IA e sistemi LLM applicati per team statunitensi ed europei
Illustrazione isometrica di un nucleo IA luminoso che emette flussi di simboli di codice e nodi di attività agentici collegati da linee di dati ambrate e blu su sfondo blu navy scuro

In sintesi

Gemini 3.7 Flash è arrivato il 13 agosto 2026, ventitré giorni dopo 3.6 Flash, con un miglioramento DeepSWE di 16 punti e un prezzo introduttivo che dimezza il costo per token fino al 31 dicembre 2026. A 0,75 $ per milione di token in input e 3,75 $ per milione in output, è ora più economico di 3.6 Flash (1,50 $ / 7,50 $) e al contempo più performante sui benchmark di codice e automazione. Si classifica primo su FrontierCode 1.1 Main — davanti a Claude Sonnet 5 e GPT-5.6 Terra — e ottiene il 34% su GDP.pdf per la comprensione di documenti aziendali, rispetto al 28% di Sonnet 5 e al 24,7% di GPT-5.6 Terra.

La risposta corretta è la stessa di qualsiasi lancio di modello: instrada una quota del traffico reale degli agenti su 3.7 Flash, misura il costo per attività completata e il tasso di revisione sui tuoi carichi di lavoro reali, e promuovilo solo dove la qualità regge.

Cosa ha rilasciato Google

Gemini 3.7 Flash viene posizionato da Google come il suo “modello workhorse più intelligente” per coding e agenti, arrivando 23 giorni dopo 3.6 Flash. Il modello mantiene la stessa finestra di contesto da 1 milione di token e fino a 64.000 token in output del suo predecessore, ma offre una migliore accuratezza al primo tentativo, una maggiore aderenza alle istruzioni e una pianificazione multi-step più deliberata. Utilizza la stessa architettura transformer-based a mixture-of-experts di 3.6 Flash.

La disponibilità è ampia fin dal primo giorno. L'accesso per gli sviluppatori avviene tramite Gemini API e Google AI Studio; Android Studio include 3.7 Flash per l'assistenza al coding nell'IDE; Google Antigravity lo supporta per i flussi di lavoro agent-first; e la Gemini Enterprise Agent Platform offre alle aziende un percorso di distribuzione controllato. Per gli utenti consumer, è in distribuzione tramite Gemini Spark agli abbonati AI Pro e Ultra in oltre 160 paesi. I team che già costruiscono pipeline di agenti IA sullo stack Google possono accedervi oggi senza alcuna migrazione necessaria.

Google sottolinea che il modello “si adatta meglio agli ostacoli, chiarisce l'intento quando necessario e segue le istruzioni con maggiore fedeltà”, e “investe più impegno nella pianificazione multi-step e nelle chiamate agli strumenti.” Per i carichi di lavoro agentici, questi miglioramenti si traducono in meno chiamate agli strumenti fallite e meno cicli di revisione per attività completata — il che incide sui costi più della sola tariffa per token.

Risultati dei benchmark e concorrenza

I risultati dei benchmark sono degni di nota perché 3.7 Flash non migliora solo rispetto a 3.6 Flash — supera anche i modelli frontier attuali di Anthropic e OpenAI su più attività rilevanti per il coding.

DeepSWE v1.1 (ingegneria software a lungo orizzonte): 65,3% per 3.7 Flash contro 49,0% per 3.6 Flash — un guadagno di 16,3 punti. Questo benchmark misura la capacità di un agente di completare attività di ingegneria multi-step da zero, rendendolo uno degli indicatori più rilevanti per i team che costruiscono pipeline di coding automatizzato.

FrontierCode 1.1 Main (qualità del codice in produzione su 100 attività di programmazione in più linguaggi): 43,6% contro 34,4%. Google rivendica il primo posto in assoluto, davanti a Claude Sonnet 5 e GPT-5.6 Terra. Questo benchmark enfatizza la correttezza della compilazione, lo stile del codice e il completamento delle attività piuttosto che la sola predizione di token, quindi tende a tracciare le prestazioni di codice nel mondo reale più da vicino rispetto alle valutazioni di ragionamento generale.

GDP.pdf (comprensione di documenti aziendali): 34,0% contro 22,0% per 3.6 Flash, rispetto al 28% di Claude Sonnet 5 e al 24,7% di GPT-5.6 Terra. Per i team che costruiscono pipeline che elaborano contratti, documenti di conformità o report finanziari insieme al codice, questo conta.

AutomationBench (automazione dei flussi di lavoro aziendali): 30,4% contro 17,0% — un quasi raddoppio che riflette una migliore orchestrazione multi-strumento e pianificazione multi-step.

Arena.ai WebDev (attività di sviluppo web): Elo 1588 contro 1538 per 3.6 Flash.

Il divario competitivo è ridotto in termini percentuali assoluti, ma la direzione è coerente: 3.7 Flash è attualmente il modello focalizzato sul coding più forte nella fascia efficienza, da qualsiasi fornitore. Per i team che valutano le scelte dei modelli per i progetti di integrazione GenAI, è ora il benchmark di riferimento da testare.

Prezzi: costo dimezzato fino a fine 2026

Il cambiamento dei prezzi è la parte con il maggiore impatto operativo immediato. Gemini 3.7 Flash viene lanciato a 0,75 $ per milione di token in input e 3,75 $ per milione in output — esattamente la metà degli 1,50 $ in input e 7,50 $ in output di Gemini 3.6 Flash. Questa tariffa introduttiva è confermata fino al 31 dicembre 2026, dopodiché i prezzi salgono ai prezzi standard equivalenti a 3.6 Flash (1,50 $ in input / 7,50 $ in output) a partire dal 1° gennaio 2027.

Per i team con flotte di agenti ad alto volume, la matematica è semplice: se i tuoi carichi di lavoro mantengono la qualità su 3.7 Flash, eseguire gli stessi lavori ora costa la metà. Un team che spende 10.000 $ al mese in token agentici su 3.6 Flash potrebbe spenderne 5.000 su 3.7 Flash fino a fine anno, oppure mantenere la stessa spesa e raddoppiare il volume di lavoro. Questi risparmi si amplificano su ogni esecuzione dell'agente che si completa correttamente in meno token — e i miglioramenti dei benchmark suggeriscono che 3.7 Flash completa effettivamente le attività a lungo orizzonte in meno passaggi.

Il ripristino del prezzo standard a gennaio 2027 vale la pena notare nella pianificazione. I team che ottimizzano i loro stack di agenti attorno al prezzo introduttivo dovrebbero modellare l'impatto sui costi di gennaio fin d'ora, oppure pianificare una rivalutazione prima di fine anno, quando probabilmente sarà comunque disponibile il prossimo livello di efficienza, dato il ciclo di rilascio di tre settimane di Google questa estate.

Cosa significa per i team italiani

Per i team italiani che sviluppano funzionalità di prodotto con agenti IA — revisione automatizzata del codice, triage della pipeline CI, estrazione dati multi-step — Gemini 3.7 Flash è il primo significativo taglio di prezzo abbinato a un miglioramento della qualità nella fascia efficienza. La risposta giusta non è premere un interruttore, ma instradare una quota rappresentativa del traffico reale, misurare il costo per attività riuscita e il tasso di errore, e promuoverlo solo dove i numeri reggono. I carichi di lavoro agentici dipendono dalla tua codebase, dai tuoi strumenti e dal design dei prompt; i benchmark forniscono un punto di partenza, non una garanzia.

I team con obblighi di conformità hanno un passaggio aggiuntivo. Il modello è disponibile a livello globale tramite Gemini API e, per le aziende, tramite Vertex AI e la Gemini Enterprise Agent Platform. Ma la disponibilità non equivale alla conformità. I carichi di lavoro che elaborano dati personali — comuni nelle pipeline FinTech, HealthTech e legal-tech — richiedono che la specifica regione di elaborazione, i termini di gestione dei dati e le configurazioni di logging vengano verificati rispetto al GDPR, all'AI Act europeo e alle indicazioni del Garante prima che gli agenti accedano ai dati di produzione. Google offre endpoint nella regione UE tramite Vertex AI; verifica che il tuo deployment utilizzi uno di essi se la residenza dei dati è rilevante per te.

Lo schema più ampio da tenere d'occhio: Google ha rilasciato tre aggiornamenti Gemini di fascia efficienza in circa due mesi (3.5 Flash, 3.6 Flash, 3.7 Flash), mentre Gemini 3.5 Pro — la fascia flagship — è ancora in ritardo. Gemini 3.5 Pro è stato aggiornato l'ultima volta a febbraio 2026 e non è ancora uscito al momento della stesura di questo articolo, secondo Bloomberg. La gara competitiva al momento si svolge nell'efficienza e nel prezzo, non nelle capacità frontier. Per i responsabili tecnici che valutano la strategia sui modelli IA, questo significa che l'economia dei carichi di lavoro agentici ad alto volume sta migliorando più rapidamente dell'intelligenza grezza dei modelli, e lo stack vincente è quello che può cambiare il livello di routing a basso costo quando esce il prossimo aggiornamento.

Come valutarlo in questo trimestre

La finestra del prezzo introduttivo fino a fine anno rende questo il momento pratico per condurre una valutazione approfondita, non solo una stima approssimativa. Ecco il processo che evita il problema comune di cambiare tutto il traffico basandosi solo sui benchmark.

  1. Definisci il costo per attività riuscita sul tuo carico di lavoro. Misura token, dollari e tasso di completamento per attività agentiche reali, non il prezzo di listino per token o il punteggio del benchmark.
  2. Instrada una quota, non tutto il traffico. Invia il 10–20% delle esecuzioni reali degli agenti su 3.7 Flash e confronta con il tuo modello attuale fianco a fianco per una o due settimane.
  3. Monitora i tassi di revisione e fallimento. Un modello che completa le attività di coding con meno auto-correzioni risparmia interi cicli di generazione — monitora questa metrica accanto al costo dei token.
  4. Verifica regione e conformità per i carichi di lavoro italiani. Controlla l'endpoint di residenza dei dati, l'ambito del logging e gli obblighi dell'AI Act prima che gli agenti elaborino dati regolamentati. Verifica con il Garante per la protezione dei dati personali per i settori regolamentati.
  5. Limita la spesa per agente. Un modello più economico invita a un volume di esecuzioni più elevato. Imposta limiti di spesa per agente e per giorno prima di promuovere al traffico completo, in modo che i guadagni di efficienza non vengano annullati dalla crescita del volume.
  6. Modella il riadeguamento dei prezzi di gennaio. Le tariffe standard dal 1° gennaio 2027 equivalgono agli attuali prezzi di 3.6 Flash. Prevedi l'impatto ora per evitare sorprese di bilancio a fine anno.

Domande frequenti

Cos'è Gemini 3.7 Flash?

Gemini 3.7 Flash è l'ultimo modello di fascia efficienza di Google, rilasciato il 13 agosto 2026. È ottimizzato per lo sviluppo software, i flussi di lavoro degli agenti IA e la pianificazione multi-step, ed è disponibile tramite Gemini API, Google AI Studio, Android Studio, Google Antigravity, la Gemini Enterprise Agent Platform e Gemini Spark in oltre 160 paesi.

In cosa differisce Gemini 3.7 Flash da Gemini 3.6 Flash?

Gemini 3.7 Flash ottiene il 65,3% su DeepSWE, rispetto al 49,0% di 3.6 Flash, e il 43,6% su FrontierCode 1.1 qualità del codice in produzione, rispetto al 34,4%. L'automazione dei flussi di lavoro aziendali (AutomationBench) più che raddoppia al 30,4% dal 17,0%. Il prezzo è dimezzato durante il periodo introduttivo: 0,75 $ in input / 3,75 $ in output per milione di token, rispetto a 1,50 $ / 7,50 $ per 3.6 Flash.

Quanto costa Gemini 3.7 Flash?

0,75 $ per milione di token in input e 3,75 $ per milione in output fino al 31 dicembre 2026. Dal 1° gennaio 2027, i prezzi salgono a 1,50 $ in input e 7,50 $ in output per milione di token, pari agli attuali prezzi standard di 3.6 Flash.

Gemini 3.7 Flash è disponibile nell'UE?

Sì, tramite Gemini API, Gemini Enterprise Agent Platform e Vertex AI. I team italiani che trattano dati personali o regolamentati devono verificare l'endpoint di residenza dei dati, la configurazione del logging e la conformità al GDPR, alle indicazioni del Garante per la protezione dei dati personali e all'AI Act europeo prima di utilizzare il modello in pipeline agentiche di produzione.

Dovremmo passare gli agenti di codice da 3.6 Flash a 3.7 Flash adesso?

Testa prima di cambiare. Instrada il 10–20% del traffico reale degli agenti su 3.7 Flash, misura il costo per attività completata, il tasso di revisione e il tasso di successo, e promuovilo solo dove la qualità regge sulla tua codebase e sui tuoi strumenti specifici. I punteggi dei benchmark sono indicativi; i risparmi sono reali solo sui tuoi carichi di lavoro specifici.

Come si colloca Gemini 3.7 Flash rispetto alle normative italiane sulla privacy?

I team italiani che trattano dati personali — in ambito bancario, assicurativo, sanitario o della pubblica amministrazione — devono verificare la conformità al GDPR e alle indicazioni del Garante prima di indirizzare dati di produzione verso modelli cloud esterni. Google offre endpoint nella regione UE tramite Vertex AI: questo è il percorso corretto per chi ha obblighi di residenza dei dati in Italia o nell'Unione Europea. Il PNRR incentiva la transizione al cloud ma non esime dalla verifica di conformità.

Cosa significa il congelamento di Gemini 3.5 Pro per i team italiani?

Gemini 3.5 Pro — il modello di fascia flagship — non è stato aggiornato da febbraio 2026 e non è ancora uscito al momento della pubblicazione. La gara competitiva si svolge attualmente nell'efficienza e nel prezzo, non nelle capacità frontier. Per i responsabili tecnici italiani che valutano la strategia sui modelli IA, questo significa che l'economia dei carichi di lavoro agentici ad alto volume sta migliorando più rapidamente dell'intelligenza grezza dei modelli.

Fonti

Google — Introducing Gemini 3.7 Flash: our most intelligent workhorse model (fonte primaria), 13 agosto 2026
Bloomberg — Google Unveils Gemini 3.7 Flash Model as Gemini 3.5 Pro Delay Persists, 13 agosto 2026
Axios — Google’s Gemini 3.7 Flash arrives before Gemini 3.5 Pro, 13 agosto 2026
SiliconAngle — Google launches Gemini 3.7 Flash for coding, AI agent projects, 13 agosto 2026