Daniel Reyes, YuSMP Group
Daniel Reyes Ingegnere Principale (AI/ML), YuSMP Group · Agenti AI e sistemi LLM applicati per team statunitensi ed europei
Illustrazione isometrica di un nucleo di modello IA luminoso con frammenti Mixture-of-Experts che si irradiano verso l’esterno, collegati a rack di server privati circostanti tramite flussi di dati sicuri su uno sfondo blu navy scuro

La risposta breve

Il 13 agosto 2026 DeepSeek ha portato il modello V4 Pro dall’anteprima alla disponibilità generale, distribuendo il checkpoint 0813 su app, interfaccia web e piattaforme API. Il modello è un sistema Mixture-of-Experts da 1,6 trilioni di parametri totali che attiva 49 miliardi di parametri per token, supporta una finestra di contesto di un milione di token e si classifica al terzo posto nell’Artificial Analysis Intelligence Index su 106 modelli. I pesi open-weight con licenza MIT consentono ai team di fare self-hosting senza royalty. Un significativo aumento di prezzo entra in vigore alle 16:00 UTC del 16 agosto: i costi di output salgono del 4,5x, da $0,87 a $3,96 per milione di token nelle ore peak.

Per i team che gestiscono già flussi di lavoro di sviluppo assistiti dall’IA, V4 Pro 0813 è il modello open-weight agentivo per il coding più capace disponibile oggi. L’urgenza è data dalla scadenza dei prezzi: i team che vogliono effettuare proiezioni di costo prima di impegnarsi devono agire entro la fine del 15 agosto.

Cosa ha effettivamente rilasciato DeepSeek

Il rilascio GA porta tre modifiche sostanziali rispetto alla build di anteprima. In primo luogo, DeepSeek segnala “capacità agentive significativamente potenziate”: l’abilità del modello di usare strumenti, eseguire codice in modo autonomo e completare flussi di lavoro a più fasi senza intervento umano. In secondo luogo, i livelli di sforzo di ragionamento sono stati espansi a tre impostazioni (basso, alto, massimo), consentendo agli sviluppatori di calibrare il budget computazionale alla complessità del task, invece di scegliere tra on/off. In terzo luogo, l’API supporta ora il formato OpenAI Responses API nativamente, con integrazione Codex integrata.

Quest’ultimo punto ha conseguenze pratiche per i team già in produzione. Le codebase esistenti che chiamano l’SDK OpenAI possono reindirizzare le richieste a DeepSeek V4 Pro cambiando solo il base URL e la chiave API: nessun rifattorizzazione strutturale di prompt, definizioni di strumenti o loop agentivi richiesta. I metodi di chiamata sono invariati rispetto all’anteprima, quindi qualsiasi integrazione già attiva in staging continua a funzionare.

L’architettura del modello rimane la stessa annunciata ad aprile: 1,6 trilioni di parametri totali con un design Mixture-of-Experts che attiva solo 49 miliardi di parametri durante l’inferenza. La finestra di contesto è di un milione di token (circa 1.500 pagine di testo). La lunghezza massima dell’output è di 384.000 token. Il modello supporta modalità con e senza ragionamento, solo input/output testuale — nessun input multimodale.

Quanto è capace?

Nell’Artificial Analysis Intelligence Index — una valutazione indipendente che copre ragionamento, coding, seguire istruzioni e task a più fasi — V4 Pro 0813 ottiene 53 su 100, collocandosi al terzo posto su 106 modelli valutati. Questo è nettamente al di sopra della mediana degli open-weight pari a 27 e competitivo con i sistemi proprietari di punta.

Sui benchmark agentivi pubblicati da DeepSeek: Terminal Bench 2.1 (task agentivi a lungo orizzonte) ha segnato 87,9; DeepSWE (problem-solving nell’ingegneria del software) ha segnato 62,7; NL2Repo (generazione di codice a livello di repository da linguaggio naturale) ha segnato 61,5. Queste cifre sono auto-dichiarate. Al 13 agosto 2026 nessun valutatore terzo indipendente ha pubblicato una replica del checkpoint 0813 preciso: trattare i dati del vendor come indicativi ma non confermati.

La velocità si attesta a 80,8 token al secondo sull’infrastruttura di Artificial Analysis, al di sopra della mediana di mercato di 66,3. Uno sconto del 97% sugli hit in cache si applica ai prefissi di prompt ripetuti — rilevante per i team che eseguono inferenza batch su prompt simili o pipeline RAG con contesto condiviso.

L’aumento di prezzo che non si può ignorare

Il segnale operativo più importante del rilascio GA è la ristrutturazione dei prezzi che entra in vigore alle 16:00 UTC del 16 agosto 2026. Tariffe attuali flat: $0,435 per milione di token in input su cache miss, $0,003625 per milione su cache hit, e $0,87 per milione di token in output. Tariffe peak post-modifica: $1,32 per milione di token in input e $3,96 per milione di token in output — un aumento del 4,5x sull’output. I prezzi off-peak sono fissati a metà del prezzo peak, premiando i team che possono pianificare workload batch nelle finestre fuori orario di punta.

Per contestualizzare, alle tariffe attuali V4 Pro è circa 57 volte più economico sull’output rispetto a Claude Opus 4 a listino. Dopo il 16 agosto il divario si restringe, ma il modello rimane sostanzialmente più economico della maggior parte delle API proprietarie chiuse nelle ore off-peak. Lo sconto sugli hit in cache rimane invariato ed è la leva principale per il controllo dei costi sui workload con query ripetute.

I team che non hanno ancora eseguito un audit mensile dei token dovrebbero farlo prima della fine del 15 agosto. Il conto post-aumento per un workload agentivo ad alto volume — loop SWE-agent, pipeline RAG, automazione della code review — può essere significativamente più elevato rispetto alle proiezioni attuali basate sui prezzi pre-GA.

Cosa significa per i team italiani

Con lo status GA diventano concrete alcune decisioni specificamente rilevanti per il contesto italiano.

API vs. self-hosting — GDPR e sovranità dei dati. Le chiamate API all’infrastruttura DeepSeek (Cina) attivano la valutazione dei trasferimenti GDPR Art. 44+ (paese terzo senza decisione di adeguatezza). Il Garante per la protezione dei dati personali ha già interrotto temporaneamente ChatGPT nel 2023 per questioni analoghe: le aziende italiane che trattano dati personali devono valutare con attenzione l’hosting API offshore. Il self-hosting dei pesi MIT su infrastruttura UE — ad esempio OVHcloud, Hetzner, oppure data center italiani certificati — mantiene l’inferenza all’interno del perimetro GDPR e riduce il rischio regolatorio in modo strutturale. Per i team che sviluppano livelli di integrazione GenAI su misura, un’architettura model-agnostic che astrae il provider consente di passare da API a self-hosted senza riscrivere il codice applicativo.

PNRR e trasformazione digitale. Il Piano Nazionale di Ripresa e Resilienza finanzia progetti di trasformazione digitale e adozione dell’IA nelle PA e nelle PMI italiane. I team che sviluppano soluzioni per bandi PNRR devono rispettare le linee guida AgID (Agenzia per l’Italia Digitale) su interoperabilità e residenza dei dati. Un modello open-weight con licenza MIT, eseguito su cloud certificato, è generalmente più allineato con questi requisiti rispetto a un’API proprietaria di terze parti con infrastruttura fuori UE. La licenza MIT elimina anche il vincolo royalty: il costo totale di ownership su infrastruttura propria è prevedibile e non soggetto a variazioni unilaterali del vendor.

PMI italiane e adozione dell’IA. Il tessuto industriale italiano — manifattura, moda, agroalimentare, fintech — è in fase di adozione precoce degli strumenti di AI coding. La compatibilità API OpenAI di V4 Pro abbassa la barriera di valutazione per i team già integrati con SDK OpenAI: il cambio richiede solo base URL e chiave API. L’aumento di prezzo del 16 agosto (output: $0,87 → $3,96/M token) corrisponde a circa €0,80 → €3,64/M token al cambio attuale. La pianificazione dei workload batch nelle ore off-peak riduce i costi della metà.

AI Act UE e classificazione. V4 Pro è un modello di IA per uso generale (GPAI). Gli obblighi AI Act UE per i GPAI si applicano ai provider di tali modelli, non necessariamente ai deployer. Tuttavia, se il vostro prodotto utilizza V4 Pro in un’applicazione ad alto rischio ai sensi dell’Allegato III — selezione del personale, credit scoring, infrastrutture critiche — si è soggetti agli obblighi come deployer. Il self-hosting non trasferisce gli obblighi di livello provider; cambia quale parte è responsabile per quale strato.

Come valutarlo questo trimestre

Il percorso strutturato: esegui V4 Pro 0813 attraverso il tuo harness di valutazione esistente, rispetto alla distribuzione specifica di task che i tuoi agenti gestiscono — non rispetto ai prompt generici delle classifiche pubbliche. Misura il tasso di successo dei task, il conteggio di token in output per task (i modelli prolissi sono più costosi in scala), il tempo totale di esecuzione per flusso di lavoro e il costo mensile stimato alle tariffe post-16-agosto. Confronta con il tuo modello attuale, non con i benchmark.

Per i team senza un harness di valutazione, il minimo pratico è: scegli cinque task rappresentativi, esegui ciascuno 10 volte su entrambi i modelli, valuta gli output alla cieca e calcola il costo per successo valutato ai prezzi post-aumento. Quel campione di 50 osservazioni vale più di qualsiasi posizione in classifica per prevedere le prestazioni sulla tua codebase.

Mantieni la tua integrazione model-agnostic. V4 Pro è la migliore opzione open-weight oggi; quella posizione cambierà. Il team che ha costruito un livello di routing passerà a un modello migliore il trimestre prossimo senza un rebuild.

Domande frequenti

Cos’è DeepSeek V4 Pro 0813 e quando è diventato GA?

DeepSeek V4 Pro 0813 è il checkpoint in disponibilità generale del modello di punta di DeepSeek, rilasciato ufficialmente il 13 agosto 2026 sull’app, sull’interfaccia web e tramite API. Il modello era in anteprima dalla presentazione della serie V4 nell’aprile 2026. I metodi di chiamata sono invariati rispetto all’anteprima: le integrazioni esistenti continuano a funzionare senza modifiche al codice.

I pesi open-weight sono ancora con licenza MIT?

Sì. La serie V4 è stata rilasciata con pesi sotto licenza MIT che consentono il self-hosting e l’uso commerciale senza royalty. Il checkpoint GA 0813 mantiene tale licenza. I team dovrebbero verificare la portata esatta con il proprio consulente legale per ambienti regolamentati, in particolare tenendo conto degli obblighi cinesi sulla residenza dei dati che potrebbero applicarsi all’origine del modello, ma la licenza in sé è genuinamente permissiva.

Come si confronta V4 Pro 0813 con altri modelli di frontiera per il coding agentivo?

Secondo Artificial Analysis, V4 Pro 0813 si classifica al terzo posto su 106 modelli nell’Intelligence Index, nettamente al di sopra della mediana degli open-weight. Sui benchmark agentivi pubblicati da DeepSeek: Terminal Bench 2.1 ha segnato 87,9, DeepSWE ha segnato 62,7, NL2Repo ha segnato 61,5. La replica indipendente da terzi del checkpoint 0813 era ancora in attesa al 13 agosto 2026: trattare le cifre del vendor in modo conservativo finché non corroborate.

Qual è l’aumento di prezzo del 16 agosto e come dovrebbero pianificarsi i team?

Alle 16:00 UTC del 16 agosto 2026 DeepSeek introduce la fatturazione peak/off-peak. Il prezzo di output in peak sale da $0,87 a $3,96 per milione di token — un aumento del 4,5x. I prezzi off-peak sono fissati a metà del prezzo peak. Gli sconti per cache hit rimangono elevati (97% di sconto). I team dovrebbero verificare i volumi mensili di token, calcolare il conto post-aumento e decidere se spostare i workload batch nelle ore off-peak o valutare il self-hosting tramite i pesi con licenza MIT.

Cosa significa la compatibilità nativa con l’API OpenAI Responses per i team?

Qualsiasi codebase che già chiama l’SDK OpenAI può instradare le richieste a DeepSeek V4 Pro cambiando solo il base URL e la chiave API, senza rifattorizzazione strutturale dei prompt. Questo abbassa notevolmente il costo di valutazione: i team possono testare DeepSeek in A/B rispetto ai provider di modelli esistenti senza modificare il livello agentivo o di tooling.

Fonti: Documentazione API DeepSeek — api-docs.deepseek.com (note di rilascio ufficiali, 13 agosto 2026); Artificial Analysis — DeepSeek V4 Pro 0813: benchmark e prezzi; Quartz / QZ — DeepSeek lancia ufficialmente il modello AI V4-Pro in agosto 2026 (13 agosto 2026).