Quanto costa DeepSeek V4.1 Flash per milione di token
DeepSeek V4.1 Flash costa $0,15 per milione di token di input cache-miss fuori dall'orario di punta e $0,30 durante l'orario di punta. Un token di input memorizzato nella cache costa $0,003 fuori dall'orario di punta, che è 50 volte inferiore al tasso di cache-miss di Flash stesso (derivato).
Flash è arrivato intorno al 10 settembre 2026 e appare nella documentazione ufficiale come DeepSeek-Flash. Il modello di punta DeepSeek-V4-Pro-0813 è generalmente disponibile dal 13 agosto 2026.
Ogni cifra di seguito è in USD per milione di token, prelevata da api-docs.deepseek.com e confermata a settembre 2026.
| Modello e finestra | Input, cache hit | Input, cache miss | Output |
|---|---|---|---|
| DeepSeek-V4-Pro-0813, fuori dall'orario di punta | $0,022 | $0,66 | $1,98 |
| DeepSeek-V4-Pro-0813, orario di punta | $0,044 | $1,32 | $3,96 |
| DeepSeek-V4.1-Flash, fuori dall'orario di punta | $0,003 | $0,15 | Non pubblicato |
| DeepSeek-V4.1-Flash, orario di punta | $0,006 | $0,30 | Non pubblicato |
DeepSeek non ha pubblicato un prezzo di output per V4.1 Flash che possa essere confermato sulla pagina ufficiale. Se ne vedi uno citato altrove, consideralo non verificato finché non appare nella tabella ufficiale.
DeepSeek è insolito in un secondo modo che conta di più per i fondatori rispetto al numero di token: non offre alcun programma di crediti per startup. Questa lacuna è coperta di seguito, ed è il motivo per cui AI Perks tiene traccia dei fornitori che ne gestiscono uno.

Perché DeepSeek addebita due prezzi diversi per lo stesso token
DeepSeek è l'unico importante fornitore di modelli che fattura per orario del giorno. Le ore di punta sono dalle 01:00 alle 04:00 e dalle 06:00 alle 10:00 UTC nei giorni feriali, e tutto ciò che è al di fuori di queste finestre costa esattamente la metà.
Leggi questo elenco di finestre due volte, perché c'è una lacuna nel mezzo. Il tratto dalle 04:00 alle 06:00 UTC si trova tra i due blocchi di punta ed è fatturato alla tariffa fuori dall'orario di punta. Non è un unico blocco continuo di nove ore di punta.
Derivato dalle finestre pubblicate: la punta copre sette ore al giorno, solo nei giorni feriali, ovvero 35 ore su 168 in una settimana. Circa il 79% del calendario è già fuori dall'orario di punta.
Ciò riformula il problema. Non stai cercando di trovare la finestra economica, stai cercando di evitare quella costosa. Tre carichi di lavoro in cui ciò è quasi gratuito da fare:
- Job batch notturni. Un job programmato alle 08:00 UTC rientra nell'orario di punta. Spostarlo alle 12:00 UTC dimezza la fattura e non cambia nient'altro.
- Esecuzioni di valutazione e regressione. Questi non hanno utenti in attesa, quindi appartengono fuori dai blocchi di punta per impostazione predefinita.
- Passaggi di embedding e re-indicizzazione. Le grandi operazioni di input una tantum sono la singola cosa più sensibile all'orario di punta che la maggior parte dei team esegue.
Il traffico interattivo è la parte che non puoi spostare e dovrebbe essere prezzato alle tariffe di punta in qualsiasi previsione che costruisci.
Il Cache Hit è il Moltiplicatore Più Grande
Su DeepSeek-V4-Pro, un token di input memorizzato nella cache costa $0,022 per milione contro $0,66 per un miss. Si tratta di una differenza di 30 volte (derivata dalla tabella sopra), e sovrasta il 2x ottenuto dalla tempistica.
I due moltiplicatori si sommano, e questa somma è l'intera storia del profilo di costo di DeepSeek. Un token di input cache-miss in orario di punta a $1,32 contro un token cache-hit fuori dall'orario di punta a $0,022 è uno spread di 60 volte sullo stesso modello (derivato).
Su V4.1 Flash, il rapporto cache è ancora più ampio: $0,15 per un miss contro $0,003 per un hit è 50 volte (derivato).
Ciò che questo significa in pratica è che la struttura del prompt batte la scelta del modello. Passare da V4-Pro a Flash riduce l'input cache-miss di 4,4 volte (derivato, $0,66 contro $0,15). Far funzionare la cache su V4-Pro la riduce di 30 volte. Il modello più economico è la leva più piccola.
I cache hit provengono da un prefisso stabile, quindi le regole pratiche sono noiose ed efficaci: mantieni il prompt di sistema byte-identico tra le chiamate, metti le definizioni degli strumenti e il contesto recuperato prima di qualsiasi cosa specifica dell'utente, e non interpolare mai un timestamp o un ID di sessione vicino alla cima di un prompt.

I Nomi degli Endpoint Ritirati da DeepSeek V4.1 Flash
DeepSeek-V4.1-Flash ha ritirato i nomi dei modelli deepseek-v4-flash e deepseek-v4-flash-vision-exp. Il codice che invia ancora una di queste stringhe fallirà.
| Nome del modello ritirato | Stato |
|---|---|
deepseek-v4-flash | Ritirato con V4.1 Flash |
deepseek-v4-flash-vision-exp | Ritirato con V4.1 Flash |
Questo è stato un cambiamento discreto piuttosto che una deprecazione di rilievo, che è esattamente ciò che lo rende costoso. La stringa del modello è solitamente la linea meno rivista in un'integrazione AI: si trova in una variabile d'ambiente, un file di configurazione, un template Terraform o un wrapper SDK fornito, e nessuno la tocca tra una release e l'altra.
Il problema più ampio è la lunga coda di contenuti. Tutorial, video su YouTube, risposte nei forum e campioni di codice generati prima di settembre 2026 fanno ancora riferimento ai vecchi nomi, e nessuno di essi verrà corretto. Un assistente che ha imparato da quelle pagine continuerà a suggerirli.
Se esegui DeepSeek in produzione, cerca nel tuo repository entrambe le stringhe, quindi controlla separatamente la configurazione della tua infrastruttura e qualsiasi gestore di segreti. Un nome di modello impostato sei mesi fa in una variabile di deployment non apparirà in una ricerca di codice.
Cosa è cambiato rispetto alla precedente guida sui prezzi di DeepSeek
Tre cose hanno invalidato parti di ogni pagina sui prezzi di DeepSeek scritta prima di metà agosto 2026: la divisione tra orario di punta e fuori dall'orario di punta, la divisione tra V4-Pro e Flash, e i nomi degli endpoint ritirati.
| Data | Release o modifica | Fiducia |
|---|---|---|
| 24 aprile 2026 | Anteprima V4-Pro e V4-Flash: contesto da 1 milione di token, fino a 384K di output, modalità pensante e non pensante commutabili | Media |
| 31 luglio 2026 | DeepSeek-V4-Flash-0731, release stabile della linea Flash | Media |
| 13 agosto 2026 | Disponibilità generale di DeepSeek-V4-Pro-0813 | Alta |
| 16 agosto 2026 | Introduzione dei prezzi per orario di punta e fuori dall'orario di punta | Media |
| Intorno al 10 settembre 2026 | DeepSeek-V4.1-Flash, ritirati i vecchi nomi degli endpoint Flash | Alta |
La cifra storica degna di nota è l'ultimo prezzo Flash conosciuto prima della modifica del 16 agosto: $0,14 per milione di input cache-miss e $0,28 per milione di output. Questo è il numero che la maggior parte delle tabelle comparative di terze parti mostra ancora. Non sono i prezzi attuali e precedono completamente il moltiplicatore dell'orario di punta, quindi qualsiasi previsione basata su di esso sottostima un carico di lavoro fortemente orientato all'orario di punta di circa 2 volte (derivato: $0,14 rispetto all'attuale tasso di cache-miss di punta di $0,30 è 2,1 volte).
Un singolo prezzo di input fisso per DeepSeek ora è privo di significato senza due qualificatori allegati: quale lato della cache e quale lato dell'orologio.

DeepSeek non ha un livello API gratuito né un programma di crediti per startup
L'app di chat DeepSeek è gratuita. L'API non lo è e non esiste un livello gratuito dichiarato sulla pagina dei prezzi ufficiale. DeepSeek inoltre non gestisce alcun programma di crediti dedicato per startup.
Le affermazioni secondo cui i nuovi account API ricevono crediti gratuiti circolano ampiamente e sono riportate in modo incoerente. Non sono confermate sulla pagina dei prezzi ufficiale, quindi pianifica il tuo primo mese di spesa come se non esistessero.
Gli host di terze parti sono un percorso parziale per aggirare questo problema, con la solita avvertenza che i loro prezzi e termini sono propri. Baseten elenca l'input di DeepSeek V4.1 Flash a $0,30 per milione e offre un credito di prova permanente di $30 per nuovo spazio di lavoro (verifica entrambi prima di effettuare il budget in base ad essi). OpenRouter, Together e Fireworks ospitano anche modelli DeepSeek, e la scelta tra di essi riguarda solitamente il routing, la regione e i limiti di velocità piuttosto che il prezzo principale.
La vera lacuna per i fondatori è strutturale. La maggior parte dei fornitori di modelli e infrastrutture su cui si basa una startup opera una qualche forma di programma di crediti, e gli importi e i termini attuali per ciascuno sono ciò che AI Perks tiene traccia. DeepSeek non ne gestisce nessuno, il che significa che DeepSeek è l'unica voce della tua fattura AI che paghi sempre in contanti.
Questa è l'argomentazione per trattarlo come il livello predefinito economico all'interno di uno stack piuttosto che l'intero stack. Instrada il lavoro ad alto volume, favorevole alla cache e fuori dall'orario di punta verso DeepSeek, e instrada il lavoro che richiede un ragionamento all'avanguardia a un fornitore il cui conto qualcun altro sta coprendo. AI Perks tiene traccia di $7,7 milioni in crediti attraverso 194 aziende, da cui proviene la seconda metà.
Vedi quali fornitori eseguono programmi di crediti su getaiperks.com →
Domande frequenti
Quanto costa DeepSeek V4.1 Flash?
DeepSeek V4.1 Flash costa $0,15 per milione di token di input cache-miss fuori dall'orario di punta e $0,30 durante l'orario di punta. L'input memorizzato nella cache costa $0,003 fuori dall'orario di punta e $0,006 durante l'orario di punta. DeepSeek non ha pubblicato un prezzo di output confermabile per Flash, quindi considera non verificata qualsiasi cifra di output che trovi altrove.
Quali sono gli orari di punta e fuori dall'orario di punta di DeepSeek?
Gli orari di punta sono dalle 01:00 alle 04:00 e dalle 06:00 alle 10:00 UTC nei giorni feriali. Tutto il resto, compresa la lacuna dalle 04:00 alle 06:00 UTC tra i due blocchi e tutto il traffico del fine settimana, è fuori dall'orario di punta a metà prezzo. Derivato da queste finestre, circa il 79% della settimana è già fuori dall'orario di punta.
Perché la mia chiamata API deepseek-v4-flash fallisce improvvisamente?
DeepSeek-V4.1-Flash ha ritirato i nomi dei modelli deepseek-v4-flash e deepseek-v4-flash-vision-exp. Qualsiasi codice, tutorial o configurazione che invia ancora tali stringhe fallirà. Controlla le tue variabili d'ambiente e la configurazione di deployment, nonché il tuo codice sorgente, poiché i nomi dei modelli spesso risiedono al di fuori del repository. La modifica è stata rilasciata discretamente intorno al 10 settembre 2026.
DeepSeek offre crediti API gratuiti ai nuovi account?
Non esiste un livello API gratuito dichiarato sulla pagina dei prezzi ufficiale di DeepSeek. I resoconti sui crediti per nuovi account sono incoerenti e non confermati, quindi pianifica come se non ne esistessero. L'app di chat è gratuita. Per i fornitori che pubblicano programmi di crediti, vedi AI Perks.
DeepSeek ha un programma di crediti per startup?
No. DeepSeek non gestisce alcun programma di crediti dedicato per startup, il che lo rende una delle poche principali API di modelli per cui paghi sempre in contanti. La maggior parte degli altri fornitori ne gestisce uno, e AI Perks tiene traccia di $7,7 milioni in crediti attraverso 194 aziende che li coprono.
DeepSeek V4-Pro o V4.1 Flash è più economico?
Flash è più economico su ogni confronto pubblicato: $0,15 contro $0,66 per milione di token di input cache-miss fuori dall'orario di punta, un divario di 4,4 volte (derivato). Ma sistemare la cache del tuo prompt su V4-Pro è una leva di 30 volte, quindi la struttura del prompt conta più della scelta del modello. Nessuno dei due ha un programma di crediti dietro, che è la parte che AI Perks tiene traccia per i fornitori che lo fanno.
DeepSeek è la voce più economica della tua bolletta AI. Copri le altre voci su getaiperks.com.