Prezzi Flash DeepSeek V4.1 e Endpoint API V4 in pensione

Prezzi Flash DeepSeek V4.1, la divisione tra picco e fuori picco, cache hit versus miss e i nomi degli endpoint deepseek-v4-flash che ora falliscono.

DeepSeekDeepSeek V4LLM PricingAI APIAI Perks
Author Avatar
Andrew
AI Perks Team
12,681

Quick Answer

DeepSeek V4.1 Flash costa $0,15 per milione di token di input cache-miss fuori orario e $0,30 durante l'orario di punta, con input in cache a $0,003 fuori orario. DeepSeek è l'unico fornitore importante che applica tariffe in base all'ora del giorno e non offre alcun programma di credito di avvio, a differenza delle 194 aziende monitorate su getaiperks.com.

Quanto costa DeepSeek V4.1 Flash per milione di token

DeepSeek V4.1 Flash costa $0,15 per milione di token di input cache-miss fuori dall'orario di punta e $0,30 durante l'orario di punta. Un token di input memorizzato nella cache costa $0,003 fuori dall'orario di punta, che è 50 volte inferiore al tasso di cache-miss di Flash stesso (derivato).

Flash è arrivato intorno al 10 settembre 2026 e appare nella documentazione ufficiale come DeepSeek-Flash. Il modello di punta DeepSeek-V4-Pro-0813 è generalmente disponibile dal 13 agosto 2026.

Ogni cifra di seguito è in USD per milione di token, prelevata da api-docs.deepseek.com e confermata a settembre 2026.

Modello e finestraInput, cache hitInput, cache missOutput
DeepSeek-V4-Pro-0813, fuori dall'orario di punta$0,022$0,66$1,98
DeepSeek-V4-Pro-0813, orario di punta$0,044$1,32$3,96
DeepSeek-V4.1-Flash, fuori dall'orario di punta$0,003$0,15Non pubblicato
DeepSeek-V4.1-Flash, orario di punta$0,006$0,30Non pubblicato

DeepSeek non ha pubblicato un prezzo di output per V4.1 Flash che possa essere confermato sulla pagina ufficiale. Se ne vedi uno citato altrove, consideralo non verificato finché non appare nella tabella ufficiale.

DeepSeek è insolito in un secondo modo che conta di più per i fondatori rispetto al numero di token: non offre alcun programma di crediti per startup. Questa lacuna è coperta di seguito, ed è il motivo per cui AI Perks tiene traccia dei fornitori che ne gestiscono uno.


Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

Perché DeepSeek addebita due prezzi diversi per lo stesso token

DeepSeek è l'unico importante fornitore di modelli che fattura per orario del giorno. Le ore di punta sono dalle 01:00 alle 04:00 e dalle 06:00 alle 10:00 UTC nei giorni feriali, e tutto ciò che è al di fuori di queste finestre costa esattamente la metà.

Leggi questo elenco di finestre due volte, perché c'è una lacuna nel mezzo. Il tratto dalle 04:00 alle 06:00 UTC si trova tra i due blocchi di punta ed è fatturato alla tariffa fuori dall'orario di punta. Non è un unico blocco continuo di nove ore di punta.

Derivato dalle finestre pubblicate: la punta copre sette ore al giorno, solo nei giorni feriali, ovvero 35 ore su 168 in una settimana. Circa il 79% del calendario è già fuori dall'orario di punta.

Ciò riformula il problema. Non stai cercando di trovare la finestra economica, stai cercando di evitare quella costosa. Tre carichi di lavoro in cui ciò è quasi gratuito da fare:

  • Job batch notturni. Un job programmato alle 08:00 UTC rientra nell'orario di punta. Spostarlo alle 12:00 UTC dimezza la fattura e non cambia nient'altro.
  • Esecuzioni di valutazione e regressione. Questi non hanno utenti in attesa, quindi appartengono fuori dai blocchi di punta per impostazione predefinita.
  • Passaggi di embedding e re-indicizzazione. Le grandi operazioni di input una tantum sono la singola cosa più sensibile all'orario di punta che la maggior parte dei team esegue.

Il traffico interattivo è la parte che non puoi spostare e dovrebbe essere prezzato alle tariffe di punta in qualsiasi previsione che costruisci.


Il Cache Hit è il Moltiplicatore Più Grande

Su DeepSeek-V4-Pro, un token di input memorizzato nella cache costa $0,022 per milione contro $0,66 per un miss. Si tratta di una differenza di 30 volte (derivata dalla tabella sopra), e sovrasta il 2x ottenuto dalla tempistica.

I due moltiplicatori si sommano, e questa somma è l'intera storia del profilo di costo di DeepSeek. Un token di input cache-miss in orario di punta a $1,32 contro un token cache-hit fuori dall'orario di punta a $0,022 è uno spread di 60 volte sullo stesso modello (derivato).

Su V4.1 Flash, il rapporto cache è ancora più ampio: $0,15 per un miss contro $0,003 per un hit è 50 volte (derivato).

Ciò che questo significa in pratica è che la struttura del prompt batte la scelta del modello. Passare da V4-Pro a Flash riduce l'input cache-miss di 4,4 volte (derivato, $0,66 contro $0,15). Far funzionare la cache su V4-Pro la riduce di 30 volte. Il modello più economico è la leva più piccola.

I cache hit provengono da un prefisso stabile, quindi le regole pratiche sono noiose ed efficaci: mantieni il prompt di sistema byte-identico tra le chiamate, metti le definizioni degli strumenti e il contesto recuperato prima di qualsiasi cosa specifica dell'utente, e non interpolare mai un timestamp o un ID di sessione vicino alla cima di un prompt.


Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

I Nomi degli Endpoint Ritirati da DeepSeek V4.1 Flash

DeepSeek-V4.1-Flash ha ritirato i nomi dei modelli deepseek-v4-flash e deepseek-v4-flash-vision-exp. Il codice che invia ancora una di queste stringhe fallirà.

Nome del modello ritiratoStato
deepseek-v4-flashRitirato con V4.1 Flash
deepseek-v4-flash-vision-expRitirato con V4.1 Flash

Questo è stato un cambiamento discreto piuttosto che una deprecazione di rilievo, che è esattamente ciò che lo rende costoso. La stringa del modello è solitamente la linea meno rivista in un'integrazione AI: si trova in una variabile d'ambiente, un file di configurazione, un template Terraform o un wrapper SDK fornito, e nessuno la tocca tra una release e l'altra.

Il problema più ampio è la lunga coda di contenuti. Tutorial, video su YouTube, risposte nei forum e campioni di codice generati prima di settembre 2026 fanno ancora riferimento ai vecchi nomi, e nessuno di essi verrà corretto. Un assistente che ha imparato da quelle pagine continuerà a suggerirli.

Se esegui DeepSeek in produzione, cerca nel tuo repository entrambe le stringhe, quindi controlla separatamente la configurazione della tua infrastruttura e qualsiasi gestore di segreti. Un nome di modello impostato sei mesi fa in una variabile di deployment non apparirà in una ricerca di codice.


Cosa è cambiato rispetto alla precedente guida sui prezzi di DeepSeek

Tre cose hanno invalidato parti di ogni pagina sui prezzi di DeepSeek scritta prima di metà agosto 2026: la divisione tra orario di punta e fuori dall'orario di punta, la divisione tra V4-Pro e Flash, e i nomi degli endpoint ritirati.

DataRelease o modificaFiducia
24 aprile 2026Anteprima V4-Pro e V4-Flash: contesto da 1 milione di token, fino a 384K di output, modalità pensante e non pensante commutabiliMedia
31 luglio 2026DeepSeek-V4-Flash-0731, release stabile della linea FlashMedia
13 agosto 2026Disponibilità generale di DeepSeek-V4-Pro-0813Alta
16 agosto 2026Introduzione dei prezzi per orario di punta e fuori dall'orario di puntaMedia
Intorno al 10 settembre 2026DeepSeek-V4.1-Flash, ritirati i vecchi nomi degli endpoint FlashAlta

La cifra storica degna di nota è l'ultimo prezzo Flash conosciuto prima della modifica del 16 agosto: $0,14 per milione di input cache-miss e $0,28 per milione di output. Questo è il numero che la maggior parte delle tabelle comparative di terze parti mostra ancora. Non sono i prezzi attuali e precedono completamente il moltiplicatore dell'orario di punta, quindi qualsiasi previsione basata su di esso sottostima un carico di lavoro fortemente orientato all'orario di punta di circa 2 volte (derivato: $0,14 rispetto all'attuale tasso di cache-miss di punta di $0,30 è 2,1 volte).

Un singolo prezzo di input fisso per DeepSeek ora è privo di significato senza due qualificatori allegati: quale lato della cache e quale lato dell'orologio.


Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

DeepSeek non ha un livello API gratuito né un programma di crediti per startup

L'app di chat DeepSeek è gratuita. L'API non lo è e non esiste un livello gratuito dichiarato sulla pagina dei prezzi ufficiale. DeepSeek inoltre non gestisce alcun programma di crediti dedicato per startup.

Le affermazioni secondo cui i nuovi account API ricevono crediti gratuiti circolano ampiamente e sono riportate in modo incoerente. Non sono confermate sulla pagina dei prezzi ufficiale, quindi pianifica il tuo primo mese di spesa come se non esistessero.

Gli host di terze parti sono un percorso parziale per aggirare questo problema, con la solita avvertenza che i loro prezzi e termini sono propri. Baseten elenca l'input di DeepSeek V4.1 Flash a $0,30 per milione e offre un credito di prova permanente di $30 per nuovo spazio di lavoro (verifica entrambi prima di effettuare il budget in base ad essi). OpenRouter, Together e Fireworks ospitano anche modelli DeepSeek, e la scelta tra di essi riguarda solitamente il routing, la regione e i limiti di velocità piuttosto che il prezzo principale.

La vera lacuna per i fondatori è strutturale. La maggior parte dei fornitori di modelli e infrastrutture su cui si basa una startup opera una qualche forma di programma di crediti, e gli importi e i termini attuali per ciascuno sono ciò che AI Perks tiene traccia. DeepSeek non ne gestisce nessuno, il che significa che DeepSeek è l'unica voce della tua fattura AI che paghi sempre in contanti.

Questa è l'argomentazione per trattarlo come il livello predefinito economico all'interno di uno stack piuttosto che l'intero stack. Instrada il lavoro ad alto volume, favorevole alla cache e fuori dall'orario di punta verso DeepSeek, e instrada il lavoro che richiede un ragionamento all'avanguardia a un fornitore il cui conto qualcun altro sta coprendo. AI Perks tiene traccia di $7,7 milioni in crediti attraverso 194 aziende, da cui proviene la seconda metà.

Vedi quali fornitori eseguono programmi di crediti su getaiperks.com →


Domande frequenti

Quanto costa DeepSeek V4.1 Flash?

DeepSeek V4.1 Flash costa $0,15 per milione di token di input cache-miss fuori dall'orario di punta e $0,30 durante l'orario di punta. L'input memorizzato nella cache costa $0,003 fuori dall'orario di punta e $0,006 durante l'orario di punta. DeepSeek non ha pubblicato un prezzo di output confermabile per Flash, quindi considera non verificata qualsiasi cifra di output che trovi altrove.

Quali sono gli orari di punta e fuori dall'orario di punta di DeepSeek?

Gli orari di punta sono dalle 01:00 alle 04:00 e dalle 06:00 alle 10:00 UTC nei giorni feriali. Tutto il resto, compresa la lacuna dalle 04:00 alle 06:00 UTC tra i due blocchi e tutto il traffico del fine settimana, è fuori dall'orario di punta a metà prezzo. Derivato da queste finestre, circa il 79% della settimana è già fuori dall'orario di punta.

Perché la mia chiamata API deepseek-v4-flash fallisce improvvisamente?

DeepSeek-V4.1-Flash ha ritirato i nomi dei modelli deepseek-v4-flash e deepseek-v4-flash-vision-exp. Qualsiasi codice, tutorial o configurazione che invia ancora tali stringhe fallirà. Controlla le tue variabili d'ambiente e la configurazione di deployment, nonché il tuo codice sorgente, poiché i nomi dei modelli spesso risiedono al di fuori del repository. La modifica è stata rilasciata discretamente intorno al 10 settembre 2026.

DeepSeek offre crediti API gratuiti ai nuovi account?

Non esiste un livello API gratuito dichiarato sulla pagina dei prezzi ufficiale di DeepSeek. I resoconti sui crediti per nuovi account sono incoerenti e non confermati, quindi pianifica come se non ne esistessero. L'app di chat è gratuita. Per i fornitori che pubblicano programmi di crediti, vedi AI Perks.

DeepSeek ha un programma di crediti per startup?

No. DeepSeek non gestisce alcun programma di crediti dedicato per startup, il che lo rende una delle poche principali API di modelli per cui paghi sempre in contanti. La maggior parte degli altri fornitori ne gestisce uno, e AI Perks tiene traccia di $7,7 milioni in crediti attraverso 194 aziende che li coprono.

DeepSeek V4-Pro o V4.1 Flash è più economico?

Flash è più economico su ogni confronto pubblicato: $0,15 contro $0,66 per milione di token di input cache-miss fuori dall'orario di punta, un divario di 4,4 volte (derivato). Ma sistemare la cache del tuo prompt su V4-Pro è una leva di 30 volte, quindi la struttura del prompt conta più della scelta del modello. Nessuno dei due ha un programma di crediti dietro, che è la parte che AI Perks tiene traccia per i fornitori che lo fanno.


Iscriviti su getaiperks.com →

DeepSeek è la voce più economica della tua bolletta AI. Copri le altre voci su getaiperks.com.

This content is for informational purposes only and may contain inaccuracies. Credit programs, amounts, and eligibility requirements change frequently. Always verify details directly with the provider.