DeepSeek Context Caching 2026: Lo Sconto 30x sull'Input

DeepSeek addebita 30 volte in meno per l'input memorizzato nella cache rispetto a un cache miss e dimezza ogni prezzo fuori dall'ora di punta. Le tariffe V4-Pro e V4.1-Flash, spiegate correttamente.

DeepSeekContext CachingLLM PricingAI API CostsAI Perks
Author Avatar
Andrew
AI Perks Team
10,100

Quick Answer

Un cache hit su DeepSeek-V4-Pro costa $0,022 per milione di token di input fuori orario di punta rispetto a $0,66 per un cache miss, uno sconto 30x sullo stesso modello. DeepSeek dimezza anche ogni prezzo al di fuori delle ore di punta, quindi un token in cache fuori orario di punta costa 60 volte meno di un cache miss in orario di punta. I crediti dai fornitori che gestiscono programmi per startup sono tracciati su getaiperks.com.

Quanto costa davvero un hit della cache di DeepSeek

Su DeepSeek-V4-Pro, un token di input servito dalla cache costa $0,022 per milione fuori picco rispetto a $0,66 per una cache miss. Si tratta di uno sconto di 30 volte per aver inviato lo stesso prefisso due volte.

La maggior parte delle pagine dei prezzi indica un numero di input e passa oltre. DeepSeek ne ha quattro, perché due moltiplicatori separati si applicano a ogni singola chiamata: se il prefisso ha colpito la cache e a che ora del giorno l'hai inviato.

Modello e finestraInput con cache hitInput con cache missOutput
DeepSeek-V4-Pro-0813, fuori picco$0,022$0,66$1,98
DeepSeek-V4-Pro-0813, picco$0,044$1,32$3,96
DeepSeek-V4.1-Flash, fuori picco$0,003$0,15non verificato
DeepSeek-V4.1-Flash, picco$0,006$0,30non verificato

Tutte le cifre sono in USD per milione di token, dalla documentazione ufficiale dell'API di settembre 2026. Il prezzo dell'output di V4.1-Flash non è verificato qui, quindi controlla la pagina ufficiale prima di pianificare il tuo budget.

Il rapporto Flash è ancora più ampio di quello del modello di punta: $0,003 rispetto a $0,15 è un divario di 50x (derivato dalle tariffe sopra). AI Perks tiene traccia di questo tipo di meccanismo del provider insieme ai programmi di credito che lo compensano.


Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

Picco e fuori picco: l'unico fornitore che addebita per ora

Gli orari di punta di DeepSeek sono dalle 01:00 alle 04:00 e dalle 06:00 alle 10:00 UTC nei giorni feriali. Tutto il resto, inclusi tutto il sabato e la domenica, viene fatturato esattamente a metà prezzo.

Nessun altro importante fornitore di modelli prezza in base all'ora del giorno, il che lo rende la leva più trascurata nel lavoro sui costi LLM. Nessuna guida di ottimizzazione scritta per OpenAI o Anthropic ha motivo di menzionarlo.

Derivato da quelle finestre: il picco è 7 ore al giorno su 5 giorni feriali, quindi 35 delle 168 ore della settimana. Circa il 79% del calendario è già fuori picco, quindi la maggior parte dei team ottiene lo sconto per caso e potrebbe ottenerne di più di proposito.

La tua posizione decide quanta parte della tua giornata lavorativa è esposta:

Posizione del teamFinestre di picco, ora localeEsposizione durante il giorno lavorativo
US Eastern (UTC-4)21:00-00:00, 02:00-06:00Nessuna, l'intera giornata lavorativa è fuori picco
US Pacific (UTC-7)18:00-21:00, 23:00-03:00Nessuna
Europa Centrale (UTC+2)03:00-06:00, 08:00-12:00Tutta la mattinata
India (UTC+5:30)06:30-09:30, 11:30-15:30La maggior parte della giornata lavorativa
Cina (UTC+8)09:00-12:00, 14:00-18:00Quasi tutta

Gli orari locali vengono convertiti dalle finestre UTC pubblicate con gli offset indicati, e l'ora legale li sposta di un'ora. Il modello non è un caso: le finestre di picco corrispondono alla giornata lavorativa cinese, quindi il traffico interattivo di un team statunitense finisce gratuitamente nella metà economica dell'orologio.


Impilare entrambi gli sconti: uno spread di 60x su un modello

Un token di input in cache fuori picco a $0,022 rispetto a un cache miss di picco a $1,32 è uno spread di 60x su un output identico dallo stesso modello.

Ecco come appare su un carico di lavoro di un agente realistico: un contesto di 200.000 token inviato 1.000 volte al giorno, ovvero 200 milioni di token di input giornalieri su V4-Pro.

ScenarioTariffa per 1 milioneCosto di input giornaliero
Picco, ogni chiamata è una cache miss$1,32$264,00
Fuori picco, ogni chiamata è una cache miss$0,66$132,00
Picco, ogni chiamata è un cache hit$0,044$8,80
Fuori picco, ogni chiamata è un cache hit$0,022$4,40

Tutte e quattro le righe sono derivate moltiplicando le tariffe pubblicate per 200. La differenza tra la prima e l'ultima riga è di circa $260 al giorno, o circa $95.000 all'anno, su un carico di lavoro che non cambia affatto.

Due cose seguono che la maggior parte delle analisi dei costi trascura:

Un modello di punta in cache batte un modello piccolo senza cache. L'input in cache V4-Pro a $0,022 fuori picco è circa 7 volte più economico dell'input senza cache V4.1-Flash a $0,15 (derivato). Retrocedere il modello per risparmiare denaro è la mossa sbagliata se il vero problema è una cache che non hai mai riscaldato.

L'output non viene mai memorizzato nella cache. A $1,98 fuori picco, un token di output costa circa 90 volte un token di input in cache (derivato). Una volta che la cache funziona, non hai più una fattura di input, ma una fattura di output, e ogni ulteriore risparmio deriva da risposte più brevi o budget di pensiero limitati. I team che finanziano quella fattura di output con crediti del provider possono confrontare ciò che è disponibile su getaiperks.com.


Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

Cosa è cambiato dalla nostra precedente guida ai prezzi di DeepSeek

Tre cose sono cambiate nel 2026: V4-Pro-0813 ha raggiunto la disponibilità generale il 13 agosto, i prezzi di picco e fuori picco hanno sostituito le tariffe fisse a metà agosto e V4.1-Flash è arrivato intorno al 10 settembre.

La nostra precedente pagina dei prezzi di DeepSeek riporta tariffe fisse per token senza componente oraria. Queste precedono la modifica e dovrebbero essere considerate storiche.

La cronologia, con il grado di attendibilità indicato onestamente:

  • 24 aprile 2026 (media attendibilità): Anteprima di V4-Pro e V4-Flash, con una finestra di contesto di 1 milione di token, fino a 384K token di output e modalità di pensiero e non pensiero commutabili.
  • 31 luglio 2026 (media attendibilità): DeepSeek-V4-Flash-0731, la versione stabile di Flash. L'ultimo prezzo noto prima della modifica era di $0,14 per milione di input con cache miss e $0,28 per milione di output, entrambi fissi. Solo storico.
  • 13 agosto 2026: Disponibilità generale di DeepSeek-V4-Pro-0813, l'attuale modello di ragionamento e agente di punta.
  • Intorno al 10 settembre 2026: DeepSeek-V4.1-Flash, elencato nella documentazione come "DeepSeek-Flash".

Se stai lavorando da un tutorial o da un modello di costo scritto prima dell'agosto 2026, ogni cifra di input in esso contenuta è errata in entrambe le direzioni: troppo alta per un cache hit, troppo bassa per un cache miss di picco.


La ridenominazione dell'endpoint che interrompe il vecchio codice

DeepSeek-V4.1-Flash ha ritirato silenziosamente i nomi dei modelli deepseek-v4-flash e deepseek-v4-flash-vision-exp. Le richieste che utilizzano ancora queste stringhe falliranno.

Questo è il tipo di cambiamento che emerge come un incidente di produzione piuttosto che un ticket di migrazione, poiché il nome del modello si trova solitamente in un file di configurazione che nessuno ha aperto da mesi. Vecchi esempi di codice, wrapper SDK e tutorial di terze parti fanno ancora riferimento ai nomi ritirati.

Vale la pena fare prima del prossimo deployment:

  • Esegui grep nell'intero repository per entrambe le stringhe ritirate, inclusa la configurazione dell'infrastruttura e i notebook.
  • Controlla eventuali SDK o framework di agenti inclusi che codificano un modello DeepSeek predefinito.
  • Conferma separatamente il percorso della visione, poiché anche l'endpoint sperimentale della visione è stato rinominato.
  • Esegui nuovamente il tuo modello di costo in seguito, poiché il sostituto si basa sul nuovo programma di picco e fuori picco.

Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

Piano gratuito e crediti DeepSeek: cosa è effettivamente vero

L'app di chat DeepSeek è gratuita. L'API non lo è e non esiste un piano gratuito indicato nella pagina dei prezzi ufficiale.

È qui che la maggior parte degli articoli sbaglia. Le affermazioni secondo cui i nuovi account API ricevono crediti gratuiti circolano ampiamente, sono segnalate in modo incoerente e non sono confermate sulla pagina dei prezzi ufficiale. Se hai bisogno di un saldo iniziale, presumibilmente lo pagherai.

Più importante per i fondatori: DeepSeek non gestisce alcun programma dedicato di crediti per startup. Non c'è domanda, nessun livello basato sulla fase, nessun percorso di partnership. Il basso prezzo per token è l'intera offerta, che è un vero gap se stai assemblando uno stack di crediti.

Quel gap è esattamente il motivo per cui la decisione di routing è importante. Molti provider offrono programmi per startup e AI Perks tiene traccia di 7,7 milioni di dollari in crediti per 194 aziende che li coprono. Il modello pratico è instradare il traffico ad alto volume e "cache-friendly" a DeepSeek a $0,022 per milione e spendere i crediti concessi sui provider più costosi, dove un token gratuito vale molto di più.


Acquistare DeepSeek da qualcun altro

Gli host di terze parti non replicano il programma di picco e fuori picco di DeepSeek, il che significa che possono praticare prezzi inferiori rispetto all'API first-party durante il picco e perdere pesantemente fuori picco.

Baseten elenca l'input DeepSeek V4.1 Flash a $0,30 per milione (media attendibilità, verifica prima di pianificare il tuo budget), e la cifra di output non è stata verificata in modo affidabile. Baseten offre anche un credito di prova permanente di $30 per nuovo spazio di lavoro.

Nota cosa equivale $0,30: è esattamente la tariffa di cache miss di picco di DeepSeek, e il doppio della tariffa fuori picco (derivato). Per un team statunitense o europeo il cui traffico rientra per lo più fuori picco comunque, una tariffa fissa di terze parti non è ovviamente un risparmio.

OpenRouter, Together e Fireworks ospitano anche modelli DeepSeek. Non stiamo citando i loro prezzi qui perché non li abbiamo verificati, e neanche tutto ciò che leggi dovrebbe farlo. Il compromesso qualitativo è comunque coerente:

  • API first-party: l'unico posto in cui si applica l'intero stack di cache hit e fuori picco, e il percorso più economico di gran lunga quando entrambi si attivano.
  • Host di terze parti: tariffe fisse, regioni diverse, fatturazione unificata e di solito nessuna esposizione al livello di cache hit di DeepSeek.
  • Aggregatori: utili per il failover, a un premio che dovresti misurare piuttosto che dare per scontato.

Prezza il tuo traffico contro entrambi, quindi confronta il risultato con i crediti disponibili su altri provider su getaiperks.com. Un token gratuito batte uno economico.


Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

Domande frequenti

Quanto costa meno un cache hit di DeepSeek?

Su DeepSeek-V4-Pro, un cache hit costa $0,022 per milione di token di input fuori picco rispetto a $0,66 per un cache miss, una differenza di 30 volte. Su V4.1-Flash il divario è ancora più ampio, $0,003 contro $0,15, una differenza di 50 volte (derivato). Le tariffe sono tratte dalla documentazione ufficiale dell'API di settembre 2026.

Quando sono gli orari di punta di DeepSeek?

Il picco è solo nei giorni feriali dalle 01:00 alle 04:00 e dalle 06:00 alle 10:00 UTC. Tutto il resto, inclusi entrambi i giorni del fine settimana, viene fatturato alla metà della tariffa di picco. Ciò si traduce in circa il 79% della settimana fuori picco (derivato), quindi i team con sede negli Stati Uniti ottengono lo sconto durante la loro intera giornata lavorativa senza cambiare nulla.

DeepSeek ha un piano API gratuito?

Nessun piano API gratuito è indicato nella pagina dei prezzi ufficiale. L'app di chat per i consumatori è gratuita, ma l'API è a pagamento dal primo token. Le segnalazioni di crediti gratuiti per nuovi account sono incoerenti e non confermate. I provider che concedono crediti sono tracciati su getaiperks.com.

DeepSeek offre crediti per startup?

DeepSeek non gestisce alcun programma dedicato di crediti per startup. Il basso prezzo per token è l'intera offerta. Per i fondatori che costruiscono uno stack di crediti, questo è un gap che vale la pena colmare altrove: AI Perks copre 7,7 milioni di dollari in crediti per 194 aziende dai provider che gestiscono programmi.

Perché la mia chiamata API DeepSeek ha smesso di funzionare?

La causa più probabile è il nome del modello. DeepSeek-V4.1-Flash ha ritirato i nomi degli endpoint deepseek-v4-flash e deepseek-v4-flash-vision-exp, e tutorial e file di configurazione obsoleti li fanno ancora riferimento. Esegui grep nel tuo repository per entrambe le stringhe, inclusi SDK e notebook inclusi, quindi ricontrolla il tuo modello di costo rispetto alle tariffe attuali.

Dovrei usare DeepSeek V4-Pro o V4.1-Flash?

Esegui i calcoli prima di presumere che Flash sia più economico. L'input in cache V4-Pro a $0,022 fuori picco è circa 7 volte più economico dell'input senza cache Flash a $0,15 (derivato), quindi un modello di punta ben memorizzato nella cache può battere completamente un modello piccolo senza cache sulla riga di input. Il volume di output, non la dimensione del modello, di solito decide la fattura.


Iscriviti su getaiperks.com →

Memorizza nella cache il prefisso, invia fuori picco e lascia che i crediti di qualcun altro coprano il resto.

This content is for informational purposes only and may contain inaccuracies. Credit programs, amounts, and eligibility requirements change frequently. Always verify details directly with the provider.