Puoi eseguire DeepSeek da solo?
Sì. Le release open-weight di DeepSeek sono scaricabili ed eseguibili sul tuo hardware, e Ollama è la via più breve per un'istanza locale funzionante. Il costo non è quasi mai il motivo per farlo.
Questa seconda frase è la parte che ogni altra guida tralascia. L'API ospitata da DeepSeek offre due sconti cumulabili, che insieme spingono il punto di pareggio dell'auto-hosting in un luogo che la maggior parte dei team non può raggiungere con GPU noleggiate.
L'auto-hosting di DeepSeek è una decisione di controllo: residenza dei dati, funzionamento offline, blocco delle versioni. Consideralo un piano di risparmio e i numeri qui sotto ti deluderanno.
I crediti per i modelli dei provider che li distribuiscono effettivamente sono tracciati su AI Perks.

Come eseguire DeepSeek con Ollama
Ollama scarica una copia quantizzata dei pesi, li mantiene sul disco locale ed espone un endpoint HTTP compatibile con OpenAI su localhost:11434, quindi il codice esistente può essere adattato con una modifica di una riga all'URL di base.
La sequenza di funzionamento è breve:
ollama pull <deepseek-tag>per scaricare i pesiollama run <deepseek-tag>per un prompt interattivo- Punta il tuo SDK su
http://localhost:11434/v1e passa una stringa non vuota come chiave API
Tre cose da controllare sulla pagina del modello prima di pianificare un prodotto basato su un tag:
Quale variante contiene effettivamente il tag. I pesi che stanno su un laptop e i pesi dietro l'endpoint ospitato di DeepSeek non sono spesso lo stesso modello. Le varianti distills e ridotte condividono un nome di famiglia e si comportano in modo diverso.
Quale quantizzazione hai scaricato. Una build a 4 bit dimezza la memoria rispetto a una build a 8 bit e non produce un output identico. Se fai benchmark localmente e distribuisci rispetto all'API, stai confrontando due sistemi diversi.
Il tuo soffitto di contesto reale. Localmente, il contesto è limitato dalla memoria che hai, non dal numero massimo indicato nell'annuncio. Un numero di contesto lungo da una release ospitata non si trasferisce sulla tua macchina.
Cosa deve battere l'auto-hosting
DeepSeek è l'unico importante fornitore di modelli che addebita in base all'ora del giorno. Le ore di punta sono dalle 01:00 alle 04:00 e dalle 06:00 alle 10:00 UTC nei giorni feriali, e tutto ciò che è al di fuori di queste finestre, compresi tutti i fine settimana, costa esattamente la metà.
Sopra l'orologio c'è uno sconto sulla cache molto più grande. Le tariffe pubblicate attuali, in USD per milione di token:
| Modello e tipo di token | Fuori punta | Punta |
|---|---|---|
| DeepSeek-V4-Pro input, cache hit | $0.022 | $0.044 |
| DeepSeek-V4-Pro input, cache miss | $0.66 | $1.32 |
| DeepSeek-V4-Pro output | $1.98 | $3.96 |
| DeepSeek-V4.1-Flash input, cache hit | $0.003 | $0.006 |
| DeepSeek-V4.1-Flash input, cache miss | $0.15 | $0.30 |
Un cache hit su V4-Pro è circa 30 volte più economico di un cache miss. Combinando questo con l'orologio, un token di input fuori punta nella cache a $0.022 si posiziona 60 volte al di sotto di un cache miss di punta a $1.32, sullo stesso modello. Nulla nella tua infrastruttura ha una leva di 60 volte al suo interno. La ripartizione completa della finestra è nella nostra guida ai prezzi off-peak di DeepSeek.

La matematica del punto di pareggio sull'esecuzione locale di DeepSeek
Derivato dalle tariffe pubblicate sopra: per battere l'API off-peak di DeepSeek sull'output, il tuo hardware deve produrre un milione di token di output all'ora per meno di $1.98, tutto compreso.
Questa inquadratura è più utile di qualsiasi listino prezzi di GPU, perché vale qualunque cosa tu stia noleggiando. Prendi la produttività che puoi sostenere effettivamente e confrontala con quanto costa lo stesso volume sull'API:
| Produttività di output sostenuta | Costo API fuori punta | Costo API di punta |
|---|---|---|
| 100.000 token/ora | $0.20 | $0.40 |
| 500.000 token/ora | $0.99 | $1.98 |
| 1.000.000 token/ora | $1.98 | $3.96 |
| 5.000.000 token/ora | $9.90 | $19.80 |
| 10.000.000 token/ora | $19.80 | $39.60 |
Cifre derivate dalle tariffe per token pubblicate da DeepSeek, non citate da DeepSeek.
Leggi attentamente la riga centrale. Una macchina che serve un milione di token di output ogni ora, 24 ore su 24, 7 giorni su 7, sta spostando circa $1.425 al mese di spesa API off-peak (derivato: $1.98 x 24 ore x 30 giorni = $1.425,60). Il tuo acceleratore, l'host, lo storage, la larghezza di banda e l'ingegnere che lo tiene in funzione devono rientrare tutti in questo.
L'input è peggio. Se il tuo carico di lavoro è dominato da un prompt di sistema riutilizzato, l'API addebita $0.022 per milione di token memorizzati nella cache fuori punta. L'auto-hosting deve battere due centesimi per milione. Non lo farà.
La conclusione onesta: l'auto-hosting di DeepSeek ripaga a volumi veramente grandi, costanti e ad alta utilizzazione, e quasi da nessun'altra parte. Per tutto ciò che sta al di sotto di questa linea, la mossa più economica è l'API più i crediti gratuiti di altri provider, che è quello per cui getaiperks.com esiste per mappare.
Quando eseguire DeepSeek da solo è la chiamata giusta
L'auto-hosting di DeepSeek vince sul controllo, non sul prezzo. Cinque situazioni lo giustificano indipendentemente dalla tabella di pareggio.
Residenza dei dati e conformità. Se i prompt contengono materiale che non può lasciare la tua giurisdizione o la tua rete, nessuno sconto per token rende l'opzione ospitata praticabile. Questo è il singolo motivo legittimo più comune.
Funzionamento air-gapped e offline. Implementazioni sul campo, strutture sicure e connettività inaffidabile richiedono inferenze che non dipendono da un endpoint raggiungibile.
Blocco delle versioni. I pesi locali non cambiano sotto di te. I modelli ospitati sì, e DeepSeek lo ha dimostrato.
Immunità all'orologio. Una curva di costo auto-ospitata è piatta. La curva dell'API oscilla di 2 volte tra martedì mattina e sabato sera, il che rende la pianificazione della capacità rispetto ad essa imbarazzante per qualsiasi cosa legata alla latenza alle ore lavorative.
Accesso ai pesi stessi. Il fine-tuning, l'ispezione dei logit e la decodifica personalizzata non sono semplicemente disponibili tramite un'API. Se il tuo prodotto ne ha bisogno, la decisione non è mai stata incentrata sui costi.

Cosa è cambiato dalla nostra precedente guida su DeepSeek
La nostra pagina sui prezzi di DeepSeek del 2026 precede la generazione V4 e l'intero sistema di punta e fuori punta. Quattro cose sono cambiate.
| Quando | Cosa è stato rilasciato |
|---|---|
| 24 aprile 2026 | Anteprima V4-Pro e V4-Flash, con contesto da 1 milione di token e modalità di pensiero commutabili segnalate al lancio |
| 31 luglio 2026 | DeepSeek-V4-Flash-0731, la release Flash stabile |
| 13 agosto 2026 | DeepSeek-V4-Pro-0813 raggiunge la disponibilità generale |
| Intorno al 10 settembre 2026 | DeepSeek-V4.1-Flash, elencato nei documenti come DeepSeek-Flash |
Prima della modifica dei prezzi di agosto, la linea Flash era conosciuta per l'ultimo come $0.14 per milione di token di input con cache miss e $0.28 per milione di output. Questo è un contesto storico, non una tariffa su cui puoi fatturare oggi.
La modifica che interrompe le compatibilità merita un avviso a sé stante. DeepSeek-V4.1-Flash ha ritirato i nomi degli endpoint deepseek-v4-flash e deepseek-v4-flash-vision-exp. Tutorial, risposte su Stack Overflow e vecchi esempi di codice li fanno ancora riferimento, e queste chiamate ora falliscono. Se hai ereditato un'integrazione DeepSeek scritta prima di settembre, cerca entrambe le stringhe prima di fare il debug di qualsiasi altra cosa.
Quel ritiro è anche l'argomento pratico più forte per i pesi locali: un modello sul tuo disco non può essere rinominato sotto un'implementazione.
DeepSeek non offre programmi di crediti per startup
L'app di chat DeepSeek è gratuita. L'API non lo è, e DeepSeek non gestisce alcun programma di crediti dedicato per startup.
Essere precisi qui è importante, perché è qui che la maggior parte degli articoli diventa disordinata:
- L'app di chat per i consumatori è gratuita da usare
- Non esiste un livello gratuito API dichiarato sulla pagina ufficiale dei prezzi di DeepSeek
- Le affermazioni di crediti API gratuiti per nuovi account sono segnalate in modo incoerente e non confermate sulla pagina ufficiale, quindi trattale come non verificate
- DeepSeek non pubblica alcun track di crediti per fondatori, startup o ricerca
Quest'ultimo punto è una vera lacuna. Un fondatore può eseguire DeepSeek a basso costo, ma non può eseguirlo gratuitamente, e non può compensarlo con una sovvenzione come può fare con i provider che gestiscono programmi. AI Perks traccia $7,7 milioni in crediti per 194 aziende, coprendo i fornitori che distribuiscono crediti.
Gli host di terze parti sono l'altra via. Baseten elenca l'input DeepSeek V4.1 Flash a $0.30 per milione e offre un credito di prova permanente di $30 per nuovo spazio di lavoro. Anche OpenRouter, Together e Fireworks servono modelli DeepSeek. Verifica tu stesso le loro tariffe attuali prima di preventivare contro di esse, perché i prezzi di routing si muovono più velocemente dei prezzi dei modelli.

Domande frequenti
Posso eseguire DeepSeek localmente con Ollama?
Sì. Ollama scarica una copia quantizzata dei pesi sul disco locale e serve un endpoint compatibile con OpenAI su localhost:11434, quindi il codice esistente necessita solo di una modifica all'URL di base. Conferma quale variante e quantizzazione si trovano dietro il tag prima di fare benchmark, perché le build locali e il modello ospitato di DeepSeek non sono spesso gli stessi pesi.
È più economico auto-ospitare DeepSeek che usare l'API?
Di solito no. DeepSeek addebita $1.98 per milione di token di output fuori punta, quindi un rig che serve un milione di token di output all'ora sposta circa $1.425 al mese (derivato: $1.98 x 24 x 30). L'input memorizzato nella cache costa $0.022 per milione, che nessun hardware batte. Auto-ospita per residenza e controllo. Per il costo, usa i crediti da AI Perks.
DeepSeek è open source?
DeepSeek è meglio descritto come open weight piuttosto che open source: i file del modello rilasciati sono scaricabili ed eseguibili, il che rende possibile la distribuzione locale. Controlla il repository del modello di DeepSeek stesso per confermare quale generazione e quale variante è effettivamente pubblicata, poiché il modello di punta servito tramite API e la build scaricabile non sono sempre identici.
Perché la mia chiamata API deepseek-v4-flash ha smesso di funzionare?
DeepSeek-V4.1-Flash ha ritirato i nomi degli endpoint deepseek-v4-flash e deepseek-v4-flash-vision-exp. Qualsiasi codice o tutorial scritto prima di settembre 2026 che li fa riferimento fallirà. Aggiorna all'identificatore del modello corrente nella documentazione API di DeepSeek. Questa ridenominazione è un buon argomento a favore del blocco dei pesi locali se la stabilità ti interessa.
DeepSeek offre crediti API gratuiti ai nuovi account?
Non esiste un livello gratuito API dichiarato sulla pagina ufficiale dei prezzi di DeepSeek, e i resoconti di crediti per nuovi account sono incoerenti e non confermati. DeepSeek inoltre non gestisce alcun programma di crediti per startup. I provider che ne gestiscono uno sono tracciati, con gli importi attuali, su AI Perks.
Ho bisogno di una GPU per eseguire DeepSeek localmente?
Varianti quantizzate più piccole funzioneranno su CPU, ma la produttività scende abbastanza da escludere la maggior parte degli usi interattivi. Build più grandi richiedono memoria dell'acceleratore in proporzione alle loro dimensioni e quantizzazione. Controlla la scheda del modello per il tag specifico piuttosto che fidarti di un requisito generico, e aspettati un divario reale tra "si carica" e "utilizzabile".
DeepSeek ti offre una scelta reale: un'API ospitata prezzata a ore e per cache, o la stessa famiglia di pesi su hardware che controlli. Scegli il controllo quando hai bisogno di controllo. Scegli l'API quando hai bisogno di produttività e copri la fattura con crediti dai provider che ancora li distribuiscono gratuitamente.
Eseguilo da solo o noleggialo. In entrambi i casi, smetti di pagare il prezzo intero su getaiperks.com.