Quanto costa realmente Fireworks AI nel 2026?
Fireworks AI offre Kimi K3 a $3,00 per milione di token di input, $0,30 per milione di token di input in cache e $15,00 per milione di token di output sul suo livello serverless Standard.
Queste sono le tariffe di lancio pubblicate da Fireworks, e corrispondono al centesimo al prezzo di prima parte di Moonshot AI, cosa che raramente accade con un host di terze parti.
Fireworks ha rilasciato Kimi K3 il 27 luglio 2026, il giorno in cui Moonshot ha reso disponibili pesi, inferenza e training insieme. Modal e Baseten lo hanno rilasciato lo stesso giorno, rendendo il lancio una gara a tre. Moonshot aveva aperto K3 agli utenti di chat e API il 16 luglio. Si tratta di un mixture of experts da 2,8 trilioni di parametri, il più grande rilascio open-weights fino ad oggi, e ha debuttato al terzo posto nella classifica Artificial Analysis.
| Modello e host | Input / 1M | Input in cache / 1M | Output / 1M | Contesto |
|---|---|---|---|---|
| Kimi K3, Fireworks Standard | $3,00 | $0,30 | $15,00 | 1M |
| Kimi K3, Fireworks Fast | $4,50 | $0,45 | $22,50 | 1M |
| Kimi K3, Moonshot diretto | $3,00 | $0,30 | $15,00 | 1.048.576 |
| Kimi K2.7-Code, Moonshot diretto | $0,95 | $0,19 | $4,00 | 262.144 |
| Kimi K2.7-Code highspeed, Moonshot | $1,90 | $0,38 | $8,00 | 262.144 |
| Kimi K2.6, Moonshot diretto | $0,95 | $0,16 | $4,00 | 262.144 |
L'input è il tasso di cache miss, l'input in cache il tasso di cache hit. L'input in cache costa il 10% dell'input non in cache su Kimi K3, quindi il caching del prompt è più vantaggioso qui rispetto a quasi qualsiasi altra ottimizzazione. Anche il salto generazionale è ripido: l'output di K3 costa 3,75 volte l'output di K2.7-Code, per 2,8T parametri contro 1T di K2.6 con 32B attivi.
Nessuno finanzia una bolletta di inferenza frontier con i ricavi nel primo anno. AI Perks tiene traccia di quali fornitori di modelli e calcolo stanno offrendo crediti.

Fire Pass è un vero livello gratuito?
Fire Pass è il livello gratuito di Fireworks, e il suo modello gratuito in evidenza è ora Kimi K3 Fast con il contesto completo di 1 milione di token. Ciò che manca è un set di limiti pubblicato su cui poter pianificare un prodotto.
Un livello gratuito con un modello frontier è insolito, e il contrasto con il lab è netto: Moonshot non gestisce alcun livello gratuito permanente su nessun modello Kimi, e si dice che l'account debba essere pre-finanziato, con un minimo di circa $1, prima che l'API risponda affatto. Il fatto che Fireworks metta gli stessi pesi dietro un livello gratuito è il modo legittimo più economico per puntare un agente di codifica su un modello con contesto da 1 milione di token.
La cautela è simmetrica. Gli articoli su Fire Pass circolano con condizioni molto specifiche: codici di invito, carichi di lavoro di produzione vietati, clausole di revoca, limiti giornalieri. Nessuno di questi è confermato nei materiali di lancio di Fireworks, come verificato qui, quindi considera ogni restrizione e numero come non confermato finché non appare nella tua console.
Questo divario tra una prova per sviluppatori e un budget finanziato è ciò che i programmi di credito per startup colmano. AI Perks tiene traccia di quali sono aperti ora.
Il Premium di Hosting negli Stati Uniti: Due Numeri Discordanti
Fireworks vende una variante di Kimi K3 ospitata negli Stati Uniti al di sopra del prezzo globale. Il premium viene segnalato in due modi, e il divario tra loro è di un fattore cinque.
Il materiale di lancio di Fireworks su Kimi K3 posiziona la variante ospitata negli Stati Uniti al 10% al di sopra della tariffa serverless base. Un riassunto successivo della documentazione sui prezzi serverless di Fireworks riporta invece una politica: dal 1° settembre 2026, i modelli di nuova emissione solo per gli Stati Uniti avranno un prezzo pari a 1,5 volte il base, con un'eccezione, GLM-5.2 Fast US, che si dice corrisponda ai prezzi globali. Questo secondo resoconto è un riassunto secondario, non confermato rispetto alla documentazione di Fireworks qui.
Entrambi possono essere veri contemporaneamente: uno descrive un modello prezzato prima di tale data, l'altro modelli lanciati dopo. Leggi il prezzo degli Stati Uniti dalla tua console prima di impegnarti in una clausola di residenza dei dati, perché su un modello frontier il 10% rispetto al 50% è la differenza tra un errore di arrotondamento e una voce di bilancio.
Il livello di velocità, al contrario, non è in discussione. Su una singola esecuzione di 1 milione di token di input e 100.000 token di output senza cache hit:
| Percorso | Costo di input | Costo di output | Totale esecuzione |
|---|---|---|---|
| Kimi K3, Fireworks Standard | $3,00 | $1,50 | $4,50 |
| Kimi K3, Fireworks Fast | $4,50 | $2,25 | $6,75 |
Fast costa esattamente 1,5 volte Standard su tutti e tre i tipi di token, $2,25 in più su quell'esecuzione: economico per la latenza di cui hai bisogno, costoso come impostazione predefinita.

Training Serverless: Segnalato, Non Conferto
Si dice che Fireworks abbia lanciato un'API di Training Serverless insieme a Kimi K3, fatturando il fine-tuning LoRA per token piuttosto che per ora di GPU riservata. Quasi tutto ciò che lo riguarda è di seconda mano.
Il cambio di progettazione è la parte interessante, e non dipende da una tabella dei prezzi. Il training riservato addebita le ore di GPU indipendentemente dal fatto che si stia imparando qualcosa o meno. Il training per token addebita il lavoro svolto, il che si adatta agli esperimenti di dimensioni LoRA che la maggior parte dei team esegue effettivamente. La copertura segnalata al lancio includeva Qwen 3.5 9B, Qwen 3.6 27B e Kimi K3.
Tutto ciò che segue è riportato da una fonte secondaria e non è stato confermato nella documentazione di Fireworks in questa fase. Consideralo una forma, non un prezzo:
- Si dice che la fatturazione sia suddivisa tra le fasi di prefill, prefill in cache, campionamento e training, piuttosto che un'unica tariffa fissa per token.
- L'intervallo riportato tra queste fasi è da $0,66 a $32,55 per 1 milione di token. Un intervallo di 49x rende insignificante qualsiasi singolo numero di copertina: un preventivo basato sullo stadio sbagliato è sbagliato di un ordine di grandezza.
- Tariffe LoRA per modello, costi di esecuzione di esempio e stato di anteprima circolano nella copertura del lancio, nessuno di essi è confermato qui.
Budget per un programma di fine-tuning dalla tua console, non dalla copertura del lancio. I crediti sono la variabile più economica da risolvere, e AI Perks tiene traccia dei crediti di calcolo e dei modelli fianco a fianco.
Fireworks, Modal, Baseten o Moonshot diretto?
Sulla base dei numeri pubblicati, Fireworks Standard e Moonshot diretto sono alla pari, e gli altri due host del giorno del lancio non hanno pubblicato abbastanza per un confronto.
Il livello Standard di Fireworks e la piattaforma di Moonshot elencano entrambi $3,00 di input, $0,30 di input in cache e $15,00 di output per milione di token con un contesto di 1 milione di token. Questa parità rimuove il prezzo dalla discussione del tutto.
Il resto del campo è più magro di quanto suggerisca la copertura del lancio:
- Baseten elenca l'input di Kimi K3 a $3,00 per 1 milione. La sua cifra di output pubblicata è abbastanza poco chiara da non valere la pena leggerla dalla pagina dei prezzi di Baseten.
- Modal ha confermato il pricing basato sui token per Kimi K3 ma non ha pubblicato alcuna tariffa per 1 milione nel proprio post di lancio. Modal offre ai nuovi workspace $30 al mese di credito di calcolo generale, un'offerta permanente piuttosto che un vantaggio di lancio di Kimi.
- Moonshot diretto non gestisce alcun livello gratuito permanente su nessun modello Kimi, e prezza i job batch di K2.6 al 60% della tariffa standard, l'unico sconto qui che è di prima parte e inequivocabile.
Una cautela sui pesi: la licenza personalizzata di Kimi K3 richiede alle aziende con ricavi superiori a $20 milioni di negoziare un contratto commerciale con Moonshot prima di rivendere l'accesso. Ciò limita una copia auto-ospitata, non quella che chiami tramite l'API di qualcun altro.

Cosa riduce effettivamente il conto di Fireworks
Fire Pass copre un laptop da sviluppatore. I programmi di credito coprono un prodotto. Sono strumenti diversi e ne vuoi entrambi.
I crediti di inferenza e i crediti di calcolo raggiungono la stessa destinazione da direzioni diverse. Fireworks fattura per i token; lo strato GPU sottostante gestisce i propri programmi di startup. Vale la pena sapere prima: non è stato trovato alcun programma di credito dedicato per startup sulla piattaforma Kimi di Moonshot per K2.6, K2.7-Code o K3, quindi lo strato di credito per questa famiglia si trova presso gli host, non presso il lab.
Le leve che resistono all'esame, dalla più grande alla più piccola:
- Cache prima. Al 10% della tariffa non in cache, il prompt caching su Kimi K3 è una leva più grande che cambiare provider, ed è l'unica che non costa nulla provare.
- Dimensiona correttamente il modello. K2.7-Code a $0,95 in e $4,00 in uscita è circa un quarto del prezzo di output di K3, e Moonshot riporta che ha ottenuto un punteggio del 21,8% superiore a K2.6 nel Kimi Code Bench v2 del lab stesso, utilizzando il 30% in meno di token di ragionamento. I benchmark interni sono marketing, ma meno token di ragionamento compaiono comunque nella fattura.
- Processa in batch ciò che non è sensibile alla latenza. Moonshot prezza i job batch di K2.6 al 60% della tariffa standard.
- Ricontrolla trimestralmente. La politica di prezzi per gli Stati Uniti di Fireworks è cambiata secondo quanto riferito il 1° settembre 2026 senza alcun lancio di modello associato. Le schede dei prezzi si muovono più velocemente degli articoli sulle schede dei prezzi, compreso questo.
Domande Frequenti
Fireworks AI ha un livello gratuito?
Sì. Fire Pass è il livello gratuito di Fireworks, e il suo modello gratuito in evidenza è Kimi K3 Fast con un contesto di 1 milione di token. Limiti, condizioni di invito e restrizioni sui carichi di lavoro circolano ampiamente ma non sono confermati nei materiali verificati qui, quindi verificali nella tua console. Per budget superiori allo sviluppo personale, i crediti sono tracciati su getaiperks.com.
Quanto costa Kimi K3 su Fireworks AI?
Kimi K3 costa $3,00 per milione di token di input, $0,30 per milione di token di input in cache e $15,00 per milione di token di output sul livello serverless Standard. Il livello Fast elenca $4,50 / $0,45 / $22,50, esattamente 1,5 volte lo Standard. Una variante ospitata negli Stati Uniti comporta un premium la cui entità è riportata in modo incoerente.
Fireworks AI è più economico dell'utilizzo diretto di Kimi?
No, e nemmeno più costoso. Il livello Standard di Fireworks corrisponde al prezzo pubblicato da Moonshot AI al centesimo su tutti e tre i tipi di token, entrambi con un contesto di 1 milione di token. Scegli in base alla regione, alla latenza e all'ampiezza del modello, quindi riduci qualsiasi fattura che otterrai utilizzando i crediti da getaiperks.com.
Qual è il premium di hosting negli Stati Uniti di Fireworks?
È riportato in due modi. Il materiale di lancio di Kimi K3 di Fireworks posiziona la variante ospitata negli Stati Uniti al 10% al di sopra del prezzo serverless base. Un riassunto secondario della documentazione dei prezzi di Fireworks riporta invece 1,5 volte il base per i modelli solo per gli Stati Uniti lanciati dal 1° settembre 2026, con GLM-5.2 Fast US come eccezione ai prezzi globali. Controlla il modello che intendi effettivamente chiamare prima di preventivare una di queste cifre.
L'API di Training Serverless di Fireworks è generalmente disponibile?
Fireworks non ha pubblicato una tabella dei prezzi completa e pubblica per il training serverless, e le cifre che circolano da fonti secondarie, inclusa una presunta gamma da $0,66 a $32,55 per 1 milione di token attraverso le fasi di fatturazione, non sono confermate. Prezza qualsiasi programma di fine-tuning dalla tua console e compensalo con i crediti da getaiperks.com.
Ci sono crediti per startup per Kimi K3?
Non è stato trovato alcun programma di credito dedicato per startup dal lato di Moonshot per K2.6, K2.7-Code o K3. Dal lato dell'host, Modal offre ai nuovi workspace $30 al mese di credito di calcolo generale, che non è specifico di Kimi. I termini attuali attraverso gli strati di inferenza e calcolo sono tracciati su getaiperks.com.
Esegui il modello frontier. Lascia che qualcun altro paghi i token.