Qual é o Custo Real do Fireworks AI em 2026?
O Fireworks AI oferece o Kimi K3 por US$ 3,00 por milhão de tokens de entrada, US$ 0,30 por milhão de tokens de entrada em cache e US$ 15,00 por milhão de tokens de saída em seu nível de servidor sem servidor Standard.
Essas são as taxas de lançamento publicadas pela Fireworks, e elas correspondem ao preço de primeira mão da Moonshot AI até o centavo, o que raramente acontece com um host de terceiros.
A Fireworks lançou o Kimi K3 em 27 de julho de 2026, o dia em que a Moonshot lançou os pesos, inferência e treinamento juntos. Modal e Baseten o lançaram no mesmo dia, tornando o lançamento uma corrida a três. A Moonshot havia aberto o K3 para usuários de chat e API em 16 de julho. É uma mistura de experts de 2,8 trilhões de parâmetros, o maior lançamento de pesos abertos até o momento, e estreou em terceiro lugar no placar da Análise Artificial.
| Modelo e host | Entrada / 1M | Entrada em cache / 1M | Saída / 1M | Contexto |
|---|---|---|---|---|
| Kimi K3, Fireworks Standard | US$ 3,00 | US$ 0,30 | US$ 15,00 | 1M |
| Kimi K3, Fireworks Fast | US$ 4,50 | US$ 0,45 | US$ 22,50 | 1M |
| Kimi K3, Moonshot direto | US$ 3,00 | US$ 0,30 | US$ 15,00 | 1.048.576 |
| Kimi K2.7-Code, Moonshot direto | US$ 0,95 | US$ 0,19 | US$ 4,00 | 262.144 |
| Kimi K2.7-Code highspeed, Moonshot | US$ 1,90 | US$ 0,38 | US$ 8,00 | 262.144 |
| Kimi K2.6, Moonshot direto | US$ 0,95 | US$ 0,16 | US$ 4,00 | 262.144 |
Entrada é a taxa de cache-miss, entrada em cache é a taxa de cache-hit. A entrada em cache custa 10% da entrada sem cache no Kimi K3, portanto, o cache de prompt vale mais aqui do que em quase qualquer outra otimização. O salto geracional também é acentuado: a saída do K3 custa 3,75 vezes a saída do K2.7-Code, para 2,8T parâmetros contra 1T do K2.6 com 32B ativos.
Ninguém financia uma conta de inferência de ponta com receita no primeiro ano. AI Perks rastreia quais fornecedores de modelos e computação estão distribuindo créditos.

O Fire Pass é um Nível Gratuito Real?
O Fire Pass é o nível gratuito da Fireworks, e seu modelo gratuito em destaque agora é o Kimi K3 Fast com o contexto completo de 1 milhão de tokens. O que falta é um conjunto publicado de limites com os quais você possa planejar um produto.
Um nível gratuito com um modelo de ponta é incomum, e o contraste com o laboratório é acentuado: a Moonshot não executa um nível gratuito permanente em nenhum modelo Kimi, e a conta supostamente precisa ser pré-financiada, com um mínimo de cerca de US$ 1, antes que a API responda. A Fireworks colocando os mesmos pesos por trás de um nível gratuito é a maneira legítima mais barata de apontar um agente de codificação para um modelo de 1 milhão de tokens de contexto.
A cautela é simétrica. Resenhas do Fire Pass circulam condições muito específicas: códigos de convite, cargas de trabalho de produção banidas, cláusulas de revogação, limites diários. Nada disso é confirmado no material de lançamento da própria Fireworks, conforme verificado aqui, portanto, trate cada restrição e número como não confirmado até que apareça em seu próprio console.
Essa lacuna entre um teste de desenvolvedor e um orçamento financiado é o que os programas de crédito para startups preenchem. AI Perks rastreia quais estão abertos agora.
O Prêmio de Hospedagem nos EUA: Dois Números em Desacordo
A Fireworks vende uma variante hospedada nos EUA do Kimi K3 acima do preço global. O prêmio é relatado de duas maneiras, e a diferença entre eles é um fator de cinco.
O material de lançamento do Kimi K3 da própria Fireworks coloca a variante hospedada nos EUA 10% acima da taxa de servidor sem servidor base. Um resumo posterior da documentação de preços do Fireworks relata uma política em vez disso: a partir de 1º de setembro de 2026, os modelos recém-lançados apenas nos EUA terão preços 1,5 vezes a base, com uma exceção, GLM-5.2 Fast US, que corresponderá aos preços globais. Essa segunda conta é um resumo secundário, não confirmado em relação à documentação da Fireworks aqui.
Ambos podem ser verdadeiros ao mesmo tempo: um descreve um modelo precificado antes dessa data, o outro modelos lançados depois dela. Leia o preço dos EUA em seu próprio console antes de se comprometer com uma cláusula de residência de dados, porque em um modelo de ponta, 10% versus 50% é a diferença entre um erro de arredondamento e uma linha de item.
O nível de velocidade, em contraste, não está em disputa. Em uma única execução de 1 milhão de tokens de entrada e 100 mil tokens de saída sem acertos de cache:
| Rota | Custo de entrada | Custo de saída | Total da execução |
|---|---|---|---|
| Kimi K3, Fireworks Standard | US$ 3,00 | US$ 1,50 | US$ 4,50 |
| Kimi K3, Fireworks Fast | US$ 4,50 | US$ 2,25 | US$ 6,75 |
Fast custa exatamente 1,5 vezes Standard em todos os três tipos de token, US$ 2,25 a mais nessa execução: barato para a latência que você precisa, caro como padrão.

Treinamento de Servidor sem Servidor: Relatado, Não Confirmado
A Fireworks relatou o lançamento de uma API de Treinamento sem Servidor ao lado do Kimi K3, cobrando o fine-tuning LoRA por token em vez de por hora de GPU reservada. Quase tudo sobre isso é de segunda mão.
A mudança de design é a parte interessante e não depende de uma tabela de preços. O treinamento reservado cobra por horas de GPU, quer você esteja aprendendo algo ou não. O treinamento por token cobra pelo trabalho feito, o que se adapta aos experimentos em tamanho de LoRA que a maioria das equipes realmente executa. A cobertura relatada no lançamento abrangeu Qwen 3.5 9B, Qwen 3.6 27B e Kimi K3.
Tudo abaixo é relatado por uma fonte secundária e não foi confirmado na própria documentação da Fireworks nesta passagem. Trate como uma forma, não um preço:
- A cobrança é dita ser dividida entre os estágios de preenchimento antecipado, preenchimento antecipado em cache, amostra e treinamento, em vez de uma taxa única por token.
- A faixa relatada entre esses estágios é de US$ 0,66 a US$ 32,55 por 1 milhão de tokens. Uma variação de 49x torna qualquer número principal único sem sentido: um orçamento construído sobre o estágio errado está errado por uma ordem de magnitude.
- As taxas LoRA por modelo, os custos de execução de amostra e o status de pré-visualização circulam na cobertura de lançamento, nenhum deles confirmado aqui.
Orce um programa de fine-tuning a partir da saída do seu próprio console, não da cobertura de lançamento. Créditos são a variável mais barata para resolver, e AI Perks rastreia créditos de computação e de modelo lado a lado.
Fireworks, Modal, Baseten ou Moonshot Direto?
Com base nos números publicados, Fireworks Standard e Moonshot direto estão empatados, e os outros dois hosts do dia zero não publicaram o suficiente para comparar.
O nível Standard da Fireworks e a plataforma da Moonshot listam US$ 3,00 de entrada, US$ 0,30 de entrada em cache e US$ 15,00 de saída por milhão de tokens em um contexto de 1 milhão de tokens. Essa paridade remove o preço do argumento inteiramente.
O restante do campo é mais fino do que a cobertura de lançamento sugere:
- Baseten lista a entrada Kimi K3 por US$ 3,00 por 1 milhão. Seu valor de saída publicado é confuso o suficiente para valer a pena ler na própria página de preços da Baseten.
- Modal confirmou a precificação baseada em token para Kimi K3, mas não publicou uma taxa por 1 milhão em seu próprio post de lançamento. Modal oferece aos novos espaços de trabalho US$ 30 por mês de crédito de computação geral, uma oferta permanente em vez de um benefício de lançamento Kimi.
- Moonshot direto não executa um nível gratuito permanente em nenhum modelo Kimi e precifica trabalhos em lote K2.6 em 60% da taxa padrão, o único desconto aqui que é de primeira mão e inequívoco.
Uma advertência sobre os pesos: a licença personalizada do Kimi K3 exige que empresas com receita acima de US$ 20 milhões negociem um contrato comercial com a Moonshot antes de revender o acesso. Isso restringe uma cópia auto-hospedada, não o que você chama através da API de outra pessoa.

O Que Realmente Reduz a Conta da Fireworks
O Fire Pass cobre um laptop de desenvolvedor. Programas de crédito cobrem um produto. São instrumentos diferentes e você quer ambos.
Créditos de inferência e créditos de computação chegam ao mesmo destino por caminhos diferentes. A Fireworks fatura por tokens; a camada de GPU por baixo executa seus próprios programas de startup. Vale a pena saber primeiro: nenhum programa de crédito de startup dedicado foi encontrado na própria plataforma Kimi da Moonshot para K2.6, K2.7-Code ou K3, então a camada de crédito para esta família está com os hosts, não com o laboratório.
As alavancas que sobrevivem ao escrutínio, começando pela maior:
- Cache primeiro. A 10% da taxa sem cache, o cache de prompt no Kimi K3 é uma alavanca maior do que trocar de provedor, e a única que não custa nada para tentar.
- Dimensionar o modelo corretamente. K2.7-Code a US$ 0,95 de entrada e US$ 4,00 de saída é aproximadamente um quarto do preço de saída do K3, e a Moonshot relata que ele pontua 21,8% mais alto que o K2.6 no próprio Kimi Code Bench v2 do laboratório, enquanto usa 30% menos tokens de raciocínio. Benchmarks internos são marketing, mas menos tokens de raciocínio aparecem na fatura de qualquer maneira.
- Agrupar o que não é sensível à latência. A Moonshot precifica trabalhos em lote K2.6 em 60% da taxa padrão.
- Rever trimestralmente. A política de preços dos EUA da Fireworks supostamente mudou em 1º de setembro de 2026, sem lançamento de modelo associado. As tabelas de preços se movem mais rápido do que os artigos sobre tabelas de preços, incluindo este.
Perguntas Frequentes
O Fireworks AI tem um nível gratuito?
Sim. O Fire Pass é o nível gratuito da Fireworks, e seu modelo gratuito em destaque é o Kimi K3 Fast com um contexto de 1 milhão de tokens. Limites, condições de convite e restrições de carga de trabalho circulam amplamente, mas não são confirmados no material verificado aqui, portanto, verifique-os em seu próprio console. Para orçamentos além do desenvolvimento pessoal, os créditos são rastreados em getaiperks.com.
Quanto custa o Kimi K3 no Fireworks AI?
O Kimi K3 custa US$ 3,00 por milhão de tokens de entrada, US$ 0,30 por milhão de tokens de entrada em cache e US$ 15,00 por milhão de tokens de saída no nível de servidor sem servidor Standard. O nível Fast lista US$ 4,50 / US$ 0,45 / US$ 22,50, exatamente 1,5 vezes o Standard. Uma variante hospedada nos EUA carrega um prêmio cujo tamanho é relatado de forma inconsistente.
O Fireworks AI é mais barato do que usar o Kimi diretamente?
Não, nem mais caro. O nível Standard da Fireworks corresponde ao preço publicado pela Moonshot AI até o centavo em todos os três tipos de token, ambos em um contexto de 1 milhão de tokens. Escolha com base na região, latência e amplitude do modelo, e então reduza qualquer conta que você acabar usando créditos de getaiperks.com.
Qual é o prêmio de hospedagem nos EUA do Fireworks?
É relatado de duas maneiras. O material de lançamento do Kimi K3 da Fireworks coloca a variante hospedada nos EUA 10% acima do preço de servidor sem servidor base. Um resumo secundário da documentação de preços da Fireworks relata em vez disso 1,5 vezes a base para modelos apenas nos EUA lançados a partir de 1º de setembro de 2026, com GLM-5.2 Fast US como uma exceção ao preço global. Verifique o modelo que você realmente planeja chamar antes de orçar qualquer um dos valores.
A API de Treinamento sem Servidor do Fireworks está geralmente disponível?
A Fireworks não publicou uma tabela de preços pública completa para treinamento sem servidor, e os números que circulam de fontes secundárias, incluindo uma faixa relatada de US$ 0,66 a US$ 32,55 por 1 milhão de tokens entre os estágios de cobrança, não são confirmados. Prece qualquer programa de fine-tuning a partir da saída do seu próprio console e compense-o com créditos de getaiperks.com.
Existem créditos para startups para o Kimi K3?
Nenhum programa de crédito de startup dedicado foi encontrado no lado da Moonshot para K2.6, K2.7-Code ou K3. No lado do host, a Modal oferece novos espaços de trabalho com US$ 30 por mês de crédito de computação geral, que não é específico do Kimi. Os termos atuais nas camadas de inferência e computação são rastreados em getaiperks.com.
Inscreva-se em getaiperks.com →
Execute o modelo de ponta. Deixe outra pessoa pagar pelos tokens.