Quel est le coût réel de Fireworks AI en 2026 ?
Fireworks AI propose Kimi K3 à 3,00 $ par million de tokens d'entrée, 0,30 $ par million de tokens d'entrée mis en cache et 15,00 $ par million de tokens de sortie sur son niveau sans serveur Standard.
Ce sont les tarifs de lancement publiés par Fireworks, et ils correspondent exactement au prix de première partie de Moonshot AI, ce qui est rare avec un hébergeur tiers.
Fireworks a lancé Kimi K3 le 27 juillet 2026, jour où Moonshot a publié les poids, l'inférence et l'entraînement ensemble. Modal et Baseten l'ont lancé le même jour, faisant de ce lancement une course à trois. Moonshot avait ouvert K3 aux utilisateurs de chat et d'API le 16 juillet. Il s'agit d'un mélange d'experts de 2,8 trillions de paramètres, la plus grande publication de poids ouverts à ce jour, et il a débuté à la troisième place du classement Artificial Analysis.
| Modèle et hébergeur | Entrée / 1M | Entrée mise en cache / 1M | Sortie / 1M | Contexte |
|---|---|---|---|---|
| Kimi K3, Fireworks Standard | 3,00 $ | 0,30 $ | 15,00 $ | 1M |
| Kimi K3, Fireworks Fast | 4,50 $ | 0,45 $ | 22,50 $ | 1M |
| Kimi K3, Moonshot direct | 3,00 $ | 0,30 $ | 15,00 $ | 1 048 576 |
| Kimi K2.7-Code, Moonshot direct | 0,95 $ | 0,19 $ | 4,00 $ | 262 144 |
| Kimi K2.7-Code highspeed, Moonshot | 1,90 $ | 0,38 $ | 8,00 $ | 262 144 |
| Kimi K2.6, Moonshot direct | 0,95 $ | 0,16 $ | 4,00 $ | 262 144 |
L'entrée correspond au taux de manque de cache, l'entrée mise en cache au taux de succès de cache. L'entrée mise en cache coûte 10 % de l'entrée non mise en cache sur Kimi K3, donc la mise en cache des invites est plus intéressante ici que presque toute autre optimisation. Le saut générationnel est également abrupt : la sortie K3 coûte 3,75 fois la sortie K2.7-Code, pour 2,8T de paramètres contre 1T pour K2.6 avec 32B actifs.
Personne ne finance une facture d'inférence de pointe sur les revenus la première année. AI Perks suit quels fournisseurs de modèles et de calcul distribuent des crédits.

Fire Pass est-il un véritable niveau gratuit ?
Fire Pass est le niveau gratuit de Fireworks, et son modèle gratuit mis en avant est désormais Kimi K3 Fast avec un contexte complet de 1 million de tokens. Ce qui lui manque, c'est un ensemble de limites publiées sur lesquelles vous pouvez baser un produit.
Un niveau gratuit doté d'un modèle de pointe est inhabituel, et le contraste avec le laboratoire est net : Moonshot n'exécute aucun niveau gratuit permanent sur aucun modèle Kimi, et le compte devrait être pré-financé, avec un minimum d'environ 1 $, avant que l'API ne réponde. Fireworks proposant les mêmes poids derrière un niveau gratuit est le moyen légitime le moins cher de pointer un agent de codage vers un modèle à contexte 1M.
La prudence est symétrique. Les articles sur Fire Pass font état de conditions très spécifiques : codes d'invitation, charges de travail de production interdites, clauses de révocation, plafonds quotidiens. Rien de tout cela n'est confirmé dans le matériel de lancement de Fireworks tel que vérifié ici, alors traitez chaque restriction et chaque chiffre comme non confirmé jusqu'à ce qu'il apparaisse dans votre propre console.
Cet écart entre un essai développeur et un budget financé est ce que les programmes de crédits pour startups comblent. AI Perks suit ceux qui sont ouverts actuellement.
La prime d'hébergement aux États-Unis : deux chiffres qui divergent
Fireworks vend une variante de Kimi K3 hébergée aux États-Unis au-dessus du prix mondial. La prime est rapportée de deux manières, et l'écart entre les deux est un facteur cinq.
Le matériel de lancement de Kimi K3 de Fireworks place la variante hébergée aux États-Unis à 10 % au-dessus du taux sans serveur de base. Un résumé ultérieur de la documentation de tarification sans serveur de Fireworks rapporte une politique à la place : à partir du 1er septembre 2026, les modèles nouvellement lancés uniquement aux États-Unis sont tarifés à 1,5 fois le prix de base, avec une exception, GLM-5.2 Fast US, qui devrait correspondre à la tarification mondiale. Ce deuxième compte est un résumé secondaire, non confirmé par la documentation de Fireworks ici.
Les deux peuvent coexister : l'un décrit un modèle tarifé avant cette date, l'autre des modèles lancés après. Lisez le prix américain de votre propre console avant de vous engager dans une clause de résidence des données, car sur un modèle de pointe, 10 % contre 50 % est la différence entre une erreur d'arrondi et une ligne budgétaire.
Le niveau de vitesse, en revanche, n'est pas contesté. Sur une seule exécution de 1 million de tokens d'entrée et 100 000 tokens de sortie sans succès de cache :
| Route | Coût d'entrée | Coût de sortie | Total d'exécution |
|---|---|---|---|
| Kimi K3, Fireworks Standard | 3,00 $ | 1,50 $ | 4,50 $ |
| Kimi K3, Fireworks Fast | 4,50 $ | 2,25 $ | 6,75 $ |
Fast coûte exactement 1,5 fois Standard sur les trois types de tokens, soit 2,25 $ de plus pour cette exécution : bon marché pour la latence dont vous avez besoin, cher par défaut.

Entraînement sans serveur : rapporté, mais non confirmé
Il est rapporté que Fireworks a lancé une API d'entraînement sans serveur en parallèle avec Kimi K3, facturant le fine-tuning LoRA par token plutôt que par heure de GPU réservée. Presque tout ce qui la concerne est de seconde main.
Le changement de conception est la partie intéressante, et il ne dépend pas d'une grille tarifaire. L'entraînement réservé facture les heures de GPU, que vous appreniez quelque chose ou non. L'entraînement par token facture le travail effectué, ce qui convient aux expériences de taille LoRA que la plupart des équipes exécutent réellement. La couverture rapportée au lancement comprenait Qwen 3.5 9B, Qwen 3.6 27B et Kimi K3.
Tout ce qui suit est rapporté par une source secondaire et n'a pas été confirmé sur la documentation de Fireworks lors de cette vérification. Traitez-le comme une forme, pas comme un prix :
- La facturation est supposée être divisée entre les étapes de préremplissage, de préremplissage mis en cache, d'échantillonnage et d'entraînement plutôt qu'un taux unique par token.
- La plage rapportée entre ces étapes est de 0,66 $ à 32,55 $ par million de tokens. Un écart de 49x rend n'importe quel chiffre principal sans signification : un devis basé sur la mauvaise étape est erroné d'un ordre de grandeur.
- Les tarifs LoRA par modèle, les coûts d'exécution d'échantillons et le statut de prévisualisation circulent dans la couverture du lancement, aucun d'entre eux n'étant confirmé ici.
Budgétisez un programme de fine-tuning à partir des sorties de votre propre console, et non à partir de la couverture du lancement. Les crédits sont la variable la moins chère à résoudre, et AI Perks suit les crédits de calcul et de modèle côte à côte.
Fireworks, Modal, Baseten ou Moonshot Direct ?
Sur la base des chiffres publiés, Fireworks Standard et Moonshot direct sont à égalité, et les deux autres hébergeurs du jour zéro n'ont pas publié suffisamment d'informations pour comparer.
Le niveau Standard de Fireworks et la plateforme de Moonshot affichent tous deux 3,00 $ d'entrée, 0,30 $ d'entrée mise en cache et 15,00 $ de sortie par million de tokens avec un contexte de 1 million de tokens. Cette parité élimine le prix de l'argument.
Le reste du peloton est moins fourni que ce que suggère la couverture du lancement :
- Baseten affiche l'entrée Kimi K3 à 3,00 $ par million. Son chiffre de sortie publié n'est pas assez clair pour être utilement lu à partir de la page de tarification de Baseten.
- Modal a confirmé la tarification basée sur les tokens pour Kimi K3 mais n'a pas publié de taux par million dans son propre article de lancement. Modal offre aux nouveaux espaces de travail 30 $ de crédit de calcul général par mois, une offre permanente plutôt qu'un avantage de lancement Kimi.
- Moonshot direct n'exécute aucun niveau gratuit permanent sur aucun modèle Kimi et tarifie les jobs batch K2.6 à 60 % du taux standard, la seule réduction ici qui est de première partie et non ambiguë.
Une mise en garde concernant les poids : la licence personnalisée de Kimi K3 exige que les entreprises dont le chiffre d'affaires dépasse 20 millions de dollars américains négocient un contrat commercial avec Moonshot avant de revendre l'accès. Cela contraint une copie auto-hébergée, pas ce que vous appelez via l'API de quelqu'un d'autre.

Ce qui réduit réellement la facture Fireworks
Fire Pass couvre un ordinateur portable de développeur. Les programmes de crédits couvrent un produit. Ce sont des instruments différents et vous avez besoin des deux.
Les crédits d'inférence et les crédits de calcul atteignent la même destination par des directions différentes. Fireworks facture les tokens ; la couche GPU sous-jacente exécute ses propres programmes de démarrage. Il est utile de savoir d'abord : aucun programme de crédit de démarrage dédié n'a été trouvé sur la plateforme Kimi de Moonshot pour K2.6, K2.7-Code ou K3, donc la couche de crédit pour cette famille se situe chez les hébergeurs, pas au laboratoire.
Les leviers qui résistent à l'examen, les plus importants en premier :
- Mettez en cache d'abord. À 10 % du taux non mis en cache, la mise en cache des invites sur Kimi K3 est un levier plus important que le changement de fournisseur, et le seul qui ne coûte rien à essayer.
- Dimensionnez correctement le modèle. K2.7-Code à 0,95 $ en entrée et 4,00 $ en sortie coûte environ un quart du prix de sortie de K3, et Moonshot rapporte qu'il obtient un score de 21,8 % supérieur à K2.6 sur le banc d'essai Kimi Code Bench v2 du laboratoire tout en utilisant 30 % de tokens de raisonnement en moins. Les benchmarks internes sont du marketing, mais moins de tokens de raisonnement apparaissent sur la facture quoi qu'il en soit.
- Traitez par lots ce qui n'est pas sensible à la latence. Moonshot tarifie les jobs batch K2.6 à 60 % du taux standard.
- Vérifiez trimestriellement. La politique de prix américaine de Fireworks a apparemment changé le 1er septembre 2026 sans aucun lancement de modèle associé. Les grilles tarifaires évoluent plus rapidement que les articles à leur sujet, y compris celui-ci.
Questions fréquemment posées
Fireworks AI propose-t-il un niveau gratuit ?
Oui. Fire Pass est le niveau gratuit de Fireworks, et son modèle gratuit mis en avant est Kimi K3 Fast avec un contexte de 1 million de tokens. Les plafonds, les conditions d'invitation et les restrictions de charge de travail circulent largement mais ne sont pas confirmés dans le matériel vérifié ici, alors vérifiez-les dans votre propre console. Pour les budgets au-delà du développement personnel, les crédits sont suivis sur getaiperks.com.
Combien coûte Kimi K3 sur Fireworks AI ?
Kimi K3 coûte 3,00 $ par million de tokens d'entrée, 0,30 $ par million de tokens d'entrée mis en cache et 15,00 $ par million de tokens de sortie sur le niveau sans serveur Standard. Le niveau Fast est affiché à 4,50 $ / 0,45 $ / 22,50 $, soit exactement 1,5 fois le niveau Standard. Une variante hébergée aux États-Unis entraîne une prime dont la taille est rapportée de manière incohérente.
Fireworks AI est-il moins cher que d'utiliser Kimi directement ?
Non, et pas plus cher non plus. Le niveau Standard de Fireworks correspond au tarif publié par Moonshot AI à centime près sur les trois types de tokens, tous deux avec un contexte de 1 million de tokens. Choisissez en fonction de la région, de la latence et de la diversité des modèles, puis réduisez la facture que vous obtenez avec les crédits de getaiperks.com.
Quelle est la prime d'hébergement aux États-Unis de Fireworks ?
Elle est rapportée de deux manières. Le matériel de lancement de Kimi K3 de Fireworks place la variante hébergée aux États-Unis 10 % au-dessus du prix sans serveur de base. Un résumé secondaire de la documentation de tarification de Fireworks rapporte plutôt 1,5 fois le prix de base pour les modèles uniquement américains lancés à partir du 1er septembre 2026, avec GLM-5.2 Fast US comme exception au prix mondial. Vérifiez le modèle que vous prévoyez réellement d'appeler avant de budgétiser l'un ou l'autre chiffre.
L'API d'entraînement sans serveur de Fireworks est-elle généralement disponible ?
Fireworks n'a pas publié de grille tarifaire publique complète pour l'entraînement sans serveur, et les chiffres circulant provenant de sources secondaires, y compris une fourchette rapportée de 0,66 $ à 32,55 $ par million de tokens sur les étapes de facturation, ne sont pas confirmés. Tarifez tout programme de fine-tuning à partir de votre propre console et compensez-le avec des crédits de getaiperks.com.
Existe-t-il des crédits de démarrage pour Kimi K3 ?
Aucun programme de crédit de démarrage dédié n'a été trouvé du côté de Moonshot pour K2.6, K2.7-Code ou K3. Du côté de l'hébergeur, Modal offre aux nouveaux espaces de travail 30 $ de crédit de calcul général par mois, ce qui n'est pas spécifique à Kimi. Les conditions actuelles entre les couches d'inférence et de calcul sont suivies sur getaiperks.com.
Abonnez-vous sur getaiperks.com →
Exécutez le modèle de pointe. Laissez quelqu'un d'autre payer pour les tokens.