Ce que DeepSeek V4.1 Flash coûte par million de tokens
DeepSeek V4.1 Flash coûte 0,15 $ par million de tokens d'entrée en cache-miss hors pointe et 0,30 $ en pointe. Un token d'entrée en cache coûte 0,003 $ hors pointe, soit 50 fois moins que le taux de cache-miss de Flash lui-même (dérivé).
Flash est arrivé vers le 10 septembre 2026 et apparaît dans la documentation officielle sous le nom de DeepSeek-Flash. Le modèle phare DeepSeek-V4-Pro-0813 est disponible en général depuis le 13 août 2026.
Tous les chiffres ci-dessous sont en dollars américains par million de tokens, tirés de api-docs.deepseek.com et confirmés en septembre 2026.
| Modèle et fenêtre | Entrée, cache atteint | Entrée, cache manqué | Sortie |
|---|---|---|---|
| DeepSeek-V4-Pro-0813, hors pointe | 0,022 $ | 0,66 $ | 1,98 $ |
| DeepSeek-V4-Pro-0813, pointe | 0,044 $ | 1,32 $ | 3,96 $ |
| DeepSeek-V4.1-Flash, hors pointe | 0,003 $ | 0,15 $ | Non publié |
| DeepSeek-V4.1-Flash, pointe | 0,006 $ | 0,30 $ | Non publié |
DeepSeek n'a pas publié de prix de sortie pour V4.1 Flash qui puisse être confirmé sur la page officielle. Si vous en voyez un cité ailleurs, considérez-le comme non vérifié jusqu'à ce qu'il apparaisse dans le tableau officiel.
DeepSeek est inhabituel d'une seconde manière qui compte plus pour les fondateurs que le nombre de tokens : il n'a aucun programme de crédit de démarrage. Cette lacune est traitée ci-dessous, et c'est pourquoi AI Perks suit les fournisseurs qui en proposent un.

Pourquoi DeepSeek facture deux prix différents pour le même token
DeepSeek est le seul grand fournisseur de modèles qui facture par heure de la journée. Les heures de pointe sont de 01h00 à 04h00 et de 06h00 à 10h00 UTC en semaine, et tout ce qui se trouve en dehors de ces fenêtres coûte exactement la moitié.
Lisez cette liste de fenêtres deux fois, car il y a un intervalle au milieu. La période de 04h00 à 06h00 UTC se situe entre les deux blocs de pointe et est facturée au tarif hors pointe. Ce n'est pas une seule période de pointe continue de neuf heures.
Dérivé des fenêtres publiées : la pointe couvre sept heures par jour, uniquement en semaine, soit 35 heures sur les 168 de la semaine. Environ 79 % du calendrier est déjà hors pointe.
Cela recadre le problème. Vous n'essayez pas de trouver la fenêtre bon marché, vous essayez d'éviter celle qui est chère. Trois charges de travail où cela est presque gratuit :
- Jobs de traitement par lots nocturnes. Un travail planifié à 08h00 UTC tombe dans la période de pointe. Le déplacer à 12h00 UTC divise la facture par deux et ne change rien d'autre.
- Exécutions d'évaluation et de régression. Personne n'attend d'eux, ils appartiennent donc par défaut en dehors des blocs de pointe.
- Passages d'intégration et de réindexation. Les grosses consommations d'entrée ponctuelles sont la chose la plus sensible à la pointe que la plupart des équipes exécutent.
Le trafic interactif est la partie que vous ne pouvez pas déplacer, et il doit être tarifé aux taux de pointe dans toute prévision que vous construisez.
Le cache atteint est le plus grand multiplicateur
Sur DeepSeek-V4-Pro, un token d'entrée mis en cache coûte 0,022 $ par million contre 0,66 $ pour un manqué. C'est une différence de 30x (dérivée du tableau ci-dessus), et cela éclipse le 2x que vous obtenez du timing.
Les deux multiplicateurs s'accumulent, et cette accumulation est toute l'histoire du profil de coût de DeepSeek. Un token d'entrée en cache manqué en pointe à 1,32 $ contre un token d'entrée en cache atteint hors pointe à 0,022 $ représente un écart de 60x sur le même modèle (dérivé).
Sur V4.1 Flash, le ratio de cache est encore plus large : 0,15 $ pour un manqué contre 0,003 $ pour un atteint est 50x (dérivé).
Ce que cela signifie en pratique, c'est que la structure du prompt prime sur le choix du modèle. Passer de V4-Pro à Flash réduit les entrées en cache manqué de 4,4x (dérivé, 0,66 $ contre 0,15 $). Obtenir votre cache atteint sur V4-Pro le réduit de 30x. Le modèle le moins cher est le levier le moins important.
Les cache atteints proviennent d'un préfixe stable, donc les règles pratiques sont ennuyeuses et efficaces : gardez le prompt système octet par octet identique entre les appels, placez les définitions d'outils et le contexte récupéré avant tout ce qui est spécifique à l'utilisateur, et n'interpolez jamais un horodatage ou un identifiant de session près du haut d'un prompt.

Les noms de points de terminaison que DeepSeek V4.1 Flash a retirés
DeepSeek-V4.1-Flash a retiré les noms de modèles deepseek-v4-flash et deepseek-v4-flash-vision-exp. Le code qui envoie toujours l'une de ces chaînes échouera.
| Nom du modèle retiré | Statut |
|---|---|
deepseek-v4-flash | Retiré avec V4.1 Flash |
deepseek-v4-flash-vision-exp | Retiré avec V4.1 Flash |
C'était un changement discret plutôt qu'une dépréciation majeure, ce qui le rend coûteux. La chaîne du modèle est généralement la ligne la moins examinée dans une intégration IA : elle se trouve dans une variable d'environnement, un fichier de configuration, un modèle Terraform ou un wrapper SDK acheté, et personne ne la touche entre les versions.
Le problème plus large est la longue traîne de contenu. Les tutoriels, les vidéos YouTube, les réponses de forums et les exemples de code générés avant septembre 2026 font toujours référence aux anciens noms, et aucun d'entre eux ne sera corrigé. Un assistant qui a appris de ces pages continuera à les suggérer.
Si vous utilisez DeepSeek en production, recherchez les deux chaînes dans votre référentiel, puis vérifiez séparément la configuration de votre infrastructure et tout gestionnaire de secrets. Un nom de modèle défini il y a six mois dans une variable de déploiement n'apparaîtra pas dans une recherche de code.
Qu'est-ce qui a changé depuis le précédent guide tarifaire DeepSeek
Trois éléments ont invalidé des parties de chaque page tarifaire DeepSeek rédigée avant mi-août 2026 : la division pointe/hors pointe, la division V4-Pro et Flash, et les noms de points de terminaison retirés.
| Date | Version ou changement | Confiance |
|---|---|---|
| 24 avril 2026 | Aperçu V4-Pro et V4-Flash : contexte de 1M de tokens, jusqu'à 384K de sortie, modes de pensée et de non-pensée commutables | Moyenne |
| 31 juillet 2026 | DeepSeek-V4-Flash-0731, version stable de la gamme Flash | Moyenne |
| 13 août 2026 | Disponibilité générale de DeepSeek-V4-Pro-0813 | Élevée |
| 16 août 2026 | Introduction des prix en pointe et hors pointe | Moyenne |
| Vers le 10 septembre 2026 | DeepSeek-V4.1-Flash, anciens noms de points de terminaison Flash retirés | Élevée |
Le chiffre historique qui vaut la peine d'être connu est le dernier prix Flash connu avant le changement du 16 août : 0,14 $ par million d'entrées en cache-miss et 0,28 $ par million de sorties. C'est le nombre que la plupart des tableaux comparatifs tiers affichent encore. Ce n'est pas le prix actuel, et il précède entièrement le multiplicateur de pointe, donc toute prévision basée sur celui-ci sous-estime une charge de travail fortement axée sur la pointe d'environ 2x (dérivé : 0,14 $ contre le taux actuel de 0,30 $ pour les entrées en cache-miss en pointe est 2,1x).
Un prix d'entrée unique et fixe pour DeepSeek n'a désormais plus de sens sans deux qualificatifs : de quel côté du cache, et de quel côté de l'horloge.

DeepSeek n'a pas de niveau API gratuit ni de programme de crédit de démarrage
L'application de chat DeepSeek est gratuite. L'API ne l'est pas, et il n'y a pas de niveau gratuit indiqué sur la page de tarification officielle. DeepSeek n'a pas non plus de programme de crédit de démarrage dédié.
Les affirmations selon lesquelles les nouveaux comptes API reçoivent des crédits gratuits circulent largement et sont rapportées de manière incohérente. Elles ne sont pas confirmées sur la page de tarification officielle, alors planifiez votre premier mois de dépenses comme s'ils n'existaient pas.
Les hôtes tiers sont une solution partielle, avec la mise en garde habituelle que leurs prix et leurs conditions leur sont propres. Baseten liste les entrées DeepSeek V4.1 Flash à 0,30 $ par million et propose un crédit d'essai de 30 $ pour les nouveaux espaces de travail (vérifiez les deux avant de budgétiser en fonction). OpenRouter, Together et Fireworks hébergent également des modèles DeepSeek, et le choix entre eux concerne généralement le routage, la région et les limites de débit plutôt que le prix principal.
La véritable lacune pour les fondateurs est structurelle. La plupart des fournisseurs de modèles et d'infrastructure sur lesquels une startup s'appuie exploitent une forme de programme de crédit, et les montants et conditions actuels pour chacun sont ce que suit AI Perks. DeepSeek n'en exploite aucun, ce qui signifie que DeepSeek est la seule ligne de votre facture IA que vous payez toujours en espèces.
C'est l'argument pour le traiter comme le niveau par défaut bon marché à l'intérieur d'une pile plutôt que comme la pile entière. Routez le travail à haut volume, adapté au cache et hors pointe vers DeepSeek, et routez le travail qui nécessite un raisonnement de pointe vers un fournisseur dont la facture est couverte par quelqu'un d'autre. AI Perks suit 7,7 millions de dollars de crédits dans 194 entreprises, d'où provient cette seconde moitié.
Voir quels fournisseurs proposent des programmes de crédit sur getaiperks.com →
Foire aux questions
Combien coûte DeepSeek V4.1 Flash ?
DeepSeek V4.1 Flash coûte 0,15 $ par million de tokens d'entrée en cache-miss hors pointe et 0,30 $ en pointe. Les entrées en cache coûtent 0,003 $ hors pointe et 0,006 $ en pointe. DeepSeek n'a pas publié de prix de sortie vérifiable pour Flash, alors considérez toute donnée de sortie que vous trouvez ailleurs comme non vérifiée.
Quelles sont les heures de pointe et hors pointe de DeepSeek ?
Les heures de pointe sont de 01h00 à 04h00 et de 06h00 à 10h00 UTC en semaine. Tout le reste, y compris l'intervalle de 04h00 à 06h00 UTC entre les deux blocs et tout le trafic du week-end, est hors pointe à moitié prix. Dérivé de ces fenêtres, environ 79 % de la semaine est déjà hors pointe.
Pourquoi mon appel API deepseek-v4-flash échoue-t-il soudainement ?
DeepSeek-V4.1-Flash a retiré les noms de modèles deepseek-v4-flash et deepseek-v4-flash-vision-exp. Tout code, tutoriel ou configuration faisant toujours référence à ces chaînes échouera. Vérifiez vos variables d'environnement et votre configuration de déploiement ainsi que votre code source, car les noms de modèles se trouvent souvent en dehors du dépôt. Le changement a été déployé discrètement vers le 10 septembre 2026.
DeepSeek offre-t-il des crédits API gratuits aux nouveaux comptes ?
Il n'y a pas de niveau API gratuit indiqué sur la page de tarification officielle de DeepSeek. Les rapports sur les crédits pour nouveaux comptes sont incohérents et non confirmés, alors budgétez comme s'ils n'existaient pas. L'application de chat est gratuite. Pour les fournisseurs qui publient des programmes de crédit, consultez AI Perks.
DeepSeek a-t-il un programme de crédit pour les startups ?
Non. DeepSeek n'a aucun programme de crédit de démarrage dédié, ce qui en fait l'une des rares API de modèles majeurs que vous payez toujours en espèces. La plupart des autres fournisseurs en proposent un, et AI Perks suit 7,7 millions de dollars de crédits dans 194 entreprises pour les couvrir.
DeepSeek V4-Pro ou V4.1 Flash est-il moins cher ?
Flash est moins cher sur tous les comparables publiés : 0,15 $ contre 0,66 $ par million de tokens d'entrée en cache-miss hors pointe, soit un écart de 4,4x (dérivé). Mais corriger la mise en cache de votre prompt sur V4-Pro est un levier de 30x, donc la structure du prompt est plus importante que le choix du modèle. Aucun des deux n'a de programme de crédit derrière lui, ce qui est ce que AI Perks suit pour les fournisseurs qui en ont.
Abonnez-vous sur getaiperks.com →
DeepSeek est la ligne la moins chère de votre facture IA. Couvrez les autres lignes sur getaiperks.com.