Le coût réel d'un succès de cache DeepSeek
Sur DeepSeek-V4-Pro, un token d'entrée servi depuis le cache coûte 0,022 $ par million hors heures de pointe, contre 0,66 $ pour un échec de cache. C'est une réduction de 30x pour avoir envoyé le même préfixe deux fois.
La plupart des pages de tarification indiquent un seul chiffre d'entrée et passent à autre chose. DeepSeek en a quatre, car deux multiplicateurs distincts s'appliquent à chaque appel : si le préfixe a atteint le cache et à quelle heure de la journée vous l'avez envoyé.
| Modèle et fenêtre | Entrée succès cache | Entrée échec cache | Sortie |
|---|---|---|---|
| DeepSeek-V4-Pro-0813, hors heures de pointe | 0,022 $ | 0,66 $ | 1,98 $ |
| DeepSeek-V4-Pro-0813, heures de pointe | 0,044 $ | 1,32 $ | 3,96 $ |
| DeepSeek-V4.1-Flash, hors heures de pointe | 0,003 $ | 0,15 $ | non vérifié |
| DeepSeek-V4.1-Flash, heures de pointe | 0,006 $ | 0,30 $ | non vérifié |
Tous les chiffres sont en USD par million de tokens, issus de la documentation officielle de l'API en septembre 2026. Les prix de sortie de V4.1-Flash ne sont pas vérifiés ici, consultez donc la page officielle avant de budgétiser.
Le ratio Flash est encore plus large que celui du vaisseau amiral : 0,003 $ contre 0,15 $, soit un écart de 50x (dérivé des tarifs ci-dessus). AI Perks suit ce type de mécanique de fournisseur ainsi que les programmes de crédits qui la compensent.

Heures de pointe et hors heures de pointe : le seul fournisseur facturant à l'heure
Les heures de pointe de DeepSeek sont de 01h00 à 04h00 et de 06h00 à 10h00 UTC en semaine. Tout le reste, y compris tout le samedi et le dimanche, est facturé exactement à moitié prix.
Aucun autre fournisseur de modèles majeur ne fixe ses prix en fonction de l'heure de la journée, ce qui en fait le levier le plus négligé dans les travaux de réduction des coûts des LLM. Aucun guide d'optimisation écrit pour OpenAI ou Anthropic n'a de raison de le mentionner.
Dérivé de ces créneaux : les heures de pointe représentent 7 heures par jour sur 5 jours de semaine, soit 35 des 168 heures de la semaine. Environ 79 % du calendrier est déjà hors heures de pointe, donc la plupart des équipes bénéficient de la réduction par accident et pourraient en obtenir davantage intentionnellement.
Votre emplacement détermine l'exposition de votre journée de travail :
| Emplacement de l'équipe | Créneaux de pointe, heure locale | Exposition en jours ouvrables |
|---|---|---|
| Côte Est des États-Unis (UTC-4) | 21h00-00h00, 02h00-06h00 | Aucune, toute la journée de travail est hors heures de pointe |
| Côte Pacifique des États-Unis (UTC-7) | 18h00-21h00, 23h00-03h00 | Aucune |
| Europe centrale (UTC+2) | 03h00-06h00, 08h00-12h00 | Toute la matinée |
| Inde (UTC+5:30) | 06h30-09h30, 11h30-15h30 | La majeure partie de la journée de travail |
| Chine (UTC+8) | 09h00-12h00, 14h00-18h00 | Presque toute la journée |
Les heures locales sont converties à partir des créneaux UTC publiés aux décalages indiqués, et l'heure d'été les décale d'une heure. Le schéma n'est pas un accident : les créneaux de pointe correspondent aux heures de travail chinoises, de sorte que le trafic interactif d'une équipe américaine atterrit dans la moitié bon marché de l'horloge gratuitement.
Empiler les deux réductions : un écart de 60x sur un seul modèle
Un token d'entrée en cache hors heures de pointe à 0,022 $ contre un échec de cache aux heures de pointe à 1,32 $ représente un écart de 60x pour une sortie identique du même modèle.
Voici à quoi cela ressemble sur une charge de travail d'agent réaliste : un contexte de 200 000 tokens renvoyé 1 000 fois par jour, soit 200 millions de tokens d'entrée par jour sur V4-Pro.
| Scénario | Tarif par 1M | Coût d'entrée quotidien |
|---|---|---|
| Heures de pointe, chaque appel un échec de cache | 1,32 $ | 264,00 $ |
| Hors heures de pointe, chaque appel un échec de cache | 0,66 $ | 132,00 $ |
| Heures de pointe, chaque appel un succès de cache | 0,044 $ | 8,80 $ |
| Hors heures de pointe, chaque appel un succès de cache | 0,022 $ | 4,40 $ |
Les quatre lignes sont dérivées en multipliant les tarifs publiés par 200. L'écart entre la première ligne et la dernière est d'environ 260 $ par jour, soit environ 95 000 $ par an, sur une charge de travail qui ne change pas du tout.
Deux éléments en découlent que la plupart des analyses de coûts manquent :
Un vaisseau amiral en cache surpasse un petit modèle non mis en cache. L'entrée V4-Pro en cache à 0,022 $ hors heures de pointe est environ 7 fois moins chère que l'entrée V4.1-Flash non mise en cache à 0,15 $ (dérivé). Rétrograder le modèle pour économiser de l'argent est la mauvaise décision si le véritable problème est un cache que vous n'avez jamais réchauffé.
La sortie n'est jamais mise en cache. À 1,98 $ hors heures de pointe, un token de sortie coûte environ 90x un token d'entrée en cache (dérivé). Une fois que le cache fonctionne, vous n'avez plus de facture d'entrée, vous avez une facture de sortie, et toute économie supplémentaire provient de réponses plus courtes ou de budgets de réflexion plafonnés. Les équipes qui financent cette facture de sortie avec des crédits fournisseurs peuvent comparer ce qui est disponible sur getaiperks.com.

Ce qui a changé depuis notre précédent guide de tarification DeepSeek
Trois choses ont évolué en 2026 : V4-Pro-0813 a atteint la disponibilité générale le 13 août, les prix des heures de pointe et hors heures de pointe ont remplacé les tarifs forfaitaires à la mi-août, et V4.1-Flash a été lancé vers le 10 septembre.
Notre précédente page de tarification DeepSeek indique des tarifs forfaitaires par token sans composante horaire. Ceux-ci précèdent le changement et doivent être considérés comme historiques.
La chronologie, avec la confiance marquée honnêtement :
- 24 avril 2026 (confiance moyenne) : Prévisualisation de V4-Pro et V4-Flash, avec une fenêtre contextuelle de 1M de tokens, jusqu'à 384K tokens de sortie, et des modes de réflexion et de non-réflexion commutables.
- 31 juillet 2026 (confiance moyenne) : DeepSeek-V4-Flash-0731, la version stable de Flash. Les derniers prix connus avant le changement étaient de 0,14 $ par million d'entrées en cache manqué et 0,28 $ par million de sorties, tous deux forfaitaires. Historique uniquement.
- 13 août 2026 : Disponibilité générale de DeepSeek-V4-Pro-0813, le modèle de raisonnement et d'agent phare actuel.
- Vers le 10 septembre 2026 : DeepSeek-V4.1-Flash, répertorié dans la documentation sous le nom de "DeepSeek-Flash".
Si vous travaillez à partir d'un tutoriel ou d'un modèle de coût écrit avant août 2026, chaque chiffre d'entrée est faux dans les deux sens : trop élevé pour un succès de cache, trop bas pour un échec de cache aux heures de pointe.
Le renommage du point de terminaison qui casse le vieux code
DeepSeek-V4.1-Flash a discrètement retiré les noms de modèles deepseek-v4-flash et deepseek-v4-flash-vision-exp. Les requêtes utilisant toujours ces chaînes échoueront.
C'est le genre de changement qui se manifeste par un incident de production plutôt que par un ticket de migration, car le nom du modèle se trouve généralement dans un fichier de configuration que personne n'a ouvert depuis des mois. Les anciens exemples de code, les wrappers SDK et les tutoriels tiers font toujours référence aux noms retirés.
Ce qu'il faut faire avant votre prochain déploiement :
- Recherchez dans tout le dépôt les deux chaînes retirées, y compris la configuration de l'infrastructure et les notebooks.
- Vérifiez tout SDK ou framework d'agent fourni qui code en dur un modèle DeepSeek par défaut.
- Confirmez le chemin de la vision séparément, car le point de terminaison expérimental de la vision a également été renommé.
- Réexécutez votre modèle de coût par la suite, car le remplacement repose sur le nouveau calendrier des heures de pointe et hors heures de pointe.

Niveau gratuit et crédits DeepSeek : ce qui est réellement vrai
L'application de chat DeepSeek est gratuite. L'API ne l'est pas, et il n'y a pas de niveau gratuit indiqué sur la page de tarification officielle.
C'est là que la plupart des articles se trompent. Les affirmations selon lesquelles les nouveaux comptes API reçoivent des crédits gratuits circulent largement, sont rapportées de manière incohérente et ne sont pas confirmées sur la page de tarification officielle. Si vous avez besoin d'un solde de départ, supposez que vous le payez.
Plus important pour les fondateurs : DeepSeek n'exécute aucun programme de crédits de démarrage dédié. Il n'y a pas de candidature, pas de niveau basé sur les étapes, pas de parcours partenaire. Les prix bas par token sont toute l'offre, ce qui est un réel écart si vous assemblez une pile de crédits.
Cet écart est précisément la raison pour laquelle la décision de routage est importante. De nombreux fournisseurs proposent des programmes de démarrage, et AI Perks suit 7,7 millions de dollars de crédits dans 194 entreprises couvrant ceux qui le font. Le schéma pratique consiste à acheminer le trafic à haut volume et favorable au cache vers DeepSeek à 0,022 $ par million et à dépenser les crédits accordés sur les fournisseurs plus chers, où un token gratuit vaut beaucoup plus.
Acheter DeepSeek auprès de quelqu'un d'autre
Les hébergeurs tiers ne reproduisent pas le calendrier des heures de pointe et hors heures de pointe de DeepSeek, ce qui signifie qu'ils peuvent être moins chers que l'API de première partie pendant les heures de pointe et perdre beaucoup face à elle hors heures de pointe.
Baseten liste l'entrée DeepSeek V4.1 Flash à 0,30 $ par million (confiance moyenne, vérifiez avant de budgétiser), et le chiffre de sortie n'a pas été vérifié de manière fiable. Baseten offre également un crédit d'essai permanent de 30 $ pour un nouvel espace de travail.
Remarquez ce que valent 0,30 $ : c'est exactement le taux d'échec de cache de DeepSeek, et le double du taux hors heures de pointe (dérivé). Pour une équipe américaine ou européenne dont le trafic arrive principalement hors des heures de pointe de toute façon, un taux forfaitaire tiers n'est pas une économie évidente.
OpenRouter, Together et Fireworks hébergent également des modèles DeepSeek. Nous ne citons pas leurs prix ici car nous ne les avons pas vérifiés, et personne d'autre ne devrait le faire. Le compromis qualitatif est cependant cohérent :
- API de première partie : le seul endroit où la pile complète succès de cache et hors heures de pointe s'applique, et le chemin le moins cher par une large marge lorsque les deux fonctionnent.
- Hébergeurs tiers : tarifs forfaitaires, régions différentes, facturation unifiée, et généralement aucune exposition au niveau succès de cache de DeepSeek.
- Agrégateurs : utiles pour le basculement, à une prime que vous devriez mesurer plutôt qu'assumer.
Tarifez votre propre trafic par rapport aux deux, puis comparez le résultat avec les crédits disponibles sur d'autres fournisseurs sur getaiperks.com. Un token gratuit est meilleur qu'un token bon marché.

Foire aux questions
À quel point un succès de cache DeepSeek est-il moins cher ?
Sur DeepSeek-V4-Pro, un succès de cache coûte 0,022 $ par million de tokens d'entrée hors heures de pointe contre 0,66 $ pour un échec de cache, soit une différence de 30x. Sur V4.1-Flash, l'écart est encore plus grand, 0,003 $ contre 0,15 $, soit une différence de 50x (dérivé). Les tarifs proviennent de la documentation officielle de l'API en septembre 2026.
Quand sont les heures de pointe de DeepSeek ?
Les heures de pointe sont uniquement de 01h00 à 04h00 et de 06h00 à 10h00 UTC en semaine. Tout le reste, y compris les deux jours de week-end, est facturé à la moitié du tarif de pointe. Cela représente environ 79 % de la semaine hors heures de pointe (dérivé), de sorte que les équipes basées aux États-Unis bénéficient de la réduction pendant toute leur journée de travail sans rien changer.
DeepSeek a-t-il un niveau API gratuit ?
Aucun niveau API gratuit n'est indiqué sur la page de tarification officielle. L'application de chat grand public est gratuite, mais l'API est payante dès le premier token. Les rapports sur les crédits gratuits pour les nouveaux comptes sont incohérents et non confirmés. Les fournisseurs qui accordent des crédits sont suivis sur getaiperks.com.
DeepSeek offre-t-il des crédits de démarrage ?
DeepSeek n'exécute aucun programme de crédits de démarrage dédié. Les prix bas par token sont toute l'offre. Pour les fondateurs qui construisent une pile de crédits, c'est un écart qui vaut la peine d'être comblé ailleurs : AI Perks couvre 7,7 millions de dollars de crédits dans 194 entreprises auprès des fournisseurs qui proposent des programmes.
Pourquoi mon appel API DeepSeek a-t-il cessé de fonctionner ?
La cause la plus probable est le nom du modèle. DeepSeek-V4.1-Flash a retiré les noms de points de terminaison deepseek-v4-flash et deepseek-v4-flash-vision-exp, et les anciens tutoriels et fichiers de configuration y font toujours référence. Recherchez dans votre dépôt les deux chaînes, y compris les SDK et les notebooks fournis, puis vérifiez à nouveau votre modèle de coût par rapport aux tarifs actuels.
Dois-je utiliser DeepSeek V4-Pro ou V4.1-Flash ?
Faites le calcul avant de supposer que Flash est moins cher. L'entrée V4-Pro en cache à 0,022 $ hors heures de pointe est environ 7 fois moins chère que l'entrée Flash non mise en cache à 0,15 $ (dérivé), de sorte qu'un vaisseau amiral bien mis en cache peut surpasser un petit modèle non mis en cache sur la ligne d'entrée. Le volume de sortie, pas la taille du modèle, décide généralement de la facture.
Abonnez-vous sur getaiperks.com →
Mettez en cache le préfixe, expédiez hors des heures de pointe et laissez les crédits de quelqu'un d'autre couvrir le reste.