Exécuter DeepSeek localement : Ollama, poids ouverts, coût réel

Exécuter DeepSeek vous-même avec les poids ouverts et Ollama, et le calcul du seuil de rentabilité par rapport aux prix API de DeepSeek hors pointe et cache-hit.

DeepSeekOpen WeightsOllamaSelf-HostingAI Perks
Author Avatar
Andrew
AI Perks Team
11,644

Quick Answer

DeepSeek publie des poids ouverts, vous pouvez donc l'exécuter localement via Ollama ou le servir vous-même. Le coût est rarement la raison. DeepSeek divise par deux ses prix d'API en dehors des heures de pointe et facture environ 30 fois moins cher pour les entrées mises en cache, donc l'auto-hébergement doit être inférieur à 1,98 $ par million de tokens de sortie. Les crédits des fournisseurs qui proposent des programmes pour startups sont suivis sur getaiperks.com.

Pouvez-vous exécuter DeepSeek vous-même ?

Oui. Les versions open-weight de DeepSeek sont téléchargeables et exécutables sur votre propre matériel, et Ollama est le chemin le plus court vers une instance locale fonctionnelle. Le coût n'est presque jamais la raison de le faire.

Cette deuxième phrase est la partie que tous les autres guides omettent. L'API hébergée de DeepSeek offre deux réductions qui se cumulent, et ensemble, elles poussent le seuil de rentabilité de l'auto-hébergement à un niveau que la plupart des équipes ne peuvent pas atteindre avec des GPU loués.

L'auto-hébergement de DeepSeek est une décision de contrôle : résidence des données, fonctionnement hors ligne, épinglage de version. Traitez-le comme un plan d'épargne et les chiffres ci-dessous vous décevront.

Les crédits de modèle des fournisseurs qui les distribuent réellement sont suivis sur AI Perks.


Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

Comment exécuter DeepSeek avec Ollama

Ollama télécharge une copie quantifiée des poids, les conserve sur le disque local et expose un point de terminaison HTTP compatible OpenAI sur localhost:11434, de sorte que le code existant est rapidement adapté avec une modification de la ligne de base de l'URL.

La séquence de fonctionnement est courte :

  • ollama pull <deepseek-tag> pour récupérer les poids
  • ollama run <deepseek-tag> pour une invite interactive
  • Pointez votre SDK sur http://localhost:11434/v1 et passez toute chaîne non vide comme clé API

Trois points à vérifier sur la page du modèle avant de planifier un produit autour d'une étiquette :

Quelle variante l'étiquette contient réellement. Les poids qui tiennent sur un ordinateur portable et les poids derrière le point de terminaison hébergé de DeepSeek ne sont souvent pas le même modèle. Les variantes distillées et réduites partagent un nom de famille et se comportent différemment.

Quelle quantification vous avez téléchargée. Une construction 4 bits divise par deux la mémoire par rapport à une construction 8 bits et ne produit pas de sortie identique. Si vous effectuez des benchmarks localement et déployez contre l'API, vous comparez deux systèmes différents.

Votre véritable plafond de contexte. Localement, le contexte est limité par la mémoire dont vous disposez, et non par le chiffre maximum annoncé. Un nombre de contexte long provenant d'une version hébergée ne se transfère pas sur votre machine.


Ce que l'auto-hébergement doit surpasser

DeepSeek est le seul grand fournisseur de modèles qui facture selon l'heure de la journée. Les heures de pointe sont de 01h00 à 04h00 et de 06h00 à 10h00 UTC en semaine, et tout ce qui se trouve en dehors de ces fenêtres, y compris tout le week-end, coûte exactement la moitié.

Au-dessus de l'horloge se trouve une réduction de cache bien plus importante. Les tarifs publiés actuels, en USD par million de jetons :

Modèle et type de jetonHors pointePointe
DeepSeek-V4-Pro entrée, cache hit0,022 $0,044 $
DeepSeek-V4-Pro entrée, cache miss0,66 $1,32 $
DeepSeek-V4-Pro sortie1,98 $3,96 $
DeepSeek-V4.1-Flash entrée, cache hit0,003 $0,006 $
DeepSeek-V4.1-Flash entrée, cache miss0,15 $0,30 $

Un cache hit sur V4-Pro est environ 30 fois moins cher qu'un cache miss. Combinez cela avec l'horloge et un jeton d'entrée hors pointe mis en cache à 0,022 $ est 60 fois inférieur à un cache miss de pointe à 1,32 $, sur le même modèle. Rien dans votre propre infrastructure n'a un levier de 60x. La ventilation complète des fenêtres se trouve dans notre guide de tarification hors pointe de DeepSeek.


Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

Les calculs du seuil de rentabilité pour exécuter DeepSeek localement

Dérivé des tarifs publiés ci-dessus : pour battre l'API hors pointe de DeepSeek sur la sortie, votre matériel doit produire un million de jetons de sortie par heure pour moins de 1,98 $, tout compris.

Ce cadrage est plus utile que toute liste de prix GPU, car il s'applique quelle que soit la location. Prenez le débit que vous pouvez réellement maintenir et comparez-le à ce que le même volume coûte sur l'API :

Débit de sortie soutenuCoût API hors pointeCoût API en pointe
100 000 jetons/heure0,20 $0,40 $
500 000 jetons/heure0,99 $1,98 $
1 000 000 jetons/heure1,98 $3,96 $
5 000 000 jetons/heure9,90 $19,80 $
10 000 000 jetons/heure19,80 $39,60 $

Chiffres dérivés des tarifs par jeton publiés par DeepSeek, non cités par DeepSeek.

Lisez attentivement la ligne du milieu. Une machine qui sert un million de jetons de sortie chaque heure, 24h/24 et 7j/7, remplace environ 1 425 $ par mois de dépenses API hors pointe (dérivé : 1,98 $ x 24 heures x 30 jours = 1 425,60 $). Votre accélérateur, l'hôte, le stockage, la bande passante et l'ingénieur qui le maintient en vie doivent tous tenir là-dedans.

L'entrée est pire. Si votre charge de travail est dominée par une invite système réutilisée, l'API facture 0,022 $ par million de jetons mis en cache hors pointe. L'auto-hébergement doit battre deux centimes par million. Ce ne sera pas le cas.

La conclusion honnête : l'auto-hébergement de DeepSeek est rentable pour un volume véritablement important, constant et à forte utilisation, et presque nulle part ailleurs. Pour tout ce qui se trouve en dessous de cette ligne, le mouvement le moins cher est l'API plus les crédits gratuits d'autres fournisseurs, ce qui est ce pour quoi getaiperks.com existe pour cartographier.


Quand exécuter DeepSeek vous-même est le bon choix

L'auto-hébergement de DeepSeek gagne sur le contrôle, pas sur le prix. Cinq situations le justifient indépendamment du tableau de rentabilité.

Résidence des données et conformité. Si les invites contiennent du matériel qui ne peut pas quitter votre juridiction ou votre réseau, aucune réduction par jeton ne rend l'option hébergée viable. C'est la raison légitime la plus courante.

Fonctionnement isolé et hors ligne. Les déploiements sur le terrain, les installations sécurisées et la connectivité peu fiable nécessitent tous une inférence qui ne dépend pas d'un point de terminaison joignable.

Épinglage de version. Les poids locaux ne changent pas sous votre contrôle. Les modèles hébergés, si, et DeepSeek l'a prouvé.

Immunité à l'horloge. Une courbe de coûts auto-hébergée est plate. La courbe de l'API oscille 2 fois entre le mardi matin et le samedi soir, ce qui rend la planification de capacité compliquée pour tout ce qui est lié à la latence pendant les heures ouvrables.

Accès aux poids eux-mêmes. Le réglage fin, l'inspection des logits et le décodage personnalisé ne sont tout simplement pas disponibles via une API. Si votre produit en a besoin, la décision n'a jamais porté sur le coût.


Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

Ce qui a changé depuis notre précédent guide sur DeepSeek

Notre page de tarification DeepSeek de 2026 précède la génération V4 et l'ensemble du système pointe et hors pointe. Quatre choses ont bougé.

QuandQuoi a été livré
24 avril 2026Aperçu de V4-Pro et V4-Flash, avec un contexte de 1 million de jetons et des modes de réflexion commutables rapportés au lancement
31 juillet 2026DeepSeek-V4-Flash-0731, la version Flash stable
13 août 2026DeepSeek-V4-Pro-0813 atteint la disponibilité générale
Autour du 10 septembre 2026DeepSeek-V4.1-Flash, répertorié dans la documentation sous le nom de DeepSeek-Flash

Avant le changement de prix d'août, la ligne Flash était dernièrement connue à 0,14 $ par million de jetons d'entrée avec cache miss et 0,28 $ par million de sortie. C'est un contexte historique, pas un tarif que vous pouvez facturer aujourd'hui.

La modification disruptive mérite un avertissement. DeepSeek-V4.1-Flash a retiré les noms de point de terminaison deepseek-v4-flash et deepseek-v4-flash-vision-exp. Les tutoriels, les réponses Stack Overflow et les anciens exemples de code y font toujours référence, et ces appels échouent maintenant. Si vous avez hérité d'une intégration DeepSeek écrite avant septembre, recherchez les deux chaînes avant de déboguer quoi que ce soit d'autre.

Ce retrait est également l'argument pratique le plus fort pour les poids locaux : un modèle sur votre disque ne peut pas être renommé sous un déploiement.


DeepSeek n'offre pas de crédits de démarrage

L'application de chat DeepSeek est gratuite. L'API ne l'est pas, et DeepSeek n'exploite aucun programme de crédits de démarrage dédié.

Être précis ici est important, car c'est là que la plupart des articles deviennent négligents :

  • L'application de chat grand public est gratuite à utiliser
  • Il n'y a pas de niveau gratuit d'API déclaré sur la page de tarification officielle de DeepSeek
  • Les affirmations de crédits API gratuits pour les nouveaux comptes sont rapportées de manière incohérente et non confirmées sur la page officielle, traitez-les donc comme non vérifiées
  • DeepSeek ne publie aucun programme de crédits pour fondateurs, startups ou chercheurs

Ce dernier point est un réel écart. Un fondateur peut exécuter DeepSeek à faible coût, mais ne peut pas l'exécuter gratuitement, et ne peut pas le compenser avec une subvention comme il peut le faire avec les fournisseurs qui exploitent des programmes. AI Perks suit 7,7 millions de dollars de crédits dans 194 entreprises, couvrant les fournisseurs qui distribuent des crédits.

Les hôtes tiers sont l'autre voie. Baseten liste DeepSeek V4.1 Flash entrée à 0,30 $ par million et offre un crédit d'essai permanent de 30 $ pour un nouvel espace de travail. OpenRouter, Together et Fireworks servent également des modèles DeepSeek. Vérifiez vous-même tous leurs tarifs actuels avant de budgétiser en fonction de ceux-ci, car les prix des itinéraires évoluent plus vite que les prix des modèles.


Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

Foire aux questions

Puis-je exécuter DeepSeek localement avec Ollama ?

Oui. Ollama télécharge une copie quantifiée des poids sur le disque local et sert un point de terminaison compatible OpenAI sur localhost:11434, de sorte que le code existant n'a besoin que d'une modification de l'URL de base. Confirmez quelle variante et quelle quantification se trouvent derrière l'étiquette avant de faire des benchmarks, car les constructions locales et le modèle hébergé de DeepSeek ne sont souvent pas les mêmes poids.

Est-il moins cher d'auto-héberger DeepSeek que d'utiliser l'API ?

Généralement non. DeepSeek facture 1,98 $ par million de jetons de sortie hors pointe, donc une machine servant un million de jetons de sortie par heure remplace environ 1 425 $ par mois (dérivé : 1,98 $ x 24 x 30). L'entrée mise en cache coûte 0,022 $ par million, ce que aucun matériel ne surpasse. Auto-hébergez pour la résidence et le contrôle. Pour le coût, utilisez les crédits de AI Perks.

DeepSeek est-il open source ?

DeepSeek est mieux décrit comme open weights plutôt que open source : les fichiers de modèle publiés sont téléchargeables et exécutables, ce qui rend le déploiement local possible. Consultez le propre dépôt de modèles de DeepSeek pour confirmer quelle génération et quelle variante sont réellement publiées, car le modèle phare servi par l'API et la construction téléchargeable ne sont pas toujours identiques.

Pourquoi mon appel API deepseek-v4-flash a-t-il cessé de fonctionner ?

DeepSeek-V4.1-Flash a retiré les noms de point de terminaison deepseek-v4-flash et deepseek-v4-flash-vision-exp. Tout code ou tutoriel écrit avant septembre 2026 qui y fait référence échouera. Mettez à jour vers l'identifiant de modèle actuel dans la documentation API de DeepSeek. Ce renommage est un bon argument pour épingler les poids locaux si la stabilité est importante pour vous.

DeepSeek offre-t-il des crédits API gratuits aux nouveaux comptes ?

Il n'y a pas de niveau gratuit d'API déclaré sur la page de tarification officielle de DeepSeek, et les rapports sur les crédits pour les nouveaux comptes sont incohérents et non confirmés. DeepSeek n'exploite pas non plus de programme de crédits pour startups. Les fournisseurs qui en ont un sont suivis, avec les montants actuels, sur AI Perks.

Ai-je besoin d'un GPU pour exécuter DeepSeek localement ?

Les variantes quantifiées plus petites fonctionneront sur CPU, mais le débit chute suffisamment pour exclure la plupart des utilisations interactives. Les constructions plus grandes nécessitent une mémoire d'accélérateur proportionnelle à leur taille et à leur quantification. Consultez la carte du modèle pour l'étiquette spécifique plutôt que de faire confiance à une exigence générique, et attendez-vous à une réelle différence entre "charge" et "utilisable".


DeepSeek vous offre un véritable choix : une API hébergée tarifiée à l'heure et au cache, ou la même famille de poids sur du matériel que vous contrôlez. Choisissez le contrôle lorsque vous avez besoin de contrôle. Choisissez l'API lorsque vous avez besoin de débit, et couvrez la facture avec les crédits des fournisseurs qui les donnent encore.

Abonnez-vous sur getaiperks.com →

Exécutez-le vous-même ou louez-le. Dans tous les cas, arrêtez de payer le prix fort sur getaiperks.com.

This content is for informational purposes only and may contain inaccuracies. Credit programs, amounts, and eligibility requirements change frequently. Always verify details directly with the provider.