DeepSeek Lokal Ausführen: Ollama, Open Weights, Reale Kosten

DeepSeek selbst ausführen mit offenen Gewichten und Ollama, und die Break-Even-Rechnung gegen DeepSeek Off-Peak- und Cache-Hit-API-Preise.

DeepSeekOpen WeightsOllamaSelf-HostingAI Perks
Author Avatar
Andrew
AI Perks Team
6,771

Quick Answer

DeepSeek veröffentlicht offene Gewichte, sodass Sie es lokal über Ollama ausführen oder selbst hosten können. Die Kosten sind selten der Grund dafür. DeepSeek halbiert seine API-Preise außerhalb der Spitzenzeiten und berechnet für gecachte Eingaben etwa 30-mal weniger, sodass sich das Selbst-Hosting für 1,98 US-Dollar pro Million Ausgabetoken lohnen muss. Credits von Anbietern, die Startup-Programme anbieten, werden unter getaiperks.com verfolgt.

Können Sie DeepSeek selbst ausführen?

Ja. Die Open-Weight-Releases von DeepSeek können heruntergeladen und auf Ihrer eigenen Hardware ausgeführt werden, und Ollama ist der kürzeste Weg zu einer funktionierenden lokalen Instanz. Kosten sind fast nie der Grund dafür.

Der zweite Satz ist der Teil, den jeder andere Leitfaden auslässt. Die gehostete API von DeepSeek bietet zwei Rabatte, die sich stapeln, und zusammen drücken sie den Break-Even-Punkt für das Self-Hosting an einen Ort, den die meisten Teams mit gemieteten GPUs nicht erreichen können.

Das Self-Hosting von DeepSeek ist eine Kontrollentscheidung: Datenresidenz, Offline-Betrieb, Versionsfixierung. Betrachten Sie es als einen Sparplan, und die Zahlen unten werden Sie enttäuschen.

Modellguthaben von den Anbietern, die sie tatsächlich verteilen, werden unter AI Perks verfolgt.


Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

Wie Sie DeepSeek mit Ollama ausführen

Ollama lädt eine quantisierte Kopie der Gewichte herunter, speichert sie auf der lokalen Festplatte und stellt einen OpenAI-kompatiblen HTTP-Endpunkt auf localhost:11434 bereit, sodass vorhandener Code mit einer einzeiligen Basis-URL-Änderung übernommen werden kann.

Die Arbeitssequenz ist kurz:

  • ollama pull <deepseek-tag> zum Abrufen der Gewichte
  • ollama run <deepseek-tag> für eine interaktive Eingabeaufforderung
  • Richten Sie Ihr SDK auf http://localhost:11434/v1 und übergeben Sie eine beliebige nicht leere Zeichenfolge als API-Schlüssel

Drei Dinge, die Sie auf der Modellseite überprüfen sollten, bevor Sie ein Produkt um ein Tag herum planen:

Welche Variante das Tag tatsächlich enthält. Die Gewichte, die auf einen Laptop passen, und die Gewichte hinter dem gehosteten Endpunkt von DeepSeek sind häufig nicht dasselbe Modell. Destillierte und reduzierte Varianten teilen sich einen Familiennamen und verhalten sich unterschiedlich.

Welche Quantisierung Sie heruntergeladen haben. Eine 4-Bit-Version halbiert den Speicher im Vergleich zu einer 8-Bit-Version und liefert keine identischen Ergebnisse. Wenn Sie lokal Benchmarks durchführen und gegen die API bereitstellen, vergleichen Sie zwei verschiedene Systeme.

Ihre tatsächliche Kontextgrenze. Lokal ist der Kontext durch den verfügbaren Speicher begrenzt, nicht durch die Höchstzahl in der Ankündigung. Eine Zahl für langen Kontext aus einer gehosteten Version wird nicht auf Ihren Rechner übertragen.


Was das Self-Hosting schlagen muss

DeepSeek ist der einzige große Modellhersteller, der nach Tageszeit abrechnet. Spitzenzeiten sind Wochentags von 01:00 bis 04:00 und 06:00 bis 10:00 UTC, und alles außerhalb dieser Fenster, einschließlich des gesamten Wochenendes, kostet genau die Hälfte.

Über die Uhrzeit hinaus gibt es einen deutlich größeren Cache-Rabatt. Aktuelle veröffentlichte Preise in USD pro Million Token:

Modell und Token-TypAußerhalb der SpitzenzeitenSpitzenzeit
DeepSeek-V4-Pro Eingabe, Cache-Treffer0,022 $0,044 $
DeepSeek-V4-Pro Eingabe, Cache-Fehlzugriff0,66 $1,32 $
DeepSeek-V4-Pro Ausgabe1,98 $3,96 $
DeepSeek-V4.1-Flash Eingabe, Cache-Treffer0,003 $0,006 $
DeepSeek-V4.1-Flash Eingabe, Cache-Fehlzugriff0,15 $0,30 $

Ein Cache-Treffer bei V4-Pro ist ungefähr 30x günstiger als ein Cache-Fehlzugriff. Kombinieren Sie das mit der Uhrzeit, und ein gecachter Eingabe-Token außerhalb der Spitzenzeiten für 0,022 $ liegt 60x unter einem Spitzen-Cache-Fehlzugriff für 1,32 $, beim selben Modell. Nichts in Ihrer eigenen Infrastruktur hat einen 60-fachen Hebel. Die vollständige Aufschlüsselung der Fenster finden Sie in unserem Leitfaden zu DeepSeek-Preisen außerhalb der Spitzenzeiten.


Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

Die Break-Even-Rechnung für die lokale Ausführung von DeepSeek

Abgeleitet aus den oben genannten veröffentlichten Preisen: Um die API außerhalb der Spitzenzeiten von DeepSeek für die Ausgabe zu schlagen, muss Ihre Hardware eine Million Ausgabetoken pro Stunde für unter 1,98 $ produzieren, alles inklusive.

Diese Formulierung ist nützlicher als jede GPU-Preisliste, da sie alles abdeckt, was Sie mieten. Nehmen Sie den Durchsatz, den Sie tatsächlich aufrechterhalten können, und vergleichen Sie ihn mit den Kosten für das gleiche Volumen über die API:

Aufrechterhaltener AusgabedurchsatzAPI-Kosten außerhalb der SpitzenzeitenAPI-Kosten zur Spitzenzeit
100.000 Token/Stunde0,20 $0,40 $
500.000 Token/Stunde0,99 $1,98 $
1.000.000 Token/Stunde1,98 $3,96 $
5.000.000 Token/Stunde9,90 $19,80 $
10.000.000 Token/Stunde19,80 $39,60 $

Die Zahlen sind aus den veröffentlichten Token-Preisen von DeepSeek abgeleitet, nicht von DeepSeek zitiert.

Lesen Sie die mittlere Zeile sorgfältig. Eine Maschine, die rund um die Uhr eine Million Ausgabetoken pro Stunde liefert, ersetzt monatlich etwa 1.425 $ an API-Ausgaben außerhalb der Spitzenzeiten (abgeleitet: 1,98 $ x 24 Stunden x 30 Tage = 1.425,60 $). Ihr Beschleuniger, der Host, der Speicher, die Bandbreite und der Ingenieur, der ihn am Laufen hält, müssen alle darin enthalten sein.

Die Eingabe ist schlimmer. Wenn Ihre Arbeitslast von einem wiederverwendeten System-Prompt dominiert wird, berechnet die API 0,022 $ pro Million gecachter Token außerhalb der Spitzenzeiten. Das Self-Hosting muss zwei Cent pro Million schlagen. Das wird es nicht.

Die ehrliche Schlussfolgerung: Das Self-Hosting von DeepSeek lohnt sich bei wirklich großem, konstantem Volumen mit hoher Auslastung und fast nirgendwo sonst. Für alles unter dieser Linie ist die günstigere Option die API plus kostenlose Credits von anderen Anbietern, was getaiperks.com abbildet.


Wann es richtig ist, DeepSeek selbst auszuführen

Das Self-Hosting von DeepSeek gewinnt bei der Kontrolle, nicht beim Preis. Fünf Situationen rechtfertigen es unabhängig von der Break-Even-Tabelle.

Datenresidenz und Compliance. Wenn Prompts Materialien enthalten, die Ihre Gerichtsbarkeit oder Ihr Netzwerk nicht verlassen dürfen, macht kein Token-Rabatt die gehostete Option rentabel. Dies ist der häufigste legitime Grund.

Air-gapped und Offline-Betrieb. Feldeinsätze, sichere Einrichtungen und unzuverlässige Konnektivität erfordern Inferenz, die nicht von einem erreichbaren Endpunkt abhängt.

Versionsfixierung. Lokale Gewichte ändern sich nicht unter Ihnen. Gehostete Modelle tun es, und DeepSeek hat bewiesen, dass es so ist.

Immunität gegen die Uhrzeit. Eine Self-Hosting-Kostenkurve ist flach. Die Kurve der API schwankt um das 2-fache zwischen Dienstagmorgen und Samstagabend, was die Kapazitätsplanung dagegen für alles, was Latenz-gebunden an die Geschäftszeiten ist, umständlich macht.

Zugriff auf die Gewichte selbst. Fine-Tuning, Logit-Inspektion und benutzerdefinierte Dekodierung sind über eine API einfach nicht verfügbar. Wenn Ihr Produkt sie benötigt, ging es nie um die Kosten.


Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

Was sich seit unserem früheren DeepSeek-Leitfaden geändert hat

Unsere DeepSeek-Preis-Seite von 2026 liegt vor der V4-Generation und dem gesamten Spitzen- und Nebensaison-System. Vier Dinge haben sich geändert.

WannWas wurde ausgeliefert
24. April 2026V4-Pro und V4-Flash Vorschau mit 1M-Token-Kontext und umschaltbaren Denkmodi, die bei der Veröffentlichung berichtet wurden
31. Juli 2026DeepSeek-V4-Flash-0731, die stabile Flash-Version
13. August 2026DeepSeek-V4-Pro-0813 erreicht die allgemeine Verfügbarkeit
Ungefähr 10. September 2026DeepSeek-V4.1-Flash, in den Dokumenten als DeepSeek-Flash aufgeführt

Vor der Preisänderung im August wurde die Flash-Zeile zuletzt mit 0,14 $ pro Million Eingabetoken mit Cache-Fehlzugriff und 0,28 $ pro Million Ausgabetoken aufgeführt. Das ist historischer Kontext, keine Rate, die Sie heute in Rechnung stellen können.

Die Breaking-Change-Änderung verdient eine eigene Warnung. DeepSeek-V4.1-Flash hat die Endpunktnamen deepseek-v4-flash und deepseek-v4-flash-vision-exp stillschweigend ausgemustert. Tutorials, Stack Overflow-Antworten und ältere Codebeispiele beziehen sich immer noch darauf, und diese Aufrufe schlagen nun fehl. Wenn Sie eine DeepSeek-Integration geerbt haben, die vor September geschrieben wurde, durchsuchen Sie beide Zeichenfolgen, bevor Sie etwas anderes debuggen.

Diese Ausmusterung ist auch das stärkste praktische Argument für lokale Gewichte: Ein Modell auf Ihrer Festplatte kann nicht umbenannt werden, ohne dass eine Bereitstellung darunter leidet.


DeepSeek hat kein Startup-Guthabenprogramm

Die DeepSeek Chat-App ist kostenlos. Die API ist es nicht, und DeepSeek betreibt überhaupt kein spezielles Startup-Guthabenprogramm.

Präzision ist hier wichtig, weil die meisten Artikel hier schlampig werden:

  • Die Consumer-Chat-App ist kostenlos nutzbar
  • Es gibt keinen angegebenen kostenlosen API-Tier auf der offiziellen Preis-Seite von DeepSeek
  • Behauptungen über kostenlose API-Credits für neue Konten werden inkonsistent gemeldet und nicht auf der offiziellen Seite bestätigt, also behandeln Sie sie als unbestätigt
  • DeepSeek veröffentlicht keine Gründer-, Startup- oder Forschungsguthaben-Tracks

Der letzte Punkt ist eine echte Lücke. Ein Gründer kann DeepSeek günstig betreiben, aber nicht kostenlos, und kann es nicht mit einem Zuschuss ausgleichen, wie er es bei Anbietern tun kann, die Programme betreiben. AI Perks verfolgt 7,7 Mio. $ an Guthaben bei 194 Unternehmen, die die Anbieter abdecken, die Guthaben verteilen.

Drittanbieter-Hosts sind die andere Route. Baseten listet DeepSeek V4.1 Flash Eingabe für 0,30 $ pro Million und bietet einen stehenden Testguthaben von 30 $ für neue Arbeitsbereiche an. OpenRouter, Together und Fireworks bieten ebenfalls DeepSeek-Modelle an. Überprüfen Sie die aktuellen Tarife selbst, bevor Sie diese budgetieren, da Routing-Preise sich schneller ändern als Modellpreise.


Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

Häufig gestellte Fragen

Kann ich DeepSeek lokal mit Ollama ausführen?

Ja. Ollama lädt eine quantisierte Kopie der Gewichte auf die lokale Festplatte und stellt einen OpenAI-kompatiblen Endpunkt auf localhost:11434 bereit, sodass vorhandener Code nur eine Basis-URL-Änderung benötigt. Bestätigen Sie, welche Variante und Quantisierung hinter dem Tag stecken, bevor Sie Benchmarks durchführen, da lokale Builds und das gehostete Modell von DeepSeek häufig nicht dieselben Gewichte sind.

Ist es günstiger, DeepSeek selbst zu hosten, als die API zu nutzen?

Meistens nicht. DeepSeek berechnet 1,98 $ pro Million Ausgabetoken außerhalb der Spitzenzeiten, sodass eine Rig, die eine Million Ausgabetoken pro Stunde liefert, etwa 1.425 $ pro Monat ersetzt (abgeleitet: 1,98 $ x 24 x 30). Gecachte Eingaben kosten 0,022 $ pro Million, was keine Hardware schlägt. Self-host für Residenz und Kontrolle. Für die Kosten nutzen Sie Credits von AI Perks.

Ist DeepSeek Open Source?

DeepSeek wird am besten als Open Weights denn als Open Source beschrieben: Die veröffentlichten Modelldateien sind herunterladbar und ausführbar, was eine lokale Bereitstellung ermöglicht. Überprüfen Sie das eigene Modell-Repository von DeepSeek, um zu bestätigen, welche Generation und welche Variante tatsächlich veröffentlicht ist, da das über die API bereitgestellte Flaggschiff und der herunterladbare Build nicht immer identisch sind.

Warum hat mein deepseek-v4-flash API-Aufruf aufgehört zu funktionieren?

DeepSeek-V4.1-Flash hat die Endpunktnamen deepseek-v4-flash und deepseek-v4-flash-vision-exp ausgemustert. Jeder Code oder jedes Tutorial, das vor September 2026 geschrieben wurde und sich darauf bezieht, wird fehlschlagen. Aktualisieren Sie auf den aktuellen Modellbezeichner in den DeepSeek API-Dokumenten. Diese Umbenennung ist ein gutes Argument für die Fixierung lokaler Gewichte, wenn Stabilität für Sie wichtig ist.

Gibt DeepSeek kostenlose API-Credits für neue Konten?

Es gibt keinen angegebenen kostenlosen API-Tier auf der offiziellen Preis-Seite von DeepSeek, und Berichte über neue Konten-Credits sind inkonsistent und unbestätigt. DeepSeek betreibt auch kein Startup-Kreditprogramm. Die Anbieter, die eines betreiben, werden unter AI Perks mit den aktuellen Beträgen verfolgt.

Benötige ich eine GPU, um DeepSeek lokal auszuführen?

Kleinere quantisierte Varianten laufen auf der CPU, aber der Durchsatz sinkt so stark, dass die meisten interaktiven Nutzungen ausgeschlossen werden. Größere Builds benötigen Grafikspeicher im Verhältnis zu ihrer Größe und Quantisierung. Überprüfen Sie die Modellkarte für das spezifische Tag, anstatt sich auf eine allgemeine Anforderung zu verlassen, und erwarten Sie eine echte Lücke zwischen "lädt" und "nutzbar".


DeepSeek bietet Ihnen eine echte Wahl: eine gehostete API, die nach Uhrzeit und Cache bepreist wird, oder die gleiche Familie von Gewichten auf Hardware, die Sie kontrollieren. Wählen Sie Kontrolle, wenn Sie Kontrolle brauchen. Wählen Sie die API, wenn Sie Durchsatz brauchen, und decken Sie die Rechnung mit Credits von den Anbietern, die sie noch verschenken.

Abonnieren Sie unter getaiperks.com →

Führen Sie es selbst aus oder mieten Sie es. Beides tut, zahlen Sie nicht mehr den vollen Preis auf getaiperks.com.

This content is for informational purposes only and may contain inaccuracies. Credit programs, amounts, and eligibility requirements change frequently. Always verify details directly with the provider.