DeepSeek-Kontext-Caching 2026: Der 30-fache Eingaberabatt

DeepSeek verlangt 30x weniger für gecachte Eingaben als für einen Cache-Fehler und halbiert jeden Preis außerhalb der Stoßzeiten. Die V4-Pro und V4.1-Flash-Preise, richtig erklärt.

DeepSeekContext CachingLLM PricingAI API CostsAI Perks
Author Avatar
Andrew
AI Perks Team
11,640

Quick Answer

Ein Cache-Treffer auf DeepSeek-V4-Pro kostet 0,022 US-Dollar pro Million Eingabe-Token außerhalb der Spitzenzeiten im Vergleich zu 0,66 US-Dollar für einen Cache-Fehler, ein 30-facher Rabatt auf dasselbe Modell. DeepSeek halbiert auch jeden Preis außerhalb der Spitzenstunden, sodass ein gecachter Token außerhalb der Spitzenzeiten 60-mal günstiger ist als ein Cache-Fehler während der Spitzenzeiten. Credits von Anbietern, die Startup-Programme anbieten, werden unter getaiperks.com verfolgt.

Was ein DeepSeek Cache-Treffer tatsächlich kostet

Auf DeepSeek-V4-Pro kostet ein aus dem Cache abgerufener Eingabetoken außerhalb der Spitzenzeiten 0,022 US-Dollar pro Million, verglichen mit 0,66 US-Dollar bei einem Cache-Fehltreffer. Das ist ein 30-facher Rabatt für das zweimalige Senden desselben Präfixes.

Die meisten Preisgestaltungsseiten geben eine Eingabezahl an und gehen dann weiter. DeepSeek hat vier, da auf jeden einzelnen Aufruf zwei separate Multiplikatoren angewendet werden: ob der Präfix den Cache getroffen hat und zu welcher Tageszeit er gesendet wurde.

Modell und FensterEingabe mit Cache-TrefferEingabe bei Cache-FehltrefferAusgabe
DeepSeek-V4-Pro-0813, außerhalb der Spitzenzeiten$0.022$0.66$1.98
DeepSeek-V4-Pro-0813, Spitzenzeiten$0.044$1.32$3.96
DeepSeek-V4.1-Flash, außerhalb der Spitzenzeiten$0.003$0.15nicht verifiziert
DeepSeek-V4.1-Flash, Spitzenzeiten$0.006$0.30nicht verifiziert

Alle Angaben in US-Dollar pro Million Tokens, aus den offiziellen API-Dokumenten vom September 2026. Die Ausgabepreise für V4.1-Flash sind hier nicht verifiziert, prüfen Sie daher die offizielle Seite, bevor Sie damit planen.

Das Flash-Verhältnis ist sogar noch größer als das des Flaggschiffs: 0,003 US-Dollar gegenüber 0,15 US-Dollar ist eine Lücke von 50x (abgeleitet von den oben genannten Raten). AI Perks verfolgt diese Art von Anbietermechanismen neben den dafür ausgeglichenen Kreditprogrammen.


Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

Spitzenzeiten und Nebenzeiten: Der einzige Anbieter, der nach Uhrzeit abrechnet

Die Spitzenzeiten von DeepSeek sind werktags von 01:00 bis 04:00 Uhr und von 06:00 bis 10:00 Uhr UTC. Alles andere, einschließlich des gesamten Samstags und Sonntags, wird zum halben Preis abgerechnet.

Kein anderer großer Modellieferant berechnet die Preise nach Tageszeit, was ihn zum am meisten übersehenen Hebel bei der Arbeit an LLM-Kosten macht. Kein Optimierungsleitfaden für OpenAI oder Anthropic hat einen Grund, ihn zu erwähnen.

Abgeleitet von diesen Fenstern: Spitzenzeiten sind 7 Stunden pro Tag an 5 Wochentagen, also 35 von den 168 Stunden der Woche. Etwa 79 % der Kalenderwoche fallen bereits in die Nebenzeiten, sodass die meisten Teams den Rabatt versehentlich erhalten und bewusst mehr davon bekommen könnten.

Wo Sie sich befinden, bestimmt, wie viel von Ihrem Arbeitstag betroffen ist:

Standort des TeamsSpitzenzeiten, lokale ZeitBelastung am Geschäftstag
US East (UTC-4)21:00-00:00, 02:00-06:00Keine, der gesamte Arbeitstag fällt in die Nebenzeiten
US Pacific (UTC-7)18:00-21:00, 23:00-03:00Keine
Mitteleuropa (UTC+2)03:00-06:00, 08:00-12:00Der gesamte Vormittag
Indien (UTC+5:30)06:30-09:30, 11:30-15:30Der Großteil des Arbeitstages
China (UTC+8)09:00-12:00, 14:00-18:00Fast der gesamte Arbeitstag

Lokale Zeiten werden von den angegebenen UTC-Fenstern mit den angezeigten Versätzen umgerechnet, und die Sommerzeit verschiebt sie um eine Stunde. Das Muster ist kein Zufall: Die Spitzenzeitfenster fallen auf den chinesischen Arbeitstag, sodass der interaktive Verkehr eines US-Teams kostenlos in die günstige Hälfte der Uhr fällt.


Beide Rabatte kombinieren: Eine 60-fache Spanne bei einem Modell

Ein aus dem Cache abgerufener Eingabetoken außerhalb der Spitzenzeiten für 0,022 US-Dollar im Vergleich zu einem Cache-Fehltreffer zu Spitzenzeiten für 1,32 US-Dollar ergibt eine Spanne von 60x bei identischer Ausgabe desselben Modells.

So sieht das bei einer realistischen Agenten-Arbeitslast aus: Ein 200.000-Token-Kontext, der 1.000 Mal pro Tag erneut gesendet wird, also täglich 200 Millionen Eingabetoken auf V4-Pro.

SzenarioPreis pro 1 Mio.Tägliche Kosten für Eingaben
Spitzenzeiten, jeder Aufruf ein Cache-Fehltreffer$1.32$264.00
Außerhalb der Spitzenzeiten, jeder Aufruf ein Cache-Fehltreffer$0.66$132.00
Spitzenzeiten, jeder Aufruf ein Cache-Treffer$0.044$8.80
Außerhalb der Spitzenzeiten, jeder Aufruf ein Cache-Treffer$0.022$4.40

Alle vier Zeilen ergeben sich durch Multiplikation der veröffentlichten Raten mit 200. Die Differenz zwischen der obersten und der untersten Zeile beträgt etwa 260 US-Dollar pro Tag oder rund 95.000 US-Dollar pro Jahr, bei einer Arbeitslast, die sich überhaupt nicht ändert.

Zwei Dinge ergeben sich daraus, die die meisten Kostenaufschriebe übersehen:

Ein gecachter Flaggschiff schlägt ein ungecachtes kleines Modell. V4-Pro gecachte Eingabe für 0,022 US-Dollar außerhalb der Spitzenzeiten ist etwa 7x günstiger als V4.1-Flash ungecachte Eingabe für 0,15 US-Dollar (abgeleitet). Die Herabstufung des Modells, um Geld zu sparen, ist der falsche Schritt, wenn das eigentliche Problem ein Cache ist, den Sie nie aufgewärmt haben.

Ausgaben werden niemals gecacht. Für 1,98 US-Dollar außerhalb der Spitzenzeiten kostet ein Ausgabetoken etwa 90x einen gecachten Eingabetoken (abgeleitet). Sobald das Caching funktioniert, haben Sie keine Eingaberechnung mehr, sondern eine Ausgaberechnung, und jede weitere Einsparung ergibt sich aus kürzeren Antworten oder begrenzten Denkbudgets. Teams, die diese Ausgaberechnung mit Anbieterguthaben finanzieren, können vergleichen, was auf getaiperks.com verfügbar ist.


Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

Was hat sich seit unserem früheren DeepSeek-Preisleitfaden geändert?

Drei Dinge haben sich im Jahr 2026 ereignet: V4-Pro-0813 erreichte am 13. August die allgemeine Verfügbarkeit, die Preise für Spitzenzeiten und Nebenzeiten ersetzten die Festpreise Mitte August, und V4.1-Flash wurde um den 10. September herum veröffentlicht.

Unsere frühere DeepSeek-Preisgestaltungsseite gibt feste Token-Preise ohne Zeitkomponente an. Diese sind vor der Änderung und sollten als historische Information betrachtet werden.

Die Zeitleiste, mit ehrlich dargestellter Zuverlässigkeit:

  • 24. April 2026 (mittlere Zuverlässigkeit): V4-Pro und V4-Flash Vorschau mit einem 1-Mio.-Token-Kontextfenster, bis zu 384.000 Ausgabetokens und umschaltbaren Denk- und Nicht-Denk-Modi.
  • 31. Juli 2026 (mittlere Zuverlässigkeit): DeepSeek-V4-Flash-0731, die stabile Flash-Version. Der letzte bekannte Preis vor der Änderung betrug 0,14 US-Dollar pro Million Cache-Miss-Eingaben und 0,28 US-Dollar pro Million Ausgaben, beides Festpreise. Nur historisch.
  • 13. August 2026: DeepSeek-V4-Pro-0813 allgemeine Verfügbarkeit, das aktuelle Flaggschiff für Schlussfolgerungen und Agenten.
  • Um den 10. September 2026: DeepSeek-V4.1-Flash, aufgeführt in den Dokumenten als "DeepSeek-Flash".

Wenn Sie mit einem Tutorial oder einem Kostenmodell arbeiten, das vor August 2026 verfasst wurde, sind alle darin enthaltenen Eingabezahlen in beide Richtungen falsch: zu hoch für einen Cache-Treffer, zu niedrig für einen Spitzenzeit-Cache-Fehltreffer.


Die Endpunkt-Umbenennung, die alten Code kaputt macht

DeepSeek-V4.1-Flash hat die Modellnamen deepseek-v4-flash und deepseek-v4-flash-vision-exp stillschweigend ausgemustert. Anfragen, die diese Zeichenfolgen weiterhin senden, schlagen fehl.

Dies ist die Art von Änderung, die eher als Produktionsvorfall denn als Migrations-Ticket auftaucht, da der Modellname normalerweise in einer Konfigurationsdatei steht, die niemand seit Monaten geöffnet hat. Ältere Codebeispiele, SDK-Wrapper und Tutorials von Drittanbietern beziehen sich immer noch auf die ausgemusterten Namen.

Was vor Ihrem nächsten Deployment getan werden sollte:

  • Durchsuchen Sie das gesamte Repository nach beiden ausgemusterten Zeichenfolgen, einschließlich der Infrastrukturkonfiguration und der Notebooks.
  • Überprüfen Sie alle verwendeten SDKs oder Agenten-Frameworks, die standardmäßig ein DeepSeek-Modell fest codieren.
  • Bestätigen Sie den Vision-Pfad separat, da auch der experimentelle Vision-Endpunkt umbenannt wurde.
  • Führen Sie Ihr Kostenmodell danach erneut aus, da der Ersatz auf dem neuen Zeitplan für Spitzenzeiten und Nebenzeiten basiert.

Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

DeepSeek kostenlose Stufe und Gutschriften: Was tatsächlich wahr ist

Die DeepSeek Chat-App ist kostenlos nutzbar. Die API ist es nicht, und auf der offiziellen Preisseite gibt es keine angegebene kostenlose Stufe.

Hier machen die meisten Artikel Fehler. Behauptungen, dass neue API-Konten kostenlose Gutschriften erhalten, kursieren weit verbreitet, werden inkonsistent berichtet und sind auf der offiziellen Preisseite nicht bestätigt. Wenn Sie ein Startguthaben benötigen, gehen Sie davon aus, dass Sie dafür bezahlen.

Wichtiger für Gründer: DeepSeek führt kein dediziertes Startup-Gutschriftenprogramm durch. Es gibt keine Bewerbung, keine stufenbasierte Zuordnung, keine Partneroption. Die günstigen pro-Token-Preise sind das gesamte Angebot, was eine echte Lücke darstellt, wenn Sie einen Stapel von Gutschriften zusammenstellen.

Diese Lücke ist genau der Grund, warum die Routing-Entscheidung wichtig ist. Viele Anbieter führen Startup-Programme durch, und AI Perks verfolgt 7,7 Millionen US-Dollar an Gutschriften über 194 Unternehmen, die diese abdecken. Das praktische Muster besteht darin, stark frequentierten, cache-freundlichen Verkehr zu DeepSeek für 0,022 US-Dollar pro Million zu leiten und gewährte Gutschriften für teurere Anbieter auszugeben, bei denen ein kostenloser Token weitaus mehr wert ist.


DeepSeek von jemand anderem kaufen

Drittanbieter-Hosts replizieren nicht den Zeitplan für Spitzen- und Nebenzeiten von DeepSeek, was bedeutet, dass sie während der Spitzenzeiten die First-Party-API unterbieten und außerhalb der Spitzenzeiten stark verlieren können.

Baseten listet DeepSeek V4.1 Flash-Eingaben für 0,30 US-Dollar pro Million (mittlere Zuverlässigkeit, vor Budgetierung verifizieren), und die Ausgabezahl wurde nicht zuverlässig bestätigt. Baseten bietet auch einen dauerhaften 30-Dollar-Gutschrift für neue Arbeitsbereiche an.

Beachten Sie, was 0,30 US-Dollar entspricht: Es ist genau die eigene Spitzenrate für Cache-Fehltreffer von DeepSeek und doppelt so viel wie die Nebenzeitenrate (abgeleitet). Für ein US- oder europäisches Team, dessen Verkehr ohnehin hauptsächlich in die Nebenzeiten fällt, ist ein einheitlicher Drittanbieter-Tarif keine offensichtliche Einsparung.

OpenRouter, Together und Fireworks hosten ebenfalls DeepSeek-Modelle. Wir geben hier keine Preise an, da wir sie nicht verifiziert haben, und das sollte auch nichts anderes tun, was Sie lesen. Der qualitative Kompromiss ist jedoch konsistent:

  • First-Party-API: der einzige Ort, an dem der volle Stack für Cache-Treffer und Nebenzeiten gilt, und der mit Abstand günstigste Weg, wenn beide greifen.
  • Drittanbieter-Hosts: Festpreise, verschiedene Regionen, einheitliche Abrechnung und in der Regel keine Exposition gegenüber der Cache-Hit-Stufe von DeepSeek.
  • Aggregatoren: nützlich für Failover, zu einem Aufpreis, den Sie messen, statt annehmen sollten.

Preisen Sie Ihren eigenen Verkehr gegen beide und vergleichen Sie das Ergebnis mit den verfügbaren Gutschriften bei anderen Anbietern unter getaiperks.com. Ein kostenloser Token ist besser als ein billiger.


Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

Häufig gestellte Fragen

Wie viel günstiger ist ein DeepSeek Cache-Treffer?

Bei DeepSeek-V4-Pro kostet ein Cache-Treffer 0,022 US-Dollar pro Million Eingabetoken außerhalb der Spitzenzeiten im Vergleich zu 0,66 US-Dollar bei einem Cache-Fehltreffer, ein Unterschied von 30x. Bei V4.1-Flash ist die Lücke noch größer: 0,003 US-Dollar gegenüber 0,15 US-Dollar, ein Unterschied von 50x (abgeleitet). Die Preise stammen aus den offiziellen API-Dokumenten vom September 2026.

Wann sind die Spitzenzeiten von DeepSeek?

Spitzenzeiten sind werktags von 01:00-04:00 Uhr und 06:00-10:00 Uhr UTC. Alles andere, einschließlich beider Wochenendtage, wird zum halben Spitzenpreis abgerechnet. Das sind etwa 79 % der Woche außerhalb der Spitzenzeiten (abgeleitet), sodass US-basierte Teams ihren gesamten Arbeitstag lang den Rabatt erhalten, ohne etwas zu ändern.

Hat DeepSeek eine kostenlose API-Stufe?

Auf der offiziellen Preisseite ist keine kostenlose API-Stufe angegeben. Die Chat-App für Verbraucher ist kostenlos, aber die API ist ab dem ersten Token kostenpflichtig. Berichte über kostenlose Gutschriften für neue Konten sind inkonsistent und unbestätigt. Anbieter, die Gutschriften gewähren, werden unter getaiperks.com aufgeführt.

Bietet DeepSeek Startup-Gutschriften an?

DeepSeek führt kein dediziertes Startup-Gutschriftenprogramm durch. Geringe Token-Preise sind das gesamte Angebot. Für Gründer, die einen Stapel von Gutschriften aufbauen, ist das eine Lücke, die sich anderswo füllen lässt: AI Perks deckt 7,7 Millionen US-Dollar an Gutschriften über 194 Unternehmen von den Anbietern ab, die Programme durchführen.

Warum hat mein DeepSeek API-Aufruf aufgehört zu funktionieren?

Die wahrscheinlichste Ursache ist der Modellname. DeepSeek-V4.1-Flash hat die Endpunktnamen deepseek-v4-flash und deepseek-v4-flash-vision-exp ausgemustert, und ältere Tutorials und Konfigurationsdateien beziehen sich immer noch darauf. Durchsuchen Sie Ihr Repository nach beiden Zeichenfolgen, einschließlich der verwendeten SDKs und Notebooks, und überprüfen Sie dann Ihr Kostenmodell anhand der aktuellen Preise.

Sollte ich DeepSeek V4-Pro oder V4.1-Flash verwenden?

Rechnen Sie nach, bevor Sie annehmen, dass Flash billiger ist. V4-Pro gecachte Eingaben für 0,022 US-Dollar außerhalb der Spitzenzeiten sind etwa 7x günstiger als Flash ungecachte Eingaben für 0,15 US-Dollar (abgeleitet). Ein gut gecachter Flaggschiff kann also ein ungecachtes kleines Modell bei der Eingabe komplett übertreffen. Das Ausgabevolumen und nicht die Modellgröße bestimmt in der Regel die Rechnung.


Abonnieren Sie auf getaiperks.com →

Cachen Sie das Präfix, versenden Sie außerhalb der Spitzenzeiten und lassen Sie die Gutschriften anderer den Rest abdecken.

This content is for informational purposes only and may contain inaccuracies. Credit programs, amounts, and eligibility requirements change frequently. Always verify details directly with the provider.