DeepSeek Context Caching 2026: 30x Inputrabatten

DeepSeek opkræver 30 gange mindre for cached input end for en cache miss og halverer enhver pris uden for spidsbelastningstiderne. V4-Pro og V4.1-Flash-raterne, forklaret ordentligt.

DeepSeekContext CachingLLM PricingAI API CostsAI Perks
Author Avatar
Andrew
AI Perks Team
9,831

Quick Answer

Et cache-hit på DeepSeek-V4-Pro koster 0,022 USD pr. million input tokens uden for spidsbelastningstidspunktet mod 0,66 USD for et cache-miss, en rabat på 30x på samme model. DeepSeek halverer også alle priser uden for spidsbelastningstidspunktet, så en cachede token uden for spidsbelastningstidspunktet kører 60x billigere end et cache-miss i spidsbelastningstidspunktet. Credits fra udbydere, der kører startup-programmer, spores på getaiperks.com.

AI Perks

AI Perks giver adgang til eksklusive rabatter, kreditter og tilbud på AI-værktøjer, cloud-tjenester og API'er for at hjælpe startups og udviklere med at spare penge.

AI Perks Cards

Hvad et DeepSeek Cache Hit Faktisk Koster

På DeepSeek-V4-Pro koster et input-token leveret fra cache $0,022 per million uden for spidsbelastning mod $0,66 for et cache miss. Det er en rabat på 30x for at sende den samme præfiks to gange.

De fleste prissider angiver et enkelt input-tal og går videre. DeepSeek har fire, fordi to separate multiplikatorer gælder for hvert enkelt kald: om præfiksen ramte cachen, og hvilken tid på dagen du sendte den.

Model og vindueCache hit inputCache miss inputOutput
DeepSeek-V4-Pro-0813, uden for spidsbelastning$0,022$0,66$1,98
DeepSeek-V4-Pro-0813, spidsbelastning$0,044$1,32$3,96
DeepSeek-V4.1-Flash, uden for spidsbelastning$0,003$0,15ikke verificeret
DeepSeek-V4.1-Flash, spidsbelastning$0,006$0,30ikke verificeret

Alle tal er USD per million tokens, fra de officielle API-dokumenter pr. september 2026. V4.1-Flash output-priser er ikke verificeret her, så tjek den officielle side, før du budgetterer med den.

Flash-forholdet er endnu bredere end flagskibets: $0,003 mod $0,15 er en 50x forskel (udledt fra ovenstående priser). AI Perks sporer denne type udbydermechanisme sammen med de kreditter, der udligner den.


Top AI-kompetencer til startups

Ansøg direkte gennem disse verificerede programmer.

Spidsbelastning og Uden for Spidsbelastning: Den Eneste Udbyder der Afregner efter Klokken

DeepSeek spidsbelastningstider er 01:00-04:00 og 06:00-10:00 UTC på hverdage. Alt andet, inklusive hele lørdag og søndag, afregnes til præcis halv pris.

Ingen anden stor modeludbyder prissætter efter tidspunkt på dagen, hvilket gør det til den mest oversete faktor i LLM-omkostningsarbejde. Ingen optimeringsguide skrevet til OpenAI eller Anthropic har nogen grund til at nævne det.

Udledt fra disse vinduer: spidsbelastning er 7 timer om dagen fordelt på 5 hverdage, altså 35 ud af ugens 168 timer. Cirka 79% af kalenderen er allerede uden for spidsbelastning, så de fleste teams får rabatten ved et uheld og kunne få mere af den med vilje.

Hvor du befinder dig, afgør hvor meget af din arbejdsdag der er eksponeret:

TeamplaceringSpidsbelastningsvinduer, lokal tidEksponering på arbejdsdage
US Eastern (UTC-4)21:00-00:00, 02:00-06:00Ingen, hele arbejdsdagen er uden for spidsbelastning
US Pacific (UTC-7)18:00-21:00, 23:00-03:00Ingen
Centraleuropa (UTC+2)03:00-06:00, 08:00-12:00Hele formiddagen
Indien (UTC+5:30)06:30-09:30, 11:30-15:30Det meste af arbejdsdagen
Kina (UTC+8)09:00-12:00, 14:00-18:00Næsten hele dagen

Lokale tider er konverteret fra de publicerede UTC-vinduer med de viste forskydninger, og sommertid flytter dem med en time. Mønsteret er ikke en tilfældighed: spidsbelastningsvinduerne passer ind i den kinesiske arbejdsdag, så et amerikansk teams interaktive trafik lander gratis i den billige halvdel af døgnet.


Kombination af Begge Rabatter: En 60x Forskel på Én Model

Et cached input-token uden for spidsbelastning til $0,022 mod et spidsbelastnings cache miss til $1,32 er en 60x forskel på identisk output fra den samme model.

Her er, hvordan det ser ud på en realistisk agent-arbejdsbyrde: en 200.000-token kontekst sendt igen 1.000 gange om dagen, altså 200 millioner input-tokens dagligt på V4-Pro.

ScenariePris per 1 mio.Daglige input-omkostninger
Spidsbelastning, hvert kald et cache miss$1,32$264,00
Uden for spidsbelastning, hvert kald et cache miss$0,66$132,00
Spidsbelastning, hvert kald et cache hit$0,044$8,80
Uden for spidsbelastning, hvert kald et cache hit$0,022$4,40

Alle fire rækker er udledt ved at multiplicere de publicerede priser med 200. Forskellen mellem den øverste og nederste række er cirka $260 om dagen, eller groft sagt $95.000 om året, på en arbejdsbyrde der slet ikke ændrer sig.

To ting følger heraf, som de fleste omkostningsskrivninger går glip af:

En cached flagskibsmodel slår en ikke-cached lille model. V4-Pro cached input til $0,022 uden for spidsbelastning er cirka 7x billigere end V4.1-Flash ikke-cached input til $0,15 (udledt). At nedgradere modellen for at spare penge er den forkerte beslutning, hvis det reelle problem er en cache, du aldrig har opvarmet.

Output caches aldrig. Til $1,98 uden for spidsbelastning koster et output-token cirka 90x et cached input-token (udledt). Når caching virker, har du ikke længere en input-regning, du har en output-regning, og enhver yderligere besparelse kommer fra kortere svar eller begrænsede tankebudgetter. Teams, der finansierer den output-regning med udbyder-kreditter, kan sammenligne, hvad der er tilgængeligt på getaiperks.com.


Top AI-kompetencer til startups

Ansøg direkte gennem disse verificerede programmer.

Hvad Ændrede Sig Siden Vores Tidligere DeepSeek Prisguide

Tre ting skete i 2026: V4-Pro-0813 nåede generel tilgængelighed den 13. august, spidsbelastnings- og uden for spidsbelastningspriser erstattede faste priser i midten af august, og V4.1-Flash landede omkring den 10. september.

Vores tidligere DeepSeek prisside angiver faste priser per token uden en tids-komponent. Disse går forud for ændringen og bør læses som historik.

Tidslinjen, med tillid markeret ærligt:

  • 24. april 2026 (mellemstor tillid): V4-Pro og V4-Flash preview, med et 1M-token kontekstvindue, op til 384K output-tokens, og skiftbare tænke- og ikke-tænke-tilstande.
  • 31. juli 2026 (mellemstor tillid): DeepSeek-V4-Flash-0731, den stabile Flash-udgivelse. Sidste kendte pris før ændringen var $0,14 per million cache-miss input og $0,28 per million output, begge faste. Kun historisk.
  • 13. august 2026: DeepSeek-V4-Pro-0813 generel tilgængelighed, den nuværende flagskibs ræsonnement- og agentmodel.
  • Omkring 10. september 2026: DeepSeek-V4.1-Flash, angivet i dokumenterne som "DeepSeek-Flash".

Hvis du arbejder ud fra en tutorial eller en omkostningsmodel skrevet før august 2026, er alle input-tal i den forkerte retning i begge retninger: for høje for et cache hit, for lave for et spidsbelastnings cache miss.


Navneskiftet af Endpoints, der Bryder Gammel Kode

DeepSeek-V4.1-Flash har stille og roligt afskaffet modelnavnene deepseek-v4-flash og deepseek-v4-flash-vision-exp. Anmodninger, der stadig bruger disse strenge, vil fejle.

Dette er den type ændring, der dukker op som en produktionshændelse snarere end en migrationsbillet, fordi modelnavnet normalt sidder i en konfigurationsfil, som ingen har åbnet i måneder. Ældre kodestykker, SDK-wrappers og tredjeparts tutorials refererer stadig til de afskaffede navne.

Det er værd at gøre før din næste deployment:

  • Gennemgå hele lageret for begge afskaffede strenge, inklusive infrastrukturkonfiguration og notebooks.
  • Tjek enhver leveret SDK eller agent-framework, der hardcoder en standard DeepSeek-model.
  • Bekræft visionsstien separat, da den eksperimentelle visions-endpoint også er blevet omdøbt.
  • Kør din omkostningsmodel igen bagefter, da erstatningen sidder på den nye spidsbelastnings- og uden for spidsbelastningsplan.

Top AI-kompetencer til startups

Ansøg direkte gennem disse verificerede programmer.

DeepSeek Gratis Niveau og Kreditter: Hvad Der Faktisk Er Sandt

DeepSeek chat-appen er gratis at bruge. API'en er ikke, og der er intet angivet gratis niveau på den officielle prisside.

Dette er, hvor de fleste artikler tager fejl. Påstande om, at nye API-konti modtager gratis kreditter, cirkulerer bredt, rapporteres inkonsistent og er ikke bekræftet på den officielle prisside. Hvis du har brug for en startbalance, skal du antage, at du betaler for den.

Vigtigere for stiftere: DeepSeek kører intet dedikeret startup-kreditprogram. Der er ingen ansøgning, ingen trindelt niveauer, ingen partner-spor. Billig pris per token er hele tilbuddet, hvilket er et reelt hul, hvis du samler en kredit-stack.

Det hul er præcis grunden til, at routing-beslutningen betyder noget. Mange udbydere kører startup-programmer, og AI Perks sporer 7,7 mio. dollars i kreditter på tværs af 194 virksomheder, der dækker dem, der gør det. Det praktiske mønster er at route trafik med højt volumen og cache-venlig trafik til DeepSeek til $0,022 per million og bruge tildelte kreditter på de dyrere udbydere, hvor et gratis token er langt mere værd.


Køb DeepSeek Fra En Anden

Tredjeparts-hosts gentager ikke DeepSeek's spidsbelastnings- og uden for spidsbelastningsplan, hvilket betyder, at de kan underbyde den første-parts API under spidsbelastning og tabe stort til den uden for spidsbelastning.

Baseten angiver DeepSeek V4.1 Flash input til $0,30 per million (mellemstor tillid, verificer før du budgetterer på det), og output-tallet blev ikke pålideligt bekræftet. Baseten tilbyder også en stående $30 ny-workspace prøvekredit.

Bemærk, hvad $0,30 svarer til: det er præcis DeepSeek's egen spidsbelastnings cache-miss-rate, og dobbelt så meget som uden for spidsbelastningsraten (udledt). For et amerikansk eller europæisk team, hvis trafik for det meste lander uden for spidsbelastning alligevel, er en fast tredjepartspris ikke en åbenlys besparelse.

OpenRouter, Together og Fireworks hoster også DeepSeek-modeller. Vi angiver ikke deres priser her, fordi vi ikke har verificeret dem, og det bør intet andet, du læser, heller ikke gøre. Den kvalitative handel er dog konsekvent:

  • Første-parts API: det eneste sted, hvor hele cache-hit og uden for spidsbelastning stacken gælder, og den billigste vej med stor margin, når begge aktiveres.
  • Tredjeparts-hosts: faste priser, forskellige regioner, samlet fakturering, og normalt ingen eksponering for DeepSeek's cache-hit-niveau.
  • Aggregatorer: nyttige til failover, til en præmie du bør måle, snarere end antage.

Prissæt din egen trafik mod begge, og sammenlign derefter resultatet med de kreditter, der er tilgængelige på andre udbydere på getaiperks.com. Et gratis token slår et billigt.


Top AI-kompetencer til startups

Ansøg direkte gennem disse verificerede programmer.

Ofte Stillede Spørgsmål

Hvor meget billigere er et DeepSeek cache hit?

På DeepSeek-V4-Pro er et cache hit $0,022 per million input-tokens uden for spidsbelastning mod $0,66 for et cache miss, en forskel på 30x. På V4.1-Flash er forskellen endnu større, $0,003 mod $0,15, en forskel på 50x (udledt). Priserne er fra de officielle API-dokumenter pr. september 2026.

Hvornår er DeepSeek spidsbelastningstider?

Spidsbelastning er 01:00-04:00 og 06:00-10:00 UTC kun på hverdage. Alt andet, inklusive begge weekenddage, afregnes til halvdelen af spidsbelastningsprisen. Det svarer til cirka 79% af ugen uden for spidsbelastning (udledt), så amerikansk-baserede teams får rabatten i løbet af hele deres arbejdsdag uden at ændre noget.

Har DeepSeek et gratis API-niveau?

Intet gratis API-niveau er angivet på den officielle prisside. Forbrugerchat-appen er gratis, men API'en betales fra det første token. Rapporter om gratis kreditter til nye konti er inkonsistente og ubekræftede. Udbydere, der yder kreditter, spores på getaiperks.com.

Tilbyder DeepSeek startup-kreditter?

DeepSeek kører intet dedikeret startup-kreditprogram. Lav pris per token er hele tilbuddet. For stiftere, der bygger en kredit-stack, er det et hul, der er værd at udfylde et andet sted: AI Perks dækker 7,7 mio. dollars i kreditter på tværs af 194 virksomheder fra de udbydere, der kører programmer.

Hvorfor holdt mit DeepSeek API-kald op med at virke?

Den mest sandsynlige årsag er modelnavnet. DeepSeek-V4.1-Flash afskaffede endpoint-navnene deepseek-v4-flash og deepseek-v4-flash-vision-exp, og ældre tutorials og konfigurationsfiler refererer stadig til dem. Gennemgå dit lager for begge strenge, inklusive leverede SDK'er og notebooks, og tjek derefter din omkostningsmodel igen mod de aktuelle priser.

Skal jeg bruge DeepSeek V4-Pro eller V4.1-Flash?

Kør regnestykket, før du antager, at Flash er billigere. V4-Pro cached input til $0,022 uden for spidsbelastning er cirka 7x billigere end Flash ikke-cached input til $0,15 (udledt), så et vel-cached flagskib kan helt slå en ikke-cached lille model på input-linjen. Output-volumen, ikke modelstørrelse, afgør normalt regningen.


Abonner på getaiperks.com →

Cache præfiksen, send uden for spidsbelastning, og lad andres kreditter dække resten.

AI Perks

AI Perks giver adgang til eksklusive rabatter, kreditter og tilbud på AI-værktøjer, cloud-tjenester og API'er for at hjælpe startups og udviklere med at spare penge.

AI Perks Cards

This content is for informational purposes only and may contain inaccuracies. Credit programs, amounts, and eligibility requirements change frequently. Always verify details directly with the provider.