DeepSeek Context Caching 2026: O Desconto de 30x na Entrada

O DeepSeek cobra 30x menos para entradas em cache do que para falhas de cache e reduz pela metade todos os preços fora do pico. As taxas V4-Pro e V4.1-Flash, explicadas corretamente.

DeepSeekContext CachingLLM PricingAI API CostsAI Perks
Author Avatar
Andrew
AI Perks Team
5,908

Quick Answer

Um cache hit no DeepSeek-V4-Pro custa $0,022 por milhão de tokens de entrada fora do pico, contra $0,66 para um cache miss, um desconto de 30x no mesmo modelo. DeepSeek também reduz pela metade todos os preços fora do horário de pico, portanto, um token cacheado fora do pico custa 60x mais barato do que um cache miss no pico. Créditos de provedores que executam programas de inicialização são rastreados em getaiperks.com.

Quanto Custa Realmente um Cache Hit da DeepSeek

No DeepSeek-V4-Pro, um token de entrada servido do cache custa US$ 0,022 por milhão fora do horário de pico em comparação com US$ 0,66 para uma falha de cache. Isso é um desconto de 30x por enviar o mesmo prefixo duas vezes.

A maioria das páginas de preços cita um número de entrada e segue em frente. A DeepSeek tem quatro, porque dois multiplicadores separados se aplicam a cada chamada: se o prefixo atingiu o cache e a que horas do dia você o enviou.

Modelo e janelaEntrada com cache hitEntrada com cache missSaída
DeepSeek-V4-Pro-0813, fora do picoUS$ 0,022US$ 0,66US$ 1,98
DeepSeek-V4-Pro-0813, picoUS$ 0,044US$ 1,32US$ 3,96
DeepSeek-V4.1-Flash, fora do picoUS$ 0,003US$ 0,15não verificado
DeepSeek-V4.1-Flash, picoUS$ 0,006US$ 0,30não verificado

Todos os valores em USD por milhão de tokens, da documentação oficial da API em setembro de 2026. O preço da saída V4.1-Flash não é verificado aqui, portanto, consulte a página oficial antes de orçar com base nele.

A proporção do Flash é ainda maior do que a do carro-chefe: US$ 0,003 contra US$ 0,15 é uma lacuna de 50x (derivada das taxas acima). O AI Perks rastreia esse tipo de mecânica do provedor juntamente com os programas de crédito que a compensam.


Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

Pico e Fora do Pico: O Único Fornecedor que Cobra por Hora

As horas de pico da DeepSeek são de 01:00 a 04:00 e de 06:00 a 10:00 UTC em dias úteis. Todo o resto, incluindo todo o sábado e domingo, é cobrado pela metade do preço.

Nenhum outro grande fornecedor de modelos precifica por hora do dia, o que o torna a alavancagem mais negligenciada no trabalho de custo de LLM. Nenhuma guia de otimização escrita para OpenAI ou Anthropic tem razão para mencioná-lo.

Derivado dessas janelas: pico é 7 horas por dia em 5 dias úteis, portanto, 35 das 168 horas da semana. Aproximadamente 79% do calendário já está fora do pico, então a maioria das equipes obtém o desconto por acidente e pode obter mais dele intencionalmente.

Onde você está sentado decide quanta exposição o seu dia de trabalho tem:

Localização da equipeJanelas de pico, horário localExposição durante o dia útil
Leste dos EUA (UTC-4)21:00-00:00, 02:00-06:00Nenhuma, o dia de trabalho inteiro está fora do pico
Pacífico dos EUA (UTC-7)18:00-21:00, 23:00-03:00Nenhuma
Europa Central (UTC+2)03:00-06:00, 08:00-12:00Toda a manhã
Índia (UTC+5:30)06:30-09:30, 11:30-15:30A maior parte do dia de trabalho
China (UTC+8)09:00-12:00, 14:00-18:00Quase tudo

Os horários locais são convertidos das janelas UTC publicadas com os deslocamentos mostrados, e o horário de verão os move em uma hora. O padrão não é acidental: as janelas de pico se alinham ao dia de trabalho chinês, então o tráfego interativo de uma equipe dos EUA chega à metade barata do relógio gratuitamente.


Empilhando Ambos os Descontos: Uma Disparidade de 60x em um Modelo

Um token de entrada cacheado fora do pico a US$ 0,022 contra uma falha de cache no pico a US$ 1,32 é uma disparidade de 60x em uma saída idêntica do mesmo modelo.

Veja como isso se parece em uma carga de trabalho de agente realista: um contexto de 200.000 tokens reenviado 1.000 vezes por dia, totalizando 200 milhões de tokens de entrada diariamente no V4-Pro.

CenárioTaxa por 1MCusto diário de entrada
Pico, cada chamada uma falha de cacheUS$ 1,32US$ 264,00
Fora do pico, cada chamada uma falha de cacheUS$ 0,66US$ 132,00
Pico, cada chamada um cache hitUS$ 0,044US$ 8,80
Fora do pico, cada chamada um cache hitUS$ 0,022US$ 4,40

Todas as quatro linhas são derivadas multiplicando as taxas publicadas por 200. A lacuna entre a linha superior e a inferior é de cerca de US$ 260 por dia, ou aproximadamente US$ 95.000 por ano, em uma carga de trabalho que não muda absolutamente nada.

Duas coisas seguem que a maioria dos relatórios de custo perde:

Um carro-chefe cacheado supera um modelo pequeno não cacheado. A entrada cacheada do V4-Pro a US$ 0,022 fora do pico é cerca de 7x mais barata do que a entrada não cacheada do V4.1-Flash a US$ 0,15 (derivado). Rebaixar o modelo para economizar dinheiro é o movimento errado se o problema real for um cache que você nunca aqueceu.

A saída nunca é cacheada. A US$ 1,98 fora do pico, um token de saída custa aproximadamente 90x um token de entrada cacheado (derivado). Uma vez que o cache funciona, você não tem mais uma conta de entrada, você tem uma conta de saída, e cada economia adicional vem de respostas mais curtas ou orçamentos de pensamento limitados. As equipes que financiam essa conta de saída com créditos do provedor podem comparar o que está disponível em getaiperks.com.


Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

O Que Mudou Desde o Nosso Guia Anterior de Preços da DeepSeek

Três coisas mudaram em 2026: o V4-Pro-0813 atingiu a disponibilidade geral em 13 de agosto, os preços de pico e fora do pico substituíram as taxas fixas em meados de agosto e o V4.1-Flash chegou por volta de 10 de setembro.

Nossa página de preços anterior da DeepSeek cita taxas fixas por token sem componente de hora do dia. Essas precedem a mudança e devem ser lidas como histórico.

A linha do tempo, com confiança marcada honestamente:

  • 24 de abril de 2026 (confiança média): prévia do V4-Pro e V4-Flash, com uma janela de contexto de 1 milhão de tokens, até 384 mil tokens de saída e modos de pensamento e não pensamento alternáveis.
  • 31 de julho de 2026 (confiança média): DeepSeek-V4-Flash-0731, o lançamento estável do Flash. Os últimos preços conhecidos antes da mudança foram de US$ 0,14 por milhão de entrada com falha de cache e US$ 0,28 por milhão de saída, ambos fixos. Histórico apenas.
  • 13 de agosto de 2026: DeepSeek-V4-Pro-0813 disponibilidade geral, o atual carro-chefe de raciocínio e modelo de agente.
  • Por volta de 10 de setembro de 2026: DeepSeek-V4.1-Flash, listado na documentação como "DeepSeek-Flash".

Se você está trabalhando a partir de um tutorial ou modelo de custo escrito antes de agosto de 2026, todos os números de entrada nele estão errados em ambas as direções: muito altos para um cache hit, muito baixos para uma falha de cache no pico.


A Renomeação do Endpoint Que Quebra Código Antigo

O DeepSeek-V4.1-Flash aposentou silenciosamente os nomes de modelo deepseek-v4-flash e deepseek-v4-flash-vision-exp. Solicitações que ainda usam essas strings falharão.

Essa é o tipo de mudança que surge como um incidente de produção em vez de um ticket de migração, porque o nome do modelo geralmente fica em um arquivo de configuração que ninguém abre há meses. Exemplos de código mais antigos, wrappers de SDK e tutoriais de terceiros ainda referenciam os nomes aposentados.

Vale a pena fazer antes do seu próximo deploy:

  • Use grep em todo o repositório para ambas as strings aposentadas, incluindo configuração de infraestrutura e notebooks
  • Verifique qualquer SDK ou framework de agente incluído que codifique um modelo DeepSeek padrão
  • Confirme o caminho da visão separadamente, pois o endpoint experimental de visão também foi renomeado
  • Reexecute seu modelo de custo depois, pois o substituto está na nova programação de pico e fora do pico

Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

Nível Gratuito e Créditos da DeepSeek: O Que é Realmente Verdade

O aplicativo de chat DeepSeek é gratuito para usar. A API não é, e não há nível gratuito declarado na página oficial de preços.

É aqui que a maioria dos artigos erra. Alegações de que novas contas de API recebem créditos gratuitos circulam amplamente, são reportadas de forma inconsistente e não são confirmadas na página oficial de preços. Se você precisa de um saldo inicial, assuma que está pagando por ele.

Mais importante para fundadores: A DeepSeek não executa nenhum programa dedicado de crédito para startups. Não há inscrição, nenhum nível baseado em estágio, nenhuma trilha de parceiro. O baixo preço por token é toda a oferta, o que é uma lacuna real se você estiver montando uma pilha de créditos.

Essa lacuna é exatamente o motivo pelo qual a decisão de roteamento é importante. Muitos provedores executam programas para startups, e o AI Perks rastreia US$ 7,7 milhões em créditos em 194 empresas que cobrem aqueles que o fazem. O padrão prático é rotear tráfego de alto volume e amigável ao cache para a DeepSeek a US$ 0,022 por milhão e gastar créditos concedidos nos provedores mais caros, onde um token gratuito vale muito mais.


Comprando DeepSeek de Outra Pessoa

Hospedeiros de terceiros não replicam a programação de pico e fora do pico da DeepSeek, o que significa que eles podem subcotar a API de primeira parte durante o pico e perder muito para ela fora do pico.

O Baseten lista a entrada DeepSeek V4.1 Flash a US$ 0,30 por milhão (confiança média, verifique antes de orçar), e o valor de saída não foi confirmado de forma confiável. O Baseten também oferece um crédito de teste de novo espaço de trabalho de US$ 30.

Note o que US$ 0,30 equivale: é exatamente a taxa de falha de cache no pico da própria DeepSeek, e o dobro da taxa fora do pico (derivado). Para uma equipe dos EUA ou Europa cujo tráfego chega principalmente fora do pico de qualquer maneira, uma taxa fixa de terceiros não é obviamente uma economia.

OpenRouter, Together e Fireworks também hospedam modelos DeepSeek. Não estamos citando seus preços aqui porque não os verificamos, e nem nada mais que você ler deveria. A troca qualitativa é consistente, no entanto:

  • API de primeira parte: o único lugar onde a pilha completa de cache hit e fora do pico se aplica, e o caminho mais barato por uma margem significativa quando ambos disparam
  • Hospedeiros de terceiros: taxas fixas, regiões diferentes, faturamento unificado e geralmente nenhuma exposição ao nível de cache hit da DeepSeek
  • Agregadores: úteis para failover, a um prêmio que você deve medir em vez de supor

Pretifique seu próprio tráfego contra ambos, e então compare o resultado com os créditos disponíveis em outros provedores em getaiperks.com. Um token gratuito supera um barato.


Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

Perguntas Frequentes

Quão mais barato é um cache hit da DeepSeek?

No DeepSeek-V4-Pro, um cache hit custa US$ 0,022 por milhão de tokens de entrada fora do pico contra US$ 0,66 para uma falha de cache, uma diferença de 30x. No V4.1-Flash, a lacuna é ainda maior, US$ 0,003 contra US$ 0,15, uma diferença de 50x (derivado). As taxas são da documentação oficial da API em setembro de 2026.

Quando são as horas de pico da DeepSeek?

Pico é de 01:00 a 04:00 e de 06:00 a 10:00 UTC apenas em dias úteis. Todo o resto, incluindo ambos os dias de fim de semana, é cobrado pela metade da taxa de pico. Isso resulta em cerca de 79% da semana fora do pico (derivado), então equipes baseadas nos EUA obtêm o desconto durante todo o dia útil sem mudar nada.

A DeepSeek tem um nível de API gratuito?

Não há nível de API gratuito declarado na página oficial de preços. O aplicativo de chat do consumidor é gratuito, mas a API é paga a partir do primeiro token. Relatos de créditos gratuitos para novas contas são inconsistentes e não confirmados. Os provedores que concedem créditos são rastreados em getaiperks.com.

A DeepSeek oferece créditos para startups?

A DeepSeek não executa nenhum programa dedicado de crédito para startups. O baixo preço por token é toda a oferta. Para fundadores que constroem uma pilha de créditos, essa é uma lacuna que vale a pena preencher em outro lugar: o AI Perks cobre US$ 7,7 milhões em créditos em 194 empresas dos provedores que executam programas.

Por que minha chamada de API DeepSeek parou de funcionar?

A causa mais provável é o nome do modelo. O DeepSeek-V4.1-Flash aposentou os nomes de endpoint deepseek-v4-flash e deepseek-v4-flash-vision-exp, e tutoriais e arquivos de configuração mais antigos ainda os referenciam. Use grep em seu repositório para ambas as strings, incluindo SDKs e notebooks incluídos, e então reconfirme seu modelo de custo contra as taxas atuais.

Devo usar DeepSeek V4-Pro ou V4.1-Flash?

Execute os cálculos antes de assumir que o Flash é mais barato. A entrada cacheada do V4-Pro a US$ 0,022 fora do pico é aproximadamente 7x mais barata do que a entrada não cacheada do Flash a US$ 0,15 (derivado), então um carro-chefe bem cacheado pode superar um modelo pequeno não cacheado na linha de entrada inteiramente. O volume de saída, não o tamanho do modelo, geralmente decide a conta.


Inscreva-se em getaiperks.com →

Cache o prefixo, envie fora do pico e deixe os créditos de outra pessoa cobrirem o resto.

This content is for informational purposes only and may contain inaccuracies. Credit programs, amounts, and eligibility requirements change frequently. Always verify details directly with the provider.