Quanto Custa Realmente um Cache Hit da DeepSeek
No DeepSeek-V4-Pro, um token de entrada servido do cache custa US$ 0,022 por milhão fora do horário de pico em comparação com US$ 0,66 para uma falha de cache. Isso é um desconto de 30x por enviar o mesmo prefixo duas vezes.
A maioria das páginas de preços cita um número de entrada e segue em frente. A DeepSeek tem quatro, porque dois multiplicadores separados se aplicam a cada chamada: se o prefixo atingiu o cache e a que horas do dia você o enviou.
| Modelo e janela | Entrada com cache hit | Entrada com cache miss | Saída |
|---|---|---|---|
| DeepSeek-V4-Pro-0813, fora do pico | US$ 0,022 | US$ 0,66 | US$ 1,98 |
| DeepSeek-V4-Pro-0813, pico | US$ 0,044 | US$ 1,32 | US$ 3,96 |
| DeepSeek-V4.1-Flash, fora do pico | US$ 0,003 | US$ 0,15 | não verificado |
| DeepSeek-V4.1-Flash, pico | US$ 0,006 | US$ 0,30 | não verificado |
Todos os valores em USD por milhão de tokens, da documentação oficial da API em setembro de 2026. O preço da saída V4.1-Flash não é verificado aqui, portanto, consulte a página oficial antes de orçar com base nele.
A proporção do Flash é ainda maior do que a do carro-chefe: US$ 0,003 contra US$ 0,15 é uma lacuna de 50x (derivada das taxas acima). O AI Perks rastreia esse tipo de mecânica do provedor juntamente com os programas de crédito que a compensam.

Pico e Fora do Pico: O Único Fornecedor que Cobra por Hora
As horas de pico da DeepSeek são de 01:00 a 04:00 e de 06:00 a 10:00 UTC em dias úteis. Todo o resto, incluindo todo o sábado e domingo, é cobrado pela metade do preço.
Nenhum outro grande fornecedor de modelos precifica por hora do dia, o que o torna a alavancagem mais negligenciada no trabalho de custo de LLM. Nenhuma guia de otimização escrita para OpenAI ou Anthropic tem razão para mencioná-lo.
Derivado dessas janelas: pico é 7 horas por dia em 5 dias úteis, portanto, 35 das 168 horas da semana. Aproximadamente 79% do calendário já está fora do pico, então a maioria das equipes obtém o desconto por acidente e pode obter mais dele intencionalmente.
Onde você está sentado decide quanta exposição o seu dia de trabalho tem:
| Localização da equipe | Janelas de pico, horário local | Exposição durante o dia útil |
|---|---|---|
| Leste dos EUA (UTC-4) | 21:00-00:00, 02:00-06:00 | Nenhuma, o dia de trabalho inteiro está fora do pico |
| Pacífico dos EUA (UTC-7) | 18:00-21:00, 23:00-03:00 | Nenhuma |
| Europa Central (UTC+2) | 03:00-06:00, 08:00-12:00 | Toda a manhã |
| Índia (UTC+5:30) | 06:30-09:30, 11:30-15:30 | A maior parte do dia de trabalho |
| China (UTC+8) | 09:00-12:00, 14:00-18:00 | Quase tudo |
Os horários locais são convertidos das janelas UTC publicadas com os deslocamentos mostrados, e o horário de verão os move em uma hora. O padrão não é acidental: as janelas de pico se alinham ao dia de trabalho chinês, então o tráfego interativo de uma equipe dos EUA chega à metade barata do relógio gratuitamente.
Empilhando Ambos os Descontos: Uma Disparidade de 60x em um Modelo
Um token de entrada cacheado fora do pico a US$ 0,022 contra uma falha de cache no pico a US$ 1,32 é uma disparidade de 60x em uma saída idêntica do mesmo modelo.
Veja como isso se parece em uma carga de trabalho de agente realista: um contexto de 200.000 tokens reenviado 1.000 vezes por dia, totalizando 200 milhões de tokens de entrada diariamente no V4-Pro.
| Cenário | Taxa por 1M | Custo diário de entrada |
|---|---|---|
| Pico, cada chamada uma falha de cache | US$ 1,32 | US$ 264,00 |
| Fora do pico, cada chamada uma falha de cache | US$ 0,66 | US$ 132,00 |
| Pico, cada chamada um cache hit | US$ 0,044 | US$ 8,80 |
| Fora do pico, cada chamada um cache hit | US$ 0,022 | US$ 4,40 |
Todas as quatro linhas são derivadas multiplicando as taxas publicadas por 200. A lacuna entre a linha superior e a inferior é de cerca de US$ 260 por dia, ou aproximadamente US$ 95.000 por ano, em uma carga de trabalho que não muda absolutamente nada.
Duas coisas seguem que a maioria dos relatórios de custo perde:
Um carro-chefe cacheado supera um modelo pequeno não cacheado. A entrada cacheada do V4-Pro a US$ 0,022 fora do pico é cerca de 7x mais barata do que a entrada não cacheada do V4.1-Flash a US$ 0,15 (derivado). Rebaixar o modelo para economizar dinheiro é o movimento errado se o problema real for um cache que você nunca aqueceu.
A saída nunca é cacheada. A US$ 1,98 fora do pico, um token de saída custa aproximadamente 90x um token de entrada cacheado (derivado). Uma vez que o cache funciona, você não tem mais uma conta de entrada, você tem uma conta de saída, e cada economia adicional vem de respostas mais curtas ou orçamentos de pensamento limitados. As equipes que financiam essa conta de saída com créditos do provedor podem comparar o que está disponível em getaiperks.com.

O Que Mudou Desde o Nosso Guia Anterior de Preços da DeepSeek
Três coisas mudaram em 2026: o V4-Pro-0813 atingiu a disponibilidade geral em 13 de agosto, os preços de pico e fora do pico substituíram as taxas fixas em meados de agosto e o V4.1-Flash chegou por volta de 10 de setembro.
Nossa página de preços anterior da DeepSeek cita taxas fixas por token sem componente de hora do dia. Essas precedem a mudança e devem ser lidas como histórico.
A linha do tempo, com confiança marcada honestamente:
- 24 de abril de 2026 (confiança média): prévia do V4-Pro e V4-Flash, com uma janela de contexto de 1 milhão de tokens, até 384 mil tokens de saída e modos de pensamento e não pensamento alternáveis.
- 31 de julho de 2026 (confiança média): DeepSeek-V4-Flash-0731, o lançamento estável do Flash. Os últimos preços conhecidos antes da mudança foram de US$ 0,14 por milhão de entrada com falha de cache e US$ 0,28 por milhão de saída, ambos fixos. Histórico apenas.
- 13 de agosto de 2026: DeepSeek-V4-Pro-0813 disponibilidade geral, o atual carro-chefe de raciocínio e modelo de agente.
- Por volta de 10 de setembro de 2026: DeepSeek-V4.1-Flash, listado na documentação como "DeepSeek-Flash".
Se você está trabalhando a partir de um tutorial ou modelo de custo escrito antes de agosto de 2026, todos os números de entrada nele estão errados em ambas as direções: muito altos para um cache hit, muito baixos para uma falha de cache no pico.
A Renomeação do Endpoint Que Quebra Código Antigo
O DeepSeek-V4.1-Flash aposentou silenciosamente os nomes de modelo deepseek-v4-flash e deepseek-v4-flash-vision-exp. Solicitações que ainda usam essas strings falharão.
Essa é o tipo de mudança que surge como um incidente de produção em vez de um ticket de migração, porque o nome do modelo geralmente fica em um arquivo de configuração que ninguém abre há meses. Exemplos de código mais antigos, wrappers de SDK e tutoriais de terceiros ainda referenciam os nomes aposentados.
Vale a pena fazer antes do seu próximo deploy:
- Use grep em todo o repositório para ambas as strings aposentadas, incluindo configuração de infraestrutura e notebooks
- Verifique qualquer SDK ou framework de agente incluído que codifique um modelo DeepSeek padrão
- Confirme o caminho da visão separadamente, pois o endpoint experimental de visão também foi renomeado
- Reexecute seu modelo de custo depois, pois o substituto está na nova programação de pico e fora do pico

Nível Gratuito e Créditos da DeepSeek: O Que é Realmente Verdade
O aplicativo de chat DeepSeek é gratuito para usar. A API não é, e não há nível gratuito declarado na página oficial de preços.
É aqui que a maioria dos artigos erra. Alegações de que novas contas de API recebem créditos gratuitos circulam amplamente, são reportadas de forma inconsistente e não são confirmadas na página oficial de preços. Se você precisa de um saldo inicial, assuma que está pagando por ele.
Mais importante para fundadores: A DeepSeek não executa nenhum programa dedicado de crédito para startups. Não há inscrição, nenhum nível baseado em estágio, nenhuma trilha de parceiro. O baixo preço por token é toda a oferta, o que é uma lacuna real se você estiver montando uma pilha de créditos.
Essa lacuna é exatamente o motivo pelo qual a decisão de roteamento é importante. Muitos provedores executam programas para startups, e o AI Perks rastreia US$ 7,7 milhões em créditos em 194 empresas que cobrem aqueles que o fazem. O padrão prático é rotear tráfego de alto volume e amigável ao cache para a DeepSeek a US$ 0,022 por milhão e gastar créditos concedidos nos provedores mais caros, onde um token gratuito vale muito mais.
Comprando DeepSeek de Outra Pessoa
Hospedeiros de terceiros não replicam a programação de pico e fora do pico da DeepSeek, o que significa que eles podem subcotar a API de primeira parte durante o pico e perder muito para ela fora do pico.
O Baseten lista a entrada DeepSeek V4.1 Flash a US$ 0,30 por milhão (confiança média, verifique antes de orçar), e o valor de saída não foi confirmado de forma confiável. O Baseten também oferece um crédito de teste de novo espaço de trabalho de US$ 30.
Note o que US$ 0,30 equivale: é exatamente a taxa de falha de cache no pico da própria DeepSeek, e o dobro da taxa fora do pico (derivado). Para uma equipe dos EUA ou Europa cujo tráfego chega principalmente fora do pico de qualquer maneira, uma taxa fixa de terceiros não é obviamente uma economia.
OpenRouter, Together e Fireworks também hospedam modelos DeepSeek. Não estamos citando seus preços aqui porque não os verificamos, e nem nada mais que você ler deveria. A troca qualitativa é consistente, no entanto:
- API de primeira parte: o único lugar onde a pilha completa de cache hit e fora do pico se aplica, e o caminho mais barato por uma margem significativa quando ambos disparam
- Hospedeiros de terceiros: taxas fixas, regiões diferentes, faturamento unificado e geralmente nenhuma exposição ao nível de cache hit da DeepSeek
- Agregadores: úteis para failover, a um prêmio que você deve medir em vez de supor
Pretifique seu próprio tráfego contra ambos, e então compare o resultado com os créditos disponíveis em outros provedores em getaiperks.com. Um token gratuito supera um barato.

Perguntas Frequentes
Quão mais barato é um cache hit da DeepSeek?
No DeepSeek-V4-Pro, um cache hit custa US$ 0,022 por milhão de tokens de entrada fora do pico contra US$ 0,66 para uma falha de cache, uma diferença de 30x. No V4.1-Flash, a lacuna é ainda maior, US$ 0,003 contra US$ 0,15, uma diferença de 50x (derivado). As taxas são da documentação oficial da API em setembro de 2026.
Quando são as horas de pico da DeepSeek?
Pico é de 01:00 a 04:00 e de 06:00 a 10:00 UTC apenas em dias úteis. Todo o resto, incluindo ambos os dias de fim de semana, é cobrado pela metade da taxa de pico. Isso resulta em cerca de 79% da semana fora do pico (derivado), então equipes baseadas nos EUA obtêm o desconto durante todo o dia útil sem mudar nada.
A DeepSeek tem um nível de API gratuito?
Não há nível de API gratuito declarado na página oficial de preços. O aplicativo de chat do consumidor é gratuito, mas a API é paga a partir do primeiro token. Relatos de créditos gratuitos para novas contas são inconsistentes e não confirmados. Os provedores que concedem créditos são rastreados em getaiperks.com.
A DeepSeek oferece créditos para startups?
A DeepSeek não executa nenhum programa dedicado de crédito para startups. O baixo preço por token é toda a oferta. Para fundadores que constroem uma pilha de créditos, essa é uma lacuna que vale a pena preencher em outro lugar: o AI Perks cobre US$ 7,7 milhões em créditos em 194 empresas dos provedores que executam programas.
Por que minha chamada de API DeepSeek parou de funcionar?
A causa mais provável é o nome do modelo. O DeepSeek-V4.1-Flash aposentou os nomes de endpoint deepseek-v4-flash e deepseek-v4-flash-vision-exp, e tutoriais e arquivos de configuração mais antigos ainda os referenciam. Use grep em seu repositório para ambas as strings, incluindo SDKs e notebooks incluídos, e então reconfirme seu modelo de custo contra as taxas atuais.
Devo usar DeepSeek V4-Pro ou V4.1-Flash?
Execute os cálculos antes de assumir que o Flash é mais barato. A entrada cacheada do V4-Pro a US$ 0,022 fora do pico é aproximadamente 7x mais barata do que a entrada não cacheada do Flash a US$ 0,15 (derivado), então um carro-chefe bem cacheado pode superar um modelo pequeno não cacheado na linha de entrada inteiramente. O volume de saída, não o tamanho do modelo, geralmente decide a conta.
Inscreva-se em getaiperks.com →
Cache o prefixo, envie fora do pico e deixe os créditos de outra pessoa cobrirem o resto.