Você Pode Executar o DeepSeek Sozinho?
Sim. Os lançamentos de pesos abertos do DeepSeek são baixáveis e executáveis em seu próprio hardware, e o Ollama é o caminho mais curto para uma instância local funcional. O custo quase nunca é o motivo para fazer isso.
Essa segunda frase é a parte que todos os outros guias deixam de fora. A API hospedada do DeepSeek oferece dois descontos que se acumulam e, juntos, levam o ponto de equilíbrio do auto-hospedagem a um lugar que a maioria das equipes não consegue alcançar com GPUs alugadas.
Auto-hospedar o DeepSeek é uma decisão de controle: residência de dados, operação offline, fixação de versão. Trate isso como um plano de economia e os números abaixo o decepcionarão.
Os créditos de modelo dos provedores que realmente os distribuem são rastreados em AI Perks.

Como Executar o DeepSeek com Ollama
Ollama baixa uma cópia quantizada dos pesos, os mantém no disco local e expõe um endpoint HTTP compatível com OpenAI em localhost:11434, para que o código existente possa ser trocado com uma mudança de URL base de uma linha.
A sequência de funcionamento é curta:
ollama pull <deepseek-tag>para buscar os pesosollama run <deepseek-tag>para um prompt interativo- Aponte seu SDK para
http://localhost:11434/v1e passe qualquer string não vazia como chave da API
Três coisas para verificar na página do modelo antes de planejar um produto em torno de uma tag:
Qual variante a tag realmente contém. Os pesos que cabem em um laptop e os pesos por trás do endpoint hospedado do DeepSeek frequentemente não são o mesmo modelo. Variantes destiladas e reduzidas compartilham um nome de família e se comportam de maneira diferente.
Qual quantização você baixou. Uma construção de 4 bits dobra a memória em comparação com uma construção de 8 bits e não produz resultados idênticos. Se você benchmark localmente e implantar contra a API, estará comparando dois sistemas diferentes.
Seu teto de contexto real. Localmente, o contexto é limitado pela memória que você tem, não pelo número máximo no anúncio. Um número de contexto longo de um lançamento hospedado não é transferido para sua máquina.
O Que o Auto-Hospedagem Tem Que Vencer
DeepSeek é o único grande fornecedor de modelos que cobra por hora do dia. As horas de pico são de 01:00 a 04:00 e de 06:00 a 10:00 UTC nos dias de semana, e tudo fora dessas janelas, incluindo todo o fim de semana, custa exatamente a metade.
No topo do relógio, há um desconto de cache muito maior. As taxas publicadas atuais, em USD por milhão de tokens:
| Modelo e tipo de token | Fora do pico | Pico |
|---|---|---|
| Entrada DeepSeek-V4-Pro, cache hit | $0.022 | $0.044 |
| Entrada DeepSeek-V4-Pro, cache miss | $0.66 | $1.32 |
| Saída DeepSeek-V4-Pro | $1.98 | $3.96 |
| Entrada DeepSeek-V4.1-Flash, cache hit | $0.003 | $0.006 |
| Entrada DeepSeek-V4.1-Flash, cache miss | $0.15 | $0.30 |
Um cache hit no V4-Pro é cerca de 30x mais barato do que um cache miss. Combine isso com o relógio e um token de entrada fora do pico em cache a $0.022 está 60x abaixo de um cache miss de pico a $1.32, no mesmo modelo. Nada em sua própria infraestrutura tem uma alavancagem de 60x. O detalhamento completo da janela está em nosso guia de preços fora do pico do DeepSeek.

A Matemática do Ponto de Equilíbrio para Executar o DeepSeek Localmente
Derivado das taxas publicadas acima: para superar a API fora do pico do DeepSeek na saída, seu hardware deve produzir um milhão de tokens de saída por hora por menos de $1.98, tudo incluído.
Essa formulação é mais útil do que qualquer lista de preços de GPU, porque se mantém independentemente do que você está alugando. Pegue a taxa de transferência que você pode realmente sustentar e compare-a com o custo do mesmo volume na API:
| Taxa de transferência de saída sustentada | Custo da API fora do pico | Custo da API no pico |
|---|---|---|
| 100.000 tokens/hora | $0.20 | $0.40 |
| 500.000 tokens/hora | $0.99 | $1.98 |
| 1.000.000 tokens/hora | $1.98 | $3.96 |
| 5.000.000 tokens/hora | $9.90 | $19.80 |
| 10.000.000 tokens/hora | $19.80 | $39.60 |
Valores derivados das taxas por token publicadas pelo DeepSeek, não cotados pelo DeepSeek.
Leia cuidadosamente a linha do meio. Uma máquina que atende a um milhão de tokens de saída a cada hora, 24 horas por dia, está deslocando cerca de $1.425 por mês em gastos da API fora do pico (derivado: $1.98 x 24 horas x 30 dias = $1.425,60). Seu acelerador, o host, o armazenamento, a largura de banda e o engenheiro que o mantém funcionando devem caber dentro disso.
A entrada é pior. Se sua carga de trabalho for dominada por um prompt de sistema reutilizado, a API cobra $0.022 por milhão de tokens em cache fora do pico. O auto-hospedagem precisa vencer dois centavos por milhão. Não vencerá.
A conclusão honesta: o auto-hospedagem do DeepSeek se paga em volume genuinamente grande, estável e de alta utilização, e quase em nenhum outro lugar. Para tudo abaixo dessa linha, o movimento mais barato é a API mais créditos gratuitos de outros provedores, que é o que getaiperks.com existe para mapear.
Quando Executar o DeepSeek Sozinho é a Chamada Certa
O auto-hospedagem do DeepSeek vence no controle, não no preço. Cinco situações o justificam, independentemente da tabela de ponto de equilíbrio.
Residência de dados e conformidade. Se os prompts contiverem material que não pode sair de sua jurisdição ou de sua rede, nenhum desconto por token torna a opção hospedada viável. Esta é a razão legítima mais comum.
Operação offline e sem ar. Implantações de campo, instalações seguras e conectividade não confiável precisam de inferência que não dependa de um endpoint acessível.
Fixação de versão. Pesos locais não mudam sob você. Modelos hospedados mudam, e o DeepSeek provou isso.
Imunidade ao relógio. Uma curva de custo auto-hospedada é plana. A curva da API oscila 2x entre terça-feira de manhã e sábado à noite, o que torna o planejamento de capacidade contra ela estranho para qualquer coisa com latência limitada às horas comerciais.
Acesso aos próprios pesos. Fine-tuning, inspeção de logit e decodificação personalizada simplesmente não estão disponíveis através de uma API. Se o seu produto precisar deles, a decisão nunca foi sobre o custo.

O Que Mudou Desde Nosso Guia Anterior do DeepSeek
Nossa página de preços do DeepSeek de 2026 precede a geração V4 e todo o sistema de pico e fora de pico. Quatro coisas mudaram.
| Quando | O que foi lançado |
|---|---|
| 24 de abril de 2026 | Prévia do V4-Pro e V4-Flash, com contexto de 1M de tokens e modos de pensamento alternáveis relatados no lançamento |
| 31 de julho de 2026 | DeepSeek-V4-Flash-0731, o lançamento estável do Flash |
| 13 de agosto de 2026 | DeepSeek-V4-Pro-0813 atinge disponibilidade geral |
| Por volta de 10 de setembro de 2026 | DeepSeek-V4.1-Flash, listado na documentação como DeepSeek-Flash |
Antes da mudança de preço de agosto, a linha Flash era conhecida pela última vez em $0.14 por milhão de tokens de entrada sem cache e $0.28 por milhão de saída. Este é um contexto histórico, não uma taxa pela qual você pode faturar hoje.
A mudança disruptiva merece seu próprio aviso. DeepSeek-V4.1-Flash aposentou silenciosamente os nomes de endpoints deepseek-v4-flash e deepseek-v4-flash-vision-exp. Tutoriais, respostas do Stack Overflow e exemplos de código mais antigos ainda os referenciam, e essas chamadas agora falham. Se você herdou uma integração DeepSeek escrita antes de setembro, procure por ambas as strings antes de depurar qualquer outra coisa.
Essa aposentadoria também é o argumento prático mais forte para pesos locais: um modelo em seu disco não pode ser renomeado sob uma implantação.
DeepSeek Não Oferece Programa de Crédito para Startups
O aplicativo de chat DeepSeek é gratuito. A API não é, e o DeepSeek não opera nenhum programa de crédito dedicado para startups.
Ser preciso aqui é importante, porque é onde a maioria dos artigos fica descuidada:
- O aplicativo de chat para consumidores é gratuito para usar
- Não há nível gratuito de API declarado na página oficial de preços do DeepSeek
- Alegações de créditos de API gratuitos para novas contas são relatadas de forma inconsistente e não confirmadas na página oficial, portanto, trate-as como não verificadas
- DeepSeek não publica nenhum plano de crédito para fundadores, startups ou pesquisa
Este último ponto é uma lacuna real. Um fundador pode executar o DeepSeek de forma barata, mas não pode executá-lo gratuitamente, e não pode compensá-lo com uma bolsa da maneira que pode com os provedores que operam programas. AI Perks rastreia $7.7M em créditos em 194 empresas, cobrindo os fornecedores que distribuem créditos.
Hosts de terceiros são a outra rota. Baseten lista a entrada DeepSeek V4.1 Flash a $0.30 por milhão e oferece um crédito de teste de $30 para novos espaços de trabalho. OpenRouter, Together e Fireworks também atendem modelos DeepSeek. Verifique você mesmo qualquer uma de suas taxas atuais antes de orçar contra elas, porque os preços de roteamento se movem mais rápido do que os preços dos modelos.

Perguntas Frequentes
Posso executar o DeepSeek localmente com Ollama?
Sim. Ollama baixa uma cópia quantizada dos pesos para o disco local e serve um endpoint compatível com OpenAI em localhost:11434, então o código existente precisa apenas de uma mudança na URL base. Confirme qual variante e quantização estão por trás da tag antes de fazer benchmark, porque as compilações locais e o modelo hospedado do DeepSeek frequentemente não são os mesmos pesos.
É mais barato auto-hospedar o DeepSeek do que usar a API?
Geralmente não. DeepSeek cobra $1.98 por milhão de tokens de saída fora do pico, então um equipamento que serve um milhão de tokens de saída por hora desloca cerca de $1.425 por mês (derivado: $1.98 x 24 x 30). A entrada em cache custa $0.022 por milhão, o que nenhum hardware supera. Auto-hospede para residência e controle. Para custo, use créditos de AI Perks.
O DeepSeek é de código aberto?
DeepSeek é melhor descrito como pesos abertos em vez de código aberto: os arquivos de modelo liberados são baixáveis e executáveis, o que torna a implantação local possível. Verifique o próprio repositório de modelos do DeepSeek para confirmar qual geração e qual variante é realmente publicada, já que o carro-chefe servido pela API e a compilação baixável nem sempre são idênticos.
Por que minha chamada de API deepseek-v4-flash parou de funcionar?
DeepSeek-V4.1-Flash aposentou os nomes de endpoints deepseek-v4-flash e deepseek-v4-flash-vision-exp. Qualquer código ou tutorial escrito antes de setembro de 2026 que os refira falhará. Atualize para o identificador de modelo atual na documentação da API do DeepSeek. Essa renomeação é um bom argumento para fixar pesos locais se a estabilidade for importante para você.
O DeepSeek oferece créditos de API gratuitos para novas contas?
Não há nível gratuito de API declarado na página oficial de preços do DeepSeek, e os relatos de créditos para novas contas são inconsistentes e não confirmados. DeepSeek também não opera um programa de crédito para startups. Os provedores que operam um são rastreados, com os valores atuais, em AI Perks.
Preciso de uma GPU para executar o DeepSeek localmente?
Variantes quantizadas menores funcionarão em CPU, mas a taxa de transferência cai o suficiente para descartar a maior parte do uso interativo. Compilações maiores precisam de memória do acelerador em proporção ao seu tamanho e quantização. Verifique o cartão do modelo para a tag específica em vez de confiar em um requisito genérico, e espere uma lacuna real entre "carrega" e "usável".
DeepSeek oferece a você uma escolha genuína: uma API hospedada precificada pelo relógio e pelo cache, ou a mesma família de pesos em hardware que você controla. Escolha controle quando precisar de controle. Escolha a API quando precisar de taxa de transferência, e cubra a conta com créditos dos provedores que ainda os distribuem.
Inscreva-se em getaiperks.com →
Execute você mesmo ou alugue. De qualquer forma, pare de pagar o preço integral em getaiperks.com.