本地运行 DeepSeek:Ollama、开放权重、真实成本

自行运行 DeepSeek,开放权重和 Ollama,以及与 DeepSeek 非高峰期和缓存命中 API 定价的盈亏平衡计算。

DeepSeekOpen WeightsOllamaSelf-HostingAI Perks
Author Avatar
Andrew
AI Perks Team
10,798

Quick Answer

DeepSeek 发布了开放权重,因此您可以通过 Ollama 在本地运行它,或自行托管。成本很少是原因。DeepSeek 在非高峰时段 API 价格减半,并且对缓存输入收费约低 30 倍,因此自托管必须低于每百万输出代币 1.98 美元。来自运行初创企业计划的提供商的积分可在 getaiperks.com 追踪。

你可以自己运行 DeepSeek 吗?

是的。DeepSeek 的开源权重版本可以下载并在你自己的硬件上运行,而 Ollama 是最快捷的本地运行方式。成本几乎不是你这样做的原因。

第二句话是其他指南都忽略的部分。DeepSeek 的托管 API 提供了两项叠加的折扣,加在一起后,使得自托管的盈亏平衡点达到了大多数团队无法用租用的 GPU 达到的水平。

自托管 DeepSeek 是一个控制决策:数据驻留、离线运行、版本锁定。将其视为一个储蓄计划,那么下面的数字会让你失望。

实际发放模型积分的提供商的积分追踪地址是 AI Perks


Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

如何使用 Ollama 运行 DeepSeek

Ollama 下载权重的量化副本,将其保存在本地磁盘上,并在 localhost:11434 上公开一个与 OpenAI 兼容的 HTTP 端点,因此现有代码只需更改一行基础 URL 即可切换。

工作流程很简短:

  • ollama pull <deepseek-tag> 获取权重
  • ollama run <deepseek-tag> 进行交互式提示
  • 将你的 SDK 指向 http://localhost:11434/v1,并将任何非空字符串作为 API 密钥传递

在将某个标签用于产品之前,需要在模型页面上检查三件事:

标签实际包含的变体。 适合笔记本电脑的权重和 DeepSeek 托管端点背后的权重通常不是同一个模型。蒸馏版和精简版共享一个家族名称,但行为不同。

你下载的量化版本。 4 位版本比 8 位版本内存占用减半,并且输出不完全相同。如果你进行本地基准测试并部署到 API,你就是在比较两个不同的系统。

你的实际上下文上限。 在本地,上下文受限于你的内存,而不是公告中的最大值。托管版本中的长上下文数字无法转移到你的机器上。


自托管需要克服的障碍

DeepSeek 是唯一一家按一天中的时间收费的主要模型供应商。高峰时段是工作日的 01:00 至 04:00 和 06:00 至 10:00 UTC,此时间窗口之外的所有时间,包括整个周末,价格都正好减半。

在时钟价格之上,还有一个更大的缓存折扣。当前公布的价格(美元/百万 token):

模型和 token 类型非高峰时段高峰时段
DeepSeek-V4-Pro 输入,缓存命中$0.022$0.044
DeepSeek-V4-Pro 输入,缓存未命中$0.66$1.32
DeepSeek-V4-Pro 输出$1.98$3.96
DeepSeek-V4.1-Flash 输入,缓存命中$0.003$0.006
DeepSeek-V4.1-Flash 输入,缓存未命中$0.15$0.30

V4-Pro 的缓存命中比缓存未命中便宜约 30 倍。结合时钟,非高峰时段的缓存输入 token 价格为 $0.022,比高峰时段的缓存未命中价格 $1.32 低 60 倍,而且是同一个模型。你的自有基础设施中没有任何东西能达到 60 倍的杠杆。完整的窗口明细请参阅我们的 DeepSeek 非高峰定价指南


Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

在本地运行 DeepSeek 的盈亏平衡计算

根据上述公布的价格得出:要超越 DeepSeek 的非高峰 API 输出成本,你的硬件每小时必须以低于 $1.98 的总价产生一百万个输出 token。

这种表述比任何 GPU 价格表都更有用,因为它适用于你租用的任何东西。获取你实际能维持的吞吐量,并与 API 上的相同数量的成本进行比较:

持续输出吞吐量API 非高峰成本API 高峰成本
100,000 token/小时$0.20$0.40
500,000 token/小时$0.99$1.98
1,000,000 token/小时$1.98$3.96
5,000,000 token/小时$9.90$19.80
10,000,000 token/小时$19.80$39.60

数据来源于 DeepSeek 公布的每 token 价格,而非 DeepSeek 的报价。

仔细阅读中间一行。一台每小时、全天候服务一百万个输出 token 的机器,大约可以节省 每月 1,425 美元 的非高峰 API 支出(计算:$1.98 x 24 小时 x 30 天 = $1,425.60)。你的加速器、主机、存储、带宽以及维护它的工程师都必须包含在内。

输入成本更糟。如果你的工作负载主要由重复使用的系统提示词组成,API 每百万缓存 token 收费 $0.022(非高峰时段)。自托管的成本必须低于每百万两美分。这不可能实现。

诚实的结论:DeepSeek 自托管只有在真正大量、稳定、高利用率的情况下才划算,其他情况几乎都不划算。对于低于此线的任何情况,更便宜的选择是使用 API 加上其他提供商的免费积分,这就是 getaiperks.com 的用途。


何时自己运行 DeepSeek 是正确的选择

自托管 DeepSeek 胜在控制,而非价格。五种情况可以证明其合理性,而无需考虑盈亏平衡表。

数据驻留和合规性。 如果提示词包含无法离开你所在司法管辖区或网络的材料,那么任何每 token 的折扣都无法使托管选项可行。这是最常见合法的理由。

气隙和离线操作。 现场部署、安全设施和不可靠的连接都需要不依赖可访问端点的推理。

版本锁定。 本地权重不会在你不知情的情况下更改。托管模型会,DeepSeek 已经证明了这一点。

免疫时钟。 自托管的成本曲线是平坦的。API 的曲线在周二早上和周六晚上之间有 2 倍的波动,这使得以它为基准的容量规划对于任何受业务时间限制的延迟都显得尴尬。

访问权重本身。 微调、logit 检查和自定义解码等功能都无法通过 API 实现。如果你的产品需要这些功能,那么这个决定从来就不是关于成本的。


Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

自上次 DeepSeek 指南以来发生了什么变化

我们 2026 年的 DeepSeek 定价页面早于 V4 代和整个高峰/非高峰系统。有四件事发生了变化。

时间发布内容
2026 年 4 月 24 日V4-Pro 和 V4-Flash 预览版,发布时报告支持 100 万 token 上下文和可切换的思维模式
2026 年 7 月 31 日DeepSeek-V4-Flash-0731,稳定的 Flash 版本
2026 年 8 月 13 日DeepSeek-V4-Pro-0813 正式发布
约 2026 年 9 月 10 日DeepSeek-V4.1-Flash,文档中列为 DeepSeek-Flash

在 8 月份的价格变动之前,Flash 线的缓存未命中输入 token 价格为每百万 $0.14,输出为每百万 $0.28。这是历史背景,而不是你今天能计费的价格。

这个破坏性变更值得单独警告。 DeepSeek-V4.1-Flash 已悄然停用 deepseek-v4-flashdeepseek-v4-flash-vision-exp 端点名称。教程、Stack Overflow 回答和旧的代码样本仍然引用它们,但这些调用现在会失败。如果你继承了一个在 9 月之前编写的 DeepSeek 集成,请在调试其他任何内容之前搜索这两个字符串。

这个重命名也是支持本地权重的最有力的实际论据:你本地的模型不会在你不知情的情况下被重命名。


DeepSeek 不提供创业公司信用计划

DeepSeek 聊天应用是免费的。API 则不是,DeepSeek 根本不提供专门的创业公司信用计划。

在这里精确很重要,因为大多数文章在这个地方都很草率:

  • 消费者聊天应用是免费使用的
  • DeepSeek 官方定价页面没有明确的 API 免费套餐
  • 关于新账户免费 API 积分的说法报告不一致且未经确认,因此请将其视为未经验证
  • DeepSeek 没有发布创始人、创业公司或研究信用计划

最后一点是一个真正的差距。创始人可以廉价地运行 DeepSeek,但不能免费运行,也不能像使用那些确实提供计划的供应商那样,通过赠款来抵消成本。AI Perks 追踪了横跨 194 家公司总计 770 万美元的积分,涵盖了提供积分的供应商。

第三方托管是另一条途径。Baseten 列出了 DeepSeek V4.1 Flash 输入价格为每百万 $0.30,并提供 30 美元的标准新工作区试用积分。OpenRouter、Together 和 Fireworks 也提供 DeepSeek 模型。在进行预算时,请自行验证他们当前的费率,因为路由价格的变动比模型价格更快。


Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

常见问题解答

我可以在本地使用 Ollama 运行 DeepSeek 吗?

是的。Ollama 将权重的量化副本下载到本地磁盘,并在 localhost:11434 上提供一个与 OpenAI 兼容的端点,因此现有代码只需要更改基础 URL。在进行基准测试之前,请确认标签背后是哪个变体和量化版本,因为本地构建和 DeepSeek 的托管模型通常不是同一个权重。

自托管 DeepSeek 比使用 API 更便宜吗?

通常不是。DeepSeek 每百万输出 token 收费 $1.98(非高峰时段),因此每小时服务一百万输出 token 的设备大约可以节省每月 1,425 美元(计算:$1.98 x 24 x 30)。缓存输入每百万 token 价格为 $0.022,没有任何硬件能比这更便宜。自托管是为了数据驻留和控制。至于成本,请使用 AI Perks 的积分。

DeepSeek 是开源的吗?

DeepSeek 最好被描述为开放权重,而不是开源:发布的模型文件是可下载和可运行的,这使得本地部署成为可能。请查看 DeepSeek 自己的模型仓库,以确认实际发布的生成和变体,因为 API 提供的旗舰模型和可下载版本并不总是相同的。

我的 deepseek-v4-flash API 调用为什么停止工作了?

DeepSeek-V4.1-Flash 已停用 deepseek-v4-flashdeepseek-v4-flash-vision-exp 端点名称。任何在 2026 年 9 月之前编写的引用它们的代码或教程都会失败。请更新到 DeepSeek API 文档中的当前模型标识符。如果您重视稳定性,此重命名是锁定本地权重的有力论据。

DeepSeek 是否为新账户提供免费 API 积分?

DeepSeek 官方定价页面没有明确的 API 免费套餐,关于新账户积分的报告不一致且未经证实。DeepSeek 也没有提供创业公司信用计划。提供此计划的供应商可以在 AI Perks 上追踪到,并显示当前金额。

我需要 GPU 才能在本地运行 DeepSeek 吗?

较小的量化变体可以在 CPU 上运行,但吞吐量会大幅下降,以至于大多数交互式使用都不可行。较大的版本需要与大小和量化成比例的加速器内存。请查看模型卡以获取特定标签,而不是依赖于通用要求,并预期“加载”和“可用”之间存在实际差距。


DeepSeek 为你提供了真正的选择:一个按时段和缓存计费的托管 API,或者在你控制的硬件上运行同一个系列模型。当你需要控制时,选择控制。当你需要吞吐量时,选择 API,并使用仍提供免费积分的供应商的积分来支付账单。

在 getaiperks.com 订阅 →

自己运行或租用。无论哪种方式,都可以停止在 getaiperks.com 支付全价。

This content is for informational purposes only and may contain inaccuracies. Credit programs, amounts, and eligibility requirements change frequently. Always verify details directly with the provider.