2026年Fireworks AI的实际成本是多少?
Fireworks AI 在其标准无服务器层上为 Kimi K3 提供服务,每百万输入 token 价格为 3.00 美元,每百万缓存输入 token 价格为 0.30 美元,每百万输出 token 价格为 15.00 美元。
这些是 Fireworks 公布的发布价格,它们与 Moonshot AI 的第一方价格分文不差,这种情况在第三方托管服务中很少见。
Fireworks 于 2026 年 7 月 27 日 发布了 Kimi K3,这一天 Moonshot 同时发布了权重、推理和训练。Modal 和 Baseten 也在同一天发布了 Kimi K3,这场发布会成为一场三方竞逐。Moonshot 于 7 月 16 日向聊天和 API 用户开放了 K3。K3 是一个拥有 2.8 万亿参数的混合专家模型,是迄今为止最大规模的开放权重模型,并在 Artificial Analysis 排行榜上 debut 获得第三名。
| 模型和托管 | 输入 / 1M | 缓存输入 / 1M | 输出 / 1M | 上下文 |
|---|---|---|---|---|
| Kimi K3, Fireworks Standard | $3.00 | $0.30 | $15.00 | 1M |
| Kimi K3, Fireworks Fast | $4.50 | $0.45 | $22.50 | 1M |
| Kimi K3, Moonshot direct | $3.00 | $0.30 | $15.00 | 1,048,576 |
| Kimi K2.7-Code, Moonshot direct | $0.95 | $0.19 | $4.00 | 262,144 |
| Kimi K2.7-Code highspeed, Moonshot | $1.90 | $0.38 | $8.00 | 262,144 |
| Kimi K2.6, Moonshot direct | $0.95 | $0.16 | $4.00 | 262,144 |
输入是指缓存未命中率,缓存输入是指缓存命中率。在 Kimi K3 上,缓存输入的成本是未缓存输入的 10%,因此提示缓存在这里比几乎任何其他优化都更有价值。代际跨越也非常显著:K3 的输出成本是 K2.7-Code 输出成本的 3.75 倍,K3 拥有 2.8T 参数,而 K2.6 拥有 1T 参数,其中 32B 参数处于活跃状态。
没有人会在第一年仅凭收入来支付前沿推理的费用。AI Perks 会追踪哪些模型和计算供应商正在提供积分。

Fire Pass 是真正的免费套餐吗?
Fire Pass 是 Fireworks 的免费套餐,其特色免费模型是 Kimi K3 Fast,拥有完整的 1M token 上下文。它缺乏的是一套可以用于产品规划的已发布限制。
一个由前沿模型驱动的免费套餐是不寻常的,与实验室的策略形成鲜明对比:Moonshot 不对任何 Kimi 模型提供永久免费套餐,据报道,API 在进行任何响应之前都需要预先充值,最低充值金额约为 1 美元。Fireworks 通过免费套餐提供相同的模型权重,这是最经济合法的将编码代理指向 1M 上下文模型的方式。
警告是双向的。关于 Fire Pass 的文章流传着非常具体的条件:邀请码、禁止的生产工作负载、撤销条款、每日上限。在 Fireworks 本身已检查的发布材料中,这些都没有得到确认,因此请将每一项限制和数字都视为未经确认,直到它们出现在您自己的控制台中。
开发者试用和付费预算之间的差距正是初创公司信用计划所要填补的。AI Perks 会追踪目前开放的计划。
美国托管溢价:两个不一致的数字
Fireworks 以高于全球价格的价格销售 Kimi K3 的美国托管版本。该溢价有两种报道方式,两者之间的差距是五倍。
Fireworks 自己的 Kimi K3 发布材料显示,美国托管版本的价格比基础无服务器价格高出 10%。后来对 Fireworks 无服务器定价文档的总结报告了一项政策:从 2026 年 9 月 1 日起,新发布的仅限美国的模型价格为基础价格的 1.5 倍,但有一个例外,GLM-5.2 Fast US 据称与全球价格相同。第二个说法是二手总结,在此处未得到 Fireworks 文档的确认。
这两种说法可能同时成立:一种描述的是该日期之前的模型定价,另一种描述的是该日期之后发布的新模型。在承诺数据驻留条款之前,请从您自己的控制台中查看美国价格,因为在前沿模型上,10% 与 50% 的差异将从舍入误差变为一个独立的支出项目。
相比之下,速度层定价并无争议。在单次运行 1M 输入和 100K 输出 token 且无缓存命中时:
| 路线 | 输入成本 | 输出成本 | 运行总计 |
|---|---|---|---|
| Kimi K3, Fireworks Standard | $3.00 | $1.50 | $4.50 |
| Kimi K3, Fireworks Fast | $4.50 | $2.25 | $6.75 |
Fast 价格在所有三种 token 类型上的成本都是 Standard 的精确 1.5 倍,在该次运行中增加了 2.25 美元:如果您需要低延迟,这是划算的,但作为默认选项则很昂贵。

无服务器训练:有报道,但未经确认
据报道,Fireworks 与 Kimi K3 一同发布了无服务器训练 API,按 token 计费 LoRA 微调,而不是按预留 GPU 小时计费。几乎所有关于它的信息都是二手信息。
设计变更是有趣的部分,它不依赖于费率卡。预留训练会为 GPU 小时收费,无论您是否正在学习任何内容。按 token 计费的训练则为实际完成的工作收费,这更适合大多数团队实际运行的 LoRA 大小的实验。据报道,发布时的覆盖范围包括 Qwen 3.5 9B、Qwen 3.6 27B 和 Kimi K3。
以下所有内容均由二手来源报告,在此过程中未在 Fireworks 的官方文档中得到确认。请将其视为一个大致方向,而不是一个确切的价格:
- 据说计费方式是按 prefill、cached prefill、sample 和 train 阶段进行拆分,而不是统一的按 token 费率。
- 据报道,这些阶段的价格范围在每 100 万 token 0.66 美元到 32.55 美元之间。49 倍的价差使得任何单一的头条数字都毫无意义:基于错误阶段的报价会造成数量级上的错误。
- 每个模型的 LoRA 费率、样本运行成本和预览状态在发布报道中都有流传,但在此均未得到确认。
请根据您自己控制台的输出来预算微调计划,而不是根据发布报道。积分是更便宜的可控变量,AI Perks 会同时追踪计算和模型积分。
Fireworks、Modal、Baseten 还是 Moonshot Direct?
根据公布的数据,Fireworks Standard 和 Moonshot direct 持平,而另外两个首发当天的托管服务商尚未公布足够的信息进行比较。
Fireworks 的 Standard 层和 Moonshot 的平台在每百万 token 的输入、缓存输入和输出价格上均为 3.00 美元、0.30 美元和 15.00 美元,上下文长度均为 1M token。这种价格一致性完全消除了价格因素的考量。
其他竞争者的信息比发布报道所暗示的要少:
- Baseten 列出的 Kimi K3 输入价格为每 1M token 3.00 美元。其公布的输出数据不够清晰,无法在 Baseten 自家的定价页面上准确读取。
- Modal 确认了 Kimi K3 的按 token 计费,但在其发布帖子中未公布每 1M token 的价格。Modal 为新工作空间提供每月 30 美元的通用计算积分,这是一项固定优惠,而不是 Kimi 的发布特权。
- Moonshot direct 不对任何 Kimi 模型提供永久免费套餐,并将 K2.6 的批量作业价格设定为标准价格的 60%,这是这里唯一的第一方且明确的折扣。
关于权重的注意事项:Kimi K3 的自定义许可证要求收入超过 2000 万美元的公司在转售访问权限之前必须与 Moonshot 协商商业合同。这限制了自行托管的副本,而不是通过他人 API 调用。

实际削减 Fireworks 账单的方法
Fire Pass 覆盖开发者笔记本电脑。信用计划覆盖产品。它们是不同的工具,您需要两者兼备。
推理积分和计算积分从不同方向到达同一目的地。Fireworks 按 token 收费;下层的 GPU 运行其自身的初创公司计划。首先需要了解的是:在 Moonshot 自家的 Kimi 平台上,没有找到针对 K2.6、K2.7-Code 或 K3 的专用初创公司信用计划,因此这个系列的信用层位于托管商那里,而不是模型实验室。
经过仔细审查后,仍然有效的节省成本方法(按重要性排序):
- 优先缓存。在 Kimi K3 上,提示缓存的成本是未缓存率的 10%,这比更换提供商更重要,而且是唯一无需尝试即可节省成本的方法。
- 正确调整模型大小。K2.7-Code 的输入价格为 0.95 美元,输出价格为 4.00 美元,大约是 K3 输出价格的四分之一,Moonshot 报告称,其在实验室自家的 Kimi Code Bench v2 上得分比 K2.6 高 21.8%,同时使用的推理 token 减少了 30%。内部基准测试是营销手段,但发票上显示的推理 token 数量确实减少了。
- 批量处理非延迟敏感的任务。Moonshot 将 K2.6 的批量作业价格设定为标准价格的 60%。
- 每季度重新检查。据报道,Fireworks 的美国定价政策于 2026 年 9 月 1 日变更,但并未伴随任何模型发布。费率卡的变化速度比关于费率卡文章(包括这篇)的变化速度要快。
常见问题解答
Fireworks AI 有免费套餐吗?
是的。Fire Pass 是 Fireworks 的免费套餐,其特色免费模型是 Kimi K3 Fast,拥有 1M token 上下文。关于上限、邀请条件和工作负载限制的说法流传甚广,但在此处检查的材料中并未得到确认,因此请在您自己的控制台中进行核实。对于超出个人开发预算的需求,可以在 getaiperks.com 追踪信用。
Kimi K3 在 Fireworks AI 上需要多少费用?
在标准无服务器层上,Kimi K3 的价格为每百万输入 token 3.00 美元,每百万缓存输入 token 0.30 美元,每百万输出 token 15.00 美元。Fast 层价格为 4.50 美元 / 0.45 美元 / 22.50 美元,正好是 Standard 价格的 1.5 倍。美国托管版本具有溢价,其幅度报道不一。
Fireworks AI 比直接使用 Kimi 更便宜吗?
不,也不是更贵。Fireworks 的 Standard 层在所有三种 token 类型上都与 Moonshot AI 公布的价格分文不差,并且上下文长度均为 1M token。根据地区、延迟和模型广度进行选择,然后使用 getaiperks.com 的积分来削减您最终的账单。
Fireworks 的美国托管溢价是多少?
有两种报道方式。Fireworks 的 Kimi K3 发布材料显示,美国托管版本的价格比基础无服务器价格高出 10%。对 Fireworks 定价文档的二手总结则报告称,从 2026 年 9 月 1 日起,仅限美国的模型价格为基础价格的 1.5 倍,GLM-5.2 Fast US 是一个例外,价格与全球价格相同。在预算这两个数字之前,请检查您实际计划调用的模型。
Fireworks 无服务器训练 API 是否普遍可用?
Fireworks 尚未发布完整的无服务器训练公开费率卡,从二手来源流传的数字,包括据报道的按 100 万 token 0.66 美元到 32.55 美元的价格范围(跨越计费阶段),均未得到确认。请根据您自己控制台的输出来为任何微调计划定价,并使用 getaiperks.com 的积分进行抵消。
Kimi K3 有初创公司信用计划吗?
在 Moonshot 方面,没有找到针对 K2.6、K2.7-Code 或 K3 的专用初创公司信用计划。在托管商方面,Modal 为新工作空间提供每月 30 美元的通用计算积分,但这并非 Kimi 特定的。推理和计算层的当前条款可在 getaiperks.com 追踪。
运行前沿模型。让别人来支付 token 的费用。