初创公司实际能获得多少免费 GPU 额度?
模型训练的免费 GPU 额度可从超大规模云服务商、芯片供应商和专业计算平台获得,公布的上限从最低的约 10,000 美元到最高的 1,000,000 美元不等。没有一个单一的项目能覆盖完整的训练预算,而需要实际运行的团队通常会同时获得三到四个项目。
下表是 AI Perks 当前追踪的上限。请将每一项视为一个层级上限,而非默认奖励——您获得的金额取决于您的发展阶段和融资情况,而不是您的训练规模。
| 项目 | 追踪的额度上限 | 额度涵盖内容 |
|---|---|---|
| AWS 生成式 AI 项目 | 最高 1,000,000 美元 | AWS 广泛使用:GPU 实例、模型推理、存储、传输 |
| Google Cloud for Startups | 1,000 美元至 350,000 美元 | 所有 GCP 服务,包括 GPU 和 TPU 容量 |
| AWS Activate (通用云) | 最高 300,000 美元 | 任何 AWS 服务,包括 EC2 GPU 实例 |
| AWS Trainium | 最高 300,000 美元 | Amazon 自研的训练芯片,通过 Trn 实例 |
| Modal | 最高 50,000 美元 | 无服务器 GPU 和 CPU 计算,按秒计费 |
| Together AI | 最高 50,000 美元 | 托管的开源模型训练、微调和推理 |
| Microsoft for Startups Founders Hub | 25,000 美元 Azure 额度 | Azure 计算以及 Azure OpenAI Service |
| Nvidia Inception | 最高 15,000 美元外加 DGX Cloud 折扣 | 额度、GPU 访问和工程支持 |
| Oracle Cloud | 10,000 美元 | OCI 计算、存储、网络和托管 AI |
仅云层面的总上限:远超 1,000,000 美元。 AI Perks 追踪到 194 家公司共计 770 万美元的额度,其中计算类别是最大的单一组成部分。

GPU 额度实际用途
GPU 额度用于购买租赁硬件上的加速器使用时长。当您拥有模型权重时,这是合适的工具;而当您仅调用他人的 API 时,则不适合。
这一区别决定了上述任何项目是否值得申请。四种工作负载确实会消耗 GPU 时长:
从零开始预训练。 罕见、昂贵,并且几乎很少是初创公司的首选。
继续预训练。 采用一个开源模型,并输入领域数据进行处理。这是种子阶段大多数严肃的模型工作实际发生的地方。
微调和偏好微调。 相对于上述内容,成本较低,但它是迭代式的,迭代次数决定了成本。
大规模自托管推理。 一旦请求量足够高,在预留 GPU 上提供自身权重就比按 token 计费的 API 更划算。
如果您的产品只是一个封装了前沿 API 的包装器,那么以上这些都不适用,您需要的是模型额度。这两类额度在 getaiperks.com 上并列,混淆它们是创始人浪费申请机会最常见的方式。
GPU 训练成本如何随规模变化
训练成本按 GPU 小时计费,而非按结果。无论训练收敛、发散还是在第九小时崩溃,仪表盘都会显示时钟时间乘以加速器数量的费用。
以下五个特性使得这一账单与其他初创公司成本结构的行为截然不同:
计算量随参数乘以 token 数而增长。 一个广为人知的近似值是,训练 FLOPs 大约是参数数量乘以 token 数量的六倍。因此,将两者翻倍会导致支出增加约四倍,而非两倍。
利用率是隐形乘数。 一次运行实际达到的理论 FLOPs 分数,随着并行策略、批量大小和互联方式的不同而差异很大。一次调优不佳的运行,与输出相同的任务相比,成本可能接近调优良好运行的两倍。
互联决定多节点经济效益。 没有快速节点间网络连接的廉价 GPU,对于分布式训练来说并不便宜,因为集群大部分时间都在等待梯度。
失败的运行也全额计费。 检查点频率是一种成本控制,而非仅仅为了卫生。
非 GPU 项目并非是凑数的。 检查点存储、数据集存储以及跨区域或跨云的出口流量,会在加速器支出之上增加可观的费用。广泛的云额度可以覆盖这些;仅 GPU 的拨款则不行。

如何选择 GPU 额度提供商
将额度与工作负载的形态相匹配,而不是仅仅看标题数字的大小。一个 300,000 美元的拨款,如果使用的是您的技术栈无法支持的芯片,其价值不如一个您下周就能花掉的 50,000 美元拨款。
| 如果您的工作负载是 | 合适的额度形态 | 注意事项 |
|---|---|---|
| 从零开始预训练 | 最大规模的超大规模云服务商提供的拨款 | 容量而非额度余额是限制因素 |
| 继续预训练 | 超大规模云服务商或定制芯片 | 迁移到 CUDA 以外的成本 |
| 微调开源模型 | 托管平台或专业 GPU 提供商 | 额度在数据集准备好之前就过期 |
| 爆发式实验 | 无服务器、按秒计费 | 始终预热的 GPU 会快速消耗无服务器额度 |
| 自托管推理 | 预留容量加上供应商计划 | 占空比决定盈亏平衡点,而非标价 |
| 调用前沿 API | 模型额度,而非 GPU 额度 | 完全购买了错误的层级 |
三个问题可以解决大部分选择:您的技术栈是否锁定在 CUDA,这将使定制芯片计划因迁移成本而打折扣?您的训练数据目前存放在哪里,因为出口流量是计费的?您的占空比是爆发式还是持续性的,这将决定选择无服务器还是预留容量?
每个项目的资格取决于您的发展阶段、融资情况,有时还取决于支持您的投资者。这些标准在 getaiperks.com 上按项目列出。
时间比上限金额更重要
计算项目运行在两个独立的时钟上:审查所需时间,以及一旦批准,拨款的有效期。将这两个时钟合并为一个,是这一领域最昂贵的调度错误。
审查时钟因项目类型而异。大型超大规模云服务商和芯片供应商的项目,由于决策涉及人工和队列,因此具有最高的上限和最长的审查周期。硬件供应商的项目居中,它们限制的通常是加速器分配而非金钱,而在供应紧张时,后者更有价值。无服务器和托管训练平台位于快速端,决策可能在训练运行安排之前就已经落地。
过期时钟的运行方向与直觉相反。每个计算拨款都有一个窗口期,这个窗口期通常在批准后而不是首次使用时开始。一份在数据集仍在清理时获得的拨款,其生命周期的一部分将在闲置账户上度过。因此,快速的项目最适合作为储备,而缓慢的项目则最不适合持有。
实际后果是,上限金额和可用价值会分道扬镳。一份大型拨款如果在清理过程中过期,其价值不如一份在集群准备就绪的当周才获得的适度拨款。在 getaiperks.com 上的计算和云基础设施类别显示了当前哪些项目开放,这是时间决策实际依赖的输入。

创始人对免费 GPU 额度的误解
反复出现的错误是将额度余额视为 GPU 预留。它不是。额度用于结算账单;您所在区域的容量决定了实例是否存在。
五种错误会使团队付出真金白银:
混淆额度和容量。 在供应紧张时,训练运行的限制是可用加速器,而不是预算。附带分配的供应商项目比其美元价值暗示的更有价值。
追求最大的标题数字。 非 CUDA 芯片上的拨款会带来工程周的迁移成本。有时这种交易很棒。但它永远不是免费的。
过早申请。 额度有时限,而一份在您仍在清理数据集时过期的拨款将毫无价值。
忽视出口锁定。 来自一个云的额度会将您的数据集中在那里。之后迁移大型语料库的费用是无人能预测的账单。
在可以微调时进行训练。 大多数认为需要训练的产品,实际上只需要微调;而大多数认为需要微调的产品,只需要更好的检索。免费额度是承担训练流程的一个糟糕理由。
持有不同层级的多个拨款,才能真正为一家模型公司的第一年提供资金。 AI Perks 的存在是为了展示哪些项目是开放的,以及哪些组合是兼容的。
常见问题解答
如何获得免费的 GPU 额度用于模型训练?
GPU 额度来自云提供商、芯片供应商和专业计算平台,上限从约 10,000 美元到 1,000,000 美元不等。每个项目都有基于发展阶段和融资情况的特定资格标准。当前开放项目的列表及其涵盖内容,可在 getaiperks.com 上追踪。
GPU 额度与 OpenAI 或 Anthropic 额度相同吗?
不,拥有一个不能替代另一个。GPU 额度用于支付您控制的硬件上的加速器使用时长。模型额度用于通过他人的 API 按 token 支付费用。训练自有权重的团队需要前者;调用前沿模型的团队需要后者。
我可以叠加来自多个提供商的 GPU 额度吗?
通常可以,因为每个拨款都应用于不同供应商的账单。叠加使用云、芯片供应商和专业平台提供的额度比例外情况更普遍。兼容性因项目而异,适用的组合可在 getaiperks.com 上找到。
50,000 美元的额度可以购买多少 GPU 小时?
这完全取决于加速器类别和地区,并且公开的小时费率变动频繁,任何固定答案都会很快过时。更有用的视角是占空比:爆发式实验可以长时间地延长如此规模的拨款,而始终在线的多 GPU 集群则会迅速消耗掉它。
我需要有融资才能符合资格吗?
这取决于具体项目,该类别没有统一的标准。一些项目对任何阶段的团队开放,其他项目则更看重您的融资情况,还有一些项目设有层级,随着您的发展,上限会随之提高。不同项目之间的标准差异很大,猜测不是一个好的筛选方法。当前按项目列出的要求可在 getaiperks.com 上追踪。
GPU 额度过期后会怎样?
在几乎所有项目中,未使用的额度都会被没收,这就是为什么激活时机比申请时机更重要。拨款有时限,而窗口期通常在批准后开始。将您的批准与实际训练计划排序,是花费拨款和损失拨款的区别。
训练模型。让云服务商来资助 GPU。