免费可观测性积分的价值是多少?
五家监控和可观测性供应商提供的初创公司积分计划,每项价值在 $2,500 至 $100,000 之间,而且由于它们都是独立的供应商发票,因此它们可以叠加而不是重叠。
AI Perks 追踪了这些积分,总计为 194 家公司提供了 194 家公司共计 $7.7M 的积分。
| 项目 | 积分价值 | 覆盖范围 | 计费方式 |
|---|---|---|---|
| Datadog | 最高 $100,000 | 基础设施监控、APM、日志、前端分析 | 主机、日志摄入、自定义指标 |
| PostHog | 最高 $50,000 | 产品分析、会话回放、错误追踪、标志 | 事件 |
| New Relic | $5,000 | APM、基础设施、日志、错误追踪 | 摄入数据、全平台席位 |
| Elastic | $5,000 | 日志分析、搜索、Kibana 仪表板 | 预置资源、保留数据 |
| PagerDuty | $2,500 | 值班调度、升级、告警路由 | 席位 |
有两件事会扭曲这张表格。标题数字是上限,不是报价,而且路线会改变数字:通过云合作伙伴计划获得的 Datadog 报价价值为 $5,000,而不是 $100,000,但产品相同。资格因计划而异,每条路线的当前条款可在 getaiperks.com 上找到。

可观测性实际为你买了什么
可观测性不是单独的指标、日志和追踪。这三者都是免费的。你支付的是它们之间的连接,这样在凌晨 3 点,一个人就可以从延迟峰值切换到特定追踪,再切换到特定日志行,而无需更换工具。
每个层都有免费的等效项。Prometheus 和 Grafana 覆盖指标。OpenTelemetry 搭配 Jaeger 或 Tempo 覆盖追踪。Loki 或你的云提供商的原生日志覆盖日志。开源错误追踪覆盖异常。
你无法免费获得的是关联性和运营商的缺席。自己运行该堆栈大约需要一位工程师的四分之一的工作量,当数据保留、基数和版本升级成为实际工作时。在一家十人公司,这四分之一的工作量比软件本身更昂贵。
判断你是否需要付费平台的诚实测试是:**你是否有值班轮换,是否有人因为无法从一个仪表板解释的事情而被呼叫两次?**如果答案是否定的,错误追踪加上你云的内置指标就足够了,积分稍后会更有价值。
可观测性定价如何随规模变化
可观测性账单与收入不符。它们与你的代码的“健谈”程度有关,这是一个工程师在冲刺中期做出的决定,而从未见过价格。
每个供应商都以不同的轴进行计量,而该轴决定了给定积分的消耗速度:
- 基于主机的 (Datadog 基础设施):可预测,直到自动伸缩组在高峰时计算短暂运行的节点
- 基于摄入的 (New Relic, Elastic, 大多数日志产品):可预测,直到事件发生后有人仍然开启调试日志
- 基于事件的 (PostHog):随流量和仪表化而增长,而非人数
- 基于席位的 (PagerDuty, New Relic 的一部分):这是你唯一可以真正预测一年远的计量方式
几乎每个人都会遇到的失败模式是标签基数。在自定义指标中添加类似 user_id 或 request_id 的标签是一个单行更改,它可以将单个指标乘以六位数的存储时序数据。这是意外的可观测性账单最常见的原因,遥遥领先。
可能出错的规模不是理论上的。据报道,Coinbase 在 2023 年在 Datadog 上的支出达到数千万美元,比内部预期高出一个数量级。没有人批准过这个。它是一次一个标签和一个日志级别累积起来的。

如何在可观测性提供商之间进行选择
根据账单计量和你的团队能够操作的内容来选择,而不是根据标题上的积分。一个价值 $100,000 的赠款,如果用于你没有进行仪表化的系统,其价值不如一个价值 $5,000 的赠款用于实际的值班轮换。
从你的团队的构成开始,而不是从供应商列表开始:
| 团队构成 | 最低可行可观测性 | 目前可以跳过 |
|---|---|---|
| 1-3 名工程师,一个服务 | 错误追踪加上你的云提供商的内置指标 | APM、会话回放、日志索引 |
| 4-10 名工程师,有值班轮换 | 错误追踪、集中式日志、告警路由 | 每个服务都进行全平台 APM |
| 10+ 名工程师,多个服务 | 在一处关联的指标、追踪和日志 | 无,这是该类别发挥其价值的地方 |
第二个决定是单一平台与最佳组合。一个供应商处理所有事情可以为你带来关联性和一个账单,并在续约时让你付出议价能力。单独的错误、日志和值班工具每个都更便宜,并且通常在其一项工作上做得更好,你为此付出的代价是在事件发生期间的上下文切换。
一个有用的规则是:**用你获得的最高积分来资助单一平台的选择,并且始终将值班服务保留在独立的供应商上。**告警是你不想与它正在监控的东西一起宕机的唯一系统。AI Perks 将这些计划整合在一起,使金额和条款并列显示,而不是散布在十几家供应商的页面上。
激活顺序
批准和激活是不同的决定,混淆它们是导致大量积分浪费的原因。重要的顺序不是你先伸手去拿哪个计划,而是你先启用哪个计划。
这些计划及其当前条款可在 getaiperks.com 上的分析和可观测性类别下找到,那里包含了监控、日志记录、错误追踪和事件工具。
一旦有多个计划可供你使用,请按你实际能够消耗的顺序从小到大激活它们。
先激活小型、基于席位的赠款。 值班和错误追踪在你启用当天就能带来价值,并且以可预测的速度消耗积分。
在车队真正运行起来后,最后激活最大的赠款。 积分消耗于你已经进行仪表化的部分,因此激活一个大型赠款但只使用三个服务,最终会白白消耗掉。
定期重新检查该类别。 基础设施计划的条款和路线经常变化,同一供应商通过一个路线可能比另一个路线贵二十倍。

创始人对可观测性积分的误解
最昂贵的错误是将巨额积分视为免费监控,而不是一个固定的窗口,让你在之后能够以标价购买可负担的成本习惯。
假设云积分可以覆盖。 它们不能。Datadog、New Relic 和 PagerDuty 是第三方供应商,它们的账单独立于你的 AWS 或 Google Cloud 余额。这正是它们能够整齐叠加的原因,也是为什么同时持有云积分、模型积分和可观测性积分可以覆盖三个不同的账单,而不是一个更大的同一版本。
在第一天就对一切进行仪表化。 积分在你的团队形成默认设置的精确时刻消除了价格信号。任何你在免费时启用的东西,你之后都将以标价继承。
索引无人搜索的日志。 摄入是便宜的,索引不是。广泛摄入,狭窄索引,其余归档到对象存储。
无使用量警报。 所有这些平台都可以监控其自身的消耗。在第一天配置好,而不是在余额几乎用完时才配置。
过晚规划退出。 积分以标价计价,因此一个的结束是一个悬崖而不是一个坡道。在消耗 70% 时决定你将削减什么。同一类别中用于缓冲过渡的其他计划可在 getaiperks.com 上找到。
常见问题解答
初创公司最大的免费可观测性积分有哪些?
Datadog 最大,高达 $100,000,其次是 PostHog,高达 $50,000,然后是 New Relic 和 Elastic,各约 $5,000,PagerDuty 为 $2,500。金额因路线而异,因此同一供应商可能价值非常不同的金额。当前条款可在 getaiperks.com 上找到。
AWS 或 Google Cloud 积分是否涵盖 Datadog 或 New Relic?
否。这些是第三方 SaaS 供应商,它们的账单独立于你的云提供商,因此大量的云赠款不会触及你的监控账单。这种分离是它们能够整齐叠加的原因,也是为什么同时持有两者比只持有一个金额更大的更重要。
我可以叠加来自多个供应商的可观测性积分吗?
是的。每个计划都是一个独立的供应商发票,因此没有什么可以阻止你在一个赠款上运行错误追踪,在另一个上运行日志,在第三个上运行值班服务。实际限制是操作上的,而不是合同上的:更多的工具意味着事件发生期间更多的上下文切换。请参阅 getaiperks.com 上的可用组合。
种子轮前的初创公司应该使用哪个可观测性工具?
对于一到两个服务且没有值班轮换的情况,错误追踪加上你的云提供商的内置指标几乎可以覆盖一切,成本接近零。一旦你拥有多个服务、一个队列以及无法从单个仪表板解释的事件,一个完整的平台就能发挥其价值。
为什么我的可观测性账单增长速度比我的流量快?
几乎总是自定义指标的基数。向指标添加高基数标签,如用户 ID 或请求 ID,会将其乘以巨大的存储时序数据量。日志索引通常是第二大原因。定期审计这两项可以使账单减半,而不会丢失任何实际的可见性。
可观测性积分用完后会发生什么?
你将继承一个账单,其规模是你免费使用期间形成的习惯决定的,并且是以标价而非协商价格支付。解决方法是写下你可以在无补贴情况下承担的月度支出,然后配置保留期、索引和 APM 覆盖范围,以便在积分结束前达到该水平。
对系统进行仪表化。让别人来付费监控它。