برنامه استارتاپ Statsig چه چیزی به شما میدهد
برنامه استارتاپ Statsig تا سقف ۵۰۰۰ دلار اعتبار برای Statsig ارائه میدهد، که قابلیتهای پرچمهای ویژگی (feature flags)، آزمایش (experimentation)، تحلیل محصول (product analytics) و پخش جلسه (session replay) را بر روی یک جریان رویداد واحد قرار میدهد، بنابراین پرچمی که یک کاربر را در معرض قرار داده و معیاری که تغییر را ارزیابی کرده، یک رکورد یکسان هستند.
AI Perks این را در دستهAnalytics ردیابی میکند، در کنار ۷.۷ میلیون دلار اعتبار در ۱۹۴ شرکت.
۵۰۰۰ دلار، اعتبار عملیاتی (runway) نیست. این فرصتی را برای اندازهگیری یک عرضه (release) بدون هزینه فراهم میکند، زمانی که یک تیم متوجه میشود که آیا واقعاً آزمایش انجام خواهد داد یا صرفاً عرضه کرده و امیدوار خواهد بود.
یک نکته در مورد فروشنده قبل از ساخت روی آن: Statsig در سال ۲۰۲۵ توسط OpenAI خریداری شد و همچنان به صورت مستقل فروخته میشود. قبل از استفاده از آن به عنوان تکیهگاه، تأیید کنید که این موضوع همچنان صادق است. جزئیات فعلی در getaiperks.com لیست شدهاند.

پلتفرم آزمایش (Experimentation Platform) واقعاً برای چیست
یک پلتفرم آزمایش به یک سؤال پاسخ میدهد که داشبورد نمیتواند: آیا تغییر شما باعث حرکت عدد شد، یا عدد به هر حال قرار بود حرکت کند؟
جایگزین آن، هیچ چیز نیست. این یعنی عرضه ویژگی، تماشای نمودار برای یک هفته، و اعلام پیروزی. این به دلایل غیرعادی شکست میخورد: فصلی بودن، اشاره مطبوعات، پایان ماه، و سه چیز دیگر که آن هفته عرضه کردید.
مورد خاصی که Statsig میفروشد این است که پرچم (flag) و معیار (metric) یک سیستم واحد هستند. در یک پشته (stack) که از فروشندگان جداگانه مونتاژ شده است، قرار گرفتن در معرض (exposure) در ابزار پرچم و تبدیل (conversion) در ابزار تحلیل قرار دارد، و پیوستن به آنها یک کار مهندسی داده است که به آرامی هرگز انجام نمیشود.
این چیست، نه:
- جایگزین تحلیل محصول نیست. شامل تحلیل است، اما یک نمودار قیف (funnel chart) به شما میگوید کجا افراد خارج میشوند. یک آزمایش به شما میگوید آیا رفع شما کار کرده است.
- برای تصمیماتی که نمیتوانید تصادفی کنید مفید نیست. تغییر قیمت در ۴۰ حساب سازمانی یک تصمیم قضایی با اندازه نمونه ۴۰ است.
- جایگزین یک معیار تعریف شده نیست. آن بحث قبل از تست اتفاق میافتد، یا بعد از آن اتفاق میافتد و نتیجه را مسموم میکند.
تست صادقانه، ترافیک است، و حسابداری احساسی نیست.
چه مقدار ترافیک قبل از اینکه یک آزمایش معنیدار شود نیاز دارید
بیشتر تیمهای در مرحله اولیه نمیتوانند اندازه برد (win) را که واقعاً عرضه میکنند، تشخیص دهند. تشخیص بهبود نسبی ۵٪ بر روی نرخ تبدیل پایه ۱۰٪ به حدود ۱۱۵۰۰۰ کاربر در تست نیاز دارد، و بردهای کوچک به بیشترین ترافیک نیاز دارند.
جدول زیر فرض میکند نرخ تبدیل پایه ۱۰٪، قدرت آماری ۸۰٪ و اطمینان ۹۵٪ در یک تست دو طرفه. اعداد با پایه شما حرکت میکنند، اما شکل نه.
| مقدار افزایش نسبی که میخواهید تشخیص دهید | تغییر در پایه ۱۰٪ | کاربران در هر بازو (arm) | کل کاربران در هر تست |
|---|---|---|---|
| ۵۰٪ | ۱۰٪ تا ۱۵٪ | ~۵۸۰ | ~۱,۲۰۰ |
| ۲۰٪ | ۱۰٪ تا ۱۲٪ | ~۳,۶۰۰ | ~۷,۲۰۰ |
| ۱۰٪ | ۱۰٪ تا ۱۱٪ | ~۱۴,۴۰۰ | ~۲۸,۸۰۰ |
| ۵٪ | ۱۰٪ تا ۱۰.۵٪ | ~۵۷,۶۰۰ | ~۱۱۵,۰۰۰ |
| ۲٪ | ۱۰٪ تا ۱۰.۲٪ | ~۳۶۰,۰۰۰ | ~۷۲۰,۰۰۰ |
این را به عنوان یک قانون توالی (sequencing rule) بخوانید، نه دلسردی. زیر چند هزار کاربر در ماه، فقط تغییرات بزرگ قابل اندازهگیری هستند، بنابراین تست طرحهای بازنگری (redesigns) و جریانهای ورود (onboarding flows)، نه رنگ دکمهها. روشهای کاهش واریانس مانند CUPED، که Statsig از آن پشتیبانی میکند، این اعداد را بدون تغییر ترتیب اندازه، کوچک میکنند.
به همین دلیل ارزش دارد که اعتبار را قبل از نیاز نگه دارید. پلتفرم از لحاظ ابزارسازی (instrumentation) در اوایل ارزان است، و ترافیک دیرتر میرسد.

رفتار قیمتگذاری Statsig در مقیاس
Statsig از لحاظ تاریخی بر روی رویدادهای تحلیلی (analytics events) به جای صندلیهای توسعهدهنده (developer seats) محاسبه میکرد، با ارزیابی پرچمهای ویژگی و آزمایش بسیار سخاوتمندانهتر از دریافت تحلیل. بنابراین قبض شما میزان ثبت (log) شما را ردیابی میکند، نه تعداد مهندسانی که استخدام میکنید.
این شکل به طور معناداری با ابزارهای قیمتگذاری بر اساس صندلی متفاوت است، و دو طرف دارد. یک تیم پنج نفره با ترافیک سنگین میتواند بیشتر از یک تیم پنجاه نفره با یک محصول B2B آرام، هزینه کند.
| متر (Meter) | چه چیزی آن را هدایت میکند | چه چیزی باعث جهش آن میشود |
|---|---|---|
| رویدادهای تحلیلی | هر رویداد ثبت شدهای که برای تحلیل ارسال میکنید | ضبط خودکار (Autocapture) در یک سایت بازاریابی با ترافیک بالا روشن است |
| بررسی پرچم ویژگی | ارزیابی پرچم در برنامه شما | از لحاظ تاریخی سخاوتمندانهترین متر، بنابراین به ندرت مشکلساز است |
| پخش جلسه | جلسات ثبت و نگهداری شده | پخش بدون نمونهبرداری با ۱۰۰٪ در طول جهش ترافیک |
| پنجره نگهداری (Retention window) | چه مدت سابقه رویداد قابل پرسوجو باقی میماند | جستجوهای طولانی در جریانهای رویداد با حجم بالا |
| بومی انبار داده (Warehouse native) | تحلیل اجرا شده بر روی انبار داده خود شما | صورتحساب توسط Snowflake یا BigQuery، نه توسط Statsig |
سطوح منتشر شده و میزان رایگان اغلب تغییر میکنند، بنابراین قبل از مدلسازی هر چیزی، اعداد فعلی را تأیید کنید.
دو مکانیک بیشتر فاکتورها را تعیین میکنند. ضبط خودکار (Autocapture): ابزارسازی هر کلیک در هر صفحه، حجم رویداد عظیمی تولید میکند و بینش کمی اضافه میکند، و روشن کردن آن یک خط است. نمونهبرداری (Sampling): پخش با ضبط کامل در صفحهای که ویروسی میشود، مورد کلاسیک فاکتور غافلگیرکننده است.
تحلیل بومی انبار داده شایسته توجه است. اجرای آن بر روی Snowflake، BigQuery یا Databricks داده خودتان، محاسبات را به فاکتور انبار داده شما منتقل میکند، که اعتبار آن را پوشش نمیدهد. این میتواند معماری درستی باشد و همچنان باعث شود که کمکهزینه کمتر از آنچه تیتر نشان میدهد، کشش داشته باشد.
اعتبارات Statsig با چه چیزی ترکیب میشوند
آزمایش یک فاکتور جداگانه است. اعتبارات ابری آن را جذب نمیکنند، اعتبارات مدل آن را جذب نمیکنند، و اعتبارات مشاهدهپذیری (observability) آن را جذب نمیکنند، بنابراین یک کمکهزینه Statsig واقعاً افزایشی است نه همپوشان.
بنیانگذارانی که یک اعتبار بزرگ AWS یا Google Cloud را در دست دارند، به طور معمول فرض میکنند که ابزارهای SaaS را پوشش میدهد. اینطور نیست.
یک حلقه عرضه و اندازهگیری (release-and-measure loop) کارآمد، چهار لایه را لمس میکند، و برنامههای استارتاپ برای هر کدام وجود دارند:
- محاسبات (Compute) - ابری که شما استقرار میدهید، معمولاً بزرگترین اعتبار شما
- عرضه (Release) - پرچمها و آزمایشها، لایهای که این اعتبار آن را پوشش میدهد
- سیگنال (Signal) - مشاهدهپذیری و ردیابی خطا، که به شما میگویند یک عرضه بد پیش میرود، دقایقی قبل از اینکه یک معیار تبدیل (conversion metric) این کار را انجام دهد.
- ذخیرهسازی (Storage) - انبار دادهای که رویدادهای خام را به عنوان منبع حقیقت (source of truth) نگه میدارد که اگر زمانی فروشنده را عوض کردید، آن را حفظ میکنید.
این لایه آخر تصمیم معماری است که اعتبار باید آن را تأمین کند. رویدادها را از طریق یک خط لوله (pipeline) ثبت کنید که آنها را در انبار داده خودتان نیز قرار میدهد و Statsig قابل تعویض باقی میماند. مستقیماً به SDK تنها ابزارسازی کنید و تاریخچه شما در داخل یک فروشنده زندگی میکند. اعتبارات زمانی ارزانترین هستند که چیزی که آنها تأمین میکنند بعداً قابل جایگزینی باشد. کدام برنامهها کدام لایه را پوشش میدهند دلیل این است که AI Perks به عنوان یک لیست ردیابی شده نگهداری میشود.

بنیانگذاران در مورد اعتبارات آزمایش اشتباه میکنند
گرانترین اشتباه این است که اجازه دهید اعتبارات رایگان سیگنال قیمت را حذف کنند در حالی که تیم شما هنوز در حال شکلدهی به تنظیمات پیشفرض ثبت (logging defaults) خود است. هر چیزی را که در زمانی که هیچ هزینهای ندارد روشن کنید، همان چیزی است که با قیمت لیست بعداً به ارث میبرید.
پنج الگو، به ترتیب تقریبی هزینه آنها:
نگاه دزدکی به نتایج و توقف زودهنگام. بررسی روزانه یک تست و توقف لحظهای که از نظر آماری معنیدار میشود، مثبت کاذب (false positives) را به شدت باد میکند. تستهای افق ثابت (fixed-horizon tests) به یک اندازه نمونه از پیش متعهد شده نیاز دارند، یا شما به یک روش تست متوالی (sequential testing method) نیاز دارید که برای نظارت مستمر طراحی شده است.
اجرای تستهای کمقدرت و نامیدن آنها به عنوان "مسطح" (flat). تستی که یک چهارم ترافیک مورد نیاز خود را دارد، معمولاً تفاوت معنیداری را برنمیگرداند، که تیمها آن را به عنوان "ویژگی هیچ کاری نکرد" میخوانند تا "ما نتوانستیم بفهمیم".
روشن کردن ضبط خودکار (autocapture) در روز اول. این سریعترین راه برای یک صورتحساب رویداد غافلگیرکننده است، و دادههایی که تولید میکند به ندرت دادهای است که در نهایت تحلیل میکنید.
رفتار کردن با عرضه درصدی (percentage rollout) به عنوان یک آزمایش. افزایش به ۱۰٪ بدون معیار از پیش اعلام شده و گروه کنترل، یک عرضه با مراحل اضافی است.
برنامهریزی برای پایان دادن (offboarding) خیلی دیر. اعتبارات به عنوان یک صخره (cliff) پایان مییابند، نه یک شیب (ramp). در ۷۰٪ مصرف، تصمیم بگیرید که کدام رویدادها را ثبت خواهید کرد و نرخ نمونهبرداری شما چه میشود، و بررسی کنید که چه چیزهای دیگری در دسته Analytics میتوانند گذار را در getaiperks.com تسکین دهند.
Statsig در میان اعتبارات Analytics کجا قرار میگیرد
دسته Analytics در getaiperks.com Statsig را در کنار سایر برنامههای آزمایش، تحلیل محصول و انبار داده، هر کدام با مقدار فعلی و شرایط خود، لیست میکند.
کانالهای شتابدهنده (Accelerator) و سرمایهگذار (investor) اغلب مقادیر متفاوتی نسبت به مسیر عمومی دارند، بنابراین بررسی کنید که شبکه شما چه چیزی را در حال حاضر پوشش میدهد. ساعتهای اعتبار (Credit clocks) نیز معمولاً از زمان فعالسازی شروع میشوند، که باعث میشود یک کمکهزینه که تا زمانی که ترافیک قابل آزمایش داشته باشید نگهداری شود، بیشتر از یکی باشد که روی یک قیف خالی سوخته است.
در هر صورت، نظم یکسان است: صورتحساب ماهانه یارانهای (unsubsidised monthly bill) را که میتوانید تحمل کنید، بنویسید، سپس ضبط خودکار، نمونهبرداری پخش و پنجرههای نگهداری را تنظیم کنید تا زمانی که اعتبار تمام شود، به آنجا برسند.

سوالات متداول
ارزش برنامه استارتاپ Statsig چقدر است؟
تا سقف ۵۰۰۰ دلار اعتبار برای Statsig، که پرچمهای ویژگی، آزمایش، تحلیل محصول و پخش جلسه را بر روی یک پلتفرم واحد پوشش میدهد. برای تیمی با ترافیک متوسط، این اعتبار عملیاتی قابل توجهی در خط آزمایش است، اگرچه حجم رویداد بالا آن را سریعتر مصرف میکند. مقادیر فعلی در getaiperks.com ردیابی میشوند.
قبل از اینکه تست A/B ارزش داشته باشد، به چه مقدار ترافیک نیاز دارم؟
به اندازهای که اندازه برد (win) که عرضه میکنید، قابل تشخیص باشد. تشخیص افزایش نسبی ۲۰٪ بر روی پایه ۱۰٪ به حدود ۷,۲۰۰ کاربر در هر تست نیاز دارد، در حالی که افزایش ۵٪ حدود ۱۱۵,۰۰۰ نفر نیاز دارد. زیر چند هزار کاربر ماهانه، تست طرحهای بازنگری بزرگ به جای تغییرات کوچک.
آیا Statsig برای پرچمهای ویژگی رایگان است؟
Statsig از لحاظ تاریخی یک سطح رایگان با میزان سخاوتمندانه رویداد ماهانه و ارزیابی پرچم غیرمجاز ارائه داده است، که استفاده پولی را عمدتاً بر روی رویدادهای تحلیلی اندازهگیری میکند. سطوح رایگان به طور منظم تغییر میکنند، بنابراین هر عدد خاصی را ناپایدار تلقی کنید و قبل از برنامهریزی بر اساس آنها، شرایط فعلی را تأیید کنید.
آیا اعتبارات AWS یا Google Cloud، Statsig را پوشش میدهند؟
خیر. Statsig یک فروشنده SaaS شخص ثالث است که جدا از ارائهدهنده ابری شما صورتحساب میگیرد، بنابراین یک کمکهزینه AWS Activate یا Google Cloud، فاکتور آزمایش را دست نخورده باقی میگذارد. این جداسازی دقیقاً دلیل این است که این دو به خوبی ترکیب میشوند. برنامههای سازگار در لایههای محاسبات، عرضه و تحلیل در getaiperks.com ردیابی میشوند.
آزمایش بومی انبار داده (warehouse-native experimentation) چیست و آیا صورتحساب من را تغییر میدهد؟
این به این معنی است که تجزیه و تحلیل آزمایش بر روی دادههایی که در حال حاضر در انبار Snowflake، BigQuery یا Databricks شما وجود دارد، به جای نسخهای که توسط فروشنده نگهداری میشود، اجرا میشود. تیمها آن را برای کنترل و حاکمیت داده انتخاب میکنند. پیامد هزینه مهم است: محاسبات پرسوجو به فاکتور انبار داده شما منتقل میشود، که یک اعتبار Statsig آن را پوشش نمیدهد.
وقتی اعتبارات Statsig تمام میشود چه اتفاقی میافتد؟
شما صورتحسابی را به ارث میبرید که توسط تنظیمات ضبط خودکار، نمونهبرداری پخش و نگهداری که در زمانی که رایگان بود انتخاب شدهاند، شکل گرفته است، با قیمت لیست. آنها را در ابتدا با دقت تنظیم کنید، رویدادهای خام را در انباری که متعلق به شماست نگه دارید تا پلتفرم قابل تعویض باقی بماند، و تصمیم بگیرید که چه چیزی را قبل از اولین فاکتور یارانهای، نه بعد از آن، تغییر دهید.
در getaiperks.com مشترک شوید →
تغییر را عرضه کنید. اجازه دهید شخص دیگری سالی را که صرف یادگیری مفید بودن یا نبودن آن میگذرانید، تأمین مالی کند.