Cloudera Startup Program で得られるもの
Cloudera は、Cloudera Data Platform の利用に対して最大 10,000 ドルのクレジットを提供し、データウェアハウス、データエンジニアリング、ストリーミング、機械学習サービス全体での消費をカバーします。
AI Perks は、これを 194 社にわたる 770 万ドルのクレジット とともに追跡しています。
構造的な詳細が、見出しの数字よりも重要です。Cloudera のパブリッククラウドサービスは、Cloudera ではなく、独自のクラウドアカウントにデプロイされるように設計されています。そのため、デプロイメントでは 2 つの請求が発生します。Cloudera が請求するプラットフォームの消費と、AWS、Azure、または Google Cloud が請求する基盤となるインスタンス、オブジェクトストレージ、ネットワーク転送です。
10,000 ドルの Cloudera グラントは、これらの 2 つの請求のうち 1 つを相殺します。1 つの請求書で予算を組んでいた創業者が 2 つの請求書を受け取ると、計画よりもはるかに速くクレジットを使い果たします。リリース間でパッケージングが変更されるため、現在のサービス名と料金は Cloudera 自身の価格ページで確認してください。現在の利用規約は getaiperks.com に記載されています。

Cloudera の実際の用途
Cloudera はハイブリッドデータプラットフォームです。つまり、独自のデータセンターとパブリッククラウドで同じように実行されるオープンソースエンジン全体に、単一のセキュリティ、ガバナンス、リネージレイヤーを適用します。 差別化要因はクエリ速度ではありません。同じテーブル、アクセスポリシー、監査証跡が両方の環境でデータを追跡することです。
その成り立ちが、その形状を説明しています。Cloudera と Hortonworks は 2 つの商用 Hadoop ディストリビューションであり、2019 年に合併したため、プラットフォームは Apache エコシステムを伴います。処理には Spark、SQL には Hive と Impala、データフローには NiFi、ルックアップには HBase、エンジン全体でのオープンテーブルフォーマットとして Iceberg を使用します。バンドルとサービス名はリリース間で変化します。基盤となるエンジンが永続的な部分です。
プラットフォームクラスがあなたに適しているかどうかは、次の 3 つの質問で決まります。
- データは特定の場所に留まる必要がありますか? 居住法、エアギャップ環境、病院ネットワーク、またはテレメトリをパブリックリージョンに送信できない工場フロアなど。
- データはすでに複数の場所に存在しますか? オンプレミスとクラウド、買収後の 2 つのクラウド、または断続的に同期するエッジティア。
- ガバナンスが成果物ですか? 購入者のセキュリティレビューで、署名前に列レベルのポリシーとエンドツーエンドのリネージが要求される場合、その仕組みが購入している製品です。
すべての質問に「いいえ」と答えた場合、おそらくまだこのカテゴリは必要ありません。単一リージョンに 200GB のデータを持つシードステージのチームは、カラム拡張機能を持つ Postgres、またはオブジェクトストレージ内の Parquet 上の DuckDB で、長年にわたって十分に対応できます。 それは小規模なデータプラットフォームではなく、異なり、はるかに安価なものです。これらの質問のいずれかが「はい」になったら、クレジットを使用してください。
Cloudera がクラウドネイティブウェアハウスに勝る場合
データがすべて 1 つのパブリッククラウドリージョンに移動できない場合、Cloudera が勝ちます。移動できる場合は、クラウドネイティブウェアハウスが勝ちます。 その制約が、あらゆる機能リストよりも、両者をより確実に分離します。
| オプション | データの場所 | 購入するもの | 適合しなくなる場所 |
|---|---|---|---|
| Postgres または Parquet 上の DuckDB | 1 つのデータベースまたはバケット | シンプルさ、ほぼゼロのプラットフォームコスト | 同時実行性とガバナンスの要求 |
| クラウドネイティブウェアハウスまたはレイクハウス | 1 つのプロバイダーのリージョン | 管理されたパフォーマンス、迅速な開始 | 合法的に移動できないデータ |
| Cloudera Data Platform | オンプレミス、クラウド、またはその両方 | 環境間のポータブルなガバナンス | 未使用のリーチに対して支払いを行っている単一クラウドチーム |
| セルフホスト Spark および Iceberg | インストールした場所 | コントロール、プラットフォーム手数料なし | それを必要とするオンコールローテーション |
ハイブリッド行に留まる構造的な理由があるセクターは一貫しています。金融サービス、ヘルスケア、通信、公共部門、エネルギー、産業製造です。それらに販売し、パイロットが顧客の環境内で実行される場合、その形状のために構築されたプラットフォームは、より高速なクエリエンジンよりも優れています。広範囲にわたるプログラムは AI Perks に記載されています。

Cloudera の価格設定がスケールでどのように動作するか
消費は、各サービスが実行される時間ごとに、Cloudera 独自のコンピューティングユニットで計測され、その基盤となるインフラストラクチャはクラウドプロバイダーによって請求されます。創業者が驚くメーターは、ボリュームではなく、アイドル時間です。
| メーター | それを駆動するもの | それを急増させるもの |
|---|---|---|
| データウェアハウス | 仮想ウェアハウスの実行時間 | 自動サスペンドが設定されていない |
| データエンジニアリング | Spark の実行時間とエグゼキュータサイズ | 過剰なエグゼキュータ、サイレントリトライ |
| データフローとストリーミング | 実行中のフローデプロイメント | マイグレーション後のアイドルコネクタ |
| 機械学習と AI | セッションとワークスペースの実行時間 | シャットダウンされなかった GPU セッション |
| オペレーショナルデータベース | 常時稼働クラスター容量 | 年に 2 回のピークに合わせてサイズ設定 |
| クラウドコンピューティング | アカウント内のインスタンス時間 | 決してダウンしない開発環境 |
| オブジェクトストレージ | 格納された GB 数およびリクエストボリューム | ライフサイクルポリシーがない、スナップショットのスプロール |
| ネットワーク転送 | クロスリージョンおよびサイトツークラウドの移動 | 非従量課金のハイブリッドレプリケーション |
料金はサービス、プロバイダー、リージョン、契約によって異なり、変更されます。表は請求書の形状として扱ってください。価格としてではありません。
重要な計算はデューティサイクルです。24 時間年中無休で稼働している仮想ウェアハウスは、月に約 730 時間 請求されます。実際のクエリアクティビティがそのうちの 40 時間 である場合、受け取った作業に対して約 18 倍 の料金を支払ったことになります。これは 10% の超過ではなく桁違いであり、ほとんどのデータプラットフォームクレジットが、誰も大規模なジョブを実行せずに消えていく方法です。
ボリュームは、圧縮、パーティショニング、ファイルレイアウトがそれの多くを吸収するため、創業者が予想するよりも親切に振る舞います。アイドル時間は何も吸収しません。他に何も最適化する前に自動サスペンドを設定してください。
Cloudera クレジットがスタックするもの
Cloudera クレジットはプラットフォームの消費のみをカバーするため、クラウドクレジットはオプションの追加ではなく、同じデプロイメントのもう半分になります。 サービスはアカウント内で実行されるため、クラウドグラントなしの Cloudera グラントでは、より大きな請求書が資金不足のままになります。
動作するデータスタックは 4 つのベンダーに触れ、各レイヤーにグラントが存在します。
- クラウドクレジット は、プラットフォームが実行されるインスタンス、オブジェクトストレージ、転送をカバーします。
- Cloudera クレジット は、その上のプラットフォーム、ガバナンス、エンジンの消費をカバーします。
- 取り込みとストリーミングクレジット は、イベントをそこに移動させるものをカバーします。
- モデルと API クレジット は、トレーニングまたは提供するものからの推論をカバーします。
これらの 4 つのうち 3 つを保持しているチームは、本番データスタックの大部分に資金を提供しています。AI Perks は、194 社にわたる互換性のあるプログラムと、静かに互いを排除するプログラムを維持しています。

創業者がデータプラットフォームクレジットについて誤解していること
最も高価な間違いは、実際のニーズがテーブルであったときにプラットフォームを採用することです。2 番目は、プラットフォームクレジットとインフラストラクチャ請求書が異なる請求書であることを忘れることです。
5 つの失敗パターン(コストの概算順):
使用しないリーチを購入する。 ハイブリッドポータビリティはプレミアム機能であり、単一のクラウドリージョン内にいるチームは、それが構築された境界を越えることはありません。
1 つの請求書に資金を提供し、2 つを受け取る。 コンピューティングとストレージはアカウント内に配置されるため、プラットフォームグラントはデプロイメントの半分をカバーし、クラウドクレジットは残りをカバーします。
アイドル状態の支払い。 消費メーターは、スケールではなく、デューティサイクルを罰します。自動サスペンド、スケジュールされた環境、正直な開発ティアのサイジングは、今年のクエリチューニングよりもはるかに多くの節約になります。
ガバナンスをフェーズ 2 として扱う。 ポリシー、リネージ、監査は、このプラットフォームクラスが高価である理由です。それらをスキップするチームは、自分でインストールできたエンジンを実行するためにプレミアム料金を支払います。
逃げられないフォーマットに書き込む。 独自のオブジェクトストレージ内の Iceberg と Parquet は、実際にポータブルであり、それが本当のレバレッジです。コントロールプレーン、ポリシー設定、運用ツールは、再構築するものになります。クレジットの 70% が消費された時点で、補助金なしのスタックがどのようになるかを決定してください。
データプラットフォームクレジットを長持ちさせる方法
クレジットは、グラントのサイズではなく、運用のデフォルトによって消費されます。 3 つの設定により、10,000 ドルのプラットフォーム消費が実際にどの程度持続するかが決まります。
デューティサイクルが最初で最大です。すべての仮想ウェアハウスでの自動サスペンド、開発環境のスケジュールされたシャットダウン、正直な開発ティアのサイジングが、単一のクエリがチューニングされる前に請求書を形成します。すべて設定であり、エンジニアリングではありません。
両方の請求書に資金を提供することが 2 番目です。プラットフォームの消費と基盤となるインフラストラクチャは別々の請求書として届くため、最初の驚きが起きた後ではなく、プラットフォームグラントの隣にクラウドグラントがあります。
テーブルフォーマットが 3 番目です。独自のオブジェクトストレージ内の Iceberg と Parquet は、他のエンジンで読み取り可能であり、コントロールプレーンがそうでない場合でもデータレイヤーをポータブルに保ちます。
現在のデータとインフラストラクチャプログラムは、それぞれの金額と条件とともに getaiperks.com にあります。

よくある質問
Cloudera スタートアッププログラムの価値はどれくらいですか?
Cloudera Data Platform の利用に対する最大 10,000 ドルのクレジットで、データウェアハウス、データエンジニアリング、ストリーミング、機械学習サービス全体での消費をカバーします。適切なサイズの環境を実行する初期段階のチームにとって、これはプラットフォーム消費における有意義なランウェイです。現在の金額と適格性は getaiperks.com で追跡されます。
Cloudera クレジットは AWS または Azure の請求書をカバーしますか?
一般的にいいえ。Cloudera のパブリッククラウドサービスは、独自のクラウドアカウント内で実行されるように設計されているため、インスタンス、オブジェクトストレージ、ネットワーク転送は AWS、Azure、または Google Cloud によって直接請求されます。インフラストラクチャ側はより大きな数字になることが多いため、Cloudera グラントとともにクラウドグラントを保持してください。
Cloudera は単なる Hadoop ですか?
もはやそうではありませんが、その成り立ちは本物です。Cloudera と Hortonworks は 2019 年に合併し、プラットフォームは Apache エコシステムを前進させています。Spark、Hive、Impala、NiFi、HBase、Iceberg などです。今日購入するのは、オンプレミスとクラウドのデプロイメントにまたがるガバナンス、セキュリティ、リネージレイヤーです。
初期のスタートアップはデータプラットフォームを使用すべきですか?
多くの場合、まだです。単一リージョンに数百ギガバイトのデータがある場合、カラム拡張機能を持つ Postgres または Parquet 上の DuckDB は、より安価で、シンプルで、数年間は十分に高速です。データが特定の場所に留まる必要がある場合、複数の環境に存在する場合、またはガバナンスが顧客が購入するものである場合に、プラットフォームはそのコストに見合う価値があります。
Cloudera クレジットを他のスタートアップクレジットと組み合わせることはできますか?
はい、請求書が重複しないため、レイヤーはきれいにスタックします。クラウドクレジットはインフラストラクチャをカバーし、Cloudera はプラットフォームをカバーし、取り込みクレジットはそれを供給するものをカバーし、モデルクレジットはそれに対する推論をカバーします。194 社および 770 万ドルの追跡クレジットにわたる互換性は、getaiperks.com に記載されています。
Cloudera クレジットがなくなるとどうなりますか?
無料であった間に選択されたデューティサイクル、サイジング、および保持のデフォルトによって形成された請求書を引き継ぎます。自動サスペンドを早期に設定し、テーブルを独自のストレージ内の Iceberg と Parquet に保持してポータブルな状態にし、最初の完全な請求書の後ではなく、70% が消費された時点でカットするものを決定してください。
データレイヤーを構築します。初期のプラットフォーム請求書は他の誰かに資金提供させましょう。