Cloud TPU リソースを計画する

このページでは、Tensor Processing Unit(TPU)の使用量を計画する方法について説明します。

使用オプションを選択する

使用オプションとは、コンピューティング リソースを取得して使用する方法を指します。速度、期間、費用、プリエンプション許容度に基づいて Cloud TPU VM 容量をリクエストできます。次のオプションがあります。

  • オンデマンド: 標準の従量課金制インスタンス。
  • Spot VM: 低コストのプリエンプティブル インスタンス。プリエンプティブル割り当てを使用します。
  • Flex Start VM: 長期的な予約や複雑な割り当て管理を行うことなく、最大 7 日間、必要に応じて容量を予約します。
  • 予約: 特定の期間(最大 90 日間または 1 年以上)の容量を予約し、可用性を保証します。オンデマンドの割り当てを使用します。

次の表に、動作、理想的なユースケース、サポートされている TPU バージョンに基づいて、TPU の使用オプションを比較します。

使用オプション 機能 最適な用途 サポートされる TPU バージョン
1 年以上の将来の予約

1 年以上前に TPU リソースをリクエストします。これらのリソースは、その期間にお客様が排他的に使用するために予約されます。

予約を使用すると、容量を確実に確保できます。また、オンデマンド リソースよりも低価格で利用できます。

TPU の将来の予約には、確約利用割引(CUD)が含まれます。CUD では、確約利用契約を購入すると割引料金が適用されます。詳細については、 1 年以上の将来の予約をご覧ください。

1 年以上の将来の予約は、長時間実行されるトレーニング ジョブと推論ワークロードに最適です。 すべての TPU バージョン
最大 90 日間の将来の予約(カレンダー モード)

特定の開始時間と期間(1 ~ 90 日)の TPU リソースをリクエストします。これらのリソースは、その期間にお客様が排他的に使用するために予約されます。詳細については、最大 90 日間の将来の予約(カレンダー モード)をご覧ください。

予約を使用すると、容量を確実に確保できます。また、オンデマンド リソースよりも低価格で利用できます。

カレンダー モードの将来の予約は、正確な開始時間と定義された期間を必要とするトレーニングとテストのワークロードに適しています。 TPU7x、TPU v6e、TPU v5p
オンデマンド

TPU リソースをリクエストして、必要な期間すぐに使用できるようにします。

オンデマンドは柔軟性が高い方法です。オンデマンド リソースはプリエンプトされませんが、リクエストを満たすのに十分な TPU リソースがあることを保証するものではありません。TPU リソースを作成する際のデフォルトのオプションはオンデマンドです。オンデマンド TPU の作成と使用の詳細については、TPU VM を作成するをご覧ください。

オンデマンドは、緊急のジョブや、終了時間を柔軟に設定する必要があるワークロードに適しています。 すべての TPU バージョン
Flex Start(プレビュー)

容量を事前に予約することなく、最大 7 日間の TPU リソースをリクエストします。

TPU Flex Start VM は専用の容量プールから提供されるため、これらのリソースの可用性はオンデマンドよりも高くなります。詳細については、TPU Flex Start VM をリクエストするをご覧ください。

Google Kubernetes Engine(GKE)で TPU Flex Start VM を使用する方法については、 Flex Start プロビジョニング モードでの GPU と TPU のプロビジョニングについてをご覧ください。

Flex Start は、迅速なテスト、小規模なテスト、推論ワークロード用の TPU の動的プロビジョニング、モデルのファインチューニング、7 日未満のワークロード実行に適しています。 TPU7x、TPU v6e、TPU v5p
スポット

プリエンプト可能な TPU リソースをリクエストします。

Spot VM は、オンデマンド リソースよりも大幅に低価格で利用できます。Spot VM はオンデマンド リソースよりも簡単に取得できますが、いつでもプリエンプト(シャットダウン)される可能性があります。実行時間に制限はありません。TPU Spot VM の詳細については、 TPU Spot VM を管理するをご覧ください。

Spot は、モデルの事前トレーニング、モデルのファインチューニング、可用性の中断に耐性のあるシミュレーション ジョブなど、優先度の低いワークロードのスケジューリングに適しています。 すべての TPU バージョン

TPU 容量モードを選択する

デフォルトでは、TPU 容量は Google マネージド インフラストラクチャで動作します。予約がある場合は、TPU v6e(Trillium)と TPU7x(Ironwood)に All Capacity モードを使用できます。All Capacity モードでは、予約済み容量の 100% にアクセスでき、トポロジを完全に可視化できます。ただし、ハードウェアのメンテナンスと障害復旧の管理はお客様の責任となります。

デフォルトの Google マネージド インフラストラクチャと All Capacity モードの詳細な比較については、TPU 容量モードをご覧ください。

TPU バージョンを選択する

モデルのトレーニングまたは推論のニーズに基づいて、TPU バージョン(v5p、v6e、TPU7x(Ironwood)など)を選択します。詳細については、TPU のバージョンをご覧ください。

TPU の割り当てをリクエストする

TPU VM を使用するには、使用オプションに関係なく、Cloud TPU リソースのオンデマンド割り当てまたはプリエンプティブル割り当てが必要です。選択したオプション、TPU バージョン、サイズ、ゾーンに十分な割り当てがあることを確認します。割り当ては TPU バージョンごとに固有であり、オンデマンドとプリエンプティブルの使用で異なります。一部の TPU バージョンにはデフォルトの割り当てがありますが、他のバージョンでは割り当てをリクエストする必要があります。詳細については、Compute Engine の割り当てをご覧ください。

次のステップ