クラスタ管理機能

A4X Max, A4X, A4, A3 Ultra, A3 Mega, および A3 High(8 個の GPU)マシンシリーズを使用するクラスタなどのクラスタ化された GPU を使用すると、大規模な 人工知能(AI)と機械学習(ML)のワークロードを実行できます。これらのマシンには次のクラスタ管理機能があります。

ほとんどのクラスタ管理機能は、 予約で制限された容量でのみサポートされます。これは、 予約で制限されたプロビジョニング モデルを使用するインフラストラクチャであり、 クラスタ化された GPU マシンタイプのみをサポートします。 他のプロビジョニング モデルを使用する容量では、次のクラスタ管理機能のみを使用できます。

AI インフラストラクチャ リソースのコロケーション

A4X Max、A4X、A4、A3 Ultra、A3 Mega、A3 High(8 個の GPU)などのクラスタ化された GPU を使用する場合は、 Compute Engine ができるだけ近づけてプロビジョニングするホストマシンをリクエストできます。これらのマシンには次の機能があります。

このリソース構成により、ネットワーク ホップが最小限に抑えられ、ネットワーク レイテンシが最小限になるように最適化されます。Compute Engine が高密度で割り振るアクセラレータ最適化マシンのブロックをデプロイするには、次のオプションを使用します。

クラスタ トポロジを考慮した配置

クラスタ化された GPU を作成すると、ノードレベルとクラスタレベルでトポロジ情報を取得できます。この情報は、次の操作に役立ちます。

  • ネットワーク レイテンシをさらに最小限に抑えるように、アプリケーションまたはワークロードの設計を調整する。

  • 相互に頻繁に通信するインスタンスのネットワーク レイテンシとパフォーマンスの問題を理解し、トラブルシューティングする。これらの問題は、インスタンスが予期せず離れた場所に配置されている場合に発生する可能性があります。

具体的には、トポロジ情報は次のようにサポートされています。

  • トポロジ情報は、予約のトポロジを表示するために 必要な予約で制限された容量で最適に機能します

  • スポット VM の場合、マシンがコンパクト プレースメント ポリシーまたはワークロード ポリシーを使用している場合にのみ、トポロジ情報が表示されます。

詳しくは以下をご覧ください。

クラスタの運用モード

予約で制限された容量を予約してコンピューティング インスタンスまたはクラスタを作成する場合、予約するマシンタイプによって、インスタンスのクラスタの運用モードが決定します。 このモード では、ホストエラーまたは 障害のあるホストのレポートの後にインスタンスがどのように動作するかを指定します。インスタンスで使用できる運用モードは マネージド モードです。このモードでは、Compute Engine が障害のある マシンを自動的に置き換えますが、インスタンスが再起動に必要なリソースを確保できるように、予約容量の一部を保持します。 または、すべての容量モードです。このモードでは、予約済みの容量全体にアクセスできますが、障害と計画メンテナンスの管理はお客様の責任となります。

詳細については、 予約の運用モードをご覧ください。

クラスタのメンテナンスのスケジュール設定と制御

リソース ブロックでトポロジを考慮したスケジューリングを使用して、クラスタ化された GPU のメンテナンスを制御します。この機能を使用すると、アップグレードを同期できるため、ワークロードがホストイベントに対してより復元力が高くなり、中断を最小限に抑えることができます。このアプローチは、ワークロードの グッドプットの向上に役立ちます

メンテナンス イベントを完全に制御するために、次の機能を使用できます。

メンテナンスのスケジュール設定のタイプ

予約で制限された容量を予約してコンピューティング インスタンスまたはクラスタ化された GPU のクラスタを作成する場合、インスタンスが実行されるインフラストラクチャを Compute Engine がどのように維持するかを定義できます。 インスタンスに使用するマシンタイプに応じて、インスタンス間の同期メンテナンス(グループ化)または 異なるメンテナンス スケジュール(独立)を選択できます。

詳細については、 メンテナンスのスケジュール設定のタイプをご覧ください。

ホストイベントを管理する

クラスタ化された GPU を作成してワークロードを開始したら、アラートを設定し、インスタンスまたは予約済みブロックのメンテナンスがスケジュール設定、開始、完了されたときに通知を受け取ることができます。また、スケジュールされた時刻の前に、インスタンスまたは予約済みブロックのメンテナンスを表示して、必要に応じて手動で開始することもできます。 これらのオプションを使用すると、ワークロードのダウンタイムを事前に制御して最小限に抑えることができます。

詳しくは以下をご覧ください。

クラスタ モニタリングと診断ツール

モニタリングとトラブルシューティングのために、クラスタ化された GPU マシンタイプには、予約で制限された容量に対して次のサービスが含まれています。

次のステップ