クラスタ管理機能

A4X MaxA4XA4A3 UltraA3 MegaA3 High(8 GPU)マシンシリーズなどのクラスタ化された GPU は、大規模な人工知能(AI)クラスタと機械学習(ML)クラスタを実行できるように設計されており、次のクラスタ管理機能を提供します。

サポートされているマシンシリーズ

このページで説明するクラスタ管理機能は、 マルチノードの大規模ワークロード向けに最適化されたクラスタ化された GPU マシンシリーズで使用できます。

これらの機能は、標準の VPC ネットワーキングを使用し、メンテナンス運用モードや高密度コロケーションをサポートしていない独立したコンピューティング リソースで構成される汎用 GPU マシンシリーズには適用されません。

次の表に、AI Hypercomputer でサポートされているマシンシリーズをまとめます。

カテゴリ マシンシリーズ クラスタ管理をサポート
クラスタ化された GPU A4X MaxA4XA4A3 UltraA3 MegaA3 High はい
汎用 GPU A3 EdgeA2G2G4N1 いいえ

各マシンシリーズの詳細については、GPU アクセラレータについてをご覧ください。

ほとんどのクラスタ管理機能は、 予約にバインドされた容量でのみサポートされます。これは、 予約にバインドされたプロビジョニング モデルを使用するインフラストラクチャであり、 クラスタ化された GPU マシンタイプのみをサポートします。 他のプロビジョニング モデルを使用する容量では、次のクラスタ管理機能のみを使用できます。

クラスタ化された GPU インフラストラクチャのコロケーション

A4X Max、A4X、A4、A3 Ultra、A3 Mega、A3 High(8 GPU)などのクラスタ化された GPU を使用する場合は、 Compute Engine ができるだけ近づけてプロビジョニングするホストマシンをリクエストできます。これらのマシンには次の機能があります。

このリソース構成により、ネットワーク ホップが最小限に抑えられ、ネットワーク レイテンシが最小限になるように最適化されます。Compute Engine が高密度に割り振るアクセラレータ最適化マシンのブロックをデプロイするには、次のオプションを使用します。

クラスタ トポロジを考慮した配置

クラスタ化された GPU を作成すると、ノードレベルとクラスタレベルでトポロジ情報を取得できます。この情報は、次の操作に役立ちます。

  • ネットワーク レイテンシをさらに最小限に抑えるように、アプリケーションまたはワークロードの設計を調整する。

  • 相互に頻繁に通信するインスタンスのネットワーク レイテンシとパフォーマンスの問題を理解し、トラブルシューティングする。この問題は、インスタンスが予期せず離れた場所に配置されている場合に発生することがあります。

具体的には、トポロジ機能のサポートは次のとおりです。

詳細については、 コンピューティング インスタンスのトポロジを表示するをご覧ください。

クラスタの運用モード

クラスタ化された GPU を使用してコンピューティング インスタンスまたはクラスタを作成するために容量を予約する場合、予約するマシンタイプによって、インスタンスのクラスタ運用モードが決定します。 このモードでは、ホストエラーまたは障害のあるホストの報告後にインスタンスがどのように動作するかを指定します。インスタンスで使用できる運用モードは、障害のある マシンを Compute Engine が自動的に置き換えるが、インスタンスが再起動に必要なリソースを確保できるように予約容量の一部を保持する マネージド モードです。または、予約済みの容量全体にアクセスできるが、障害と計画メンテナンスの管理はお客様の責任となる全容量モードです。

詳細については、 予約の運用モードをご覧ください。

クラスタのメンテナンスのスケジュール設定と制御

リソース ブロックでトポロジを考慮したスケジューリングを使用して、クラスタ化された GPU のメンテナンスを制御します。この機能により、アップグレードが同期され、ワークロードのホストイベントに対する復元力を高め、中断を最小限に抑えることができます。このアプローチは、ワークロードの グッドプットを向上させるのに役立ちます

メンテナンス イベントを完全に制御するために、次の機能を使用できます。

メンテナンスのスケジュール設定のタイプ

クラスタ化された GPU のコンピューティング インスタンスまたはクラスタを作成するために容量を予約する際に、インスタンスが実行されるインフラストラクチャを Compute Engine がどのように維持するかを定義できます。インスタンスに使用するマシンタイプに基づいて、インスタンス間の同期メンテナンス(グループ化)または 異なるメンテナンス スケジュール(独立)を選択できます。

詳細については、 メンテナンスのスケジュール設定のタイプをご覧ください。

ホストイベントを管理する

クラスタ化された GPU を作成してワークロードを開始したら、アラートを設定し、インスタンスまたは予約済みブロックのメンテナンスがスケジュール設定、開始、完了されたときに通知を受け取ることができます。また、スケジュール設定された時刻より前に、インスタンスまたは予約済みブロックのメンテナンスを表示して、必要に応じて手動で開始することもできます。 これらのオプションを使用すると、ワークロードのダウンタイムを事前に制御して最小限に抑えることができます。

詳しくは以下をご覧ください。

クラスタ モニタリングと診断ツール

モニタリングとトラブルシューティングのために、クラスタ化された GPU には次のサービスが含まれています。

次のステップ