このドキュメントでは、ワークロードの有効なデータ転送速度であるグッドプットを最適化する方法について説明します。この最適化を実現するために、一般的な機械学習(ML)フレームワークとモデルを使用する再現可能なグッドプット レシピを厳選しました。これらのレシピを確認するには、
AI Hypercomputer GitHub 組織をご覧ください。
グッドプット レシピは、Cluster Toolkit を使用して作成されたクラスタでテストされています。
ワークロードの信頼性を最適化し、グッドプットを最大化するために、今後 5 時間以内にパフォーマンスが低下する可能性のある Google Kubernetes Engine(GKE)クラスタ内のノードを事前に特定することもできます。この早期警告により、リスクのある VM に新しいワークロードをスケジュール設定することを回避できるため、ジョブの中断のリスクを軽減できます。詳細については、
ノードのヘルス予測を有効にするをご覧ください。