運用 Compute Advisor 設計 AI 基礎架構

本文說明如何透過 Compute Advisor 規劃及設計 GPU 執行個體或叢集。Compute Advisor 是由 Gemini 支援的 AI 輔助介面。如要進一步瞭解建立叢集前或建立叢集時必須設定的元件,請參閱「規劃及建立 AI 基礎架構」。

Compute Advisor 可協助您評估硬體選項、估算部署費用,以及查看叢集的建議設定。為提供量身打造的建議,Compute Advisor 會評估您的Google Cloud 專案,檢查配額限制、現有預留項目、承諾使用折扣 (CUD)預設區域和可用區,以及任何資源位置限制。在建立或修改叢集前,您可以使用 Compute Advisor 輔助規劃,為工作負載找出最佳設定。

限制

在 Google Cloud 控制台中提示 Compute Advisor 時,您無法直接建立、修改或刪除資源。

事前準備

使用 Google Cloud 控制台存取 Google Cloud 服務和 API 時,不需要設定驗證。

必要的角色

如要取得存取及提示 Gemini 所需的權限,請要求管理員授予您專案的「叢集導向器檢視者」 (roles/hypercomputecluster.viewer) IAM 角色。如要進一步瞭解如何授予角色,請參閱「管理專案、資料夾和組織的存取權」。

這個預先定義的角色具備存取及提示 Gemini 所需的權限。如要查看確切的必要權限,請展開「Required permissions」(必要權限) 部分:

所需權限

如要存取及提示 Gemini,必須具備下列權限:

  • 如要查看叢集清單: hypercomputecluster.clusters.list

您或許還可透過自訂角色或其他預先定義的角色取得這些權限。

在 Google Cloud 控制台中存取 Compute Advisor

如要在 Google Cloud 控制台中存取 Compute Advisor,請完成下列步驟:

  1. 前往 Google Cloud 控制台的「Compute Advisor」頁面。

    前往 Compute Advisor

  2. 頁面準備就緒後,您就能查看下列資訊:

    Compute Advisor 頁面的介面元素。

    上圖顯示的 UI 元素如下:

    • 對話記錄側邊面板:顯示近期對話。您可以透過下列方式與這個面板互動:

      • 如要展開新對話,請按一下「新的對話」

      • 如要繼續最近的對話,請在「最近的對話」部分點選該對話。

      • 如要查看所有對話清單,請按一下「查看全部」。在「我的記錄」頁面中,你可以查看及繼續先前的對話,或刪除不再需要的對話。

    • 快速操作提示資訊卡:一組資訊卡,每張都包含範例提示。點選資訊卡後, Google Cloud 控制台會自動在提示詞輸入框中填入範例提示。

    • 提示詞輸入框:這個欄位可供輸入及提交提示詞。如要提交提示,請按一下「提交提示」

提示 Compute Advisor

提交提示後,Compute Advisor 就會開始生成回覆。系統會顯示窗格, Google Cloud 控制台會在窗格中顯示提示的回覆,如下列螢幕截圖所示:

在 Compute Advisor 窗格中生成建議回覆。

根據提示,回覆窗格會包含下列元素:

  • 情境基礎:Compute Advisor 會自動評估專案情境,提供高度客製化的建議,包括配額限制、現有預訂、CUD、預設區域和可用區,以及任何資源位置限制。

  • 互動式程式碼片段:Compute Advisor 會產生 gcloud 指令、REST API 方法或 Terraform 資源。您可以複製並貼上這些程式碼片段,或在 Cloud Shell 中執行。

  • 視覺化畫布:Compute Advisor 會將建議整理成結構化表格,並進行並排比較。這個檢視畫面有助於評估產品功能和架構方法。並提供用途的實作計畫。

以下各節將說明撰寫提示的最佳做法,以及您在建立或修改叢集前可使用的提示範例。

提示詞最佳做法

如要從 Compute Advisor 取得最準確且可執行的建議,建議您以程式碼區塊的結構編寫提示。這種做法會使用明確的參數宣告、角色定義、具體指令和明確的輸出格式,引導生成式 AI。

提示 Compute Advisor 時,請考慮下列最佳做法:

  • 專注於設計和規劃:建議您不要提示 Compute Advisor 解決叢集錯誤。如要解決這些錯誤,請參閱「排解建立、更新及刪除運算執行個體的問題」。

  • 指定形象或角色:為 Compute Advisor 宣告目標角色或形象,例如 IT 管理員、AI 研究人員或平台工程師。這有助於引導系統生成建議,並決定建議的語氣、深度和專業程度。

  • 提供明確的編號指令:將目標分解為具體的逐步問題或工作。這種做法可建構 Compute Advisor 的推理程序,並確保 Compute Advisor 滿足所有需求。

  • 定義特定輸出格式:明確說明您希望建議採用的格式,例如逐步說明、Markdown 比較表,或可直接使用的 gcloud 程式碼區塊。

  • 運用自動情境基礎:您不需要在提示中加入預設區域或可用區、可用配額、CUD 或資源位置限制。Compute Advisor 可以存取您專案中的這項資訊 Google Cloud 。

  • 反覆修正設計:您可以傳送新提示,修改或擴充 Compute Advisor 生成的回覆。舉例來說,您可以要求助理在部署計畫中加入網路建議,或修改儲存空間需求,而不必開啟新的對話。

範例提示詞

以下是提示範例,可協助您設計及最佳化叢集:

  • 叢集拓撲和刊登位置策略:如要為高效能 AI 工作負載決定最佳部署模型和刊登位置政策,請使用類似下列的提示:

    Act as an AI researcher. I need to design a GPU cluster topology in
    Cluster Director to train a foundation large language model that
    maximizes ML goodput and secures accelerator capacity. Please provide the
    following:
    
    1. A comparison of clustered GPU machine series across available regions.
    2. An explanation of how compact placement policies and workload policies
       reduce network latency and boost goodput.
    3. The optimal configuration for future reservations in
       AI Hypercomputer to secure capacity for this workload.
    
    Format the comparison as a Markdown table, and provide the deployment steps
    as a ready-to-use gcloud code block.
    
  • 佈建模型和成本最佳化:如要評估佈建模型並降低批次處理成本,請使用下列提示:

    Act as an IT administrator. I need to select the most cost-effective
    consumption option to run large fault-tolerant AI batch jobs on clusters in
    Cluster Director without data loss. Please provide the following:
    
    1. A cost and availability comparison of Flex-start VMs against
       Spot VMs for AI workloads.
    
    2. An explanation of how atomic allocation in Flex-start VMs
       provisions all accelerator nodes at the exact same time.
    
    3. A cluster configuration with checkpoint storage to save model state
       before Compute Engine reclaims a Spot VM.
    
    Format the comparison as a Markdown table, and provide the configuration
    steps to complete in the Google Cloud console.
    

後續步驟