使用 Google Cloud 控制台部署模型

在 Google Cloud 控制台中,您可以建立公開端點,並將模型部署至該端點。

您可以從「線上預測」頁面或「模型登錄」頁面部署模型。

從「線上預測」頁面部署模型

在「線上預測」頁面中,您可以建立端點,並將一或多個模型部署至該端點,步驟如下:

  1. 在 Google Cloud 控制台的「Agent Platform」部分,前往「Online prediction」頁面。

    前往「線上預測」頁面

  2. 點選 「Create」(建立)

  3. 在「New endpoint」(新增端點) 窗格中:

    1. 輸入「端點名稱」

    2. 選取「標準」做為存取類型。

    3. 如要建立專屬 (非共用) 公開端點,請勾選「啟用專屬 DNS」核取方塊。

    4. 按一下「繼續」

  4. 在「模型設定」窗格中:

    1. 從下拉式清單中選取型號。

    2. 從下拉式選單中選擇模型版本。

    3. 輸入模型的流量分配百分比。

    4. 按一下 [完成]

    5. 如要部署其他模型,請重複上述步驟。

從「Model Registry」頁面部署模型

在「Model Registry」頁面中,您可以將模型部署至一或多個新的或現有端點,方法如下:

  1. 前往 Google Cloud 控制台的「Agent Platform」部分,然後前往「Models」頁面。

    前往「模型」頁面

  2. 按一下要部署的模型名稱和版本 ID,開啟詳細資料頁面。

  3. 選取「Deploy & Test」(部署及測試) 分頁標籤。

    如果模型已部署至任何端點,這些端點會列在「Deploy your model」(部署模型) 專區。

  4. 按一下「Deploy to endpoint」(部署至端點)

  5. 如要將模型部署至新端點,請按照下列步驟操作:

    1. 選取「建立新端點」
    2. 為新端點命名。
    3. 如要建立專屬 (非共用) 公開端點,請勾選「啟用專屬 DNS」核取方塊。
    4. 按一下「繼續」

    如要將模型部署至現有端點,請按照下列步驟操作:

    1. 選取「新增至現有端點」
    2. 從下拉式清單中選取端點。
    3. 按一下「繼續」

    您可以將多個模型部署至一個端點,也可以將同一個模型部署至多個端點。

  6. 如果將模型部署至已部署一或多個模型的現有端點,您必須更新要部署的模型和已部署模型的流量分配百分比,讓所有百分比加總為 100%。

  7. 如果將模型部署至新端點,請接受「流量分配」的 100。否則,請調整端點上所有模型的流量分配值,使其總和為 100。

  8. 輸入要為模型提供的運算節點數量下限

    這是模型隨時可用的節點數量。

    無論是處理推論負載或待機 (最低) 節點,系統都會向您收取節點使用費,即使沒有推論流量也一樣。請參閱定價頁面

    如有需要處理推論流量,運算節點數量可能會增加,但絕不會超過節點數量上限。

  9. 如要使用自動調度資源功能,請輸入 Agent Platform 要調度資源的運算節點數量上限

  10. 選取您的機型

    較大的機器資源可提升推論效能,但也會增加費用。比較可用的機器類型

  11. 選取「加速器類型」和「加速器數量」

    如果您在匯入或建立模型時啟用加速器,就會看到這個選項。

    如需加速器數量,請參閱 GPU 表格,查看各 CPU 機型可使用的有效 GPU 數量。加速器數量是指每個節點的加速器數量,而非部署中的加速器總數。

  12. 如要為部署作業使用自訂服務帳戶,請在「Service account」(服務帳戶) 下拉式方塊中選取服務帳戶。

  13. 瞭解如何變更推論記錄的預設設定

  14. 為模型點選「完成」,確認所有「流量分配」百分比都正確無誤後,點選「繼續」

    系統會顯示模型部署的區域。這個地區必須與您建立模型的地區相同。

  15. 按一下「Deploy」(部署),將模型部署至端點。

後續步驟