在 Google Cloud 控制台中,您可以建立公開端點,並將模型部署至該端點。
您可以從「線上預測」頁面或「模型登錄」頁面部署模型。
從「線上預測」頁面部署模型
在「線上預測」頁面中,您可以建立端點,並將一或多個模型部署至該端點,步驟如下:
在 Google Cloud 控制台的「Agent Platform」部分,前往「線上預測」頁面。
點選 「建立」。
在「New endpoint」(新增端點) 窗格中:
輸入「端點名稱」。
選取「標準」做為存取權類型。
如要建立專屬 (非共用) 公開端點,請選取「啟用專屬 DNS」核取方塊。
按一下「繼續」。
在「模型設定」窗格中:
從下拉式選單中選取型號。
從下拉式選單中選擇模型版本。
輸入模型的流量分配百分比。
按一下「完成」。
如要部署其他模型,請重複上述步驟。
從「Model Registry」頁面部署模型
在「Model Registry」頁面中,您可以將模型部署至一或多個新的或現有端點,方法如下:
前往 Google Cloud 控制台的「Agent Platform」部分,然後前往「Models」頁面。
按一下要部署的模型名稱和版本 ID,開啟詳細資料頁面。
選取「Deploy & Test」(部署及測試) 分頁標籤。
如果模型已部署至任何端點,這些端點會列在「Deploy your model」(部署模型) 專區。
按一下「Deploy to endpoint」(部署至端點)。
如要將模型部署至新端點,請按照下列步驟操作:
- 選取「建立新端點」
- 為新端點命名。
- 如要建立專屬 (非共用) 公開端點,請選取「啟用專屬 DNS」核取方塊。
- 按一下「繼續」。
如要將模型部署至現有端點,請按照下列步驟操作:
- 選取「新增至現有端點」。
- 從下拉式清單中選取端點。
- 按一下「繼續」。
您可以將多個模型部署至一個端點,也可以將同一個模型部署至多個端點。
如果將模型部署至已部署一或多個模型的現有端點,您必須更新要部署的模型和已部署模型的流量分配百分比,確保所有百分比加總為 100%。
如果將模型部署至新端點,請接受「流量拆分」的 100%。否則,請調整端點上所有模型的流量分配值,使總和達到 100%。
輸入要為模型提供的運算節點數量下限。
這是模型隨時可用的節點數量。
無論是處理推論負載或待機 (最低) 節點,系統都會向您收取節點使用費,即使沒有推論流量也一樣。詳情請參閱定價頁面。
如有需要處理推論流量,運算節點數量可能會增加,但絕不會超過節點數量上限。
如要使用自動調度資源功能,請輸入 Agent Platform 要調度資源的運算節點數量上限。
選取您的機型。
較大的機器資源可提升推論效能,但也會增加費用。比較可用的機器類型。
選取「加速器類型」和「加速器數量」。
如果您在匯入或建立模型時啟用加速器,就會看到這個選項。
如需加速器數量,請參閱 GPU 表格,查看各 CPU 機型可使用的有效 GPU 數量。加速器數量是指每個節點的加速器數量,而非部署中的加速器總數。
如要為部署作業使用自訂服務帳戶,請在「Service account」(服務帳戶) 下拉式方塊中選取服務帳戶。
瞭解如何變更推論記錄的預設設定。
為模型點選「完成」,確認所有「流量分配」百分比都正確無誤後,點選「繼續」。
系統會顯示模型部署的區域。這個地區必須是您建立模型的地區。
按一下「Deploy」(部署),將模型部署至端點。
後續步驟
- 瞭解如何取得線上推論結果。
- 瞭解如何變更推論記錄的預設設定。