本教學課程說明如何使用 vLLM 架構,部署及提供gpt-oss-120b 語言模型。您會在 Google Kubernetes Engine (GKE) Autopilot 叢集上部署這個模型,並使用單一 A4 虛擬機器 (VM),其中包含 8 個 B200 GPU。
本教學課程的適用對象為機器學習 (ML) 工程師、平台管理員和操作員,以及有興趣使用 Kubernetes 容器自動化調度管理功能處理推論工作負載的資料和 AI 專家。
目標
- 使用 Hugging Face 存取
gpt-oss-120b。 - 準備環境。
- 在 Autopilot 模式中建立 GKE 叢集。
- 建立 Hugging Face 憑證的 Kubernetes 密鑰。
- 建立 Cloud Storage bucket。
- 將模型下載至 Cloud Storage bucket。
- 將 vLLM 容器部署至 GKE 叢集。
- 使用 curl 與 gpt-oss 語言模型互動。
- 清除所用資源。
費用
本教學課程使用 Google Cloud的計費元件,包括:
如要根據預測用量估算費用,請使用 Pricing Calculator。
事前準備
- 登入 Google Cloud 帳戶。如果您是 Google Cloud新手,歡迎 建立帳戶,親自評估產品在實際工作環境中的成效。新客戶還能獲得價值 $300 美元的免費抵免額,可用於執行、測試及部署工作負載。
-
安裝 Google Cloud CLI。
-
若您採用的是外部識別資訊提供者 (IdP),請先使用聯合身分登入 gcloud CLI。
-
執行下列指令,初始化 gcloud CLI:
gcloud init -
選取或建立專案所需的角色
- 選取專案:選取專案時,不需要具備特定 IAM 角色,只要您在專案中獲派角色,即可選取該專案。
-
建立專案:如要建立專案,您需要「專案建立者」角色 (
roles/resourcemanager.projectCreator),其中包含resourcemanager.projects.create權限。瞭解如何授予角色。
-
建立 Google Cloud 專案:
gcloud projects create PROJECT_ID
將
PROJECT_ID替換為您要建立的 Google Cloud 專案名稱。 -
選取您建立的 Google Cloud 專案:
gcloud config set project PROJECT_ID
將
PROJECT_ID替換為 Google Cloud 專案名稱。
啟用必要的 API:
啟用 API 時所需的角色
如要啟用 API,您必須具備
serviceusage.services.enable權限。如果您建立了專案,可能已透過「擁有者」角色 (roles/owner) 取得這項權限。否則,您可以透過「服務使用情形管理員」角色 (roles/serviceusage.serviceUsageAdmin) 取得這項權限。瞭解如何授予角色。gcloud services enable container.googleapis.com
-
安裝 Google Cloud CLI。
-
若您採用的是外部識別資訊提供者 (IdP),請先使用聯合身分登入 gcloud CLI。
-
執行下列指令,初始化 gcloud CLI:
gcloud init -
選取或建立專案所需的角色
- 選取專案:選取專案時,不需要具備特定 IAM 角色,只要您在專案中獲派角色,即可選取該專案。
-
建立專案:如要建立專案,您需要「專案建立者」角色 (
roles/resourcemanager.projectCreator),其中包含resourcemanager.projects.create權限。瞭解如何授予角色。
-
建立 Google Cloud 專案:
gcloud projects create PROJECT_ID
將
PROJECT_ID替換為您要建立的 Google Cloud 專案名稱。 -
選取您建立的 Google Cloud 專案:
gcloud config set project PROJECT_ID
將
PROJECT_ID替換為 Google Cloud 專案名稱。
啟用必要的 API:
啟用 API 時所需的角色
如要啟用 API,您必須具備
serviceusage.services.enable權限。如果您建立了專案,可能已透過「擁有者」角色 (roles/owner) 取得這項權限。否則,您可以透過「服務使用情形管理員」角色 (roles/serviceusage.serviceUsageAdmin) 取得這項權限。瞭解如何授予角色。gcloud services enable container.googleapis.com
-
將角色授予使用者帳戶。針對下列每個 IAM 角色,執行一次下列指令:
roles/container.admingcloud projects add-iam-policy-binding PROJECT_ID --member="user:USER_IDENTIFIER" --role=ROLE
更改下列內容:
PROJECT_ID:專案 ID。USER_IDENTIFIER:使用者帳戶的 ID。 例如:myemail@example.com。ROLE:授予使用者帳戶的 IAM 角色。
- 登入或建立 Hugging Face 帳戶。
透過 Hugging Face 存取 gpt-oss
如要使用 Hugging Face 存取 gpt-oss,請按照下列步驟操作:
- 登入 Hugging Face 並探索 gpt-oss 模型。
- 建立 Hugging Face
read存取權杖。 - 複製並儲存
read access權杖值。本教學課程稍後會用到這項資訊。
準備環境
如要準備環境,請設定預設環境變數:
更改下列內容:
YOUR_PROJECT_ID:您要在 Google Cloud 專案中建立 GKE 叢集,請輸入該專案的 ID。YOUR_RESERVATION_NAME:您要用來建立 GKE 叢集的預留項目網址。根據預留項目所在的專案,指定下列其中一個值:專案中已有預留項目:
RESERVATION_NAME預留項目位於其他專案,且您的專案可以使用該預留項目:
projects/RESERVATION_PROJECT_ID/reservations/RESERVATION_NAME
YOUR_REGION:要建立 GKE 叢集的區域。您只能在預訂項目所在的區域建立叢集。YOUR_CLUSTER_NAME:要建立的 GKE 叢集名稱。YOUR_GCS_BUCKET:下載模型的 Cloud Storage bucket 名稱。YOUR_HF_TOKEN:您在上一個章節中建立的 Hugging Face 存取權杖。YOUR_NETWORK_NAME:GKE 叢集使用的網路。請指定下列其中一個值:如果您建立的是自訂網路,請指定網路名稱。
否則,請指定
default。
YOUR_SUBNETWORK_NAME:GKE 叢集使用的子網路。請指定下列其中一個值:如果您建立的是自訂子網路,請指定子網路名稱。您只能指定與預留項目位於相同區域的子網路。
否則,請指定
default。
在 Autopilot 模式中建立 GKE 叢集
如要在 Autopilot 模式中建立 GKE 叢集,請執行下列指令:
建立 GKE 叢集可能需要一段時間才能完成。如要確認 Google Cloud 已完成叢集建立作業,請前往 Google Cloud 控制台的「Kubernetes clusters」(Kubernetes 叢集) 頁面。
建立 Hugging Face 憑證的 Kubernetes Secret
如要為 Hugging Face 憑證建立 Kubernetes 密鑰,請按照下列步驟操作:
設定
kubectl,與 GKE 叢集通訊:建立 Kubernetes 密鑰,儲存您的 Hugging Face 權杖:
建立 Cloud Storage bucket
如果您使用現有的 Cloud Storage bucket,請確認下列條件成立:
- Cloud Storage 值區與 GKE 叢集位於相同區域。
- 您的服務帳戶具備 bucket 的必要
write權限。
如要將模型儲存在新的 Cloud Storage bucket 中,請完成下列步驟:
執行下列指令來建立 bucket:
將 Cloud Storage 值區的
write權限授予預設服務帳戶。
將模型下載至 Cloud Storage bucket
如要將模型下載到 Cloud Storage bucket,請完成下列步驟:
建立
gpt-download-job.yaml檔案:如要初始化下載作業,請套用
gpt-download-job.yaml資訊清單。這項工作資源會從 Hugging Face 將
gpt-oss-120b模型權重下載至 Cloud Storage bucket。下載程序大約需要 30 分鐘才會完成。下載完成後,請前往下一節啟動模型部署作業。如要查看完成狀態,請執行下列指令:
--timeout旗標會指定指令監控工作多久後逾時。如要刪除作業,請執行下列指令:
將 vLLM 容器部署至 GKE 叢集
將模型下載至 Cloud Storage bucket 後,請將 vLLM 容器部署至 GKE 叢集:
建立
vllm-gpt-oss-120b.yaml檔案,並選擇 vLLM 部署作業:將
vllm-gpt-oss-120b.yaml檔案套用至 GKE 叢集:如要查看完成狀態,請執行下列指令:
--timeout旗標可讓指令在指定時間內監控部署作業。
使用 curl 與 gpt-oss 模型互動
如要驗證您部署的 gpt-oss 模型,請按照下列步驟操作:
設定通訊埠轉送至
gpt-oss模型:開啟新的終端機視窗。然後,您可以使用
curl與模型對話:您看到的輸出內容類似如下:
{ "id": "chatcmpl-2235c39759c040daae23ce2addc40c0a", "object": "chat.completion", "created": 1756831629, "model": "openai/gpt-oss-120b", "choices": [ { "index": 0, "message": { "role": "assistant", "content": "A sleek vessel gliding on water, its cloth sails billowing like captured wind.", "refusal": null, "annotations": null, "audio": null, "function_call": null, "tool_calls": [], "reasoning_content": "User asks: \"Describe a sailboat in one short sentence?\" We need to produce a short sentence description. Should comply with policy. It's fine. Provide a short sentence." }, "logprobs": null, "finish_reason": "stop", "stop_reason": null } ], "service_tier": null, "system_fingerprint": null, "usage": { "prompt_tokens": 80, "total_tokens": 142, "completion_tokens": 62, "prompt_tokens_details": null }, "prompt_logprobs": null, "kv_transfer_params": null }
觀察模型效能
如要觀察模型效能,您可以使用 Cloud Monitoring 中的 vLLM 資訊主頁整合功能。這個資訊主頁可協助您查看模型的重要效能指標,例如權杖輸送量、網路延遲和錯誤率。詳情請參閱 Monitoring 說明文件中的 vLLM。
清除所用資源
為避免因為本教學課程所用資源,導致系統向 Google Cloud 帳戶收取費用,請刪除含有相關資源的專案,或者保留專案但刪除個別資源。
刪除資源
完成本教學課程後,請刪除不再需要的資源。
如要從 GKE 叢集刪除
vllm-gpt-oss-120b.yaml檔案中定義的部署作業和服務,以及 Kubernetes 密鑰,請執行下列指令:如要刪除 Cloud Storage bucket,請執行下列指令:
如要刪除 GKE 叢集,請按照下列步驟操作:
刪除專案
刪除 Google Cloud 專案:
gcloud projects delete PROJECT_ID