您可以建立使用 Advanced Compute Images 的執行個體,為人工智慧 (AI)、機器學習 (ML) 和高效能運算 (HPC) 工作負載提供最佳化環境。您可以使用下列介面:
- Google Cloud CLI
- Google Cloud console
- SchedMD 的 Slurm 工作負載管理員
如要瞭解 Advanced Compute Images,請參閱「Advanced Compute Images 總覽」。
事前準備
-
如果尚未設定驗證,請先完成設定。
驗證可確認您的身分,以便存取 Google Cloud 服務和 API。如要從本機開發環境執行程式碼或範例,請選取下列其中一個選項,向 Compute Engine 進行驗證:
選取這個頁面上您打算如何使用範例的分頁:
控制台
使用 Google Cloud 控制台存取 Google Cloud 服務和 API 時,無須設定驗證。
gcloud
-
安裝 Google Cloud CLI。 完成後,執行下列指令來初始化 Google Cloud CLI:
gcloud init若您採用的是外部識別資訊提供者 (IdP),請先使用聯合身分登入 gcloud CLI。
-
- 設定預設地區和區域。
必要的角色
如要取得建立執行個體所需的權限,請要求管理員授予您專案的 Compute 執行個體管理員 (v1) (roles/compute.instanceAdmin.v1) IAM 角色。如要進一步瞭解如何授予角色,請參閱「管理專案、資料夾和組織的存取權」。
這個預先定義的角色具備建立執行個體所需的權限。如要查看確切的必要權限,請展開「Required permissions」(必要權限) 部分:
所需權限
如要建立執行個體,必須具備下列權限:
-
compute.instances.create專案 -
如要使用自訂映像檔建立 VM:
compute.images.useReadOnly在映像檔上 -
如要使用快照建立 VM:
compute.snapshots.useReadOnly在快照上 -
如要使用執行個體範本建立 VM,請按照下列步驟操作:
compute.instanceTemplates.useReadOnly在執行個體範本上 -
如要為 VM 指定子網路:
compute.subnetworks.use專案或所選子網路的 -
如要為 VM 指定靜態 IP 位址:
compute.addresses.use專案的權限 -
使用虛擬私有雲網路時,如要將外部 IP 位址指派給 VM:
compute.subnetworks.useExternalIp專案或所選子網路的權限 -
如要將舊版網路指派給 VM,請按照下列步驟操作:
compute.networks.use專案的 -
使用舊版網路時,如要將外部 IP 位址指派給 VM,請在專案中設定
compute.networks.useExternalIp。 -
如要為 VM 設定 VM 執行個體中繼資料,請按照下列步驟操作:
compute.instances.setMetadata在專案中 -
如要為 VM 設定標記,請按照下列步驟操作:
compute.instances.setTags在 VM 上 -
如要為 VM 設定標籤,請按照下列步驟操作:
compute.instances.setLabels在 VM 上 -
如要設定 VM 使用的服務帳戶,請在 VM 上執行下列操作:
compute.instances.setServiceAccount在 VM 上 -
為 VM 建立新磁碟:
compute.disks.create專案的 -
如要以唯讀或讀寫模式附加現有磁碟:
compute.disks.use磁碟 -
如要以唯讀模式連接現有磁碟:
compute.disks.useReadOnly磁碟
快速入門導覽課程
本教學課程說明如何建立使用 Advanced Compute Images 的 A3 Ultra 或 A4 執行個體,並設定及自訂客層 OS。
必要條件
建立執行個體前,請先完成下列工作,以便建立 A3 Ultra 和 A4 執行個體:
使用 Advanced Compute Images 建立運算執行個體
完成必要工作後,您可以使用下列任一方法建立執行個體。
控制台
前往 Google Cloud 控制台的「Create an instance」(建立執行個體) 頁面。
如果出現提示,請選取專案並按一下「繼續」。「建立執行個體」頁面隨即顯示,並顯示「機器設定」窗格。
在「機器設定」窗格中,執行下列操作:
- 在「Name」(名稱) 欄位中,指定運算執行個體的名稱。詳情請參閱「資源命名慣例」。
為執行個體選取「區域」和「可用區」。如果您已預留運算資源,所選區域和可用區必須與預留資源的區域和可用區相符。
按一下「GPU」分頁標籤,然後完成下列步驟:
- 在「GPU type」(GPU 類型) 清單中,選取 GPU 類型。
- 如果是 A4 執行個體,請選取「NVIDIA B200」。
- 如果是 A3 Ultra 執行個體,請選取「NVIDIA H200 141GB」。
- 在「Number of GPUs」(GPU 數量) 清單中,選取「8」。
- 選用:選取其他機型。
- 在「GPU type」(GPU 類型) 清單中,選取 GPU 類型。
在導覽選單中,按一下「OS and storage」(OS 和儲存空間)。在隨即顯示的「OS and storage」(作業系統和儲存空間) 窗格中,完成下列步驟:
- 點選「變更」。「開機磁碟」窗格隨即顯示,並顯示「公開映像檔」分頁。
- 在「Operating system」(作業系統) 清單中,選取「Advanced Compute Images」(進階 Compute 映像檔)。
- 在「Version」清單中,選取作業系統版本。
- 選用:在「Boot disk type」(開機磁碟類型) 清單中,選取開機磁碟類型。
- 選用:指定開機磁碟的其他屬性,例如磁碟大小。
- 選用:如需進階設定選項,請展開「Show advanced configurations」(顯示進階設定) 部分。
- 如要確認開機磁碟選項並返回「作業系統和儲存空間」窗格,請按一下「選取」。
在導覽選單中,按一下「網路」。「Networking」(網路連線) 窗格隨即顯示。
選用:如要從 Google Cloud外部設定執行個體的存取權,請完成下列步驟:
- 前往「防火牆」部分。
如要允許運算執行個體接收 HTTP 或 HTTPS 流量,請選取「Allow HTTP traffic」或「Allow HTTPS traffic」。
Compute Engine 會將網路標記新增至運算執行個體,並建立對應輸入防火牆規則,允許所有流量傳入
tcp:80(HTTP) 或tcp:443(HTTPS)。網路標記會建立防火牆規則與執行個體之間的關聯。詳情請參閱 Cloud Next Generation Firewall 說明文件中的「防火牆規則總覽」。
如要建立多 NIC 的執行個體,請在「網路」窗格中完成下列步驟。如果是單一 NIC 執行個體,請略過這些步驟。
- 在「Network interfaces」(網路介面) 區段中,完成下列步驟:
- 刪除預設網路介面。如要刪除介面,請按一下 「刪除」。
按一下「新增網路介面」。使用這個選項新增網路介面,附加至您在前一節中建立的虛擬私有雲網路。新增網路介面時,請注意下列事項:
如要用於主機對主機通訊的網路介面,請從「網路」和「子網路」清單中選取一般虛擬私有雲網路和子網路,並將「網路介面卡」清單設為「gVNIC」。
如要使用網路介面進行 GPU 間的通訊,請從「網路」和「子網路」清單中選取 RoCE 虛擬私有雲網路和子網路,並將這些網路介面的「網路介面卡」清單設為「MRDMA」。
在導覽選單中,按一下「進階」。然後,根據要使用的佈建模型完成下列步驟。
彈性啟動
- 在「佈建模型」部分,從「VM 佈建模型」清單中選取「彈性啟動」。
在「Enter number of hours」(輸入時數) 欄位中,輸入運算執行個體要執行的時間上限。這個值必須介於
0.01(0.01 小時或 36 秒) 和168(168 小時或七天) 之間。選取「設定建立 VM 的等待時間」。
根據工作負載的區域需求,指定下列其中一個時間長度,有助於提高 VM 建立要求成功的機率:
- 有嚴格區域需求的工作負載:如果工作負載要求您在特定區域中建立 VM,請指定 90 秒到 2 小時之間的時間長度。 時間越長,獲得資源的機率就越高。
- 沒有嚴格區域限制的工作負載:如果 VM 可以在區域內的任何區域執行,請指定 0 秒的持續時間,或取消勾選「設定 VM 建立等待時間」核取方塊。這項動作會指定 Compute Engine 僅在資源可立即使用時才分配資源。如果資源無法使用,導致 VM 建立要求失敗,請在其他可用區重試要求。
在「On VM termination」(在 VM 終止時) 欄位中,選取要在執行時間結束時停止或刪除運算執行個體:
- 如要刪除執行個體,請選取「刪除」。
- 如要停止執行個體,請選取「停止」。
取決於預留項目
按一下「選擇預留項目」。這項操作會開啟窗格,其中列出所選區域內的可用預訂項目。在預訂清單中,完成下列步驟:
- 選取要用於運算執行個體的預訂。你也可以選取預訂中的特定時段。
- 按一下「選擇」。
Spot
- 在「佈建模型」部分,從「VM 佈建模型」清單中選取「Spot」。
選用:如要選取 Compute Engine 預先終止 Spot VM 時執行的終止動作,請完成下列步驟:
- 展開「VM 佈建模式進階設定」部分。
- 在「On VM termination」(在 VM 終止時) 清單中,選取下列其中一個選項:
- 如要在先占期間停止 Spot VM,請選取「停止」 (預設)。
- 如要在先占期間刪除 Spot VM,請選取「Delete」(刪除)。
如要建立並啟動執行個體,請按一下「建立」。
gcloud
如要建立 VM,請使用
gcloud compute instances create 指令。
您需要指定的參數取決於此部署作業使用的消耗選項。選取與計費方案對應的分頁。
預留項目
執行指令前,請先詳閱下列所有步驟,判斷是否要加入其他標記。
gcloud compute instances create INSTANCE_NAME \
--machine-type=MACHINE_TYPE \
--image-family=IMAGE_FAMILY \
--image-project=IMAGE_PROJECT \
--zone=ZONE \
--boot-disk-type=hyperdisk-balanced \
--boot-disk-size=DISK_SIZE \
--scopes=cloud-platform \
--network-interface=nic-type=GVNIC,network=GVNIC_NAME_PREFIX-net-0,subnet=GVNIC_NAME_PREFIX-sub-0 \
--network-interface=nic-type=GVNIC,network=GVNIC_NAME_PREFIX-net-1,subnet=GVNIC_NAME_PREFIX-sub-1,no-address
--network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-0,no-address \
--network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-1,no-address \
--network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-2,no-address \
--network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-3,no-address \
--network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-4,no-address \
--network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-5,no-address \
--network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-6,no-address \
--network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-7,no-address \
--reservation-affinity=specific \
--reservation=RESERVATION \
--provisioning-model=RESERVATION_BOUND \
--instance-termination-action=TERMINATION_ACTION \
--maintenance-policy=TERMINATE \
--restart-on-failure
操作步驟如下:
-
更改下列內容:
INSTANCE_NAME:VM 的名稱。MACHINE_TYPE:VM 要使用的機型。詳情請參閱 Compute Engine 說明文件中的 GPU 機器類型。IMAGE_FAMILY:您要使用的 OS 映像檔系列。 如需所有支援的作業系統清單,請參閱「支援的作業系統」。IMAGE_PROJECT:OS 映像檔的專案 ID。ZONE:您要使用的機型所在的可用區。如要指定密集配置政策,請使用與密集配置政策位於相同區域的可用區。 如需區域相關資訊,請參閱「各區域和可用區的 GPU 供應情形」。DISK_SIZE:開機磁碟的大小,單位為 GB。詳情請參閱Google Cloud Hyperdisk 大小限制或永久磁碟大小限制,視磁碟類型而定。GVNIC_NAME_PREFIX:建立使用 gVNIC 的標準 VPC 網路和子網路時指定的名稱前置字元。RDMA_NAME_PREFIX:建立使用 RDMA NIC 的虛擬私有雲網路和子網路時指定的名稱前置字元。-
RESERVATION:預留項目名稱或預留項目內的特定區塊。如要取得預留名稱或可用區塊,請參閱「查看預留容量」。根據執行個體放置位置的需求,選擇下列其中一個選項:如要在任何區塊建立執行個體,請按照下列步驟操作:
projects/RESERVATION_OWNER_PROJECT_ID/reservations/RESERVATION_NAME
此外,如要在同一個區塊中建立多個執行個體,請在建立每個執行個體時,套用指定區塊並置 (
maxDistance=2) 的相同密集配置政策。Compute Engine 隨後會將政策套用至預留項目,並在相同區塊中建立執行個體。如要在特定區塊建立執行個體,請按照下列步驟操作:
projects/RESERVATION_OWNER_PROJECT_ID/reservations/RESERVATION_NAME/reservationBlocks/RESERVATION_BLOCK_NAME
TERMINATION_ACTION:Compute Engine 在預訂期間結束時,是停止 (STOP) 還是刪除 (DELETE) VM。
-
選用:如要使用密集配置政策,請新增下列旗標:
--resource-policies=POLICY_NAME
更改下列內容:
POLICY_NAME:密集配置政策的名稱。
- 執行更改後的指令。
彈性啟動
執行指令前,請先詳閱下列所有步驟,判斷是否要加入其他標記。
gcloud compute instances create INSTANCE_NAME \
--machine-type=MACHINE_TYPE \
--image-family=IMAGE_FAMILY \
--image-project=IMAGE_PROJECT \
--zone=ZONE \
--boot-disk-type=hyperdisk-balanced \
--boot-disk-size=DISK_SIZE \
--scopes=cloud-platform \
--network-interface=nic-type=GVNIC,network=GVNIC_NAME_PREFIX-net-0,subnet=GVNIC_NAME_PREFIX-sub-0 \
--network-interface=nic-type=GVNIC,network=GVNIC_NAME_PREFIX-net-1,subnet=GVNIC_NAME_PREFIX-sub-1,no-address
--network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-0,no-address \
--network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-1,no-address \
--network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-2,no-address \
--network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-3,no-address \
--network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-4,no-address \
--network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-5,no-address \
--network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-6,no-address \
--network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-7,no-address \
--reservation-affinity=none \
--provisioning-model=FLEX_START \
--request-valid-for-duration=REQUEST_VALID_FOR_DURATION \
--max-run-duration=MAX_RUN_DURATION \
--instance-termination-action=TERMINATION_ACTION \
--maintenance-policy=TERMINATE
操作步驟如下:
-
更改下列內容:
INSTANCE_NAME:VM 的名稱。MACHINE_TYPE:VM 要使用的機型。詳情請參閱 Compute Engine 說明文件中的 GPU 機器類型。IMAGE_FAMILY:您要使用的 OS 映像檔系列。 如需所有支援的作業系統清單,請參閱「支援的作業系統」。IMAGE_PROJECT:OS 映像檔的專案 ID。ZONE:您要使用的機型所在的可用區。如要指定密集配置政策,請使用與密集配置政策位於相同區域的可用區。 如需區域相關資訊,請參閱「各區域和可用區的 GPU 供應情形」。DISK_SIZE:開機磁碟的大小,單位為 GB。詳情請參閱Google Cloud Hyperdisk 大小限制或永久磁碟大小限制,視磁碟類型而定。GVNIC_NAME_PREFIX:建立使用 gVNIC 的標準 VPC 網路和子網路時指定的名稱前置字元。RDMA_NAME_PREFIX:建立使用 RDMA NIC 的虛擬私有雲網路和子網路時指定的名稱前置字元。REQUEST_VALID_FOR_DURATION:建立 VM 的要求有效時間長度。您必須將值格式化為天數、時數、分鐘數或秒數,並分別加上d、h、m和s。舉例來說,指定30m代表 30 分鐘,指定1h2m3s則代表 1 小時 2 分 3 秒。根據工作負載的區域需求,指定下列其中一個時間長度,有助於提高 VM 建立要求成功的機率:
- 有嚴格區域需求的工作負載:如果工作負載要求您在特定區域中建立 VM,請指定 90 秒 (
90s) 到兩小時 (2h) 的時間長度。時間長度越長,取得資源的機率就越高。 - 沒有嚴格可用區需求的工作負載:如果 VM 可以在區域內的任何可用區執行,請指定零秒的期限 (
0s)。這項動作會指定 Compute Engine 僅在資源可立即使用時分配資源。如果資源無法使用,導致 VM 建立要求失敗,請在其他可用區重試要求。
- 有嚴格區域需求的工作負載:如果工作負載要求您在特定區域中建立 VM,請指定 90 秒 (
MAX_RUN_DURATION:您希望要求的 VM 執行多久。您必須將值格式化為天數、時數、分鐘數或秒數,並分別加上d、h、m和s。值必須介於 10 分鐘至 7 天之間。TERMINATION_ACTION:Compute Engine 是否會在 VM 執行時間結束時停止 (STOP) 或刪除 (DELETE) VM。
-
選用:如要使用密集配置政策,請新增下列旗標:
--resource-policies=POLICY_NAME
更改下列內容:
POLICY_NAME:密集配置政策的名稱。
- 執行更改後的指令。
Spot
執行指令前,請先詳閱下列所有步驟,判斷是否要加入其他標記。
gcloud compute instances create INSTANCE_NAME \
--machine-type=MACHINE_TYPE \
--image-family=IMAGE_FAMILY \
--image-project=IMAGE_PROJECT \
--zone=ZONE \
--boot-disk-type=hyperdisk-balanced \
--boot-disk-size=DISK_SIZE \
--scopes=cloud-platform \
--network-interface=nic-type=GVNIC,network=GVNIC_NAME_PREFIX-net-0,subnet=GVNIC_NAME_PREFIX-sub-0 \
--network-interface=nic-type=GVNIC,network=GVNIC_NAME_PREFIX-net-1,subnet=GVNIC_NAME_PREFIX-sub-1,no-address
--network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-0,no-address \
--network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-1,no-address \
--network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-2,no-address \
--network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-3,no-address \
--network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-4,no-address \
--network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-5,no-address \
--network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-6,no-address \
--network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-7,no-address \
--provisioning-model=SPOT \
--instance-termination-action=TERMINATION_ACTION \
--maintenance-policy=TERMINATE \
--no-restart-on-failure
操作步驟如下:
-
更改下列內容:
INSTANCE_NAME:VM 的名稱。MACHINE_TYPE:VM 要使用的機型。詳情請參閱 Compute Engine 說明文件中的 GPU 機器類型。IMAGE_FAMILY:您要使用的 OS 映像檔系列。 如需所有支援的作業系統清單,請參閱「支援的作業系統」。IMAGE_PROJECT:OS 映像檔的專案 ID。ZONE:您要使用的機型所在的可用區。如要指定密集配置政策,請使用與密集配置政策位於相同區域的可用區。 如需區域相關資訊,請參閱「各區域和可用區的 GPU 供應情形」。DISK_SIZE:開機磁碟的大小,單位為 GB。詳情請參閱Google Cloud Hyperdisk 大小限制或永久磁碟大小限制,視磁碟類型而定。GVNIC_NAME_PREFIX:建立使用 gVNIC 的標準 VPC 網路和子網路時指定的名稱前置字元。RDMA_NAME_PREFIX:建立使用 RDMA NIC 的虛擬私有雲網路和子網路時指定的名稱前置字元。TERMINATION_ACTION:Compute Engine 預先終止執行個體時採取的動作,可以是STOP(預設) 或DELETE。
-
選用:如要使用密集配置政策,請新增下列旗標:
--resource-policies=POLICY_NAME
更改下列內容:
POLICY_NAME:密集配置政策的名稱。
- 執行更改後的指令。
過一段時間後,運算執行個體就會建立完成。如要驗證執行個體設定並查看狀態,請執行下列指令:
gcloud compute instances describe INSTANCE_NAME
設定 Spot VM
如果您建立了 Spot VM,請完成下列步驟:
如要為 Spot VM 準備因應可能的先占情況,請參閱「管理 Spot VM 先占」。
選用:瞭解 Spot VM 的最佳做法。
存取運算執行個體
建立運算執行個體後,執行個體會自動啟動。如要存取執行個體,請執行下列任一操作:
控制台
前往 Google Cloud 控制台的「VM instances」(VM 執行個體) 頁面。
按一下運算執行個體的名稱。
在「Remote Access」(遠端存取) 部分中,按一下第一個下拉式清單,並選擇存取該執行個體的方式。
Compute Engine 會傳播您的 SSH 金鑰,並建立您的使用者。詳情請參閱「連線至 Linux VM」。
gcloud
如要使用 SSH 存取執行個體,請使用 gcloud compute ssh 指令:
gcloud compute ssh INSTANCE_NAME --zone ZONE
Compute Engine 會傳播您的 SSH 金鑰,並建立您的使用者。詳情請參閱「連線至 Linux VM」。
清除所用資源
如要避免系統向您的 Google Cloud 帳戶收取這些快速入門導覽課程所用資源的費用,請刪除您建立的所有運算執行個體和附加資源。
控制台
前往 Google Cloud 控制台的「VM instances」(VM 執行個體) 頁面。
選取要刪除的執行個體。
按一下「刪除」圖示 。
在對話方塊中執行下列操作:
選用:如要刪除執行個體,但不要正常關機,或要結束進行中的正常關機程序,請選取「Skip graceful shutdown (if applicable)」(略過正常關機 (如適用)) 核取方塊。
按一下「Delete」(刪除) 確認操作。
如要刪除已刪除執行個體使用的磁碟,請前往「Disks」頁面,然後執行下列步驟:
選取要刪除的磁碟。所選磁碟的「In use by」(由誰使用) 欄不得有值。
按一下「刪除」圖示 。
按一下「Delete」(刪除) 確認操作。
gcloud
如要刪除同一區域中的一或多個執行個體,請使用 gcloud compute instances delete 指令。如要強制刪除連結至一或多個執行個體的磁碟,請加入 --delete-disks 標記:
gcloud compute instances delete INSTANCE_NAMES \
--delete-disks=DELETE_DISK_TYPE \
--zone=ZONE
更改下列內容:
INSTANCE_NAMES:以空格分隔的執行個體名稱清單,例如instance-01 instance-02 instance-03。ZONE:執行個體所在的區域。DELETE_DISK_TYPE:指定下列其中一個值:- 如要刪除已連結的開機和非開機永久儲存空間,請按照下列步驟操作:
all - 如要只刪除附加的開機永久儲存空間,請執行
boot: - 如要只刪除非開機永久儲存空間,請按照下列步驟操作:
data
- 如要刪除已連結的開機和非開機永久儲存空間,請按照下列步驟操作:
根據 Advanced Compute Images 建立自訂映像檔
您可以根據 Advanced Compute Images 映像檔建立自訂映像檔。然後,您可以在為工作負載和應用程式建立新的運算執行個體時,使用自訂映像檔。
如要建立自訂映像檔,請完成下列工作:
設定圖片的儲存位置。如要建立、修改及刪除儲存在 Cloud Storage 中的 OS 映像檔,您必須獲派
roles/compute.storageAdmin角色。視需要自訂運算執行個體的客體 OS。
停止運算執行個體,避免資料寫入磁碟。如果無法停止執行個體,請完成「盡量減少寫入永久磁碟的資料」一文中的步驟。
使用運算執行個體的開機磁碟做為來源磁碟,建立自訂映像檔。您可以使用 Google Cloud 控制台或 Google Cloud CLI 執行這項操作。
控制台
前往 Google Cloud 控制台的「Images」頁面。
點選「建立映像檔」。
指定映像檔的「Name」(名稱)。
在「Source disk」(來源磁碟) 底下,選取使用 Advanced Compute Images 的運算執行個體開機磁碟名稱。
如果運算執行個體未停止,請選取「Keep instance running」(讓執行個體保持執行狀態),確認要在執行個體執行時建立映像檔。您先前應已完成將寫入作業降到最低的步驟。
在「Based on source disk location (default)」(根據來源磁碟位置 (預設值)) 下拉式清單中,指定儲存自訂映像檔的位置。例如,指定
us會將映像檔儲存在us多地區;指定us-central1則會儲存在us-central1地區。如果未選擇位置,Compute Engine 會將映像檔儲存在最靠近自訂映像檔來源位置的多區域。
選用:指定圖片的其他屬性:
指定加密金鑰。您可以選擇Google-owned and Google-managed encryption key 或 Cloud Key Management Service (Cloud KMS) 金鑰。如未指定加密金鑰,系統會使用 Google-owned and Google-managed encryption key將映像檔加密。
按一下 [建立] 以建立映像檔。
gcloud
使用
gcloud compute images create指令建立自訂映像檔。--force旗標是選用旗標,可讓您從執行中的執行個體建立映像檔。根據預設,您無法從執行中的執行個體建立映像檔。除非您確定要在執行個體執行時建立映像檔,否則請勿指定此旗標。gcloud compute images create IMAGE_NAME \ --source-disk=SOURCE_DISK \ --source-disk-zone=ZONE \ [--family=IMAGE_FAMILY] \ [--storage-location=LOCATION] \ [--force]更改下列內容:
IMAGE_NAME:新圖片的名稱SOURCE_DISK:要建立映像檔的磁碟ZONE:磁碟所在的可用區IMAGE_FAMILY:選用:指定此映像檔所屬映像檔系列的旗標LOCATION:選用:旗標,可指定儲存映像檔的區域或多區域。例如,指定us會將映像檔儲存在us多地區;指定us-central1則會儲存在us-central1地區。如果未選擇位置,Compute Engine 會將映像檔儲存在最靠近映像檔來源位置的多區域。
如要進一步瞭解如何建立自訂映像檔,請參閱「建立自訂映像檔」。
分享圖片
建立自訂映像檔後,您可以跨專案共用映像檔。如果您允許其他專案的使用者使用自訂映像檔,他們就能在要求中指定映像檔專案,藉此存取這些映像檔。
搭配執行個體範本使用 Advanced Compute Images
您可以建立指定 Advanced Compute Images 映像檔的執行個體範本,然後使用該範本執行下列操作:
建立個別運算執行個體。
在代管執行個體群組 (MIG) 中建立運算執行個體。
建立運算執行個體的預留資源。
建立執行個體範本的限制
建立執行個體範本時,請注意下列限制:
- 在 gcloud CLI 和 REST 中,系統支援在執行個體範本以外的介面上使用 Shared VPC,但Google Cloud 控制台不支援。
nic0 - 您無法更新現有的執行個體範本,也無法在執行個體範本建立後再加以變更。如果執行個體範本已過期,或是您需要變更設定,請建立新的執行個體範本。
- 如要在執行個體範本中指定映像檔系列,請勿使用 Google Cloud 控制台。請改用 Google Cloud CLI 或 REST。
- 如要在執行個體範本中指定地區磁碟而非區域磁碟,請勿使用 Google Cloud 控制台。請改用 Google Cloud CLI 或 REST。
- 您可以使用執行個體範本建立運算執行個體,並搭配位於儲存空間集區的 Hyperdisk Balanced 開機磁碟,但前提是儲存空間集區與執行個體位於相同區域。
- 您無法使用全域執行個體範本,建立含有儲存集區中非開機磁碟的運算執行個體。
- 如要建立地區執行個體範本,範本中指定的 GPU 類型必須在指定地區的至少一個區域中提供。
建立執行個體範本
在用來建立個別運算執行個體的要求中,大多數可指定的執行個體屬性都能利用執行個體範本來指定,包括任何執行個體中繼資料、開機指令碼、永久磁碟和服務帳戶。執行個體範本的必要資訊包括機器類型、開機磁碟和網路。
您可以使用 Google Cloud 控制台或 Google Cloud CLI,建立使用 Advanced Compute Images 的區域或全域執行個體範本。
如要建立執行個體範本,使用者帳戶必須具備呼叫 instanceTemplates.insert 方法所需的所有權限。
下列各節說明如何建立執行個體範本,以搭配代管執行個體群組 (MIG)、個別運算執行個體或預留項目使用。如要建立供 AI Hypercomputer 使用的執行個體範本,請改為按照「使用 A4 或 A3 Ultra 機型建立 AI 適用的 MIG」一文中的操作說明進行。
為 A3 Ultra 或 A4 執行個體建立額外資源
如要為使用 Advanced Compute Images 的執行個體建立執行個體範本,請先建立要在執行個體範本中指定的資源。完成「必要條件」中列出的工作,建立這些資源。
建立指定進階 Compute Images 映像檔的執行個體範本
您可以使用 Google Cloud 控制台或 gcloud CLI 指令建立執行個體範本。
控制台
前往 Google Cloud 控制台的「Instance templates」(執行個體範本) 頁面。
點選「建立執行個體範本」。
在「Name」(名稱) 欄位中,輸入執行個體範本的名稱。
按照以下方式選取「Location」(位置):
- 如要跨區域使用執行個體範本,請選擇「Global」(全域) (預設)。
- 如要減少跨區域依附元件,請選擇「Regional」(區域),然後選取要建立執行個體範本的「區域」。
在「Machine configuration」(機器設定) 部分,執行下列操作:
- 按一下「GPU」分頁標籤。
- 在「GPU type」(GPU 類型) 清單中,選取 GPU 類型。如果是 A4 執行個體,請選取
NVIDIA B200;如果是 A3 Ultra 執行個體,請選取NVIDIA H200 141GB。 - 在「Number of GPUs」(GPU 數量) 清單中,選取 8。
- 選用:選取非預設的機型。
在「Boot disk」(開機磁碟) 專區中,按一下「Change」(變更),然後執行下列操作:
- 在「Operating system」(作業系統) 清單中,選取「Advanced Compute Images」(進階 Compute 映像檔)。
- 在「Version」清單中,選取作業系統版本。
- 選用:指定開機磁碟的其他屬性,例如磁碟大小。
點選 [Create] (建立) 來建立執行個體範本。
gcloud
如要建立區域或全域執行個體範本,請使用 instance-templates create 指令。如果是區域性執行個體範本,您必須使用 --instance-template-region 標記設定範本的區域。
為 GPU 執行個體建立執行個體範本時,您必須將 --maintenance-policy 旗標設為 TERMINATE。
使用下列指令建立區域執行個體範本。
gcloud compute instance-templates create INSTANCE_TEMPLATE_NAME \ --instance-template-region=REGION \ --accelerator=count=8,type=GPU_TYPE \ --machine-type=MACHINE_TYPE \ --image-project=advanced-compute-images \ --image-family=IMAGE_FAMILY \ --maintenance-policy=TERMINATE
使用下列指令建立全域執行個體範本:
gcloud compute instance-templates create INSTANCE_TEMPLATE_NAME --accelerator=count=8,type=GPU_TYPE \ --machine-type=MACHINE_TYPE \ --image-project=advanced-compute-images \ --image-family=IMAGE_FAMILY \ --maintenance-policy=TERMINATE
更改下列內容:
- INSTANCE_TEMPLATE_NAME:執行個體範本的名稱。
- REGION:如果是區域執行個體範本,這是要建立範本的區域。
- GPU_TYPE:要搭配運算執行個體使用的 GPU 類型。
使用 Advanced Compute Images 時,您必須為 A4 或 A3 Ultra 執行個體指定
nvidia-b200或nvidia-h200-141gb。 - MACHINE_TYPE:運算執行個體的機型。 如要使用 Advanced Compute Images,必須指定 A3 Ultra 或 A4 機型。
- IMAGE_FAMILY:請指定下列其中一個值:
- IMAGE_FAMILY:映像檔系列。這會指定該系列中最新的 OS 映像檔版本。舉例來說,您可以指定
aci-gpu-u2204-slurm-2511-cuda-130-nvidia-580-amd64。 - IMAGE:作業系統映像檔的特定版本,例如
aci-gpu-u2204-slurm-2511-cuda-130-nvidia-580-amd64-v20260427-1。如要指定特定 OS 映像檔版本,而非映像檔系列,請使用--image旗標,而非--image-family旗標。
- IMAGE_FAMILY:映像檔系列。這會指定該系列中最新的 OS 映像檔版本。舉例來說,您可以指定
您最多可以加入 15 個次要非開機磁碟。請為您建立的每個次要磁碟指定 --create-disk 旗標。
- 如要透過公開或自訂映像檔建立次要磁碟,請在
--create-disk標記中,為每個磁碟指定image和image-project屬性。 - 如要建立空白磁碟,請勿加入
image或image-project屬性 - 您也可以視情況加入磁碟
size和type屬性。
如需所有可用子指令和旗標的清單,請參閱 instance-templates 參考資料。
後續步驟
* 查看建立代管執行個體群組 (MIG) 的基本情境。 * 瞭解如何查看執行個體狀態,確認執行個體何時可以使用。* 瞭解如何連線至執行個體。