使用 Advanced Compute Images 建立執行個體

您可以建立使用 Advanced Compute Images 的執行個體,為人工智慧 (AI)、機器學習 (ML) 和高效能運算 (HPC) 工作負載提供最佳化環境。您可以使用下列介面:

如要瞭解 Advanced Compute Images,請參閱「Advanced Compute Images 總覽」。

事前準備

  • 如果尚未設定驗證,請先完成設定。 驗證可確認您的身分,以便存取 Google Cloud 服務和 API。如要從本機開發環境執行程式碼或範例,請選取下列其中一個選項,向 Compute Engine 進行驗證:

    選取這個頁面上您打算如何使用範例的分頁:

    控制台

    使用 Google Cloud 控制台存取 Google Cloud 服務和 API 時,無須設定驗證。

    gcloud

    1. 安裝 Google Cloud CLI。 完成後,執行下列指令來初始化 Google Cloud CLI:

      gcloud init

      若您採用的是外部識別資訊提供者 (IdP),請先使用聯合身分登入 gcloud CLI

  • 設定預設地區和區域

必要的角色

如要取得建立執行個體所需的權限,請要求管理員授予您專案的 Compute 執行個體管理員 (v1) (roles/compute.instanceAdmin.v1) IAM 角色。如要進一步瞭解如何授予角色,請參閱「管理專案、資料夾和組織的存取權」。

這個預先定義的角色具備建立執行個體所需的權限。如要查看確切的必要權限,請展開「Required permissions」(必要權限) 部分:

所需權限

如要建立執行個體,必須具備下列權限:

  • compute.instances.create 專案
  • 如要使用自訂映像檔建立 VM: compute.images.useReadOnly 在映像檔上
  • 如要使用快照建立 VM: compute.snapshots.useReadOnly 在快照上
  • 如要使用執行個體範本建立 VM,請按照下列步驟操作: compute.instanceTemplates.useReadOnly 在執行個體範本上
  • 如要為 VM 指定子網路: compute.subnetworks.use 專案或所選子網路的
  • 如要為 VM 指定靜態 IP 位址: compute.addresses.use 專案的權限
  • 使用虛擬私有雲網路時,如要將外部 IP 位址指派給 VM: compute.subnetworks.useExternalIp 專案或所選子網路的權限
  • 如要將舊版網路指派給 VM,請按照下列步驟操作: compute.networks.use 專案的
  • 使用舊版網路時,如要將外部 IP 位址指派給 VM,請在專案中設定 compute.networks.useExternalIp
  • 如要為 VM 設定 VM 執行個體中繼資料,請按照下列步驟操作: compute.instances.setMetadata 在專案中
  • 如要為 VM 設定標記,請按照下列步驟操作: compute.instances.setTags 在 VM 上
  • 如要為 VM 設定標籤,請按照下列步驟操作: compute.instances.setLabels 在 VM 上
  • 如要設定 VM 使用的服務帳戶,請在 VM 上執行下列操作: compute.instances.setServiceAccount 在 VM 上
  • 為 VM 建立新磁碟: compute.disks.create 專案的
  • 如要以唯讀或讀寫模式附加現有磁碟: compute.disks.use 磁碟
  • 如要以唯讀模式連接現有磁碟: compute.disks.useReadOnly 磁碟

您或許還可透過自訂角色或其他預先定義的角色取得這些權限。

快速入門導覽課程

本教學課程說明如何建立使用 Advanced Compute Images 的 A3 UltraA4 執行個體,並設定及自訂客層 OS。

必要條件

建立執行個體前,請先完成下列工作,以便建立 A3 Ultra 和 A4 執行個體:

  1. 取得 A3 Ultra 或 A4 執行個體的資源容量
  2. 建立虛擬私有雲網路
  3. 選用:建立密集配置政策

使用 Advanced Compute Images 建立運算執行個體

完成必要工作後,您可以使用下列任一方法建立執行個體。

控制台

  1. 前往 Google Cloud 控制台的「Create an instance」(建立執行個體) 頁面。

    前往「建立執行個體」

    如果出現提示,請選取專案並按一下「繼續」。「建立執行個體」頁面隨即顯示,並顯示「機器設定」窗格。

  2. 在「機器設定」窗格中,執行下列操作:

    1. 在「Name」(名稱) 欄位中,指定運算執行個體的名稱。詳情請參閱「資源命名慣例」。
    2. 為執行個體選取「區域」和「可用區」。如果您已預留運算資源,所選區域和可用區必須與預留資源的區域和可用區相符。

    3. 按一下「GPU」分頁標籤,然後完成下列步驟:

      1. 在「GPU type」(GPU 類型) 清單中,選取 GPU 類型。
        • 如果是 A4 執行個體,請選取「NVIDIA B200」
        • 如果是 A3 Ultra 執行個體,請選取「NVIDIA H200 141GB」
      2. 在「Number of GPUs」(GPU 數量) 清單中,選取「8」
      3. 選用:選取其他機型。
  3. 在導覽選單中,按一下「OS and storage」(OS 和儲存空間)。在隨即顯示的「OS and storage」(作業系統和儲存空間) 窗格中,完成下列步驟:

    1. 點選「變更」。「開機磁碟」窗格隨即顯示,並顯示「公開映像檔」分頁。
    2. 在「Operating system」(作業系統) 清單中,選取「Advanced Compute Images」(進階 Compute 映像檔)
    3. 在「Version」清單中,選取作業系統版本。
    4. 選用:在「Boot disk type」(開機磁碟類型) 清單中,選取開機磁碟類型。
    5. 選用:指定開機磁碟的其他屬性,例如磁碟大小。
    6. 選用:如需進階設定選項,請展開「Show advanced configurations」(顯示進階設定) 部分。
    7. 如要確認開機磁碟選項並返回「作業系統和儲存空間」窗格,請按一下「選取」
  4. 在導覽選單中,按一下「網路」。「Networking」(網路連線) 窗格隨即顯示。

  5. 選用:如要從 Google Cloud外部設定執行個體的存取權,請完成下列步驟:

    1. 前往「防火牆」部分。
    2. 如要允許運算執行個體接收 HTTP 或 HTTPS 流量,請選取「Allow HTTP traffic」或「Allow HTTPS traffic」

      Compute Engine 會將網路標記新增至運算執行個體,並建立對應輸入防火牆規則,允許所有流量傳入 tcp:80 (HTTP) 或 tcp:443 (HTTPS)。網路標記會建立防火牆規則與執行個體之間的關聯。詳情請參閱 Cloud Next Generation Firewall 說明文件中的「防火牆規則總覽」。

  6. 如要建立多 NIC 的執行個體,請在「網路」窗格中完成下列步驟。如果是單一 NIC 執行個體,請略過這些步驟。

    1. 在「Network interfaces」(網路介面) 區段中,完成下列步驟:
    2. 刪除預設網路介面。如要刪除介面,請按一下 「刪除」
    3. 按一下「新增網路介面」。使用這個選項新增網路介面,附加至您在前一節中建立的虛擬私有雲網路。新增網路介面時,請注意下列事項:

      • 如要用於主機對主機通訊的網路介面,請從「網路」和「子網路」清單中選取一般虛擬私有雲網路和子網路,並將「網路介面卡」清單設為「gVNIC」

      • 如要使用網路介面進行 GPU 間的通訊,請從「網路」和「子網路」清單中選取 RoCE 虛擬私有雲網路和子網路,並將這些網路介面的「網路介面卡」清單設為「MRDMA」

  7. 在導覽選單中,按一下「進階」。然後,根據要使用的佈建模型完成下列步驟。

    彈性啟動

    1. 在「佈建模型」部分,從「VM 佈建模型」清單中選取「彈性啟動」
    2. 在「Enter number of hours」(輸入時數) 欄位中,輸入運算執行個體要執行的時間上限。這個值必須介於 0.01 (0.01 小時或 36 秒) 和 168 (168 小時或七天) 之間。

    3. 選取「設定建立 VM 的等待時間」

      根據工作負載的區域需求,指定下列其中一個時間長度,有助於提高 VM 建立要求成功的機率:

      • 有嚴格區域需求的工作負載:如果工作負載要求您在特定區域中建立 VM,請指定 90 秒2 小時之間的時間長度。 時間越長,獲得資源的機率就越高。
      • 沒有嚴格區域限制的工作負載:如果 VM 可以在區域內的任何區域執行,請指定 0 秒的持續時間,或取消勾選「設定 VM 建立等待時間」核取方塊。這項動作會指定 Compute Engine 僅在資源可立即使用時才分配資源。如果資源無法使用,導致 VM 建立要求失敗,請在其他可用區重試要求。

    4. 在「On VM termination」(在 VM 終止時) 欄位中,選取要在執行時間結束時停止或刪除運算執行個體:

      • 如要刪除執行個體,請選取「刪除」
      • 如要停止執行個體,請選取「停止」

    取決於預留項目

    1. 按一下「選擇預留項目」。這項操作會開啟窗格,其中列出所選區域內的可用預訂項目。在預訂清單中,完成下列步驟:

      1. 選取要用於運算執行個體的預訂。你也可以選取預訂中的特定時段。
      2. 按一下「選擇」

    Spot

    1. 在「佈建模型」部分,從「VM 佈建模型」清單中選取「Spot」
    2. 選用:如要選取 Compute Engine 預先終止 Spot VM 時執行的終止動作,請完成下列步驟:

      1. 展開「VM 佈建模式進階設定」部分。
      2. 在「On VM termination」(在 VM 終止時) 清單中,選取下列其中一個選項:
      3. 如要在先占期間停止 Spot VM,請選取「停止」 (預設)。
      4. 如要在先占期間刪除 Spot VM,請選取「Delete」(刪除)
  8. 如要建立並啟動執行個體,請按一下「建立」

gcloud

如要建立 VM,請使用 gcloud compute instances create 指令

您需要指定的參數取決於此部署作業使用的消耗選項。選取與計費方案對應的分頁。

預留項目

執行指令前,請先詳閱下列所有步驟,判斷是否要加入其他標記。

gcloud compute instances create INSTANCE_NAME  \
    --machine-type=MACHINE_TYPE \
    --image-family=IMAGE_FAMILY \
    --image-project=IMAGE_PROJECT \
    --zone=ZONE \
    --boot-disk-type=hyperdisk-balanced \
    --boot-disk-size=DISK_SIZE \
    --scopes=cloud-platform \
    --network-interface=nic-type=GVNIC,network=GVNIC_NAME_PREFIX-net-0,subnet=GVNIC_NAME_PREFIX-sub-0 \
    --network-interface=nic-type=GVNIC,network=GVNIC_NAME_PREFIX-net-1,subnet=GVNIC_NAME_PREFIX-sub-1,no-address 
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-0,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-1,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-2,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-3,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-4,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-5,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-6,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-7,no-address \
    --reservation-affinity=specific \
    --reservation=RESERVATION \
    --provisioning-model=RESERVATION_BOUND \
    --instance-termination-action=TERMINATION_ACTION \
    --maintenance-policy=TERMINATE \
    --restart-on-failure

操作步驟如下:

  1. 更改下列內容:

    • INSTANCE_NAME:VM 的名稱。
    • MACHINE_TYPE:VM 要使用的機型。詳情請參閱 Compute Engine 說明文件中的 GPU 機器類型
    • IMAGE_FAMILY:您要使用的 OS 映像檔系列。 如需所有支援的作業系統清單,請參閱「支援的作業系統」。
    • IMAGE_PROJECT:OS 映像檔的專案 ID。
    • ZONE:您要使用的機型所在的可用區。如要指定密集配置政策,請使用與密集配置政策位於相同區域的可用區。 如需區域相關資訊,請參閱「各區域和可用區的 GPU 供應情形」。
    • DISK_SIZE:開機磁碟的大小,單位為 GB。詳情請參閱Google Cloud Hyperdisk 大小限制永久磁碟大小限制,視磁碟類型而定。
    • GVNIC_NAME_PREFIX:建立使用 gVNIC 的標準 VPC 網路和子網路時指定的名稱前置字元。
    • RDMA_NAME_PREFIX:建立使用 RDMA NIC 的虛擬私有雲網路和子網路時指定的名稱前置字元。
    • RESERVATION:預留項目名稱或預留項目內的特定區塊。如要取得預留名稱或可用區塊,請參閱「查看預留容量」。根據執行個體放置位置的需求,選擇下列其中一個選項:
      • 如要在任何區塊建立執行個體,請按照下列步驟操作:

        projects/RESERVATION_OWNER_PROJECT_ID/reservations/RESERVATION_NAME

        此外,如要在同一個區塊中建立多個執行個體,請在建立每個執行個體時,套用指定區塊並置 (maxDistance=2) 的相同密集配置政策。Compute Engine 隨後會將政策套用至預留項目,並在相同區塊中建立執行個體。

      • 如要在特定區塊建立執行個體,請按照下列步驟操作:

        projects/RESERVATION_OWNER_PROJECT_ID/reservations/RESERVATION_NAME/reservationBlocks/RESERVATION_BLOCK_NAME
    • TERMINATION_ACTION:Compute Engine 在預訂期間結束時,是停止 (STOP) 還是刪除 (DELETE) VM。

  2. 選用:如要使用密集配置政策,請新增下列旗標:

      --resource-policies=POLICY_NAME
    

    更改下列內容:

    • POLICY_NAME:密集配置政策的名稱。
  3. 執行更改後的指令。

彈性啟動

執行指令前,請先詳閱下列所有步驟,判斷是否要加入其他標記。

gcloud compute instances create INSTANCE_NAME  \
    --machine-type=MACHINE_TYPE \
    --image-family=IMAGE_FAMILY \
    --image-project=IMAGE_PROJECT \
    --zone=ZONE \
    --boot-disk-type=hyperdisk-balanced \
    --boot-disk-size=DISK_SIZE \
    --scopes=cloud-platform \
    --network-interface=nic-type=GVNIC,network=GVNIC_NAME_PREFIX-net-0,subnet=GVNIC_NAME_PREFIX-sub-0 \
    --network-interface=nic-type=GVNIC,network=GVNIC_NAME_PREFIX-net-1,subnet=GVNIC_NAME_PREFIX-sub-1,no-address 
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-0,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-1,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-2,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-3,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-4,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-5,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-6,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-7,no-address \
    --reservation-affinity=none \
    --provisioning-model=FLEX_START \
    --request-valid-for-duration=REQUEST_VALID_FOR_DURATION \
    --max-run-duration=MAX_RUN_DURATION \
    --instance-termination-action=TERMINATION_ACTION \
    --maintenance-policy=TERMINATE

操作步驟如下:

  1. 更改下列內容:

    • INSTANCE_NAME:VM 的名稱。
    • MACHINE_TYPE:VM 要使用的機型。詳情請參閱 Compute Engine 說明文件中的 GPU 機器類型
    • IMAGE_FAMILY:您要使用的 OS 映像檔系列。 如需所有支援的作業系統清單,請參閱「支援的作業系統」。
    • IMAGE_PROJECT:OS 映像檔的專案 ID。
    • ZONE:您要使用的機型所在的可用區。如要指定密集配置政策,請使用與密集配置政策位於相同區域的可用區。 如需區域相關資訊,請參閱「各區域和可用區的 GPU 供應情形」。
    • DISK_SIZE:開機磁碟的大小,單位為 GB。詳情請參閱Google Cloud Hyperdisk 大小限制永久磁碟大小限制,視磁碟類型而定。
    • GVNIC_NAME_PREFIX:建立使用 gVNIC 的標準 VPC 網路和子網路時指定的名稱前置字元。
    • RDMA_NAME_PREFIX:建立使用 RDMA NIC 的虛擬私有雲網路和子網路時指定的名稱前置字元。
    • REQUEST_VALID_FOR_DURATION:建立 VM 的要求有效時間長度。您必須將值格式化為天數、時數、分鐘數或秒數,並分別加上 dhms。舉例來說,指定 30m 代表 30 分鐘,指定 1h2m3s 則代表 1 小時 2 分 3 秒。

      根據工作負載的區域需求,指定下列其中一個時間長度,有助於提高 VM 建立要求成功的機率:

      • 有嚴格區域需求的工作負載:如果工作負載要求您在特定區域中建立 VM,請指定 90 秒 (90s) 到兩小時 (2h) 的時間長度。時間長度越長,取得資源的機率就越高。
      • 沒有嚴格可用區需求的工作負載:如果 VM 可以在區域內的任何可用區執行,請指定零秒的期限 (0s)。這項動作會指定 Compute Engine 僅在資源可立即使用時分配資源。如果資源無法使用,導致 VM 建立要求失敗,請在其他可用區重試要求。
    • MAX_RUN_DURATION:您希望要求的 VM 執行多久。您必須將值格式化為天數、時數、分鐘數或秒數,並分別加上 dhms。值必須介於 10 分鐘至 7 天之間。

    • TERMINATION_ACTION:Compute Engine 是否會在 VM 執行時間結束時停止 (STOP) 或刪除 (DELETE) VM。

  2. 選用:如要使用密集配置政策,請新增下列旗標:

      --resource-policies=POLICY_NAME
    

    更改下列內容:

    • POLICY_NAME:密集配置政策的名稱。
  3. 執行更改後的指令。

Spot

執行指令前,請先詳閱下列所有步驟,判斷是否要加入其他標記。

gcloud compute instances create INSTANCE_NAME  \
    --machine-type=MACHINE_TYPE \
    --image-family=IMAGE_FAMILY \
    --image-project=IMAGE_PROJECT \
    --zone=ZONE \
    --boot-disk-type=hyperdisk-balanced \
    --boot-disk-size=DISK_SIZE \
    --scopes=cloud-platform \
    --network-interface=nic-type=GVNIC,network=GVNIC_NAME_PREFIX-net-0,subnet=GVNIC_NAME_PREFIX-sub-0 \
    --network-interface=nic-type=GVNIC,network=GVNIC_NAME_PREFIX-net-1,subnet=GVNIC_NAME_PREFIX-sub-1,no-address 
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-0,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-1,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-2,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-3,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-4,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-5,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-6,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-7,no-address \
    --provisioning-model=SPOT \
    --instance-termination-action=TERMINATION_ACTION \
    --maintenance-policy=TERMINATE \
    --no-restart-on-failure

操作步驟如下:

  1. 更改下列內容:

    • INSTANCE_NAME:VM 的名稱。
    • MACHINE_TYPE:VM 要使用的機型。詳情請參閱 Compute Engine 說明文件中的 GPU 機器類型
    • IMAGE_FAMILY:您要使用的 OS 映像檔系列。 如需所有支援的作業系統清單,請參閱「支援的作業系統」。
    • IMAGE_PROJECT:OS 映像檔的專案 ID。
    • ZONE:您要使用的機型所在的可用區。如要指定密集配置政策,請使用與密集配置政策位於相同區域的可用區。 如需區域相關資訊,請參閱「各區域和可用區的 GPU 供應情形」。
    • DISK_SIZE:開機磁碟的大小,單位為 GB。詳情請參閱Google Cloud Hyperdisk 大小限制永久磁碟大小限制,視磁碟類型而定。
    • GVNIC_NAME_PREFIX:建立使用 gVNIC 的標準 VPC 網路和子網路時指定的名稱前置字元。
    • RDMA_NAME_PREFIX:建立使用 RDMA NIC 的虛擬私有雲網路和子網路時指定的名稱前置字元。
    • TERMINATION_ACTION:Compute Engine 預先終止執行個體時採取的動作,可以是 STOP (預設) 或 DELETE

  2. 選用:如要使用密集配置政策,請新增下列旗標:

      --resource-policies=POLICY_NAME
    

    更改下列內容:

    • POLICY_NAME:密集配置政策的名稱。
  3. 執行更改後的指令。

過一段時間後,運算執行個體就會建立完成。如要驗證執行個體設定並查看狀態,請執行下列指令:

gcloud compute instances describe INSTANCE_NAME

設定 Spot VM

如果您建立了 Spot VM,請完成下列步驟:

存取運算執行個體

建立運算執行個體後,執行個體會自動啟動。如要存取執行個體,請執行下列任一操作:

控制台

  1. 前往 Google Cloud 控制台的「VM instances」(VM 執行個體) 頁面

    前往 VM 執行個體

  2. 按一下運算執行個體的名稱。

  3. 在「Remote Access」(遠端存取) 部分中,按一下第一個下拉式清單,並選擇存取該執行個體的方式。

Compute Engine 會傳播您的 SSH 金鑰,並建立您的使用者。詳情請參閱「連線至 Linux VM」。

gcloud

如要使用 SSH 存取執行個體,請使用 gcloud compute ssh 指令

gcloud compute ssh INSTANCE_NAME --zone ZONE

Compute Engine 會傳播您的 SSH 金鑰,並建立您的使用者。詳情請參閱「連線至 Linux VM」。

清除所用資源

如要避免系統向您的 Google Cloud 帳戶收取這些快速入門導覽課程所用資源的費用,請刪除您建立的所有運算執行個體和附加資源。

控制台

  1. 前往 Google Cloud 控制台的「VM instances」(VM 執行個體) 頁面

    前往 VM 執行個體

  2. 選取要刪除的執行個體。

  3. 按一下「刪除」圖示

  4. 在對話方塊中執行下列操作:

    1. 選用:如要刪除執行個體,但不要正常關機,或要結束進行中的正常關機程序,請選取「Skip graceful shutdown (if applicable)」(略過正常關機 (如適用)) 核取方塊。

    2. 按一下「Delete」(刪除) 確認操作。

  5. 如要刪除已刪除執行個體使用的磁碟,請前往「Disks」頁面,然後執行下列步驟:

    前往「Disks」(磁碟)

    1. 選取要刪除的磁碟。所選磁碟的「In use by」(由誰使用) 欄不得有值。

    2. 按一下「刪除」圖示

    3. 按一下「Delete」(刪除) 確認操作。

gcloud

如要刪除同一區域中的一或多個執行個體,請使用 gcloud compute instances delete 指令。如要強制刪除連結至一或多個執行個體的磁碟,請加入 --delete-disks 標記:

gcloud compute instances delete INSTANCE_NAMES \
        --delete-disks=DELETE_DISK_TYPE \
        --zone=ZONE

更改下列內容:

  • INSTANCE_NAMES:以空格分隔的執行個體名稱清單,例如 instance-01 instance-02 instance-03

  • ZONE:執行個體所在的區域。

  • DELETE_DISK_TYPE:指定下列其中一個值:

    • 如要刪除已連結的開機和非開機永久儲存空間,請按照下列步驟操作:all
    • 如要只刪除附加的開機永久儲存空間,請執行 boot
    • 如要只刪除非開機永久儲存空間,請按照下列步驟操作:data

根據 Advanced Compute Images 建立自訂映像檔

您可以根據 Advanced Compute Images 映像檔建立自訂映像檔。然後,您可以在為工作負載和應用程式建立新的運算執行個體時,使用自訂映像檔。

如要建立自訂映像檔,請完成下列工作:

  1. 設定圖片的儲存位置。如要建立、修改及刪除儲存在 Cloud Storage 中的 OS 映像檔,您必須獲派 roles/compute.storageAdmin 角色。

  2. 使用 Advanced Compute Images 建立運算執行個體

  3. 視需要自訂運算執行個體的客體 OS。

  4. 停止運算執行個體,避免資料寫入磁碟。如果無法停止執行個體,請完成「盡量減少寫入永久磁碟的資料」一文中的步驟。

  5. 停用開機磁碟的自動刪除選項

  6. 使用運算執行個體的開機磁碟做為來源磁碟,建立自訂映像檔。您可以使用 Google Cloud 控制台Google Cloud CLI 執行這項操作。

    控制台

    1. 前往 Google Cloud 控制台的「Images」頁面。

      前往「映文件」

    2. 點選「建立映像檔」

    3. 指定映像檔的「Name」(名稱)

    4. 在「Source disk」(來源磁碟) 底下,選取使用 Advanced Compute Images 的運算執行個體開機磁碟名稱。

      如果運算執行個體未停止,請選取「Keep instance running」(讓執行個體保持執行狀態),確認要在執行個體執行時建立映像檔。您先前應已完成將寫入作業降到最低的步驟。

    5. 在「Based on source disk location (default)」(根據來源磁碟位置 (預設值)) 下拉式清單中,指定儲存自訂映像檔的位置。例如,指定 us 會將映像檔儲存在 us 多地區;指定 us-central1 則會儲存在 us-central1 地區。

      如果未選擇位置,Compute Engine 會將映像檔儲存在最靠近自訂映像檔來源位置的多區域。

    6. 選用:指定圖片的其他屬性:

      • 系列:這個新映像檔所屬的映像檔系列
      • 說明:自訂圖片的說明。
      • 標籤:用來將資源歸類的標籤
    7. 指定加密金鑰。您可以選擇Google-owned and Google-managed encryption key 或 Cloud Key Management Service (Cloud KMS) 金鑰。如未指定加密金鑰,系統會使用 Google-owned and Google-managed encryption key將映像檔加密。

    8. 按一下 [建立] 以建立映像檔。

    gcloud

    使用 gcloud compute images create 指令建立自訂映像檔。

    --force 旗標是選用旗標,可讓您從執行中的執行個體建立映像檔。根據預設,您無法從執行中的執行個體建立映像檔。除非您確定要在執行個體執行時建立映像檔,否則請勿指定此旗標。

    gcloud compute images create IMAGE_NAME \
        --source-disk=SOURCE_DISK \
        --source-disk-zone=ZONE \
        [--family=IMAGE_FAMILY] \
        [--storage-location=LOCATION] \
        [--force]
    

    更改下列內容:

    • IMAGE_NAME:新圖片的名稱
    • SOURCE_DISK:要建立映像檔的磁碟
    • ZONE:磁碟所在的可用區
    • IMAGE_FAMILY:選用:指定此映像檔所屬映像檔系列的旗標
    • LOCATION:選用:旗標,可指定儲存映像檔的區域或多區域。例如,指定 us 會將映像檔儲存在 us 多地區;指定 us-central1 則會儲存在 us-central1 地區。如果未選擇位置,Compute Engine 會將映像檔儲存在最靠近映像檔來源位置的多區域。

如要進一步瞭解如何建立自訂映像檔,請參閱「建立自訂映像檔」。

分享圖片

建立自訂映像檔後,您可以跨專案共用映像檔。如果您允許其他專案的使用者使用自訂映像檔,他們就能在要求中指定映像檔專案,藉此存取這些映像檔

搭配執行個體範本使用 Advanced Compute Images

您可以建立指定 Advanced Compute Images 映像檔的執行個體範本,然後使用該範本執行下列操作:

建立執行個體範本的限制

建立執行個體範本時,請注意下列限制:

  • 在 gcloud CLI 和 REST 中,系統支援在執行個體範本以外的介面上使用 Shared VPC,但Google Cloud 控制台不支援。nic0
  • 您無法更新現有的執行個體範本,也無法在執行個體範本建立後再加以變更。如果執行個體範本已過期,或是您需要變更設定,請建立新的執行個體範本。
  • 如要在執行個體範本中指定映像檔系列,請勿使用 Google Cloud 控制台。請改用 Google Cloud CLI 或 REST。
  • 如要在執行個體範本中指定地區磁碟而非區域磁碟,請勿使用 Google Cloud 控制台。請改用 Google Cloud CLI 或 REST。
  • 您可以使用執行個體範本建立運算執行個體,並搭配位於儲存空間集區的 Hyperdisk Balanced 開機磁碟,但前提是儲存空間集區與執行個體位於相同區域。
  • 您無法使用全域執行個體範本,建立含有儲存集區中非開機磁碟的運算執行個體。
  • 如要建立地區執行個體範本,範本中指定的 GPU 類型必須在指定地區的至少一個區域中提供。

建立執行個體範本

在用來建立個別運算執行個體的要求中,大多數可指定的執行個體屬性都能利用執行個體範本來指定,包括任何執行個體中繼資料、開機指令碼、永久磁碟和服務帳戶。執行個體範本的必要資訊包括機器類型、開機磁碟和網路。

您可以使用 Google Cloud 控制台或 Google Cloud CLI,建立使用 Advanced Compute Images 的區域或全域執行個體範本。

如要建立執行個體範本,使用者帳戶必須具備呼叫 instanceTemplates.insert 方法所需的所有權限。

下列各節說明如何建立執行個體範本,以搭配代管執行個體群組 (MIG)、個別運算執行個體或預留項目使用。如要建立供 AI Hypercomputer 使用的執行個體範本,請改為按照「使用 A4 或 A3 Ultra 機型建立 AI 適用的 MIG」一文中的操作說明進行。

為 A3 Ultra 或 A4 執行個體建立額外資源

如要為使用 Advanced Compute Images 的執行個體建立執行個體範本,請先建立要在執行個體範本中指定的資源。完成「必要條件」中列出的工作,建立這些資源。

建立指定進階 Compute Images 映像檔的執行個體範本

您可以使用 Google Cloud 控制台或 gcloud CLI 指令建立執行個體範本。

控制台

  1. 前往 Google Cloud 控制台的「Instance templates」(執行個體範本) 頁面。

    前往「Instance templates」(執行個體範本)

  2. 點選「建立執行個體範本」

  3. 在「Name」(名稱) 欄位中,輸入執行個體範本的名稱。

  4. 按照以下方式選取「Location」(位置)

    1. 如要跨區域使用執行個體範本,請選擇「Global」(全域) (預設)。
    2. 如要減少跨區域依附元件,請選擇「Regional」(區域),然後選取要建立執行個體範本的「區域」
  5. 在「Machine configuration」(機器設定) 部分,執行下列操作:

    1. 按一下「GPU」分頁標籤。
    2. 在「GPU type」(GPU 類型) 清單中,選取 GPU 類型。如果是 A4 執行個體,請選取 NVIDIA B200;如果是 A3 Ultra 執行個體,請選取 NVIDIA H200 141GB
    3. 在「Number of GPUs」(GPU 數量) 清單中,選取 8。
    4. 選用:選取非預設的機型。
  6. 在「Boot disk」(開機磁碟) 專區中,按一下「Change」(變更),然後執行下列操作:

    1. 在「Operating system」(作業系統) 清單中,選取「Advanced Compute Images」(進階 Compute 映像檔)
    2. 在「Version」清單中,選取作業系統版本。
    3. 選用:指定開機磁碟的其他屬性,例如磁碟大小。
  7. 點選 [Create] (建立) 來建立執行個體範本。

gcloud

如要建立區域或全域執行個體範本,請使用 instance-templates create 指令。如果是區域性執行個體範本,您必須使用 --instance-template-region 標記設定範本的區域。

為 GPU 執行個體建立執行個體範本時,您必須將 --maintenance-policy 旗標設為 TERMINATE

  • 使用下列指令建立區域執行個體範本。

    gcloud compute instance-templates create INSTANCE_TEMPLATE_NAME \
      --instance-template-region=REGION \
      --accelerator=count=8,type=GPU_TYPE \
      --machine-type=MACHINE_TYPE \
      --image-project=advanced-compute-images \
      --image-family=IMAGE_FAMILY \
      --maintenance-policy=TERMINATE
    
  • 使用下列指令建立全域執行個體範本:

    gcloud compute instance-templates create INSTANCE_TEMPLATE_NAME
      --accelerator=count=8,type=GPU_TYPE \
      --machine-type=MACHINE_TYPE \
      --image-project=advanced-compute-images \
      --image-family=IMAGE_FAMILY \
      --maintenance-policy=TERMINATE
    

更改下列內容:

  • INSTANCE_TEMPLATE_NAME:執行個體範本的名稱。
  • REGION:如果是區域執行個體範本,這是要建立範本的區域。
  • GPU_TYPE:要搭配運算執行個體使用的 GPU 類型。 使用 Advanced Compute Images 時,您必須為 A4 或 A3 Ultra 執行個體指定 nvidia-b200nvidia-h200-141gb
  • MACHINE_TYPE:運算執行個體的機型。 如要使用 Advanced Compute Images,必須指定 A3 UltraA4 機型。
  • IMAGE_FAMILY:請指定下列其中一個值:
    • IMAGE_FAMILY:映像檔系列。這會指定該系列中最新的 OS 映像檔版本。舉例來說,您可以指定 aci-gpu-u2204-slurm-2511-cuda-130-nvidia-580-amd64
    • IMAGE:作業系統映像檔的特定版本,例如 aci-gpu-u2204-slurm-2511-cuda-130-nvidia-580-amd64-v20260427-1。如要指定特定 OS 映像檔版本,而非映像檔系列,請使用 --image 旗標,而非 --image-family 旗標。

您最多可以加入 15 個次要非開機磁碟。請為您建立的每個次要磁碟指定 --create-disk 旗標。

  • 如要透過公開或自訂映像檔建立次要磁碟,請在 --create-disk 標記中,為每個磁碟指定 imageimage-project 屬性。
  • 如要建立空白磁碟,請勿加入 imageimage-project 屬性
  • 您也可以視情況加入磁碟 sizetype 屬性。

如需所有可用子指令和旗標的清單,請參閱 instance-templates 參考資料

後續步驟

* 查看建立代管執行個體群組 (MIG) 的基本情境。 * 瞭解如何查看執行個體狀態,確認執行個體何時可以使用。* 瞭解如何連線至執行個體