Dokumen ini menjelaskan cara membuat cluster Google Kubernetes Engine (GKE) yang dioptimalkan untuk AI yang menggunakan seri mesin yang dioptimalkan untuk akselerator G2 (NVIDIA L4) atau G4 (NVIDIA RTX PRO 6000) untuk mendukung workload kecerdasan buatan (AI) dan machine learning (ML) Anda. G2 dan G4 adalah seri mesin GPU Umum, yang menyediakan resource komputasi independen yang dirancang untuk tugas AI umum seperti inferensi kecil hingga sedang dan aplikasi yang memerlukan grafis intensif. Selain jenis mesin GPU tunggal dan multi-GPU, seri mesin G4 mendukung GPU virtual (vGPU) pada jenis mesin yang memiliki kurang dari satu GPU:
g4-standard-6(seperdelapan GPU)g4-standard-12(seperempat GPU)g4-standard-24(setengah GPU)
GKE menyediakan satu platform untuk menjalankan beragam workload bagi organisasi Anda, sehingga mengurangi beban operasional dalam mengelola beberapa platform.
Untuk membuat cluster GKE yang dioptimalkan untuk AI dengan G2 atau G4, selesaikan langkah-langkah berikut:
Sebelum memulai
Sebelum memulai, pastikan Anda telah melakukan tugas berikut:
- Aktifkan Google Kubernetes Engine API. Aktifkan Google Kubernetes Engine API
- Untuk menggunakan Google Cloud CLI untuk tugas ini,
instal lalu
lakukan inisialisasi
gcloud CLI. Jika sebelumnya Anda telah menginstal gcloud CLI, dapatkan versi terbaru dengan menjalankan perintah
gcloud components update. Versi gcloud CLI yang lebih lama mungkin tidak mendukung menjalankan perintah dalam dokumen ini.
Peran yang diperlukan
Untuk mendapatkan izin yang Anda perlukan guna membuat dan mengelola cluster GKE, minta administrator untuk memberi Anda peran IAM berikut pada project:
- Kubernetes Engine Admin (
roles/container.admin) - Compute Admin (
roles/compute.admin)
Untuk mengetahui informasi selengkapnya tentang pemberian peran, lihat Mengelola akses ke project, folder, dan organisasi.
Anda mungkin juga bisa mendapatkan izin yang diperlukan melalui peran khusus atau peran bawaan lainnya.
Memilih opsi pemakaian dan mendapatkan kapasitas
Pilih opsi pemakaian. Buat pilihan berdasarkan cara Anda ingin mendapatkan dan menggunakan resource GPU. Untuk mengetahui informasi selengkapnya, lihat Memilih opsi pemakaian.
Untuk GKE, pertimbangkan informasi tambahan berikut saat Anda memilih opsi penggunaan:
- Untuk mengetahui informasi selengkapnya tentang flex-start (Pratinjau) dan GKE, lihat Tentang ketersediaan GPU dengan flex-start.
- Flex-start menggunakan penempatan rapat upaya terbaik. Untuk memeriksa topologi Anda, lihat Melihat topologi fisik node di cluster GKE Anda.
- Anda hanya bisa mendapatkan informasi topologi saat menggunakan VM Spot jika Anda mengonfigurasi penempatan rapat.
Dapatkan kapasitas. Pelajari cara mendapatkan kapasitas untuk opsi penggunaan Anda.
Persyaratan
Untuk membuat cluster GKE yang dioptimalkan untuk AI yang menggunakan G2 atau G4, pastikan Anda memenuhi persyaratan berikut:
- Versi GKE: Mesin G4 (NVIDIA RTX PRO 6000) memerlukan
versi GKE minimum berikut:
- Mode standar:
- Jenis mesin yang memiliki satu atau beberapa GPU:
1.34.0-gke.1662000atau yang lebih baru - Jenis mesin yang memiliki kurang dari satu GPU (
g4-standard-6,g4-standard-12, dang4-standard-24):- 1.35:
1.35.8-gke.1518000atau yang lebih baru - 1.36 atau yang lebih baru:
1.36.4-gke.1082000atau yang lebih baru
- 1.35:
- Jenis mesin yang memiliki satu atau beberapa GPU:
- Mode Autopilot:
- Jenis mesin yang memiliki satu atau beberapa GPU:
1.34.1-gke.1829001atau yang lebih baru - Jenis mesin yang memiliki kurang dari satu GPU (
g4-standard-6,g4-standard-12, dang4-standard-24):- 1.35:
1.35.8-gke.1518000atau yang lebih baru - 1.36 atau yang lebih baru:
1.36.4-gke.1082000atau yang lebih baru
- 1.35:
- Jenis mesin yang memiliki satu atau beberapa GPU:
- Mode standar:
- Driver GPU:
- Node G2 (NVIDIA L4) harus menggunakan driver NVIDIA versi
535atau yang lebih baru. - Node G4 (NVIDIA RTX PRO 6000) harus menggunakan driver NVIDIA versi
580atau yang lebih baru.
- Node G2 (NVIDIA L4) harus menggunakan driver NVIDIA versi
Batasan
Batasan berikut berlaku untuk G2 dan G4 sebagai seri mesin GPU Umum:
- SSD Lokal: Jenis mesin G2 dan G4 tidak menyertakan disk SSD Lokal secara
default. Anda harus melampirkannya secara manual jika diperlukan. Jenis mesin
g4-standard-6(seperdelapan GPU) tidak mendukung SSD Lokal. - NCCL Fast Socket: Anda tidak dapat menggunakan NCCL Fast Socket dengan mesin G2 atau G4 di GKE. Meskipun mesin G2 dan G4 mendukung komunikasi multi-node, keduanya menggunakan jaringan VPC standar. Untuk pelatihan terdistribusi berskala besar yang memerlukan throughput jaringan maksimum, sebaiknya gunakan seri mesin GPU Bercluster, seperti A3 High atau A3 Mega (yang menggunakan GPUDirect TCPX) atau A3 Ultra dan A4 (yang menggunakan GPUDirect RDMA).
- Jenis mesin G4 yang memiliki kurang dari satu GPU: untuk
g4-standard-6,g4-standard-12, dang4-standard-24:- Anda tidak dapat menggunakan image node Ubuntu.
- Anda tidak dapat menggunakan GPU multi-instance, NVIDIA MPS, atau GPU time-sharing.
Buat lingkungan GKE
Anda dapat membuat cluster dalam mode Autopilot atau Standard.
Autopilot
Untuk membuat cluster Autopilot, jalankan perintah berikut:
gcloud container clusters create-auto CLUSTER_NAME \
--region=REGION
Ganti kode berikut:
CLUSTER_NAME: nama cluster Anda.REGION: region untuk cluster Anda.
Standar
Buat cluster Standar dan node pool GPU:
Untuk membuat cluster Standard, jalankan perintah berikut:
gcloud container clusters create CLUSTER_NAME \ --region=REGION \ --enable-ip-aliasGanti kode berikut:
CLUSTER_NAME: nama cluster Anda.REGION: region untuk cluster Anda.
Buat node pool. Setelah membuat cluster, Anda dapat menambahkan node pool dengan G2 atau G4. Untuk workload multi-node yang menggunakan G2 (L4) atau G4 (RTX PRO 6000), sebaiknya gunakan kebijakan penempatan ringkas untuk meminimalkan latensi jaringan antar-node.
Untuk membuat node pool, gunakan perintah berikut:
G2 (NVIDIA L4)
gcloud container node-pools create NODE_POOL_NAME \ --cluster=CLUSTER_NAME \ --region=REGION \ --node-locations=ZONE \ --machine-type=MACHINE_TYPE \ --accelerator=type=nvidia-l4,count=AMOUNT,gpu-driver-version=LATEST \ --placement-type=COMPACT \ --scopes="https://www.googleapis.com/auth/cloud-platform" \ --local-ssd-count=LOCAL_SSD_COUNTG4 (NVIDIA RTX PRO 6000)
gcloud container node-pools create NODE_POOL_NAME \ --cluster=CLUSTER_NAME \ --region=REGION \ --node-locations=ZONE \ --machine-type=MACHINE_TYPE \ --accelerator=type=nvidia-rtx-pro-6000,count=AMOUNT,gpu-driver-version=LATEST \ --disk-type=hyperdisk-balanced \ --placement-type=COMPACT \ --scopes="https://www.googleapis.com/auth/cloud-platform" \ --local-ssd-count=LOCAL_SSD_COUNTG4 Virtual Workstation (vWS)
gcloud container node-pools create NODE_POOL_NAME \ --cluster=CLUSTER_NAME \ --region=REGION \ --node-locations=ZONE \ --machine-type=MACHINE_TYPE \ --accelerator=type=nvidia-rtx-pro-6000-vws,count=AMOUNT,gpu-driver-version=LATEST \ --disk-type=hyperdisk-balanced \ --placement-type=COMPACT \ --scopes="https://www.googleapis.com/auth/cloud-platform" \ --local-ssd-count=LOCAL_SSD_COUNTGanti kode berikut:
NODE_POOL_NAME: nama node pool Anda.CLUSTER_NAME: nama cluster Anda.REGION: region untuk cluster Anda.ZONE: satu atau beberapa zona dalam region Anda yang memiliki GPU yang diminta tersedia, misalnya,us-central1-a. Hal ini diperlukan saat menggunakan penempatan rapat.MACHINE_TYPE: jenis mesin untuk node Anda, misalnya,g2-standard-4untuk mesin G2,g4-standard-48untuk mesin G4 GPU tunggal, ataug4-standard-6,g4-standard-12, ataug4-standard-24untuk jenis mesin G4 yang memiliki kurang dari satu GPU (dengan jenis akseleratornvidia-rtx-pro-6000).AMOUNT: jumlah GPU yang akan dipasang ke setiap node. Jika Anda menggunakan jenis mesin G4 yang memiliki kurang dari satu GPU (g4-standard-6,g4-standard-12, ataug4-standard-24), ataug4-standard-48(satu GPU), Anda harus menyetelAMOUNTke1.LOCAL_SSD_COUNT: jumlah volume SSD Lokal yang akan disediakan di setiap node. Hilangkan tanda--local-ssd-countjika Anda menggunakan jenis mesing4-standard-6, karenag4-standard-6tidak mendukung SSD Lokal.
Hubungkan ke cluster Anda
Hubungkan ke cluster Anda agar Anda dapat menjalankan perintah kubectl di bagian berikutnya:
gcloud container clusters get-credentials CLUSTER_NAME \
--region=REGION
Ganti kode berikut:
CLUSTER_NAME: nama cluster Anda.REGION: region untuk cluster Anda.
Untuk mengetahui informasi selengkapnya, lihat Menginstal kubectl dan mengonfigurasi akses cluster.
Mengonfigurasi manifes Pod (khusus Autopilot)
Jika membuat cluster Autopilot, Anda harus memilih GPU yang sesuai dalam manifes Pod agar GKE menyediakan hardware.
Tentukan jenis GPU yang dipilih dan reservasi tertentu menggunakan pemilih node:
spec: nodeSelector: cloud.google.com/gke-accelerator: ACCELERATOR cloud.google.com/gke-gpu-driver-version: latest # Optional: Include if using reserved capacity cloud.google.com/reservation-name: RESERVATION_NAME cloud.google.com/reservation-affinity: "specific"Ganti kode berikut:
ACCELERATOR: akselerator yang Anda pesan. Anda harus menggunakannvidia-l4(untuk G2),nvidia-rtx-pro-6000(untuk G4), ataunvidia-rtx-pro-6000-vws(untuk G4 dengan Virtual Workstation).RESERVATION_NAME: nama reservasi kapasitas Compute Engine. Untuk memakai reservasi bersama, atau blok dan sub-blok reservasi tertentu, lihat bagian masing-masing di Memakai resource jalur zona yang dicadangkan.
Tambahkan resource berikut ke container yang meminta GPU:
containers: - name: my-container resources: limits: nvidia.com/gpu: AMOUNTGanti
AMOUNTdengan jumlah GPU yang akan digunakan container. Untuk meminta jenis mesin G4 yang memiliki kurang dari satu GPU (g4-standard-6,g4-standard-12, ataug4-standard-24) di cluster Autopilot, Anda harus menggunakanComputeClasskustom yang menentukan jenis mesin dan Anda harus menyetelnvidia.com/gpuke1. Untuk mengetahui petunjuknya, lihat Meminta jenis mesin G4 yang memiliki kurang dari satu GPU.