Dokumen ini menjelaskan cara membuat cluster Google Kubernetes Engine (GKE) kustom yang menggunakan seri mesin yang dioptimalkan untuk akselerator G2 (NVIDIA L4) atau G4 (NVIDIA RTX PRO 6000) untuk mendukung workload kecerdasan buatan (AI) dan machine learning (ML) Anda. G2 dan G4 adalah seri mesin GPU Umum, yang menyediakan resource komputasi independen yang dirancang untuk tugas AI mainstream seperti inferensi skala kecil hingga menengah dan aplikasi yang memerlukan daya komputasi grafis intensif.
GKE menyediakan satu platform untuk menjalankan berbagai workload bagi organisasi Anda, sehingga mengurangi beban operasional dalam mengelola beberapa platform.
Untuk membuat cluster GKE yang dioptimalkan untuk AI dengan G2 atau G4, Anda akan melakukan hal berikut:
Sebelum memulai
Sebelum memulai, pastikan Anda telah melakukan tugas berikut:
- Aktifkan Google Kubernetes Engine API. Aktifkan Google Kubernetes Engine API
- Jika ingin menggunakan Google Cloud CLI untuk tugas ini,
instal lalu
lakukan inisialisasi gcloud CLI. Jika sebelumnya Anda telah menginstal gcloud CLI, dapatkan versi terbaru dengan menjalankan perintah
gcloud components update. Versi gcloud CLI yang lebih lama mungkin tidak mendukung perintah yang ada dalam dokumen ini.
Peran yang diperlukan
Untuk mendapatkan izin yang Anda perlukan untuk membuat dan mengelola cluster GKE, minta administrator untuk memberi Anda peran IAM berikut pada project:
- Kubernetes Engine Admin (
roles/container.admin) - Compute Admin (
roles/compute.admin)
Untuk mengetahui informasi selengkapnya tentang pemberian peran, lihat Mengelola akses ke project, folder, dan organisasi.
Anda mungkin juga bisa mendapatkan izin yang diperlukan melalui peran khusus atau peran bawaan lainnya.
Memilih opsi pemakaian dan mendapatkan kapasitas
Pilih opsi pemakaian. Buat pilihan berdasarkan cara Anda ingin mendapatkan dan menggunakan resource GPU. Untuk mengetahui informasi selengkapnya, lihat Memilih opsi pemakaian.
Untuk GKE, pertimbangkan informasi tambahan berikut saat Anda memilih opsi pemakaian:
- Untuk mengetahui informasi selengkapnya tentang flex-start (Pratinjau) dan GKE, lihat Tentang ketersediaan GPU dengan flex-start.
- Flex-start menggunakan penempatan rapat upaya terbaik. Untuk memeriksa topologi Anda, lihat Melihat topologi fisik node di cluster GKE.
- Anda hanya dapat memperoleh informasi topologi saat menggunakan VM Spot jika Anda mengonfigurasi penempatan rapat.
Dapatkan kapasitas. Pelajari cara mendapatkan kapasitas untuk opsi pemakaian Anda.
Persyaratan
Untuk membuat cluster GKE yang dioptimalkan untuk AI yang menggunakan G2 atau G4, pastikan Anda memenuhi persyaratan berikut:
- Versi GKE: Mesin G4 (RTX PRO 6000) memerlukan GKE versi 1.32.4-gke.1698000 atau yang lebih baru.
- Driver GPU: node GPU Anda harus menggunakan driver NVIDIA versi 535 atau yang lebih baru.
Batasan
Batasan berikut berlaku untuk G2 dan G4 sebagai seri mesin GPU Umum:
- SSD Lokal: Jenis mesin G2 dan G4 tidak menyertakan disk SSD Lokal secara default. Anda harus melampirkannya secara manual jika diperlukan.
- NCCL Fast Socket: Anda tidak dapat menggunakan NCCL Fast Socket dengan mesin G2 atau G4 di GKE. Meskipun mesin G2 dan G4 mendukung komunikasi multi-node, keduanya menggunakan jaringan VPC standar. Untuk pelatihan terdistribusi skala besar yang memerlukan throughput jaringan maksimum, sebaiknya gunakan seri mesin GPU Bercluster, seperti A3 High atau A3 Mega (yang menggunakan GPUDirect TCPX) atau A3 Ultra dan A4 (yang menggunakan GPUDirect RDMA).
Membuat lingkungan GKE
Anda dapat membuat cluster dalam mode Autopilot atau Standar.
Autopilot
Untuk membuat cluster Autopilot, jalankan perintah berikut:
gcloud container clusters create-auto CLUSTER_NAME \
--region=REGION
Ganti kode berikut:
CLUSTER_NAME: nama cluster Anda.REGION: region untuk cluster Anda.
Standar
Buat cluster Standar dan node pool GPU:
Untuk membuat cluster Standar, jalankan perintah berikut:
gcloud container clusters create CLUSTER_NAME \ --region=REGION \ --enable-ip-aliasGanti kode berikut:
CLUSTER_NAME: nama cluster Anda.REGION: region untuk cluster Anda.
Buat node pool. Setelah membuat cluster, Anda dapat menambahkan node pool dengan G2 atau G4. Untuk workload multi-node yang menggunakan G2 (L4) atau G4 (RTX PRO 6000), sebaiknya gunakan kebijakan penempatan rapat untuk meminimalkan latensi jaringan antar-node.
Untuk membuat node pool, gunakan perintah berikut:
G2 (NVIDIA L4)
gcloud container node-pools create NODE_POOL_NAME \ --cluster=CLUSTER_NAME \ --region=REGION \ --node-locations=ZONE \ --machine-type=MACHINE_TYPE \ --accelerator=type=nvidia-l4,count=AMOUNT,gpu-driver-version=LATEST \ --placement-type=COMPACT \ --scopes="https://www.googleapis.com/auth/cloud-platform" \ --local-ssd-count=LOCAL_SSD_COUNTG4 (NVIDIA RTX PRO 6000)
gcloud container node-pools create NODE_POOL_NAME \ --cluster=CLUSTER_NAME \ --region=REGION \ --node-locations=ZONE \ --machine-type=MACHINE_TYPE \ --accelerator=type=nvidia-rtx-pro-6000,count=AMOUNT,gpu-driver-version=LATEST \ --disk-type=hyperdisk-balanced \ --placement-type=COMPACT \ --scopes="https://www.googleapis.com/auth/cloud-platform" \ --local-ssd-count=LOCAL_SSD_COUNTWorkstation Virtual G4 (vWS)
gcloud container node-pools create NODE_POOL_NAME \ --cluster=CLUSTER_NAME \ --region=REGION \ --node-locations=ZONE \ --machine-type=MACHINE_TYPE \ --accelerator=type=nvidia-rtx-pro-6000-vws,count=AMOUNT,gpu-driver-version=LATEST \ --disk-type=hyperdisk-balanced \ --placement-type=COMPACT \ --scopes="https://www.googleapis.com/auth/cloud-platform" \ --local-ssd-count=LOCAL_SSD_COUNTGanti kode berikut:
NODE_POOL_NAME: nama node pool Anda.CLUSTER_NAME: nama cluster Anda.REGION: region untuk cluster Anda.ZONE: satu atau beberapa zona dalam region Anda yang memiliki GPU yang diminta, misalnya,us-central1-a. Hal ini diperlukan saat menggunakan penempatan rapat.MACHINE_TYPE: jenis mesin untuk node Anda, misalnya,g2-standard-4untuk mesin G2 dang4-standard-48untuk mesin G4.AMOUNT: jumlah GPU yang akan dilampirkan ke setiap node.LOCAL_SSD_COUNT: jumlah volume SSD Lokal yang akan disediakan di setiap node.
Menghubungkan ke cluster Anda
Hubungkan ke cluster Anda agar Anda dapat menjalankan perintah kubectl di bagian berikutnya:
gcloud container clusters get-credentials CLUSTER_NAME \
--region=REGION
Ganti kode berikut:
CLUSTER_NAME: nama cluster Anda.REGION: region untuk cluster Anda.
Untuk mengetahui informasi selengkapnya, lihat Menginstal kubectl dan mengonfigurasi akses cluster.
Mengonfigurasi manifes Pod Anda (khusus Autopilot)
Jika Anda membuat cluster Autopilot, Anda harus memilih GPU yang sesuai dalam manifes Pod agar GKE menyediakan hardware.
Tentukan jenis GPU yang dipilih dan reservasi tertentu menggunakan pemilih node:
spec: nodeSelector: cloud.google.com/gke-accelerator: ACCELERATOR cloud.google.com/gke-gpu-driver-version: latest # Optional: Include if using reserved capacity cloud.google.com/reservation-name: RESERVATION_NAME cloud.google.com/reservation-affinity: "specific"Ganti kode berikut:
ACCELERATOR: akselerator yang Anda pesan. Anda harus menggunakannvidia-l4(untuk G2),nvidia-rtx-pro-6000(untuk G4), ataunvidia-rtx-pro-6000-vws(untuk G4 dengan Workstation Virtual).RESERVATION_NAME: nama reservasi kapasitas Compute Engine. Untuk menggunakan reservasi bersama, atau blok dan sub-blok reservasi tertentu, lihat bagian yang relevan di Menggunakan resource jalur zona yang dipesan.
Tambahkan resource berikut ke container yang meminta GPU:
containers: - name: my-container resources: limits: nvidia.com/gpu: AMOUNTGanti
AMOUNTdengan jumlah GPU yang akan dilampirkan ke setiap node.