Dukungan GPU untuk kumpulan pekerja

Halaman ini menjelaskan konfigurasi GPU untuk workerpool Cloud Run Anda. Google menyediakan GPU NVIDIA RTX PRO 6000 Blackwell dengan memori GPU (VRAM) 96 GB dan GPU NVIDIA L4 dengan memori GPU (VRAM) 24 GB, yang terpisah dari memori instance.

GPU di Cloud Run terkelola sepenuhnya, tanpa memerlukan driver atau library tambahan. Fitur GPU menawarkan ketersediaan on-demand tanpa perlu reservasi, mirip dengan cara kerja CPU on-demand dan memori on-demand di Cloud Run.

Instance Cloud Run dengan GPU NVIDIA RTX PRO 6000 Blackwell atau GPU L4 yang terpasang dengan driver yang telah diinstal sebelumnya akan dimulai dalam waktu sekitar 5 detik, yang pada saat itu proses yang berjalan di container Anda dapat mulai menggunakan GPU.

Anda dapat mengonfigurasi satu GPU per instance Cloud Run. Jika Anda menggunakan container sidecar, perhatikan bahwa GPU hanya dapat dilampirkan ke satu container.

Jenis GPU yang didukung

Cloud Run mendukung dua jenis GPU:

  • GPU NVIDIA RTX PRO 6000 Blackwell dengan versi driver NVIDIA saat ini: 580.x.x (13.0). Untuk GPU NVIDIA RTX PRO 6000 Blackwell, Anda harus menggunakan minimal 20 CPU dan memori sebesar 80 GiB.
  • GPU L4 dengan versi driver NVIDIA saat ini: 580.x.x (13.0). Untuk GPU L4, Anda harus menggunakan minimal 4 CPU dan memori 16 GiB.

Region yang didukung

Wilayah berikut didukung oleh GPU NVIDIA RTX PRO 6000 Blackwell:

  • asia-southeast1 (Singapura).
  • asia-south2 (Delhi, India).
  • europe-west4 (Belanda) ikon daun CO2 Rendah
  • us-central1 (Iowa) ikon daun CO2 Rendah

GPU L4 mendukung region berikut:

  • asia-southeast1 (Singapura)
  • asia-south1 (Mumbai) . Wilayah ini hanya tersedia berdasarkan undangan. Hubungi tim Akun Google Anda jika Anda tertarik dengan wilayah ini.
  • europe-west1 (Belgia) ikon daun CO2 Rendah
  • europe-west4 (Belanda) ikon daun CO2 Rendah
  • us-central1 (Iowa) ikon daun CO2 Rendah . Penskalaan resource tambahan di region ini mungkin memerlukan permintaan penambahan kuota. Hubungi tim Akun Google Anda jika Anda tertarik dengan region ini.
  • us-east4 (Virginia Utara) . Penskalaan resource tambahan di region ini mungkin memerlukan permintaan penambahan kuota. Hubungi tim Akun Google Anda jika Anda tertarik dengan region ini.

Dampak harga

Lihat harga Cloud Run untuk mengetahui detail harga GPU. Perhatikan persyaratan dan pertimbangan berikut:

  • Ada perbedaan biaya antara redundansi zona GPU dan redundansi non-zona. Lihat harga Cloud Run untuk mengetahui detail harga GPU.
  • Pool pekerja GPU tidak dapat diskalakan secara otomatis. Anda tetap dikenakan biaya untuk GPU meskipun GPU tersebut tidak menjalankan proses apa pun, dan selama instance GPU worker pool masih berjalan.
  • Harga CPU dan memori untuk worker pool berbeda dengan harga layanan dan job. Namun, SKU GPU dihargai sama dengan layanan dan pekerjaan.
  • Konfigurasi CPU dan memori resource Anda.
  • GPU ditagih selama seluruh durasi siklus proses instance.

Opsi redundansi zona GPU

Secara default, Cloud Run menyebarkan worker pool Anda ke beberapa zona dalam satu region. Arsitektur ini memberikan ketahanan yang inheren: jika suatu zona mengalami pemadaman layanan, Cloud Run akan otomatis merutekan traffic dari zona yang terpengaruh ke zona yang sehat dalam region yang sama.

Saat menggunakan resource GPU, perlu diingat bahwa resource GPU memiliki batasan kapasitas tertentu. Selama gangguan zona, mekanisme failover standar untuk workload GPU mengandalkan ketersediaan kapasitas GPU yang tidak digunakan dan memadai di zona responsif yang tersisa. Karena sifat GPU yang terbatas, kapasitas ini mungkin tidak selalu tersedia.

Untuk meningkatkan ketersediaan kumpulan pekerja yang dipercepat GPU Anda selama pemadaman zona, Anda dapat mengkonfigurasi redundansi zona secara khusus untuk GPU:

  • Redundansi Zona Diaktifkan (default): Cloud Run memesan kapasitas GPU untuk kumpulan pekerja Anda di beberapa zona. Hal ini secara signifikan meningkatkan kemungkinan bahwa kumpulan pekerja Anda dapat berhasil menangani lalu lintas yang dialihkan dari zona yang terpengaruh, menawarkan keandalan yang lebih tinggi selama kegagalan zona dengan biaya tambahan per detik GPU.

  • Redundansi Zonal Dinonaktifkan: Cloud Run mencoba failover untuk workload GPU dengan upaya terbaik. Traffic hanya dirutekan ke zona lain jika kapasitas GPU yang memadai tersedia pada saat itu. Opsi ini tidak menjamin kapasitas yang dicadangkan untuk skenario failover, tetapi menghasilkan biaya per detik GPU yang lebih rendah.

SLA

SLA untuk Cloud Run GPU bergantung pada apakah worker pool menggunakan redundansi zona atau redundansi non-zona option. Lihat halaman SLA untuk mengetahui detailnya.

Meminta penambahan kuota

Kuota untuk GPU nvidia-rtx-pro-6000 Cloud Run diberikan dalam milliGPU. Project yang menggunakan GPU nvidia-rtx-pro-6000 di suatu region untuk pertama kalinya akan otomatis diberi kuota 3.000 milliGPU (redundansi zona nonaktif) saat deployment pertama dibuat. Hal ini setara dengan 3 GPU. Project yang menggunakan GPU nvidia-l4 Cloud Run di suatu region untuk pertama kalinya akan otomatis diberi kuota 3 GPU (redundansi zona nonaktif) saat deployment pertama dibuat.

Jika Anda memerlukan GPU Cloud Run tambahan, Anda harus meminta peningkatan kuota untuk kumpulan pekerja Cloud Run Anda. Gunakan link yang disediakan di tombol berikut untuk meminta kuota yang Anda butuhkan.

Kuota diperlukan Link kuota
GPU NVIDIA RTX PRO 6000 Blackwell dengan redundansi zona dinonaktifkan (harga lebih rendah) Minta kuota GPU tanpa redundansi zona
GPU NVIDIA RTX PRO 6000 Blackwell dengan redundansi zona diaktifkan (harga lebih tinggi) Meminta kuota GPU dengan redundansi zona
GPU L4 dengan redundansi zonal dinonaktifkan (harga lebih rendah) Minta kuota GPU tanpa redundansi zona
GPU L4 dengan redundansi zona diaktifkan (harga lebih tinggi) Meminta kuota GPU dengan redundansi zona

Untuk mengetahui informasi selengkapnya tentang cara meminta penambahan kuota, lihat Cara menambah kuota.

Sebelum memulai

Daftar berikut menjelaskan persyaratan dan batasan saat menggunakan GPU di Cloud Run:

  1. Login ke akun Google Cloud Anda. Jika Anda baru menggunakan Google Cloud, buat akun untuk mengevaluasi performa produk kami dalam skenario dunia nyata. Pelanggan baru juga mendapatkan kredit gratis senilai $300 untuk menjalankan, menguji, dan men-deploy workload.
  2. In the Google Cloud console, on the project selector page, select or create a Google Cloud project.

    Roles required to select or create a project

    • Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
    • Create a project: To create a project, you need the Project Creator role (roles/resourcemanager.projectCreator), which contains the resourcemanager.projects.create permission. Learn how to grant roles.

    Go to project selector

  3. Verify that billing is enabled for your Google Cloud project.

  4. In the Google Cloud console, on the project selector page, select or create a Google Cloud project.

    Roles required to select or create a project

    • Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
    • Create a project: To create a project, you need the Project Creator role (roles/resourcemanager.projectCreator), which contains the resourcemanager.projects.create permission. Learn how to grant roles.

    Go to project selector

  5. Verify that billing is enabled for your Google Cloud project.

  6. Mengaktifkan Cloud Run API.

    Peran yang diperlukan untuk mengaktifkan API

    Untuk mengaktifkan API, Anda memerlukan izin serviceusage.services.enable. Jika Anda membuat project, kemungkinan Anda sudah memiliki izin ini melalui peran Pemilik (roles/owner). Jika tidak, Anda bisa mendapatkan izin ini melalui peran Admin Penggunaan Layanan (roles/serviceusage.serviceUsageAdmin). Pelajari cara memberikan peran.

    Mengaktifkan API

  7. Minta kuota yang diperlukan.
  8. Lihat Praktik terbaik GPU: Cloud Run worker pool dengan GPU untuk rekomendasi tentang membangun image container Anda dan memuat model berukuran besar.
  9. Pastikan worker pool Cloud Run Anda memiliki konfigurasi berikut:
    • Konfigurasi setelan penagihan ke penagihan berbasis instance. Perlu dicatat bahwa kumpulan pekerja yang diatur ke penagihan berbasis instance masih dapat diskalakan hingga nol.
    • Untuk GPU NVIDIA RTX PRO 6000 Blackwell, konfigurasi minimal 20 CPU dan minimal 80 GiB memori.
    • Untuk GPU L4, konfigurasikan minimal 4 CPU untuk worker pool Anda, dengan rekomendasi 8 CPU, dan minimal 16 GiB memori, dengan rekomendasi 32 GiB.
    • Tentukan dan tetapkan konkurensi maksimum yang optimal untuk penggunaan GPU Anda.

Peran yang diperlukan

Untuk mendapatkan izin yang Anda perlukan untuk mengkonfigurasi dan menerapkan worker pool Cloud Run, mintalah administrator Anda untuk memberikan peran IAM berikut pada worker pool:

  • Cloud Run Developer (roles/run.developer) - kumpulan pekerja Cloud Run
  • Pengguna Akun Layanan (roles/iam.serviceAccountUser) - identitas layanan

Untuk mengetahui daftar peran dan izin IAM yang terkait dengan Cloud Run, lihat Peran IAM Cloud Run dan Izin IAM Cloud Run. Jika kumpulan worker Cloud Run Anda berinteraksi dengan APIGoogle Cloud , seperti Library Klien Cloud, lihat panduan konfigurasi identitas layanan. Untuk mengetahui informasi selengkapnya tentang cara memberikan peran, lihat izin deployment dan mengelola akses.

Konfigurasikan kumpulan pekerja Cloud Run dengan GPU.

Setiap perubahan konfigurasi akan menghasilkan revisi baru. Revisi selanjutnya juga akan otomatis mendapatkan setelan konfigurasi ini, kecuali jika Anda melakukan pembaruan eksplisit untuk mengubahnya.

Anda dapat menggunakan Google Cloud konsol, Google Cloud CLI, atau YAML untuk mengonfigurasi GPU.

Konsol

  1. Di konsol Google Cloud , buka Cloud Run:

    Buka Cloud Run

  2. Pilih Worker Pools dari menu navigasi Cloud Run, dan klik Deploy container untuk mengkonfigurasi worker pool baru. Jika Anda mengonfigurasi pool worker yang ada, klik pool worker, lalu klik Edit dan deploy revisi baru.

  3. Jika Anda mengkonfigurasi worker pool baru, isi halaman pengaturan worker pool awal, lalu klik Kontainer, Jaringan, Keamanan untuk membuka halaman konfigurasi worker pool.

  4. Klik tab Containers.

    gambar

    • Konfigurasikan CPU, memori, konkurensi, lingkungan eksekusi, dan probe startup mengikuti rekomendasi di Sebelum Anda mulai
    • Centang kotak centang GPU, lalu pilih tipe GPU dari menu Tipe GPU, dan jumlah GPU dari menu Jumlah GPU.
    • Secara default, redundansi zona diaktifkan. Untuk mengubah pengaturan saat ini, pilih kotak centang GPU untuk menampilkan opsi redundansi GPU.
      • Pilih Tidak ada redundansi zona untuk menonaktifkan redundansi zona
      • Pilih Redundansi zonat untuk mengaktifkan redundansi zonat.
  5. Klik Buat atau Deploy.

gcloud

Untuk membuat worker pool yang mendukung GPU, gunakangcloud run worker-pools deploy memerintah:

  gcloud run worker-pools deploy WORKER_POOL \
    --image IMAGE_URL \
    --gpu 1

Ganti kode berikut:

  • WORKER_POOL: nama kumpulan pekerja Cloud Run Anda.
  • IMAGE_URL: referensi ke image container yang berisi kumpulan pekerja, seperti us-docker.pkg.dev/cloudrun/container/worker-pool:latest.

Untuk memperbarui konfigurasi GPU untuk kumpulan pekerja, gunakangcloud run worker-pools update memerintah:

  gcloud run worker-pools update WORKER_POOL \
    --image IMAGE_URL \
    --cpu CPU \
    --memory MEMORY \
    --gpu GPU_NUMBER \
    --gpu-type GPU_TYPE \
    --GPU_ZONAL_REDUNDANCY
    

Ganti kode berikut:

  • WORKER_POOL: nama kumpulan pekerja Cloud Run Anda.
  • IMAGE_URL: referensi ke image container yang berisi kumpulan pekerja, seperti us-docker.pkg.dev/cloudrun/container/worker-pool:latest.
  • CPU: jumlah CPU. Untuk GPU NVIDIA RTX PRO 6000 Blackwell, Anda harus menentukan minimal 20 CPU. Untuk GPU NVIDIA L4, Anda harus menentukan setidaknya 4 CPU.
  • MEMORY: jumlah memori. Untuk GPU NVIDIA RTX PRO 6000 Blackwell, Anda harus menentukan minimal 80Gi (80 GiB). Untuk GPU NVIDIA L4, Anda harus menentukan minimal 16Gi (16 GiB).
  • GPU_NUMBER: nilai 1 (satu). Jika tidak ditentukan, tetapi GPU_TYPE ada, defaultnya adalah 1.
  • GPU_TYPE: jenis GPU. GPU NVIDIA RTX PRO 6000 Blackwell, masukkan nvidia-rtx-pro-6000. Untuk GPU L4, masukkan nilai nvidia-l4 (nvidia-L4 huruf L kecil, bukan nilai numerik empat belas).
  • GPU_ZONAL_REDUNDANCY: no-gpu-zonal-redundancy untuk menonaktifkan redundansi zona, atau gpu-zonal-redundancy untuk mengaktifkan redundansi zona.

YAML

  1. Jika Anda membuat kumpulan pekerja baru, lewati langkah ini. Jika Anda memperbarui kumpulan pekerja yang ada, download konfigurasi YAML-nya:

    gcloud run worker-pools describe WORKER_POOL --format export > worker-pool.yaml
  2. Perbarui atribut nvidia.com/gpu: dan nodeSelector:
    run.googleapis.com/accelerator:
    :

    apiVersion: run.googleapis.com/v1
    kind: WorkerPool
    metadata:
      name: WORKER_POOL
    spec:
      template:
        metadata:
          annotations:
            run.googleapis.com/gpu-zonal-redundancy-disabled: 'GPU_ZONAL_REDUNDANCY'
        spec:
          containers:
          - image: IMAGE_URL
            resources:
              limits:
                cpu: 'CPU'
                memory: 'MEMORY'
                nvidia.com/gpu: '1'
          nodeSelector:
            run.googleapis.com/accelerator: GPU_TYPE

    Ganti kode berikut:

    • WORKER_POOL: nama kumpulan pekerja Cloud Run Anda.
    • IMAGE_URL: referensi ke image container yang berisi kumpulan pekerja, seperti us-docker.pkg.dev/cloudrun/container/worker-pool:latest.
    • CPU: jumlah CPU. Untuk GPU NVIDIA RTX PRO 6000 Blackwell, Anda harus menentukan minimal 20 CPU. Untuk GPU L4, Anda harus menentukan setidaknya 4 CPU.
    • MEMORY: jumlah memori. Untuk GPU NVIDIA RTX PRO 6000 Blackwell, Anda harus menentukan minimal 80Gi (80 GiB). Untuk GPU L4, Anda harus menentukan minimal 16Gi (16 GiB).
    • GPU_TYPE: jenis GPU. Untuk GPU NVIDIA RTX PRO 6000 Blackwell, masukkan nvidia-rtx-pro-6000. Untuk GPU L4, masukkan nilai nvidia-l4 (nvidia-L4 huruf L kecil, bukan nilai numerik empat belas).
    • GPU_ZONAL_REDUNDANCY: false untuk mengaktifkan redundansi zonal GPU, atau true untuk menonaktifkannya.
  3. Buat atau update kumpulan pekerja menggunakan perintah berikut:

    gcloud run worker-pools replace worker-pool.yaml

    Perintah gcloud run worker-pools replace secara default akan menggunakan file worker-pool.yaml jika ada.

Terraform

Untuk mempelajari cara menerapkan atau menghapus konfigurasi Terraform, lihat Perintah dasar Terraform.

resource "google_cloud_run_v2_worker_pool" "default" {
  provider = google-beta
  name     = "WORKER_POOL"
  location = "REGION"

  template {
    gpu_zonal_redundancy_disabled = "GPU_ZONAL_REDUNDANCY"
    containers {
      image = "IMAGE_URL"
      resources {
        limits = {
          "cpu" = "CPU"
          "memory" = "MEMORY"
          "nvidia.com/gpu" = "1"
        }
      }
    }
    node_selector {
      accelerator = "GPU_TYPE"
    }
  }
}

Ganti kode berikut:

  • WORKER_POOL: nama kumpulan pekerja Cloud Run Anda.
  • GPU_ZONAL_REDUNDANCY: false untuk mengaktifkan redundansi zonal GPU, atau true untuk menonaktifkannya.
  • IMAGE_URL: referensi ke image container yang berisi kumpulan pekerja, seperti us-docker.pkg.dev/cloudrun/container/worker-pool:latest.
  • CPU: jumlah CPU. Untuk GPU NVIDIA RTX PRO 6000 Blackwell, Anda harus menentukan minimal 20 CPU. Untuk GPU NVIDIA L4, Anda harus menentukan setidaknya 4 CPU.
  • MEMORY: jumlah memori. Untuk GPU NVIDIA RTX PRO 6000 Blackwell, Anda harus menentukan minimal 80Gi (80 GiB). Untuk GPU NVIDIA L4, Anda harus menentukan minimal 16Gi (16 GiB).
  • GPU_TYPE: jenis GPU. GPU NVIDIA RTX PRO 6000 Blackwell, masukkan nvidia-rtx-pro-6000. Untuk GPU L4, masukkan nilai nvidia-l4 (nvidia-L4 huruf L kecil, bukan nilai numerik empat belas).

Melihat setelan GPU

Untuk melihat pengaturan GPU saat ini untuk kumpulan pekerja Cloud Run Anda:

Konsol

  1. Di konsol Google Cloud , buka halaman kumpulan pekerja Cloud Run:

    Buka kumpulan pekerja Cloud Run

  2. Klik kumpulan pekerja yang Anda minati untuk membuka halaman Detail kumpulan pekerja.

  3. Klik Edit dan deploy revisi baru.

  4. Cari pengaturan GPU di detail konfigurasi.

gcloud

  1. Gunakan perintah berikut:

    gcloud run worker-pools describe WORKER_POOL
  2. Temukan setelan GPU dalam konfigurasi yang ditampilkan.

Menghapus GPU

Anda dapat menghapus GPU menggunakan Google Cloud konsol, Google Cloud CLI, atau YAML.

Konsol

  1. Di konsol Google Cloud , buka Cloud Run:

    Buka Cloud Run

  2. Pilih Worker Pools dari menu navigasi Cloud Run, dan klik Deploy container untuk mengkonfigurasi worker pool baru. Jika Anda mengonfigurasi pool worker yang ada, klik pool worker, lalu klik Edit dan deploy revisi baru.

  3. Jika Anda mengkonfigurasi worker pool baru, isi halaman pengaturan worker pool awal, lalu klik Kontainer, Jaringan, Keamanan untuk membuka halaman konfigurasi worker pool.

  4. Klik tab Containers.

gambar

  • Hapus centang pada kotak centang GPU.
  1. Klik Buat atau Deploy.

gcloud

Untuk menghapus GPU, atur jumlah GPU menjadi 0:

  gcloud run worker-pools update WORKER_POOL --gpu 0
  

Ganti WORKER_POOL dengan nama worker pool Cloud Run Anda.

YAML

  1. Jika Anda membuat kumpulan pekerja baru, lewati langkah ini. Jika Anda memperbarui kumpulan pekerja yang ada, download konfigurasi YAML-nya:

    gcloud run worker-pools describe WORKER_POOL --format export > worker-pool.yaml
  2. Hapus baris nvidia.com/gpu: dan nodeSelector: run.googleapis.com/accelerator: GPU_TYPE.

  3. Buat atau update kumpulan pekerja menggunakan perintah berikut:

    gcloud run worker-pools replace worker-pool.yaml

    Perintah gcloud run worker-pools replace secara default akan menggunakan file worker-pool.yaml jika ada.

Library driver

Secara default, semua library driver GPU NVIDIA RTX PRO 6000 Blackwell dan GPU NVIDIA L4 dipasang di /usr/local/nvidia/lib64. Cloud Run secara otomatis menambahkan jalur ini ke variabel lingkungan LD_LIBRARY_PATH (yaitu ${LD_LIBRARY_PATH}:/usr/local/nvidia/lib64) container dengan GPU. Hal ini memungkinkan linker dinamis menemukan library driver NVIDIA. Linker menelusuri dan menyelesaikan jalur dalam urutan yang Anda cantumkan dalam variabel lingkungan LD_LIBRARY_PATH. Setiap nilai yang Anda tentukan dalam variabel ini akan lebih diprioritaskan daripada jalur library driver Cloud Run default /usr/local/nvidia/lib64.

Jika Anda ingin menggunakan CUDA versi yang lebih baru dari 13.0, cara termudah adalah dengan mengandalkan image dasar NVIDIA yang lebih baru dengan paket kompatibilitas ke depan yang sudah diinstal. Opsi lainnya adalah menginstal paket kompatibilitas penerusan NVIDIA secara manual dan menambahkannya ke LD_LIBRARY_PATH. Lihat matriks kompatibilitas NVIDIA untuk menentukan versi CUDA mana yang kompatibel ke depan dengan versi driver NVIDIA yang diberikan.