Halaman ini menjelaskan konfigurasi GPU untuk layanan Cloud Run Anda. GPU bekerja dengan baik untuk beban kerja inferensi AI, seperti model bahasa besar (LLM) atau kasus penggunaan non-AI intensif komputasi lainnya seperti transcoding video dan rendering 3D. Google menyediakan GPU NVIDIA RTX PRO 6000 Blackwell dengan memori GPU (VRAM) 96 GB dan GPU NVIDIA L4 dengan memori GPU (VRAM) 24 GB, yang terpisah dari memori instance.
GPU di Cloud Run terkelola sepenuhnya, tanpa memerlukan driver atau library tambahan. Fitur GPU menawarkan ketersediaan on-demand tanpa perlu reservasi, mirip dengan cara kerja CPU on-demand dan memori on-demand di Cloud Run. Instance layanan Cloud Run yang telah dikonfigurasi untuk menggunakan GPU dapat diperkecil skalanya hingga nol untuk penghematan biaya saat tidak digunakan.
Instance Cloud Run dengan GPU NVIDIA RTX PRO 6000 Blackwell atau GPU L4 yang terpasang dengan driver yang telah diinstal sebelumnya akan dimulai dalam waktu sekitar 5 detik, yang pada saat itu proses yang berjalan di container Anda dapat mulai menggunakan GPU.
Anda dapat mengonfigurasi satu GPU per instance Cloud Run. Jika Anda menggunakan container sidecar, perhatikan bahwa GPU hanya dapat dilampirkan ke satu container.
Jenis GPU yang didukung
Cloud Run mendukung dua jenis GPU:
- GPU NVIDIA RTX PRO 6000 Blackwell dengan versi driver NVIDIA saat ini: 580.xx (13.0). Untuk GPU NVIDIA RTX PRO 6000 Blackwell, Anda harus menggunakan minimal 20 CPU dan memori sebesar 80 GiB.
- GPU L4 dengan versi driver NVIDIA saat ini: 580.x.x (13.0). Untuk GPU L4, Anda harus menggunakan minimal 4 CPU dan memori 16 GiB.
Region yang didukung
GPU NVIDIA RTX PRO 6000 Blackwell mendukung wilayah-wilayah berikut:
asia-southeast1(Singapura).asia-south2(Delhi, India).europe-west4(Belanda)CO2 Rendah
us-central1(Iowa)CO2 Rendah
GPU L4 mendukung region berikut:
asia-southeast1(Singapura)asia-south1(Mumbai) . Wilayah ini hanya tersedia melalui undangan. Hubungi tim Akun Google Anda jika Anda tertarik dengan wilayah ini.europe-west1(Belgia)CO2 Rendah
europe-west4(Belanda)CO2 Rendah
us-central1(Iowa)Rendah CO2 . Penambahan kapasitas sumber daya di wilayah ini mungkin memerlukan permintaan peningkatan kuota. Hubungi tim Akun Google Anda jika Anda tertarik dengan wilayah ini.
us-east4(Virginia Utara) . Penskalaan resource tambahan di region ini mungkin memerlukan permintaan penambahan kuota. Hubungi tim Akun Google Anda jika Anda tertarik dengan region ini.
Dampak harga
Lihat harga Cloud Run untuk mengetahui detail harga GPU. Perhatikan persyaratan dan pertimbangan berikut:
- Tidak ada biaya per permintaan. Anda harus menggunakan penagihan berbasis instance untuk menggunakan fitur GPU. Instance minimum ditagih dengan tarif penuh meskipun sedang tidak digunakan.
- Ada perbedaan biaya antara redundansi zona GPU dan redundansi non-zona. Lihat harga Cloud Run untuk mengetahui detail harga GPU.
- Saat Anda menerapkan layanan atau fungsi Cloud Run dari kode sumber dengan GPU diaktifkan, Cloud Run menggunakan tipe mesin
e2-highcpu-8, bukan tipe mesine2-standard-2default untuk membangun kode sumber Anda. Jenis mesin yang lebih besar memberikan dukungan CPU yang lebih tinggi, dan bandwidth jaringan yang lebih tinggi sehingga menghasilkan waktu build yang lebih cepat. - Konfigurasi CPU dan memori resource Anda.
- GPU ditagih untuk seluruh durasi siklus hidup instance.
Opsi redundansi zona GPU
Secara default, Cloud Run akan menyebarkan layanan Anda ke beberapa zona dalam satu wilayah. Arsitektur ini memberikan ketahanan yang inheren: jika suatu zona mengalami pemadaman layanan, Cloud Run akan otomatis merutekan traffic dari zona yang terpengaruh ke zona yang sehat dalam region yang sama.
Saat menggunakan sumber daya GPU, perlu diingat bahwa sumber daya GPU memiliki batasan kapasitas tertentu. Selama gangguan zona, mekanisme failover standar untuk workload GPU mengandalkan ketersediaan kapasitas GPU yang tidak digunakan dan memadai di zona responsif yang tersisa. Karena sifat GPU yang terbatas, kapasitas ini mungkin tidak selalu tersedia.
Untuk meningkatkan ketersediaan layanan yang dipercepat GPU selama gangguan zona, Anda dapat mengonfigurasi redundansi zona khusus untuk GPU:
Redundansi Zona Diaktifkan (default): Cloud Run mencadangkan kapasitas GPU untuk layanan Anda di beberapa zona. Hal ini secara signifikan meningkatkan probabilitas layanan Anda dapat berhasil menangani traffic yang dialihkan dari zona yang terpengaruh, sehingga menawarkan keandalan yang lebih tinggi selama kegagalan zona dengan biaya tambahan per detik GPU.
Redundansi Zona Dimatikan: Cloud Run mencoba melakukan failover untuk beban kerja GPU dengan upaya terbaik. Traffic hanya dirutekan ke zona lain jika kapasitas GPU yang memadai tersedia pada saat itu. Opsi ini tidak menjamin kapasitas yang dicadangkan untuk skenario failover, tetapi menghasilkan biaya per detik GPU yang lebih rendah.
SLA
SLA untuk Cloud Run GPU bergantung pada apakah layanan tersebut menggunakan redundansi zona atau redundansi non-zona option. Lihat halaman SLA untuk detailnya.
Meminta penambahan kuota
Kuota untuk GPU nvidia-rtx-pro-6000 Cloud Run diberikan dalam milliGPU.
Proyek yang menggunakan GPU nvidia-rtx-pro-6000 di suatu wilayah untuk pertama kalinya akan secara otomatis diberikan kuota 3.000 milliGPU (redundansi zona dimatikan) saat penyebaran pertama dibuat. Ini setara dengan 3 GPU. Proyek yang menggunakan GPU Cloud Run nvidia-l4 di suatu wilayah untuk pertama kalinya secara otomatis diberikan kuota 3 GPU (redundansi zona dimatikan) saat penyebaran pertama dibuat.
Jika Anda memerlukan GPU Cloud Run tambahan, Anda harus meminta peningkatan kuota untuk layanan Cloud Run Anda. Gunakan link yang disediakan di tombol berikut untuk meminta kuota yang Anda butuhkan.
| Kuota diperlukan | Tautan kuota |
|---|---|
| GPU NVIDIA RTX PRO 6000 Blackwell dengan redundansi zona dimatikan (harga lebih rendah) | Minta kuota GPU tanpa redundansi zona |
| GPU NVIDIA RTX PRO 6000 Blackwell dengan redundansi zona diaktifkan (harga lebih tinggi) | Minta kuota GPU dengan redundansi zona |
| GPU L4 dengan redundansi zonal dinonaktifkan (harga lebih rendah) | Minta kuota GPU tanpa redundansi zona |
| GPU L4 dengan redundansi zona diaktifkan (harga lebih tinggi) | Minta kuota GPU dengan redundansi zona |
Untuk mengetahui informasi selengkapnya tentang cara meminta penambahan kuota, lihat Cara menambah kuota.
Sebelum memulai
Daftar berikut menjelaskan persyaratan dan batasan saat menggunakan GPU di Cloud Run:
- Login ke akun Google Cloud Anda. Jika Anda baru menggunakan Google Cloud, buat akun untuk mengevaluasi performa produk kami dalam skenario dunia nyata. Pelanggan baru juga mendapatkan kredit gratis senilai $300 untuk menjalankan, menguji, dan men-deploy workload.
-
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
Verify that billing is enabled for your Google Cloud project.
-
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
Verify that billing is enabled for your Google Cloud project.
Mengaktifkan Cloud Run API.
Peran yang diperlukan untuk mengaktifkan API
Untuk mengaktifkan API, Anda memerlukan izin
serviceusage.services.enable. Jika Anda membuat project, kemungkinan Anda sudah memiliki izin ini melalui peran Pemilik (roles/owner). Jika tidak, Anda bisa mendapatkan izin ini melalui peran Admin Penggunaan Layanan (roles/serviceusage.serviceUsageAdmin). Pelajari cara memberikan peran.- Minta kuota yang diperlukan.
- Lihat Praktik terbaik: Inferensi AI di Cloud Run dengan GPU untuk rekomendasi tentang membangun citra kontainer Anda dan memuat model besar.
- Pastikan layanan Cloud Run Anda memiliki konfigurasi berikut:
- Konfigurasi setelan penagihan ke penagihan berbasis instance. Perlu dicatat bahwa layanan yang diatur ke penagihan berbasis instance masih dapat diskalakan hingga nol.
- Untuk GPU NVIDIA RTX PRO 6000 Blackwell, konfigurasi minimal 20 CPU dan minimal 80 GiB memori.
- Untuk GPU L4, konfigurasikan minimal 4 CPU untuk layanan Anda, dengan rekomendasi 8 CPU, dan minimal 16 GiB memori, dengan rekomendasi 32 GiB.
- Tentukan dan tetapkan konkurensi maksimum yang optimal untuk penggunaan GPU Anda.
- Jumlah maksimum instance harus ditetapkan ke angka yang lebih rendah daripada kuota yang diizinkan per project per region untuk GPU. Lihat Tentang GPU dan jumlah instance maksimum.
Peran yang diperlukan
Untuk mendapatkan izin yang Anda perlukan untuk mengkonfigurasi dan menyebarkan layanan Cloud Run, mintalah administrator Anda untuk memberikan peran IAM berikut pada layanan tersebut:
- Cloud Run Developer (
roles/run.developer) - layanan Cloud Run - Pengguna Akun Layanan (
roles/iam.serviceAccountUser) - identitas layanan
Jika Anda menyebarkan service atau function dari kode sumber, Anda juga harus memiliki peran tambahan yang diberikan kepada Anda pada proyek dan akun layanan Cloud Build Anda.
Untuk mengetahui daftar peran dan izin IAM yang terkait dengan Cloud Run, lihat Peran IAM Cloud Run dan Izin IAM Cloud Run. Jika layanan Cloud Run Anda berinteraksi dengan Google Cloud API, seperti Library Klien Cloud, lihat panduan konfigurasi identitas layanan. Untuk mengetahui informasi selengkapnya tentang cara memberikan peran, lihat izin deployment dan mengelola akses.
Mengonfigurasi layanan Cloud Run dengan GPU
Setiap perubahan konfigurasi akan menghasilkan revisi baru. Revisi selanjutnya juga akan otomatis mendapatkan setelan konfigurasi ini, kecuali jika Anda melakukan pembaruan eksplisit untuk mengubahnya.
Anda dapat menggunakan Google Cloud Gunakan konsol, Google Cloud CLI, atau YAML untuk mengkonfigurasi GPU.
Konsol
Di konsol Google Cloud , buka Cloud Run:
Pilih Layanan dari menu navigasi Cloud Run, dan klik Sebarkan kontainer untuk mengkonfigurasi layanan baru. Jika Anda mengkonfigurasi layanan yang sudah ada, klik layanan tersebut.
Jika Anda mengkonfigurasi layanan baru, isi halaman pengaturan layanan awal, lalu klik Kontainer, Jaringan, Keamanan untuk membuka halaman konfigurasi layanan.
Klik tab Containers.
Konfigurasi CPU, memori, konkurensi, lingkungan eksekusi, dan pemeriksaan startup dengan mengikuti rekomendasi di Sebelum memulai.
Centang kotak centang GPU, lalu pilih Jenis GPU dan Jumlah GPU dari menu masing-masing.
Secara default, redundansi zonal diaktifkan untuk layanan baru. Memilih kotak centang GPU akan menampilkan opsi redundansi GPU.
- Untuk menonaktifkan redundansi zonal, pilih Tidak ada redundansi zonal.
- Untuk mengaktifkan redundansi zona, pilih Redundansi zona.
Klik Create untuk layanan baru. Klik View diff & redeploy, lalu Deploy changes untuk layanan yang ada.
gcloud
Untuk membuat layanan dengan GPU yang diaktifkan, gunakan perintah
gcloud run deploy:
Untuk men-deploy container:
gcloud run deploy SERVICE \ --image IMAGE_URL \ --gpu 1
Ganti kode berikut:
- SERVICE: nama layanan Cloud Run Anda.
IMAGE_URL: referensi ke image container, misalnya,us-docker.pkg.dev/cloudrun/container/hello:latest. Jika Anda menggunakan Artifact Registry, repositori REPO_NAME harus sudah dibuat. URL mengikuti formatLOCATION-docker.pkg.dev/PROJECT_ID/REPO_NAME/PATH:TAG.
Untuk men-deploy dari kode sumber:
gcloud run deploy SERVICE \ --source . \ --gpu 1
Untuk memperbarui konfigurasi GPU untuk layanan, gunakan perintah
gcloud run services update. Sebagai contoh, untuk memperbarui layanan yang sudah ada yang menentukan citra kontainer:
gcloud run services update SERVICE \ --image IMAGE_URL \ --cpu CPU \ --memory MEMORY \ --no-cpu-throttling \ --gpu GPU_NUMBER \ --gpu-type GPU_TYPE \ --max-instances MAX_INSTANCE --GPU_ZONAL_REDUNDANCY
Ganti kode berikut:
- SERVICE: nama layanan Cloud Run Anda.
IMAGE_URL: referensi ke image container, misalnya,us-docker.pkg.dev/cloudrun/container/hello:latest. Jika Anda menggunakan Artifact Registry, repositori REPO_NAME harus sudah dibuat. URL mengikuti formatLOCATION-docker.pkg.dev/PROJECT_ID/REPO_NAME/PATH:TAG.- CPU: jumlah CPU. Untuk GPU NVIDIA RTX PRO 6000 Blackwell, Anda harus menentukan minimal
20CPU. Untuk GPU L4, Anda harus menentukan setidaknya4CPU. - MEMORY: jumlah memori. Untuk GPU NVIDIA RTX PRO 6000
Blackwell, Anda harus menentukan minimal
80Gi(80 GiB). Untuk GPU L4, Anda harus menentukan minimal16Gi(16 GiB). - GPU_NUMBER: nilai
1(satu). Jika tidak ditentukan, tetapi GPU_TYPE ada, defaultnya adalah1. - GPU_TYPE: jenis GPU. GPU NVIDIA RTX PRO 6000 Blackwell,
masukkan
nvidia-rtx-pro-6000. Untuk GPU L4, masukkan nilainvidia-l4(nvidia-L4 huruf L kecil, bukan nilai numerik empat belas). - MAX_INSTANCE: jumlah maksimum instance. Angka ini tidak boleh melebihiKuota GPU dialokasikan untuk proyek Anda.
- GPU_ZONAL_REDUNDANCY:
no-gpu-zonal-redundancyuntuk mematikan redundansi zona, ataugpu-zonal-redundancyuntuk menghidupkan redundansi zona.
YAML
Jika Anda membuat layanan baru, lewati langkah ini. Jika Anda mengupdate layanan yang sudah ada, download konfigurasi YAML-nya:
gcloud run services describe SERVICE --format export > service.yaml
Perbarui atribut
nvidia.com/gpu:dannodeSelector::
run.googleapis.com/accelerator:apiVersion: serving.knative.dev/v1 kind: Service metadata: name: SERVICE spec: template: metadata: annotations: autoscaling.knative.dev/maxScale: 'MAX_INSTANCE' run.googleapis.com/cpu-throttling: 'false' run.googleapis.com/gpu-zonal-redundancy-disabled: 'GPU_ZONAL_REDUNDANCY' spec: containers: - image: IMAGE_URL ports: - containerPort: CONTAINER_PORT name: http1 resources: limits: cpu: 'CPU' memory: 'MEMORY' nvidia.com/gpu: '1' # Optional: use a longer startup probe to allow long starting containers startupProbe: failureThreshold: 1800 periodSeconds: 1 tcpSocket: port: CONTAINER_PORT timeoutSeconds: 1 nodeSelector: run.googleapis.com/accelerator: GPU_TYPE
Ganti kode berikut:
- SERVICE: nama layanan Cloud Run Anda.
IMAGE_URL: referensi ke image container, misalnya,us-docker.pkg.dev/cloudrun/container/hello:latest. Jika Anda menggunakan Artifact Registry, repositori REPO_NAME harus sudah dibuat. URL mengikuti formatLOCATION-docker.pkg.dev/PROJECT_ID/REPO_NAME/PATH:TAG.- CONTAINER_PORT: port kontainer yang ditetapkan untuk layanan Anda.
- CPU: jumlah CPU. Untuk GPU NVIDIA RTX PRO 6000 Blackwell, Anda harus menentukan minimal
20CPU. Untuk GPU L4, Anda harus menentukan minimal4CPU. - MEMORY: jumlah memori. Untuk GPU NVIDIA RTX PRO 6000
Blackwell, Anda harus menentukan minimal
80Gi(80 GiB). Untuk GPU L4, Anda harus menentukan minimal16Gi(16 GiB). - GPU_TYPE: jenis GPU. GPU NVIDIA RTX PRO 6000 Blackwell,
masukkan
nvidia-rtx-pro-6000. Untuk GPU L4, masukkan nilainvidia-l4(nvidia-L4 huruf L kecil, bukan nilai numerik empat belas). - MAX_INSTANCE: jumlah maksimum instance. Angka ini tidak boleh melebihiKuota GPU dialokasikan untuk proyek Anda.
- GPU_ZONAL_REDUNDANCY:
falseuntuk mengaktifkan redundansi zonal GPU, atautrueuntuk menonaktifkannya.
Buat atau update layanan menggunakan perintah berikut:
gcloud run services replace service.yaml
Perintah
gcloud run services replacesecara default akan menggunakan fileservice.yamljika ada.
Terraform
Untuk mempelajari cara menerapkan atau menghapus konfigurasi Terraform, lihat Perintah dasar Terraform.
Tambahkan kode berikut ke resourcegoogle_cloud_run_v2_service
di konfigurasi Terraform Anda:resource "google_cloud_run_v2_service" "default" {
provider = google-beta
name = "SERVICE"
location = "europe-west1"
template {
gpu_zonal_redundancy_disabled = "GPU_ZONAL_REDUNDANCY"
containers {
image = "IMAGE_URL"
resources {
limits = {
"cpu" = "CPU"
"memory" = "MEMORY"
"nvidia.com/gpu" = "1"
}
}
}
node_selector {
accelerator = "GPU_TYPE"
}
}
}
Ganti kode berikut:
- SERVICE: nama layanan Cloud Run Anda.
- GPU_ZONAL_REDUNDANCY:
falseuntuk mengaktifkan redundansi zonal GPU, atautrueuntuk menonaktifkannya. IMAGE_URL: referensi ke image container, misalnya,us-docker.pkg.dev/cloudrun/container/hello:latest. Jika Anda menggunakan Artifact Registry, repositori REPO_NAME harus sudah dibuat. URL mengikuti formatLOCATION-docker.pkg.dev/PROJECT_ID/REPO_NAME/PATH:TAG.- CPU: jumlah CPU. Untuk GPU NVIDIA RTX PRO 6000 Blackwell, Anda harus menentukan minimal
20CPU. Untuk GPU L4, Anda harus menentukan setidaknya4CPU. - MEMORY: jumlah memori. Untuk GPU NVIDIA RTX PRO 6000 Blackwell, Anda harus menentukan
setidaknya
80Gi(80 GiB). Untuk GPU L4, Anda harus menentukan setidaknya16Gi(16 GiB). - GPU_TYPE: jenis GPU. Untuk GPU NVIDIA RTX PRO 6000 Blackwell,
masukkan
nvidia-rtx-pro-6000. Untuk GPU L4, masukkan nilainvidia-l4(nvidia-L4 huruf L kecil, bukan nilai numerik empat belas).
Lihat pengaturan GPU
Untuk melihat pengaturan GPU saat ini untuk layanan Cloud Run Anda:
Konsol
Di konsol Google Cloud , buka halaman Services Cloud Run:
Klik layanan yang Anda minati untuk membuka halaman Detail layanan.
Klik tab Kontainer untuk melihat pengaturan.
gcloud
Gunakan perintah berikut:
gcloud run services describe SERVICE
Temukan setelan GPU dalam konfigurasi yang ditampilkan.
Menghapus GPU
Anda dapat menghapus GPU menggunakan Google Cloud konsol, Google Cloud CLI, atau YAML.
Konsol
Di konsol Google Cloud , buka Cloud Run:
Pilih Layanan dari menu navigasi Cloud Run, dan klik Sebarkan kontainer untuk mengkonfigurasi layanan baru. Jika Anda mengonfigurasi layanan yang ada, klik layanan tersebut.
Jika Anda mengkonfigurasi layanan baru, isi halaman pengaturan layanan awal, lalu klik Kontainer, Jaringan, Keamanan untuk membuka halaman konfigurasi layanan.
Klik tab Containers.
Batalkan pilihan pada kotak centang GPU.
Klik Create untuk layanan baru. Klik View diff & redeploy, lalu Deploy changes untuk layanan yang ada.
gcloud
Untuk menghapus GPU, atur jumlah GPU menjadi 0 menggunakan perintah gcloud run services update:
gcloud run services update SERVICE --gpu 0
Ganti SERVICE dengan nama layanan Cloud Run Anda.
YAML
Jika Anda membuat layanan baru, lewati langkah ini. Jika Anda mengupdate layanan yang sudah ada, download konfigurasi YAML-nya:
gcloud run services describe SERVICE --format export > service.yaml
Hapus baris
nvidia.com/gpu:dannodeSelector: run.googleapis.com/accelerator: GPU_TYPE.Buat atau update layanan menggunakan perintah berikut:
gcloud run services replace service.yaml
Perintah
gcloud run services replacesecara default akan menggunakan fileservice.yamljika ada.
Pustaka driver
Secara default, semua library driver GPU NVIDIA RTX PRO 6000 Blackwell dan GPU NVIDIA L4 dipasang di /usr/local/nvidia/lib64. Cloud Run secara otomatis menambahkan jalur ini ke variabel lingkungan LD_LIBRARY_PATH (yaitu ${LD_LIBRARY_PATH}:/usr/local/nvidia/lib64) dari kontainer dengan GPU. Hal ini memungkinkan linker dinamis menemukan library driver NVIDIA. Linker menelusuri dan menyelesaikan jalur dalam urutan yang Anda cantumkan dalam variabel lingkungan LD_LIBRARY_PATH. Setiap nilai yang Anda tentukan dalam variabel ini akan lebih diprioritaskan daripada jalur library driver Cloud Run default /usr/local/nvidia/lib64.
Jika Anda ingin menggunakan versi CUDA yang lebih tinggi dari 13.0, cara termudah adalah dengan bergantung pada citra dasar NVIDIA yang lebih baru dengan paket kompatibilitas ke depan yang sudah terpasang. Opsi lainnya adalah secara manual.instal paket kompatibilitas maju NVIDIA dan menambahkannya keLD_LIBRARY_PATH . Lihat matriks kompatibilitas NVIDIA
untuk menentukan versi CUDA mana yang kompatibel ke depan dengan versi driver NVIDIA yang diberikan.
Tentang GPU dan jumlah instance maksimum
Jumlah instance dengan GPU dibatasi dalam dua cara:
- Setelan Instance maksimum membatasi jumlah instance per layanan. Nilai ini tidak boleh lebih tinggi daripada kuota GPU per project per region untuk GPU.
- Kuota GPU yang diizinkan per project per region. Hal ini membatasi jumlah instance di seluruh layanan di region yang sama.
Langkah berikutnya
Lihat Menjalankan inferensi AI di Cloud Run dengan GPU untuk melihat tutorial.