Halaman ini menjelaskan teknik yang tersedia yang dapat Anda gunakan untuk mendapatkan akselerator komputasi, seperti GPU atau TPU, berdasarkan persyaratan workload AI/ML Anda. Teknik ini disebut opsi pemakaian akselerator di GKE. Memahami berbagai opsi penggunaan membantu Anda mengoptimalkan pemanfaatan resource untuk menghindari kurangnya pemanfaatan resource, meningkatkan kemungkinan mendapatkan resource, serta menyeimbangkan biaya dan performa.
Halaman ini ditujukan untuk admin dan operator Platform yang berkoordinasi dengan engineer machine learning (ML) untuk mendapatkan resource yang diperlukan agar berhasil men-deploy workload AI/ML.
Untuk mempelajari lebih lanjut peran umum dan contoh tugas yang kami referensikan dalam konten Google Cloud , lihat Peran dan tugas pengguna GKE umum.
Memahami opsi pemakaian
Anda dapat memilih dari opsi berikut untuk menggunakan akselerator di GKE:
- On-demand: Anda menggunakan TPU atau GPU di GKE tanpa mengatur kapasitas terlebih dahulu. Sebelum meminta resource, Anda harus memiliki kuota on-demand yang cukup untuk jenis dan jumlah akselerator tertentu. On-demand adalah opsi konsumsi yang paling fleksibel; namun, tidak ada jaminan bahwa resource on-demand yang tersedia akan cukup untuk memenuhi permintaan Anda.
- Reservasi: Anda memesan resource untuk jangka waktu tertentu. Reservasi dapat berupa salah satu dari berikut:
- Pemesanan untuk masa mendatang: Anda memesan resource untuk durasi yang biasanya lebih lama untuk waktu tertentu pada masa mendatang. Anda memiliki akses eksklusif ke resource yang dipesan selama jangka waktu tersebut. Pemesanan untuk masa mendatang memerlukan interaksi dengan Manajer Akun Teknis (TAM). Untuk mengetahui informasi selengkapnya, lihat panduan TPU dan GPU.
- Pemesanan untuk masa mendatang hingga 90 hari (dalam mode kalender): Anda meminta kapasitas untuk jangka waktu tertentu, dengan penasihat kalender yang menyarankan tanggal tersedia. Pemesanan untuk masa mendatang hingga 90 hari (dalam mode kalender) menawarkan fleksibilitas yang lebih besar untuk durasi yang lebih singkat dan penelusuran kapasitas layanan mandiri. Untuk mengetahui informasi selengkapnya, lihat Permintaan pemesanan untuk masa mendatang dalam mode kalender.
- Pemesanan on-demand: Anda dapat meminta pemesanan on-demand untuk disediakan segera setelah kapasitas tersedia, mirip dengan opsi on-demand. Selama pemesanan aktif, Anda membayar resource tersebut, baik Anda menggunakannya atau tidak.
- Flex-start: Anda mengamankan resource yang dialokasikan secara padat untuk workload berdurasi pendek tanpa reservasi. Anda meminta sejumlah GPU atau TPU tertentu, dan Compute Engine akan menyediakan GPU atau TPU tersebut saat kapasitas tersedia. GPU atau TPU berjalan tanpa gangguan hingga tujuh hari. Untuk mengetahui informasi selengkapnya, lihat penyediaan flex-start.
- Spot: Anda menyediakan Spot VM, yang memungkinkan Anda mendapatkan diskon yang signifikan, tetapi Spot VM dapat di-preempt kapan saja, dengan peringatan 30 detik. Untuk mengetahui informasi selengkapnya, lihat Spot VM.
Untuk mengoptimalkan keberhasilan penyediaan dalam batasan resource komputasi, Anda dapat mengatur opsi ini menggunakan ComputeClasses.
Memahami kuota akselerator di GKE
Kuota dan batas sistem membatasi penggunaan resource Google Cloud Anda untuk mendukung ketersediaan resource bagi semua pengguna Google Cloud . Kuota memiliki nilai default, tetapi biasanya Anda dapat meminta penyesuaian. Batas sistem adalah nilai tetap yang tidak dapat diubah. Secara default, project umumnya tidak dilengkapi dengan kuota akselerator yang signifikan. Anda harus meminta dan menerima persetujuan kuota untuk jenis dan region akselerator tertentu.
Pertimbangkan karakteristik berikut saat mengelola kuota yang dibutuhkan workload Anda:
Anda harus meminta kuota yang diperlukan untuk setiap opsi konsumsi. Untuk mengidentifikasi kuota yang diperlukan untuk setiap opsi penggunaan, lihat parameter "Kuota" yang sesuai yang tercantum dalam tabel pilih opsi penggunaan. Jika kuota tidak mencukupi, upaya untuk membuat cluster, node pool, atau men-deploy workload yang memerlukan akselerator akan gagal dengan error
Quota exceeded.Anda harus meminta kuota saat menggunakan ComputeClass kustom di Autopilot. Node yang disediakan untuk memenuhi persyaratan ComputeClass tetap menggunakan kuota project Anda untuk akselerator yang ditentukan.
Google Cloud Akun Uji Coba Gratis memiliki batasan dalam meminta penambahan kuota untuk resource bernilai tinggi seperti GPU dan TPU. Untuk mendapatkan akses ke kuota akselerator, upgrade ke akun berbayar.
Untuk memeriksa dan meminta kuota, buka halaman Quotas di konsol Google Cloud . Anda dapat memfilter kuota akselerator dan meminta penambahan.
Mengidentifikasi opsi pemakaian
Gunakan pertimbangan berikut untuk memilih opsi konsumsi terbaik untuk workload AI/ML Anda:
- Jenis workload: pertimbangkan jenis workload yang ingin Anda terapkan.
Persyaratan GKE bervariasi jika Anda menjalankan workload pelatihan atau inferensi:
- Pelatihan: memerlukan resource berperforma tinggi dengan memori yang signifikan. Workload pelatihan biasanya memiliki masa aktif yang jelas. Beban kerja ini biasanya lebih mudah direncanakan karena cenderung tidak mengalami lonjakan tiba-tiba dalam konsumsi resource.
- Inferensi: biasanya memerlukan akselerator yang dioptimalkan untuk skalabilitas dan biaya yang lebih rendah. Beban kerja inferensi dapat memerlukan memori akselerator yang signifikan selama lonjakan konsumsi resource yang tiba-tiba.
- Masa pakai berdasarkan fase implementasi: pertimbangkan sasaran bisnis Anda jika Anda menjalankan Bukti Konsep (POC), evaluasi platform, pengembangan atau pengujian aplikasi, produksi, atau pengoptimalan.
- Waktu penyediaan: tentukan apakah workload Anda memerlukan eksekusi segera atau dapat dijalankan di masa mendatang. Jika eksekusi di masa mendatang memungkinkan, tentukan seberapa fleksibel waktu mulainya.
- Keseimbangan antara biaya dan performa: evaluasi persyaratan performa workload dan batasan anggaran Anda untuk memilih akselerator yang paling hemat biaya. Pertimbangkan kompromi antara biaya akselerator dan karakteristik performanya. Ingatlah bahwa akselerator baru dapat meningkatkan rasio biaya dan performa.
Memilih opsi pemakaian
Gunakan tabel berikut untuk memilih opsi pemakaian:
| Opsi pemakaian | Parameter penyediaan | Akselerator yang didukung | Detail | Contoh workload |
|---|---|---|---|---|
| Pemesanan on-demand |
|
|
|
|
| Pemesanan untuk masa mendatang |
|
|
|
|
| Pemesanan untuk masa mendatang hingga 90 hari (dalam mode kalender) |
|
|
|
|
| Mode penyediaan Flex-start |
|
|
|
|
| Spot VM |
|
|
|
|
| Sesuai permintaan (GPU atau TPU) |
|
|
|
Mengoptimalkan biaya dan penyediaan workload dengan ComputeClasses
Anda dapat menggunakan ComputeClasses untuk mengelola dan mengotomatiskan strategi penggunaan akselerator secara dinamis dengan menentukan daftar konfigurasi penggantian berbasis prioritas. Selama operasi peningkatan skala, GKE mencoba menyediakan node sesuai dengan hierarki prioritas yang Anda tetapkan.
Daftar berikut menjelaskan opsi penggunaan yang tersedia dengan ComputeClass dan cara mengonfigurasinya. Untuk manifes YAML lengkap, lihat Contoh opsi penggunaan dengan ComputeClass.
- Reservasi: Anda dapat menentukan nama pemesanan di kolom
reservationsdi ComputeClass. Hal ini memastikan bahwa GKE pertama-tama mencoba menggunakan kapasitas yang dicadangkan sebelum melakukan penggantian. - Mode penyediaan flex-start: aktifkan antrean fleksibel menggunakan kolom
flexStartdi ComputeClass, dan konfigurasi durasi penggantian node pengganti dengan menggunakan kolomnodeRecycling. - Spot VM: menginstruksikan GKE untuk menggunakan Spot VM saat
menyediakan node untuk aturan prioritas tersebut dengan menetapkan
kolom
spotketrue. - Kapasitas on-demand yang dikombinasikan dengan kebijakan lokasi multi-zona:
Nyatakan konfigurasi mesin standar dalam daftar prioritas dan
konfigurasi strategi lokasi penggantian menggunakan kolom
location.
ComputeClass tidak mendukung Pemesanan untuk masa mendatang atau Pemesanan untuk masa mendatang hingga 90 hari (dalam mode kalender).
Contoh opsi pemakaian dengan ComputeClasses
Bagian berikut memberikan contoh konfigurasi untuk strategi ini.
Pemesanan dengan konfigurasi penggantian
Konfigurasi ini paling cocok untuk workload yang dapat menoleransi gangguan, bukan workload yang bergantung pada data persisten atau harus dijalankan hingga selesai.
Konfigurasi ini menetapkan strategi penggantian yang tangguh menggunakan langkah-langkah berikut:
- Memakai reservasi terlebih dahulu: GKE mencoba menyediakan node menggunakan reservasi kapasitas spesifik yang telah Anda beli di muka.
- Beralih ke flex-start: Jika kapasitas pemesanan dimanfaatkan sepenuhnya, GKE akan beralih ke resource flex-start berdurasi singkat dan didiskon.
- Melakukan fallback ke On-demand: Sebagai fallback terakhir, GKE menyediakan resource on-demand standar.
Memigrasikan kembali ke reservasi: Mengaktifkan migrasi aktif akan menginstruksikan GKE untuk otomatis menggabungkan dan memigrasikan workload kembali ke node reservasi dengan prioritas lebih tinggi segera setelah kapasitas tersedia. Migrasi ini dapat mengganggu.
apiVersion: cloud.google.com/v1 kind: ComputeClass metadata: name: ha-gpu-fallback spec: activeMigration: optimizeRulePriority: true # Migrate workloads back to reservation when capacity releases priorities: # Priority 1: Consume specific corporate reservation first - gpu: type: nvidia-l4 count: 1 reservations: affinity: Specific specific: - name: reserved-l4-pool project: my-project zones: [us-central1-a] # Priority 2: Fallback to Flex Start (short-duration allocation) - gpu: type: nvidia-l4 count: 1 flexStart: enabled: true # Priority 3: Fallback to On-demand resources - gpu: type: nvidia-l4 count: 1
Mode penyediaan flex-start dengan konfigurasi daur ulang node
Konfigurasi ini mengelola kapasitas berdiskon berdurasi singkat dengan waktu aktif berkelanjutan menggunakan langkah-langkah berikut:
- Meminta VM flex-start: GKE meminta instance VM dari antrean flex-start (yang berjalan tanpa gangguan hingga tujuh hari).
- Memantau masa berlaku sewa: GKE melacak durasi yang tersisa dari node flex-start yang aktif.
- Memicu daur ulang node: Dua puluh menit (1200 detik) sebelum masa berlaku sewa VM berakhir, GKE akan otomatis menyediakan node pengganti.
Menjadwalkan ulang workload: Workload dimigrasikan ke node baru, melanjutkan eksekusi tanpa gangguan layanan.
apiVersion: cloud.google.com/v1 kind: ComputeClass metadata: name: flex-node-recycling spec: priorities: - gpu: type: nvidia-l4 count: 1 flexStart: enabled: true nodeRecycling: leadTimeSeconds: 1200 # Automatically launch replacement node before VM lease expires
Konfigurasi kebijakan alokasi multi-zona
Konfigurasi ini mengabaikan batasan pasokan zona tunggal menggunakan langkah-langkah berikut:
- Tentukan zona target: Anda mencantumkan beberapa zona cadangan (seperti
us-central1-a,us-central1-b, danus-central1-c) dalam aturan prioritas. - Memperluas parameter target: Anda menetapkan kebijakan lokasi ke
ANY. Setelan ini menginstruksikan autoscaler cluster untuk mencari kapasitas yang diminta di semua zona yang ditentukan. - Menganalisis ketersediaan per zona: selama peristiwa peningkatan skala, GKE memindai zona yang ditentukan.
Menyediakan di zona yang tersedia: GKE segera menyediakan node workload yang diminta di zona target mana pun yang memiliki kapasitas yang sesuai. Strategi ini mencegah penyumbatan dalam antrean alokasi.
apiVersion: cloud.google.com/v1 kind: ComputeClass metadata: name: broad-zonal-serving spec: priorities: - gpu: type: nvidia-l4 count: 1 location: zones: [us-central1-a, us-central1-b, us-central1-c] locationPolicy: ANY # Provision accelerator in any target zone with supply
Langkah berikutnya
- Pelajari lebih lanjut GPU di GKE.
- Pelajari lebih lanjut TPU di GKE.
- Pelajari lebih lanjut inferensi AI/ML di GKE.