Opsi pemakaian untuk AI Hypercomputer

AI Hypercomputer memiliki beberapa opsi pemakaian untuk mendapatkan resource komputasi. Opsi ini memenuhi kebutuhan seperti durasi workload, toleransi kesalahan, dan model infrastruktur. Pelajari opsi ini dan pilih opsi terbaik untuk kasus penggunaan Anda.

Ringkasan opsi pemakaian

Untuk membandingkan opsi pemakaian berdasarkan karakteristik utama, gunakan tabel berikut:

Opsi pemakaian Model penyediaan Paling cocok untuk Jaminan kapasitas Masa aktif Preemptible Kuota Diskon Model alokasi
Flex-start Flex-start Workload berdurasi singkat hingga tujuh hari yang dapat menunggu kapasitas. Upaya terbaik Hingga tujuh hari Tidak Kuota preemptible Diskon (hingga 53%) untuk seri yang didukung Padat untuk permintaan perubahan ukuran MIG; upaya terbaik untuk VM mandiri.
Spot VM Spot Workload GPU umum yang fault-tolerant dan berdurasi singkat. Upaya terbaik Preemptible Ya Kuota preemptible Diskon besar (hingga 91%) Standar
Reservasi standar Standar Workload GPU umum penting yang memerlukan tingkat jaminan kapasitas yang sangat tinggi. Sangat tinggi Sangat tinggi Ditentukan pengguna Tidak Tidak ada kuota yang digunakan Tarif diskon dengan diskon abonemen (CUD)
Pemesanan untuk masa mendatang untuk blok kapasitas Terikat dengan reservasi Pelatihan berskala besar dan berjalan lama di GPU yang dikelompokkan. Sangat tinggi Tanpa batas selama periode reservasi. Tidak Ditingkatkan secara otomatis Diskon (hingga 53%) dengan CUD Padat
Pemesanan untuk masa mendatang dalam mode kalender Terikat dengan reservasi workload GPU yang dikelompokkan hingga 90 hari yang memerlukan kapasitas yang dicadangkan. Sangat tinggi Hingga 90 hari Tidak Tidak ada kuota yang digunakan Diskon (hingga 53%) Padat
VM sesuai permintaan Standar workload GPU umum tanpa durasi tertentu. Upaya terbaik Tidak terbatas Tidak Kuota sesuai permintaan Tidak ada (bayar sesuai penggunaan) Standar

Opsi pemakaian yang Anda gunakan untuk men-deploy infrastruktur bergantung pada apakah Anda menggunakan GPU Umum atau GPU Berkelompok.

  • GPU Umum: dirancang untuk inferensi, pengembangan, dan workload pelatihan skala kecil. Jenis GPU ini menawarkan fleksibilitas operasional melalui pemeliharaan asinkron. Untuk melihat opsi yang tersedia, lihat Opsi konsumsi untuk GPU umum.

  • GPU bercluster: dirancang untuk workload pelatihan skala besar yang terikat erat dan inferensi, RL, serta workload model penalaran skala besar yang memerlukan jaminan kapasitas tinggi dan alokasi resource padat untuk meminimalkan latensi jaringan. Untuk melihat opsi yang tersedia, lihat Opsi penggunaan untuk GPU yang dikelompokkan.

Opsi pemakaian untuk GPU umum

Gunakan opsi konsumsi berikut untuk mendapatkan kapasitas GPU umum.

Menggunakan Flex-start

Untuk menjalankan workload berdurasi singkat yang memerlukan resource yang dialokasikan secara padat, Anda dapat meminta resource komputasi hingga tujuh hari menggunakan flex-start. Setiap kali resource tersedia, Compute Engine akan membuat VM dalam jumlah yang Anda minta. Anda dapat menghentikan VM Flex-start mandiri, tetapi Anda tidak dapat menghentikan VM Flex-start yang dibuat oleh grup instance terkelola (MIG) melalui permintaan pengubahan ukuran. VM mulai fleksibel akan ada hingga Anda menghapusnya, atau hingga Compute Engine menghapus VM di akhir durasi jalannya.

Workload ideal

  • Pra-pelatihan model kecil
  • Penyesuaian model
  • Simulasi komputasi berperforma tinggi (HPC)
  • Inferensi batch

Karakteristik utama

  • Model penyediaan: Flex-start.
  • Dukungan hardware yang luas: minta jenis mesin GPU bercluster apa pun, kecuali A4X Max dan A4X.
  • Pengoptimalan latensi: terapkan kebijakan penempatan rapat ke VM mandiri untuk meminimalkan latensi jaringan.
  • Efisiensi biaya: dapatkan diskon hingga 53% untuk vCPU, memori, GPU, dan disk SSD Lokal untuk seri mesin A4, A3, A2, dan G4. Tarif on-demand standar berlaku untuk seri lain yang didukung. Untuk mengetahui informasi selengkapnya, lihat Harga flex-start.

Menggunakan Spot

Untuk menjalankan workload fault-tolerant, Anda bisa mendapatkan resource komputasi secara langsung berdasarkan ketersediaan. Anda mendapatkan resource dengan harga serendah mungkin. Namun, Compute Engine dapat melakukan preempt VM kapan saja untuk memulihkan kapasitas.

Workload ideal

  • Batch processing dan analisis data
  • Komputasi berperforma tinggi (HPC) dan encoding media

Karakteristik utama

  • Model penyediaan: Spot.
  • Dukungan hardware yang luas: minta jenis mesin GPU bercluster apa pun, kecuali A4X Max dan A4X.
  • Pengoptimalan latensi: terapkan kebijakan penempatan rapat ke VM mandiri untuk meminimalkan latensi jaringan.
  • Efisiensi biaya: dapatkan diskon hingga 91% untuk vCPU, memori, GPU, dan disk SSD Lokal.

Menggunakan on-demand

Tips: Untuk meningkatkan peluang Anda mendapatkan kapasitas GPU umum, gunakan Flex-start atau Spot. Opsi penggunaan ini menawarkan GPU dengan harga diskon dibandingkan dengan harga on-demand, dan dirancang untuk membantu meningkatkan peluang Anda mendapatkan resource dengan permintaan tinggi seperti GPU.

Untuk menjalankan workload tanpa durasi tertentu, Anda bisa mendapatkan resource komputasi secara langsung berdasarkan ketersediaan. VM berjalan hingga Anda menghentikan atau menghapusnya.

Workload ideal

  • Inferensi dan penyajian model
  • Pembuatan prototipe dan eksperimen

Karakteristik utama

  • Model penyediaan: Standar.
  • Ketersediaan langsung: buat instance VM secara langsung tanpa menunggu penjadwalan atau persetujuan kapasitas.
  • Harga standar: bayar resource dengan tarif on-demand standar tanpa komitmen jangka panjang.
  • Dukungan hardware yang luas: gunakan dengan seri mesin GPU yang didukung di jalur GPU umum.

Menggunakan reservasi standar

Untuk menjalankan workload GPU umum penting yang memerlukan tingkat jaminan kapasitas yang sangat tinggi, Anda dapat menggunakan reservasi standar.

Workload ideal

  • Workload produksi penting
  • Workload yang memerlukan kapasitas terjamin

Karakteristik utama

  • Model penyediaan: Standar.
  • Jaminan kapasitas: memberikan jaminan yang sangat tinggi bahwa resource tersedia.
  • Harga: tarif standar berlaku, tetapi Anda dapat melampirkan CUD untuk mendapatkan penghematan.

Opsi pemakaian untuk GPU bercluster

Gunakan opsi penggunaan berikut untuk mendapatkan kapasitas GPU berkluster.

Menggunakan pemesanan untuk masa mendatang untuk blok kapasitas

Untuk menjalankan workload terdistribusi berskala besar dan berjalan lama yang memerlukan alokasi resource yang padat, Anda dapat meminta resource komputasi untuk waktu tertentu di masa mendatang. Anda memiliki akses eksklusif ke resource yang dipesan selama jangka waktu tersebut, dan Anda dapat menggunakan resource untuk membuat VM atau cluster. Di akhir periode pemesanan, Compute Engine melakukan hal berikut:

  • Compute Engine akan menghapus pemesanan.
  • Berdasarkan tindakan penghentian yang Anda tentukan untuk VM, Compute Engine akan menghentikan atau menghapus VM apa pun yang menggunakan reservasi.

Workload ideal

  • Model dasar pra-pelatihan
  • Inferensi untuk model dasar di beberapa host

Karakteristik utama

  • Model penyediaan: Terikat dengan reservasi.
  • Dukungan mesin premium: pesan jenis mesin A4X Max, A4X, A4, A3 Ultra, A3 Mega, atau A3 High (8 GPU).
  • Persyaratan komitmen: lampirkan komitmen berbasis resource untuk pemesanan selama satu tahun atau lebih.
  • Modifikasi dinamis: Aktifkan notifikasi pemeliharaan darurat hardware untuk penggunaan tugas Vertex AI setelah periode dimulai.

Menggunakan pemesanan untuk masa mendatang dalam mode kalender

Untuk menjalankan workload terdistribusi yang berjalan singkat dan memerlukan alokasi resource yang padat, Anda dapat meminta resource komputasi hingga 90 hari. Anda memiliki akses eksklusif ke resource yang dipesan selama waktu tersebut, dan Anda dapat menggunakan resource untuk membuat VM atau cluster. Di akhir periode pemesanan, Compute Engine melakukan hal berikut:

  • Compute Engine akan menghapus reservasi.
  • Berdasarkan tindakan penghentian yang Anda tentukan untuk VM, Compute Engine akan menghentikan atau menghapus VM apa pun yang menggunakan reservasi.

Workload ideal

  • Pelatihan awal dan fine-tuning
  • Simulasi dan inferensi berskala besar

Karakteristik utama

  • Model penyediaan: Terikat dengan reservasi.
  • Dukungan seri mesin: pesan jenis mesin A4, A3 Ultra, A3 Mega, atau A3 High (8 GPU).
  • Batasan skalabilitas: cadangkan hingga 80 VM selama maksimum 90 hari.
  • Penyediaan yang dioptimalkan: gunakan model terikat reservasi untuk meningkatkan peluang Anda mendapatkan GPU.

Menggunakan Flex-start

Gunakan flex-start untuk permintaan perubahan ukuran grup instance terkelola (MIG) yang dikelompokkan saat Anda memerlukan resource yang dialokasikan secara padat hingga tujuh hari.

Workload ideal

VM mulai fleksibel ideal untuk menjalankan workload yang dapat dimulai kapan saja, seperti berikut:

  • Pra-pelatihan model kecil
  • Penyesuaian model
  • Simulasi komputasi berperforma tinggi (HPC)
  • Inferensi batch

Karakteristik utama

  • Model penyediaan: Flex-start.
  • Alokasi resource: dialokasikan secara padat untuk permintaan perubahan ukuran MIG.
  • Efisiensi biaya: dapatkan diskon hingga 53% untuk vCPU, memori, GPU, dan disk SSD Lokal yang terpasang untuk seri mesin A4, A3, A2, dan G4. Tarif on-demand standar berlaku untuk seri lain yang didukung.

Menggunakan Spot

Anda dapat menggunakan Spot VM untuk workload fault-tolerant yang dialokasikan secara padat untuk mendapatkan diskon besar, dengan pemahaman bahwa Compute Engine dapat melakukan preempt VM untuk memulihkan kapasitas.

Workload ideal

  • Pelatihan terdistribusi yang fault-tolerant
  • Batch processing

Karakteristik utama

  • Model penyediaan: Spot.
  • Preemption: Compute Engine dapat melakukan preemption pada instance kapan saja.
  • Efisiensi biaya: dapatkan diskon hingga 91% untuk vCPU, memori, GPU, dan disk SSD Lokal yang terpasang

Langkah berikutnya