Opsi pemakaian untuk AI Hypercomputer

AI Hypercomputer memiliki beberapa opsi pemakaian untuk mendapatkan resource komputasi. Opsi ini memenuhi kebutuhan seperti durasi workload, toleransi fault, dan model infrastruktur. Pelajari opsi ini dan pilih opsi terbaik untuk kasus penggunaan Anda.

Sebagai alternatif untuk evaluasi manual, Anda dapat meminta Gemini di Google Cloud konsol untuk membandingkan opsi pemakaian untuk workload dan anggaran Anda. Untuk mengetahui informasi selengkapnya, lihat Mendesain infrastruktur AI Anda dengan Gemini.

Ringkasan opsi pemakaian

Untuk membandingkan opsi pemakaian di seluruh karakteristik utama, gunakan tabel berikut:

Opsi pemakaian Model penyediaan Paling cocok untuk Jaminan kapasitas Masa aktif Preemptible Quota Diskon Model alokasi
Flex-start Flex-start Workload berdurasi singkat hingga tujuh hari yang dapat menunggu kapasitas. Upaya terbaik Hingga tujuh hari Tidak Kuota preemptible Didiskon (hingga 53%) pada seri yang didukung Padat untuk permintaan perubahan ukuran MIG; upaya terbaik untuk VM mandiri.
Spot VM Spot Workload GPU umum berdurasi singkat dan fault-tolerant. Upaya terbaik Preemptible Ya Kuota preemptible Didiskon besar (hingga 91%) Standar
Reservasi standar Standar Workload GPU umum penting yang memerlukan tingkat jaminan kapasitas yang sangat tinggi. Sangat tinggi Sangat tinggi Ditentukan pengguna Tidak Tidak ada kuota yang digunakan Tarif diskon dengan diskon abonemen (CUD)
Reservasi untuk masa mendatang untuk blok kapasitas Terikat reservasi Pelatihan berskala besar dan berjalan lama pada GPU bercluster. Sangat tinggi Tidak terbatas dalam periode reservasi. Tidak Ditingkatkan secara otomatis Didiskon (hingga 53%) dengan CUD Padat
Reservasi untuk masa mendatang dalam mode kalender Terikat reservasi Workload GPU bercluster hingga 90 hari yang memerlukan kapasitas yang dipesan. Sangat tinggi Hingga 90 hari Tidak Tidak ada kuota yang digunakan Didiskon (hingga 53%) Padat
VM sesuai permintaan Standar Workload GPU umum tanpa durasi tertentu. Upaya terbaik Tidak terbatas Tidak Kuota sesuai permintaan Tidak ada (bayar sesuai penggunaan) Standar

Opsi pemakaian yang Anda gunakan untuk men-deploy infrastruktur bergantung pada apakah Anda menggunakan GPU Umum atau GPU Bercluster.

  • GPU Umum: dirancang untuk inferensi skala kecil, pengembangan, dan workload pelatihan skala kecil. Jenis GPU ini menawarkan fleksibilitas operasional melalui pemeliharaan asinkron. Untuk melihat opsi yang tersedia, lihat Opsi pemakaian untuk GPU umum.

  • GPU Bercluster: dirancang untuk workload pelatihan berskala besar, terhubung erat serta workload inferensi, RL, dan model penalaran berskala besar yang memerlukan jaminan kapasitas tinggi dan alokasi resource padat untuk meminimalkan latensi jaringan. Untuk melihat opsi yang tersedia, lihat Opsi pemakaian untuk GPU bercluster.

Opsi pemakaian untuk GPU umum

Gunakan opsi pemakaian berikut untuk mendapatkan kapasitas GPU umum.

Menggunakan Flex-start

Untuk menjalankan workload berdurasi singkat yang memerlukan alokasi resource padat, Anda dapat meminta resource komputasi resource hingga tujuh hari menggunakan Flex-start. Setiap kali resource tersedia, Compute Engine akan membuat jumlah VM yang Anda minta. Anda dapat menghentikan VM Flex-start mandiri, tetapi Anda tidak dapat menghentikan VM Flex-start yang dibuat oleh grup instance terkelola (MIG) melalui permintaan perubahan ukuran. VM Flex-start ada hingga Anda menghapusnya, atau hingga Compute Engine menghapus VM pada akhir durasi run-nya.

Workload ideal

  • Pra-pelatihan model kecil
  • Fine-tuning model
  • Simulasi komputasi berperforma tinggi (HPC)
  • Inferensi batch

Karakteristik utama

  • Model penyediaan: Flex-start.
  • Dukungan hardware yang luas: minta jenis mesin GPU bercluster apa pun, kecuali A4X Max dan A4X.
  • Pengoptimalan latensi: terapkan kebijakan penempatan ringkas ke VM mandiri untuk meminimalkan latensi jaringan.
  • Efisiensi biaya: dapatkan diskon hingga 53% untuk vCPU, memori, GPU, dan disk SSD Lokal untuk seri mesin A4, A3, A2, dan G4. Tarif sesuai permintaan standar berlaku untuk seri lain yang didukung. Untuk mengetahui informasi selengkapnya, lihat Harga Flex-start.

Menggunakan Spot

Untuk menjalankan workload fault-tolerant, Anda dapat segera mendapatkan resource komputasi berdasarkan ketersediaan. Anda mendapatkan resource dengan harga serendah mungkin. Namun, Compute Engine dapat melakukan preempt VM kapan saja untuk memulihkan kapasitas.

Workload ideal

  • Batch processing dan analisis data
  • Komputasi berperforma tinggi (HPC) dan encoding media

Karakteristik utama

  • Model penyediaan: Spot.
  • Dukungan hardware yang luas: minta jenis mesin GPU bercluster apa pun, kecuali A4X Max dan A4X.
  • Pengoptimalan latensi: terapkan kebijakan penempatan ringkas ke VM mandiri untuk meminimalkan latensi jaringan.
  • Efisiensi biaya: dapatkan diskon hingga 91% untuk vCPU, memori, GPU, dan disk SSD Lokal.

Menggunakan sesuai permintaan

Tips: Untuk meningkatkan peluang Anda mendapatkan kapasitas GPU umum, gunakan Flex-start atau Spot. Opsi pemakaian ini menawarkan GPU dengan harga diskon dibandingkan dengan harga sesuai permintaan, dan dirancang untuk membantu meningkatkan peluang Anda mendapatkan resource dengan permintaan tinggi seperti GPU.

Untuk menjalankan workload tanpa durasi tertentu, Anda dapat segera mendapatkan resource komputasi berdasarkan ketersediaan. VM berjalan hingga Anda menghentikan atau menghapusnya.

Workload ideal

  • Inferensi dan penyajian model
  • Pembuatan prototipe dan eksperimen

Karakteristik utama

  • Model penyediaan: Standar.
  • Ketersediaan langsung: buat instance VM segera tanpa menunggu penjadwalan atau persetujuan kapasitas.
  • Harga standar: bayar resource dengan tarif sesuai permintaan standar tanpa komitmen jangka panjang.
  • Dukungan hardware yang luas: gunakan dengan seri mesin GPU yang didukung di jalur GPU umum.

Menggunakan reservasi standar

Untuk menjalankan workload GPU umum penting yang memerlukan tingkat jaminan kapasitas yang sangat tinggi, Anda dapat menggunakan reservasi standar.

Workload ideal

  • Workload produksi penting
  • Workload yang memerlukan kapasitas terjamin

Karakteristik utama

  • Model penyediaan: Standar.
  • Jaminan kapasitas: memberikan jaminan yang sangat tinggi bahwa resource tersedia.
  • Harga: tarif standar berlaku, tetapi Anda dapat melampirkan CUD untuk penghematan.

Opsi pemakaian untuk GPU bercluster

Gunakan opsi pemakaian berikut untuk mendapatkan kapasitas GPU bercluster.

Menggunakan reservasi untuk masa mendatang untuk blok kapasitas

Untuk menjalankan workload terdistribusi berskala besar dan berjalan lama yang memerlukan alokasi resource padat, Anda dapat meminta resource komputasi untuk waktu tertentu di masa mendatang. Anda memiliki akses eksklusif ke resource yang dipesan untuk jangka waktu tersebut, dan Anda dapat menggunakan resource untuk membuat VM atau cluster. Pada akhir periode reservasi, Compute Engine akan melakukan hal berikut:

  • Compute Engine menghapus reservasi.
  • Berdasarkan tindakan penghentian yang Anda tentukan untuk VM, Compute Engine akan menghentikan atau menghapus VM apa pun yang menggunakan reservasi.

Workload ideal

  • Model dasar pra-pelatihan
  • Inferensi untuk model dasar di beberapa host

Karakteristik utama

  • Model penyediaan: Terikat reservasi.
  • Dukungan mesin premium: pesan jenis mesin A4X Max, A4X, A4, A3 Ultra, A3 Mega, atau A3 High (8 GPU).
  • Persyaratan komitmen: lampirkan komitmen berbasis resource untuk reservasi selama satu tahun atau lebih.
  • Modifikasi dinamis: aktifkan notifikasi pemeliharaan darurat hardware untuk penggunaan tugas Vertex AI setelah periode dimulai.

Menggunakan reservasi untuk masa mendatang dalam mode kalender

Untuk menjalankan workload terdistribusi berdurasi singkat yang memerlukan alokasi resource padat, Anda dapat meminta resource komputasi hingga 90 hari. Anda memiliki akses eksklusif ke resource yang dipesan untuk jangka waktu tersebut, dan Anda dapat menggunakan resource untuk membuat VM atau cluster. Pada akhir periode reservasi, Compute Engine akan melakukan hal berikut:

  • Compute Engine menghapus reservasi.
  • Berdasarkan tindakan penghentian yang Anda tentukan untuk VM, Compute Engine akan menghentikan atau menghapus VM apa pun yang menggunakan reservasi.

Workload ideal

  • Pra-pelatihan dan fine-tuning
  • Simulasi dan inferensi berskala besar

Karakteristik utama

  • Model penyediaan: Terikat reservasi.
  • Dukungan seri mesin: pesan jenis mesin A4, A3 Ultra, A3 Mega, atau A3 High (8 GPU) jenis mesin.
  • Batas skalabilitas: pesan hingga 80 VM selama maksimum 90 hari.
  • Penyediaan yang dioptimalkan: gunakan model terikat reservasi untuk meningkatkan peluang Anda mendapatkan GPU.

Menggunakan Flex-start

Gunakan Flex-start untuk permintaan perubahan ukuran grup instance terkelola (MIG) bercluster saat Anda memerlukan alokasi resource padat hingga tujuh hari.

Workload ideal

VM Flex-start ideal untuk menjalankan workload yang dapat dimulai kapan saja, seperti berikut:

  • Pra-pelatihan model kecil
  • Fine-tuning model
  • Simulasi komputasi berperforma tinggi (HPC)
  • Inferensi batch

Karakteristik utama

  • Model penyediaan: Flex-start.
  • Alokasi resource: dialokasikan secara padat untuk permintaan perubahan ukuran MIG.
  • Efisiensi biaya: Anda akan menerima diskon hingga 53% untuk vCPU, memori, GPU, dan disk SSD Lokal terlampir untuk seri mesin A4, A3, A2, dan G4. Tarif sesuai permintaan standar berlaku untuk seri mesin lain yang didukung.

Menggunakan Spot

Anda dapat menggunakan Spot VM untuk workload fault-tolerant yang dialokasikan secara padat untuk mendapatkan diskon besar, dengan pemahaman bahwa Compute Engine dapat melakukan preempt VM untuk memulihkan kapasitas.

Workload ideal

  • Pelatihan terdistribusi yang fault-tolerant
  • Batch processing

Karakteristik utama

  • Model penyediaan: Spot.
  • Preemption: Compute Engine dapat melakukan preempt instance kapan saja.
  • Efisiensi biaya: dapatkan diskon hingga 91% untuk vCPU, memori, GPU, dan disk SSD Lokal terlampir

Langkah berikutnya