AI Hypercomputer memiliki beberapa opsi pemakaian untuk mendapatkan resource komputasi. Opsi ini memenuhi kebutuhan seperti durasi workload, toleransi fault, dan model infrastruktur. Pelajari opsi ini dan pilih opsi terbaik untuk kasus penggunaan Anda.
Sebagai alternatif untuk evaluasi manual, Anda dapat meminta Gemini di Google Cloud konsol untuk membandingkan opsi pemakaian untuk workload dan anggaran Anda. Untuk mengetahui informasi selengkapnya, lihat Mendesain infrastruktur AI Anda dengan Gemini.
Ringkasan opsi pemakaian
Untuk membandingkan opsi pemakaian di seluruh karakteristik utama, gunakan tabel berikut:
| Opsi pemakaian | Model penyediaan | Paling cocok untuk | Jaminan kapasitas | Masa aktif | Preemptible | Quota | Diskon | Model alokasi |
|---|---|---|---|---|---|---|---|---|
| Flex-start | Flex-start | Workload berdurasi singkat hingga tujuh hari yang dapat menunggu kapasitas. | Upaya terbaik | Hingga tujuh hari | Tidak | Kuota preemptible | Didiskon (hingga 53%) pada seri yang didukung | Padat untuk permintaan perubahan ukuran MIG; upaya terbaik untuk VM mandiri. |
| Spot VM | Spot | Workload GPU umum berdurasi singkat dan fault-tolerant. | Upaya terbaik | Preemptible | Ya | Kuota preemptible | Didiskon besar (hingga 91%) | Standar |
| Reservasi standar | Standar | Workload GPU umum penting yang memerlukan tingkat jaminan kapasitas yang sangat tinggi. | Sangat tinggi | Sangat tinggi | Ditentukan pengguna | Tidak | Tidak ada kuota yang digunakan | Tarif diskon dengan diskon abonemen (CUD) |
| Reservasi untuk masa mendatang untuk blok kapasitas | Terikat reservasi | Pelatihan berskala besar dan berjalan lama pada GPU bercluster. | Sangat tinggi | Tidak terbatas dalam periode reservasi. | Tidak | Ditingkatkan secara otomatis | Didiskon (hingga 53%) dengan CUD | Padat |
| Reservasi untuk masa mendatang dalam mode kalender | Terikat reservasi | Workload GPU bercluster hingga 90 hari yang memerlukan kapasitas yang dipesan. | Sangat tinggi | Hingga 90 hari | Tidak | Tidak ada kuota yang digunakan | Didiskon (hingga 53%) | Padat |
| VM sesuai permintaan | Standar | Workload GPU umum tanpa durasi tertentu. | Upaya terbaik | Tidak terbatas | Tidak | Kuota sesuai permintaan | Tidak ada (bayar sesuai penggunaan) | Standar |
Opsi pemakaian yang Anda gunakan untuk men-deploy infrastruktur bergantung pada apakah Anda menggunakan GPU Umum atau GPU Bercluster.
GPU Umum: dirancang untuk inferensi skala kecil, pengembangan, dan workload pelatihan skala kecil. Jenis GPU ini menawarkan fleksibilitas operasional melalui pemeliharaan asinkron. Untuk melihat opsi yang tersedia, lihat Opsi pemakaian untuk GPU umum.
GPU Bercluster: dirancang untuk workload pelatihan berskala besar, terhubung erat serta workload inferensi, RL, dan model penalaran berskala besar yang memerlukan jaminan kapasitas tinggi dan alokasi resource padat untuk meminimalkan latensi jaringan. Untuk melihat opsi yang tersedia, lihat Opsi pemakaian untuk GPU bercluster.
Opsi pemakaian untuk GPU umum
Gunakan opsi pemakaian berikut untuk mendapatkan kapasitas GPU umum.
Menggunakan Flex-start
Untuk menjalankan workload berdurasi singkat yang memerlukan alokasi resource padat, Anda dapat meminta resource komputasi resource hingga tujuh hari menggunakan Flex-start. Setiap kali resource tersedia, Compute Engine akan membuat jumlah VM yang Anda minta. Anda dapat menghentikan VM Flex-start mandiri, tetapi Anda tidak dapat menghentikan VM Flex-start yang dibuat oleh grup instance terkelola (MIG) melalui permintaan perubahan ukuran. VM Flex-start ada hingga Anda menghapusnya, atau hingga Compute Engine menghapus VM pada akhir durasi run-nya.
Workload ideal
- Pra-pelatihan model kecil
- Fine-tuning model
- Simulasi komputasi berperforma tinggi (HPC)
- Inferensi batch
Karakteristik utama
- Model penyediaan: Flex-start.
- Dukungan hardware yang luas: minta jenis mesin GPU bercluster apa pun, kecuali A4X Max dan A4X.
- Pengoptimalan latensi: terapkan kebijakan penempatan ringkas ke VM mandiri untuk meminimalkan latensi jaringan.
- Efisiensi biaya: dapatkan diskon hingga 53% untuk vCPU, memori, GPU, dan disk SSD Lokal untuk seri mesin A4, A3, A2, dan G4. Tarif sesuai permintaan standar berlaku untuk seri lain yang didukung. Untuk mengetahui informasi selengkapnya, lihat Harga Flex-start.
Menggunakan Spot
Untuk menjalankan workload fault-tolerant, Anda dapat segera mendapatkan resource komputasi berdasarkan ketersediaan. Anda mendapatkan resource dengan harga serendah mungkin. Namun, Compute Engine dapat melakukan preempt VM kapan saja untuk memulihkan kapasitas.
Workload ideal
- Batch processing dan analisis data
- Komputasi berperforma tinggi (HPC) dan encoding media
Karakteristik utama
- Model penyediaan: Spot.
- Dukungan hardware yang luas: minta jenis mesin GPU bercluster apa pun, kecuali A4X Max dan A4X.
- Pengoptimalan latensi: terapkan kebijakan penempatan ringkas ke VM mandiri untuk meminimalkan latensi jaringan.
- Efisiensi biaya: dapatkan diskon hingga 91% untuk vCPU, memori, GPU, dan disk SSD Lokal.
Menggunakan sesuai permintaan
Tips: Untuk meningkatkan peluang Anda mendapatkan kapasitas GPU umum, gunakan Flex-start atau Spot. Opsi pemakaian ini menawarkan GPU dengan harga diskon dibandingkan dengan harga sesuai permintaan, dan dirancang untuk membantu meningkatkan peluang Anda mendapatkan resource dengan permintaan tinggi seperti GPU.
Untuk menjalankan workload tanpa durasi tertentu, Anda dapat segera mendapatkan resource komputasi berdasarkan ketersediaan. VM berjalan hingga Anda menghentikan atau menghapusnya.
Workload ideal
- Inferensi dan penyajian model
- Pembuatan prototipe dan eksperimen
Karakteristik utama
- Model penyediaan: Standar.
- Ketersediaan langsung: buat instance VM segera tanpa menunggu penjadwalan atau persetujuan kapasitas.
- Harga standar: bayar resource dengan tarif sesuai permintaan standar tanpa komitmen jangka panjang.
- Dukungan hardware yang luas: gunakan dengan seri mesin GPU yang didukung di jalur GPU umum.
Menggunakan reservasi standar
Untuk menjalankan workload GPU umum penting yang memerlukan tingkat jaminan kapasitas yang sangat tinggi, Anda dapat menggunakan reservasi standar.
Workload ideal
- Workload produksi penting
- Workload yang memerlukan kapasitas terjamin
Karakteristik utama
- Model penyediaan: Standar.
- Jaminan kapasitas: memberikan jaminan yang sangat tinggi bahwa resource tersedia.
- Harga: tarif standar berlaku, tetapi Anda dapat melampirkan CUD untuk penghematan.
Opsi pemakaian untuk GPU bercluster
Gunakan opsi pemakaian berikut untuk mendapatkan kapasitas GPU bercluster.Menggunakan reservasi untuk masa mendatang untuk blok kapasitas
Untuk menjalankan workload terdistribusi berskala besar dan berjalan lama yang memerlukan alokasi resource padat, Anda dapat meminta resource komputasi untuk waktu tertentu di masa mendatang. Anda memiliki akses eksklusif ke resource yang dipesan untuk jangka waktu tersebut, dan Anda dapat menggunakan resource untuk membuat VM atau cluster. Pada akhir periode reservasi, Compute Engine akan melakukan hal berikut:
- Compute Engine menghapus reservasi.
- Berdasarkan tindakan penghentian yang Anda tentukan untuk VM, Compute Engine akan menghentikan atau menghapus VM apa pun yang menggunakan reservasi.
Workload ideal
- Model dasar pra-pelatihan
- Inferensi untuk model dasar di beberapa host
Karakteristik utama
- Model penyediaan: Terikat reservasi.
- Dukungan mesin premium: pesan jenis mesin A4X Max, A4X, A4, A3 Ultra, A3 Mega, atau A3 High (8 GPU).
- Persyaratan komitmen: lampirkan komitmen berbasis resource untuk reservasi selama satu tahun atau lebih.
- Modifikasi dinamis: aktifkan notifikasi pemeliharaan darurat hardware untuk penggunaan tugas Vertex AI setelah periode dimulai.
Menggunakan reservasi untuk masa mendatang dalam mode kalender
Untuk menjalankan workload terdistribusi berdurasi singkat yang memerlukan alokasi resource padat, Anda dapat meminta resource komputasi hingga 90 hari. Anda memiliki akses eksklusif ke resource yang dipesan untuk jangka waktu tersebut, dan Anda dapat menggunakan resource untuk membuat VM atau cluster. Pada akhir periode reservasi, Compute Engine akan melakukan hal berikut:
- Compute Engine menghapus reservasi.
- Berdasarkan tindakan penghentian yang Anda tentukan untuk VM, Compute Engine akan menghentikan atau menghapus VM apa pun yang menggunakan reservasi.
Workload ideal
- Pra-pelatihan dan fine-tuning
- Simulasi dan inferensi berskala besar
Karakteristik utama
- Model penyediaan: Terikat reservasi.
- Dukungan seri mesin: pesan jenis mesin A4, A3 Ultra, A3 Mega, atau A3 High (8 GPU) jenis mesin.
- Batas skalabilitas: pesan hingga 80 VM selama maksimum 90 hari.
- Penyediaan yang dioptimalkan: gunakan model terikat reservasi untuk meningkatkan peluang Anda mendapatkan GPU.
Menggunakan Flex-start
Gunakan Flex-start untuk permintaan perubahan ukuran grup instance terkelola (MIG) bercluster saat Anda memerlukan alokasi resource padat hingga tujuh hari.
Workload ideal
VM Flex-start ideal untuk menjalankan workload yang dapat dimulai kapan saja, seperti berikut:
- Pra-pelatihan model kecil
- Fine-tuning model
- Simulasi komputasi berperforma tinggi (HPC)
- Inferensi batch
Karakteristik utama
- Model penyediaan: Flex-start.
- Alokasi resource: dialokasikan secara padat untuk permintaan perubahan ukuran MIG.
- Efisiensi biaya: Anda akan menerima diskon hingga 53% untuk vCPU, memori, GPU, dan disk SSD Lokal terlampir untuk seri mesin A4, A3, A2, dan G4. Tarif sesuai permintaan standar berlaku untuk seri mesin lain yang didukung.
Menggunakan Spot
Anda dapat menggunakan Spot VM untuk workload fault-tolerant yang dialokasikan secara padat untuk mendapatkan diskon besar, dengan pemahaman bahwa Compute Engine dapat melakukan preempt VM untuk memulihkan kapasitas.
Workload ideal
- Pelatihan terdistribusi yang fault-tolerant
- Batch processing
Karakteristik utama
- Model penyediaan: Spot.
- Preemption: Compute Engine dapat melakukan preempt instance kapan saja.
- Efisiensi biaya: dapatkan diskon hingga 91% untuk vCPU, memori, GPU, dan disk SSD Lokal terlampir
Langkah berikutnya
- Untuk mengidentifikasi kebutuhan workload Anda, lihat Mengidentifikasi kebutuhan workload Anda.
- Untuk membuat dan menggunakan reservasi, lihat Membuat dan menggunakan reservasi.
- Untuk mempelajari Spot VM lebih lanjut, lihat Mempelajari Spot VM lebih lanjut.
- Untuk membuat instance VM sesuai permintaan, lihat Membuat instance VM sesuai permintaan.