AI Hypercomputer memiliki beberapa opsi pemakaian untuk mendapatkan resource komputasi. Opsi ini memenuhi kebutuhan seperti durasi workload, toleransi kesalahan, dan model infrastruktur. Pelajari opsi ini dan pilih opsi terbaik untuk kasus penggunaan Anda.
Ringkasan opsi pemakaian
Untuk membandingkan opsi pemakaian berdasarkan karakteristik utama, gunakan tabel berikut:
| Opsi pemakaian | Model penyediaan | Paling cocok untuk | Jaminan kapasitas | Masa aktif | Preemptible | Kuota | Diskon | Model alokasi |
|---|---|---|---|---|---|---|---|---|
| Flex-start | Flex-start | Workload berdurasi singkat hingga tujuh hari yang dapat menunggu kapasitas. | Upaya terbaik | Hingga tujuh hari | Tidak | Kuota preemptible | Diskon (hingga 53%) untuk seri yang didukung | Padat untuk permintaan perubahan ukuran MIG; upaya terbaik untuk VM mandiri. |
| Spot VM | Spot | Workload GPU umum yang fault-tolerant dan berdurasi singkat. | Upaya terbaik | Preemptible | Ya | Kuota preemptible | Diskon besar (hingga 91%) | Standar |
| Reservasi standar | Standar | Workload GPU umum penting yang memerlukan tingkat jaminan kapasitas yang sangat tinggi. | Sangat tinggi | Sangat tinggi | Ditentukan pengguna | Tidak | Tidak ada kuota yang digunakan | Tarif diskon dengan diskon abonemen (CUD) |
| Pemesanan untuk masa mendatang untuk blok kapasitas | Terikat dengan reservasi | Pelatihan berskala besar dan berjalan lama di GPU yang dikelompokkan. | Sangat tinggi | Tanpa batas selama periode reservasi. | Tidak | Ditingkatkan secara otomatis | Diskon (hingga 53%) dengan CUD | Padat |
| Pemesanan untuk masa mendatang dalam mode kalender | Terikat dengan reservasi | workload GPU yang dikelompokkan hingga 90 hari yang memerlukan kapasitas yang dicadangkan. | Sangat tinggi | Hingga 90 hari | Tidak | Tidak ada kuota yang digunakan | Diskon (hingga 53%) | Padat |
| VM sesuai permintaan | Standar | workload GPU umum tanpa durasi tertentu. | Upaya terbaik | Tidak terbatas | Tidak | Kuota sesuai permintaan | Tidak ada (bayar sesuai penggunaan) | Standar |
Opsi pemakaian yang Anda gunakan untuk men-deploy infrastruktur bergantung pada apakah Anda menggunakan GPU Umum atau GPU Berkelompok.
GPU Umum: dirancang untuk inferensi, pengembangan, dan workload pelatihan skala kecil. Jenis GPU ini menawarkan fleksibilitas operasional melalui pemeliharaan asinkron. Untuk melihat opsi yang tersedia, lihat Opsi konsumsi untuk GPU umum.
GPU bercluster: dirancang untuk workload pelatihan skala besar yang terikat erat dan inferensi, RL, serta workload model penalaran skala besar yang memerlukan jaminan kapasitas tinggi dan alokasi resource padat untuk meminimalkan latensi jaringan. Untuk melihat opsi yang tersedia, lihat Opsi penggunaan untuk GPU yang dikelompokkan.
Opsi pemakaian untuk GPU umum
Gunakan opsi konsumsi berikut untuk mendapatkan kapasitas GPU umum.
Menggunakan Flex-start
Untuk menjalankan workload berdurasi singkat yang memerlukan resource yang dialokasikan secara padat, Anda dapat meminta resource komputasi hingga tujuh hari menggunakan flex-start. Setiap kali resource tersedia, Compute Engine akan membuat VM dalam jumlah yang Anda minta. Anda dapat menghentikan VM Flex-start mandiri, tetapi Anda tidak dapat menghentikan VM Flex-start yang dibuat oleh grup instance terkelola (MIG) melalui permintaan pengubahan ukuran. VM mulai fleksibel akan ada hingga Anda menghapusnya, atau hingga Compute Engine menghapus VM di akhir durasi jalannya.
Workload ideal
- Pra-pelatihan model kecil
- Penyesuaian model
- Simulasi komputasi berperforma tinggi (HPC)
- Inferensi batch
Karakteristik utama
- Model penyediaan: Flex-start.
- Dukungan hardware yang luas: minta jenis mesin GPU bercluster apa pun, kecuali A4X Max dan A4X.
- Pengoptimalan latensi: terapkan kebijakan penempatan rapat ke VM mandiri untuk meminimalkan latensi jaringan.
- Efisiensi biaya: dapatkan diskon hingga 53% untuk vCPU, memori, GPU, dan disk SSD Lokal untuk seri mesin A4, A3, A2, dan G4. Tarif on-demand standar berlaku untuk seri lain yang didukung. Untuk mengetahui informasi selengkapnya, lihat Harga flex-start.
Menggunakan Spot
Untuk menjalankan workload fault-tolerant, Anda bisa mendapatkan resource komputasi secara langsung berdasarkan ketersediaan. Anda mendapatkan resource dengan harga serendah mungkin. Namun, Compute Engine dapat melakukan preempt VM kapan saja untuk memulihkan kapasitas.
Workload ideal
- Batch processing dan analisis data
- Komputasi berperforma tinggi (HPC) dan encoding media
Karakteristik utama
- Model penyediaan: Spot.
- Dukungan hardware yang luas: minta jenis mesin GPU bercluster apa pun, kecuali A4X Max dan A4X.
- Pengoptimalan latensi: terapkan kebijakan penempatan rapat ke VM mandiri untuk meminimalkan latensi jaringan.
- Efisiensi biaya: dapatkan diskon hingga 91% untuk vCPU, memori, GPU, dan disk SSD Lokal.
Menggunakan on-demand
Tips: Untuk meningkatkan peluang Anda mendapatkan kapasitas GPU umum, gunakan Flex-start atau Spot. Opsi penggunaan ini menawarkan GPU dengan harga diskon dibandingkan dengan harga on-demand, dan dirancang untuk membantu meningkatkan peluang Anda mendapatkan resource dengan permintaan tinggi seperti GPU.
Untuk menjalankan workload tanpa durasi tertentu, Anda bisa mendapatkan resource komputasi secara langsung berdasarkan ketersediaan. VM berjalan hingga Anda menghentikan atau menghapusnya.
Workload ideal
- Inferensi dan penyajian model
- Pembuatan prototipe dan eksperimen
Karakteristik utama
- Model penyediaan: Standar.
- Ketersediaan langsung: buat instance VM secara langsung tanpa menunggu penjadwalan atau persetujuan kapasitas.
- Harga standar: bayar resource dengan tarif on-demand standar tanpa komitmen jangka panjang.
- Dukungan hardware yang luas: gunakan dengan seri mesin GPU yang didukung di jalur GPU umum.
Menggunakan reservasi standar
Untuk menjalankan workload GPU umum penting yang memerlukan tingkat jaminan kapasitas yang sangat tinggi, Anda dapat menggunakan reservasi standar.
Workload ideal
- Workload produksi penting
- Workload yang memerlukan kapasitas terjamin
Karakteristik utama
- Model penyediaan: Standar.
- Jaminan kapasitas: memberikan jaminan yang sangat tinggi bahwa resource tersedia.
- Harga: tarif standar berlaku, tetapi Anda dapat melampirkan CUD untuk mendapatkan penghematan.
Opsi pemakaian untuk GPU bercluster
Gunakan opsi penggunaan berikut untuk mendapatkan kapasitas GPU berkluster.Menggunakan pemesanan untuk masa mendatang untuk blok kapasitas
Untuk menjalankan workload terdistribusi berskala besar dan berjalan lama yang memerlukan alokasi resource yang padat, Anda dapat meminta resource komputasi untuk waktu tertentu di masa mendatang. Anda memiliki akses eksklusif ke resource yang dipesan selama jangka waktu tersebut, dan Anda dapat menggunakan resource untuk membuat VM atau cluster. Di akhir periode pemesanan, Compute Engine melakukan hal berikut:
- Compute Engine akan menghapus pemesanan.
- Berdasarkan tindakan penghentian yang Anda tentukan untuk VM, Compute Engine akan menghentikan atau menghapus VM apa pun yang menggunakan reservasi.
Workload ideal
- Model dasar pra-pelatihan
- Inferensi untuk model dasar di beberapa host
Karakteristik utama
- Model penyediaan: Terikat dengan reservasi.
- Dukungan mesin premium: pesan jenis mesin A4X Max, A4X, A4, A3 Ultra, A3 Mega, atau A3 High (8 GPU).
- Persyaratan komitmen: lampirkan komitmen berbasis resource untuk pemesanan selama satu tahun atau lebih.
- Modifikasi dinamis: Aktifkan notifikasi pemeliharaan darurat hardware untuk penggunaan tugas Vertex AI setelah periode dimulai.
Menggunakan pemesanan untuk masa mendatang dalam mode kalender
Untuk menjalankan workload terdistribusi yang berjalan singkat dan memerlukan alokasi resource yang padat, Anda dapat meminta resource komputasi hingga 90 hari. Anda memiliki akses eksklusif ke resource yang dipesan selama waktu tersebut, dan Anda dapat menggunakan resource untuk membuat VM atau cluster. Di akhir periode pemesanan, Compute Engine melakukan hal berikut:
- Compute Engine akan menghapus reservasi.
- Berdasarkan tindakan penghentian yang Anda tentukan untuk VM, Compute Engine akan menghentikan atau menghapus VM apa pun yang menggunakan reservasi.
Workload ideal
- Pelatihan awal dan fine-tuning
- Simulasi dan inferensi berskala besar
Karakteristik utama
- Model penyediaan: Terikat dengan reservasi.
- Dukungan seri mesin: pesan jenis mesin A4, A3 Ultra, A3 Mega, atau A3 High (8 GPU).
- Batasan skalabilitas: cadangkan hingga 80 VM selama maksimum 90 hari.
- Penyediaan yang dioptimalkan: gunakan model terikat reservasi untuk meningkatkan peluang Anda mendapatkan GPU.
Menggunakan Flex-start
Gunakan flex-start untuk permintaan perubahan ukuran grup instance terkelola (MIG) yang dikelompokkan saat Anda memerlukan resource yang dialokasikan secara padat hingga tujuh hari.
Workload ideal
VM mulai fleksibel ideal untuk menjalankan workload yang dapat dimulai kapan saja, seperti berikut:
- Pra-pelatihan model kecil
- Penyesuaian model
- Simulasi komputasi berperforma tinggi (HPC)
- Inferensi batch
Karakteristik utama
- Model penyediaan: Flex-start.
- Alokasi resource: dialokasikan secara padat untuk permintaan perubahan ukuran MIG.
- Efisiensi biaya: dapatkan diskon hingga 53% untuk vCPU, memori, GPU, dan disk SSD Lokal yang terpasang untuk seri mesin A4, A3, A2, dan G4. Tarif on-demand standar berlaku untuk seri lain yang didukung.
Menggunakan Spot
Anda dapat menggunakan Spot VM untuk workload fault-tolerant yang dialokasikan secara padat untuk mendapatkan diskon besar, dengan pemahaman bahwa Compute Engine dapat melakukan preempt VM untuk memulihkan kapasitas.
Workload ideal
- Pelatihan terdistribusi yang fault-tolerant
- Batch processing
Karakteristik utama
- Model penyediaan: Spot.
- Preemption: Compute Engine dapat melakukan preemption pada instance kapan saja.
- Efisiensi biaya: dapatkan diskon hingga 91% untuk vCPU, memori, GPU, dan disk SSD Lokal yang terpasang
Langkah berikutnya
- Untuk mengidentifikasi kebutuhan workload Anda, lihat Mengidentifikasi kebutuhan workload Anda.
- Untuk membuat dan menggunakan reservasi, lihat Membuat dan menggunakan reservasi.
- Untuk mempelajari Spot VM lebih lanjut, lihat Pelajari Spot VM lebih lanjut.
- Untuk membuat instance VM sesuai permintaan, lihat Membuat instance VM sesuai permintaan.