Merencanakan dan membuat infrastruktur AI Anda

Dokumen ini merangkum cara membuat cluster untuk workload AI Anda di AI Hypercomputer. Secara khusus, dokumen ini memandu Anda melalui proses dan pilihan yang harus dibuat saat Anda memulai cluster. Sebagai alternatif untuk evaluasi manual, Anda dapat meminta Gemini di konsol Google Cloud untuk membandingkan opsi penggunaan untuk workload dan anggaran Anda. Untuk mengetahui informasi selengkapnya, lihat Mendesain infrastruktur AI dengan Compute Advisor.

Dokumen ini mengasumsikan bahwa Anda sudah memahami terminologi yang umum digunakan untuk workload AI dan ML, seperti pelatihan model dan inferensi. Panduan ini juga mengasumsikan bahwa Anda telah mengidentifikasi workload AI tertentu yang memerlukan penentuan jenis mesin dan kebutuhan kapasitas yang optimal untuk deployment Anda—misalnya, pra-pelatihan, fine-tuning, atau inferensi model dasar.

Mulai cluster

Memulai cluster melibatkan langkah-langkah berikut:

  1. Tentukan beban kerja Anda dan pilih jenis mesin
  2. Memilih opsi pemakaian dan mendapatkan kapasitas
  3. Memilih opsi deployment
  4. Memilih orchestrator
  5. Pilih sistem operasi dan image cluster
  6. Membuat cluster Anda
  7. Menyediakan penyimpanan untuk workload Anda

Tentukan workload Anda dan pilih jenis mesin

Pilih jenis mesin untuk workload AI Anda. AI Hypercomputer mendukung pembuatan cluster untuk GPU yang dikelompokkan dan GPU umum.

Untuk membantu Anda memilih, tentukan persyaratan beban kerja Anda dan sesuaikan dengan jenis mesin dan jenis GPU yang direkomendasikan:

  • GPU yang di-cluster: paling cocok untuk workload skala besar dan berperforma tinggi seperti pra-pelatihan model dasar, penyesuaian model besar, dan inferensi di beberapa host.
  • GPU Umum: paling cocok untuk inferensi dan penayangan mainstream, Retrieval-Augmented Generation (RAG), serta pelatihan dan penyesuaian model kecil hingga sedang yang hemat biaya.

Untuk mencocokkan workload Anda dengan jenis mesin yang direkomendasikan, gunakan tabel ini:

Jenis GPU Beban kerja atau kasus penggunaan Jenis mesin yang direkomendasikan
GPU ter-cluster Model dasar pra-pelatihan dan inferensi di beberapa host A4X Max (NVIDIA GB300)*, A4X (NVIDIA GB200)*
Pelatihan, penyesuaian, dan inferensi model besar A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 141GB)
Inferensi dan penyesuaian model mainstream A3 Mega (NVIDIA H100 80GB), A3 High (NVIDIA H100 80GB)
GPU Umum Inferensi dan penayangan di edge dengan throughput tinggi A3 Edge (NVIDIA H100 80GB)
Penayangan satu node berperforma tinggi dan penyesuaian skala kecil A2 (NVIDIA A100)
Inferensi tingkat entri yang dioptimalkan untuk biaya G4 (NVIDIA RTX PRO 6000), N1 (NVIDIA T4 atau V100)
Inferensi umum, RAG, dan pelatihan model kecil hingga sedang G2 (NVIDIA L4)

Untuk mengetahui informasi mendetail tentang setiap seri mesin, lihat Tentang akselerator GPU.

Memilih opsi pemakaian dan mendapatkan kapasitas

Pilih opsi pemakaian untuk resource GPU Anda berdasarkan jenis mesin yang dipilih dan apakah Anda menggunakan GPU Umum atau GPU Berkelompok.

Opsi pemakaian untuk GPU umum

Opsi pemakaian Tersedia untuk Paling cocok untuk Cara mengajukan permintaan
Sesuai permintaan Semua GPU umum. Workload yang tidak memerlukan kapasitas terjamin. Buat instance komputasi atau cluster dan tentukan model penyediaan standar. Untuk mengetahui petunjuknya, lihat Membuat instance VM.

Tips: Untuk meningkatkan peluang Anda mendapatkan kapasitas GPU umum, gunakan Mulai fleksibel atau Spot.
Pemesanan standar dan pemesanan untuk masa mendatang standar Semua GPU umum. Workload yang memerlukan kapasitas terjamin baik secara langsung (pemesanan standar) atau untuk tanggal tertentu di masa mendatang (pemesanan standar untuk masa mendatang). Buat permintaan pemesanan on-demand atau pemesanan untuk masa mendatang. Untuk mengetahui petunjuknya, lihat Mereservasi kapasitas.
Flex-start Semua jenis mesin GPU kecuali A4X Max dan A4X. Workload yang memerlukan cluster padat jangka pendek yang berlangsung hingga tujuh hari. Menawarkan alokasi resource padat dan diskon hingga 53% untuk jenis mesin yang didukung; jika tidak, tarif on-demand standar berlaku. Buat permintaan menggunakan Compute Engine, Cluster Director, Cluster Toolkit, atau GKE. Resource disediakan segera setelah tersedia (waktu mulai tidak langsung). Untuk mengetahui petunjuknya, lihat Mendapatkan kapasitas.
Spot Semua jenis mesin GPU kecuali A4X Max dan A4X. Workload yang fault-tolerant, batch, atau berumur singkat. Menawarkan diskon terbesar (antara 61% dan 90%), tetapi resource komputasi dapat dihentikan kapan saja. Buat instance atau node pool secara langsung menggunakan model penyediaan Spot. Untuk mengetahui petunjuknya, lihat Mendapatkan kapasitas.

Opsi pemakaian untuk GPU ter-cluster

Opsi pemakaian Tersedia untuk Paling cocok untuk Cara mengajukan permintaan
Pemesanan untuk masa mendatang untuk blok kapasitas Semua jenis mesin A3 Edge dan GPU yang dikelompokkan. Workload yang memerlukan stabilitas dalam jangka waktu yang lama, seperti pra-pelatihan model dasar atau inferensi model dasar di beberapa host. Metode reservasi ini menawarkan alokasi resource padat dan kumpulan Hyperdisk opsional, serta diskon untuk vCPU, memori, GPU, disk SSD Lokal, dan kumpulan Hyperdisk jika Anda memesan resource selama 365 hari atau lebih. Minta resource melalui tim akun Google Anda untuk tanggal dan waktu mendatang, serta untuk durasi 90 hari atau lebih.
Pemesanan untuk masa mendatang dalam mode kalender Semua GPU yang dikelompokkan kecuali A4X Max dan A4X. Workload yang berjalan hingga 90 hari dan memerlukan stabilitas, seperti model pra-pelatihan atau fine-tuning. Menawarkan alokasi resource padat dan diskon hingga 53%. Buat permintaan pemesanan layanan mandiri untuk tanggal dan waktu di masa mendatang; Google Cloud harus menyetujui permintaan tersebut. Untuk mengetahui petunjuknya, lihat Mereservasi kapasitas.
Flex-start Semua jenis mesin GPU kecuali A4X Max dan A4X. Workload yang memerlukan cluster padat dan berumur pendek yang berlangsung hingga tujuh hari. Menawarkan alokasi resource padat dan diskon hingga 53% untuk jenis mesin yang didukung; jika tidak, tarif on-demand standar berlaku. Buat permintaan menggunakan Compute Engine, Cluster Director, Cluster Toolkit, atau GKE. Resource disediakan segera setelah tersedia (waktu mulai tidak langsung). Untuk mendapatkan petunjuk, lihat Mendapatkan kapasitas.
Spot Semua jenis mesin GPU kecuali A4X Max dan A4X. Workload yang fault-tolerant, batch, atau berumur singkat. Menawarkan diskon terbesar (antara 61% dan 90%), tetapi resource komputasi dapat dihentikan kapan saja. Buat instance atau node pool secara langsung menggunakan model penyediaan Spot. Untuk mengetahui petunjuknya, lihat Mendapatkan kapasitas.

Memilih opsi deployment

Bergantung pada tingkat kontrol yang Anda butuhkan atas deployment cluster, pilih salah satu opsi berikut:

Dikelola secara intensif

Opsi deployment yang dikelola sepenuhnya mengotomatiskan penyiapan dan orkestrasi resource komputasi, jaringan, dan penyimpanan Anda, sehingga mengurangi overhead operasional pengelolaan cluster. Untuk men-deploy dan mengonfigurasi infrastruktur Anda, gunakan Cluster Director, Cluster Toolkit, atau GKE.

  • Cluster Director: produk Google Cloud yang mengotomatiskan penyiapan dan konfigurasi cluster yang kompleks, sehingga membantu Anda mengonfigurasi resource komputasi, jaringan, dan penyimpanan untuk cluster Anda guna memaksimalkan performa dan meminimalkan waktu non-operasional. Cluster Director dirancang untuk administrator IT dan peneliti AI yang ingin menghindari overhead pengelolaan cluster, dan berfokus pada menjalankan workload mereka.

  • Cluster Toolkit: alat open source yang ditawarkan oleh Google yang menyederhanakan konfigurasi dan deployment cluster untuk GKE atau Compute Engine. Anda menggunakan blueprint yang telah ditentukan sebelumnya untuk men-deploy konfigurasi umum, seperti jenis mesin A4 dengan Slurm. Anda dapat mengubah cetak biru untuk menyesuaikan deployment dan stack software Anda.

  • GKE: layanan Kubernetes terkelola dan platform orkestrasi container open source. GKE menawarkan fitur seperti penskalaan otomatis dan ketersediaan tinggi. Selain itu, alat ini juga dapat mengorkestrasi aplikasi yang di-container, mendukung hardware khusus, dan kompatibel dengan ekosistem Google Cloud, sehingga sangat cocok untuk men-deploy dan mengelola workload AI atau ML. Anda dapat men-deploy cluster GKE menggunakan GKE secara langsung atau menggunakan Cluster Toolkit.

Lebih sedikit dikelola, lebih banyak kontrol

Untuk kontrol yang lebih terperinci atas cluster dan software yang diinstal di dalamnya, buat cluster Compute Engine menggunakan grup instance terkelola (MIG) Compute Engine atau dengan membuat instance secara massal. Kemudian, instal secara manual software kunci yang Anda butuhkan di instance.

Memilih orchestrator

Orchestrator mengotomatiskan pengelolaan cluster Anda. Dengan orkestrator, Anda tidak perlu mengelola setiap instance komputasi di cluster. Orchestrator, seperti Slurm atau GKE, menangani tugas seperti antrean tugas, alokasi resource, penskalaan otomatis (dalam kasus GKE), dan tugas pengelolaan cluster sehari-hari lainnya.

  • Slurm: Slurm adalah pengelola open source yang umum digunakan untuk workload HPC, AI, atau ML. Untuk pengalaman Slurm terkelola, Anda dapat menggunakan Cluster Director. Untuk menggunakan Slurm secara native, Anda dapat menggunakan Cluster Toolkit (yang menawarkan blueprint cluster yang otomatis menginstal Slurm di cluster Anda), atau Anda dapat menginstal Slurm secara manual di cluster Compute Engine.

  • GKE: GKE adalah layanan terkelola yang dibangun di atas Kubernetes, platform orkestrasi container open source. GKE sangat ideal untuk men-deploy dan mengelola workload AI atau ML, karena kemampuannya untuk mengorkestrasi aplikasi dalam container, dukungan hardware khusus, dan posisinya dalam ekosistem Google Cloud. Anda dapat men-deploy cluster GKE menggunakan GKE secara langsung atau menggunakan Cluster Toolkit.

  • Bring your own orchestrator: untuk menggunakan orchestrator lain, gunakan cluster Compute Engine. Membuat cluster Compute Engine adalah opsi yang paling sedikit dikelola yang ditawarkan di Google Cloud. Pilihan ini berarti Anda bertanggung jawab untuk menyiapkan, memelihara, dan mengupdate instance Anda.

Pilih image sistem operasi

Image yang harus Anda gunakan bergantung pada infrastruktur GPU yang Anda gunakan (GPU yang dikelompokkan atau GPU umum) dan cara Anda berencana men-deploy cluster (GKE, Slurm, atau Compute Engine). Untuk cluster GKE, gunakan Container-Optimized OS. Untuk cluster Compute Engine dan Slurm, pilih image sistem operasi yang dioptimalkan untuk akselerator, seperti GPU. Selain itu, Anda dapat memilih image container Deep Learning Software Layer (DLSL) untuk workload Anda.

Untuk mengetahui informasi mendetail, tinjau gambar AI Hypercomputer.

Image untuk cluster GKE

Untuk membuat cluster GKE, gunakan image OS container default untuk mode Standard dan Autopilot. Namun, dalam mode Standar, Anda juga dapat memilih untuk menggunakan image lain yang tersedia, seperti Ubuntu.

Jika Anda menggunakan Cluster Toolkit untuk men-deploy cluster, Anda hanya dapat menggunakan image OS container, karena image ini adalah image yang terintegrasi dalam blueprint cluster. Untuk mengetahui informasi selengkapnya tentang setiap image node, lihat Image node dalam dokumentasi GKE.

GKE juga menawarkan image container Deep Learning Software Layer (DLSL) yang menginstal paket seperti NVIDIA CUDA dan NCCL, serta framework ML seperti PyTorch, sehingga menyediakan lingkungan yang siap digunakan untuk workload deep learning. Image container DLSL bawaan ini telah diuji dan diverifikasi agar berfungsi dengan lancar di cluster GKE.

OS image untuk cluster Compute Engine

AI Hypercomputer menawarkan image yang dioptimalkan untuk menjalankan workload AI dan ML menggunakan Compute Engine. Pilih OS yang paling Anda kuasai:

  • Akselerator Rocky Linux 9
  • Akselerator Rocky Linux 8
  • Akselerator Ubuntu 24.04 LTS
  • Akselerator Ubuntu 22.04 LTS

Jika Anda menggunakan Cluster Toolkit, image akselerator ini sudah digabungkan ke dalam cetak biru Cluster Toolkit, karena Cluster Toolkit membuat image kustom yang memperluas image OS Akselerator Ubuntu LTS.

Untuk mengetahui informasi selengkapnya tentang setiap image OS, lihat Detail sistem operasi di dokumentasi Compute Engine.

Membuat cluster Anda

Setelah meninjau proses pembuatan cluster dan membuat keputusan awal untuk workload, buat cluster menggunakan salah satu opsi berikut:

Menyediakan penyimpanan untuk workload Anda

Pilih layanan penyimpanan yang akan disediakan, berdasarkan persyaratan performa, biaya, dan arsitektur penyimpanan.