Untuk membantu Anda menjalankan workload AI/ML proof-of-concept (POC), halaman ini memberikan ringkasan tutorial AI Hypercomputer yang menjelaskan proses lengkap deployment model AI umum di produk. Google Cloud
Tutorial ini dirancang untuk engineer machine learning (ML), peneliti, administrator dan operator platform, serta spesialis data dan AI. Untuk menggunakan tutorial ini secara efektif, Anda harus memiliki pemahaman dasar tentang konsep machine learning dan kemahiran dalam menggunakan layanan. Google Cloud Pengalaman dalam men-deploy dan mengelola model AI juga membantu Anda memahami konten ini.
Kategori tutorial
Tutorial workload AI diatur ke dalam kategori berikut:
Menjalankan inferensi dengan vLLM di GKE
Tutorial ini menjelaskan cara men-deploy dan menyajikan model bahasa besar (LLM) untuk inferensi menggunakan framework penyajian vLLM di Google Kubernetes Engine (GKE). Anda akan mempelajari cara menggunakan kemampuan orkestrasi container GKE untuk workload inferensi yang efisien. Tutorial ini mencakup cara mengakses model menggunakan Hugging Face, menyiapkan cluster GKE (misalnya, dalam mode Autopilot), menangani kredensial, dan men-deploy container vLLM untuk interaksi dengan LLM seperti Gemma 3, Llama 4, dan Qwen3.
Menjalankan penyesuaian
Tutorial ini menjelaskan cara menyesuaikan LLM untuk tugas tertentu di berbagai Google Cloud jenis cluster, termasuk GKE dan Slurm. Misalnya, Anda dapat menyesuaikan Gemma 3 di cluster GKE multi-node dan multi-GPU (misalnya, menggunakan instance VM A4 dengan GPU NVIDIA B200 ) dan cluster Slurm. Anda akan membuat image VM kustom, mengonfigurasi jaringan RDMA, dan menjalankan tugas penyesuaian terdistribusi dengan library seperti Hugging Face Accelerate dan FSDP. Beberapa tutorial juga membahas penggunaan framework seperti Ray untuk tugas terkait visi.
Menjalankan pelatihan
Tutorial ini menjelaskan cara melatih atau melakukan pra-pelatihan LLM di cluster berperforma tinggi. Misalnya, Anda akan mempelajari cara melakukan pra-pelatihan model seperti Qwen2 di cluster Slurm multi-node dan multi-GPU dengan virtual machine A4. Anda akan men-deploy cluster Slurm menggunakan Google Cloud Cluster Toolkit, membuat image VM kustom, mengonfigurasi instance Filestore bersama, mengonfigurasi jaringan RDMA berkecepatan tinggi, dan menjalankan tugas pra-pelatihan terdistribusi dengan Hugging Face Accelerate.
Langkah berikutnya
Pelajari tutorial AI Hypercomputer:
- Menggunakan vLLM di GKE untuk menyajikan inferensi Gemma 3 27B
- Menyesuaikan Gemma 3 di cluster GKE A4
- Melatih Qwen2 di cluster Slurm A4
- Menyajikan Qwen2-72B dengan vLLM di TPU