Cluster pelatihan Gemini Enterprise Agent Platform adalah layanan dari Google Cloud yang dirancang untuk menyederhanakan dan mempercepat workload AI/ML terbesar dan paling kompleks. Layanan ini dibuat khusus untuk mengatasi tantangan dalam pelatihan skala besar, seperti konfigurasi cluster yang kompleks, pengoptimalan framework, penanganan kegagalan hardware, dan integrasi kumpulan alat yang berbeda.
Proposisi nilai dan fitur utama
Cluster pelatihan Gemini Enterprise Agent Platform menawarkan beberapa manfaat inti:
UX Slurm open source dan transparansi cluster: Cluster pelatihan Gemini Enterprise Agent Platform menyediakan alat yang familiar dan fleksibel untuk meluncurkan dan mengelola tugas melalui pengalaman pengguna Slurm open source. Slurm adalah standar industri yang dikenal karena penjadwalan GPU yang dioptimalkan, toleransi fault otomatis, dan peluncuran tugas paralel yang disederhanakan.
Penyiapan dan konfigurasi cluster otomatis: Cluster pelatihan Gemini Enterprise Agent Platform mengotomatiskan penyiapan dan konfigurasi cluster, yang bertujuan untuk bertransisi dari reservasi ke pelatihan produksi dalam hitungan jam. Pengguna dapat membuat cluster menggunakan Google Cloud konsol (menggunakan arsitektur referensi atau konfigurasi langkah demi langkah) atau melalui panggilan API dengan file JSON.
Resep dan alur kerja ilmu data yang telah dikonfigurasi sebelumnya: Cluster pelatihan Gemini Enterprise Agent Platform mencakup alat yang dibuat khusus dan resep pelatihan yang dioptimalkan untuk memulai pelatihan untuk kasus penggunaan populer seperti model Llama dan Gemma, yang mencakup pra-pelatihan, SFT (Supervised Fine-Tuning), dan Reinforcement Learning (RL). Resep ini telah dikonfigurasi sebelumnya untuk performa state-of-the-art (SOTA) di Google Cloud Infrastruktur, yang menunjukkan peningkatan performa yang signifikan.
Ketahanan hardware dan waktu aktif yang tinggi: Cluster pelatihan Gemini Enterprise Agent Platform dirancang dengan ketahanan hardware untuk meningkatkan waktu aktif cluster. Layanan ini otomatis menyelesaikan masalah hardware, mendeteksi dan mengklasifikasikan berbagai mode kegagalan (misalnya, pemeriksaan kebenaran, pemeriksaan kecepatan, error Error-Correcting Code (ECC), pemeriksaan NVIDIA Data Center GPU Manager (DCGM), kapasitas ruang disk), dan memicu tindakan perbaikan seperti memulai ulang, membuat ulang image, atau mengganti node yang rusak, dan melanjutkan dari checkpoint. Hal ini membantu mengurangi peningkatan biaya dan penundaan yang signifikan yang disebabkan oleh gangguan tugas dan kegagalan hardware dalam pelatihan skala besar.
Arsitektur dan komponen: Cluster pelatihan Gemini Enterprise Agent Platform berjalan di infrastruktur Compute Engine yang mendukung GPU dan CPU. Layanan ini memanfaatkan orkestrator Slurm terkelola untuk men-deploy dan mengelola node komputasi, termasuk node login dan pekerja. Layanan ini terintegrasi dengan layanan lain Google Cloud seperti jaringan dan penyimpanan.
MLOps dan Observability: Terintegrasi dengan alat Vertex ML Ops seperti Gemini Enterprise Agent Platform Model Registry untuk pendaftaran, pelacakan, dan pembuatan versi alur kerja terlatih otomatis, serta Vertex AI Inference untuk deployment dengan penskalaan otomatis dan metrik otomatis. Cluster pelatihan juga memiliki integrasi observability otomatis dengan Vertex AI TensorBoard untuk memvisualisasikan proses pelatihan, melacak metrik, dan mengidentifikasi masalah sejak awal.
Cluster pelatihan dapat dibuat, diambil, dicantumkan, diperbarui, dan dihapus menggunakan Gemini Enterprise Agent Platform training clusters API. Setelah pembuatan cluster, pengguna dapat memvalidasi fungsinya dengan login ke node, menjalankan perintah Slurm dasar (misalnya, sinfo, sbatch), dan menjalankan workload terkait GPU (misalnya, nvidia-smi).
Cluster pelatihan Gemini Enterprise Agent Platform menyediakan API untuk meluncurkan tugas LLM bawaan menggunakan resep yang dioptimalkan untuk model seperti Llama dan Gemma, yang mendukung pra-pelatihan dan pra-pelatihan berkelanjutan dari checkpoint. Pemantauan tugas dapat dilakukan dengan login ke node login dan memeriksa file output serta perintah Slurm seperti squeue.
Terminologi
Bagian ini memberikan definisi untuk istilah dan konsep utama yang penting untuk memahami dan menggunakan cluster pelatihan Gemini Enterprise Agent Platform secara efektif. Istilah ini mencakup komponen layanan inti, pertimbangan arsitektur, teknologi penyimpanan terintegrasi, serta konsep machine learning (ML) dan MLOps mendasar yang mendukung lingkungan pelatihan Anda.
Konsep layanan inti
node
- Satu virtual machine (instance Compute Engine) dalam cluster. Dalam konteks Pelatihan Terkelola di cluster yang dicadangkan, node mengacu pada virtual machine (VM) individual yang berfungsi sebagai satu unit komputasi dalam cluster Anda. Anggap saja sebagai salah satu mesin pekerja khusus yang menjalankan sebagian tugas pelatihan Anda secara keseluruhan. Setiap node dilengkapi dengan resource tertentu seperti CPU, memori, dan akselerator (misalnya, GPU A3 atau A4), dan semuanya bekerja sama secara terkoordinasi untuk menangani tugas pelatihan terdistribusi skala besar.
node login
- Node login adalah titik entri utama bagi pengguna untuk mengakses cluster, mengirimkan tugas, dan mengelola file. Untuk mengetahui informasi selengkapnya, lihat Apa itu komputasi berperforma tinggi?.
partisi
- Di Slurm, pengelompokan node logis, yang sering digunakan untuk memisahkan node dengan konfigurasi hardware yang berbeda.
resep
- Dalam konteks Pelatihan Terkelola, resep adalah paket komprehensif dan dapat digunakan kembali yang berisi semua yang diperlukan untuk menjalankan workload pelatihan skala besar tertentu.
cluster Slurm
- Kumpulan instance Compute Engine, yang dikelola oleh Slurm, yang mencakup node login dan beberapa node pekerja yang dikonfigurasi untuk menjalankan tugas pelatihan. Untuk mengetahui informasi selengkapnya, lihat Pengelola workload Slurm.
worker node
- Worker node mengacu pada mesin atau instance komputasi individual dalam cluster yang bertanggung jawab untuk menjalankan tugas atau melakukan pekerjaan. Dalam sistem seperti cluster Kubernetes atau Ray, node adalah unit komputasi dasar. Untuk mengetahui informasi selengkapnya, lihat Apa itu komputasi berperforma tinggi (HPC)?.
Arsitektur dan jaringan
jaringan VPC konsumen
- Jaringan VPC konsumen adalah Virtual Private Cloud (VPC) Google Cloud yang mengakses layanan yang dihosting di VPC lain (dikenal sebagai VPC produsen) secara pribadi. Untuk mengetahui informasi selengkapnya, lihat Private Service Connect.
Unit transmisi maksimum (MTU)
- Ukuran paket data terbesar yang dapat ditransmisikan oleh perangkat yang terhubung ke jaringan. Ukuran MTU yang lebih besar (frame jumbo) dapat meningkatkan performa jaringan untuk workload tertentu. Untuk mengetahui informasi selengkapnya, lihat Unit transmisi maksimum.
akses layanan pribadi
- Akses layanan pribadi adalah koneksi pribadi antara jaringan Virtual Private Cloud (VPC) Anda dan jaringan yang dimiliki oleh Google atau penyedia layanan pihak ketiga. Hal ini memungkinkan instance virtual machine (VM) di jaringan VPC Anda berkomunikasi dengan layanan ini menggunakan alamat IP internal, sehingga menghindari paparan ke internet publik. Untuk mengetahui informasi selengkapnya, lihat Akses layanan pribadi.
Peering Jaringan VPC
- Koneksi jaringan yang memungkinkan dua jaringan VPC berkomunikasi secara pribadi. Dalam konteks Pelatihan Terkelola di cluster yang dicadangkan, Peering Jaringan VPC adalah komponen penting untuk mengintegrasikan layanan penting. Misalnya, ini adalah metode yang diperlukan untuk menghubungkan VPC cluster Anda ke instance Filestore, yang menyediakan direktori `/home` bersama yang diperlukan untuk semua node di cluster Anda.
zona
- Area deployment tertentu dalam region Google Cloud. Dalam konteks Pelatihan Terkelola di cluster yang dicadangkan, untuk mendapatkan performa terbaik, semua komponen layanan (cluster, Filestore, dan instance Managed Lustre) harus dibuat di zona yang sama.
Teknologi penyimpanan terintegrasi
Cloud Storage Fuse
- Adaptor FUSE open source yang memungkinkan Anda memasang bucket Cloud Storage sebagai sistem file di sistem Linux atau macOS. Untuk mengetahui informasi selengkapnya, lihat Cloud Storage Fuse.
Filestore
- Layanan penyimpanan file berperforma tinggi dan terkelola sepenuhnya dari Google Cloud, yang sering digunakan untuk aplikasi yang memerlukan sistem file bersama. Untuk mengetahui informasi selengkapnya, lihat Ringkasan Filestore.
Managed Lustre
- Sistem file paralel dan terdistribusi yang dirancang untuk komputasi berperforma tinggi. Managed Lustre Google Cloud menyediakan sistem file dengan throughput tinggi untuk workload yang menuntut. Untuk mengetahui informasi selengkapnya, lihat Ringkasan Managed Lustre.
tingkat performa
- Setelan konfigurasi untuk instance Managed Lustre yang menentukan kecepatan throughput-nya (dalam MBps per TiB) dan memengaruhi kapasitas minimum dan maksimumnya.
Konsep ML dan MLOps utama
checkpoint
- Data yang menangkap status parameter model selama pelatihan atau setelah pelatihan selesai. Misalnya, selama pelatihan, Anda dapat: 1. Menghentikan pelatihan, mungkin secara sengaja atau mungkin sebagai hasil dari error tertentu. 2. Mengambil checkpoint. 3. Kemudian, memuat ulang checkpoint, mungkin di hardware yang berbeda. 4. Memulai ulang pelatihan. Dalam Gemini, checkpoint mengacu pada versi tertentu dari model Gemini yang dilatih pada set data tertentu.
Supervised fine-tuning (SFT)
- Teknik machine learning yang melatih lebih lanjut model terlatih dengan set data berlabel yang lebih kecil untuk mengadaptasikannya ke tugas tertentu.
Vertex AI Inference
- Layanan Vertex AI yang memungkinkan Anda menggunakan model machine learning (ML) terlatih untuk membuat inferensi dari data baru yang belum pernah dilihat. Vertex AI menyediakan layanan untuk men-deploy model untuk inferensi. Untuk mengetahui informasi selengkapnya, lihat Mendapatkan inferensi dari model terlatih kustom.
Vertex AI Model Registry
- Vertex AI Model Registry adalah repositori pusat tempat Anda dapat mengelola siklus proses model ML. Dari Vertex AI Model Registry, Anda mendapatkan ringkasan model sehingga dapat mengatur, melacak, dan melatih versi baru dengan lebih baik. Jika memiliki versi model yang ingin di-deploy, Anda dapat menetapkannya ke endpoint langsung dari registry, atau dengan menggunakan alias, Anda dapat men-deploy model ke endpoint. Untuk mengetahui informasi selengkapnya, lihat Pengantar Vertex AI Model Registry.
Vertex AI TensorBoard
- Vertex AI TensorBoard adalah layanan terkelola dan skalabel di Google Cloud yang memungkinkan data scientist dan engineer ML memvisualisasikan eksperimen machine learning mereka, melakukan debug pelatihan model, dan melacak metrik performa menggunakan antarmuka TensorBoard open source yang familiar. Layanan ini terintegrasi dengan lancar dengan Vertex AI Training dan layanan lainnya, menyediakan penyimpanan persisten untuk data eksperimen dan memungkinkan analisis kolaboratif pengembangan model. Untuk mengetahui informasi selengkapnya, lihat Pengantar Vertex AI TensorBoard.