Tutorial ini memberikan panduan langkah demi langkah untuk menjalankan pelatihan reinforcement learning (RL) pada satu instance virtual machine (VM) Tensor Processing Unit (TPU) di Google Cloud dengan menggunakan MaxText, sebuah stack pelatihan berbasis JAX berperforma tinggi untuk model bahasa besar (LLM).v6e-8
Tujuan
- Siapkan instance VM Cloud TPU.
- Instal MaxText dan dependensinya.
- Mengonversi model Hugging Face ke format MaxText.
- Jalankan workload Pengoptimalan Kebijakan Relatif Grup (GRPO) RL di TPU.
- Konversi model terlatih kembali ke format Hugging Face untuk inferensi.
Biaya
Dalam dokumen ini, Anda akan menggunakan komponen Google Cloudyang dapat ditagih berikut:
Untuk membuat perkiraan biaya berdasarkan proyeksi penggunaan Anda,
gunakan kalkulator harga.
Setelah menyelesaikan tugas yang dijelaskan dalam dokumen ini, Anda dapat menghindari penagihan berkelanjutan dengan menghapus resource yang Anda buat. Untuk mengetahui informasi selengkapnya, lihat Pembersihan.
Sebelum memulai
Anda memerlukan token akses Hugging Face untuk menggunakan tutorial ini. Anda dapat mendaftar untuk mendapatkan akun gratis di Hugging Face. Setelah Anda memiliki akun, buat token akses:
- Di halaman Welcome to Hugging Face, klik avatar akun Anda, lalu pilih Access tokens.
- Di halaman Access tokens, klik Create new token.
- Pilih jenis token Baca dan masukkan nama untuk token Anda.
- Token akses Anda akan ditampilkan. Simpan token di tempat yang aman.
- Di situs Hugging Face, setujui perjanjian lisensi untuk model yang ingin Anda latih. Tutorial ini menggunakan
model
llama3.1-8b-Instruct.
Untuk mendapatkan izin yang Anda perlukan untuk menyelesaikan tutorial ini, minta administrator Anda untuk memberi Anda peran IAM berikut di project Anda:
- TPU Admin (
roles/tpu.admin) - Service Account User (
roles/iam.serviceAccountUser) - Compute Editor (
roles/compute.editor)
Untuk mengetahui informasi selengkapnya tentang pemberian peran, lihat Mengelola akses ke project, folder, dan organisasi.
Anda mungkin juga bisa mendapatkan izin yang diperlukan melalui peran khusus atau peran bawaan lainnya.
Menyiapkan lingkungan
Siapkan variabel lingkungan Anda dengan menjalankan skrip berikut:
Ganti kode berikut:
- YOUR_PROJECT_ID: Project ID Google Cloud Anda
- ZONE_NAME: zona yang ingin Anda gunakan
- RESERVATION_NAME: reservasi kapasitas Anda
- TPU_MACHINE_NAME: nama instance VM Cloud TPU Anda
Lakukan autentikasi dengan Google Cloud menjalankan perintah berikut:
gcloud auth login
Buat VM Cloud TPU
Buat instance VM Cloud TPU dengan 8 chip TPU v6e, yang terikat dengan reservasi kapasitas Anda.
Setelah instance VM dibuat, hubungkan ke instance tersebut menggunakan SSH.
Selesaikan langkah-langkah berikut dalam instance VM TPU Anda.
Menginstal MaxText
Update paket sistem dalam instance VM TPU.
Instal Python 3.12, yang diperlukan MaxText, dan paket lingkungan virtualnya.
Gunakan uv untuk mempercepat penginstalan paket Python.
Buat lingkungan virtual bernama maxtext_venv dan aktifkan.
Instal MaxText dan dependensi yang diperlukan untuk tugas pasca-pelatihan.
Instal dependensi wajib yang tersisa dengan menjalankan perintah berikut:
Mengonversi model ke format MaxText
Untuk melatih model dalam format MaxText, Anda harus mengonversinya dari format Hugging Face ke format MaxText.
Berikan nilai berikut:
- Token akses Hugging Face Anda
- Nama model yang ingin Anda gunakan
- Direktori tempat Anda ingin menyimpan model dalam format MaxText
- Opsi untuk pemuatan dan penyimpanan
Ganti YOUR_HF_TOKEN dengan token akses Hugging Face yang Anda buat sebelumnya.
Untuk mengonversi model dari format Hugging Face ke format MaxText, jalankan skrip berikut. Konversi ini membutuhkan waktu sekitar lima menit hingga selesai.
Mulai workload pelatihan
Setelah proses konversi selesai, Anda dapat memulai workload RL.
Konfigurasi parameter pelatihan workload RL.
Mulai tugas pelatihan. Proses ini memerlukan waktu sekitar 10 menit di instance VM
v6e-8.
Mengonversi kembali model terlatih ke format Hugging Face
Setelah beban kerja pelatihan selesai, konversi model kembali ke format Hugging Face.
Tetapkan jalur untuk ekspor dan parameter terlatih.
Jalankan konversi kembali ke format Hugging Face.
Setelah konversi selesai, model yang disesuaikan dan disimpan di
/dev/shm/$MODEL_NAME/hf-trained siap digunakan. Karena Anda kehilangan akses ke
isi folder /dev/shm saat VM di-reboot, Anda harus memindahkan
model yang disesuaikan ke penyimpanan persisten atau menguploadnya ke Hugging Face Hub.
Pembersihan
Agar tidak menimbulkan biaya tambahan, hapus resource yang dibuat selama tutorial ini.
Menghapus instance VM TPU
Hapus instance VM Cloud TPU Anda.
Langkah berikutnya
- Untuk mengetahui informasi selengkapnya tentang Cloud TPU, lihat Pengantar Cloud TPU.
- Untuk mengetahui detail arsitektur dan konfigurasi TPU
v6e-8, lihat TPU v6e.