Tentang fine-tuning reinforcement learning untuk model Gemini

Reinforcement learning adalah teknik canggih untuk mengadaptasi model bahasa besar (LLM) guna memaksimalkan reward masukan yang diberikan oleh fungsi reward yang ditentukan pengguna. Model ini mengeksplorasi banyak kemungkinan jawaban, mengamati reward numerik untuk setiap jawaban, dan secara bertahap mengubah perilakunya sehingga jawaban dengan reward tinggi menjadi lebih mungkin dan jawaban dengan reward rendah menjadi kurang mungkin. Pendekatan ini unggul dalam skenario yang memerlukan penalaran multi-langkah, pengambilan keputusan yang rumit, atau pemahaman nuansa halus dalam perintah.

Penyesuaian reinforcement learning untuk Gemini memungkinkan Anda menyesuaikan Gemini dengan menggunakan perintah Anda sendiri dan fungsi reward yang ditentukan sendiri. Anda dapat menggunakannya untuk meningkatkan kemampuan penalaran dan kualitas output model Gemini untuk kasus penggunaan dan alur kerja berbasis agen Anda sendiri.

Cara kerjanya

Penyesuaian reinforcement learning beroperasi secara iteratif untuk menyempurnakan perilaku LLM. Selama setiap iterasi, model menghasilkan respons terhadap serangkaian perintah. Respons ini kemudian dievaluasi oleh fungsi reward yang ditentukan pengguna, yang mengukur kualitas output yang dihasilkan berdasarkan kriteria yang Anda inginkan. Layanan ini menggunakan sinyal reward ini untuk memperbarui parameter model melalui algoritma reinforcement learning, guna mendorong perilaku yang menghasilkan reward lebih tinggi. Proses iteratif pembuatan, evaluasi, dan pembaruan ini memungkinkan model mempelajari dan beradaptasi dengan kasus penggunaan spesifik Anda.

Diagram berikut menunjukkan alur kerja penyesuaian pembelajaran reinforcement secara keseluruhan:

Loop umpan balik penyesuaian reinforcement learning: model mengambil sampel output dari input tidak berlabel, fungsi reward (berbasis fungsi, berbasis LLM, atau kustom) memberi skor pada setiap output, dan langkah penyesuaian RL memperbarui bobot model melalui penurunan gradien kebijakan. Loop menghasilkan checkpoint LLM yang telah disesuaikan.
Siklus masukan penyesuaian reinforcement learning untuk model Gemini.

Fitur utama

  • Fungsi reward yang dapat disesuaikan: Tentukan fungsi reward Anda sendiri untuk mengoptimalkan secara tepat berbagai kasus penggunaan kustom dan menyelaraskan perilaku model dengan tujuan tertentu. Untuk mengetahui detail jenis reward yang didukung, lihat halaman Fungsi reward.

  • Adaptor untuk penyesuaian yang efisien: Penyesuaian reinforcement learning menggunakan adaptor, yang memungkinkan adaptasi yang efektif sekaligus menggunakan kembali infrastruktur penayangan yang ada.

  • Beberapa tingkat penalaran: Layanan ini mendukung penyesuaian pada dua tingkat penalaran, MINIMAL dan HIGH (penalaran dinamis), sehingga Anda dapat memilih pendekatan yang paling sesuai dengan tujuan pembelajaran model dan pola pembuatan respons yang diinginkan. Untuk mengetahui detailnya, lihat halaman Hyperparameter.

  • Penyesuaian berkelanjutan: Memperbaiki lebih lanjut model yang telah disesuaikan sebelumnya dengan menggabungkan contoh atau epoch pelatihan tambahan. Menggunakan model atau checkpoint yang sudah disesuaikan sebagai dasar memungkinkan proses eksperimen penyesuaian yang lebih efisien. Untuk mengetahui detailnya, lihat halaman Penyetelan berkelanjutan.

  • Set data multimodal: Mendukung modalitas data teks, gambar, video, dan audio.

Kapan menggunakan penyesuaian reinforcement learning

Penyesuaian reinforcement learning lebih disukai untuk menyesuaikan LLM dalam situasi ketika strategi optimal tidak jelas melalui supervised learning. Hal ini mencakup tugas yang tujuannya adalah mengoptimalkan metrik tertentu tanpa label kebenaran dasar yang tersedia, yang keselarasan dengan preferensi manusia sangat penting (dan metode penilaian ada), dan untuk tugas yang memerlukan penalaran berat yang diuntungkan dari peningkatan dan eksplorasi iteratif.

Berikut adalah beberapa skenario yang lebih memilih fine-tuning reinforcement learning:

  • Pemahaman petunjuk yang kompleks: Saat model perlu mengikuti petunjuk rumit yang output "benar"nya bukan satu jawaban, tetapi memerlukan serangkaian pemeriksaan. Reinforcement learning dapat membantu model mempelajari cara menavigasi set instruksi yang kompleks ini.

  • Pembuatan konten kreatif: Untuk tugas seperti membuat tulisan kreatif, puisi, atau kode yang sangat khusus, yang metrik objektifnya sulit ditentukan. Reinforcement learning, dengan fungsi reward yang dirancang dengan baik (yang berpotensi melibatkan masukan manusia atau evaluasi pakar), dapat memandu model menuju output yang lebih diinginkan dan inovatif.

  • Tugas penalaran: Untuk tugas yang memerlukan penalaran berat, seperti memecahkan teka-teki kata atau masalah matematika, reinforcement learning dapat mendorong model untuk menjelajahi berbagai urutan "pemikiran" untuk mempelajari pola penalaran mana yang paling efektif dalam memecahkan masalah.

Model dan wilayah yang didukung

Model Gemini berikut mendukung penyesuaian dengan reinforcement learning:

Gemini 3.5 Flash

Spesifikasi Nilai
Endpoint yang didukung untuk penyesuaian model
  • us-central1us-central1-aiplatform.googleapis.com
  • europe-west4europe-west4-aiplatform.googleapis.com
Endpoint yang didukung untuk penayangan model yang disesuaikan
  • Endpoint multi-region us (aiplatform.us.rep.googleapis.com) saat menyesuaikan di us-central1
  • Endpoint multi-region eu (aiplatform.eu.rep.googleapis.com) saat menyesuaikan di europe-west4
Versi API v1beta1 saja

Modalitas penyesuaian yang didukung

Penyesuaian pembelajaran reinforcement mendukung modalitas data berikut dalam set data penyesuaian Anda:

  • Teks
  • Audio
  • Gambar
  • Video

Untuk batas set data per modalitas (seperti jumlah maksimum file per perintah, ukuran file maksimum, dan panjang total maksimum), lihat halaman Set data penyesuaian.

Penyesuaian berkelanjutan

Anda dapat menggunakan output tugas penyetelan sebelumnya sebagai dasar untuk tugas penyetelan halus reinforcement learning yang baru. Pola penyesuaian berkelanjutan berikut didukung:

  • Supervised fine-tuning → Reinforcement learning fine-tuning
  • Penyesuaian reinforcement learning → Penyesuaian reinforcement learning

Untuk mengetahui detail konfigurasi, lihat halaman Penyetelan berkelanjutan.

Menyajikan model yang disesuaikan

Setelah tugas penyesuaian pembelajaran penguatan yang berhasil pada model dasar Gemini, model yang disesuaikan berdasarkan checkpoint terakhir akan di-deploy ke endpoint di project Anda. Model yang disesuaikan menggunakan strategi endpoint penayangan yang sama dengan model dasar. Misalnya, jika Anda menjalankan tugas penyesuaian di us-central1, model yang disesuaikan akan di-deploy ke endpoint multi-region us (mREP).

Untuk mengambil endpoint model yang disesuaikan yang di-deploy dan menjalankan inferensi terhadapnya, lihat halaman Mulai cepat.

Harga

Harga penyesuaian

Penyesuaian reinforcement learning untuk Gemini menghasilkan token dalam dua fase: fase pengambilan sampel dan fase pelatihan. Token yang dihasilkan selama fase pelatihan dikenai biaya sesuai dengan bagian "Penyesuaian Model" di halaman harga Gemini Enterprise Agent Platform.

Harga inferensi

Setelah penyesuaian, biaya inferensi (permintaan prediksi) untuk model yang disesuaikan tetap berlaku. Untuk inferensi model yang dimulai dari Gemini 3, harga prediksi endpoint model yang disesuaikan adalah 1,5 kali harga model dasar. Untuk mengetahui informasi selengkapnya, lihat Versi model stabil Gemini yang tersedia.

Jika Anda mengonfigurasi layanan evaluasi AI generatif agar berjalan secara otomatis selama penyesuaian, evaluasi akan ditagih sebagai tugas prediksi batch. Untuk mengetahui informasi selengkapnya, lihat bagian "Penyesuaian Model" di halaman harga Platform Agen Gemini Enterprise.

Langkah berikutnya