Halaman ini memandu Anda melalui alur kerja end-to-end untuk penyesuaian pembelajaran reinforcement model Gemini: membuat tugas penyesuaian, memeriksa statusnya, mengambil endpoint model yang disesuaikan, dan menjalankan inferensi terhadapnya.
Sebelum memulai, lihat Tentang penyesuaian reinforcement learning untuk mengetahui ringkasan fitur, model yang didukung, dan region yang didukung.
Membuat tugas fine-tuning reinforcement learning
Tugas penyesuaian reinforcement learning dibuat dengan mengirim permintaan POST ke endpoint tuningJobs.create. Untuk mengetahui skema permintaan lengkap dan semua kolom yang dapat dikonfigurasi, lihat halaman Reinforcement learning fine-tuning job.
Contoh di halaman ini menggunakan us-central1 sebagai region penyesuaian. Model yang disesuaikan akan ditayangkan dari endpoint multi-region us. Untuk mengetahui daftar lengkap region penyesuaian dan penayangan yang didukung, lihat bagian Model dan region yang didukung.
curl -X POST \
-H "Authorization: Bearer $(gcloud auth application-default print-access-token)" \
-H "Content-Type: application/json" \
"https://us-central1-aiplatform.googleapis.com/v1beta1/projects/PROJECT_ID/locations/us-central1/tuningJobs" \
-d \
$'{
"tunedModelDisplayName": "dai-image-test",
"baseModel": "gemini-3.5-flash",
"reinforcementTuningSpec": {
"trainingDatasetUri": "gs://path/to/your/training_dataset.jsonl",
"validationDatasetUri": "gs://path/to/your/eval_dataset.jsonl",
"hyperParameters": {
"epochCount":15,
"learningRateMultiplier":1.0,
"samplesPerPrompt":16,
"adapterSize":"ADAPTER_SIZE_SIXTEEN",
"maxOutputTokens":32768,
"batchSize":32,
"evaluateInterval":5,
"checkpointInterval":5,
"thinkingLevel":"HIGH"
},
"singleRewardConfig": {
"rewardName": "your_reward_function_name",
"parseResponseConfig": {"parseType":"IDENTITY"},
"cloudRunRewardScorer": {
"cloudRunUri":"https://your.cloud.run.uri"
}
}
}
}'
Ganti kode berikut:
- PROJECT_ID: Project ID Google Cloud Anda.
Memeriksa status tugas penyesuaian reinforcement learning
Anda dapat memantau progres, performa, dan kualitas tugas penyesuaian reinforcement learning yang sedang berjalan di konsol Google Cloud di halaman Agent Platform > Model > Tuning. Setiap tugas penyetelan memiliki tampilan pemantauan khusus yang menampilkan status penyetelan pokok dengan diagram untuk reward pelatihan dan evaluasi, panjang pembuatan, dan metrik penyetelan lainnya. Untuk daftar lengkap metrik yang dipancarkan dan cara menafsirkannya, lihat halaman Metrik dan pemantauan.
Waktu pelatihan
Waktu pelatihan dipengaruhi oleh faktor-faktor berikut:
- Ukuran set data pelatihan dan validasi. Untuk mengetahui detailnya, lihat halaman Set data penyesuaian.
- Hyperparameter — termasuk
samplesPerPrompt, ukuran tumpukan, jumlah iterasi pelatihan, dan pengganda kecepatan pembelajaran. Untuk mengetahui detailnya, lihat halaman Hyperparameter.
Bergantung pada penyiapan Anda, tugas penyesuaian reinforcement learning Gemini dapat berjalan selama berjam-jam hingga berhari-hari.
Mendapatkan endpoint model yang disesuaikan
Setelah tugas penyesuaian mencapai JOB_STATE_SUCCEEDED, ambil endpoint model yang disesuaikan dan di-deploy dengan mengirimkan permintaan GetTuningJob dan membaca kolom tunedModel.endpoint dari respons.
curl -X GET \
-H "Authorization: Bearer $(gcloud auth application-default print-access-token)" \
"https://us-central1-aiplatform.googleapis.com/v1beta1/projects/PROJECT_ID/locations/us-central1/tuningJobs/TUNING_JOB_ID"
Ganti kode berikut:
- PROJECT_ID: Project ID Google Cloud Anda.
- TUNING_JOB_ID: ID tugas penyesuaian.
Contoh respons (disingkat):
{
"name": "projects/{PROJECT_ID}/locations/us-central1/tuningJobs/{TUNING_JOB_ID}",
"tunedModelDisplayName": "my-rl-tuned-model",
"state": "JOB_STATE_SUCCEEDED",
"tunedModel": {
"model": "projects/{PROJECT_ID}/locations/us-central1/models/{MODEL_ID}",
"endpoint": "projects/{PROJECT_ID}/locations/us/endpoints/{ENDPOINT_ID}"
},
"reinforcementTuningSpec": { ... }
}
Setelah tugas penyesuaian berhasil, endpoint dari titik pemeriksaan terakhir akan ditampilkan dalam respons.
Menjalankan inferensi pada endpoint model yang telah disesuaikan
Model yang disesuaikan menyajikan prediksi melalui API generateContent standar
di endpoint yang ditampilkan. Karena tugas penyesuaian berjalan di us-central1, model yang disesuaikan disajikan dari endpoint multi-region us.
curl -X POST \
-H "Authorization: Bearer $(gcloud auth application-default print-access-token)" \
-H "Content-Type: application/json" \
"https://aiplatform.us.rep.googleapis.com/v1beta1/projects/PROJECT_ID/locations/us/endpoints/ENDPOINT_ID:generateContent" \
-d \
$'{
"contents": [
{
"role": "user",
"parts": [
{ "text": "Why is the sky blue?" }
]
}
]
}'
Ganti kode berikut:
- PROJECT_ID: Project ID Google Cloud Anda.
- ENDPOINT_ID: ID endpoint yang ditampilkan di kolom
tunedModel.endpointresponsGetTuningJob.
Langkah berikutnya
- Pelajari lebih lanjut tugas fine-tuning reinforcement learning.