Mulai cepat: Penyesuaian reinforcement learning

Halaman ini memandu Anda melalui alur kerja end-to-end untuk penyesuaian pembelajaran reinforcement model Gemini: membuat tugas penyesuaian, memeriksa statusnya, mengambil endpoint model yang disesuaikan, dan menjalankan inferensi terhadapnya.

Sebelum memulai, lihat Tentang penyesuaian reinforcement learning untuk mengetahui ringkasan fitur, model yang didukung, dan region yang didukung.

Membuat tugas fine-tuning reinforcement learning

Tugas penyesuaian reinforcement learning dibuat dengan mengirim permintaan POST ke endpoint tuningJobs.create. Untuk mengetahui skema permintaan lengkap dan semua kolom yang dapat dikonfigurasi, lihat halaman Reinforcement learning fine-tuning job.

Contoh di halaman ini menggunakan us-central1 sebagai region penyesuaian. Model yang disesuaikan akan ditayangkan dari endpoint multi-region us. Untuk mengetahui daftar lengkap region penyesuaian dan penayangan yang didukung, lihat bagian Model dan region yang didukung.

curl -X POST \
  -H "Authorization: Bearer $(gcloud auth application-default print-access-token)" \
  -H "Content-Type: application/json" \
  "https://us-central1-aiplatform.googleapis.com/v1beta1/projects/PROJECT_ID/locations/us-central1/tuningJobs" \
  -d \
  $'{
    "tunedModelDisplayName": "dai-image-test",
    "baseModel": "gemini-3.5-flash",
    "reinforcementTuningSpec": {
      "trainingDatasetUri": "gs://path/to/your/training_dataset.jsonl",
      "validationDatasetUri": "gs://path/to/your/eval_dataset.jsonl",
      "hyperParameters": {
        "epochCount":15,
        "learningRateMultiplier":1.0,
        "samplesPerPrompt":16,
        "adapterSize":"ADAPTER_SIZE_SIXTEEN",
        "maxOutputTokens":32768,
        "batchSize":32,
        "evaluateInterval":5,
        "checkpointInterval":5,
        "thinkingLevel":"HIGH"
      },
      "singleRewardConfig": {
        "rewardName": "your_reward_function_name",
        "parseResponseConfig": {"parseType":"IDENTITY"},
        "cloudRunRewardScorer": {
          "cloudRunUri":"https://your.cloud.run.uri"
        }
      }
    }
  }'

Ganti kode berikut:

  • PROJECT_ID: Project ID Google Cloud Anda.

Memeriksa status tugas penyesuaian reinforcement learning

Anda dapat memantau progres, performa, dan kualitas tugas penyesuaian reinforcement learning yang sedang berjalan di konsol Google Cloud di halaman Agent Platform > Model > Tuning. Setiap tugas penyetelan memiliki tampilan pemantauan khusus yang menampilkan status penyetelan pokok dengan diagram untuk reward pelatihan dan evaluasi, panjang pembuatan, dan metrik penyetelan lainnya. Untuk daftar lengkap metrik yang dipancarkan dan cara menafsirkannya, lihat halaman Metrik dan pemantauan.

Waktu pelatihan

Waktu pelatihan dipengaruhi oleh faktor-faktor berikut:

  • Ukuran set data pelatihan dan validasi. Untuk mengetahui detailnya, lihat halaman Set data penyesuaian.
  • Hyperparameter — termasuk samplesPerPrompt, ukuran tumpukan, jumlah iterasi pelatihan, dan pengganda kecepatan pembelajaran. Untuk mengetahui detailnya, lihat halaman Hyperparameter.

Bergantung pada penyiapan Anda, tugas penyesuaian reinforcement learning Gemini dapat berjalan selama berjam-jam hingga berhari-hari.

Mendapatkan endpoint model yang disesuaikan

Setelah tugas penyesuaian mencapai JOB_STATE_SUCCEEDED, ambil endpoint model yang disesuaikan dan di-deploy dengan mengirimkan permintaan GetTuningJob dan membaca kolom tunedModel.endpoint dari respons.

curl -X GET \
  -H "Authorization: Bearer $(gcloud auth application-default print-access-token)" \
  "https://us-central1-aiplatform.googleapis.com/v1beta1/projects/PROJECT_ID/locations/us-central1/tuningJobs/TUNING_JOB_ID"

Ganti kode berikut:

  • PROJECT_ID: Project ID Google Cloud Anda.
  • TUNING_JOB_ID: ID tugas penyesuaian.

Contoh respons (disingkat):

{
  "name": "projects/{PROJECT_ID}/locations/us-central1/tuningJobs/{TUNING_JOB_ID}",
  "tunedModelDisplayName": "my-rl-tuned-model",
  "state": "JOB_STATE_SUCCEEDED",
  "tunedModel": {
    "model": "projects/{PROJECT_ID}/locations/us-central1/models/{MODEL_ID}",
    "endpoint": "projects/{PROJECT_ID}/locations/us/endpoints/{ENDPOINT_ID}"
  },
  "reinforcementTuningSpec": { ... }
}

Setelah tugas penyesuaian berhasil, endpoint dari titik pemeriksaan terakhir akan ditampilkan dalam respons.

Menjalankan inferensi pada endpoint model yang telah disesuaikan

Model yang disesuaikan menyajikan prediksi melalui API generateContent standar di endpoint yang ditampilkan. Karena tugas penyesuaian berjalan di us-central1, model yang disesuaikan disajikan dari endpoint multi-region us.

curl -X POST \
  -H "Authorization: Bearer $(gcloud auth application-default print-access-token)" \
  -H "Content-Type: application/json" \
  "https://aiplatform.us.rep.googleapis.com/v1beta1/projects/PROJECT_ID/locations/us/endpoints/ENDPOINT_ID:generateContent" \
  -d \
  $'{
    "contents": [
      {
        "role": "user",
        "parts": [
          { "text": "Why is the sky blue?" }
        ]
      }
    ]
  }'

Ganti kode berikut:

  • PROJECT_ID: Project ID Google Cloud Anda.
  • ENDPOINT_ID: ID endpoint yang ditampilkan di kolom tunedModel.endpoint respons GetTuningJob.

Langkah berikutnya