Set data penyesuaian untuk fine-tuning reinforcement learning

Tugas penyesuaian reinforcement learning didorong oleh set data pelatihan dan set data validasi opsional. Setiap set data adalah file JSON yang disimpan di Cloud Storage, dengan setiap baris adalah satu contoh penyesuaian.

Halaman ini menjelaskan skema set data, cara menggunakan kolom references untuk perhitungan reward, dan batas set data per modalitas yang diterapkan oleh layanan.

Skema set data

Setiap baris file set data JSONL mengikuti skema ini:

{
  "systemInstruction": {
    "role": string,
    "parts": [
      {
        "text": string
      }
    ]
  },
  "contents": [
    {
      "role": string,
      "parts": [
        {
          // Union field data: text or fileData.
          "text": string,
          "fileData": {
            "mimeType": string,
            "fileUri": string
          }
        }
      ]
    }
  ],
  "references": {
    string: string,
    ...
  }
}

Kolom contents dan systemInstruction menggunakan skema yang sama dengan Gemini Enterprise Agent Platform generateContent API. systemInstruction hanya menerima teks. contents dapat menyertakan data teks atau file (gambar, audio, atau video), yang tunduk pada batas set data.

Kolom references

Kolom references khusus untuk penyesuaian reinforcement learning. Kolom ini menyimpan metadata apa pun yang diperlukan fungsi reward Anda untuk memberi skor pada respons model. Kolom ini menerima kamus string ke string.

Misalnya, reward pencocokan string yang membandingkan jawaban model dengan kebenaran nyata yang diketahui dapat menggunakan baris set data seperti berikut:

{
  "systemInstruction": {
    "role": "system",
    "parts": [{ "text": "You are a helpful math tutor." }]
  },
  "contents": [
    {
      "role": "user",
      "parts": [{ "text": "What is 17 * 23? Put your final answer in $\\text{your answer}$." }]
    }
  ],
  "references": {
    "ground_truth_answer": "391"
  }
}

Fungsi reward Anda dapat membaca references["ground_truth_answer"] dan membandingkannya dengan nilai yang dihasilkan model. Untuk mengetahui detail tentang cara setiap jenis reward menggunakan references, lihat halaman Fungsi reward.

Batas set data

Batas berikut berlaku untuk set data penyesuaian reinforcement learning:

Spesifikasi Nilai
Jumlah maksimum contoh dalam set data pelatihan 5.000
Jumlah maksimum contoh dalam set data validasi 500
Ukuran file set data maksimum 1 GB
Token input maksimum per contoh 32.768
Token output maksimum per contoh (termasuk token pemikiran) 32.768

Batas multimodal

Batas per modalitas berikut berlaku jika set data Anda menyertakan data gambar, audio, atau video:

Audio

Spesifikasi Nilai
Jumlah maksimum file audio per perintah 15
Panjang audio total maksimum per contoh (di semua file) 10 menit
Ukuran file audio maksimum 100 MB

Video

Spesifikasi Nilai
Jumlah maksimum file video per perintah 10
Panjang video total maksimum per contoh (di semua file) 5 menit
Ukuran file video maksimum 20 MB

Gambar

Spesifikasi Nilai
Jumlah maksimum gambar per perintah 15
Ukuran file gambar maksimum 20 MB

Langkah berikutnya