Tugas penyesuaian reinforcement learning didorong oleh set data pelatihan dan set data validasi opsional. Setiap set data adalah file JSON yang disimpan di Cloud Storage, dengan setiap baris adalah satu contoh penyesuaian.
Halaman ini menjelaskan skema set data, cara menggunakan kolom references untuk perhitungan reward, dan batas set data per modalitas yang diterapkan oleh layanan.
Skema set data
Setiap baris file set data JSONL mengikuti skema ini:
{
"systemInstruction": {
"role": string,
"parts": [
{
"text": string
}
]
},
"contents": [
{
"role": string,
"parts": [
{
// Union field data: text or fileData.
"text": string,
"fileData": {
"mimeType": string,
"fileUri": string
}
}
]
}
],
"references": {
string: string,
...
}
}
Kolom contents dan systemInstruction menggunakan skema yang sama dengan
Gemini Enterprise Agent Platform
generateContent
API. systemInstruction hanya menerima teks. contents dapat menyertakan data teks atau
file (gambar, audio, atau video), yang tunduk pada
batas set data.
Kolom references
Kolom references khusus untuk penyesuaian reinforcement learning. Kolom ini menyimpan metadata apa pun yang diperlukan fungsi reward Anda untuk memberi skor pada respons model. Kolom ini menerima kamus string ke string.
Misalnya, reward pencocokan string yang membandingkan jawaban model dengan kebenaran nyata yang diketahui dapat menggunakan baris set data seperti berikut:
{
"systemInstruction": {
"role": "system",
"parts": [{ "text": "You are a helpful math tutor." }]
},
"contents": [
{
"role": "user",
"parts": [{ "text": "What is 17 * 23? Put your final answer in $\\text{your answer}$." }]
}
],
"references": {
"ground_truth_answer": "391"
}
}
Fungsi reward Anda dapat membaca references["ground_truth_answer"] dan membandingkannya
dengan nilai yang dihasilkan model. Untuk mengetahui detail tentang cara setiap jenis reward menggunakan
references, lihat halaman
Fungsi reward.
Batas set data
Batas berikut berlaku untuk set data penyesuaian reinforcement learning:
| Spesifikasi | Nilai |
|---|---|
| Jumlah maksimum contoh dalam set data pelatihan | 5.000 |
| Jumlah maksimum contoh dalam set data validasi | 500 |
| Ukuran file set data maksimum | 1 GB |
| Token input maksimum per contoh | 32.768 |
| Token output maksimum per contoh (termasuk token pemikiran) | 32.768 |
Batas multimodal
Batas per modalitas berikut berlaku jika set data Anda menyertakan data gambar, audio, atau video:
Audio
| Spesifikasi | Nilai |
|---|---|
| Jumlah maksimum file audio per perintah | 15 |
| Panjang audio total maksimum per contoh (di semua file) | 10 menit |
| Ukuran file audio maksimum | 100 MB |
Video
| Spesifikasi | Nilai |
|---|---|
| Jumlah maksimum file video per perintah | 10 |
| Panjang video total maksimum per contoh (di semua file) | 5 menit |
| Ukuran file video maksimum | 20 MB |
Gambar
| Spesifikasi | Nilai |
|---|---|
| Jumlah maksimum gambar per perintah | 15 |
| Ukuran file gambar maksimum | 20 MB |
Langkah berikutnya
- Mengonfigurasi hyperparameter untuk tugas penyesuaian.
- Menentukan fungsi reward.
- Memantau status dan metrik tugas.
- Mengikuti Panduan memulai untuk membuat tugas penyesuaian reinforcement learning pertama Anda.