強化學習微調工作會使用訓練資料集和選用的驗證資料集。每個資料集都是儲存在 Cloud Storage 中的 JSON 檔案,每行都是一個調整範例。
本頁說明資料集結構定義、如何使用 references 欄位計算獎勵,以及服務強制執行的各模式資料集限制。
資料集結構定義
JSONL 資料集檔案的每一行都遵循下列結構定義:
{
"systemInstruction": {
"role": string,
"parts": [
{
"text": string
}
]
},
"contents": [
{
"role": string,
"parts": [
{
// Union field data: text or fileData.
"text": string,
"fileData": {
"mimeType": string,
"fileUri": string
}
}
]
}
],
"references": {
string: string,
...
}
}
contents 和 systemInstruction 欄位使用的結構定義與 Gemini Enterprise Agent Platform generateContent API 相同。systemInstruction 僅接受文字。contents 可包含文字或檔案資料 (圖片、音訊或影片),但須遵守資料集限制。
「references」欄位
references 欄位專用於強化學習微調,可儲存獎勵函式評估模型回應所需的中繼資料,並接受字串對應字串的字典。
舉例來說,比較模型答案與已知真值的字串比對獎勵,可能會使用下列資料集行:
{
"systemInstruction": {
"role": "system",
"parts": [{ "text": "You are a helpful math tutor." }]
},
"contents": [
{
"role": "user",
"parts": [{ "text": "What is 17 * 23? Put your final answer in $\\text{your answer}$." }]
}
],
"references": {
"ground_truth_answer": "391"
}
}
獎勵函式可能會讀取 references["ground_truth_answer"],並與模型產生的值進行比較。如要瞭解各獎勵類型如何消耗 references,請參閱「獎勵函式」頁面。
資料集限制
以下限制適用於強化學習微調資料集:
| 規格 | 值 |
|---|---|
| 訓練資料集中的範例數量上限 | 5,000 |
| 驗證資料集中的範例數量上限 | 500 |
| 資料集檔案大小上限 | 1 GB |
| 每個範例的輸入權杖數量上限 | 32,768 |
| 每個範例的輸出符記數量上限 (包括思考符記) | 32,768 |
多模態限制
如果資料集包含圖片、音訊或影片資料,則適用下列各模態的限制:
音訊
| 規格 | 值 |
|---|---|
| 每個提示的音訊檔案數量上限 | 15 |
| 每個範例的音訊總長度上限 (所有檔案加總) | 10 分鐘 |
| 音訊檔案大小上限 | 100 MB |
影片
| 規格 | 值 |
|---|---|
| 每個提示的影片檔案數量上限 | 10 |
| 每個範例的影片總長度上限 (所有檔案加總) | 5 分鐘 |
| 影片檔案大小上限 | 20 MB |
圖片
| 規格 | 值 |
|---|---|
| 每個提示的圖片數量上限 | 15 |
| 圖片檔案大小上限 | 20 MB |