強化學習微調的調整用資料集

強化學習微調工作會使用訓練資料集和選用的驗證資料集。每個資料集都是儲存在 Cloud Storage 中的 JSON 檔案,每行都是一個調整範例。

本頁說明資料集結構定義、如何使用 references 欄位計算獎勵,以及服務強制執行的各模式資料集限制。

資料集結構定義

JSONL 資料集檔案的每一行都遵循下列結構定義:

{
  "systemInstruction": {
    "role": string,
    "parts": [
      {
        "text": string
      }
    ]
  },
  "contents": [
    {
      "role": string,
      "parts": [
        {
          // Union field data: text or fileData.
          "text": string,
          "fileData": {
            "mimeType": string,
            "fileUri": string
          }
        }
      ]
    }
  ],
  "references": {
    string: string,
    ...
  }
}

contentssystemInstruction 欄位使用的結構定義與 Gemini Enterprise Agent Platform generateContent API 相同。systemInstruction 僅接受文字。contents 可包含文字或檔案資料 (圖片、音訊或影片),但須遵守資料集限制

references」欄位

references 欄位專用於強化學習微調,可儲存獎勵函式評估模型回應所需的中繼資料,並接受字串對應字串的字典。

舉例來說,比較模型答案與已知真值的字串比對獎勵,可能會使用下列資料集行:

{
  "systemInstruction": {
    "role": "system",
    "parts": [{ "text": "You are a helpful math tutor." }]
  },
  "contents": [
    {
      "role": "user",
      "parts": [{ "text": "What is 17 * 23? Put your final answer in $\\text{your answer}$." }]
    }
  ],
  "references": {
    "ground_truth_answer": "391"
  }
}

獎勵函式可能會讀取 references["ground_truth_answer"],並與模型產生的值進行比較。如要瞭解各獎勵類型如何消耗 references,請參閱「獎勵函式」頁面。

資料集限制

以下限制適用於強化學習微調資料集:

規格
訓練資料集中的範例數量上限 5,000
驗證資料集中的範例數量上限 500
資料集檔案大小上限 1 GB
每個範例的輸入權杖數量上限 32,768
每個範例的輸出符記數量上限 (包括思考符記) 32,768

多模態限制

如果資料集包含圖片、音訊或影片資料,則適用下列各模態的限制:

音訊

規格
每個提示的音訊檔案數量上限 15
每個範例的音訊總長度上限 (所有檔案加總) 10 分鐘
音訊檔案大小上限 100 MB

影片

規格
每個提示的影片檔案數量上限 10
每個範例的影片總長度上限 (所有檔案加總) 5 分鐘
影片檔案大小上限 20 MB

圖片

規格
每個提示的圖片數量上限 15
圖片檔案大小上限 20 MB

後續步驟