강화 학습 미세 조정을 위한 조정 데이터 세트

강화 학습 미세 조정 작업은 학습 데이터 세트와 선택적 검증 데이터 세트에 의해 실행됩니다. 각 데이터 세트는 Cloud Storage에 저장된 JSON 파일이며, 각 줄은 단일 조정 예시입니다.

이 페이지에서는 데이터 세트 스키마, 보상 계산에 references 필드를 사용하는 방법, 서비스에서 적용하는 모달리티별 데이터 세트 한도를 설명합니다.

데이터 세트 스키마

JSONL 데이터 세트 파일의 각 행은 다음 스키마를 따릅니다.

{
  "systemInstruction": {
    "role": string,
    "parts": [
      {
        "text": string
      }
    ]
  },
  "contents": [
    {
      "role": string,
      "parts": [
        {
          // Union field data: text or fileData.
          "text": string,
          "fileData": {
            "mimeType": string,
            "fileUri": string
          }
        }
      ]
    }
  ],
  "references": {
    string: string,
    ...
  }
}

contentssystemInstruction 필드는 Gemini Enterprise Agent Platform generateContent API와 동일한 스키마를 사용합니다. systemInstruction은 텍스트만 허용합니다. contents에는 데이터 세트 한도에 따라 텍스트 또는 파일 데이터 (이미지, 오디오 또는 동영상)가 포함될 수 있습니다.

references 필드

references 필드는 강화 학습 미세 조정에만 해당합니다. 보상 함수가 모델의 대답을 평가하는 데 필요한 메타데이터를 저장합니다. 문자열-문자열 사전을 허용합니다.

예를 들어 모델의 답변을 알려진 정답과 비교하는 문자열 일치 보상은 다음과 같은 데이터 세트 행을 사용할 수 있습니다.

{
  "systemInstruction": {
    "role": "system",
    "parts": [{ "text": "You are a helpful math tutor." }]
  },
  "contents": [
    {
      "role": "user",
      "parts": [{ "text": "What is 17 * 23? Put your final answer in $\\text{your answer}$." }]
    }
  ],
  "references": {
    "ground_truth_answer": "391"
  }
}

보상 함수는 references["ground_truth_answer"]를 읽고 모델이 생성한 값과 비교할 수 있습니다. 각 보상 유형이 references를 사용하는 방식에 관한 자세한 내용은 보상 함수 페이지를 참고하세요.

데이터 세트 한도

강화 학습 미세 조정 데이터 세트에는 다음 한도가 적용됩니다.

사양
학습 데이터 세트의 최대 예 수 5,000
검증 데이터 세트의 최대 예 수 500
최대 데이터 세트 파일 크기 1GB
예당 최대 입력 토큰 수 32,768
예당 최대 출력 토큰 수 (사고 토큰 포함) 32,768

멀티모달 한도

데이터 세트에 이미지, 오디오 또는 동영상 데이터가 포함된 경우 다음과 같은 모달리티별 한도가 적용됩니다.

오디오

사양
프롬프트당 최대 오디오 파일 수 15
예시당 최대 총 오디오 길이 (모든 파일에 걸쳐) 10분
최대 오디오 파일 크기 100MB

동영상

사양
프롬프트당 최대 동영상 파일 수 10
예시당 최대 총 동영상 길이 (모든 파일 포함) 5분
최대 동영상 파일 크기 20MB

이미지

사양
프롬프트당 최대 이미지 수 15
최대 이미지 파일 크기 20MB

다음 단계