강화 학습 미세 조정 작업은 학습 데이터 세트와 선택적 검증 데이터 세트에 의해 실행됩니다. 각 데이터 세트는 Cloud Storage에 저장된 JSON 파일이며, 각 줄은 단일 조정 예시입니다.
이 페이지에서는 데이터 세트 스키마, 보상 계산에 references 필드를 사용하는 방법, 서비스에서 적용하는 모달리티별 데이터 세트 한도를 설명합니다.
데이터 세트 스키마
JSONL 데이터 세트 파일의 각 행은 다음 스키마를 따릅니다.
{
"systemInstruction": {
"role": string,
"parts": [
{
"text": string
}
]
},
"contents": [
{
"role": string,
"parts": [
{
// Union field data: text or fileData.
"text": string,
"fileData": {
"mimeType": string,
"fileUri": string
}
}
]
}
],
"references": {
string: string,
...
}
}
contents 및 systemInstruction 필드는 Gemini Enterprise Agent Platform generateContent API와 동일한 스키마를 사용합니다. systemInstruction은 텍스트만 허용합니다. contents에는 데이터 세트 한도에 따라 텍스트 또는 파일 데이터 (이미지, 오디오 또는 동영상)가 포함될 수 있습니다.
references 필드
references 필드는 강화 학습 미세 조정에만 해당합니다. 보상 함수가 모델의 대답을 평가하는 데 필요한 메타데이터를 저장합니다. 문자열-문자열 사전을 허용합니다.
예를 들어 모델의 답변을 알려진 정답과 비교하는 문자열 일치 보상은 다음과 같은 데이터 세트 행을 사용할 수 있습니다.
{
"systemInstruction": {
"role": "system",
"parts": [{ "text": "You are a helpful math tutor." }]
},
"contents": [
{
"role": "user",
"parts": [{ "text": "What is 17 * 23? Put your final answer in $\\text{your answer}$." }]
}
],
"references": {
"ground_truth_answer": "391"
}
}
보상 함수는 references["ground_truth_answer"]를 읽고 모델이 생성한 값과 비교할 수 있습니다. 각 보상 유형이 references를 사용하는 방식에 관한 자세한 내용은 보상 함수 페이지를 참고하세요.
데이터 세트 한도
강화 학습 미세 조정 데이터 세트에는 다음 한도가 적용됩니다.
| 사양 | 값 |
|---|---|
| 학습 데이터 세트의 최대 예 수 | 5,000 |
| 검증 데이터 세트의 최대 예 수 | 500 |
| 최대 데이터 세트 파일 크기 | 1GB |
| 예당 최대 입력 토큰 수 | 32,768 |
| 예당 최대 출력 토큰 수 (사고 토큰 포함) | 32,768 |
멀티모달 한도
데이터 세트에 이미지, 오디오 또는 동영상 데이터가 포함된 경우 다음과 같은 모달리티별 한도가 적용됩니다.
오디오
| 사양 | 값 |
|---|---|
| 프롬프트당 최대 오디오 파일 수 | 15 |
| 예시당 최대 총 오디오 길이 (모든 파일에 걸쳐) | 10분 |
| 최대 오디오 파일 크기 | 100MB |
동영상
| 사양 | 값 |
|---|---|
| 프롬프트당 최대 동영상 파일 수 | 10 |
| 예시당 최대 총 동영상 길이 (모든 파일 포함) | 5분 |
| 최대 동영상 파일 크기 | 20MB |
이미지
| 사양 | 값 |
|---|---|
| 프롬프트당 최대 이미지 수 | 15 |
| 최대 이미지 파일 크기 | 20MB |
다음 단계
- 조정 작업의 초매개변수를 구성합니다.
- 보상 함수 정의
- 작업 상태 및 측정항목을 모니터링합니다.
- 빠른 시작에 따라 첫 번째 강화 학습 미세 조정 작업을 만드세요.