Um job de ajuste do aprendizado por reforço é impulsionado por um conjunto de dados de treinamento e um conjunto de dados de validação opcional. Cada conjunto de dados é um arquivo JSON armazenado no Cloud Storage, em que cada linha é um único exemplo de ajuste.
Nesta página, descrevemos o esquema do conjunto de dados, como usar o campo references para o cálculo de recompensas e os limites de conjunto de dados por modalidade aplicados pelo serviço.
Esquema do conjunto de dados
Cada linha do arquivo de conjunto de dados JSONL segue este esquema:
{
"systemInstruction": {
"role": string,
"parts": [
{
"text": string
}
]
},
"contents": [
{
"role": string,
"parts": [
{
// Union field data: text or fileData.
"text": string,
"fileData": {
"mimeType": string,
"fileUri": string
}
}
]
}
],
"references": {
string: string,
...
}
}
Os campos contents e systemInstruction usam o mesmo esquema da
Gemini Enterprise Agent Platform
generateContent
API. systemInstruction aceita apenas texto. contents pode incluir texto ou
dados de arquivo (imagem, áudio ou vídeo), sujeito aos
limites do conjunto de dados.
O campo references
O campo references é específico para o ajuste do aprendizado por reforço. Ele armazena todos os metadados que a função de recompensa precisa para pontuar a resposta do modelo. Ele aceita um dicionário de string para string.
Por exemplo, uma recompensa de correspondência de string que compara a resposta do modelo a uma verdade básica conhecida pode usar uma linha de conjunto de dados como esta:
{
"systemInstruction": {
"role": "system",
"parts": [{ "text": "You are a helpful math tutor." }]
},
"contents": [
{
"role": "user",
"parts": [{ "text": "What is 17 * 23? Put your final answer in $\\text{your answer}$." }]
}
],
"references": {
"ground_truth_answer": "391"
}
}
A função de recompensa pode ler references["ground_truth_answer"] e compara
r ao valor produzido pelo modelo. Para detalhes sobre como cada tipo de recompensa consome
references, consulte a
página Funções de recompensa.
Limites do conjunto de dados
Os limites a seguir se aplicam a conjuntos de dados de ajuste do aprendizado por reforço:
| Especificação | Valor |
|---|---|
| Número máximo de exemplos em um conjunto de dados de treinamento | 5.000 |
| Número máximo de exemplos em um conjunto de dados de validação | 500 |
| Tamanho máximo do arquivo do conjunto de dados | 1 GB |
| Máximo de tokens de entrada por exemplo | 32.768 |
| Máximo de tokens de saída por exemplo (incluindo tokens de pensamento) | 32.768 |
Limites multimodais
Os limites por modalidade a seguir se aplicam quando o conjunto de dados inclui dados de imagem, áudio ou vídeo:
Áudio
| Especificação | Valor |
|---|---|
| Número máximo de arquivos de áudio por comando | 15 |
| Duração máxima total do áudio por exemplo (em todos os arquivos) | 10 minutos |
| Tamanho máximo do arquivo de áudio | 100 MB |
Vídeo
| Especificação | Valor |
|---|---|
| Número máximo de arquivos de vídeo por comando | 10 |
| Duração máxima total do vídeo por exemplo (em todos os arquivos) | 5 minutos |
| Tamanho máximo do arquivo de vídeo | 20 MB |
Imagem
| Especificação | Valor |
|---|---|
| Número máximo de imagens por comando | 15 |
| Tamanho máximo do arquivo de imagem | 20 MB |
A seguir
- Configure os hiperparâmetros do job de ajuste.
- Defina funções de recompensa.
- Monitore o status e as métricas do job.
- Siga o guia de início rápido para criar seu primeiro job de ajuste do aprendizado por reforço.