Conjunto de dados de ajuste para ajuste do aprendizado por reforço

Um job de ajuste do aprendizado por reforço é impulsionado por um conjunto de dados de treinamento e um conjunto de dados de validação opcional. Cada conjunto de dados é um arquivo JSON armazenado no Cloud Storage, em que cada linha é um único exemplo de ajuste.

Nesta página, descrevemos o esquema do conjunto de dados, como usar o campo references para o cálculo de recompensas e os limites de conjunto de dados por modalidade aplicados pelo serviço.

Esquema do conjunto de dados

Cada linha do arquivo de conjunto de dados JSONL segue este esquema:

{
  "systemInstruction": {
    "role": string,
    "parts": [
      {
        "text": string
      }
    ]
  },
  "contents": [
    {
      "role": string,
      "parts": [
        {
          // Union field data: text or fileData.
          "text": string,
          "fileData": {
            "mimeType": string,
            "fileUri": string
          }
        }
      ]
    }
  ],
  "references": {
    string: string,
    ...
  }
}

Os campos contents e systemInstruction usam o mesmo esquema da Gemini Enterprise Agent Platform generateContent API. systemInstruction aceita apenas texto. contents pode incluir texto ou dados de arquivo (imagem, áudio ou vídeo), sujeito aos limites do conjunto de dados.

O campo references

O campo references é específico para o ajuste do aprendizado por reforço. Ele armazena todos os metadados que a função de recompensa precisa para pontuar a resposta do modelo. Ele aceita um dicionário de string para string.

Por exemplo, uma recompensa de correspondência de string que compara a resposta do modelo a uma verdade básica conhecida pode usar uma linha de conjunto de dados como esta:

{
  "systemInstruction": {
    "role": "system",
    "parts": [{ "text": "You are a helpful math tutor." }]
  },
  "contents": [
    {
      "role": "user",
      "parts": [{ "text": "What is 17 * 23? Put your final answer in $\\text{your answer}$." }]
    }
  ],
  "references": {
    "ground_truth_answer": "391"
  }
}

A função de recompensa pode ler references["ground_truth_answer"] e compara r ao valor produzido pelo modelo. Para detalhes sobre como cada tipo de recompensa consome references, consulte a página Funções de recompensa.

Limites do conjunto de dados

Os limites a seguir se aplicam a conjuntos de dados de ajuste do aprendizado por reforço:

Especificação Valor
Número máximo de exemplos em um conjunto de dados de treinamento 5.000
Número máximo de exemplos em um conjunto de dados de validação 500
Tamanho máximo do arquivo do conjunto de dados 1 GB
Máximo de tokens de entrada por exemplo 32.768
Máximo de tokens de saída por exemplo (incluindo tokens de pensamento) 32.768

Limites multimodais

Os limites por modalidade a seguir se aplicam quando o conjunto de dados inclui dados de imagem, áudio ou vídeo:

Áudio

Especificação Valor
Número máximo de arquivos de áudio por comando 15
Duração máxima total do áudio por exemplo (em todos os arquivos) 10 minutos
Tamanho máximo do arquivo de áudio 100 MB

Vídeo

Especificação Valor
Número máximo de arquivos de vídeo por comando 10
Duração máxima total do vídeo por exemplo (em todos os arquivos) 5 minutos
Tamanho máximo do arquivo de vídeo 20 MB

Imagem

Especificação Valor
Número máximo de imagens por comando 15
Tamanho máximo do arquivo de imagem 20 MB

A seguir