Conjunto de datos de ajuste para el ajuste del aprendizaje por refuerzo

Un trabajo de ajuste del aprendizaje por refuerzo se basa en un conjunto de datos de entrenamiento y un conjunto de datos de validación opcional. Cada conjunto de datos es un archivo JSON almacenado en Cloud Storage, en el que cada línea es un solo ejemplo de ajuste.

En esta página, se describe el esquema del conjunto de datos, cómo usar el campo references para el cálculo de recompensas y los límites del conjunto de datos por modalidad que aplica el servicio.

Esquema del conjunto de datos

Cada línea del archivo del conjunto de datos JSONL sigue este esquema:

{
  "systemInstruction": {
    "role": string,
    "parts": [
      {
        "text": string
      }
    ]
  },
  "contents": [
    {
      "role": string,
      "parts": [
        {
          // Union field data: text or fileData.
          "text": string,
          "fileData": {
            "mimeType": string,
            "fileUri": string
          }
        }
      ]
    }
  ],
  "references": {
    string: string,
    ...
  }
}

Los campos contents y systemInstruction usan el mismo esquema que la API generateContent de Gemini Enterprise Agent Platform. systemInstruction solo acepta texto. contents puede incluir texto o datos de archivos (imagen, audio o video), sujeto a los límites del conjunto de datos.

El campo references

El campo references es específico del ajuste del aprendizaje por refuerzo. Almacena cualquier metadato que necesite tu función de recompensa para calificar la respuesta del modelo. Acepta un diccionario de cadena a cadena.

Por ejemplo, una recompensa de coincidencia de cadenas que compara la respuesta del modelo con una verdad fundamental conocida podría usar una línea de conjunto de datos como la siguiente:

{
  "systemInstruction": {
    "role": "system",
    "parts": [{ "text": "You are a helpful math tutor." }]
  },
  "contents": [
    {
      "role": "user",
      "parts": [{ "text": "What is 17 * 23? Put your final answer in $\\text{your answer}$." }]
    }
  ],
  "references": {
    "ground_truth_answer": "391"
  }
}

Tu función de recompensa puede leer references["ground_truth_answer"] y compara rla con el valor que produce el modelo. Para obtener detalles sobre cómo cada tipo de recompensa consume references, consulta la página Funciones de recompensa.

Límites de conjuntos de datos

Se aplican los siguientes límites a los conjuntos de datos de ajuste del aprendizaje por refuerzo:

Especificación Valor
Cantidad máxima de ejemplos en un conjunto de datos de entrenamiento 5,000
Cantidad máxima de ejemplos en un conjunto de datos de validación 500
Tamaño máximo del archivo del conjunto de datos 1 GB
Cantidad máxima de tokens de entrada por ejemplo 32,768
Cantidad máxima de tokens de salida por ejemplo (incluidos los tokens de pensamiento) 32,768

Límites multimodales

Se aplican los siguientes límites por modalidad cuando tu conjunto de datos incluye datos de imagen, audio o video:

Audio

Especificación Valor
Cantidad máxima de archivos de audio por instrucción 15
Duración total máxima de audio por ejemplo (en todos los archivos) 10 minutos
Tamaño máximo del archivo de audio 100 MB

Video

Especificación Valor
Cantidad máxima de archivos de video por instrucción 10
Duración total máxima de video por ejemplo (en todos los archivos) 5 minutos
Tamaño máximo del archivo de video 20 MB

Imagen

Especificación Valor
Cantidad máxima de imágenes por instrucción 15
Tamaño máximo del archivo de imagen 20 MB

¿Qué sigue?