Un trabajo de ajuste del aprendizaje por refuerzo se basa en un conjunto de datos de entrenamiento y un conjunto de datos de validación opcional. Cada conjunto de datos es un archivo JSON almacenado en Cloud Storage, en el que cada línea es un solo ejemplo de ajuste.
En esta página, se describe el esquema del conjunto de datos, cómo usar el campo references para el cálculo de recompensas y los límites del conjunto de datos por modalidad que aplica el servicio.
Esquema del conjunto de datos
Cada línea del archivo del conjunto de datos JSONL sigue este esquema:
{
"systemInstruction": {
"role": string,
"parts": [
{
"text": string
}
]
},
"contents": [
{
"role": string,
"parts": [
{
// Union field data: text or fileData.
"text": string,
"fileData": {
"mimeType": string,
"fileUri": string
}
}
]
}
],
"references": {
string: string,
...
}
}
Los campos contents y systemInstruction usan el mismo esquema que la
API
generateContent
de Gemini Enterprise Agent Platform. systemInstruction solo acepta texto. contents puede incluir texto o
datos de archivos (imagen, audio o video), sujeto a los
límites del conjunto de datos.
El campo references
El campo references es específico del ajuste del aprendizaje por refuerzo. Almacena cualquier metadato que necesite tu función de recompensa para calificar la respuesta del modelo. Acepta un diccionario de cadena a cadena.
Por ejemplo, una recompensa de coincidencia de cadenas que compara la respuesta del modelo con una verdad fundamental conocida podría usar una línea de conjunto de datos como la siguiente:
{
"systemInstruction": {
"role": "system",
"parts": [{ "text": "You are a helpful math tutor." }]
},
"contents": [
{
"role": "user",
"parts": [{ "text": "What is 17 * 23? Put your final answer in $\\text{your answer}$." }]
}
],
"references": {
"ground_truth_answer": "391"
}
}
Tu función de recompensa puede leer references["ground_truth_answer"] y compara
rla con el valor que produce el modelo. Para obtener detalles sobre cómo cada tipo de recompensa consume
references, consulta la
página Funciones de recompensa.
Límites de conjuntos de datos
Se aplican los siguientes límites a los conjuntos de datos de ajuste del aprendizaje por refuerzo:
| Especificación | Valor |
|---|---|
| Cantidad máxima de ejemplos en un conjunto de datos de entrenamiento | 5,000 |
| Cantidad máxima de ejemplos en un conjunto de datos de validación | 500 |
| Tamaño máximo del archivo del conjunto de datos | 1 GB |
| Cantidad máxima de tokens de entrada por ejemplo | 32,768 |
| Cantidad máxima de tokens de salida por ejemplo (incluidos los tokens de pensamiento) | 32,768 |
Límites multimodales
Se aplican los siguientes límites por modalidad cuando tu conjunto de datos incluye datos de imagen, audio o video:
Audio
| Especificación | Valor |
|---|---|
| Cantidad máxima de archivos de audio por instrucción | 15 |
| Duración total máxima de audio por ejemplo (en todos los archivos) | 10 minutos |
| Tamaño máximo del archivo de audio | 100 MB |
Video
| Especificación | Valor |
|---|---|
| Cantidad máxima de archivos de video por instrucción | 10 |
| Duración total máxima de video por ejemplo (en todos los archivos) | 5 minutos |
| Tamaño máximo del archivo de video | 20 MB |
Imagen
| Especificación | Valor |
|---|---|
| Cantidad máxima de imágenes por instrucción | 15 |
| Tamaño máximo del archivo de imagen | 20 MB |
¿Qué sigue?
- Configura los hiperparámetros para tu trabajo de ajuste.
- Define funciones de recompensa.
- Supervisa el estado y las métricas del trabajo.
- Sigue la Guía de inicio rápido para crear tu primer trabajo de ajuste del aprendizaje por refuerzo.