Un job di perfezionamento del reinforcement learning è basato su un set di dati di addestramento e su un set di dati di convalida facoltativo. Ogni set di dati è un file JSON archiviato in Cloud Storage, in cui ogni riga è un singolo esempio di ottimizzazione.
Questa pagina descrive lo schema del set di dati, come utilizzare il campo references per il calcolo della ricompensa e i limiti del set di dati per modalità applicati dal servizio.
Schema del set di dati
Ogni riga del file del set di dati JSONL segue questo schema:
{
"systemInstruction": {
"role": string,
"parts": [
{
"text": string
}
]
},
"contents": [
{
"role": string,
"parts": [
{
// Union field data: text or fileData.
"text": string,
"fileData": {
"mimeType": string,
"fileUri": string
}
}
]
}
],
"references": {
string: string,
...
}
}
I campi contents e systemInstruction utilizzano lo stesso schema dell'API
generateContent
Gemini Enterprise Agent Platform. systemInstruction accetta solo testo. contents può includere testo o
dati di file (immagine, audio o video), nel rispetto dei
limiti del set di dati.
Il campo references
Il campo references è specifico per la messa a punto dell'apprendimento per rinforzo. Memorizza tutti i metadati necessari alla funzione di ricompensa per valutare la risposta del modello. Accetta un dizionario da stringa a stringa.
Ad esempio, una ricompensa di corrispondenza delle stringhe che confronta la risposta del modello con un dato di fatto noto potrebbe utilizzare una riga del set di dati come la seguente:
{
"systemInstruction": {
"role": "system",
"parts": [{ "text": "You are a helpful math tutor." }]
},
"contents": [
{
"role": "user",
"parts": [{ "text": "What is 17 * 23? Put your final answer in $\\text{your answer}$." }]
}
],
"references": {
"ground_truth_answer": "391"
}
}
La funzione di ricompensa potrebbe leggere references["ground_truth_answer"] e confrontarlo
con il valore prodotto dal modello. Per informazioni dettagliate su come ogni tipo di premio consuma
references, consulta la pagina
Funzioni di premio.
Limiti dei set di dati
Ai set di dati di perfezionamento del reinforcement learning si applicano i seguenti limiti:
| Specifica | Valore |
|---|---|
| Numero massimo di esempi in un set di dati di addestramento | 5000 |
| Numero massimo di esempi in un set di dati di convalida | 500 |
| Dimensione massima del file del set di dati | 1 GB |
| Numero massimo di token di input per esempio | 32.768 |
| Numero massimo di token di output per esempio (inclusi i token di pensiero) | 32.768 |
Limiti multimodali
Quando il set di dati include dati di tipo immagine, audio o video, si applicano i seguenti limiti per modalità:
Audio
| Specifica | Valore |
|---|---|
| Numero massimo di file audio per prompt | 15 |
| Durata audio totale massima per esempio (in tutti i file) | 10 minuti |
| Dimensione massima del file audio | 100 MB |
Video
| Specifica | Valore |
|---|---|
| Numero massimo di file video per prompt | 10 |
| Durata totale massima del video per esempio (in tutti i file) | 5 minuti |
| Dimensioni massime del file video | 20 MB |
Immagine
| Specifica | Valore |
|---|---|
| Numero massimo di immagini per prompt | 15 |
| Dimensione massima del file immagine | 20 MB |
Passaggi successivi
- Configura gli iperparametri per il tuo job di ottimizzazione.
- Definisci le funzioni di ricompensa.
- Monitorare lo stato e le metriche dei job.
- Segui la guida rapida per creare il tuo primo job di ottimizzazione dell'apprendimento per rinforzo.