Nesta página, você vai conhecer o fluxo de trabalho de ponta a ponta para o ajuste de detalhes por aprendizado por reforço dos modelos do Gemini: criar um job de ajuste, verificar o status dele, recuperar o endpoint do modelo ajustado e executar a inferência nele.
Antes de começar, consulte Sobre o ajuste fino do aprendizado por reforço para uma visão geral do recurso, dos modelos e das regiões compatíveis.
Criar um job de ajuste do aprendizado por reforço
Um job de ajuste refinado de aprendizagem por reforço é criado enviando uma solicitação POST para o endpoint tuningJobs.create. Para conferir o esquema de solicitação completo e
todos os campos configuráveis, consulte a página
Job de ajuste refinado de aprendizado por reforço.
Os exemplos nesta página usam us-central1 como a região de ajuste. O modelo ajustado resultante é veiculado pelo endpoint multirregional us. Para conferir a lista completa de regiões compatíveis com ajuste e veiculação, consulte a seção Modelos e regiões compatíveis.
curl -X POST \
-H "Authorization: Bearer $(gcloud auth application-default print-access-token)" \
-H "Content-Type: application/json" \
"https://us-central1-aiplatform.googleapis.com/v1beta1/projects/PROJECT_ID/locations/us-central1/tuningJobs" \
-d \
$'{
"tunedModelDisplayName": "dai-image-test",
"baseModel": "gemini-3.5-flash",
"reinforcementTuningSpec": {
"trainingDatasetUri": "gs://path/to/your/training_dataset.jsonl",
"validationDatasetUri": "gs://path/to/your/eval_dataset.jsonl",
"hyperParameters": {
"epochCount":15,
"learningRateMultiplier":1.0,
"samplesPerPrompt":16,
"adapterSize":"ADAPTER_SIZE_SIXTEEN",
"maxOutputTokens":32768,
"batchSize":32,
"evaluateInterval":5,
"checkpointInterval":5,
"thinkingLevel":"HIGH"
},
"singleRewardConfig": {
"rewardName": "your_reward_function_name",
"parseResponseConfig": {"parseType":"IDENTITY"},
"cloudRunRewardScorer": {
"cloudRunUri":"https://your.cloud.run.uri"
}
}
}
}'
Substitua:
- PROJECT_ID: o ID do projeto do Google Cloud .
Verificar o status do job de ajuste refinado de aprendizado por reforço
É possível monitorar o progresso, o desempenho e a qualidade de um job de ajuste refinado de aprendizado por reforço em execução no console Google Cloud na página Agent Platform > Modelo > Ajuste. Cada job de ajuste tem uma visualização de monitoramento dedicada que mostra o status de ajuste com gráficos de recompensas de treinamento e avaliação, comprimento da geração e outras métricas de ajuste. Para conferir a lista completa de métricas emitidas e como interpretá-las, consulte a página Métricas e monitoramento.
Tempo de treinamento
O tempo de treinamento é afetado pelos seguintes fatores:
- Tamanho do conjunto de dados de treinamento e validação.Para mais detalhes, consulte a página Conjunto de dados de ajuste.
- Hiperparâmetros, incluindo
samplesPerPrompt, tamanho do lote, contagem de épocas e multiplicador da taxa de aprendizado. Para mais detalhes, consulte a página Hiperparâmetros.
Dependendo da sua configuração, um trabalho de ajuste refinado de aprendizado por reforço do Gemini pode levar horas ou dias.
Receber o endpoint do modelo ajustado
Depois que o job de ajuste atingir JOB_STATE_SUCCEEDED, recupere o endpoint do modelo ajustado implantado emitindo uma solicitação GetTuningJob e lendo o campo tunedModel.endpoint da resposta.
curl -X GET \
-H "Authorization: Bearer $(gcloud auth application-default print-access-token)" \
"https://us-central1-aiplatform.googleapis.com/v1beta1/projects/PROJECT_ID/locations/us-central1/tuningJobs/TUNING_JOB_ID"
Substitua:
- PROJECT_ID: o ID do projeto do Google Cloud .
- TUNING_JOB_ID: o ID do job de ajuste.
Exemplo de resposta (abreviada):
{
"name": "projects/{PROJECT_ID}/locations/us-central1/tuningJobs/{TUNING_JOB_ID}",
"tunedModelDisplayName": "my-rl-tuned-model",
"state": "JOB_STATE_SUCCEEDED",
"tunedModel": {
"model": "projects/{PROJECT_ID}/locations/us-central1/models/{MODEL_ID}",
"endpoint": "projects/{PROJECT_ID}/locations/us/endpoints/{ENDPOINT_ID}"
},
"reinforcementTuningSpec": { ... }
}
Quando o job de ajuste for concluído, o endpoint do último checkpoint será
mostrado na resposta.
Executar inferência no endpoint do modelo ajustado
O modelo ajustado veicula previsões usando a API generateContent padrão no endpoint retornado. Como o job de ajuste foi executado em us-central1, o modelo ajustado é veiculado pelo endpoint multirregional us.
curl -X POST \
-H "Authorization: Bearer $(gcloud auth application-default print-access-token)" \
-H "Content-Type: application/json" \
"https://aiplatform.us.rep.googleapis.com/v1beta1/projects/PROJECT_ID/locations/us/endpoints/ENDPOINT_ID:generateContent" \
-d \
$'{
"contents": [
{
"role": "user",
"parts": [
{ "text": "Why is the sky blue?" }
]
}
]
}'
Substitua:
- PROJECT_ID: o ID do projeto do Google Cloud .
- ENDPOINT_ID: o ID do endpoint retornado no campo
tunedModel.endpointda respostaGetTuningJob.
A seguir
- Saiba mais sobre jobs de ajuste do aprendizado por reforço.