Início rápido: ajuste do aprendizado por reforço

Nesta página, você vai conhecer o fluxo de trabalho de ponta a ponta para o ajuste de detalhes por aprendizado por reforço dos modelos do Gemini: criar um job de ajuste, verificar o status dele, recuperar o endpoint do modelo ajustado e executar a inferência nele.

Antes de começar, consulte Sobre o ajuste fino do aprendizado por reforço para uma visão geral do recurso, dos modelos e das regiões compatíveis.

Criar um job de ajuste do aprendizado por reforço

Um job de ajuste refinado de aprendizagem por reforço é criado enviando uma solicitação POST para o endpoint tuningJobs.create. Para conferir o esquema de solicitação completo e todos os campos configuráveis, consulte a página Job de ajuste refinado de aprendizado por reforço.

Os exemplos nesta página usam us-central1 como a região de ajuste. O modelo ajustado resultante é veiculado pelo endpoint multirregional us. Para conferir a lista completa de regiões compatíveis com ajuste e veiculação, consulte a seção Modelos e regiões compatíveis.

curl -X POST \
  -H "Authorization: Bearer $(gcloud auth application-default print-access-token)" \
  -H "Content-Type: application/json" \
  "https://us-central1-aiplatform.googleapis.com/v1beta1/projects/PROJECT_ID/locations/us-central1/tuningJobs" \
  -d \
  $'{
    "tunedModelDisplayName": "dai-image-test",
    "baseModel": "gemini-3.5-flash",
    "reinforcementTuningSpec": {
      "trainingDatasetUri": "gs://path/to/your/training_dataset.jsonl",
      "validationDatasetUri": "gs://path/to/your/eval_dataset.jsonl",
      "hyperParameters": {
        "epochCount":15,
        "learningRateMultiplier":1.0,
        "samplesPerPrompt":16,
        "adapterSize":"ADAPTER_SIZE_SIXTEEN",
        "maxOutputTokens":32768,
        "batchSize":32,
        "evaluateInterval":5,
        "checkpointInterval":5,
        "thinkingLevel":"HIGH"
      },
      "singleRewardConfig": {
        "rewardName": "your_reward_function_name",
        "parseResponseConfig": {"parseType":"IDENTITY"},
        "cloudRunRewardScorer": {
          "cloudRunUri":"https://your.cloud.run.uri"
        }
      }
    }
  }'

Substitua:

  • PROJECT_ID: o ID do projeto do Google Cloud .

Verificar o status do job de ajuste refinado de aprendizado por reforço

É possível monitorar o progresso, o desempenho e a qualidade de um job de ajuste refinado de aprendizado por reforço em execução no console Google Cloud na página Agent Platform > Modelo > Ajuste. Cada job de ajuste tem uma visualização de monitoramento dedicada que mostra o status de ajuste com gráficos de recompensas de treinamento e avaliação, comprimento da geração e outras métricas de ajuste. Para conferir a lista completa de métricas emitidas e como interpretá-las, consulte a página Métricas e monitoramento.

Tempo de treinamento

O tempo de treinamento é afetado pelos seguintes fatores:

  • Tamanho do conjunto de dados de treinamento e validação.Para mais detalhes, consulte a página Conjunto de dados de ajuste.
  • Hiperparâmetros, incluindo samplesPerPrompt, tamanho do lote, contagem de épocas e multiplicador da taxa de aprendizado. Para mais detalhes, consulte a página Hiperparâmetros.

Dependendo da sua configuração, um trabalho de ajuste refinado de aprendizado por reforço do Gemini pode levar horas ou dias.

Receber o endpoint do modelo ajustado

Depois que o job de ajuste atingir JOB_STATE_SUCCEEDED, recupere o endpoint do modelo ajustado implantado emitindo uma solicitação GetTuningJob e lendo o campo tunedModel.endpoint da resposta.

curl -X GET \
  -H "Authorization: Bearer $(gcloud auth application-default print-access-token)" \
  "https://us-central1-aiplatform.googleapis.com/v1beta1/projects/PROJECT_ID/locations/us-central1/tuningJobs/TUNING_JOB_ID"

Substitua:

  • PROJECT_ID: o ID do projeto do Google Cloud .
  • TUNING_JOB_ID: o ID do job de ajuste.

Exemplo de resposta (abreviada):

{
  "name": "projects/{PROJECT_ID}/locations/us-central1/tuningJobs/{TUNING_JOB_ID}",
  "tunedModelDisplayName": "my-rl-tuned-model",
  "state": "JOB_STATE_SUCCEEDED",
  "tunedModel": {
    "model": "projects/{PROJECT_ID}/locations/us-central1/models/{MODEL_ID}",
    "endpoint": "projects/{PROJECT_ID}/locations/us/endpoints/{ENDPOINT_ID}"
  },
  "reinforcementTuningSpec": { ... }
}

Quando o job de ajuste for concluído, o endpoint do último checkpoint será mostrado na resposta.

Executar inferência no endpoint do modelo ajustado

O modelo ajustado veicula previsões usando a API generateContent padrão no endpoint retornado. Como o job de ajuste foi executado em us-central1, o modelo ajustado é veiculado pelo endpoint multirregional us.

curl -X POST \
  -H "Authorization: Bearer $(gcloud auth application-default print-access-token)" \
  -H "Content-Type: application/json" \
  "https://aiplatform.us.rep.googleapis.com/v1beta1/projects/PROJECT_ID/locations/us/endpoints/ENDPOINT_ID:generateContent" \
  -d \
  $'{
    "contents": [
      {
        "role": "user",
        "parts": [
          { "text": "Why is the sky blue?" }
        ]
      }
    ]
  }'

Substitua:

  • PROJECT_ID: o ID do projeto do Google Cloud .
  • ENDPOINT_ID: o ID do endpoint retornado no campo tunedModel.endpoint da resposta GetTuningJob.

A seguir