빠른 시작: 강화 학습 미세 조정

이 페이지에서는 Gemini 모델의 강화 학습 미세 조정을 위한 엔드 투 엔드 워크플로(조정 작업 만들기, 상태 확인, 조정된 모델 엔드포인트 가져오기, 추론 실행)를 안내합니다.

시작하기 전에 강화 학습 미세 조정 정보 를 참조하여 기능, 지원되는 모델, 지원되는 리전을 개략적으로 살펴보세요.

강화 학습 미세 조정 작업 만들기

강화 학습 미세 조정 작업은 tuningJobs.create 엔드포인트에 POST 요청을 전송하여 만듭니다. 전체 요청 스키마와 구성 가능한 모든 필드는 강화 학습 미세 조정 작업 페이지를 참조하세요.

이 페이지의 예시에서는 us-central1을 조정 리전으로 사용합니다. 조정된 모델은 us 멀티 리전 엔드포인트에서 제공됩니다. 지원되는 조정 및 서빙 리전의 전체 목록은 지원되는 모델 및 리전 섹션을 참조하세요.

curl -X POST \
  -H "Authorization: Bearer $(gcloud auth application-default print-access-token)" \
  -H "Content-Type: application/json" \
  "https://us-central1-aiplatform.googleapis.com/v1beta1/projects/PROJECT_ID/locations/us-central1/tuningJobs" \
  -d \
  $'{
    "tunedModelDisplayName": "dai-image-test",
    "baseModel": "gemini-3.5-flash",
    "reinforcementTuningSpec": {
      "trainingDatasetUri": "gs://path/to/your/training_dataset.jsonl",
      "validationDatasetUri": "gs://path/to/your/eval_dataset.jsonl",
      "hyperParameters": {
        "epochCount":15,
        "learningRateMultiplier":1.0,
        "samplesPerPrompt":16,
        "adapterSize":"ADAPTER_SIZE_SIXTEEN",
        "maxOutputTokens":32768,
        "batchSize":32,
        "evaluateInterval":5,
        "checkpointInterval":5,
        "thinkingLevel":"HIGH"
      },
      "singleRewardConfig": {
        "rewardName": "your_reward_function_name",
        "parseResponseConfig": {"parseType":"IDENTITY"},
        "cloudRunRewardScorer": {
          "cloudRunUri":"https://your.cloud.run.uri"
        }
      }
    }
  }'

다음을 바꿉니다.

  • PROJECT_ID: 프로젝트 ID입니다. Google Cloud

강화 학습 미세 조정 작업 상태 확인

실행 중인 강화 학습 미세 조정 작업의 진행 상황, 성능, 품질을 Google Cloud console의 Agent Platform > Model > Tuning 페이지에서 모니터링할 수 있습니다. 각 조정 작업에는 학습 및 평가 보상, 생성 길이, 기타 조정 측정항목의 차트와 함께 기본 조정 상태를 표시하는 전용 모니터링 뷰가 있습니다. 내보낸 측정항목의 전체 목록과 해석 방법은 측정항목 및 모니터링 페이지를 참조하세요.

학습 시간

학습 시간은 다음 요소의 영향을 받습니다.

  • 학습 및 검증 데이터 세트 크기. 자세한 내용은 조정 데이터 세트 페이지를 참조하세요.
  • 하이퍼파라미터 : samplesPerPrompt, 배치 크기, 에포크 수, 학습률 배수 포함 자세한 내용은 하이퍼파라미터 페이지를 참조하세요.

설정에 따라 Gemini 강화 학습 미세 조정 작업은 몇 시간에서 며칠 동안 실행될 수 있습니다.

조정된 모델 엔드포인트 가져오기

조정 작업이 JOB_STATE_SUCCEEDED에 도달한 후 GetTuningJob 요청을 실행하고 응답의 tunedModel.endpoint 필드를 읽어 배포된 조정된 모델 엔드포인트를 가져옵니다.

curl -X GET \
  -H "Authorization: Bearer $(gcloud auth application-default print-access-token)" \
  "https://us-central1-aiplatform.googleapis.com/v1beta1/projects/PROJECT_ID/locations/us-central1/tuningJobs/TUNING_JOB_ID"

다음을 바꿉니다.

  • PROJECT_ID: 프로젝트 ID입니다. Google Cloud
  • TUNING_JOB_ID: 조정 작업의 ID

응답 예시 (약식):

{
  "name": "projects/{PROJECT_ID}/locations/us-central1/tuningJobs/{TUNING_JOB_ID}",
  "tunedModelDisplayName": "my-rl-tuned-model",
  "state": "JOB_STATE_SUCCEEDED",
  "tunedModel": {
    "model": "projects/{PROJECT_ID}/locations/us-central1/models/{MODEL_ID}",
    "endpoint": "projects/{PROJECT_ID}/locations/us/endpoints/{ENDPOINT_ID}"
  },
  "reinforcementTuningSpec": { ... }
}

조정 작업이 성공하면 마지막 체크포인트의 endpoint가 응답에 표시됩니다.

조정된 모델 엔드포인트에서 추론 실행

조정된 모델은 반환된 엔드포인트에서 표준 generateContent API를 통해 예측을 제공합니다. 조정 작업이 us-central1에서 실행되었으므로 조정된 모델은 us 멀티 리전 엔드포인트에서 제공됩니다.

curl -X POST \
  -H "Authorization: Bearer $(gcloud auth application-default print-access-token)" \
  -H "Content-Type: application/json" \
  "https://aiplatform.us.rep.googleapis.com/v1beta1/projects/PROJECT_ID/locations/us/endpoints/ENDPOINT_ID:generateContent" \
  -d \
  $'{
    "contents": [
      {
        "role": "user",
        "parts": [
          { "text": "Why is the sky blue?" }
        ]
      }
    ]
  }'

다음을 바꿉니다.

  • PROJECT_ID: 프로젝트 ID입니다. Google Cloud
  • ENDPOINT_ID: GetTuningJob 응답의 tunedModel.endpoint 필드에서 반환된 엔드포인트 ID입니다.

다음 단계