사고 모델은 대답을 반환하기 전에 내부 '사고' 과정을 생성합니다. 이 기능을 통해 모델은 복잡한 다단계 계획을 실행하고, 수학 문제를 해결하고, 정확한 코드를 생성할 수 있습니다.
이 페이지에서는 다음 방법을 설명합니다.
지원되는 모델
사고는 다음 모델에서 지원됩니다.
클릭하여 지원되는 모델 펼치기
- Gemini Omni Flash
- Gemini Omni 1.1 Flash
- Gemini 3.8 Flash Cyber
- Gemini 3.8 Flash
- Gemini 3.7 Flash
- Gemini 3.6 Flash
- Gemini 3.5 Flash-Lite
- Gemini 3.5 Flash
- Gemini 3.1 Pro
- Gemini 3.1 Flash-Lite 이미지 (Nano Banana 2 Lite)
- Gemini 3.1 Flash-Lite
- Gemini 3.1 Flash Image
- Gemini 3 Pro 이미지
- Gemini 3 Flash
- Gemini 2.5 Pro
- Gemini 2.5 Flash-Lite
- Gemini 2.5 Flash
모델 사고 제어
사고는 지원되는 Gemini 모델에서 기본적으로 사용 설정됩니다. Agent Studio에서는 생성된 대답과 함께 전체 사고 과정을 검사할 수 있습니다.
사고를 구성하는 방법은 모델 버전에 따라 다릅니다.
Gemini 3 이상 모델
Gemini 3 모델은 thinking_level 파라미터를 사용합니다. 이 파라미터는 지연 시간과 추론 깊이 간에 최적화할 수 있도록 개별 추론 계층을 설정합니다.
콘솔
-
Agent Studio로 이동하여 새로 만들기 > 채팅을 선택하고 모델 패널을 펼칩니다.
- 모델 설정 패널의 모델 메뉴에서 지원되는 모델을 선택합니다.
- 사고 수준 드롭다운 메뉴에서 값을 선택합니다.
Python
from google import genai
from google.genai import types
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.5-flash",
contents="How does AI work?",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(
# Options: MINIMAL, LOW, MEDIUM, HIGH
thinking_level=types.ThinkingLevel.THINKING_LEVEL_VALUE
)
),
)
print(response.text)사고 수준 값
thinking_level를 다음 값 중 하나로 설정할 수 있습니다.
MINIMAL: 사고에 가능한 가장 적은 수의 토큰을 사용합니다. 확장된 추론이 필요하지 않은 간단한 작업에 가장 적합합니다.MINIMAL에는 멀티턴 대화에서 사고 서명이 필요합니다. 이를 생략하면 모델에서400: INVALID_ARGUMENT오류를 반환합니다.LOW: 더 빠른 응답을 위해 사고 토큰을 더 적게 사용합니다. 작업 복잡성이 낮은 처리량 중심 애플리케이션에 적합합니다.MEDIUM: 추론 품질과 지연 시간의 균형을 맞춥니다. 중간 추론 단계의 이점을 누릴 수 있는 중간 수준의 복잡성을 갖는 작업에 적합합니다.HIGH: 최대 사고 능력을 사용합니다. 심층적인 추론, 다단계 문제 해결, 공식 코드 검증 또는 멀티턴 도구 실행이 필요한 복잡한 프롬프트에 적합합니다.
모델별 지원되는 사고 수준
다음 표에는 모델별로 지원되는 thinking_level 값과 기본 구성이 나와 있습니다.
| 모델 | 지원되는 thinking_level 값 |
기본값 |
|---|---|---|
| Gemini 3.8 Flash Cyber | LOW, MEDIUM, HIGH |
MEDIUM |
| Gemini 3.8 Flash | LOW, MEDIUM, HIGH |
MEDIUM |
| Gemini 3.7 Flash | LOW, MEDIUM, HIGH |
MEDIUM |
| Gemini 3.6 Flash | MINIMAL, LOW, MEDIUM, HIGH |
MEDIUM |
| Gemini 3.5 Flash-Lite | MINIMAL, LOW, MEDIUM, HIGH |
MINIMAL |
| Gemini 3.5 Flash | MINIMAL, LOW, MEDIUM, HIGH |
MEDIUM |
| Gemini 3.1 Pro | LOW, MEDIUM, HIGH |
HIGH |
| Gemini 3.1 Flash-Lite 이미지 (Nano Banana 2 Lite) | MINIMAL, HIGH |
MINIMAL |
| Gemini 3.1 Flash-Lite | MINIMAL, LOW, MEDIUM, HIGH |
MINIMAL |
| Gemini 3.1 Flash Image | MINIMAL, HIGH |
MINIMAL |
| Gemini 3 Pro 이미지 | HIGH |
HIGH |
| Gemini 3 Flash | MINIMAL, LOW, MEDIUM, HIGH |
HIGH |
Gemini 2.5 이하 모델
Gemini 2.5 이하 모델의 경우 thinking_budget 매개변수를 사용하여 사고를 구성합니다. 이 파라미터는 모델이 내부 추론 중에 사용할 수 있는 토큰 수에 대한 소프트 한도를 설정합니다.
콘솔
-
Agent Studio로 이동하여 New > Chat을 선택합니다.
- 모델 설정 패널의 모델 메뉴에서 지원되는 모델을 선택합니다.
- 사고 예산 선택기에서 수동을 선택하고 슬라이더를 사용하여 토큰 한도를 조정합니다.
Python
설치
pip install --upgrade google-genai
자세한 내용은 SDK 참고 문서를 참고하세요.
Vertex AI에서 Google 생성형 AI SDK를 사용하도록 환경 변수를 설정합니다.
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Node.js
설치
npm install @google/genai
자세한 내용은 SDK 참고 문서를 참고하세요.
Vertex AI에서 Google 생성형 AI SDK를 사용하도록 환경 변수를 설정합니다.
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Go
Go를 설치하거나 업데이트하는 방법을 알아보세요.
자세한 내용은 SDK 참고 문서를 참고하세요.
Vertex AI에서 Google 생성형 AI SDK를 사용하도록 환경 변수를 설정합니다.
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Java
Java를 설치하거나 업데이트하는 방법을 알아보세요.
자세한 내용은 SDK 참고 문서를 참고하세요.
Vertex AI에서 Google 생성형 AI SDK를 사용하도록 환경 변수를 설정합니다.
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
예산을 지정하지 않으면 모델은 최대 8,192개의 토큰까지 토큰 예산을 동적으로 설정합니다. API에서 동적 예산을 명시적으로 사용 설정하려면 thinking_budget을 -1로 설정합니다.
모델별 지원되는 사고 예산
다음 표에는 각 모델의 최소, 최대, 기본 토큰 한도가 나와 있습니다.
| 모델 | 최소 토큰 | 최대 토큰 | 기본값 |
|---|---|---|---|
| Gemini 2.5 Flash | 1 | 24,576 | Auto (최대 8,192개 토큰) |
| Gemini 2.5 Pro | 128 | 32,768 | Auto (최대 8,192개 토큰) |
| Gemini 2.5 Flash-Lite | 512 | 24,576 | Auto (최대 8,192개 토큰) |
생각하는 과정 사용 중지
thinking_budget을 0으로 설정하여 Gemini 2.5 Flash 및 Gemini 2.5 Flash-Lite의 사고를 사용 중지할 수 있습니다. 사고 콘텐츠는 대답에 반환되지 않지만 생성된 텍스트에는 여전히 추론 스타일 출력이 표시될 수 있습니다.
Gemini 2.5 Pro에서는 사고를 사용 중지할 수 없습니다.
사고 요약 보기
사고 요약에는 모델의 최종 대답과 함께 중간 추론 단계가 표시됩니다. 사고 요약은 Gemini 2.5 이상 모델에서 지원됩니다.
콘솔
사고 요약은 Agent Studio에서 기본적으로 사용 설정되어 있습니다. 요약된 추론 단계를 보려면 사고 패널을 펼칩니다.
Python
설치
pip install --upgrade google-genai
자세한 내용은 SDK 참고 문서를 참고하세요.
Vertex AI에서 Google 생성형 AI SDK를 사용하도록 환경 변수를 설정합니다.
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Node.js
설치
npm install @google/genai
자세한 내용은 SDK 참고 문서를 참고하세요.
Vertex AI에서 Google 생성형 AI SDK를 사용하도록 환경 변수를 설정합니다.
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Go
Go를 설치하거나 업데이트하는 방법을 알아보세요.
자세한 내용은 SDK 참고 문서를 참고하세요.
Vertex AI에서 Google 생성형 AI SDK를 사용하도록 환경 변수를 설정합니다.
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Java
Java를 설치하거나 업데이트하는 방법을 알아보세요.
자세한 내용은 SDK 참고 문서를 참고하세요.
Vertex AI에서 Google 생성형 AI SDK를 사용하도록 환경 변수를 설정합니다.
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
다음과 같은 상황에서는 응답에 생각 요약 텍스트 없이 생각 서명이 반환될 수 있습니다.
- 복잡성이 낮은 요청: 요청에 필요한 추론 단계가 최소한입니다.
- 요약 사용 중지됨: 생각 요약이 요청되지 않았거나 사용 중지되었습니다.
- 텍스트가 아닌 모달리티: 특정 모달리티 (예: 이미지 분석)에 대한 추론은 텍스트 요약을 생성하지 않을 수 있습니다.
애플리케이션은 빈 생각 요약 필드 또는 누락된 생각 요약 필드를 정상적으로 처리하면서 함께 제공되는 생각 서명을 보존해야 합니다.
생각 서명
생각 서명은 모델의 내부 추론 상태를 암호화한 표현입니다. 특히 함수 호출을 사용할 때 멀티턴 대화 전반에 걸쳐 컨텍스트를 유지합니다.
멀티턴 상호작용에서 추론 컨텍스트를 유지하려면 구성된 사고 수준과 관계없이 이전 응답에서 반환된 생각 서명을 후속 요청에 다시 전달하세요.
공식 Google 생성형 AI SDK (Python, Node.js, Go 또는 Java)를 사용하는 경우 표준 채팅 세션을 사용하거나 완전한 응답 객체를 메시지 기록에 추가할 때 생각 서명이 자동으로 관리됩니다.
구현 패턴, 요구사항, 예시는 생각 서명을 참고하세요.
가격 책정
사고 과정에서 생성된 토큰에 대해 요금이 청구됩니다. Gemini 3 Pro, Gemini 2.5 Pro와 같이 사고가 기본적으로 사용 설정된 모델의 경우 이러한 사고 토큰이 청구 가능한 사용량에 포함됩니다.
전체 요금 세부정보는 가격 책정을 참고하세요.