사고 모델은 대답을 생성하기 전에 내부 '사고 과정'을 생성하도록 학습됩니다. 따라서 사고 모델은 사고 능력이 없는 모델보다 더 강력한 추론, 다단계 계획, 수학 문제 해결, 코드 생성이 가능합니다.
사고 과정은 Gemini 모델 전반에서 기본적으로 사용 설정됩니다. Gemini Enterprise Agent Platform에서 Agent Studio를 사용하면 모델의 생성된 대답과 함께 전체 사고 과정을 볼 수 있습니다.
지원되는 모델
사고는 다음 모델에서 지원됩니다.
클릭하여 지원되는 모델 펼치기
- Gemini Omni Flash
- Gemini Omni 1.1 Flash
- Gemini 3.8 Flash
- Gemini 3.7 Flash
- Gemini 3.6 Flash
- Gemini 3.5 Flash-Lite
- Gemini 3.5 Flash
- Gemini 3.1 Pro
- Gemini 3.1 Flash-Lite 이미지 (Nano Banana 2 Lite)
- Gemini 3.1 Flash-Lite
- Gemini 3.1 Flash Image
- Gemini 3 Pro 이미지
- Gemini 3 Flash
- Gemini 2.5 Pro
- Gemini 2.5 Flash-Lite
- Gemini 2.5 Flash
모델 사고 제어
모델이 대답을 반환하기 전에 수행하는 사고량을 제어할 수 있습니다. 사고를 제어하는 방법은 모델 버전에 따라 다릅니다.
Gemini 3 이상 모델
Gemini 3 모델에는 사고 예산 구성을 개별 수준으로 간소화하는 thinking_level 파라미터가 도입되었습니다. 복잡한 추론이 필요하지 않은 경우 더 빠르고 지연 시간이 짧은 대답을 위해 모델의 thinking_level를 제한할 수 있습니다.
다음 표에는 각 모델에서 지원되는 thinking_level 값과 각 모델의 기본 thinking_level 값이 요약되어 있습니다.
| 모델 | 지원되는 thinking_level 값 |
기본값 |
|---|---|---|
| Gemini 3.8 Flash | LOW, MEDIUM, HIGH |
MEDIUM |
| Gemini 3.7 Flash | LOW, MEDIUM, HIGH |
MEDIUM |
| Gemini 3.6 Flash | MINIMAL, LOW, MEDIUM, HIGH |
MEDIUM |
| Gemini 3.5 Flash-Lite | MINIMAL, LOW, MEDIUM, HIGH |
MINIMAL |
| Gemini 3.5 Flash | MINIMAL, LOW, MEDIUM, HIGH |
MEDIUM |
| Gemini 3.1 Pro | LOW, MEDIUM, HIGH |
HIGH |
| Gemini 3.1 Flash-Lite 이미지 (Nano Banana 2 Lite) | MINIMAL, HIGH |
MINIMAL |
| Gemini 3.1 Flash-Lite | MINIMAL, LOW, MEDIUM, HIGH |
MINIMAL |
| Gemini 3.1 Flash 이미지 | MINIMAL, HIGH |
MINIMAL |
| Gemini 3 Pro 이미지 | HIGH |
HIGH |
| Gemini 3 Flash | MINIMAL, LOW, MEDIUM, HIGH |
HIGH |
MINIMAL: 모델이 사고에 가능한 한 적은 토큰을 사용하도록 제한하며 광범위한 추론의 이점이 없는 복잡성이 낮은 작업에 가장 적합합니다. Gemini 3.1 Flash-Lite의 기본 수준입니다.MINIMAL은 생각에 대한 예산이 0에 최대한 가깝지만 여전히 생각 서명이 필요합니다. 요청에 사고 서명이 제공되지 않으면 모델에서400오류를 반환합니다. 자세한 내용은 생각 서명을 참고하세요.from google import genai from google.genai import types client = genai.Client() response = client.models.generate_content( model="gemini-3-flash-preview", contents="How does AI work?", config=types.GenerateContentConfig( thinking_config=types.ThinkingConfig( thinking_level=types.ThinkingLevel.MINIMAL ) ), ) print(response.text)LOW: 모델이 사고에 더 적은 토큰을 사용하도록 제한하며 광범위한 추론이 필요하지 않은 간단한 작업에 적합합니다.LOW는 속도가 중요한 고처리량 작업에 적합합니다.from google import genai from google.genai import types client = genai.Client() response = client.models.generate_content( model="gemini-3.5-flash", contents="How does AI work?", config=types.GenerateContentConfig( thinking_config=types.ThinkingConfig( thinking_level=types.ThinkingLevel.LOW ) ), ) print(response.text)MEDIUM: 추론이 필요하지만 심층적인 다단계 계획이 필요하지 않은 중간 정도의 복잡성을 가진 작업에 적합한 균형 잡힌 접근 방식을 제공합니다.HIGH보다 지연 시간이 짧으면서LOW보다 추론 기능이 더 뛰어납니다.from google import genai from google.genai import types client = genai.Client() response = client.models.generate_content( model="gemini-3-flash-preview", contents="How does AI work?", config=types.GenerateContentConfig( thinking_config=types.ThinkingConfig( thinking_level=types.ThinkingLevel.MEDIUM ) ), ) print(response.text)HIGH: 모델이 사고에 더 많은 토큰을 사용할 수 있도록 하며 다단계 계획, 검증된 코드 생성 또는 고급 함수 호출 시나리오와 같이 심층적인 추론이 필요한 복잡한 프롬프트에 적합합니다. Gemini 3 Pro 모델과 Gemini 3 Flash의 기본 수준입니다. 이전에는 전문 추론 모델을 사용했을 수 있는 작업을 대체할 때 이 구성을 사용하세요.from google import genai from google.genai import types client = genai.Client() response = client.models.generate_content( model="gemini-3.5-flash", contents="Find the race condition in this multi-threaded C++ snippet: [code here]", config=types.GenerateContentConfig( thinking_config=types.ThinkingConfig( thinking_level=types.ThinkingLevel.HIGH ) ), ) print(response.text)
Gemini 3 Pro 및 Gemini 3.1 Pro에서는 사고를 사용 중지할 수 없습니다.
Gemini 3 모델에 대한 동일한 요청에서 thinking_level과 thinking_budget을 모두 지정하면 모델에서 오류가 반환됩니다.
Gemini 2.5 이하 모델
Gemini 3 이전 모델의 경우 모델이 사고 과정에 사용할 수 있는 토큰 수의 상한을 설정하는 thinking_budget 매개변수를 사용하여 사고를 제어할 수 있습니다. 기본적으로 thinking_budget이 설정되지 않은 경우 모델은 최대 8,192개의 토큰까지 사고하는 정도를 자동으로 제어합니다. API를 통해 동적 예산을 사용하려면 thinking_budget을 -1로 설정합니다.
기본 사고 예산보다 더 많거나 적은 토큰이 필요할 수 있는 상황에서는 thinking_budget을 수동으로 설정하여 토큰 수에 대한 소프트 상한을 적용할 수 있습니다. 복잡성이 낮은 작업에는 토큰 한도를 낮게, 복잡성이 높은 작업에는 토큰 한도를 높게 설정할 수 있습니다. 이는 소프트 한도이므로 총 사고 토큰이 달라질 수 있습니다. 지연 시간이 더 중요한 경우 예산을 낮추거나 예산을 0으로 설정하여 대답과 함께 사고 콘텐츠가 반환되지 않도록 합니다.
다음 표에서는 지원되는 각 모델에 대해 설정할 수 있는 thinking_budget의 최소 및 최대 금액과 각 모델의 기본 사고 예산을 보여줍니다.
| 모델 | 최소 토큰 금액 | 최대 토큰 금액 | 기본값 |
|---|---|---|---|
| Gemini 2.5 Flash | 1 | 24,576 | 자동 (최대 8,192개 토큰) |
| Gemini 2.5 Pro | 128 | 32,768 | 자동 (최대 8,192개 토큰) |
| Gemini 2.5 Flash-Lite | 512 | 24,576 | 자동 (최대 8,192개 토큰) |
Gemini 2.5 Flash 및 Gemini 2.5 Flash-Lite를 사용할 때 thinking_budget을 0으로 설정하면 대답과 함께 사고 콘텐츠가 반환되지 않습니다. 하지만 추론 스타일 텍스트는 모델의 출력에 계속 표시될 수 있습니다. Gemini 2.5 Pro의 경우 사고를 사용 중지할 수 없습니다.
Gemini 3 이전 모델에서 thinking_level 매개변수를 사용하면 모델에서 오류가 반환됩니다.
콘솔
- Agent Studio > 프롬프트 만들기를 엽니다.
- 모델 패널에서 모델 전환을 클릭하고 메뉴에서 지원되는 모델 중 하나를 선택합니다.
- 사고 예산 드롭다운 선택기에서 수동을 선택한 다음 슬라이더를 사용하여 사고 예산 한도를 조정합니다.
Python
설치
pip install --upgrade google-genai
자세한 내용은 SDK 참고 문서를 참고하세요.
Vertex AI에서 Google 생성형 AI SDK를 사용하도록 환경 변수를 설정합니다.
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Node.js
설치
npm install @google/genai
자세한 내용은 SDK 참고 문서를 참고하세요.
Vertex AI에서 Google 생성형 AI SDK를 사용하도록 환경 변수를 설정합니다.
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Go
Go를 설치하거나 업데이트하는 방법을 알아보세요.
자세한 내용은 SDK 참고 문서를 참고하세요.
Vertex AI에서 Google 생성형 AI SDK를 사용하도록 환경 변수를 설정합니다.
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Java
Java를 설치하거나 업데이트하는 방법을 알아보세요.
자세한 내용은 SDK 참고 문서를 참고하세요.
Vertex AI에서 Google 생성형 AI SDK를 사용하도록 환경 변수를 설정합니다.
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
사고 요약 보기
사고 요약은 모델이 대답을 생성하는 동안 실행한 중간 추론 단계를 보여줍니다. Gemini 2.5 이상 모델에서는 사고 요약을 볼 수 있습니다.
Agent Studio에서는 사고 요약이 기본적으로 사용 설정되어 있으며 사고 패널을 펼쳐 확인할 수 있습니다.
API를 사용하는 경우 ThinkingConfig에서 include_thoughts=True를 설정하여 생각 요약을 사용 설정할 수 있습니다.
콘솔
사고 요약은 Agent Studio에서 기본적으로 사용 설정되어 있습니다. 사고 패널을 펼쳐 모델의 요약된 사고 과정을 확인할 수 있습니다.
Python
설치
pip install --upgrade google-genai
자세한 내용은 SDK 참고 문서를 참고하세요.
Vertex AI에서 Google 생성형 AI SDK를 사용하도록 환경 변수를 설정합니다.
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Node.js
설치
npm install @google/genai
자세한 내용은 SDK 참고 문서를 참고하세요.
Vertex AI에서 Google 생성형 AI SDK를 사용하도록 환경 변수를 설정합니다.
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Go
Go를 설치하거나 업데이트하는 방법을 알아보세요.
자세한 내용은 SDK 참고 문서를 참고하세요.
Vertex AI에서 Google 생성형 AI SDK를 사용하도록 환경 변수를 설정합니다.
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Java
Java를 설치하거나 업데이트하는 방법을 알아보세요.
자세한 내용은 SDK 참고 문서를 참고하세요.
Vertex AI에서 Google 생성형 AI SDK를 사용하도록 환경 변수를 설정합니다.
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
다음 시나리오에서는 응답에 생각 요약 텍스트 없이 생각 서명이 포함될 수 있습니다.
- 복잡성이 낮은 요청: 모델이 대답을 구성하는 데 필요한 추론 단계가 최소한입니다.
- 요약 사용 중지됨: 생각 요약이 요청되지 않았거나 명시적으로 사용 중지되었습니다.
- 텍스트가 아닌 추론 모달리티: 특정 모달리티 (예: 이미지 처리)는 텍스트 요약을 내보내지 않을 수 있습니다.
애플리케이션은 항상 관련 생각 서명을 유지하면서 생각 요약 콘텐츠가 없거나 비어 있는 응답을 적절하게 처리해야 합니다.
생각 서명
생각 서명은 모델의 내부 사고 과정을 암호화한 표현으로, 특히 함수 호출을 사용할 때 여러 차례 대화 중에 Gemini 추론 상태를 유지합니다.
모델이 여러 차례의 대화에서 전체 컨텍스트를 유지하도록 하려면 사용된 사고 수준과 관계없이 후속 요청에서 이전 응답의 생각 서명을 반환해야 합니다. 공식 Google 생성형 AI SDK (Python, Node.js, Go 또는 Java)를 사용하고 표준 채팅 기록 기능을 사용하거나 전체 모델 응답을 기록에 추가하는 경우 사고 서명이 자동으로 처리됩니다.
자세한 규칙, 예시, 멀티턴 워크플로 패턴은 생각 서명을 참고하세요.
프롬프트 작성 기법
효과적인 프롬프트 설계를 통해 모델 추론을 유도하고, 토큰 예산을 확보하고, 사고 모델로 최적의 출력 품질을 달성할 수 있습니다.
포괄적인 전략, 멀티샷 패턴, 검증 프롬프트, 디버깅 팁은 프롬프트 사고 가이드를 참고하세요.
가격 책정
모델의 사고 과정에서 생성된 토큰에 대해 요금이 청구됩니다. Gemini 3 Pro, Gemini 2.5 Pro와 같은 일부 모델의 경우 사고가 기본적으로 사용 설정되어 있으며 이러한 토큰에 대해 요금이 청구됩니다.
자세한 내용은 Agent Platform 가격 책정을 참고하세요. 비용을 관리하는 방법을 알아보려면 모델 사고 제어를 참고하세요.