Os modelos de pensamento geram um processo interno de "pensamento" antes de retornar uma resposta. Esse recurso ajuda o modelo a realizar um planejamento complexo de várias etapas, resolver problemas matemáticos e gerar código preciso.
Nesta página, descrevemos como:
- Configurar níveis de pensamento e orçamentos de token
- Ver resumos de ideias
- Preservar o estado de raciocínio em conversas multiturno usando assinaturas de pensamento
Modelos compatíveis
O recurso de pensamento é compatível com os seguintes modelos:
Clique para abrir os modelos compatíveis
- Gemini Omni Flash
- Gemini Omni 1.1 Flash
- Gemini 3.8 Flash Cyber
- Gemini 3.8 Flash
- Gemini 3.7 Flash
- Gemini 3.6 Flash
- Gemini 3.5 Flash-Lite
- Gemini 3.5 Flash
- Gemini 3.1 Pro
- Imagem do Gemini 3.1 Flash-Lite (Nano Banana 2 Lite)
- Gemini 3.1 Flash-Lite
- Criação de imagens do Gemini 3.1 Flash
- Gemini 3 Pro Image
- Gemini 3 Flash
- Gemini 2.5 Pro
- Gemini 2.5 Flash-Lite
- Gemini 2.5 Flash
Controlar o raciocínio do modelo
O raciocínio está ativado por padrão nos modelos do Gemini compatíveis. No Agent Studio, você pode inspecionar todo o processo de pensamento junto com a resposta gerada.
A configuração do pensamento depende da versão do modelo:
Modelos do Gemini 3 e mais recentes
Os modelos do Gemini 3 usam o parâmetro thinking_level. Esse parâmetro define níveis de raciocínio discretos para que você possa otimizar a latência e a profundidade do raciocínio.
Console
-
Acesse o Agent Studio e selecione Novo > Chat e expanda o painel de modelos.
- No painel Configurações do modelo, selecione um modelo compatível no menu Modelo.
- Selecione um valor no menu suspenso Nível de pensamento.
Python
from google import genai
from google.genai import types
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.5-flash",
contents="How does AI work?",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(
# Options: MINIMAL, LOW, MEDIUM, HIGH
thinking_level=types.ThinkingLevel.THINKING_LEVEL_VALUE
)
),
)
print(response.text)Valores de nível de raciocínio
É possível definir thinking_level como um dos seguintes valores:
MINIMAL: usa o menor número possível de tokens para raciocínio. Ideal para tarefas simples que não exigem raciocínio extenso. OMINIMALexige assinaturas de pensamento em conversas multiturno. Se omitidas, o modelo retorna um erro400: INVALID_ARGUMENT.LOW: usa menos tokens para raciocínio e respostas mais rápidas. Ideal para aplicativos de alta capacidade com baixa complexidade de tarefas.MEDIUM: equilibra a qualidade do raciocínio e a latência. Adequado para tarefas de complexidade moderada que se beneficiam de etapas intermediárias de raciocínio.HIGH: usa a capacidade máxima de análise. Ideal para comandos complexos que exigem raciocínio profundo, resolução de problemas em várias etapas, verificação formal de código ou execução de ferramentas multiturno.
Níveis de raciocínio compatíveis por modelo
A tabela a seguir lista os valores de thinking_level compatíveis e as configurações padrão por modelo:
| Modelo | thinking_level: valores aceitos: |
Padrão |
|---|---|---|
| Gemini 3.8 Flash Cyber | LOW, MEDIUM, HIGH |
MEDIUM |
| Gemini 3.8 Flash | LOW, MEDIUM, HIGH |
MEDIUM |
| Gemini 3.7 Flash | LOW, MEDIUM, HIGH |
MEDIUM |
| Gemini 3.6 Flash | MINIMAL, LOW, MEDIUM, HIGH |
MEDIUM |
| Gemini 3.5 Flash-Lite | MINIMAL, LOW, MEDIUM, HIGH |
MINIMAL |
| Gemini 3.5 Flash | MINIMAL, LOW, MEDIUM, HIGH |
MEDIUM |
| Gemini 3.1 Pro | LOW, MEDIUM, HIGH |
HIGH |
| Imagem do Gemini 3.1 Flash-Lite (Nano Banana 2 Lite) | MINIMAL, HIGH |
MINIMAL |
| Gemini 3.1 Flash-Lite | MINIMAL, LOW, MEDIUM, HIGH |
MINIMAL |
| Criação de imagens do Gemini 3.1 Flash | MINIMAL, HIGH |
MINIMAL |
| Gemini 3 Pro Image | HIGH |
HIGH |
| Gemini 3 Flash | MINIMAL, LOW, MEDIUM, HIGH |
HIGH |
Modelos Gemini 2.5 e anteriores
Para o Gemini 2.5 e modelos anteriores, configure o raciocínio usando o parâmetro thinking_budget. Esse parâmetro define um limite flexível para o número de tokens que o modelo pode usar durante o raciocínio interno.
Console
-
Acesse o Agent Studio e selecione Novo > Chat.
- No painel Configurações do modelo, selecione um modelo compatível no menu Modelo.
- No seletor Orçamento de pensamento, selecione Manual e use o controle deslizante para ajustar o limite de tokens.
Python
Instalar
pip install --upgrade google-genai
Para saber mais, consulte a documentação de referência do SDK.
Defina variáveis de ambiente para usar o SDK de IA generativa do Google com a Vertex AI:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Node.js
Instalar
npm install @google/genai
Para saber mais, consulte a documentação de referência do SDK.
Defina variáveis de ambiente para usar o SDK de IA generativa do Google com a Vertex AI:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Go
Saiba como instalar ou atualizar o Go.
Para saber mais, consulte a documentação de referência do SDK.
Defina variáveis de ambiente para usar o SDK de IA generativa do Google com a Vertex AI:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Java
Saiba como instalar ou atualizar o Java.
Para saber mais, consulte a documentação de referência do SDK.
Defina variáveis de ambiente para usar o SDK de IA generativa do Google com a Vertex AI:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Se você não especificar um orçamento, o modelo vai definir o orçamento de token dinamicamente até 8.192 tokens. Para ativar explicitamente o orçamento dinâmico na API, defina thinking_budget como -1.
Orçamentos de pensamento compatíveis por modelo
A tabela a seguir lista os limites de tokens mínimos, máximos e padrão para cada modelo:
| Modelo | Mínimo de tokens | Máximo de tokens | Padrão |
|---|---|---|---|
| Gemini 2.5 Flash | 1 | 24.576 | Automático (até 8.192 tokens) |
| Gemini 2.5 Pro | 128 | 32.768 | Automático (até 8.192 tokens) |
| Gemini 2.5 Flash Lite | 512 | 24.576 | Automático (até 8.192 tokens) |
Desativar raciocínio
Você pode desativar o pensamento para o Gemini 2.5 Flash e o
Gemini 2.5 Flash-Lite definindo thinking_budget como 0. Embora o conteúdo de raciocínio não seja retornado na resposta, o texto gerado ainda pode mostrar uma saída de estilo de raciocínio.
Não é possível desativar o recurso de pensamento do Gemini 2.5 Pro.
Ver resumos de raciocínio
Os resumos de ideias mostram as etapas intermediárias de raciocínio ao lado da resposta final do modelo. Os resumos de ideias são compatíveis com os modelos do Gemini 2.5 e versões mais recentes.
Console
Os resumos de ideias são ativados por padrão no Agent Studio. Para conferir as etapas de raciocínio resumidas, expanda o painel Pensamentos.
Python
Instalar
pip install --upgrade google-genai
Para saber mais, consulte a documentação de referência do SDK.
Defina variáveis de ambiente para usar o SDK de IA generativa do Google com a Vertex AI:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Node.js
Instalar
npm install @google/genai
Para saber mais, consulte a documentação de referência do SDK.
Defina variáveis de ambiente para usar o SDK de IA generativa do Google com a Vertex AI:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Go
Saiba como instalar ou atualizar o Go.
Para saber mais, consulte a documentação de referência do SDK.
Defina variáveis de ambiente para usar o SDK de IA generativa do Google com a Vertex AI:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Java
Saiba como instalar ou atualizar o Java.
Para saber mais, consulte a documentação de referência do SDK.
Defina variáveis de ambiente para usar o SDK de IA generativa do Google com a Vertex AI:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Uma resposta pode retornar uma assinatura de pensamento sem texto de resumo nas seguintes situações:
- Solicitações de baixa complexidade: a solicitação exigiu etapas de raciocínio mínimas.
- Resumos desativados: os resumos de ideias não foram solicitados ou foram desativados.
- Modalidades não textuais: o raciocínio sobre determinadas modalidades (como análise de imagens) pode não produzir resumos de texto.
Seu aplicativo precisa processar campos de resumo de pensamento vazios ou ausentes de maneira adequada, preservando as assinaturas de pensamento acompanhantes.
Assinaturas de raciocínio
As assinaturas de pensamento são representações criptografadas do estado de raciocínio interno do modelo. Eles mantêm o contexto em conversas multiturno, principalmente ao usar a chamada de função.
Para preservar o contexto de raciocínio em interações multiturno, transmita as assinaturas de pensamento retornadas em respostas anteriores de volta para solicitações subsequentes, independente do nível de pensamento configurado.
Se você usar o SDK de IA Generativa do Google (Python, Node.js, Go ou Java), as assinaturas de pensamento serão gerenciadas automaticamente ao usar sessões de chat padrão ou ao anexar objetos de resposta completos ao histórico de mensagens.
Para conferir padrões, requisitos e exemplos de implementação, consulte Assinaturas de pensamento.
Preços
Você recebe uma cobrança pelos tokens gerados durante o processo de pensamento. Para modelos em que o raciocínio está ativado por padrão, como o Gemini 3 Pro e o Gemini 2.5 Pro, esses tokens de raciocínio são incluídos no uso faturável.
Para detalhes completos sobre as tarifas, consulte Preços.
A seguir
Assinaturas de raciocínio
Saiba como preservar o estado de raciocínio do Gemini durante conversas multiturno e com várias etapas usando assinaturas de pensamento.
Guia de comandos para pensar
Conheça técnicas e práticas recomendadas de engenharia de comando personalizadas para os modelos de raciocínio do Gemini.