Les modèles à raisonnement sont entraînés pour générer un "processus de réflexion" interne avant de produire une réponse. Par conséquent, les modèles de réflexion sont capables de raisonner, de planifier en plusieurs étapes, de résoudre des problèmes mathématiques et de générer du code de manière plus efficace que les modèles sans capacités de réflexion.
Le processus de réflexion est activé par défaut dans les modèles Gemini. Lorsque vous utilisez Agent Studio sur Gemini Enterprise Agent Platform, vous pouvez afficher l'intégralité du processus de réflexion, ainsi que la réponse générée par le modèle.
Modèles compatibles
Le processus de réflexion est compatible avec les modèles suivants :
Cliquer pour développer les modèles compatibles
- Gemini Omni Flash
- Gemini Omni 1.1 Flash
- Gemini 3.8 Flash
- Gemini 3.7 Flash
- Gemini 3.6 Flash
- Gemini 3.5 Flash-Lite
- Gemini 3.5 Flash
- Gemini 3.1 Pro
- Image Gemini 3.1 Flash-Lite (Nano Banana 2 Lite)
- Gemini 3.1 Flash-Lite
- Image Flash Gemini 3.1
- Gemini 3 Pro Image
- Gemini 3 Flash
- Gemini 2.5 Pro
- Gemini 2.5 Flash-Lite
- Gemini 2.5 Flash
Raisonnement du modèle de contrôle
Vous pouvez contrôler le temps de réflexion du modèle avant qu'il ne renvoie une réponse. La méthode de contrôle de la réflexion diffère selon la version du modèle.
Modèles Gemini 3 et ultérieurs
Les modèles Gemini 3 introduisent le paramètre thinking_level, qui simplifie la configuration du budget de réflexion en niveaux distincts. Pour obtenir des réponses plus rapides et à plus faible latence lorsque le raisonnement complexe n'est pas nécessaire, vous pouvez contraindre le thinking_level du modèle.
Le tableau suivant récapitule les valeurs thinking_level compatibles avec chaque modèle, ainsi que la valeur thinking_level par défaut pour chaque modèle :
| Modèle | Valeurs thinking_level compatibles |
Par défaut |
|---|---|---|
| Gemini 3.8 Flash | LOW, MEDIUM, HIGH |
MEDIUM |
| Gemini 3.7 Flash | LOW, MEDIUM, HIGH |
MEDIUM |
| Gemini 3.6 Flash | MINIMAL, LOW, MEDIUM, HIGH |
MEDIUM |
| Gemini 3.5 Flash-Lite | MINIMAL, LOW, MEDIUM, HIGH |
MINIMAL |
| Gemini 3.5 Flash | MINIMAL, LOW, MEDIUM, HIGH |
MEDIUM |
| Gemini 3.1 Pro | LOW, MEDIUM, HIGH |
HIGH |
| Image Gemini 3.1 Flash-Lite (Nano Banana 2 Lite) | MINIMAL, HIGH |
MINIMAL |
| Gemini 3.1 Flash-Lite | MINIMAL, LOW, MEDIUM, HIGH |
MINIMAL |
| Image Gemini 3.1 Flash | MINIMAL, HIGH |
MINIMAL |
| Gemini 3 Pro Image | HIGH |
HIGH |
| Gemini 3 Flash | MINIMAL, LOW, MEDIUM, HIGH |
HIGH |
MINIMAL: contraint le modèle à utiliser le moins de jetons possible pour la réflexion. Il est préférable de l'utiliser pour les tâches peu complexes qui ne bénéficieraient pas d'un raisonnement approfondi. Il s'agit du niveau par défaut pour Gemini 3.1 Flash-Lite.MINIMALest aussi proche que possible d'un budget nul pour la réflexion, mais nécessite toujours des signatures de pensée. Si aucune signature de réflexion n'est fournie dans votre requête, le modèle renvoie une erreur400. Pour en savoir plus, consultez Signatures de pensée.from google import genai from google.genai import types client = genai.Client() response = client.models.generate_content( model="gemini-3-flash-preview", contents="How does AI work?", config=types.GenerateContentConfig( thinking_config=types.ThinkingConfig( thinking_level=types.ThinkingLevel.MINIMAL ) ), ) print(response.text)LOW: contraint le modèle à utiliser moins de jetons pour la réflexion. Convient aux tâches plus simples qui ne nécessitent pas de raisonnement approfondi.LOWest idéal pour les tâches à haut débit où la rapidité est essentielle :from google import genai from google.genai import types client = genai.Client() response = client.models.generate_content( model="gemini-3.5-flash", contents="How does AI work?", config=types.GenerateContentConfig( thinking_config=types.ThinkingConfig( thinking_level=types.ThinkingLevel.LOW ) ), ) print(response.text)MEDIUM: offre une approche équilibrée adaptée aux tâches de complexité modérée qui bénéficient d'un raisonnement, mais ne nécessitent pas de planification approfondie en plusieurs étapes. Il offre une capacité de raisonnement supérieure àLOWtout en conservant une latence inférieure àHIGH:from google import genai from google.genai import types client = genai.Client() response = client.models.generate_content( model="gemini-3-flash-preview", contents="How does AI work?", config=types.GenerateContentConfig( thinking_config=types.ThinkingConfig( thinking_level=types.ThinkingLevel.MEDIUM ) ), ) print(response.text)HIGH: permet au modèle d'utiliser plus de jetons pour la réflexion et convient aux requêtes complexes nécessitant un raisonnement approfondi, comme la planification en plusieurs étapes, la génération de code vérifié ou les scénarios d'appel de fonction avancés. Il s'agit du niveau par défaut pour les modèles Gemini 3 Pro et Gemini 3 Flash. Utilisez cette configuration lorsque vous remplacez des tâches pour lesquelles vous vous appuyiez peut-être auparavant sur des modèles de raisonnement spécialisés :from google import genai from google.genai import types client = genai.Client() response = client.models.generate_content( model="gemini-3.5-flash", contents="Find the race condition in this multi-threaded C++ snippet: [code here]", config=types.GenerateContentConfig( thinking_config=types.ThinkingConfig( thinking_level=types.ThinkingLevel.HIGH ) ), ) print(response.text)
Vous ne pouvez pas désactiver la fonctionnalité Raisonnement pour Gemini 3 Pro et Gemini 3.1 Pro.
Si vous spécifiez à la fois thinking_level et thinking_budget dans la même requête pour un modèle Gemini 3, le modèle renvoie une erreur.
Modèles Gemini 2.5 et versions antérieures
Pour les modèles antérieurs à Gemini 3, vous pouvez contrôler la réflexion à l'aide du paramètre thinking_budget, qui définit une limite supérieure au nombre de jetons que le modèle peut utiliser pour son processus de réflexion. Par défaut, si thinking_budget n'est pas défini, le modèle contrôle automatiquement la quantité de jetons qu'il peut générer (jusqu'à un maximum de 8 192 jetons). Pour utiliser le budget dynamique via l'API, définissez thinking_budget sur -1.
Vous pouvez définir manuellement thinking_budget pour imposer une limite supérieure souple au nombre de jetons dans les situations où vous avez besoin de plus ou de moins de jetons que le budget de réflexion par défaut. Vous pouvez définir une limite de jetons plus faible pour les tâches moins complexes ou une limite plus élevée pour les tâches plus complexes. Notez qu'il s'agit d'une limite flexible. Le nombre total de jetons de réflexion peut donc varier. Si la latence est plus importante, utilisez un budget plus faible ou définissez-le sur 0 pour éviter que le contenu de réflexion ne soit renvoyé avec la réponse.
Le tableau suivant indique les montants minimum et maximum que vous pouvez définir pour thinking_budget pour chaque modèle compatible, ainsi que le budget de réflexion par défaut pour chaque modèle :
| Modèle | Montant minimal de jetons | Montant maximal de jetons | Par défaut |
|---|---|---|---|
| Gemini 2.5 Flash | 1 | 24,576 | Automatique (jusqu'à 8 192 jetons) |
| Gemini 2.5 Pro | 128 | 32 768 | Automatique (jusqu'à 8 192 jetons) |
| Gemini 2.5 Flash-Lite | 512 | 24,576 | Automatique (jusqu'à 8 192 jetons) |
Si vous définissez thinking_budget sur 0 lorsque vous utilisez Gemini 2.5 Flash et Gemini 2.5 Flash-Lite, aucun contenu de pensée n'est renvoyé avec la réponse. Toutefois, du texte de type raisonnement peut toujours être présent dans la sortie du modèle. La réflexion ne peut pas être désactivée pour Gemini 2.5 Pro.
Si vous utilisez le paramètre thinking_level avec un modèle antérieur à Gemini 3, le modèle renvoie une erreur.
Console
- Ouvrez Agent Studio > Créer un prompt.
- Dans le panneau Modèle, cliquez sur Changer de modèle, puis sélectionnez l'un des modèles compatibles dans le menu.
- Sélectionnez Manuel dans le sélecteur de menu déroulant Budget de réflexion, puis ajustez la limite du budget de réflexion à l'aide du curseur.
Python
Installer
pip install --upgrade google-genai
Pour en savoir plus, consultez la documentation de référence du SDK.
Définissez des variables d'environnement pour utiliser le SDK Google Gen AI avec Vertex AI :
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Node.js
Installer
npm install @google/genai
Pour en savoir plus, consultez la documentation de référence du SDK.
Définissez des variables d'environnement pour utiliser le SDK Google Gen AI avec Vertex AI :
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Go
Découvrez comment installer ou mettre à jour le Go.
Pour en savoir plus, consultez la documentation de référence du SDK.
Définissez des variables d'environnement pour utiliser le SDK Google Gen AI avec Vertex AI :
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Java
Découvrez comment installer ou mettre à jour le Java.
Pour en savoir plus, consultez la documentation de référence du SDK.
Définissez des variables d'environnement pour utiliser le SDK Google Gen AI avec Vertex AI :
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Afficher les résumés des réflexions
Les résumés des réflexions permettent de visualiser les étapes de raisonnement intermédiaires effectuées par le modèle lors de la génération d'une réponse. Vous pouvez afficher des résumés de réflexion dans Gemini 2.5 et les modèles plus récents.
Dans Agent Studio, les résumés de réflexion sont activés par défaut et peuvent être consultés en développant le panneau Étapes du raisonnement.
Lorsque vous utilisez l'API, vous pouvez activer les résumés de réflexion en définissant include_thoughts=True dans votre ThinkingConfig :
Console
Les résumés de réflexion sont activés par défaut dans Agent Studio. Vous pouvez voir le résumé du processus de réflexion du modèle en développant le panneau Étapes du raisonnement.
Python
Installer
pip install --upgrade google-genai
Pour en savoir plus, consultez la documentation de référence du SDK.
Définissez des variables d'environnement pour utiliser le SDK Google Gen AI avec Vertex AI :
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Node.js
Installer
npm install @google/genai
Pour en savoir plus, consultez la documentation de référence du SDK.
Définissez des variables d'environnement pour utiliser le SDK Google Gen AI avec Vertex AI :
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Go
Découvrez comment installer ou mettre à jour le Go.
Pour en savoir plus, consultez la documentation de référence du SDK.
Définissez des variables d'environnement pour utiliser le SDK Google Gen AI avec Vertex AI :
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Java
Découvrez comment installer ou mettre à jour le Java.
Pour en savoir plus, consultez la documentation de référence du SDK.
Définissez des variables d'environnement pour utiliser le SDK Google Gen AI avec Vertex AI :
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Une réponse peut contenir une signature de pensée sans texte récapitulatif de la pensée dans les scénarios suivants :
- Requêtes de faible complexité : le modèle a nécessité un minimum d'étapes de raisonnement pour formuler la réponse.
- Résumés désactivés : les résumés de pensée n'ont pas été demandés ou ont été explicitement désactivés.
- Modalités de raisonnement non textuelles : certaines modalités (comme le traitement d'images) peuvent ne pas générer de résumés textuels.
Votre application doit toujours gérer correctement les réponses dans lesquelles le contenu du résumé de la pensée est absent ou vide, tout en conservant les signatures de pensée associées.
Signatures de réflexion
Les signatures de pensée sont des représentations chiffrées du processus de réflexion interne du modèle qui préservent l'état de raisonnement de Gemini lors des conversations multitours, en particulier lors de l'utilisation de l'appel de fonction.
Pour que le modèle conserve l'intégralité du contexte sur plusieurs tours de conversation, vous devez renvoyer les signatures de réflexion des réponses précédentes dans vos requêtes suivantes, quel que soit le niveau de réflexion utilisé. Si vous utilisez le SDK Google Gen AI officiel (Python, Node.js, Go ou Java) et les fonctionnalités standard de l'historique des discussions, ou si vous ajoutez la réponse complète du modèle à l'historique, les signatures de pensée sont gérées automatiquement.
Pour obtenir des règles détaillées, des exemples et des modèles de workflow multitours, consultez Signatures de pensée.
Techniques de rédaction de prompts
Une conception efficace des requêtes vous aide à orienter le raisonnement du modèle, à réserver un budget de jetons et à obtenir une qualité de sortie optimale avec les modèles à raisonnement.
Pour obtenir des stratégies complètes, des modèles multishot, des requêtes de validation et des conseils de débogage, consultez le guide sur les requêtes de réflexion.
Tarifs
Les jetons générés lors du processus de réflexion d'un modèle vous sont facturés. Pour certains modèles, tels que Gemini 3 Pro et Gemini 2.5 Pro, la réflexion est activée par défaut et vous êtes facturé pour ces jetons.
Pour en savoir plus, consultez la page Tarifs d'Agent Platform. Pour savoir comment gérer les coûts, consultez Contrôler la réflexion du modèle.
Étapes suivantes
Signatures de réflexion
Découvrez comment préserver l'état de raisonnement de Gemini lors de conversations multitours et à plusieurs étapes à l'aide de signatures de pensée.
Guide sur les requêtes de réflexion
Découvrez les techniques et les bonnes pratiques de prompt engineering adaptées aux modèles de réflexion Gemini.