Les modèles Anthropic Claude proposent la mise en cache des requêtes pour réduire la latence et les coûts lorsque le même contenu est réutilisé dans plusieurs requêtes. Lorsque vous envoyez une requête, vous pouvez mettre en cache tout ou partie de votre entrée afin que les requêtes suivantes puissent utiliser les résultats mis en cache de la requête précédente. Cela évite des coûts de calcul et de réseau supplémentaires. Les caches sont propres à votre Google Cloud projet et ne peuvent pas être utilisés par d'autres projets.
Traitement des données
La mise en cache explicite des requêtes d'Anthropic est une fonctionnalité des modèles Anthropic Claude. L' offre Gemini Enterprise Agent Platform de ces modèles Anthropic se comporte comme décrit dans la documentation Anthropic.
La mise en cache des requêtes est une fonctionnalité facultative. Claude calcule les hachages (empreintes) des requêtes pour les clés de mise en cache. Ces hachages ne sont calculés que pour les requêtes pour lesquelles la mise en cache est activée.
Bien que la mise en cache des requêtes soit une fonctionnalité implémentée par les modèles Claude, du point de vue du traitement des données, Google considère ces hachages comme un type de "métadonnées utilisateur". Ils sont traités comme des "données de service" client en vertu de l'Google Cloud Avis de confidentialité et non comme des "données client" en vertu de l'Avenant relatif au traitement des données dans le cloud (Clients). En particulier, les protections supplémentaires pour les "données client" ne s'appliquent pas à ces hachages. Google n'utilise pas ces hachages à d'autres fins.
Si vous souhaitez désactiver complètement cette fonctionnalité de mise en cache des requêtes et la rendre indisponible dans certains Google Cloud projets, vous pouvez en faire la demande en contactant l'assistance client et en fournissant les numéros de projet concernés. Une fois la mise en cache explicite désactivée pour un projet, les requêtes du projet pour lesquelles la mise en cache des requêtes est activée sont rejetées.
Utiliser la mise en cache des requêtes
Vous pouvez utiliser le SDK Anthropic Claude ou l'API REST Gemini Enterprise Agent Platform pour envoyer des requêtes au point de terminaison Gemini Enterprise Agent Platform.
Pour en savoir plus, consultez la section Fonctionnement de la mise en cache des requêtes.
Pour obtenir d'autres exemples, consultez la section Exemples de mise en cache des requêtes dans la documentation Anthropic.
La mise en cache se produit automatiquement lorsque les requêtes suivantes contiennent le même texte, les mêmes images et le même paramètre cache_control que la première requête. Toutes les requêtes doivent également inclure le paramètre cache_control dans les mêmes blocs.
Par défaut, le cache a une durée de vie de cinq minutes. Vous pouvez
étendre la TTL à une heure en définissant "ttl": "1h" dans l'cache_control
objet. La durée de vie du cache est actualisée chaque fois que le contenu mis en cache est consulté. Pour en savoir plus, consultez la section
Durée de mise en cache d'une heure.
La TTL d'une heure n'est pas compatible avec les modèles suivants : Claude 3.7 Sonnet sur Google Cloud, Claude 3.5 Sonnet v2 sur Google Cloud, Claude 3.5 Sonnet sur Google Cloud et Claude 3 Opus sur Google Cloud.
Tarifs
La mise en cache des requêtes peut avoir une incidence sur les coûts de facturation. Remarques :
- Les jetons d'écriture dans le cache d'une durée de vie de cinq minutes sont 25% plus chers que les jetons d'entrée de base.
- Les jetons d'écriture dans le cache d'une durée de vie d'une heure sont 100% plus chers que les jetons d'entrée de base.
- Les jetons de lecture dans le cache sont 90% moins chers que les jetons d'entrée de base.
- Les jetons d'entrée et de sortie standards sont facturés aux tarifs standards.
Pour en savoir plus, consultez la page Tarifs.