Cette page présente les cas d'utilisation de l'hébergement d'agents IA sur Cloud Run.
Les agents IA sont des entités logicielles autonomes qui utilisent des systèmes basés sur des LLM pour percevoir, décider et agir afin d'atteindre des objectifs. À mesure que des agents plus autonomes sont créés, leur capacité à communiquer et à collaborer devient essentielle.
Pour une présentation des agents IA, consultez Qu'est-ce qu'un agent IA ?
Cas d'utilisation des agents IA sur Cloud Run
Vous pouvez implémenter des agents IA en tant que services Cloud Run pour orchestrer un ensemble de tâches asynchrones et fournir des informations via plusieurs interactions requête-réponse.
Un service Cloud Run est un point de terminaison d'API évolutif pour la logique de base de votre application. Il gère efficacement plusieurs utilisateurs simultanés grâce à un scaling automatique, à la demande et rapide des instances.
Architecture d'un agent IA sur Cloud Run
Une architecture d'agent IA type déployée sur Cloud Run peut impliquer plusieurs composants provenant de Google Cloud et en dehors de Google Cloud:
Le schéma montre les éléments suivants :
Plate-forme d'hébergement : Cloud Run est une plate-forme d'hébergement pour l' exécution d'agents. Elle offre les avantages suivants :
- Permet d'exécuter n'importe quel framework d'agent pour créer différents types d'agents et d'architectures agentiques. Parmi les exemples de frameworks d'agents, citons Agent Development Kit (ADK), Dify, LangGraph et n8n.
- Fournit des fonctionnalités intégrées pour gérer votre agent. Par exemple, Cloud Run fournit une identité de service intégrée que vous pouvez utiliser comme identité d'agent pour appeler des Google Cloud API avec des identifiants sécurisés et automatiques.
- Permet de connecter votre framework d'agent à d'autres services. Vous pouvez connecter votre agent à des outils propriétaires ou tiers déployés sur Cloud Run. Par exemple, pour obtenir de la visibilité sur les tâches et les exécutions de votre agent, vous pouvez déployer et utiliser des outils tels que Langfuse et Arize.
Interactions avec l'agent : Cloud Run est compatible avec la diffusion en flux continu des réponses HTTP à l'utilisateur et avec WebSockets pour les interactions en temps réel.
Modèles GenAI : la couche d'orchestration appelle des modèles pour les capacités de raisonnement. Ces modèles peuvent être hébergés sur des services tels que les suivants :
- API Gemini pour les modèles d'IA générative de Google.
- Points de terminaison Vertex AI pour les modèles personnalisés ou d'autres modèles de base.
- Service Cloud Run compatible avec les GPU pour vos propres modèles affinés.
Mémoire : les agents ont souvent besoin de mémoire pour conserver le contexte et tirer des leçons des interactions passées. Vous pouvez utiliser les services suivants :
- Memorystore pour Redis pour la mémoire à court terme.
- Firestore pour la mémoire à long terme, par exemple pour stocker l'historique des conversations ou mémoriser les préférences de l'utilisateur en fonction de données brutes.
- Banque de mémoire d'Agent Runtime pour la mémoire personnalisée à long terme. Cette fonctionnalité extrait automatiquement l'historique des conversations de l'utilisateur pour mémoriser et mettre à jour ses préférences au fil du temps. Notez que vous devez créer au moins une instance d'Agent Engine pour utiliser cette fonctionnalité avec Cloud Run.
Base de données vectorielle : pour la génération augmentée par récupération (RAG) ou la récupération de données structurées, utilisez une base de données vectorielle pour interroger des informations spécifiques sur une entité ou effectuer une recherche vectorielle sur des embeddings. Utilisez l'extension
pgvectoravec les services suivants :Outils : l'orchestrateur utilise des outils pour effectuer des tâches spécifiques afin d'interagir avec des services, des API ou des sites Web externes. Par exemple :
- Protocole MCP (Model Context Protocol) : utilisez ce protocole standardisé pour communiquer avec des outils externes exécutés via un serveur MCP.
- Utilitaires de base : calculs mathématiques précis, conversions d'heure ou autres utilitaires similaires.
- Appel d'API : effectuez des appels vers d'autres API internes ou tierces (accès en lecture ou en écriture).
- Génération d'images ou de graphiques : créez rapidement et efficacement du contenu visuel.
- Automatisation du navigateur et du système d'exploitation : exécutez un système d'exploitation sans interface graphique ou graphique complet dans des instances de conteneur pour permettre à l'agent de naviguer sur le Web, d'extraire des informations de sites Web ou d'effectuer des actions à l'aide de clics et de saisies au clavier.
- Exécution de code : Exécutez du code dans un environnement sécurisé avec un bac à sable multicouche, avec des autorisations IAM minimales ou nulles IAM.
- Exécution de code d'Agent Runtime : exécutez du code dans des environnements de bac à sable sécurisés, isolés et gérés qui acceptent les entrées et sorties de fichiers, une exécution de code inférieure à une seconde et une mémoire à longue durée de vie. Notez que vous devez créer au moins une instance d'Agent Runtime pour utiliser cette fonctionnalité dans Cloud Run.
Étape suivante
- Regardez Créer des agents IA sur Cloud Run.
- Essayez l'atelier de programmation pour découvrir comment créer et déployer une application LangChain sur Cloud Run.
- Découvrez comment déployer Agent Development Kit (ADK) sur Cloud Run.
- Essayez l'atelier de programmation pour utiliser un serveur MCP sur Cloud Run avec un agent ADK.
- Essayez l'atelier de programmation pour déployer votre agent ADK sur Cloud Run avec un GPU.
- Trouvez des exemples d'agents prêts à l'emploi dans Exemples d'Agent Development Kit (ADK).
- Hébergez des serveurs MCP (Model Context Protocol) sur Cloud Run.