Questa pagina illustra i casi d'uso per l'hosting di agenti di AI su Cloud Run.
Gli agenti AI sono entità software autonome che utilizzano sistemi basati su LLM per percepire, decidere e agire per raggiungere gli obiettivi. Man mano che vengono creati agenti più autonomi, la loro capacità di comunicare e collaborare diventa fondamentale.
Per un'introduzione agli agenti AI, vedere Che cos'è un AI IA.
Scegli una risorsa Cloud Run
A seconda della progettazione dell'agente, puoi eseguire il contenitore dell'agente come uno dei seguenti tipi di risorse Cloud Run:
- Servizi: Ideale per agenti stateless, basati su richieste, che gestiscono traffico utente variabile, beneficiano dell'autoscaling e possono scalare a zero quando sono inattivi. Tra gli esempi figurano le API per chatbot e i backend delle API web.
- Istanze:ideale per loop di agenti singleton dedicati, stateful e sempre attivi che richiedono comandi di stato del ciclo di vita simili a quelli delle VM. Alcuni esempi includono agenti personali come OpenClaw e Hermes.
- Pool di worker:ideali per l'esecuzione di flotte di agenti distribuiti in background che utilizzano attività provenienti da code di messaggi, come Kafka o Pub/Sub, e scalano orizzontalmente senza esporre endpoint HTTP pubblici.
- Job:ideale per i flussi di lavoro degli agenti run-to-completion, come le valutazioni batch, le pipeline di importazione dati su larga scala o gli script di sincronizzazione pianificata.
Scegliere il framework dell'agente
Prima di eseguire il deployment dell'agente in Cloud Run, scegli e configura il framework dell'agente localmente o sulla tua piattaforma di sviluppo. Esempi di framework per agenti includono Agent Development Kit (ADK), Dify, LangGraph e n8n.
Su Cloud Run, il codice viene in genere eseguito come servizio servizio o istanza. Entrambi questi tipi di risorse eseguono istanze di container in ambiente sandbox nello stesso ambiente di esecuzione e si integrano con Google Cloud services.
Architettura dell'agente AI su Cloud Run
Una tipica architettura di agenti AI di cui è stato eseguito il deployment su Cloud Run può coinvolgere diversi componenti di Google Cloud e anche al di fuori diGoogle Cloud. L'architettura seguente mostra un esempio di implementazione di un agente AI come servizio Cloud Run per orchestrare una serie di attività asincrone e fornire informazioni attraverso molteplici interazioni richiesta-risposta.
Il diagramma mostra quanto segue:
Piattaforma di hosting: un servizio Cloud Run è un endpoint API scalabile per la logica principale della tua applicazione. Gestisce in modo efficiente più utenti simultanei tramite lo scale up automatico, on demand e rapido delle istanze. Cloud Run offre i seguenti vantaggi:
- Supporta l'esecuzione di qualsiasi framework agente per costruire diversi tipi di agenti e architetture agentiche.
- Supporto integrato per Agent Identity. Assegna un'identità univoca e verificabile tramite crittografia al tuo agente per chiamare Google Cloud API e strumenti e connettersi in modo sicuro ad altri agenti. Per saperne di più, consulta Configura le funzionalità della piattaforma agente.
- Integrazione integrata con Agent Registry. Designa i servizi distribuiti come agente o server MCP per il rilevamento automatico e robusti meccanismi di autenticazione agente-agente (A2A). Per saperne di più, consulta Configura le funzionalità della piattaforma agente.
- Consente di collegare il framework dell'agente ad altri servizi. Puoi collegare il tuo agente a strumenti proprietari o di terze parti di cui è stato eseguito il deployment su Cloud Run. Ad esempio, per ottenere visibilità sulle attività e sulle esecuzioni dell'agente, puoi eseguire il deployment e utilizzare strumenti come Langfuse e Arize.
Interazioni con l'agente: Cloud Run supporta lo streaming delle risposte HTTP all'utente e WebSockets per interazioni in tempo reale.
Modelli di AI generativa: il livello di orchestrazione chiama i modelli per le funzionalità di ragionamento. Questi modelli possono essere ospitati su servizi come:
- API Gemini per i modelli di AI generativa di Google.
- Endpoint di Vertex AI per modelli personalizzati o altri modelli di base.
- Servizio Cloud Run abilitato per la GPU per i tuoi modelli ottimizzati.
Memoria Gli agenti spesso hanno bisogno della memoria per conservare il contesto e imparare dalle interazioni passate. È possibile utilizzare i seguenti servizi:
- Memorystore for Redis per la memoria a breve termine.
- Firestore per la memoria a lungo termine, ad esempio per memorizzare la cronologia delle conversazioni o ricordare le preferenze dell'utente in base ai dati non elaborati.
- Memory Bank di Vertex AI Agent Engine per la memoria personalizzata a lungo termine. Questa funzionalità estrae automaticamente dalla cronologia delle conversazioni dell'utente per ricordare e aggiornare le preferenze dell'utente nel tempo. Tieni presente che devi creare almeno un'istanza di Agent Engine per utilizzare questa funzionalità con Cloud Run.
Database vettoriale: per la generazione Retrieval-Augmented Generation (RAG) o il recupero di dati strutturati, utilizza un database vettoriale per eseguire query su informazioni specifiche sulle entità o eseguire una ricerca vettoriale sugli incorporamenti. Utilizzare il
pgvectorestensione con i seguenti servizi:Strumenti: L'orchestratore utilizza strumenti per eseguire attività specifiche per interagire con servizi esterni, API o siti web. Ciò può includere:
- Model Context Protocol (MCP): utilizza questo protocollo standardizzato per comunicare con strumenti esterni eseguiti tramite un server MCP.
- Funzioni di base: calcoli matematici precisi, conversioni di tempo o altre funzioni simili.
- Chiamate API: Effettua chiamate ad altre API interne o di terze parti (accesso in lettura o scrittura).
- Generazione di immagini o grafici: crea contenuti visivi in modo rapido ed efficace.
- Automazione del browser e del sistema operativo: esegui un sistema operativo headless o un sistema operativo grafico completo all'interno di istanze container per consentire all'agente di navigare sul web, estrarre informazioni dai siti web o eseguire azioni tramite clic e input da tastiera.
- Esecuzione del codice: esegui il codice in un ambiente sicuro con sandbox a più livelli, con autorizzazioni IAM minime o nulle .
- Esecuzione del codice di Vertex AI Agent Engine: esegui il codice in un ambiente sandbox sicuro, isolato e gestito che supporta l'input e l'output di file, l'esecuzione del codice in meno di un secondo e la memoria a lunga durata. Tieni presente che devi creare almeno un'istanza di Vertex AI Agent Engine per utilizzare questa funzionalità in Cloud Run.
Passaggi successivi
- Crea e distribuisci agenti su Cloud Run:
- Guarda Crea agenti AI su Cloud Run.
- Prova il codelab per scoprire come creare ed eseguire il deployment di un'app LangChain su Cloud Run.
- Scopri come eseguire il deployment di Agent Development Kit (ADK) su Cloud Run.
- Scopri come creare e gestire istanze Cloud Run.
- Prova il codelab per l'utilizzo di un server MCP su Cloud Run con un agente ADK.
- Prova il codelab per distribuire il tuo agente ADK su Cloud Run con GPU.
- Trova esempi di agenti pronti all'uso in Esempi ADK.
- Server Host Model Context Protocol (MCP) su Cloud Run.