Ospita agenti AI sulle risorse Cloud Run

Questa pagina illustra i casi d'uso per l'hosting di agenti di AI su Cloud Run.

Gli agenti AI sono entità software autonome che utilizzano sistemi basati su LLM per percepire, decidere e agire per raggiungere gli obiettivi. Man mano che vengono creati agenti più autonomi, la loro capacità di comunicare e collaborare diventa fondamentale.

Per un'introduzione agli agenti AI, vedere Che cos'è un AI IA.

Scegli una risorsa Cloud Run

A seconda della progettazione dell'agente, puoi eseguire il contenitore dell'agente come uno dei seguenti tipi di risorse Cloud Run:

  • Servizi: Ideale per agenti stateless, basati su richieste, che gestiscono traffico utente variabile, beneficiano dell'autoscaling e possono scalare a zero quando sono inattivi. Tra gli esempi figurano le API per chatbot e i backend delle API web.
  • Istanze:ideale per loop di agenti singleton dedicati, stateful e sempre attivi che richiedono comandi di stato del ciclo di vita simili a quelli delle VM. Alcuni esempi includono agenti personali come OpenClaw e Hermes.
  • Pool di worker:ideali per l'esecuzione di flotte di agenti distribuiti in background che utilizzano attività provenienti da code di messaggi, come Kafka o Pub/Sub, e scalano orizzontalmente senza esporre endpoint HTTP pubblici.
  • Job:ideale per i flussi di lavoro degli agenti run-to-completion, come le valutazioni batch, le pipeline di importazione dati su larga scala o gli script di sincronizzazione pianificata.

Scegliere il framework dell'agente

Prima di eseguire il deployment dell'agente in Cloud Run, scegli e configura il framework dell'agente localmente o sulla tua piattaforma di sviluppo. Esempi di framework per agenti includono Agent Development Kit (ADK), Dify, LangGraph e n8n.

Su Cloud Run, il codice viene in genere eseguito come servizio servizio o istanza. Entrambi questi tipi di risorse eseguono istanze di container in ambiente sandbox nello stesso ambiente di esecuzione e si integrano con Google Cloud services.

Architettura dell'agente AI su Cloud Run

Una tipica architettura di agenti AI di cui è stato eseguito il deployment su Cloud Run può coinvolgere diversi componenti di Google Cloud e anche al di fuori diGoogle Cloud. L'architettura seguente mostra un esempio di implementazione di un agente AI come servizio Cloud Run per orchestrare una serie di attività asincrone e fornire informazioni attraverso molteplici interazioni richiesta-risposta.

I quattro componenti dell'agente AI ospitato su Cloud Run.
Figura 1. Architettura di un agente AI su Cloud Run.

Il diagramma mostra quanto segue:

  • Piattaforma di hosting: un servizio Cloud Run è un endpoint API scalabile per la logica principale della tua applicazione. Gestisce in modo efficiente più utenti simultanei tramite lo scale up automatico, on demand e rapido delle istanze. Cloud Run offre i seguenti vantaggi:

    • Supporta l'esecuzione di qualsiasi framework agente per costruire diversi tipi di agenti e architetture agentiche.
    • Supporto integrato per Agent Identity. Assegna un'identità univoca e verificabile tramite crittografia al tuo agente per chiamare Google Cloud API e strumenti e connettersi in modo sicuro ad altri agenti. Per saperne di più, consulta Configura le funzionalità della piattaforma agente.
    • Integrazione integrata con Agent Registry. Designa i servizi distribuiti come agente o server MCP per il rilevamento automatico e robusti meccanismi di autenticazione agente-agente (A2A). Per saperne di più, consulta Configura le funzionalità della piattaforma agente.
    • Consente di collegare il framework dell'agente ad altri servizi. Puoi collegare il tuo agente a strumenti proprietari o di terze parti di cui è stato eseguito il deployment su Cloud Run. Ad esempio, per ottenere visibilità sulle attività e sulle esecuzioni dell'agente, puoi eseguire il deployment e utilizzare strumenti come Langfuse e Arize.
  • Interazioni con l'agente: Cloud Run supporta lo streaming delle risposte HTTP all'utente e WebSockets per interazioni in tempo reale.

  • Modelli di AI generativa: il livello di orchestrazione chiama i modelli per le funzionalità di ragionamento. Questi modelli possono essere ospitati su servizi come:

  • Memoria Gli agenti spesso hanno bisogno della memoria per conservare il contesto e imparare dalle interazioni passate. È possibile utilizzare i seguenti servizi:

    • Memorystore for Redis per la memoria a breve termine.
    • Firestore per la memoria a lungo termine, ad esempio per memorizzare la cronologia delle conversazioni o ricordare le preferenze dell'utente in base ai dati non elaborati.
    • Memory Bank di Vertex AI Agent Engine per la memoria personalizzata a lungo termine. Questa funzionalità estrae automaticamente dalla cronologia delle conversazioni dell'utente per ricordare e aggiornare le preferenze dell'utente nel tempo. Tieni presente che devi creare almeno un'istanza di Agent Engine per utilizzare questa funzionalità con Cloud Run.
  • Database vettoriale: per la generazione Retrieval-Augmented Generation (RAG) o il recupero di dati strutturati, utilizza un database vettoriale per eseguire query su informazioni specifiche sulle entità o eseguire una ricerca vettoriale sugli incorporamenti. Utilizzare ilpgvector estensione con i seguenti servizi:

  • Strumenti: L'orchestratore utilizza strumenti per eseguire attività specifiche per interagire con servizi esterni, API o siti web. Ciò può includere:

    • Model Context Protocol (MCP): utilizza questo protocollo standardizzato per comunicare con strumenti esterni eseguiti tramite un server MCP.
    • Funzioni di base: calcoli matematici precisi, conversioni di tempo o altre funzioni simili.
    • Chiamate API: Effettua chiamate ad altre API interne o di terze parti (accesso in lettura o scrittura).
    • Generazione di immagini o grafici: crea contenuti visivi in ​​modo rapido ed efficace.
    • Automazione del browser e del sistema operativo: esegui un sistema operativo headless o un sistema operativo grafico completo all'interno di istanze container per consentire all'agente di navigare sul web, estrarre informazioni dai siti web o eseguire azioni tramite clic e input da tastiera.
    • Esecuzione del codice: esegui il codice in un ambiente sicuro con sandbox a più livelli, con autorizzazioni IAM minime o nulle .
    • Esecuzione del codice di Vertex AI Agent Engine: esegui il codice in un ambiente sandbox sicuro, isolato e gestito che supporta l'input e l'output di file, l'esecuzione del codice in meno di un secondo e la memoria a lunga durata. Tieni presente che devi creare almeno un'istanza di Vertex AI Agent Engine per utilizzare questa funzionalità in Cloud Run.

Passaggi successivi