Che tu stia creando agenti, eseguendo modelli di inferenza o integrando vari servizi di AI, Cloud Run offre la scalabilità, la flessibilità e la facilità d'uso necessarie per dare vita alle tue innovazioni di AI.
Questa pagina evidenzia alcuni casi d'uso di alto livello per l'hosting, la creazione e il deployment di carichi di lavoro di AI su Cloud Run.
Perché utilizzare Cloud Run per i carichi di lavoro di AI?
Cloud Run offre diversi vantaggi per garantire che le tue applicazioni di AI siano scalabili, flessibili e gestibili. Di seguito sono riportati alcuni punti salienti:
- Supporto flessibile dei container: crea il pacchetto dell'app e delle relative dipendenze in un container oppure utilizza qualsiasi linguaggio, libreria o framework supportato. Scopri di più sul contratto di runtime dei container di Cloud Run.
- Endpoint HTTP: dopo il deployment di un servizio o di un'istanza Cloud Run, ricevi un endpoint URL Cloud Run sicuro e pronto all'uso . Cloud Run fornisce lo streaming tramite il supporto della codifica di trasferimento a blocchi HTTP, HTTP/2 e WebSocket.
- Scalabilità automatica o manuale: per i servizi Cloud Run, Cloud Run scala automaticamente il servizio in base alla domanda. In questo modo paghi solo per ciò che utilizzi, il che lo rende ideale per i carichi di lavoro di AI imprevedibili. Puoi anche impostare la scalabilità manuale del servizio in base alle esigenze di traffico e utilizzo della CPU. Per le istanze Cloud Run, la scalabilità automatica non è applicabile; vengono eseguite come singleton che avvii e arresti manualmente.
Supporto GPU: accelera i tuoi modelli di AI configurando le risorse Cloud Run con le GPU. I servizi Cloud Run con le GPU abilitate possono fare lo scale down a zero per ridurre i costi quando non sono in uso.
Ecosistema integrato: connettiti senza problemi ad altri Google Cloud servizi, come Vertex AI, BigQuery, Cloud SQL, Memorystore, Pub/Sub, AlloyDB per PostgreSQL, Cloud CDN, Secret Manager e domini personalizzati per creare pipeline di AI end-to-end complete. Google Cloud Observability fornisce anche strumenti di monitoraggio e logging integrati per comprendere le prestazioni delle applicazioni e risolvere i problemi in modo efficace.
- Pronto per l'uso aziendale: Cloud Run offre connettività VPC diretta, sicurezza granulare e controlli di rete.
Casi d'uso principali dell'AI
Ecco alcuni modi in cui puoi utilizzare Cloud Run per potenziare le tue applicazioni di AI:
Ospita agenti e bot di AI
Cloud Run è una piattaforma ideale per ospitare la logica di backend per agenti AI, chatbot e assistenti virtuali. Questi agenti possono orchestrare le chiamate a modelli di AI come Gemini su Vertex AI, gestire lo stato e integrarsi con vari strumenti e API.
- Microservizi per gli agenti: esegui il deployment delle singole funzionalità dell'agente come servizi o istanze Cloud Run separati. Per saperne di più, consulta Ospitare agenti AI.
- Comunicazione Agent2Agent (A2A): crea sistemi di agenti collaborativi utilizzando il protocollo A2A. Per saperne di più, consulta Ospitare agenti A2A.
- Server Model Context Protocol (MCP): implementa i server MCP per fornire un contesto standardizzato agli LLM dalle tue origini dati e dai tuoi strumenti. Per saperne di più, consulta Ospitare server MCP.
Fornisci modelli AI/ML per l'inferenza
Esegui il deployment dei modelli di machine learning addestrati come endpoint HTTP scalabili.
- Inferenza in tempo reale: fornisci previsioni da modelli creati con framework come TensorFlow, PyTorch, scikit-learn o utilizzando modelli open source come Gemma. Per un esempio, consulta Eseguire Gemma 3 su Cloud Run.
- Accelerazione GPU: utilizza le GPU NVIDIA per accelerare l'inferenza per i modelli più impegnativi. Per saperne di più, consulta Configurare la GPU per i servizi.
- Integra con Vertex AI: eroga modelli addestrati o di cui è stato eseguito il deployment su Vertex AI, utilizzando Cloud Run come frontend scalabile.
- Disaccoppia i file di modelli di grandi dimensioni dal container: l'adattatore Cloud Storage FUSE ti consente di montare un bucket Cloud Storage e di renderlo accessibile come directory locale all'interno del container Cloud Run.
Crea sistemi RAG (Retrieval-Augmented Generation)
Crea applicazioni RAG collegando i servizi o le istanze Cloud Run alle tue origini dati.
- Database vettoriali: connettiti ai database vettoriali ospitati su
Cloud SQL (con
pgvector), AlloyDB per PostgreSQL, Memorystore per Redis o altri archivi vettoriali specializzati per recuperare il contesto pertinente per i tuoi LLM. Consulta un esempio di infrastruttura che utilizza Cloud Run per ospitare un'applicazione di AI generativa compatibile con RAG ed elaborare i dati utilizzando Vertex AI e Vector Search. - Accesso ai dati: recupera i dati da Cloud Storage, BigQuery, Firestore o altre API per arricchire i prompt.
Ospita API e backend basati su AI
Crea API e microservizi che incorporano funzionalità di AI.
- API intelligenti: sviluppa API che utilizzano LLM per la comprensione del linguaggio naturale , l'analisi del sentiment, la traduzione, il riepilogo e così via.
- Workflow automatizzati: crea servizi che attivano azioni basate su AI in base a eventi o richieste.
Prototipa e sperimenta le idee
Itera rapidamente sulle idee di AI.
- Deployment rapido: sposta rapidamente i prototipi da ambienti come Vertex AI Studio, Google AI Studio, o notebook Jupyter a deployment scalabili su Cloud Run con una configurazione minima.
- Suddivisione del traffico: utilizza la funzionalità di suddivisione del traffico di Cloud Run per eseguire test A/B di diversi modelli, prompt o configurazioni e Google Cloud Observability per monitorare le metriche (latenza, tasso di errore, costo) per misurare il successo dei test A/B.
Passaggi successivi
A seconda della tua familiarità con i concetti di AI e del tuo caso d'uso di AI, esplora le risorse di AI di Cloud Run.