Questo documento fornisce un'architettura di alto livello per l'implementazione di flussi di lavoro di analisi cross-cloud che utilizzano agenti AI. Il documento è destinato ad architetti cloud, data engineer e data scientist che vogliono utilizzare l'AI agentica per i workflow di analisi in data lake multicloud, data warehouse strutturati e archivi di dati non strutturati. Il documento presuppone che tu abbia una conoscenza di base dei concetti di AI agentica, analisi dei dati e architettura cloud.
La sezione Deployment di questo documento fornisce un codelab che puoi utilizzare per imparare a creare una soluzione di analisi con agenti.
Architettura
Il seguente diagramma mostra un'architettura per una soluzione di analisi agentica che ricava approfondimenti aziendali da dati strutturati e non strutturati distribuiti su più datastore e fornitori di servizi cloud.
I componenti di questa architettura sono organizzati nei seguenti livelli:
Azioni dell'utente e dell'agente
- Ambiente di sviluppo agentico: i professionisti dei dati, come data engineer
e data scientist, inviano richieste in linguaggio naturale utilizzando uno dei
seguenti metodi:
- Un ambiente di sviluppo con agenti come Google Antigravity IDE o Microsoft Visual Studio Code.
- Un agente CLI come Gemini CLI, Claude Code o Codex.
- Estensione Google Cloud Data Agent Kit: l'estensione consente agli agenti di accedere a dati attendibili in Google Cloud caricando le competenze appropriate e connettendosi a server MCP remoti per i servizi Google Cloud .
- Foundation model: per generare approfondimenti aziendali da un contesto e da dati attendibili, l'ambiente di sviluppo agentico utilizza un foundation model, ad esempio un modello della famiglia Gemini. Il modello utilizza le competenze appropriate dell'estensione Data Agent Kit e gli strumenti del server MCP richiesti per implementare workflow di analisi complessi.
- Ambiente di sviluppo agentico: i professionisti dei dati, come data engineer
e data scientist, inviano richieste in linguaggio naturale utilizzando uno dei
seguenti metodi:
Flussi di lavoro di Analytics
- Lakehouse for Apache Iceberg: Lakehouse fornisce un catalogo di metadati unificato e ad alte prestazioni che integra il formato di tabella aperto Apache Iceberg con lo spazio di archiviazione di livello aziendale in Google Cloud.
- Managed Service for Apache Spark: Questo è il componente principale di elaborazione dei dati nell'architettura. La funzionalità Lightning Engine di Managed Service for Apache Spark supporta l'elaborazione dei dati serverless ad alte prestazioni in modalità batch e interattiva. I job di elaborazione dei dati Spark utilizzano i metadati del catalogo Iceberg in Lakehouse, leggono i dati strutturati da BigQuery ed eseguono letture senza copia da origini esterne come Amazon S3.
- Knowledge Catalog: l'agente utilizza Knowledge Catalog per eseguire scansioni intelligenti di dati non strutturati in Cloud Storage, estrae i metadati semantici e crea un grafico contestuale.
Datastore attendibili
- Dati in Google Cloud: BigQuery funge da data warehouse centrale per i dati strutturati, incluse le estrazioni strutturate da dati non strutturati in Cloud Storage.
- Dati da origini esterne: l'architettura mostra origini dati esterne, come i dati nei bucket Amazon S3 e i metadati in Databricks Unity Catalog. Cross-Cloud Interconnect fornisce una connettività dedicata a larghezza di banda elevata tra Google Cloud e altri provider di servizi cloud.
Prodotti utilizzati
L'architettura utilizza i seguenti prodotti e strumenti Google Cloud :
- Kit di agenti di Google Cloud Data: estensioni degli agenti per consentire a data scientist, data engineer e sviluppatori di app per i dati di gestire l'intero ciclo di vita dei dati all'interno dei loro ambienti di sviluppo agentici preferiti.
- BigQuery: un data warehouse aziendale che ti aiuta a gestire e analizzare i dati con funzionalità integrate come machine learning, analisi geospaziale e business intelligence.
- Managed Service for Apache Spark: un servizio gestito che esegue workload batch Apache Spark su un'infrastruttura di calcolo gestita.
- Lakehouse for Apache Iceberg: un motore di archiviazione ad alte prestazioni che ti consente di creare data lakehouse aperti e fornisce un'interfaccia unificata per analisi avanzate e AI.
- Knowledge Catalog: un servizio basato sull'AI che fornisce un catalogo unificato di asset di dati con metadati e funzionalità di governance intelligenti.
- Gemini: una famiglia di modelli di AI multimodale sviluppati da Google.
- Cloud Storage: uno spazio di archiviazione di oggetti a basso costo e senza limiti per diversi tipi di dati. I dati sono accessibili dall'interno e dall'esterno di Google Cloude vengono replicati in più località per la ridondanza.
- Cross-Cloud Interconnect: un servizio che fornisce connettività dedicata a elevata larghezza di banda e bassa latenza tra Google Cloud e altri provider di servizi cloud.
- Server MCP Google Cloud: servizi remoti gestiti da Google che implementano il Model Context Protocol (MCP) per fornire alle applicazioni AI l'accesso a Google e ai prodotti e servizi Google Cloud .
Casi d'uso
L'architettura descritta in questo documento è adatta ai seguenti casi d'uso:
- Analisi dei dati multicloud: esegui query e analizza in modo efficiente i dati distribuiti su Google Cloud e altri fornitori di servizi cloud senza spostare i file o creare pipeline di estrazione, trasformazione e caricamento (ETL) complesse. Ad esempio, un responsabile del marketing di un rivenditore globale può analizzare l'efficacia delle campagne di marketing unendo i dati del programma fedeltà dei clienti in Amazon S3 con i dati delle operazioni di marketing in BigQuery.
- Individuazione intelligente dei dati: utilizza prompt in linguaggio naturale e agenti AI per scoprire, interrogare ed elaborare set di dati federati in più ambienti. Ad esempio, uno specialista degli acquisti può determinare le cause comuni delle interruzioni della catena di fornitura in base ai dati strutturati di un sistema di gestione della catena di fornitura (SCM) combinati con approfondimenti provenienti da comunicazioni email non strutturate e report di valutazione dei danni.
- Estrazione di dati strutturati da fonti non strutturate: esegui la scansione di grandi volumi di dati non strutturati, deriva metadati semantici e archivia estratti di dati strutturati in BigQuery per l'analisi downstream. Ad esempio, un controller delle operazioni può analizzare in modo efficiente le spese estraendo dati strutturati da migliaia di fatture archiviate in un formato non strutturato, come i file PDF.
Deployment
Per scoprire come creare una soluzione di analisi basata su agenti utilizzando l'estensione Data Agent Kit, consulta il codelab Trasforma i dati non elaborati in previsioni in pochi secondi con gli agenti AI. Il codelab mostra come l'estensione Data Agent Kit ti consente di analizzare in modo efficiente i dati all'interno del tuo ambiente di sviluppo agentico preferito. Tutti i dati di esempio utilizzati nel codelab sono archiviati in Google Cloud.
Passaggi successivi
- Scopri come l'estensione Data Agent Kit ti consente di utilizzare i blocchi note per la trasformazione e l'analisi dei dati.
- Esplora i casi d'uso di Knowledge Catalog.
- Scopri di più su Lakehouse.
- Scopri come accelerare i workload Apache Spark utilizzando Lightning Engine.
- Scopri come utilizzare Knowledge Catalog come livello di governance e autonomo per BigQuery.
- Per ulteriori architetture di riferimento, diagrammi e best practice, esplora Cloud Architecture Center.
Collaboratori
Autore: Kumar Dhanagopal | Cross-Product Solution Developer
Altri collaboratori:
- Abirami Sukumaran | Staff Developer Advocate
- Arti Prasad | Technical Writer
- Brad Miro | Senior Developer Advocate
- Matthew Rahmann | Senior Product Manager
- Ranadip Chatterjee | Solutions Engineer
- Remigiusz Samborski | Lead Developer Relations Engineer