In diesem Dokument wird eine allgemeine Architektur für die Implementierung von cloudübergreifenden Analyse-Workflows mit KI-Agenten beschrieben. Das Dokument richtet sich an Cloud-Architekten, Data Engineers und Data Scientists, die agentenbasierte KI für Analyse-Workflows in Multi-Cloud-Data Lakes, strukturierten Data Warehouses und unstrukturierten Datenspeichern verwenden möchten. Dabei wird vorausgesetzt, dass Sie über grundlegende Kenntnisse in den Bereichen agentenbasierte KI-Konzepte, Datenanalyse und Cloud-Architektur verfügen.
Im Abschnitt Bereitstellung dieses Dokuments finden Sie ein Codelab, mit dem Sie erfahren, wie Sie eine agentenbasierte Analyselösung erstellen.
Architektur
Das folgende Diagramm zeigt eine Architektur für eine agentenbasierte Analyselösung, die geschäftliche Erkenntnisse aus strukturierten und unstrukturierten Daten ableitet, die in mehreren Datenspeichern und bei verschiedenen Cloud-Dienstanbietern verteilt sind.
Die Komponenten in dieser Architektur sind in die folgenden Ebenen unterteilt:
Nutzer- und agentenbasierte Aktionen
- Agentenbasierte Entwicklungsumgebung: Datenexperten wie Data Engineers
und Data Scientists senden Anfragen in natürlicher Sprache mit einer der
folgenden Methoden:
- Eine agentenbasierte Entwicklungsumgebung wie Google Antigravity IDE oder Microsoft Visual Studio Code.
- Ein CLI-Agent wie Gemini CLI, Claude Code oder Codex.
- Google Cloud Data Agent Kit-Erweiterung: Mit der Erweiterung können Agenten auf vertrauenswürdige Daten in Google Cloud zugreifen, indem sie entsprechende Skills laden und eine Verbindung zu Remote-MCP-Servern für Google Cloud Dienste herstellen.
- Foundation Model: Um geschäftliche Erkenntnisse aus vertrauenswürdigem Kontext und Daten zu generieren, verwendet die agentenbasierte Entwicklungsumgebung ein Foundation Model wie ein Modell aus der Gemini-Familie. Das Modell verwendet die entsprechenden Skills aus der Data Agent Kit-Erweiterung und die erforderlichen MCP-Servertools, um komplexe Analyse-Workflows zu implementieren.
- Agentenbasierte Entwicklungsumgebung: Datenexperten wie Data Engineers
und Data Scientists senden Anfragen in natürlicher Sprache mit einer der
folgenden Methoden:
Analyse-Workflows
- Lakehouse für Apache Iceberg: Lakehouse bietet einen leistungsstarken, einheitlichen Metadaten katalog, der das offene Tabellenformat Apache Iceberg in mit Speicher der Enterprise-Klasse integriert Google Cloud.
- Managed Service for Apache Spark: Dies ist die zentrale Datenverarbeitungskomponente in der Architektur. Das Lightning Engine Feature von Managed Service for Apache Spark unterstützt die leistungsstarke, serverlose Datenverarbeitung im Batch- und interaktiven Modus. Die Spark Datenverarbeitungsjobs verwenden Metadaten aus dem Iceberg-Katalog in Lakehouse, lesen strukturierte Daten aus BigQuery und führen Lesevorgänge ohne Kopieren aus externen Quellen wie Amazon S3 aus.
- Knowledge Catalog: Der Agent verwendet Knowledge Catalog, um intelligente Scans unstrukturierter Daten in Cloud Storagedurchzuführen, semantische Metadaten zu extrahieren und einen Kontextgraphen zu erstellen.
Vertrauenswürdige Datenspeicher
- Daten in Google Cloud: BigQuery dient als zentrales Warehouse für strukturierte Daten, einschließlich strukturierter Extrakte aus unstrukturierten Daten in Cloud Storage.
- Daten aus externen Quellen: Die Architektur zeigt externe Daten quellen wie Daten in Amazon S3-Buckets und Metadaten im Databricks Unity Catalog. Cross-Cloud Interconnect bietet eine dedizierte Verbindung mit hoher Bandbreite zwischen Google Cloud und anderen Cloud-Dienstanbietern.
Verwendete Produkte
Die Architektur verwendet die folgenden Google Cloud Produkte und Tools:
- Google Cloud Data Agent Kit: Agentenerweiterungen, mit denen Data Scientists, Data Engineers und Entwickler von Daten-Apps den gesamten Lebenszyklus der Daten in ihren bevorzugten agentenbasierten Entwicklungsumgebungen verwalten können.
- BigQuery: Ein Data Warehouse für Unternehmen, mit dem Sie Ihre Daten mit integrierten Features wie maschinellem Lernen, raumbezogenen Analysen und Business Intelligence verwalten und analysieren können.
- Managed Service for Apache Spark: Ein verwalteter Dienst, der Apache Spark-Batch Arbeitslasten in einer verwalteten Compute-Infrastruktur ausführt.
- Lakehouse for Apache Iceberg: Eine leistungsstarke Speicher-Engine, mit der Sie offene Data Lakehouses erstellen können. Sie bietet eine einheitliche Schnittstelle für erweiterte Analysen und KI.
- Knowledge Catalog: Ein KI-basierter Dienst der einen einheitlichen Katalog von Daten-Assets mit intelligenten Metadaten- und Governance Funktionen bietet.
- Gemini: Eine Familie multimodaler KI-Modelle, die von Google entwickelt wurden.
- Cloud Storage: Ein kostengünstiger, unbegrenzter Objektspeicher für verschiedene Datentypen. Auf Daten kann von innerhalb und außerhalb von zugegriffen werden Google Cloud. Sie werden zu Redundanzzwecken über Standorte hinweg repliziert .
- Cross-Cloud Interconnect: Ein Dienst, der eine dedizierte Verbindung mit hoher Bandbreite und niedriger Latenz zwischen Google Cloud und anderen Cloud-Dienstanbietern bietet.
- Google Cloud-MCP-Server: Von Google verwaltete Remotedienste, die das Model Context Protocol (MCP) implementieren, um KI-Anwendungen Zugriff auf Google- und Google Cloud Produkte und -Dienste zu ermöglichen.
Anwendungsfälle
Die in diesem Dokument beschriebene Architektur eignet sich für die folgenden Anwendungsfälle:
- Multi-Cloud-Datenanalyse: Daten, die in Google Cloud und bei anderen Cloud-Dienstanbietern verteilt sind, effizient abfragen und analysieren, ohne Dateien zu verschieben oder komplexe ETL-Pipelines (Extract, Transform, Load) zu erstellen. Ein Marketingmanager eines globalen Einzelhändlers kann beispielsweise die Effektivität von Marketingkampagnen analysieren, indem er Kundentreuedaten in Amazon S3 mit Marketingdaten in BigQuery zusammenführt.
- Intelligente Datenerkennung: Prompts in natürlicher Sprache und KI-Agenten verwenden, um föderierte Datensätze in mehreren Umgebungen zu erkennen, abzufragen und zu verarbeiten. Ein Einkäufer kann beispielsweise anhand strukturierter Daten in einem SCM-System (Supply Chain Management) in Kombination mit Erkenntnissen aus unstrukturierter E-Mail-Kommunikation und Schadensberichten häufige Ursachen für Unterbrechungen der Lieferkette ermitteln.
- Datenextraktion aus unstrukturierten Quellen: Große Mengen unstrukturierter Daten scannen, semantische Metadaten ableiten und strukturierte Datenextrakte in BigQuery für die nachgelagerte Analyse speichern. Ein Betriebscontroller kann beispielsweise Ausgaben effizient analysieren, indem er strukturierte Daten aus Tausenden von Rechnungen extrahiert, die in einem unstrukturierten Format wie PDF-Dateien gespeichert sind.
Bereitstellung
Informationen zum Erstellen einer agentenbasierten Analyselösung mit der Data Agent Kit-Erweiterung finden Sie im Codelab, Raw data to forecasting in seconds with AI agents. Im Codelab wird gezeigt, wie Sie mit der Data Agent Kit-Erweiterung Daten effizient in Ihrer bevorzugten agentenbasierten Entwicklungsumgebung analysieren können. Alle Beispieldaten, die im Codelab verwendet werden, sind in Google Cloudgespeichert.
Nächste Schritte
- Informationen dazu, wie Sie mit der Data Agent Kit-Erweiterung Notebooks für die Datentransformation und -analyse verwenden können.
- Anwendungsfälle für Knowledge Catalog .
- Weitere Informationen zu Borderless Lakehouse.
- Informationen zum Beschleunigen von Apache Spark-Arbeitslasten mit Lightning Engine.
- Informationen dazu, wie Sie Knowledge Catalog als Governance- und Agentenebene für BigQuery verwenden können.
- Weitere Referenzarchitekturen, Diagramme und Best Practices finden Sie im Cloud Architecture Center.
Beitragende
Autor: Kumar Dhanagopal | Cross-product Solution Developer
Weitere Beitragende:
- Abirami Sukumaran | Staff Developer Advocate
- Arti Prasad | Technical Writer
- Brad Miro | Senior Developer Advocate
- Matthew Rahmann | Senior Product Manager
- Ranadip Chatterjee | Solutions Engineer
- Remigiusz Samborski | Lead Developer Relations Engineer