Agentische Analyse-Workflows für verteilte Daten implementieren

Last reviewed 2026-06-09 UTC

In diesem Dokument wird eine allgemeine Architektur für die Implementierung von cloudübergreifenden Analyse-Workflows mit KI-Agenten beschrieben. Das Dokument richtet sich an Cloud-Architekten, Data Engineers und Data Scientists, die agentenbasierte KI für Analyse-Workflows in Multi-Cloud-Data Lakes, strukturierten Data Warehouses und unstrukturierten Datenspeichern verwenden möchten. Dabei wird vorausgesetzt, dass Sie über grundlegende Kenntnisse in den Bereichen agentenbasierte KI-Konzepte, Datenanalyse und Cloud-Architektur verfügen.

Im Abschnitt Bereitstellung dieses Dokuments finden Sie ein Codelab, mit dem Sie erfahren, wie Sie eine agentenbasierte Analyselösung erstellen.

Architektur

Das folgende Diagramm zeigt eine Architektur für eine agentenbasierte Analyselösung, die geschäftliche Erkenntnisse aus strukturierten und unstrukturierten Daten ableitet, die in mehreren Datenspeichern und bei verschiedenen Cloud-Dienstanbietern verteilt sind.

Eine Architektur, die eine agentenbasierte Entwicklungsumgebung und ein KI-Modell verwendet, um Daten zu analysieren, die über Google Cloud und andere Cloud-Dienstanbieter verteilt sind.

Die Komponenten in dieser Architektur sind in die folgenden Ebenen unterteilt:

  • Nutzer- und agentenbasierte Aktionen

    • Agentenbasierte Entwicklungsumgebung: Datenexperten wie Data Engineers und Data Scientists senden Anfragen in natürlicher Sprache mit einer der folgenden Methoden:
      • Eine agentenbasierte Entwicklungsumgebung wie Google Antigravity IDE oder Microsoft Visual Studio Code.
      • Ein CLI-Agent wie Gemini CLI, Claude Code oder Codex.
    • Google Cloud Data Agent Kit-Erweiterung: Mit der Erweiterung können Agenten auf vertrauenswürdige Daten in Google Cloud zugreifen, indem sie entsprechende Skills laden und eine Verbindung zu Remote-MCP-Servern für Google Cloud Dienste herstellen.
    • Foundation Model: Um geschäftliche Erkenntnisse aus vertrauenswürdigem Kontext und Daten zu generieren, verwendet die agentenbasierte Entwicklungsumgebung ein Foundation Model wie ein Modell aus der Gemini-Familie. Das Modell verwendet die entsprechenden Skills aus der Data Agent Kit-Erweiterung und die erforderlichen MCP-Servertools, um komplexe Analyse-Workflows zu implementieren.
  • Analyse-Workflows

  • Vertrauenswürdige Datenspeicher

    • Daten in Google Cloud: BigQuery dient als zentrales Warehouse für strukturierte Daten, einschließlich strukturierter Extrakte aus unstrukturierten Daten in Cloud Storage.
    • Daten aus externen Quellen: Die Architektur zeigt externe Daten quellen wie Daten in Amazon S3-Buckets und Metadaten im Databricks Unity Catalog. Cross-Cloud Interconnect bietet eine dedizierte Verbindung mit hoher Bandbreite zwischen Google Cloud und anderen Cloud-Dienstanbietern.

Verwendete Produkte

Die Architektur verwendet die folgenden Google Cloud Produkte und Tools:

  • Google Cloud Data Agent Kit: Agentenerweiterungen, mit denen Data Scientists, Data Engineers und Entwickler von Daten-Apps den gesamten Lebenszyklus der Daten in ihren bevorzugten agentenbasierten Entwicklungsumgebungen verwalten können.
  • BigQuery: Ein Data Warehouse für Unternehmen, mit dem Sie Ihre Daten mit integrierten Features wie maschinellem Lernen, raumbezogenen Analysen und Business Intelligence verwalten und analysieren können.
  • Managed Service for Apache Spark: Ein verwalteter Dienst, der Apache Spark-Batch Arbeitslasten in einer verwalteten Compute-Infrastruktur ausführt.
  • Lakehouse for Apache Iceberg: Eine leistungsstarke Speicher-Engine, mit der Sie offene Data Lakehouses erstellen können. Sie bietet eine einheitliche Schnittstelle für erweiterte Analysen und KI.
  • Knowledge Catalog: Ein KI-basierter Dienst der einen einheitlichen Katalog von Daten-Assets mit intelligenten Metadaten- und Governance Funktionen bietet.
  • Gemini: Eine Familie multimodaler KI-Modelle, die von Google entwickelt wurden.
  • Cloud Storage: Ein kostengünstiger, unbegrenzter Objektspeicher für verschiedene Datentypen. Auf Daten kann von innerhalb und außerhalb von zugegriffen werden Google Cloud. Sie werden zu Redundanzzwecken über Standorte hinweg repliziert .
  • Cross-Cloud Interconnect: Ein Dienst, der eine dedizierte Verbindung mit hoher Bandbreite und niedriger Latenz zwischen Google Cloud und anderen Cloud-Dienstanbietern bietet.
  • Google Cloud-MCP-Server: Von Google verwaltete Remotedienste, die das Model Context Protocol (MCP) implementieren, um KI-Anwendungen Zugriff auf Google- und Google Cloud Produkte und -Dienste zu ermöglichen.

Anwendungsfälle

Die in diesem Dokument beschriebene Architektur eignet sich für die folgenden Anwendungsfälle:

  • Multi-Cloud-Datenanalyse: Daten, die in Google Cloud und bei anderen Cloud-Dienstanbietern verteilt sind, effizient abfragen und analysieren, ohne Dateien zu verschieben oder komplexe ETL-Pipelines (Extract, Transform, Load) zu erstellen. Ein Marketingmanager eines globalen Einzelhändlers kann beispielsweise die Effektivität von Marketingkampagnen analysieren, indem er Kundentreuedaten in Amazon S3 mit Marketingdaten in BigQuery zusammenführt.
  • Intelligente Datenerkennung: Prompts in natürlicher Sprache und KI-Agenten verwenden, um föderierte Datensätze in mehreren Umgebungen zu erkennen, abzufragen und zu verarbeiten. Ein Einkäufer kann beispielsweise anhand strukturierter Daten in einem SCM-System (Supply Chain Management) in Kombination mit Erkenntnissen aus unstrukturierter E-Mail-Kommunikation und Schadensberichten häufige Ursachen für Unterbrechungen der Lieferkette ermitteln.
  • Datenextraktion aus unstrukturierten Quellen: Große Mengen unstrukturierter Daten scannen, semantische Metadaten ableiten und strukturierte Datenextrakte in BigQuery für die nachgelagerte Analyse speichern. Ein Betriebscontroller kann beispielsweise Ausgaben effizient analysieren, indem er strukturierte Daten aus Tausenden von Rechnungen extrahiert, die in einem unstrukturierten Format wie PDF-Dateien gespeichert sind.

Bereitstellung

Informationen zum Erstellen einer agentenbasierten Analyselösung mit der Data Agent Kit-Erweiterung finden Sie im Codelab, Raw data to forecasting in seconds with AI agents. Im Codelab wird gezeigt, wie Sie mit der Data Agent Kit-Erweiterung Daten effizient in Ihrer bevorzugten agentenbasierten Entwicklungsumgebung analysieren können. Alle Beispieldaten, die im Codelab verwendet werden, sind in Google Cloudgespeichert.

Nächste Schritte

Beitragende

Autor: Kumar Dhanagopal | Cross-product Solution Developer

Weitere Beitragende: