KI-Agents in Cloud Run-Ressourcen hosten

Diese Seite hebt Anwendungsfälle für das Hosting von KI-Agenten auf Cloud Run hervor.

KI-Agenten sind autonome Software-Einheiten, die LLM-basierte Systeme nutzen, um Wahrnehmungen zu treffen, Entscheidungen zu treffen und zu handeln, um Ziele zu erreichen. Mit der Entwicklung immer autonomerer Agenten wird deren Fähigkeit zur Kommunikation und Zusammenarbeit entscheidend.

Eine Einführung in KI-Agenten finden Sie unter Was ist ein KI-Agent?.

Cloud Run-Ressource auswählen

Je nach Agent-Design können Sie den Agent-Container als einen der folgenden Cloud Run-Ressourcentypen ausführen:

  • Services: Am besten geeignet für zustandslose, anfragegesteuerte Agenten, die mit variablem Benutzerverkehr umgehen, von Autoscaling profitieren und im Leerlauf auf Null skalieren können. Beispiele sind Chatbot-APIs und Web-API-Back-Ends.
  • Instanzen:Am besten geeignet für dedizierte, zustandsbehaftete, immer aktive Singleton-Agent-Schleifen, die VM-ähnliche Lebenszyklusstatusbefehle erfordern. Beispiele sind persönliche Agents wie OpenClaw und Hermes.
  • Worker-Pools:Am besten geeignet für die Ausführung von Hintergrund- und verteilten Agent-Flotten, die Aufgaben aus Nachrichtenwarteschlangen wie Kafka oder Pub/Sub verarbeiten und horizontal skaliert werden können, ohne öffentliche HTTP-Endpunkte verfügbar zu machen.
  • Jobs: Am besten geeignet für Agenten-Workflows, die von Anfang bis Ende ausgeführt werden, wie z. B. Batch-Auswertungen, Pipelines zur groß angelegten Datenaufnahme oder geplante Synchronisierungsskripte.

Agent-Framework auswählen

Bevor Sie Ihren Agenten in Cloud Run bereitstellen, wählen und konfigurieren Sie Ihr Agenten-Framework lokal oder auf Ihrer Entwicklungsplattform. Beispiele für Agent-Frameworks sind das Agent Development Kit (ADK), Dify, LangGraph und n8n.

Auf Cloud Run wird Ihr Code typischerweise als Dienst oder Instanz. Beide Ressourcentypen führen isolierte Containerinstanzen in derselben Ausführungsumgebung aus und integrieren sich mit Google Cloud services.

KI-Agent auf Cloud Run-Architektur

Eine typische KI-Agent-Architektur, die in Cloud Run bereitgestellt wird, kann mehrere Komponenten von Google Cloud sowie von außerhalb vonGoogle Cloudumfassen. Die folgende Architektur zeigt ein Beispiel für die Implementierung eines KI-Agenten als Cloud Run-Dienst zur Orchestrierung einer Reihe asynchroner Aufgaben und zur Bereitstellung von Informationen durch mehrere Anfrage-Antwort-Interaktionen.

Die vier Komponenten eines KI-Agents, der in Cloud Run gehostet wird.
Abbildung 1. Architektur eines KI-Agenten auf Cloud Run.

Das Diagramm zeigt Folgendes:

  • Hosting-Plattform: Ein Cloud Run-Dienst ist ein skalierbarer API-Endpunkt für die Kernlogik Ihrer Anwendung. Es verwaltet mehrere gleichzeitige Benutzer effizient durch automatische, bedarfsgerechte und schnelle Skalierung der Instanzen. Cloud Run bietet die folgenden Vorteile:

    • Unterstützt die Ausführung eines beliebigen Agent-Frameworks zum Erstellen verschiedener Arten von Agenten und Agent-Architekturen.
    • Integrierte Unterstützung für Agent Identity. Weist Ihrem Agenten eine eindeutige, kryptografisch verifizierbare Identität zu, um Google Cloud APIs und Tools aufzurufen und eine sichere Verbindung zu anderen Agenten herzustellen. Weitere Informationen finden Sie unter Agent Platform-Funktionen konfigurieren.
    • Integrierte Einbindung in die Agent Registry. Legen Sie Ihre bereitgestellten Dienste als Agent oder MCP-Server für die automatische Erkennung und robuste A2A-Authentifizierungsmechanismen (Agent-to-Agent) fest. Weitere Informationen finden Sie unter Agent Platform-Funktionen konfigurieren.
    • Unterstützt die Anbindung Ihres Agenten-Frameworks an andere Dienste. Sie können Ihren Agenten mit Tools von Erstanbietern oder Drittanbietern verbinden, die auf Cloud Run bereitgestellt werden. Wenn Sie beispielsweise Einblick in die Aufgaben und Ausführungen Ihres Agents erhalten möchten, können Sie Tools wie Langfuse und Arize bereitstellen und verwenden.
  • Agenteninteraktionen: Cloud Run unterstützt Streaming von HTTP-Antworten zurück an den Benutzer und WebSockets für Echtzeitinteraktionen.

  • GenAI-Modelle: Die Orchestrierungsebene ruft Modelle für Reasoning-Funktionen auf. Diese Modelle können auf Diensten wie den folgenden gehostet werden:

  • Speicher: Agenten benötigen oft Speicher, um den Kontext beizubehalten und aus früheren Interaktionen zu lernen. Sie können die folgenden Dienste verwenden:

    • Memorystore for Redis für das Kurzzeitgedächtnis.
    • Firestore für das Langzeitgedächtnis, z. B. zum Speichern des Unterhaltungsverlaufs oder zum Speichern der Nutzereinstellungen auf Grundlage von Rohdaten.
    • Vertex AI Agent Engine Memory Bank für langfristiges personalisiertes Gedächtnis. Bei dieser Funktion werden automatisch Informationen aus dem Unterhaltungsverlauf des Nutzers extrahiert, um die Einstellungen des Nutzers im Laufe der Zeit zu speichern und zu aktualisieren. Hinweis: Sie müssen mindestens eine Agent Engine-Instanz erstellen, um diese Funktion mit Cloud Run zu verwenden.
  • Vektordatenbank: Für Retrieval-Augmented Generation (RAG) oder zum Abrufen strukturierter Daten verwenden Sie eine Vektordatenbank, um spezifische Entitätsinformationen abzufragen oder eine Vektorsuche über Einbettungen durchzuführen. Verwenden Sie die pgvector Erweiterung mit den folgenden Diensten:

  • Tools: Der Orchestrator verwendet Tools, um spezifische Aufgaben zur Interaktion mit externen Diensten, APIs oder Websites auszuführen. Beispiel:

    • Model Context Protocol (MCP): Verwenden Sie dieses standardisierte Protokoll zur Kommunikation mit externen Tools, die über einen MCP-Server ausgeführt werden.
    • Grundlegende Hilfsprogramme: Präzise mathematische Berechnungen, Zeitumrechnungen oder ähnliche Hilfsprogramme.
    • API-Aufrufe: Aufrufe an andere interne oder externe APIs (Lese- oder Schreibzugriff).
    • Bild- oder Diagrammgenerierung: Visuelle Inhalte schnell und effektiv erstellen.
    • Browser- und Betriebssystemautomatisierung: Führen Sie ein headless oder ein vollständiges grafisches Betriebssystem innerhalb von Containerinstanzen aus, um dem Agenten das Surfen im Web, das Extrahieren von Informationen von Websites oder das Ausführen von Aktionen mittels Klicks und Tastatureingaben zu ermöglichen.
    • Codeausführung: Code ausführen in einer sicheren Umgebung mit mehrschichtigem Sandboxing, mit minimalen oder keinen IAM-Berechtigungen.
    • Vertex AI Agent Engine Codeausführung: Führen Sie Code in einer sicheren, isolierten und verwalteten Sandbox-Umgebung aus, die Dateieingabe und -ausgabe, Codeausführung in weniger als einer Sekunde und langlebigen Speicher unterstützt. Hinweis: Sie müssen mindestens eine Vertex AI Agent Engine-Instanz erstellen, um diese Funktion in Cloud Run verwenden zu können.

Nächste Schritte