Auf dieser Seite werden Anwendungsfälle für das Hosten von KI-Agenten in Cloud Run beschrieben.
KI-Agenten sind autonome Softwareentitäten, die LLM-basierte Systeme verwenden, um Ziele zu erkennen, Entscheidungen zu treffen und Maßnahmen zu ergreifen. Da immer mehr autonome Agenten entwickelt werden, wird ihre Fähigkeit zur Kommunikation und Zusammenarbeit entscheidend.
Eine Einführung in KI-Agenten finden Sie unter Was ist ein KI-Agent.
Anwendungsfälle für KI-Agenten in Cloud Run
Sie können KI-Agenten als Cloud Run-Dienste implementieren, um eine Reihe asynchroner Aufgaben zu orchestrieren und Informationen durch mehrere Anfrage-Antwort-Interaktionen bereitzustellen.
Ein Cloud Run-Dienst ist ein skalierbarer API-Endpunkt für die Kernlogik Ihrer Anwendung. Er verwaltet mehrere gleichzeitige Nutzer effizient durch automatische, bedarfsgesteuerte und schnelle Skalierung von Instanzen.
Architektur eines KI-Agenten in Cloud Run
Eine typische KI-Agentenarchitektur, die in Cloud Run bereitgestellt wird, kann mehrere Komponenten aus Google Cloud sowie außerhalb von Google Cloudumfassen:
Das Diagramm zeigt Folgendes:
Hostingplattform: Cloud Run ist eine Hostingplattform für die Ausführung von Agenten und bietet folgende Vorteile:
- Unterstützt die Ausführung eines beliebigen Agenten-Frameworks zum Erstellen verschiedener Arten von Agenten und agentenbasierten Architekturen. Beispiele für Agenten Frameworks sind das Agent Development Kit (ADK), Dify, und LangGraph, und n8n.
- Bietet integrierte Funktionen zum Verwalten Ihres Agenten. Cloud Run bietet beispielsweise eine integrierte Dienstidentität, die Sie als Agentenidentität zum Aufrufen von Google Cloud APIs mit sicheren und automatischen Anmeldedaten verwenden können.
- Unterstützt die Verbindung Ihres Agenten-Frameworks mit anderen Diensten. Sie können Ihren Agenten mit Erstanbieter- oder Drittanbietertools verbinden, die in Cloud Run bereitgestellt werden. Wenn Sie beispielsweise Einblick in die Aufgaben und Ausführungen Ihres Agenten erhalten möchten, können Sie Tools wie Langfuse und Arize bereitstellen und verwenden.
Agenteninteraktionen: Cloud Run unterstützt das Streamen von HTTP-Antworten zurück an den Nutzer und WebSockets für Echtzeitinteraktionen.
GenAI-Modelle: Die Orchestrierungsebene ruft Modelle für die Argumentationsfähigkeit auf. Diese Modelle können in Diensten wie den folgenden gehostet werden:
- Gemini API für generative KI-Modelle von Google.
- Vertex AI-Endpunkte für benutzerdefinierte Modelle oder andere Foundation Models.
- GPU-fähiger Cloud Run-Dienst für Ihre eigenen feinabgestimmten Modelle.
Speicher: Agenten benötigen oft Speicher, um den Kontext beizubehalten und aus früheren Interaktionen zu lernen. Sie können die folgenden Dienste verwenden:
- Memorystore for Redis für den Kurzzeitspeicher.
- Firestore für den Langzeitspeicher, z. B. zum Speichern des Unterhaltungsverlaufs oder zum Speichern der Nutzereinstellungen auf Grundlage von Rohdaten.
- Agent Runtime Memory Bank für einen langfristigen personalisierten Speicher. Mit dieser Funktion werden automatisch Informationen aus dem Unterhaltungsverlauf des Nutzers extrahiert, um die Nutzereinstellungen im Laufe der Zeit zu speichern und zu aktualisieren. Sie müssen mindestens eine Agent Engine-Instanz erstellen, um diese Funktion mit Cloud Run verwenden zu können.
Vektordatenbank: Für Retrieval-Augmented Generation (RAG) oder zum Abrufen strukturierter Daten verwenden Sie eine Vektordatenbank, um bestimmte Entitäts informationen abzufragen oder eine Vektorsuche in Einbettungen durchzuführen. Verwenden Sie die Erweiterung
pgvectormit den folgenden Diensten:Tools:Der Orchestrator verwendet Tools, um bestimmte Aufgaben auszuführen und mit externen Diensten, APIs oder Websites zu interagieren. Beispiel:
- Model Context Protocol (MCP): Verwenden Sie dieses standardisierte Protokoll, um mit externen Tools zu kommunizieren, die über einen MCP-Serverausgeführt werden.
- Einfache Dienstprogramme: Genaue mathematische Berechnungen, Zeitumrechnungen oder andere ähnliche Dienstprogramme.
- API-Aufrufe: Rufen Sie andere interne oder externe APIs auf (Lese- oder Schreibzugriff).
- Bild- oder Diagrammerstellung: Visuelle Inhalte schnell und effektiv erstellen.
- Browser- und Betriebssystemautomatisierung: Führen Sie ein monitorloses oder ein vollständiges grafisches Betriebssystem in Containerinstanzen aus, damit der Agent im Web surfen, Informationen von Websites extrahieren oder Aktionen mit Klicks und Tastatureingaben ausführen kann.
- Code-Ausführung: Code ausführen in einer sicheren Umgebung mit mehrschichtiger Sandbox-Technologie und minimalen oder keinen IAM-Berechtigungen.
- Agent Runtime Code Execution: Führen Sie Code in einer sicheren, isolierten und verwalteten Sandbox-Umgebung aus, die Datei-Ein- und -Ausgabe, Codeausführung in weniger als einer Sekunde und einen langlebigen Speicher unterstützt. Sie müssen mindestens eine Agent Runtime-Instanz erstellen, um diese Funktion in Cloud Run verwenden zu können.
Nächste Schritte
- Video Build AI agents on Cloud Run ansehen.
- Das Codelab zum Erstellen und Bereitstellen einer LangChain-App in Cloud Run ausprobieren.
- Informationen zum Bereitstellen des Agent Development Kit (ADK) in Cloud Run.
- Das Codelab zum Verwenden eines MCP-Servers in Cloud Run mit einem ADK-Agenten ausprobieren.
- Das Codelab zum Bereitstellen Ihres ADK-Agenten in Cloud Run mit GPU ausprobieren.
- Unter Agent Development Kit (ADK) samples finden Sie sofort einsatzbereite Agentenbeispiele.
- MCP-Server (Model Context Protocol) in Cloud Run hosten.