Dokumentation zur KI‑/ML-Orchestrierung in Cloud Run
Cloud Run ist eine vollständig verwaltete Plattform, mit der Sie Ihre containerisierten Anwendungen, einschließlich KI-/ML-Arbeitslasten, direkt auf der skalierbaren Infrastruktur von Google ausführen können. Die Infrastruktur wird für Sie verwaltet, sodass Sie sich auf das Schreiben von Code konzentrieren können, anstatt Zeit mit dem Betrieb, der Konfiguration und der Skalierung Ihrer Cloud Run-Ressourcen zu verbringen. Die Funktionen von Cloud Run bieten Folgendes:
- Hardwarebeschleuniger: Zugriff auf GPUs für die Inferenz im großen Maßstab.
- Framework-Unterstützung: Integration in die Modellbereitstellungs-Frameworks, die Sie bereits kennen und denen Sie vertrauen, z. B. Hugging Face, TGI und vLLM.
- Verwaltete Plattform: Nutzen Sie alle Vorteile einer verwalteten Plattform, um den gesamten KI-/ML-Lebenszyklus zu automatisieren, zu skalieren und die Sicherheit zu erhöhen, während Sie gleichzeitig flexibel bleiben.
In unseren Tutorials und Best Practices erfahren Sie, wie Sie Ihre KI-/ML-Arbeitslasten mit Cloud Run optimieren können.
Proof of Concept mit einem Guthaben in Höhe von 300 $ starten
- Nutzen Sie unsere neuesten generativen KI-Modelle und Tools für die Entwicklung.
- Sie können mehr als 20 beliebte Produkte wie Compute Engine und KIAI APIs kostenlos nutzen.
- Keine automatischen Abbuchungen, keine Verpflichtung.
Mehr als 20 Produkte immer kostenlos nutzen.
Sie haben Zugriff auf mehr als 20 kostenlose Produkte für gängige Anwendungsfälle, darunter KI-APIs, VMs, Data Warehouses und mehr.
Dokumentationsressourcen
KI-Lösungen ausführen
- Konzept
- Konzept
- Anleitung
- Anleitung
- Anleitung
- Anleitung
- Tutorial
- Tutorial
- Konzept
- Konzept
- Tutorial
- Tutorial
Inferenz mit GPUs
- Tutorial
- Anleitung
- Tutorial
- Best Practice
- Tutorial
- Tutorial
- Best Practice
- Best Practice
Fehlerbehebung
- Konzept
- Anleitung
- Anleitung
- Anleitung
Weitere Informationen
KI-generierten Code sicher in Cloud Run-Sandboxes ausführen
Führen Sie nicht vertrauenswürdigen, KI-generierten Code sicher aus, indem Sie Cloud Run-Sandboxes bereitstellen, in denen Ausführungsumgebungen in isolierten gVisor-basierten Containern ausgeführt werden.
Leitfaden für KI-Kaltstarts in Cloud Run
Kaltstartlatenz für die containerisierte LLM-Inferenz in Cloud Run mit serverlosen Konfigurationseinstellungen und der Optimierung des Architekturdesignmusters optimieren
KI-Agents mit der MCP-Autorisierung schützen
Autorisierungsregeln für das Model Context Protocol (MCP) konfigurieren und erzwingen, um die Remote-Tool-Verbindung für KI-Agents zu sichern, die in Cloud Run bereitgestellt werden.
AI Studio ermöglicht Full-Stack-Vibe-Coding mit Cloud Run, Firebase und Cloud SQL. Dafür ist keine Kreditkarte erforderlich.
Full-Stack-Anwendungen direkt aus dem Build-Modus von Google AI Studio in Cloud Run bereitstellen – mit integrierter Firebase- und Cloud SQL-Sicherungsunterstützung.
KI-Inferenzanwendungen auf Cloud Run mit NVIDIA-GPUs ausführen
NVIDIA L4-GPUs auf Cloud Run für KI-Echtzeitinferenzen verwenden, einschließlich der Vorteile von schnellem Kaltstart und Skalierung auf null für Large Language Models (LLMs).
Cloud Run: der schnellste Weg, um Ihre KI-Anwendungen in die Produktion zu bringen
Informationen zur Verwendung von Cloud Run für produktionsreife KI-Anwendungen In diesem Leitfaden werden Anwendungsfälle wie das Aufteilen von Traffic für A/B-Tests von Prompts, RAG-Muster (Retrieval-Augmented Generation) und die Verbindung zu Vektorspeichern beschrieben.
KI-Bereitstellung leicht gemacht: Stellen Sie Ihre App über AI Studio oder MCP-kompatible KI-Agents in Cloud Run bereit.
Bereitstellung mit nur einem Klick von Google AI Studio in Cloud Run und auf dem Cloud Run-MCP-Server (Model Context Protocol), um KI-Agenten in IDEs oder Agent-SDKs zu aktivieren und Apps bereitzustellen.
Cloud Run mit GPU-Leistung optimieren: Eine neue Ära für KI-Arbeitslasten
NVIDIA L4-GPUs in Cloud Run einbinden, um LLMs kosteneffizient bereitzustellen. In diesem Leitfaden wird der Fokus auf die Skalierung auf null gelegt. Außerdem werden Bereitstellungsschritte für Modelle wie Gemma 2 mit Ollama beschrieben.
Verpacken Sie KI-Modelle immer noch in Containern? So geht es stattdessen in Cloud Run:
Große Modelldateien mit Cloud Storage FUSE vom Container-Image entkoppeln Durch die Entkopplung werden die Build-Zeiten verkürzt, Updates vereinfacht und eine besser skalierbare Bereitstellungsarchitektur geschaffen.
Machine-Learning-Modelle mit Cog in Cloud Run verpacken und bereitstellen
Verwenden Sie das Cog-Framework, das für die ML-Bereitstellung optimiert ist, um das Verpacken und Bereitstellen von Containern in Cloud Run zu vereinfachen.
ML-Modelle mit Cloud Run bereitstellen und überwachen – schlank, skalierbar und kosteneffizient
Verwenden Sie Cloud Run für die einfache ML-Inferenz und erstellen Sie einen kostengünstigen Monitoring-Stack mit nativen Google Cloud Diensten wie Logging und BigQuery.