Die Gemini Enterprise Agent Platform unterstützt eine kuratierte Liste offener Modelle als verwaltete Modelle. Diese offenen Modelle können mit der Gemini Enterprise Agent Platform als Model as a Service (MaaS) verwendet werden und werden als verwaltete API angeboten. Wenn Sie ein verwaltetes offenes Modell verwenden, senden Sie Ihre Anfragen weiterhin an die Endpunkte der Gemini Enterprise Agent Platform. Verwaltete offene Modelle sind serverlos, sodass Sie keine Infrastruktur bereitstellen oder verwalten müssen.
Verwaltete offene Modelle können mithilfe von Model Garden gefunden werden. Sie können Modelle auch mit Model Garden bereitstellen. Weitere Informationen finden Sie unter KI Modelle in Model Garden entdecken.
Bevor Sie offene Modelle verwenden können, müssen Sie Nutzern Zugriff auf offene Modelle gewähren.
Offene Modelle
Die folgenden offenen Modelle werden als verwaltete APIs im Model Garden der Gemini Enterprise Agent Platform (MaaS) angeboten:
| Modellname | Modalität | Beschreibung | Kurzanleitung |
|---|---|---|---|
| DeepSeek-OCR | Sprache, Vision | Ein umfassendes OCR-Modell (Optical Character Recognition), das komplexe Dokumente analysiert und versteht. Es zeichnet sich bei anspruchsvollen OCR-Aufgaben aus. | Modellkarte |
| DeepSeek R1 (0528) | Sprache | Eine Version des DeepSeek R1-Modells von DeepSeek. | Modellkarte |
| DeepSeek-V3.1 | Sprache | Das Hybridmodell von DeepSeek, das sowohl den Thinking-Modus als auch den Nicht-Thinking-Modus unterstützt. | Modellkarte |
| DeepSeek-V3.2 | Sprache | Das Modell von DeepSeek, das hohe Recheneffizienz mit überlegener Schlussfolgerungs- und Agentenleistung kombiniert. | Modellkarte |
| Gemma 4 26B A4B IT | Sprache | Die Familie offener Modelle von Google, die von Google DeepMind entwickelt wurde. | Modellkarte |
| GLM 4.7 | Sprache, Code | Das GLM-Modell wurde für Core- oder Vibe-Coding, die Nutzung von Tools und komplexe Schlussfolgerungen entwickelt. | Modellkarte |
| GLM 5 | Sprache, Code | Das GLM-Modell ist auf komplexe Systempflege und langfristige agentische Aufgaben ausgerichtet. | Modellkarte |
| gpt-oss 120B | Sprache | Ein 120B-Modell, das bei Schlussfolgerungsaufgaben eine hohe Leistung bietet. | Modellkarte |
| gpt-oss 20B | Sprache | Ein 20B-Modell, das für Effizienz und Bereitstellung auf Consumer- und Edge-Hardware optimiert ist. | Modellkarte |
| Kimi K2 Thinking | Sprache | Ein Open-Source-Thinking-Agentenmodell, das Schritt für Schritt Schlussfolgerungen zieht und Tools verwendet, um komplexe Probleme zu lösen. | Modellkarte |
| Llama 3.3 | Sprache | Llama 3.3 ist ein reines Textmodell mit 70 Milliarden Parametern, das im Vergleich zu Llama 3.1 70B und Llama 3.2 90B eine verbesserte Leistung bietet, wenn es für reine Textanwendungen verwendet wird. Darüber hinaus erreicht Llama 3.3 70B bei einigen Anwendungen die Leistung von Llama 3.1 405B. | Modellkarte |
| Llama 4 Maverick 17B-128E | Sprache, Vision | Das größte und leistungsstärkste Llama 4-Modell mit Coding-, Schlussfolgerungs- und Bildfunktionen. Llama 4 Maverick 17B-128E ist ein multimodales Modell, das die MoE-Architektur (Mixture of Experts) und die Early Fusion nutzt. | Modellkarte |
| Llama 4 Scout 17B-16E | Sprache, Vision | Llama 4 Scout 17B-16E liefert für seine Größenklasse hochleistungsfähige Ergebnisse und übertrifft andere offene und proprietäre Modelle in mehreren Benchmarks. Llama 4 Scout 17B-16E ist ein multimodales Modell, das die MoE-Architektur (Mixture of Experts) und die Early Fusion nutzt. | Modellkarte |
| MiniMax M2 | Sprache, Code | Entwickelt für agentische und codebezogene Aufgaben mit starken Fähigkeiten bei der Planung und Ausführung komplexer Tool-Aufrufe. | Modellkarte |
| Qwen3 235B | Sprache | Ein Open-Weights-Modell mit einer „Hybrid Thinking“-Funktion, mit der zwischen methodischem Schlussfolgern und schnellen Gesprächen gewechselt werden kann. | Modellkarte |
| Qwen3 Coder | Sprache, Code | Ein Open-Weights-Modell, das für anspruchsvolle Softwareentwicklungsaufgaben entwickelt wurde. | Modellkarte |
| Qwen3-Next-80B Instruct | Sprache, Code | Ein Modell aus der Qwen3-Next-Modellfamilie, das speziell für die Ausführung bestimmter Befehle entwickelt wurde. | Modellkarte |
| Qwen3-Next-80B Thinking | Sprache, Code | Ein Modell aus der Qwen3-Next-Modellfamilie, das speziell für komplexe Problemlösung und tiefes Schlussfolgern entwickelt wurde. | Modellkarte |
Die folgenden offenen Einbettungsmodelle werden als verwaltete APIs im Model Garden der Gemini Enterprise Agent Platform (MaaS) angeboten:
| Modellname | Beschreibung | Ausgabedimensionen | Maximale Sequenzlänge | Unterstützte Textsprachen | Kurzanleitung |
|---|---|---|---|---|---|
| multilingual-e5-small | Teil der E5-Familie von Modellen für Texteinbettungen. Die kleine Variante enthält 12 Ebenen. | Bis zu 384 | 512 Tokens | Unterstützte Sprachen | Modellkarte |
| multilingual-e5-large | Teil der E5-Familie von Modellen für Texteinbettungen. Die große Variante enthält 24 Ebenen. | Bis zu 1024 | 512 Tokens | Unterstützte Sprachen | Modellkarte |
Einhaltung regulatorischer Anforderungen für offene Modelle
Die Zertifizierungen für generative KI in der Gemini Enterprise Agent Platform gelten weiterhin, wenn offene Modelle als verwaltete API mit der Gemini Enterprise Agent Platform verwendet werden. Wenn Sie Details zu den Modellen selbst benötigen, finden Sie weitere Informationen in der jeweiligen Modellkarte oder Sie können sich an den jeweiligen Modellherausgeber wenden.
Ihre Daten werden für offene Modelle in der Gemini Enterprise Agent Platform in der ausgewählten Region oder Multiregion im Ruhezustand gespeichert. Die Regionalisierung der Datenverarbeitung kann jedoch variieren. Eine detaillierte Liste der Verpflichtungen zur Datenverarbeitung für offene Modelle finden Sie unter Datenresidenz für offene Modelle.
Prompts von Kunden und Modellantworten werden bei Verwendung der Gemini Enterprise API, einschließlich offener Modelle, nicht an Dritte weitergegeben. Google verarbeitet Kundendaten nur gemäß den Anweisungen des Kunden. Weitere Informationen finden Sie in unserem Zusatz zur Verarbeitung von Cloud-Daten.
Kontext-Caching
Mit dem Kontext-Caching können Sie die Kosten und die Latenz von Anfragen an offene Modelle reduzieren, die wiederholte Inhalte enthalten. Diese Funktion ist nur bei der nutzungsabhängigen Abrechnung des Traffics aktiviert und unterstützt keine anderen Traffic-Typen wie bereitgestellten Durchsatz und Batch.Die unterstützte Art des Cachings ist das implizite Caching. Dabei handelt es sich um ein automatisches Caching, das standardmäßig in allen Google Cloud Projekten aktiviert ist und bei Cache-Treffern einen Rabatt von 90% auf zwischengespeicherte Tokens im Vergleich zu Standard-Eingabetokens bietet . Bei dieser Art des Cachings definieren und rufen Sie die Caches nicht explizit auf. Stattdessen ruft unser Backend diese Caches ab, sobald wiederholter Kontext erkannt wird.
Unterstützte Modelle
- qwen3-coder-480b-a35b-instruct-maas
- kimi-k2-thinking-maas
- minimax-m2-maas
- gpt-oss-20b-maas
- deepseek-v3.1-maas
- deepseek-v3.2-maas
- gemma-4-26b-a4b-it-maas
Das cachedContentTokenCount
Feld in den Metadaten Ihrer Antwort gibt die Anzahl der Tokens im zwischengespeicherten
Teil Ihrer Eingabe an. Caching-Anfragen müssen mindestens 4.096 Tokens enthalten. Dieser Mindestwert kann sich während der Vorschau ändern.
Wenn diese Option aktiviert ist, werden die Kosteneinsparungen durch implizite Cache-Treffer automatisch an Sie weitergegeben. Cache-Treffer sind nicht garantiert und hängen von gesendeten Anfragen und anderen Faktoren ab. So erhöhen Sie die Wahrscheinlichkeit eines impliziten Cache-Treffers:
- Platzieren Sie große und häufig verwendete Inhalte am Anfang Ihres Prompts.
- Senden Sie Anfragen mit einem ähnlichen Präfix in kurzer Zeit.
Nächste Schritte
- Bevor Sie offene Modelle verwenden, gewähren Sie Nutzern Zugriff auf offene Modelle.
- Informationen zum Aufrufen von APIs für offene Modelle