Die Gemini Enterprise Agent Platform unterstützt eine ausgewählte Liste von Modellen, die von Google-Partnern entwickelt wurden. Partnermodelle können mit der Gemini Enterprise Agent Platform als Model as a Service (MaaS) verwendet werden und werden als verwaltete API angeboten. Wenn Sie ein Partnermodell verwenden, senden Sie Ihre Anfragen weiterhin an die Endpunkte der Gemini Enterprise Agent Platform. Partnermodelle sind serverlos, sodass Sie keine Infrastruktur bereitstellen oder verwalten müssen.
Partnermodelle können mithilfe von Model Garden gefunden werden. Sie können Modelle auch mit Model Garden bereitstellen. Weitere Informationen finden Sie unter KI Modelle in Model Garden entdecken. Informationen zu jedem verfügbaren Partnermodell finden Sie auf der Modellkarte in Model Garden. In dieser Anleitung sind nur Drittanbietermodelle dokumentiert, die als MaaS mit der Gemini Enterprise Agent Platform funktionieren.
Die Claude- und Mistral-Modelle von Anthropic sind Beispiele für von Drittanbietern verwaltete Modelle, die mit der Gemini Enterprise Agent Platform verwendet werden können.
Partnermodelle
Die folgenden Partnermodelle werden als verwaltete APIs in Model Garden der Gemini Enterprise Agent Platform (MaaS) angeboten:
| Modellname | Modalität | Beschreibung | Kurzanleitung |
|---|---|---|---|
| Grok 4.3 (Vorschau) | Sprache | Das leistungsstarke Modell von xAI. | Modellkarte |
| Grok 4.20 (Reasoning) (Vorschau) | Sprache | Grok 4.20 (Reasoning) ist ein leistungsstarkes Modell von xAI, das sich durch eine branchenweit führende, niedrige Halluzinationsrate auszeichnet. Es eignet sich hervorragend für Aufgaben zum Dokumentenverständnis und für das Aufrufen von Tools durch Agenten mit langer Ausführungszeit. | Modellkarte |
| Grok 4.20 (Non-reasoning) (Vorschau) | Sprache | Grok 4.20 (Non-Reasoning) ist ein leistungsstarkes Modell von xAI ohne Thinking-Funktion, das sich durch eine branchenweit führende, niedrige Halluzinationsrate auszeichnet. Es eignet sich hervorragend für latenzempfindliche Anwendungsfälle wie Kundensupport und Kategorisierung. | Modellkarte |
| Grok 4.1 Fast (Reasoning) (Vorschau) | Sprache | Grok 4.1 Fast (Reasoning) ist das kostengünstigste Modell von xAI mit leistungsstarken Funktionen zum Aufrufen von Tools und effizienter Synthese von Wissensdatenbanken. Es eignet sich hervorragend für Suchaufgaben mit Webdaten und internen Wissensdatenbank-Tools. | Modellkarte |
| Grok 4.1 Fast (Non-reasoning) (Vorschau) | Sprache | Grok 4.1 Fast (Non-Reasoning) ist das kostengünstigste Modell von xAI ohne Thinking-Funktion, optimiert für niedrige Latenz. Es eignet sich hervorragend für Aufgaben mit hohem Volumen wie Zusammenfassung und Kategorisierung. | Modellkarte |
| Claude Sonnet 5 in Google Cloud | Sprache, Vision | Claude Sonnet 5 in Google Cloud ist das bisher leistungsstärkste Sonnet-Modell von Anthropic , das für Coding, KI-Agenten und professionelle Arbeit in großem Umfang entwickelt wurde. | Modellkarte |
| Claude Opus 5 in Google Cloud | Sprache, Vision | Claude Opus 5 in Google Cloud ist das fortschrittlichste Opus-Modell von Anthropic, das Agenten mit langer Ausführungszeit unterstützt und gleichzeitig Verbesserungen in den Bereichen Coding und professionelle Arbeit bietet. | Modellkarte |
| Claude Fable 5 in Google Cloud | Sprache, Vision | Claude Fable 5 in Google Cloud ist ein Modell von Anthropic, das für autonome Wissensarbeit und Coding entwickelt wurde und für komplexe, mehrtägige Projekte konzipiert ist. | Modellkarte |
| Claude Opus 4.8 in Google Cloud | Sprache, Vision | Claude Opus 4.8 ist ein Opus-Modell mit hoher Intelligenz, das für Coding und Agenten entwickelt wurde und ein besseres Schlussfolgern für Unternehmensworkflows bietet. | Modellkarte |
| Claude Opus 4.7 in Google Cloud | Sprache, Vision | Claude Opus 4.7 in Google Cloud ist ein Modell mit hoher Intelligenz von Anthropic und branchenführend in den Bereichen Coding, Agenten, Computernutzung und Unternehmens workflows. | Modellkarte |
| Claude Sonnet 4.6 in Google Cloud | Sprache, Vision | Claude Sonnet 4.6 in Google Cloud bietet erstklassige Intelligenz in großem Umfang – speziell für die Programmierung, Agenten und Unternehmensworkflows. | Modellkarte |
| Claude Opus 4.6 in Google Cloud | Sprache, Vision | Claude Opus 4.6 in Google Cloud ist ein Modell mit hoher Intelligenz von Anthropic und branchenführend in den Bereichen Coding, Agenten, Computernutzung und Unternehmens workflows. | Modellkarte |
| Claude Opus 4.5 in Google Cloud | Sprache, Vision | Claude Opus 4.5 in Google Cloud ist ein Modell mit hoher Intelligenz von Anthropic und branchenführend in den Bereichen Coding, Agenten, Computernutzung und Unternehmens workflows. | Modellkarte |
| Claude Sonnet 4.5 in Google Cloud | Sprache, Vision | Das mittelgroße Modell von Anthropic für die Unterstützung von KI-Agenten in der realen Welt mit Funktionen für die Programmierung, Computernutzung, Cybersicherheit und die Arbeit mit Office-Dateien wie Tabellenkalkulationen. | Modellkarte |
| Claude Opus 4.1 in Google Cloud | Sprache, Vision | Branchenführend für Coding. Es bietet eine nachhaltige Leistung bei langwierigen Aufgaben, die konzentrierte Anstrengung und Tausende von Schritten erfordern, und erweitert so die Möglichkeiten von KI-Agenten erheblich. Ideal für die Unterstützung von erstklassigen Agent-Produkten und Funktionen. | Modellkarte |
| Claude Haiku 4.5 in Google Cloud | Sprache, Vision | Claude Haiku 4.5 in Google Cloud bietet eine erstklassige Leistung für eine Vielzahl von Anwendungsfällen und ist eines der besten Coding-Modelle der Welt – mit der richtigen Geschwindigkeit und den richtigen Kosten für die Unterstützung kostenloser Produkte und Nutzererfahrungen mit hohem Volumen. | Modellkarte |
| Claude Opus 4 in Google Cloud | Sprache, Vision | Claude Opus 4 in Google Cloud bietet eine nachhaltige Leistung bei langwierigen Aufgaben, die konzentrierte Anstrengung und Tausende von Schritten erfordern, und erweitert so die Möglichkeiten von KI-Agenten erheblich. | Modellkarte |
| Claude Sonnet 4 in Google Cloud | Sprache, Vision | Das mittelgroße Modell von Anthropic mit überlegener Intelligenz für Anwendungen mit hohem Volumen wie Coding, eingehende Recherche, und Agenten. | Modellkarte |
| Claude 3.5 Sonnet v2 von Anthropic in Google Cloud | Sprache, Vision | Claude 3.5 Sonnet in Google Cloud ist ein leistungsstarkes Modell für reale Softwareentwicklungsaufgaben und agentische Funktionen. Claude 3.5 Sonnet in Google Cloud liefert diese Fortschritte zum gleichen Preis und zum gleichen Tempo wie sein Vorgänger. | Modellkarte |
| Claude 3.5 Sonnet von Anthropic in Google Cloud | Sprache | Claude 3.5 Sonnet in Google Cloud übertrifft Claude 3 Opus von Anthropic in Google Cloud in einer Vielzahl von Bewertungen von Anthropic mit der Geschwindigkeit und den Kosten des Mid-Tier-Modells von Anthropic, Claude 3 Sonnet in Google Cloud. | Modellkarte |
| Jamba 1.5 Large (Vorschau) | Sprache | Jamba 1.5 Large von AI21 Labs wurde für Antworten von überlegener Qualität, hohen Durchsatz und wettbewerbsfähige Preise im Vergleich zu anderen Modellen seiner Größenklasse entwickelt. | Modellkarte |
| Jamba 1.5 Mini (Vorschau) | Sprache | Jamba 1.5 Mini von AI21 Labs bietet ein ausgewogenes Verhältnis zwischen Qualität, Durchsatz und niedrigen Kosten. | Modellkarte |
| Mistral Medium 3 | Sprache | Mistral Medium 3 ist ein vielseitiges Modell, das für eine Vielzahl von Aufgaben entwickelt wurde, darunter Programmierung, mathematisches Schlussfolgern, das Verstehen langer Dokumente, Zusammenfassung und Dialog. | Modellkarte |
| Mistral OCR (25.05) | Sprache, Vision | Mistral OCR (25.05) ist eine OCR-API (Optical Character Recognition) für das Dokumentenverständnis. Das Modell versteht jedes Element von Dokumenten wie Medien, Text, Tabellen und Gleichungen. | Modellkarte |
| Mistral Small 3.1 (25.03) | Sprache | Mistral Small 3.1 (25.03) ist eine Version des Small-Modells von Mistral mit multimodalen Funktionen und erweiterter Kontextlänge. | Modellkarte |
| Codestral 2 | Sprache, Code | Codestral 2 ist das auf Codegenerierung spezialisierte Modell von Mistral, das speziell für die hochpräzise Vervollständigung von Lücken (Fill-in-the-Middle, FIM) entwickelt wurde und Entwicklern hilft, Code über einen gemeinsamen API-Endpunkt für Anweisungen und Vervollständigungen zu schreiben und mit ihm zu interagieren. | Modellkarte |
Partnermodelle mit dem Gen AI Evaluation Service bewerten
Der Gen AI Evaluation Service unterstützt die Bewertung von Partnermodellen wie Anthropic- und Llama-Modellen. Die Bewertung von Partnermodellen wird über Model Garden unterstützt. Sie müssen das Modell also aktivieren, bevor Sie Bewertungen für ein Partnermodell ausführen.
Weitere Informationen finden Sie unter Bewertung mit der Console durchführen.
Preise für Partnermodelle der Gemini Enterprise Agent Platform mit Kapazitätsgarantie
Google bietet einen bereitgestellten Durchsatz für Partnermodelle, der den Durchsatz für Ihre Modelle zu einer festen Gebühr reserviert. Sie entscheiden über die Durchsatzkapazität und in welchen Regionen diese Kapazität reserviert werden soll. Weil Anfragen zum bereitgestellten Durchsatz Vorrang vor den standardmäßigen "Pay as you go"-Anfragen haben, bietet bereitgestellter Durchsatz eine höhere Verfügbarkeit. Wenn das System überlastet ist, können Anfragen weiterhin abgeschlossen werden, solange der Durchsatz unter der der reservierten Durchsatzkapazität bleibt. Wenn Sie weitere Informationen wünschen oder den Dienst abonnieren möchten, wenden Sie sich an den Vertrieb.
Regionale, globale und multiregionale Endpunkte
Bei regionalen Endpunkten werden Anfragen aus der von Ihnen angegebenen Region verarbeitet. Wenn Sie Anforderungen an den Datenstandort haben oder ein Modell den globalen Endpunkt nicht unterstützt, verwenden Sie die regionalen Endpunkte.
Wenn Sie den globalen Endpunkt verwenden, kann Google Ihre Anfragen in jeder Region verarbeiten und bereitstellen, die vom verwendeten Modell unterstützt wird. Dies kann in einigen Fällen zu einer höheren Latenz führen. Der globale Endpunkt trägt dazu bei, die allgemeine Verfügbarkeit zu verbessern und Fehler zu reduzieren.
Multiregionale Endpunkte ermöglichen einen hochverfügbaren Zugriff auf Partnermodelle und sorgen gleichzeitig dafür, dass der Datenstandort in einer größeren geografischen Region wie den USA bleibt.
Je nach ausgewähltem Endpunkttyp gibt es einen Preisunterschied. Weitere Informationen zu Kontingenten und Funktionen finden Sie auf der entsprechenden Seite zum Drittanbietermodell.
Globaler Endpunkt
Wenn Sie den globalen Endpunkt verwenden möchten, legen Sie die Region auf global fest.
Die Anfrage-URL für einen curl-Befehl hat beispielsweise das folgende Format:
https://aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/global/publishers/PUBLISHER_NAME/models/MODEL_NAME
Für das Agent Platform SDK ist ein regionaler Endpunkt die Standardeinstellung. Legen Sie die Region auf GLOBAL fest, um den globalen Endpunkt zu verwenden.
Unterstützte Modelle für den globalen Endpunkt
Der globale Endpunkt ist für die folgenden Modelle verfügbar:
- Claude Sonnet 5 in Google Cloud
- Claude Opus 5 in Google Cloud
- Claude Fable 5 in Google Cloud
- Claude Opus 4.8 in Google Cloud
- Claude Opus 4.7 in Google Cloud
- Claude Opus 4.6 in Google Cloud
- Claude Sonnet 4.6 in Google Cloud
- Claude Opus 4.5 in Google Cloud
- Claude Opus 4.1 in Google Cloud
- Claude Opus 4 in Google Cloud
- Claude Sonnet 4.5 in Google Cloud
- Claude Sonnet 4 in Google Cloud
- Claude 3.7 Sonnet in Google Cloud
- Claude 3.5 Sonnet v2 in Google Cloud
- Claude Haiku 4.5 in Google Cloud
- Grok 4.1 Fast
- Grok 4.20
- Grok 4.3
Nutzung globaler API-Endpunkt einschränken
Um die Verwendung regionaler Endpunkte zu erzwingen, können Sie die Einschränkung der Organisationsrichtlinie constraints/gcp.restrictEndpointUsage verwenden, um Anfragen an den globalen API-Endpunkt zu blockieren. Weitere Informationen finden Sie unter
Endpunktnutzung einschränken.
Multiregionaler Endpunkt
Multiregionale Endpunkte ermöglichen einen hochverfügbaren Zugriff auf Partnermodelle und sorgen gleichzeitig dafür, dass der Datenstandort in einer größeren geografischen Region wie den USA oder der Europäischen Union bleibt.
Wählen Sie den entsprechenden Tab für die multiregionale Region aus, die Sie verwenden möchten:
USA
Wenn Sie den multiregionalen Endpunkt in den USA verwenden möchten, legen Sie die Endpunkt-URL auf aiplatform.us.rep.googleapis.com fest.
Die Anfrage-URL für einen curl-Befehl hat das folgende Format:
https://aiplatform.us.rep.googleapis.com/v1/projects/PROJECT_ID/locations/us/publishers/anthropic/models/MODEL_NAME
EU
Wenn Sie den multiregionalen Endpunkt in der EU verwenden möchten, legen Sie die Endpunkt-URL auf aiplatform.eu.rep.googleapis.com fest.
Die Anfrage-URL für einen curl-Befehl hat das folgende Format:
https://aiplatform.eu.rep.googleapis.com/v1/projects/PROJECT_ID/locations/eu/publishers/anthropic/models/MODEL_NAME
Weitere Informationen zum MODEL_NAME Format finden Sie in der Anthropic-Dokumentation.
Unterstützte Modelle für den multiregionalen Endpunkt :
Multiregionale Endpunkte unterstützen alle Claude-Modelle mit Version 4.7 und höher (z. B. claude-opus-4-7, claude-opus-4-8 und claude-fable-5). Verwenden Sie gegebenenfalls die vollständige Modell-ID einschließlich des Versionsdatums.
Beispielanfrage :
So können Sie den multiregionalen Endpunkt mit curl aufrufen:
export PROJECT_ID="YOUR_PROJECT_ID"
# Example using claude-opus-4-7
# Option 1: US Region
export LOCATION="us"
export ENDPOINT="aiplatform.us.rep.googleapis.com"
# Option 2: EU Region
# export LOCATION="eu"
# export ENDPOINT="aiplatform.eu.rep.googleapis.com"
export MODEL_ID="claude-opus-4-7"
curl -X POST \
-H "Authorization: Bearer $(gcloud auth application-default print-access-token)" \
-H "Content-Type: application/json" \
"https://${ENDPOINT}/v1/projects/${PROJECT_ID}/locations/${LOCATION}/publishers/anthropic/models/${MODEL_ID}:rawPredict" \
-d '{
"max_tokens": 300,
"messages": [
{
"role": "user",
"content": [
{
"type": "text",
"text": "Why is the sky blue?"
}
]
}
],
"anthropic_version": "vertex-2023-10-16"
}'
Multiregionale Kontingente :
Es werden dedizierte multiregionale Kontingente erzwungen. Sie können diese Standardkontingentwerte in der Google Cloud Console ansehen und Erhöhungen anfordern.
Beispiele für Kontingente in den USA :
UsOnlinePredictionInputTokensPerMinutePerBaseModelUsOnlinePredictionOutputTokensPerMinutePerBaseModelUsOnlinePredictionRequestsPerMinPerProjectPerBaseModelUsOnlinePredictionWebSearchRequestsPerProjectPerPublisher
Beispiele für Kontingente in der EU :
EuOnlinePredictionInputTokensPerMinutePerBaseModelEuOnlinePredictionOutputTokensPerMinutePerBaseModelEuOnlinePredictionRequestsPerMinPerProjectPerBaseModelEuOnlinePredictionWebSearchRequestsPerProjectPerPublisher
Nutzern Zugriff auf Partnermodelle gewähren
Damit Sie Partnermodelle aktivieren und eine Prompt-Anfrage stellen können, muss ein Google Cloud Administrator die erforderlichen Berechtigungen festlegen und prüfen , ob die Organisationsrichtlinie die Verwendung der erforderlichen APIs zulässt.
Erforderliche Berechtigungen für die Verwendung von Partnermodellen festlegen
Die folgenden Rollen und Berechtigungen sind für die Verwendung von Partnermodellen erforderlich:
Sie benötigen die IAM-Rolle (Identity and Access Management) „Manager von Nutzer-Beschaffungsberechtigungen“. Nutzer, denen diese Rolle zugewiesen wurde, können Partnermodelle in Model Garden aktivieren.
Sie benötigen die Berechtigung
aiplatform.endpoints.predict. Diese Berechtigung ist in der IAM-Rolle „Agent Platform User“ enthalten. Weitere Informationen finden Sie unter Gemini Enterprise Agent Platform User und Zugriffssteuerung.
Console
Um einem Nutzer die IAM-Rollen für Manager von Nutzer-Beschaffungsberechtigungen zuzuweisen, rufen Sie die Seite IAM auf.
Suchen Sie in der Spalte Hauptkonto das Nutzer-Hauptkonto, für das Sie den Zugriff auf Partner-Modelle aktivieren möchten, und klicken Sie dann in dieser Zeile auf Hauptkonto bearbeiten.
Klicken Sie im Bereich Berechtigungen bearbeiten auf Weitere Rolle hinzufügen.
Wählen Sie unter Rolle auswählen die Option Manager von Nutzer-Beschaffungsberechtigungen aus.
Klicken Sie im Bereich Berechtigungen bearbeiten auf Weitere Rolle hinzufügen.
Wählen Sie unter Rolle auswählen die Option Agent Platform User aus.
Klicken Sie auf Speichern.
gcloud
-
Aktivieren Sie Cloud Shell in der Google Cloud Console.
Weisen Sie die Rolle „Manager von Nutzer-Beschaffungsberechtigungen“ zu, die zum Aktivieren von Partnermodellen in Model Garden erforderlich ist.
gcloud projects add-iam-policy-binding PROJECT_ID \ --member=PRINCIPAL --role=roles/consumerprocurement.entitlementManagerWeisen Sie die Rolle „Agent Platform User“ zu, die die Berechtigung
aiplatform.endpoints.predictenthält, die zum Senden von Prompts erforderlich ist:gcloud projects add-iam-policy-binding PROJECT_ID \ --member=PRINCIPAL --role=roles/aiplatform.userErsetzen Sie
PRINCIPALdurch die Kennung des Hauptkontos. Die Kennung hat das Formatuser|group|serviceAccount:emailoderdomain:domain, z. B.user:cloudysanfrancisco@gmail.com,group:admins@example.com,serviceAccount:test123@example.domain.comoderdomain:example.domain.com.Es wird eine Liste von Richtlinienbindungen ausgegeben, die Folgendes enthält:
- members: - user:PRINCIPAL role: roles/roles/consumerprocurement.entitlementManagerWeitere Informationen finden Sie unter Einzelne Rolle zuweisen und
gcloud projects add-iam-policy-binding.
Organisationsrichtlinie für den Zugriff auf Partnermodelle festlegen
Damit Sie Partnermodelle aktivieren können, muss Ihre Organisationsrichtlinie die folgende API zulassen: Cloud Commerce Consumer Procurement API – cloudcommerceconsumerprocurement.googleapis.com.
Wenn Ihre Organisation eine Organisationsrichtlinie festlegt, um die Dienstnutzung einzuschränken, muss ein Organisationsadministrator prüfen, ob cloudcommerceconsumerprocurement.googleapis.com durch Festlegen der Organisationsrichtlinie zulässig ist.
Wenn Sie außerdem eine Organisationsrichtlinie haben, die die Modellnutzung in Model Garden einschränkt, muss die Richtlinie den Zugriff auf Partnermodelle zulassen. Weitere Informationen finden Sie unter Modellzugriff steuern.
Einhaltung regulatorischer Anforderungen für Partnermodelle
Die Zertifizierungen für generative KI auf der Gemini Enterprise Agent Platform gelten weiterhin, wenn Partnermodelle als verwaltete API über die Gemini Enterprise Agent Platform verwendet werden. Wenn Sie Details zu den Modellen selbst benötigen, finden Sie weitere Informationen auf der jeweiligen Modellkarte oder Sie können sich an den jeweiligen Modellherausgeber wenden.
Ihre Daten werden für Partnermodelle auf der Gemini Enterprise Agent Platform im Ruhezustand in der ausgewählten Region oder Multiregion gespeichert. Die Regionalisierung der Datenverarbeitung kann jedoch variieren. Eine detaillierte Liste der Verpflichtungen zur Datenverarbeitung für Partnermodelle finden Sie unter Datenstandort für Partnermodelle.
Prompts von Kunden und Modellantworten werden bei Verwendung der Gemini Enterprise API, einschließlich Partnermodellen, nicht an Dritte weitergegeben. Google verarbeitet Kundendaten nur gemäß den Anweisungen des Kunden, wie in unserem Zusatz zur Verarbeitung von Cloud-Daten beschrieben.