Plattformpartnermodelle für MaaS auf der Gemini Enterprise Agent Platform

Die Gemini Enterprise Agent Platform unterstützt eine ausgewählte Liste von Modellen, die von Google-Partnern entwickelt wurden. Partnermodelle können mit der Gemini Enterprise Agent Platform als Model as a Service (MaaS) verwendet werden und werden als verwaltete API angeboten. Wenn Sie ein Partnermodell verwenden, senden Sie Ihre Anfragen weiterhin an Gemini Enterprise Agent Platform-Endpunkte. Partnermodelle sind serverlos, sodass Sie keine Infrastruktur bereitstellen oder verwalten müssen.

Partnermodelle können mithilfe von Model Garden gefunden werden. Sie können Modelle auch mit Model Garden bereitstellen. Weitere Informationen finden Sie unter KI-Modelle in Model Garden entdecken. Informationen zu jedem verfügbaren Partnermodell finden Sie auf der Modellkarte in Model Garden. In dieser Anleitung sind nur Drittanbietermodelle, die als MaaS mit der Gemini Enterprise Agent Platform funktionieren, dokumentiert.

Anthropic Claude- und Mistral-Modelle sind Beispiele für von Drittanbietern verwaltete Modelle, die mit der Gemini Enterprise Agent Platform verwendet werden können.

Partnermodelle

Die folgenden Partnermodelle werden als verwaltete APIs im Gemini Enterprise Agent Platform Model Garden (MaaS) angeboten:

Modellname Modalität Beschreibung Kurzanleitung
Muse Spark 1.3 von Meta (Vorschau) Sprache Muse Spark 1.3 von Meta ist ein Modell für Schlussfolgerungen, das für agentenbasierte Workflows und Competitive Coding trainiert wurde. Das Modell bietet eine höhere Genauigkeit beim ersten Versuch, zuverlässige integrierte Tool-Aufrufe mit MCP-Unterstützung und einen langen Kontext von 1 Million Tokens für mehrstufige Aufgaben. Modelldetails
Grok 4.7 (Vorschau) Sprache Ein leistungsstarkes Modell von xAI, das für Coding und Wissensarbeit entwickelt wurde. Es arbeitet länger an schwierigen Aufgaben und überprüft seine eigene Arbeit. Modellkarte
Grok 4.6 Sprache Ein leistungsstarkes Modell von xAI, das für Coding, agentische Aufgaben und Wissensarbeit entwickelt wurde. Modellkarte
Grok 4.3 (Vorschau) Sprache Das leistungsstarke Modell von xAI. Modellkarte
Grok 4.20 (Reasoning) (Vorschau) Sprache Grok 4.20 (Reasoning) ist ein leistungsstarkes Modell von xAI mit einer niedrigen Halluzinationsrate. Sie eignet sich hervorragend für Aufgaben zum Verständnis von Dokumenten und für agentische Tool-Aufrufe mit langem Horizont. Modellkarte
Grok 4.20 (ohne Begründung) (Vorschau) Sprache Grok 4.20 (Non-Reasoning) ist ein leistungsstarkes Modell von xAI ohne Reasoning-Funktion, das sich durch eine niedrige Halluzinationsrate auszeichnet. Es eignet sich hervorragend für latenzempfindliche Anwendungsfälle wie Kundensupport und Kategorisierung. Modellkarte
Grok 4.1 Fast (Reasoning) (Vorschau) Sprache Grok 4.1 Fast (Reasoning) ist ein kostengünstiges Modell von xAI mit leistungsstarken Funktionen zum Aufrufen von Tools und effizienter Synthese von Wissensdatenbanken. Sie eignet sich besonders für Suchaufgaben, bei denen Webdaten und interne Wissensdatenbank-Tools verwendet werden. Modellkarte
Grok 4.1 Fast (Non-reasoning) (Vorschau) Sprache Grok 4.1 Fast (Non-Reasoning) ist ein kosteneffizientes Modell von xAI ohne Reasoning-Funktion, das für niedrige Latenz optimiert ist. Sie eignet sich hervorragend für Aufgaben mit hohem Datenvolumen wie Zusammenfassungen und Kategorisierungen. Modellkarte
Claude Haiku 5.5 in Google Cloud Sprache, Vision Claude Haiku 5.5 in Google Cloud ist ein leistungsstarkes, kostengünstiges Modell, das für die Programmierung, Sub-Agents und latenzempfindliche Anwendungen im großen Maßstab entwickelt wurde. Modellkarte
Claude Sonnet 5.5 in Google Cloud Sprache, Vision Claude Sonnet 5.5 in Google Cloud wurde für die Programmierung, Agenten und professionelle Arbeit in großem Umfang entwickelt. Modellkarte
Claude Sonnet 5 in Google Cloud Sprache, Vision Claude Sonnet 5 in Google Cloud wurde für die Programmierung, Agenten und professionelle Arbeit in großem Umfang entwickelt. Modellkarte
Claude Opus 5.5 in Google Cloud Sprache, Vision Claude Opus 5.5 in Google Cloud ist das fortschrittlichste Opus-Modell von Anthropic, das KI-Agenten mit langer Ausführungszeit unterstützt und gleichzeitig Verbesserungen beim Coding und bei professionellen Aufgaben bietet. Modellkarte
Claude Opus 5 in Google Cloud Sprache, Vision Claude Opus 5 in Google Cloud ist ein hochintelligentes Modell von Anthropic, das für Coding, KI-Agenten und professionelle Arbeit entwickelt wurde. Modellkarte
Claude Fable 5.1 in Google Cloud Sprache, Vision Claude Fable 5.1 in Google Cloud ist für autonome Wissensarbeit und Programmierung optimiert und kann lange, komplexe und asynchrone Aufgaben bewältigen. Modellkarte
Claude Fable 5 in Google Cloud Sprache, Vision Claude Fable 5 in Google Cloud ist ein Modell von Anthropic, das für autonome Wissensarbeit und Programmierung entwickelt wurde und sich für komplexe, mehrtägige Projekte eignet. Modellkarte
Claude Opus 4.8 in Google Cloud Sprache, Vision Claude Opus 4.8 ist ein hochintelligentes Opus-Modell, das für Coding und KI-Agenten entwickelt wurde und ein besseres Schlussfolgern für Unternehmensworkflows bietet. Modellkarte
Claude Opus 4.7 in Google Cloud Sprache, Vision Claude Opus 4.7 in Google Cloud ist ein hochintelligentes Modell von Anthropic und branchenführend in den Bereichen Programmierung, KI-Agenten, Computernutzung und Unternehmensworkflows. Modellkarte
Claude Sonnet 4.6 in Google Cloud Sprache, Vision Claude Sonnet 4.6 in Google Cloud bietet erstklassige Intelligenz in großem Umfang – speziell für die Programmierung, Agenten und Unternehmensworkflows. Modellkarte
Claude Opus 4.6 in Google Cloud Sprache, Vision Claude Opus 4.6 in Google Cloud ist ein hochintelligentes Modell von Anthropic und branchenführend in den Bereichen Programmierung, KI-Agenten, Computernutzung und Unternehmensworkflows. Modellkarte
Claude Opus 4.5 in Google Cloud Sprache, Vision Claude Opus 4.5 in Google Cloud ist ein hochintelligentes Modell von Anthropic und branchenführend in den Bereichen Programmierung, KI-Agenten, Computernutzung und Unternehmensworkflows. Modellkarte
Claude Sonnet 4.5 in Google Cloud Sprache, Vision Das mittelgroße Modell von Anthropic für die Unterstützung von KI-Agenten in der realen Welt mit Funktionen für die Programmierung, Computernutzung, Cybersicherheit und die Arbeit mit Office-Dateien wie Tabellenkalkulationen. Modellkarte
Claude Opus 4.1 in Google Cloud Sprache, Vision Ein Branchenführer für Programmierung. Sie bietet eine nachhaltige Leistung bei langwierigen Aufgaben, die konzentrierte Anstrengung und Tausende von Schritten erfordern. Dadurch wird das Spektrum der Aufgaben, die KI-Assistenten lösen können, erheblich erweitert. Ideal für die Nutzung in zukunftsweisenden Agentenprodukten und ‑funktionen. Modellkarte
Claude Haiku 4.5 in Google Cloud Sprache, Vision Claude Haiku 4.5 in Google Cloud ist ein leistungsstarkes Modell für eine Vielzahl von Anwendungsfällen und Programmieraufgaben. Es bietet die Geschwindigkeit und Kosteneffizienz, die für kostenlose Produkte und Nutzererfahrungen mit hohem Volumen erforderlich sind. Modellkarte
Claude Opus 4 in Google Cloud Sprache, Vision Claude Opus 4 in Google Cloud bietet eine nachhaltige Leistung bei langwierigen Aufgaben, die konzentrierte Anstrengung und Tausende von Schritten erfordern. Dadurch wird das Spektrum der Aufgaben, die KI-Agenten lösen können, erheblich erweitert. Modellkarte
Claude Sonnet 4 in Google Cloud Sprache, Vision Das mittelgroße Modell von Anthropic mit überlegener Intelligenz für den umfangreichen Einsatz, z. B. in den Bereichen Programmierung, eingehende Recherche und KI-Agenten. Modellkarte
Claude 3.5 Sonnet v2 von Anthropic in Google Cloud Sprache, Vision Claude 3.5 Sonnet in Google Cloud ist ein leistungsstarkes Modell für reale Softwareentwicklungsaufgaben und agentische Funktionen. Claude 3.5 Sonnet auf Google Cloud bietet diese Verbesserungen zum gleichen Preis und mit der gleichen Geschwindigkeit wie sein Vorgänger. Modellkarte
Claude 3.5 Sonnet von Anthropic in Google Cloud Sprache Claude 3.5 Sonnet in Google Cloud übertrifft Claude 3 Opus von Anthropic in Google Cloud in einer Vielzahl von Bewertungen von Anthropic mit der Geschwindigkeit und den Kosten des Mid-Tier-Modells von Anthropic, Claude 3 Sonnet in Google Cloud. Modellkarte
Jamba 1.5 Large (Vorschau) Sprache Jamba 1.5 Large von AI21 Labs wurde für Antworten von höchster Qualität, hohen Durchsatz und wettbewerbsfähige Preise im Vergleich zu anderen Modellen seiner Größenklasse entwickelt. Modellkarte
Jamba 1.5 Mini (Vorschau) Sprache Jamba 1.5 Mini von AI21 Labs bietet ein gutes Gleichgewicht zwischen Qualität, Durchsatz und niedrigen Kosten. Modellkarte
Mistral Medium 3 Sprache Mistral Medium 3 ist ein vielseitiges Modell, das für eine Vielzahl von Aufgaben entwickelt wurde, darunter Programmierung, mathematische Schlussfolgerungen, das Verstehen langer Dokumente, Zusammenfassung und Dialog. Modellkarte
Mistral OCR (25.05) Sprache, Vision Mistral OCR (25.05) ist eine API zur optischen Zeichenerkennung (Optical Character Recognition, OCR) für das Verstehen von Dokumenten. Das Modell erfasst jedes Element von Dokumenten wie Medien, Text, Tabellen und Gleichungen. Modellkarte
Mistral Small 3.1 (25.03) Sprache Mistral Small 3.1 (25.03) ist eine Version des Small-Modells von Mistral mit multimodalen Funktionen und einer erweiterten Kontextlänge. Modellkarte
Codestral 2 Sprache, Code Codestral 2 ist das auf Codegenerierung spezialisierte Modell von Mistral, das speziell für die hochpräzise FIM-Vervollständigung (Fill-in-the-Middle) entwickelt wurde. Es unterstützt Entwickler beim Schreiben von Code und bei der Interaktion mit Code über einen gemeinsamen API-Endpunkt für Anweisungen und Vervollständigungen. Modellkarte

Partnermodelle mit dem Gen AI Evaluation Service bewerten

Der Gen AI Evaluation Service unterstützt die Bewertung von Partnermodellen wie Anthropic- und Llama-Modellen. Die Bewertung von Partnermodellen wird über Model Garden unterstützt. Sie müssen das Modell also aktivieren, bevor Sie Bewertungen für ein Partnermodell ausführen.

Weitere Informationen finden Sie unter Evaluierung mit der Console durchführen.

Preise für Partnermodelle der Gemini Enterprise Agent Platform mit Kapazitätsgarantie

Google bietet einen bereitgestellten Durchsatz für Partnermodelle, der den Durchsatz für Ihre Modelle zu einer festen Gebühr reserviert. Sie entscheiden über die Durchsatzkapazität und in welchen Regionen diese Kapazität reserviert werden soll. Weil Anfragen zum bereitgestellten Durchsatz Vorrang vor den standardmäßigen "Pay as you go"-Anfragen haben, bietet bereitgestellter Durchsatz eine höhere Verfügbarkeit. Wenn das System überlastet ist, können Anfragen weiterhin abgeschlossen werden, solange der Durchsatz unter der der reservierten Durchsatzkapazität bleibt. Wenn Sie weitere Informationen wünschen oder den Dienst abonnieren möchten: Vertrieb kontaktieren.

Regionale, globale und multiregionale Endpunkte

Bei regionalen Endpunkten werden Anfragen aus der von Ihnen angegebenen Region bearbeitet. Wenn Sie Anforderungen an den Datenstandort haben oder ein Modell den globalen Endpunkt nicht unterstützt, verwenden Sie die regionalen Endpunkte.

Wenn Sie den globalen Endpunkt verwenden, kann Google Ihre Anfragen in jeder Region verarbeiten und bereitstellen, die vom verwendeten Modell unterstützt wird. Dies kann in einigen Fällen zu einer höheren Latenz führen. Der globale Endpunkt trägt dazu bei, die allgemeine Verfügbarkeit zu verbessern und Fehler zu reduzieren.

Multiregionale Endpunkte ermöglichen den Zugriff auf Partnermodelle mit Hochverfügbarkeit und sorgen gleichzeitig dafür, dass der Datenstandort in einem größeren geografischen Gebiet wie den USA verbleibt.

Je nach ausgewähltem Endpunkttyp gibt es Preisunterschiede. Weitere Informationen zu Kontingenten und Funktionen finden Sie auf der entsprechenden Seite des Drittanbietermodells.

Globaler Endpunkt

Wenn Sie den globalen Endpunkt verwenden möchten, legen Sie die Region auf global fest.

Die Anfrage-URL für einen curl-Befehl hat beispielsweise das folgende Format: https://aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/global/publishers/PUBLISHER_NAME/models/MODEL_NAME

Für das Agent Platform SDK ist ein regionaler Endpunkt die Standardeinstellung. Legen Sie die Region auf GLOBAL fest, um den globalen Endpunkt zu verwenden.

Unterstützte Modelle für den globalen Endpunkt

Der globale Endpunkt ist für die folgenden Modelle verfügbar:

Nutzung globaler API-Endpunkt einschränken

Um die Verwendung regionaler Endpunkte zu erzwingen, können Sie die Einschränkung der Organisationsrichtlinie constraints/gcp.restrictEndpointUsage verwenden, um Anfragen an den globalen API-Endpunkt zu blockieren. Weitere Informationen finden Sie unter Endpunktnutzung einschränken.

Multiregionaler Endpunkt

Multiregionale Endpunkte ermöglichen den hochverfügbaren Zugriff auf Partnermodelle und sorgen gleichzeitig dafür, dass der Datenstandort in einem größeren geografischen Gebiet wie den USA oder der Europäischen Union verbleibt.

Wählen Sie den entsprechenden Tab für die Multiregion aus, die Sie verwenden möchten:

USA

Wenn Sie den multiregionalen Endpunkt in den USA verwenden möchten, legen Sie die Endpunkt-URL auf aiplatform.us.rep.googleapis.com fest.

Die Anfrage-URL für einen curl-Befehl hat das folgende Format: https://aiplatform.us.rep.googleapis.com/v1/projects/PROJECT_ID/locations/us/publishers/anthropic/models/MODEL_NAME

EU

Wenn Sie den multiregionalen Endpunkt in der EU verwenden möchten, legen Sie die Endpunkt-URL auf aiplatform.eu.rep.googleapis.com fest.

Die Anfrage-URL für einen curl-Befehl hat das folgende Format: https://aiplatform.eu.rep.googleapis.com/v1/projects/PROJECT_ID/locations/eu/publishers/anthropic/models/MODEL_NAME

Weitere Informationen zum MODEL_NAME-Format finden Sie in der Anthropic-Dokumentation.

Unterstützte Modelle für den multiregionalen Endpunkt:

Multi-Region-Endpunkte unterstützen alle Claude-Modelle mit Version 4.7 und höher (z. B. claude-opus-4-7, claude-opus-4-8 und claude-fable-5). Verwenden Sie gegebenenfalls die vollständige Modell-ID einschließlich des Versionsdatums.

Grok 4.6 (grok-4.6) und Grok 4.7 (grok-4.7) sind am multiregionalen Endpunkt für die USA verfügbar. Grok-Modelle verwenden die OpenAI-kompatiblen Chat-Vervollständigungs- und Responses-APIs. Der Anfragepfad verwendet daher endpoints/openapi. Beispiel: https://aiplatform.us.rep.googleapis.com/v1/projects/PROJECT_ID/locations/us/endpoints/openapi/responses.

Beispielanfrage:

So rufen Sie den Endpunkt für mehrere Regionen mit curl auf:

export PROJECT_ID="YOUR_PROJECT_ID"
# Example using claude-opus-4-7

# Option 1: US Region
export LOCATION="us"
export ENDPOINT="aiplatform.us.rep.googleapis.com"

# Option 2: EU Region
# export LOCATION="eu"
# export ENDPOINT="aiplatform.eu.rep.googleapis.com"

export MODEL_ID="claude-opus-4-7"

curl -X POST \
  -H "Authorization: Bearer $(gcloud auth application-default print-access-token)" \
  -H "Content-Type: application/json" \
  "https://${ENDPOINT}/v1/projects/${PROJECT_ID}/locations/${LOCATION}/publishers/anthropic/models/${MODEL_ID}:rawPredict" \
  -d '{
    "max_tokens": 300,
    "messages": [
      {
        "role": "user",
        "content": [
          {
            "type": "text",
            "text": "Why is the sky blue?"
          }
        ]
      }
    ],
    "anthropic_version": "vertex-2023-10-16"
  }'

Multiregionale Kontingente:

Es gelten dedizierte multiregionale Kontingente. Sie können diese Standardkontingentwerte in der Google Cloud Console aufrufen und Erhöhungen anfordern.

  • Beispiele für Kontingente in den USA:

    • UsOnlinePredictionInputTokensPerMinutePerBaseModel
    • UsOnlinePredictionOutputTokensPerMinutePerBaseModel
    • UsOnlinePredictionRequestsPerMinPerProjectPerBaseModel
    • UsOnlinePredictionWebSearchRequestsPerProjectPerPublisher
  • Beispiele für EU-Kontingente:

    • EuOnlinePredictionInputTokensPerMinutePerBaseModel
    • EuOnlinePredictionOutputTokensPerMinutePerBaseModel
    • EuOnlinePredictionRequestsPerMinPerProjectPerBaseModel
    • EuOnlinePredictionWebSearchRequestsPerProjectPerPublisher

Nutzern Zugriff auf Partnermodelle gewähren

Damit Sie Partnermodelle aktivieren und eine Prompts-Anfrage stellen können, muss ein Google CloudAdministrator die erforderlichen Berechtigungen festlegen und bestätigen, dass die Organisationsrichtlinie die Verwendung der erforderlichen APIs zulässt.

Erforderliche Berechtigungen zum Verwenden von Partnermodellen festlegen

Die folgenden Rollen und Berechtigungen sind für die Verwendung von Partnermodellen erforderlich:

  • Sie benötigen die IAM-Rolle (Identity and Access Management) „Manager von Nutzer-Beschaffungsberechtigungen“. Nutzer, denen diese Rolle zugewiesen wurde, können Partnermodelle in Model Garden aktivieren.

  • Sie benötigen die Berechtigung aiplatform.endpoints.predict. Diese Berechtigung ist in der IAM-Rolle „Agent Platform User“ enthalten. Weitere Informationen finden Sie unter Gemini Enterprise Agent Platform-Nutzer und Zugriffssteuerung.

Console

  1. Um einem Nutzer die IAM-Rollen für Manager von Nutzer-Beschaffungsberechtigungen zuzuweisen, rufen Sie die Seite IAM auf.

    IAM aufrufen

  2. Suchen Sie in der Spalte Hauptkonto das Nutzer-Hauptkonto, für das Sie den Zugriff auf Partner-Modelle aktivieren möchten, und klicken Sie dann in dieser Zeile auf Hauptkonto bearbeiten.

  3. Klicken Sie im Bereich Berechtigungen bearbeiten auf Weitere Rolle hinzufügen.

  4. Wählen Sie unter Rolle auswählen die Option Consumer Procurement Entitlement Manager aus.

  5. Klicken Sie im Bereich Zugang bearbeiten auf Weitere Rolle hinzufügen.

  6. Wählen Sie unter Rolle auswählen die Option Agent Platform User aus.

  7. Klicken Sie auf Speichern.

gcloud

  1. Aktivieren Sie Cloud Shell in der Google Cloud Console.

    Cloud Shell aktivieren

  2. Rolle „Manager von Nutzer-Beschaffungsberechtigungen“ zuweisen, die zum Aktivieren von Partnermodellen in Model Garden erforderlich ist

    gcloud projects add-iam-policy-binding  PROJECT_ID \
    --member=PRINCIPAL --role=roles/consumerprocurement.entitlementManager
    
  3. Erteilen Sie die Rolle „Agent Platform-Nutzer“, die die aiplatform.endpoints.predict-Berechtigung enthält, die zum Senden von Prompts erforderlich ist:

    gcloud projects add-iam-policy-binding  PROJECT_ID \
    --member=PRINCIPAL --role=roles/aiplatform.user
    

    Ersetzen Sie PRINCIPAL durch die Kennung des Hauptkontos. Die Kennung hat das Format user|group|serviceAccount:email oder domain:domain, z. B. user:cloudysanfrancisco@gmail.com, group:admins@example.com, serviceAccount:test123@example.domain.com oder domain:example.domain.com.

    Es wird eine Liste von Richtlinienbindungen ausgegeben, die Folgendes enthält:

    -   members:
      -   user:PRINCIPAL
      role: roles/roles/consumerprocurement.entitlementManager
    

    Weitere Informationen finden Sie unter Einzelne Rolle zuweisen und gcloud projects add-iam-policy-binding.

Organisationsrichtlinie für den Zugriff auf Partnermodelle festlegen

Damit Sie Partnermodelle aktivieren können, muss in Ihrer Organisationsrichtlinie die folgende API zugelassen sein: Cloud Commerce Consumer Procurement API – cloudcommerceconsumerprocurement.googleapis.com

Wenn Ihre Organisation eine Organisationsrichtlinie zum Einschränken der Dienstnutzung festlegt, muss ein Organisationsadministrator bestätigen, dass cloudcommerceconsumerprocurement.googleapis.com durch Festlegen der Organisationsrichtlinie zulässig ist.

Wenn Sie eine Organisationsrichtlinie haben, die die Modellnutzung in Model Garden einschränkt, muss die Richtlinie den Zugriff auf Partnermodelle zulassen. Weitere Informationen finden Sie unter Zugriff auf Modelle steuern.

Einhaltung regulatorischer Anforderungen für Partnermodelle

Die Zertifizierungen für generative KI auf der Agent Platform gelten weiterhin, wenn Partnermodelle als verwaltete API über die Gemini Enterprise Agent Platform verwendet werden. Wenn Sie weitere Informationen zu den Modellen selbst benötigen, finden Sie diese in der jeweiligen Modellkarte. Sie können sich auch an den jeweiligen Modellpublisher wenden.

Ihre Daten werden im Ruhezustand in der ausgewählten Region oder in mehreren Regionen für Partnermodelle auf der Gemini Enterprise Agent Platform gespeichert. Die Regionalisierung der Datenverarbeitung kann jedoch variieren. Eine detaillierte Liste der Verpflichtungen zur Datenverarbeitung von Partnermodellen finden Sie unter Datenstandort für Partnermodelle.

Kunden-Prompts und Modellantworten werden bei Verwendung der Gemini Enterprise API nicht an Dritte weitergegeben, auch nicht an Partnermodelle. Google verarbeitet Kundendaten nur gemäß den Anweisungen des Kunden, wie in unserem Zusatz zur Verarbeitung von Cloud-Daten beschrieben.