Modèles partenaires Gemini Enterprise Agent Platform pour le MaaS

Gemini Enterprise Agent Platform est compatible avec une sélection de modèles développés par des partenaires Google. Les modèles partenaires peuvent être utilisés avec Gemini Enterprise Agent Platform sous forme de modèle en tant que service (MaaS) et sont proposés en tant qu'API gérée. Lorsque vous utilisez un modèle partenaire, vous continuez à envoyer vos requêtes aux points de terminaison Gemini Enterprise Agent Platform. Les modèles partenaires sont sans serveur. Vous n'avez donc pas besoin de provisionner ni de gérer l'infrastructure.

Vous pouvez découvrir des modèles partenaires sur la plate-forme Model Garden, Vous pouvez également déployer des modèles à l'aide de Model Garden. Pour en savoir plus, consultez la page Découvrir des modèles d'IA dans Model Garden. Bien que des informations sur chaque modèle partenaire disponible soient accessibles sur la fiche de modèle dédiée à chacun d'eux dans Model Garden, seuls les modèles tiers opérant comme un modèle MaaS avec Gemini Enterprise Agent Platform sont documentés dans ce guide.

Les modèles Claude d'Anthropic et Mistral sont des exemples de modèles gérés tiers disponibles sur Gemini Enterprise Agent Platform.

Modèles de partenaires

Les modèles partenaires suivants sont proposés sous forme d'API gérées dans Gemini Enterprise Agent Platform Model Garden (MaaS) :

Nom du modèle Modalité Description Guide de démarrage rapide
Grok 4.3 (preview) Langage Modèle hautes performances de xAI. fiche de modèle
Grok 4.20 (raisonnement) (preview) Langage Grok 4.20 (raisonnement) est un modèle hautes performances de xAI, offrant l'un des taux d'hallucination les plus bas du secteur. Il excelle dans les tâches de compréhension de documents et l'appel d'outils agentifs à long terme. fiche de modèle
Grok 4.20 (sans raisonnement) (preview) Langage Grok 4.20 (sans raisonnement) est un modèle hautes performances sans raisonnement de xAI, offrant l'un des taux d'hallucination les plus bas du secteur. Il excelle dans les cas d'utilisation sensibles à la latence, comme l'assistance client et la catégorisation. fiche de modèle
Grok 4.1 Fast (raisonnement) (preview) Langage Grok 4.1 Fast (raisonnement) est le modèle le plus économique de xAI, bénéficiant de solides capacités d'appel d'outils et permettant une synthèse efficace des bases de connaissances. Il excelle dans les tâches de recherche impliquant des données Web et des outils de base de connaissances internes. fiche de modèle
Grok 4.1 Fast (sans raisonnement) (preview) Langage Grok 4.1 Fast (sans raisonnement) est le modèle sans raisonnement le plus économique de xAI, optimisé pour offrir de bonnes performances et une faible latence. Il excelle dans les tâches à volume élevé, comme la synthèse et la catégorisation. fiche de modèle
Claude Sonnet 5 sur Google Cloud Langage, vision Claude Sonnet 5 sur Google Cloud est le modèle Sonnet le plus performant d'Anthropic à ce jour , conçu pour le codage, les agents et le travail professionnel à grande échelle. fiche de modèle
Claude Opus 5 sur Google Cloud Langage, vision Claude Opus 5 sur Google Cloud est le modèle Opus le plus avancé d'Anthropic. Il alimente les agents de longue durée tout en améliorant le codage et le travail professionnel. fiche de modèle
Claude Fable 5 sur Google Cloud Langage, vision Claude Fable 5 sur Google Cloud est un modèle d'Anthropic conçu pour le travail de connaissances autonome et le codage, et créé pour les projets complexes de plusieurs jours. fiche de modèle
Claude Opus 4.8 sur Google Cloud Langage, vision Claude Opus 4.8 est un modèle Opus à haute intelligence conçu pour le codage et les agents, avec un raisonnement plus approfondi pour les workflows d'entreprise. fiche de modèle
Claude Opus 4.7 sur Google Cloud Langage, vision Claude Opus 4.7 sur Google Cloud est un modèle à haute intelligence d'Anthropic et un leader du secteur en matière de codage, d'agents, d'utilisation d'ordinateur et de workflows d'entreprise. fiche de modèle
Claude Sonnet 4.6 sur Google Cloud Langage, vision Claude Sonnet 4.6 sur Google Cloud offre une intelligence de pointe à grande échelle, conçue pour le codage, les agents et les workflows d'entreprise. fiche de modèle
Claude Opus 4.6 sur Google Cloud Langage, vision Claude Opus 4.6 sur Google Cloud est un modèle à haute intelligence d'Anthropic et un leader du secteur en matière de codage, d'agents, d'utilisation d'ordinateur et de workflows d'entreprise. fiche de modèle
Claude Opus 4.5 sur Google Cloud Langage, vision Claude Opus 4.5 sur Google Cloud est un modèle à haute intelligence d'Anthropic et un leader du secteur en matière de codage, d'agents, d'utilisation d'ordinateur et de workflows d'entreprise. fiche de modèle
Claude Sonnet 4.5 sur Google Cloud Langage, vision Modèle de taille moyenne d'Anthropic pour alimenter les agents du monde réel, avec des capacités de codage, d'utilisation d'ordinateur, de cybersécurité et d'utilisation de fichiers Office tels que des feuilles de calcul. fiche de modèle
Claude Opus 4.1 sur Google Cloud Langage, vision Leader du secteur en matière de codage. Il offre des performances durables pour les tâches de longue durée qui nécessitent un effort concentré et des milliers d'étapes, ce qui élargit considérablement ce que les agents d'IA peuvent résoudre. Idéal pour alimenter les produits et fonctionnalités d'agents de pointe. fiche de modèle
Claude Haiku 4.5 sur Google Cloud Langage, vision Claude Haiku 4.5 sur Google Cloud offre des performances quasi optimales pour un large éventail de cas d'utilisation. Il se distingue comme l'un des meilleurs modèles de codage au monde, avec la vitesse et le coût adaptés pour alimenter les produits sans frais et les expériences utilisateur à volume élevé. fiche de modèle
Claude Opus 4 sur Google Cloud Langage, vision Claude Opus 4 sur Google Cloud offre des performances durables pour les tâches de longue durée qui nécessitent un effort concentré et des milliers d'étapes, ce qui élargit considérablement ce que les agents d'IA peuvent résoudre. fiche de modèle
Claude Sonnet 4 sur Google Cloud Langage, vision Modèle de taille moyenne d'Anthropic offrant une intelligence supérieure pour les utilisations à volume élevé comme le codage, la recherche approfondie, et les agents. fiche de modèle
Claude 3.5 Sonnet v2 d'Anthropic sur Google Cloud Langage, vision Claude 3.5 Sonnet sur Google Cloud est un modèle hautes performances pour les tâches d'ingénierie logicielle et les capacités agentiques en conditions réelles. Claude 3.5 Sonnet sur Google Cloud offre ces avancées au même prix et à la même vitesse que son prédécesseur. fiche de modèle
Claude 3.5 Sonnet d'Anthropic sur Google Cloud Langage Claude 3.5 Sonnet sur Google Cloud surpasse Claude 3 Opus d'Anthropic sur Google Cloud sur un large éventail d'évaluations d'Anthropic, en raison de la rapidité et du coût de son modèle de milieu de gamme, Claude 3 Sonnet sur Google Cloud. fiche de modèle
Jamba 1.5 Large (preview) Langue Le modèle Jamba 1.5 Large d'AI21 Labs est conçu pour offrir des réponses de qualité supérieure, un débit élevé et un prix compétitif par rapport aux autres modèles de sa catégorie. fiche de modèle
Jamba 1.5 Mini (preview) Langue Le Jamba 1.5 Mini d'AI21 Labs est bien équilibré en termes de qualité, de débit et de coût. fiche de modèle
Mistral Medium 3 Langage Mistral Medium 3 est un modèle polyvalent conçu pour un large éventail de tâches, y compris la programmation, le raisonnement mathématique, la compréhension de longs documents, la synthèse et le dialogue. fiche de modèle
Mistral OCR (25.05) Langage, vision Mistral OCR (25.05) est une API de reconnaissance optique des caractères pour la compréhension de documents. Le modèle comprend chaque élément des documents, tels que les médias, le texte, les tableaux et les équations. fiche de modèle
Mistral Small 3.1 (25.03) Langage Mistral Small 3.1 (25.03) est une version du modèle Small de Mistral, offrant des fonctionnalités multimodales et une longueur de contexte étendue. fiche de modèle
Codestral 2 Langage, code Codestral 2 est le modèle spécialisé de génération de code de Mistral, conçu spécifiquement pour la complétion fill-in-the-middle (FIM) de haute précision, qui aide les développeurs à écrire du code et à interagir avec lui via un point de terminaison d'API partagé pour les instructions et la complétion. fiche de modèle

Évaluer les modèles partenaires à l'aide du service d'évaluation de l'IA générative

Le service d'évaluation de l'IA générative permet d'évaluer les modèles partenaires, tels que les modèles Anthropic et Llama. L'évaluation des modèles partenaires est compatible avec Model Garden. Vous devez donc activer le modèle avant d'exécuter des évaluations sur un modèle partenaire.

Pour en savoir plus, consultez la section Effectuer une évaluation à l'aide de la console.

Tarifs des modèles partenaires Gemini Enterprise Agent Platform avec assurance de capacité

Google propose un débit provisionné pour les modèles partenaires, qui réserve une capacité de débit pour vos modèles à un tarif fixe. Vous déterminez la capacité de débit et les régions dans lesquelles vous souhaitez réserver cette capacité. Étant donné que les requêtes de débit provisionné sont prioritaires par rapport aux requêtes standards avec paiement à l'utilisation, le débit provisionné offre une disponibilité accrue. Lorsque le système est surchargé, vos requêtes peuvent toujours être traitées tant que le débit reste inférieur à votre capacité de débit réservée. Pour en savoir plus ou pour vous abonner au service, contactez le service commercial.

Points de terminaison régionaux, mondiaux et multirégionaux

Pour les points de terminaison régionaux, les requêtes sont traitées à partir de la région que vous avez spécifiée. Si vous avez des exigences de résidence des données ou si un modèle n'est pas compatible avec le point de terminaison mondial, utilisez les points de terminaison régionaux.

Lorsque vous utilisez le point de terminaison mondial, Google peut traiter et diffuser vos requêtes à partir de n'importe quelle région compatible avec le modèle que vous utilisez, ce qui peut entraîner une latence plus élevée dans certains cas. Le point de terminaison mondial contribue à améliorer la disponibilité globale et à réduire les erreurs.

Les points de terminaison multirégionaux permettent un accès haute disponibilité aux modèles partenaires tout en maintenant la résidence des données dans une zone géographique plus large, comme les États-Unis.

Le prix varie en fonction du type de point de terminaison que vous sélectionnez. Pour en savoir plus sur les quotas et les fonctionnalités, consultez la page du modèle tiers concerné.

Point de terminaison mondial

Pour utiliser le point de terminaison mondial, définissez la région sur global.

Par exemple, l'URL de requête d'une commande curl utilise le format suivant : https://aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/global/publishers/PUBLISHER_NAME/models/MODEL_NAME

Pour le SDK Agent Platform, un point de terminaison régional est défini par défaut. Définissez la région sur GLOBAL pour utiliser le point de terminaison mondial.

Modèles compatibles avec le point de terminaison mondial

Le point de terminaison mondial est disponible pour les modèles suivants :

Restreindre l'utilisation des points de terminaison d'API mondiaux

Pour appliquer l'utilisation de points de terminaison régionaux, utilisez la contrainte de règle d'administration constraints/gcp.restrictEndpointUsage afin de bloquer les requêtes envoyées au point de terminaison d'API mondial. Pour en savoir plus, consultez Restreindre l'utilisation des points de terminaison.

Point de terminaison multirégional

Les points de terminaison multirégionaux permettent un accès haute disponibilité aux modèles partenaires tout en maintenant la résidence des données dans une zone géographique plus large, comme les États-Unis ou l'Union européenne.

Sélectionnez l'onglet approprié pour la zone multirégionale que vous souhaitez utiliser :

États-Unis

Pour utiliser le point de terminaison multirégional aux États-Unis, définissez l'URL du point de terminaison sur aiplatform.us.rep.googleapis.com.

L'URL de requête d'une commande curl utilise le format suivant : https://aiplatform.us.rep.googleapis.com/v1/projects/PROJECT_ID/locations/us/publishers/anthropic/models/MODEL_NAME

UE

Pour utiliser le point de terminaison multirégional dans l'UE, définissez l'URL du point de terminaison sur aiplatform.eu.rep.googleapis.com.

L'URL de requête d'une commande curl utilise le format suivant : https://aiplatform.eu.rep.googleapis.com/v1/projects/PROJECT_ID/locations/eu/publishers/anthropic/models/MODEL_NAME

Pour en savoir plus sur le format MODEL_NAME, consultez la documentation d'Anthropic.

Modèles compatibles avec le point de terminaison multirégional :

Les points de terminaison multirégionaux sont compatibles avec tous les modèles Claude dont la version est 4.7 ou ultérieure (par exemple, claude-opus-4-7, claude-opus-4-8 et claude-fable-5). Utilisez l'ID de modèle complet, y compris la date de la version, le cas échéant.

Exemple de requête :

Voici comment appeler le point de terminaison multirégional à l'aide de curl :

export PROJECT_ID="YOUR_PROJECT_ID"
# Example using claude-opus-4-7

# Option 1: US Region
export LOCATION="us"
export ENDPOINT="aiplatform.us.rep.googleapis.com"

# Option 2: EU Region
# export LOCATION="eu"
# export ENDPOINT="aiplatform.eu.rep.googleapis.com"

export MODEL_ID="claude-opus-4-7"

curl -X POST \
  -H "Authorization: Bearer $(gcloud auth application-default print-access-token)" \
  -H "Content-Type: application/json" \
  "https://${ENDPOINT}/v1/projects/${PROJECT_ID}/locations/${LOCATION}/publishers/anthropic/models/${MODEL_ID}:rawPredict" \
  -d '{
    "max_tokens": 300,
    "messages": [
      {
        "role": "user",
        "content": [
          {
            "type": "text",
            "text": "Why is the sky blue?"
          }
        ]
      }
    ],
    "anthropic_version": "vertex-2023-10-16"
  }'

Quotas multirégionaux :

Des quotas multirégionaux dédiés sont appliqués. Vous pouvez consulter et demander des augmentations pour ces valeurs de quota par défaut dans la Google Cloud console.

  • Exemples de quotas aux États-Unis :

    • UsOnlinePredictionInputTokensPerMinutePerBaseModel
    • UsOnlinePredictionOutputTokensPerMinutePerBaseModel
    • UsOnlinePredictionRequestsPerMinPerProjectPerBaseModel
    • UsOnlinePredictionWebSearchRequestsPerProjectPerPublisher
  • Exemples de quotas dans l'UE :

    • EuOnlinePredictionInputTokensPerMinutePerBaseModel
    • EuOnlinePredictionOutputTokensPerMinutePerBaseModel
    • EuOnlinePredictionRequestsPerMinPerProjectPerBaseModel
    • EuOnlinePredictionWebSearchRequestsPerProjectPerPublisher

Accorder aux utilisateurs l'accès aux modèles partenaires

Pour que vous puissiez activer des modèles partenaires et envoyer un prompt, un Google Cloud administrateur doit définir les autorisations requises et vérifier que la règle d'administration autorise l'utilisation des API requises.

Définir les autorisations requises pour utiliser des modèles partenaires

Vous devez disposer des rôles et autorisations suivants pour utiliser des modèles partenaires :

  • Vous devez disposer du rôle IAM (Identity and Access Management) "Gestionnaire des droits d'approvisionnement des consommateurs". Tout utilisateur disposant de ce rôle peut activer des modèles partenaires dans Model Garden.

  • Vous devez disposer de l'autorisation aiplatform.endpoints.predict. Cette autorisation est incluse dans le rôle IAM "Utilisateur Agent Platform". Pour en savoir plus, consultez les sections Utilisateur Gemini Enterprise Agent Platform et Contrôle des accès.

Console

  1. Pour attribuer les rôles IAM "Gestionnaire des droits d'approvisionnement des consommateurs" à un utilisateur, accédez à la page IAM.

    Accéder à IAM

  2. Dans la colonne Compte principal, recherchez le compte principal d'utilisateur pour lequel vous souhaitez activer l'accès aux modèles partenaires, puis cliquez sur Modifier le compte principal sur cette ligne.

  3. Dans le volet Modifier les accès, cliquez sur Ajouter un autre rôle.

  4. Dans Sélectionner un rôle, sélectionnez Gestionnaire des droits d'approvisionnement des consommateurs.

  5. Dans le volet Modifier les accès, cliquez sur Ajouter un autre rôle.

  6. Dans Sélectionner un rôle, sélectionnez Utilisateur Agent Platform.

  7. Cliquez sur Enregistrer.

gcloud

  1. Dans la Google Cloud console, activez Cloud Shell.

    Activer Cloud Shell

  2. Attribuez le rôle de gestionnaire des droits d'approvisionnement des consommateurs requis pour activer les modèles partenaires dans Model Garden.

    gcloud projects add-iam-policy-binding  PROJECT_ID \
    --member=PRINCIPAL --role=roles/consumerprocurement.entitlementManager
    
  3. Attribuez le rôle d'utilisateur Agent Platform qui inclut l'autorisation aiplatform.endpoints.predict requise pour effectuer des requêtes :

    gcloud projects add-iam-policy-binding  PROJECT_ID \
    --member=PRINCIPAL --role=roles/aiplatform.user
    

    Remplacez PRINCIPAL par l'identifiant du compte principal. L'identifiant se présente sous la forme user|group|serviceAccount:email ou domain:domain (par exemple, user:cloudysanfrancisco@gmail.com, group:admins@example.com, serviceAccount:test123@example.domain.com ou domain:example.domain.com.

    Le résultat est une liste de liaisons de stratégie qui incluent les éléments suivants :

    -   members:
      -   user:PRINCIPAL
      role: roles/roles/consumerprocurement.entitlementManager
    

    Pour plus d'informations, consultez les sections Attribuer un seul rôle et gcloud projects add-iam-policy-binding.

Définir la règle d'organisation pour l'accès au modèle partenaire

Pour activer les modèles partenaires, votre règle d'administration doit autoriser l'API suivante : API Cloud Commerce Consumer Procurement - cloudcommerceconsumerprocurement.googleapis.com

Si votre organisation définit une règle d'administration pour restreindre l'utilisation des services, un administrateur de l'organisation doit vérifier que cloudcommerceconsumerprocurement.googleapis.com est autorisé en définissant la règle d'administration.

De plus, si vous disposez d'une règle d'administration qui limite l'utilisation des modèles dans Model Garden, elle doit autoriser l'accès aux modèles partenaires. Pour en savoir plus, consultez la section Contrôler l'accès au modèle.

Conformité réglementaire des modèles partenaires

Les certifications de l'IA générative sur Gemini Enterprise Agent Platform continuent de s'appliquer lorsque les modèles partenaires sont utilisés en tant qu'API gérée à l'aide de Gemini Enterprise Agent Platform. Si vous avez besoin d'informations sur les modèles eux-mêmes, vous pouvez consulter la fiche de modèle correspondante ou contacter l'éditeur du modèle concerné.

Vos données sont stockées au repos dans la région ou la zone multirégionale sélectionnée pour les modèles partenaires sur Gemini Enterprise Agent Platform, mais la régionalisation du traitement des données peut varier. Pour obtenir une liste détaillée des engagements de traitement des données des modèles partenaires, consultez la section Résidence des données pour les modèles partenaires.

Les requêtes client et les réponses de modèle ne sont pas partagées avec des tiers lorsque vous utilisez l'API Gemini Enterprise, y compris les modèles partenaires. Google ne traite les données client que conformément aux instructions du client, comme décrit plus en détail dans notre Avenant relatif au traitement des données dans le cloud.