Gemini Enterprise Agent Platform offre plusieurs façons de diffuser des grands modèles de langage ouverts, y compris Llama, DeepSeek, Mistral et Qwen, dans Google Cloud. Ce document présente les offres de Gemini Enterprise Agent Platform pour la diffusion de modèles ouverts et vous aide à choisir l'option adaptée à votre cas d'utilisation.
Options de diffusion
Gemini Enterprise Agent Platform propose les options suivantes pour diffuser des modèles ouverts. Chacune de ces options offre une haute disponibilité et inclut Google Cloud les bonnes pratiques de sécurité par défaut :
- Modèle en tant que service (MaaS) : diffuse des modèles ouverts à l'aide d'API gérées sans serveur.
- Modèles déployés automatiquement dans Model Garden: déploie des modèles ouverts à partir de Model Garden en un seul clic ou avec des pondérations personnalisées.
- Images de conteneurs prédéfinies Gemini Enterprise Agent Platform images : diffuse des modèles ouverts à l'aide de conteneurs prédéfinis pour les frameworks de diffusion courants, par exemple vLLM, Hex-LLM et TGI.
- Conteneur vLLM personnalisé : vous permet de créer et de déployer votre propre conteneur vLLM personnalisé pour plus de flexibilité.
Quand utiliser MaaS
Envisagez d'utiliser MaaS dans les cas suivants :
- Développement et prototypage rapides : MaaS vous aide à intégrer rapidement des fonctionnalités de LLM dans les applications. Cela est particulièrement utile pour l'exploration initiale, le prototypage rapide et lorsque le délai de mise sur le marché est un objectif clé.
- Réduction des frais généraux opérationnels : choisissez MaaS lorsque votre équipe souhaite se concentrer sur la logique d’application plutôt que sur la gestion de l’infrastructure. Google gère l'ensemble du provisionnement, du scaling et de la maintenance des GPU/TPU, ce qui profite aux équipes axées sur le développement d'applications plutôt que sur MLOps ou DevOps.
- Trafic variable : le modèle de paiement à l'utilisation est compatible avec les charges de travail expérimentales ou les applications dont les schémas de trafic sont imprévisibles et irréguliers.
- Utilisation prête à l'emploi : utilisez une API gérée pour les applications qui ont besoin de performances cohérentes, mais qui ne nécessitent pas de personnalisation approfondie du modèle sous-jacent ni de la pile de diffusion.
- Sécurité et conformité : MaaS permet aux entreprises d'utiliser les fonctionnalités de sécurité et de conformité intégrées de niveau entreprise. Google Cloud
- Utilisation de modèles standards : utilisez MaaS lorsqu'un modèle de fondation standard et non personnalisé répond à vos besoins.
Quand utiliser des modèles déployés automatiquement dans Model Garden
Les options de déploiement automatique incluent le déploiement à partir de Model Garden à l'aide de conteneurs prédéfinis ou personnalisés. Envisagez le déploiement automatique dans les cas clés suivants :
- Pondérations personnalisées et modèles affinés : le déploiement automatique est le meilleur choix lorsque votre application nécessite l'utilisation de pondérations personnalisées ou d'une version affinée d'un modèle, ce qui offre une plus grande flexibilité pour déployer des modèles adaptés à vos besoins spécifiques. Vous pouvez également créer et déployer vos propres conteneurs de diffusion personnalisés. Par exemple, utilisez cette option lorsqu'un modèle nécessite une logique de prétraitement ou de post-traitement unique.
- Charges de travail prévisibles et à fort volume : le déploiement automatique est une option stratégique et économique pour les applications de production avec un trafic prévisible et à fort volume. Bien qu'il nécessite un investissement initial plus important en ingénierie, il peut entraîner un coût total de possession (TCO) inférieur sur la durée de vie de l'application en raison de coûts par jeton optimisés à grande échelle.
- Contrôle précis de l'infrastructure : utilisez le déploiement automatique lorsque vous devez affiner les performances et le budget en choisissant des configurations matérielles spécifiques. Cela inclut la sélection de types de machines exacts, de GPU (par exemple, NVIDIA L4 ou H100) ou de TPU, ainsi que de frameworks de diffusion optimisés.
- Sécurité et conformité strictes : cette approche est compatible avec les applications qui doivent respecter des règles de résidence des données spécifiques ou des réglementations strictes interdisant l'utilisation d'un service géré mutualisé. Elle vous permet de déployer des modèles de manière sécurisée dans votre propre Google Cloud projet et votre réseau cloud privé virtuel, ce qui vous offre un contrôle total sur le chemin des données.
- Contrôle précis de l'emplacement : les points de terminaison dédiés vous permettent de déployer sur n'importe quel accélérateur Compute Engine dans Google Cloud toutes les régions.
Quand utiliser des conteneurs prédéfinis
Envisagez d'utiliser les conteneurs prédéfinis Gemini Enterprise Agent Platform dans les cas suivants :
- Performances optimisées : Gemini Enterprise Agent Platform optimise et personnalise les conteneurs prédéfinis pour les frameworks tels que vLLM afin d'améliorer les performances, la fiabilité et l'intégration transparente dans Google Cloud.
- Facilité d'utilisation : diffusez des modèles à l'aide de frameworks de diffusion courants tels que vLLM, Hex-LLM, SGLang, TGI ou TensorRT-LLM sans avoir à créer ni à gérer vos propres images de conteneurs.
Quand utiliser des conteneurs vLLM personnalisés
Envisagez de créer et d'utiliser votre propre conteneur personnalisé dans les cas suivants :
- Flexibilité maximale : lorsque les options de diffusion et les conteneurs prédéfinis existants ne suffisent pas à répondre à vos besoins et que vous avez besoin d'un contrôle total sur l'image de conteneur, y compris les dépendances et les configurations.
- Logique de diffusion personnalisée : lorsque votre modèle nécessite des étapes de prétraitement ou de post-traitement uniques qui ne sont pas compatibles avec les conteneurs prédéfinis.
Étape suivante
- Utiliser des modèles ouverts avec Model as a Service (MaaS)
- Déployer des modèles ouverts à partir de Model Garden
- Déployer des modèles ouverts avec des conteneurs prédéfinis
- Déployer des modèles ouverts avec un conteneur vLLM personnalisé