Gemini Enterprise Agent Platform ofrece varias formas de entregar modelos de lenguaje grandes abiertos, incluidos Llama, DeepSeek, Mistral y Qwen, en Google Cloud. En este documento, se proporciona una descripción general de las ofertas de Gemini Enterprise Agent Platform para la entrega de modelos abiertos y se te ayuda a elegir la opción adecuada para tu caso de uso.
Opciones de entrega
Gemini Enterprise Agent Platform ofrece las siguientes opciones para entregar modelos abiertos. Cada una de estas opciones proporciona alta disponibilidad e incluye Google Cloud prácticas recomendadas de seguridad de forma predeterminada:
- Modelo como servicio (MaaS): Entrega modelos abiertos con APIs administradas sin servidores.
- Modelos autoimplementados en Model Garden: Implementa modelos abiertos desde Model Garden con la implementación de un solo clic o con pesos personalizados.
- Imágenes de contenedores precompilados de Gemini Enterprise Agent Platform imágenes: Entrega modelos abiertos con contenedores precompilados para frameworks de entrega populares, por ejemplo, vLLM, Hex-LLM y TGI.
- Contenedor de vLLM personalizado: Te permite compilar e implementar tu propio contenedor de vLLM personalizado para una mayor flexibilidad.
Cuándo usar MaaS
Considera usar MaaS en estas situaciones:
- Desarrollo y creación de prototipos rápidos: MaaS te ayuda a integrar rápidamente las capacidades de LLM en las aplicaciones. Esto es especialmente útil para la exploración inicial, la creación de prototipos rápidos y cuando el tiempo de lanzamiento al mercado rápido es un objetivo clave.
- Minimizar la sobrecarga operativa: Elige MaaS cuando tu equipo quiera enfocarse en la lógica de la aplicación en lugar de la administración de la infraestructura. Google controla todo el aprovisionamiento, el ajuste de escala y el mantenimiento de GPU/TPU, lo que beneficia a los equipos enfocados en el desarrollo de aplicaciones en lugar de MLOps o DevOps.
- Tráfico variable: El modelo de pago por uso admite cargas de trabajo experimentales o aplicaciones con patrones de tráfico impredecibles y repentinos.
- Uso listo para usar: Usa una API administrada para aplicaciones que necesitan un rendimiento coherente, pero que no requieren una personalización profunda del modelo subyacente o la pila de entrega.
- Seguridad y cumplimiento: MaaS permite que las empresas usen Google Cloud's las funciones de seguridad y cumplimiento integradas de nivel empresarial.
- Uso de modelos estándar: Usa MaaS cuando un modelo de base estándar y no personalizado satisfaga tus necesidades.
Cuándo usar modelos autoimplementados en Model Garden
Las opciones de autoimplementación incluyen la implementación desde Model Garden con contenedores precompilados o personalizados. Considera la autoimplementación en estas situaciones clave:
- Pesos personalizados y modelos ajustados: La autoimplementación es la mejor opción cuando tu aplicación requiere el uso de pesos personalizados o una versión ajustada de un modelo, lo que ofrece una mayor flexibilidad para implementar modelos adaptados a tus necesidades específicas. También puedes compilar e implementar tus propios contenedores de entrega personalizados. Por ejemplo, usa esta opción cuando un modelo requiera una lógica única de preprocesamiento o posprocesamiento.
- Cargas de trabajo predecibles y de gran volumen: La autoimplementación es una opción estratégica y rentable para las aplicaciones de producción con tráfico predecible y de gran volumen. Si bien requiere una mayor inversión inicial en ingeniería, puede generar un costo total de propiedad (TCO) más bajo durante la vida útil de la aplicación debido a los costos optimizados por token a gran escala.
- Control detallado sobre la infraestructura: Usa la autoimplementación cuando necesites ajustar el rendimiento y el presupuesto eligiendo configuraciones de hardware específicas. Esto incluye seleccionar tipos de máquinas exactos, GPUs (por ejemplo, NVIDIA L4 o H100) o TPUs, y frameworks de entrega optimizados.
- Seguridad y cumplimiento estrictos: Este enfoque admite aplicaciones que deben cumplir con políticas específicas de residencia de datos o regulaciones estrictas que prohíben el uso de un servicio administrado de múltiples usuarios. Te permite implementar modelos de forma segura dentro de tu propio Google Cloud proyecto y red de nube privada virtual, lo que proporciona un control completo sobre la ruta de datos.
- Control detallado sobre la ubicación: Los extremos dedicados te permiten implementar en cualquier acelerador de Compute Engine en Google Cloud todas las regiones.
Cuándo usar contenedores precompilados
Considera usar contenedores precompilados de Gemini Enterprise Agent Platform en estas situaciones:
- Rendimiento optimizado: Gemini Enterprise Agent Platform optimiza y personaliza los contenedores precompilados para frameworks como vLLM para mejorar el rendimiento, la confiabilidad y la integración perfecta dentro de ellos Google Cloud.
- Facilidad de uso: Entrega modelos con frameworks de entrega populares, como vLLM, Hex-LLM, SGLang, TGI o TensorRT-LLM, sin compilar ni mantener tus propias imágenes de contenedores.
Cuándo usar contenedores de vLLM personalizados
Considera compilar y usar tu propio contenedor personalizado en estas situaciones:
- Máxima flexibilidad: Cuando las opciones de entrega existentes y los contenedores precompilados no son suficientes para tus necesidades y necesitas un control total sobre la imagen del contenedor, incluidas las dependencias y las configuraciones.
- Lógica de entrega personalizada: Cuando tu modelo requiere pasos únicos de preprocesamiento o posprocesamiento que no son compatibles con los contenedores precompilados.
¿Qué sigue?
- Usa modelos abiertos con Model as a Service (MaaS)
- Implementa modelos abiertos desde Model Garden
- Implementa modelos abiertos con contenedores precompilados
- Implementa modelos abiertos con un contenedor de vLLM personalizado