Documentación de la organización de IA/AA en Cloud Run
Cloud Run es una plataforma completamente administrada que te permite ejecutar tus aplicaciones alojadas en contenedores, incluidas las cargas de trabajo de AA/ML, directamente en la infraestructura escalable de Google. Maneja la infraestructura por ti, para que puedas enfocarte en escribir tu código en lugar de dedicar tiempo a operar, configurar y escalar tus recursos de Cloud Run. Las capacidades de Cloud Run proporcionan lo siguiente:
- Aceleradores de hardware: Accede a las GPUs y adminístralas para la inferencia a gran escala.
- Compatibilidad con frameworks: Se integra con los frameworks de entrega de modelos que ya conoces y en los que confías, como Hugging Face, TGI y vLLM.
- Plataforma administrada: Obtén todos los beneficios de una plataforma administrada para automatizar, escalar y mejorar la seguridad de todo tu ciclo de vida de IA/AA, sin dejar de ser flexible.
Explora nuestros instructivos y prácticas recomendadas para ver cómo Cloud Run puede optimizar tus cargas de trabajo de IA/AA.
Comienza tu prueba de concepto con un crédito gratis de $300
- Desarrolla con nuestros modelos y herramientas de IA generativa más recientes.
- Usa de manera gratuita más de 20 productos populares, incluidos Compute Engine y las APIs de IA.
- No tendrás cargos automáticos ni compromisos.
Sigue explorando con más de 20 productos siempre gratuitos.
Accede a más de 20 productos gratuitos para casos de uso comunes, incluidas las APIs de IA, las VMs, los almacenes de datos y mucho más.
Recursos de documentación
Ejecuta soluciones de IA
- Concepto
- Concepto
- Instructivo
- Instructivo
- Instructivo
- Instructivo
- Instructivo
- Instructivo
- Concepto
- Concepto
- Instructivo
- Instructivo
Inferencia con GPUs
- Instructivo
- Instructivo
- Instructivo
- Práctica recomendada
- Instructivo
- Instructivo
- Práctica recomendada
- Práctica recomendada
Solucionar problemas
- Concepto
- Instructivo
- Instructivo
- Instructivo
Recursos relacionados
Ejecuta de forma segura el código generado por IA en zonas de pruebas de Cloud Run
Ejecuta código no confiable generado por IA de forma segura implementando zonas de pruebas de Cloud Run que ejecuten entornos de ejecución dentro de contenedores aislados basados en gVisor.
Guía para el inicio en frío de la IA en Cloud Run
Optimiza la latencia de inicio en frío para la inferencia de LLM en contenedores en Cloud Run con parámetros de configuración sin servidores y el ajuste del patrón de diseño de la arquitectura.
Protección de agentes de IA con autorización de MCP
Configura y aplica reglas de autorización del Protocolo de contexto del modelo (MCP) para proteger la conectividad de herramientas remotas para los agentes de IA implementados en Cloud Run.
AI Studio desbloquea el vibe coding de pila completa con Cloud Run, Firebase y Cloud SQL, sin necesidad de tarjeta de crédito
Implementa aplicaciones de pila completa en Cloud Run directamente desde el modo de compilación de Google AI Studio con compatibilidad integrada para copias de seguridad de Firebase y Cloud SQL.
Ejecuta tus aplicaciones de inferencia de IA en Cloud Run con GPUs de NVIDIA
Usa las GPU NVIDIA L4 en Cloud Run para la inferencia de IA en tiempo real, incluidos los beneficios de inicio en frío rápido y reducción de escala a cero para los modelos de lenguaje grandes (LLM).
Cloud Run: La forma más rápida de llevar tus aplicaciones basadas en IA a producción
Aprende a usar Cloud Run para aplicaciones de IA listas para producción. En esta guía, se describen casos de uso, como la división del tráfico para las instrucciones de pruebas A/B, los patrones de RAG (generación mejorada por recuperación) y la conectividad con los almacenes de vectores.
Implementación de IA simplificada: Implementa tu app en Cloud Run desde AI Studio o agentes de IA compatibles con MCP
Implementación con un solo clic desde Google AI Studio en Cloud Run y el servidor de MCP (Protocolo de contexto del modelo) de Cloud Run para habilitar agentes de IA en IDEs o SDKs de agentes, y para implementar apps
Potencia Cloud Run con la potencia de las GPU: Una nueva era para las cargas de trabajo de IA
Integra las GPU NVIDIA L4 con Cloud Run para ofrecer LLM de manera rentable. En esta guía, se hace hincapié en la reducción de escala a cero y se proporcionan los pasos de implementación para modelos como Gemma 2 con Ollama.
¿Sigues empaquetando modelos de IA en contenedores? En su lugar, haz lo siguiente en Cloud Run:
Desacopla los archivos de modelos grandes de la imagen del contenedor con Cloud Storage FUSE. El desacoplamiento mejora los tiempos de compilación, simplifica las actualizaciones y crea una arquitectura de publicación más escalable.
Empaqueta e implementa tus modelos de aprendizaje automático en Cloud Run con Cog
Usa el framework de Cog, que está optimizado para la entrega de AA, para simplificar el empaquetado y la implementación de contenedores en Cloud Run.
Implementación y supervisión de modelos de AA con Cloud Run: Ligero, escalable y rentable
Usa Cloud Run para la inferencia de AA liviana y compila una pila de supervisión rentable con servicios Google Cloud nativos, como Logging y BigQuery.