Casos de uso de la IA en Cloud Run

Ya sea que compiles agentes, ejecutes modelos de inferencia o realices integraciones con varios servicios de IA, Cloud Run proporciona la escalabilidad, la flexibilidad y la facilidad de uso necesarias para hacer realidad tus innovaciones de IA.

En esta página, se destacan algunos casos de uso de alto nivel para alojar, compilar e implementar cargas de trabajo de IA en Cloud Run.

¿Por qué usar Cloud Run para cargas de trabajo de IA?

Cloud Run ofrece varias ventajas para garantizar que tus aplicaciones de IA sean escalables, flexibles y administrables. Algunos aspectos destacados incluyen los siguientes:

  • Compatibilidad flexible con contenedores: Empaqueta tu app y sus dependencias en un contenedor o usa cualquier lenguaje, biblioteca o framework compatible. Obtén más información sobre el contrato de tiempo de ejecución de contenedores de Cloud Run.
  • Extremo HTTP: Después de implementar un servicio o una instancia de Cloud Run, recibe un extremo de URL de Cloud Run seguro y listo para usar . Cloud Run proporciona transmisión a través de la compatibilidad con la codificación de transferencia fragmentada HTTP, HTTP/2 y WebSockets.
  • Ajuste de escala automático o manual: Para los servicios de Cloud Run, Cloud Run ajusta automáticamente la escala de tu servicio según la demanda. Esto garantiza que pagues solo por lo que usas, lo que lo hace ideal para cargas de trabajo de IA impredecibles. También puedes configurar tu servicio para que se ajuste de escala de forma manual según tus necesidades de tráfico y uso de CPU. Para las instancias de Cloud Run, el ajuste de escala automático no es aplicable; se ejecutan como singleton que inicias y detienes de forma manual.
  • Compatibilidad con GPU: Acelera tus modelos de IA configurando recursos de Cloud Run con GPUs. Los servicios de Cloud Run con GPUs habilitadas pueden reducir la escala verticalmente a cero para ahorrar costos cuando no están en uso.

  • Ecosistema integrado: Conéctate sin problemas a otros Google Cloud servicios, como Vertex AI, BigQuery, Cloud SQL, Memorystore, Pub/Sub, AlloyDB para PostgreSQL, Cloud CDN, Secret Manager y dominios personalizados para compilar canalizaciones de IA integrales de extremo a extremo. Google Cloud Observability también proporciona herramientas integradas de supervisión y registro para comprender el rendimiento de las aplicaciones y solucionar problemas de manera eficaz.

Casos de uso clave de la IA

Estas son algunas formas en las que puedes usar Cloud Run para potenciar tus aplicaciones de IA:

Aloja agentes y bots de IA

Cloud Run es una plataforma ideal para alojar la lógica de backend de agentes de IA, chatbots y asistentes virtuales. Estos agentes pueden organizar llamadas a modelos de IA como Gemini en Vertex AI, administrar el estado y realizar integraciones con varias herramientas y APIs.

  • Microservicios para agentes: Implementa capacidades de agentes individuales como servicios o instancias de Cloud Run independientes. Consulta Aloja agentes de IA para obtener más información.
  • Comunicación Agent2Agent (A2A): Compila sistemas de agentes colaborativos con el protocolo A2A. Consulta Aloja agentes de A2A para obtener más información.
  • Servidores del Protocolo de contexto del modelo (MCP): Implementa servidores de MCP para proporcionar contexto estandarizado a los LLMs desde tus herramientas y fuentes de datos. Consulta Aloja servidores de MCP para obtener más información.

Protege los agentes de IA

Cloud Run se integra en Agent Platform para proporcionar capacidades integradas para agentes de IA, servidores de MCP y herramientas.

  • Identidades de agentes: Asigna credenciales de identidad de agente administradas por el sistema a tus cargas de trabajo de Cloud Run para autenticarte en las Google Cloud APIs, otros agentes y servidores de MCP sin claves estáticas. Consulta Autentica tus agentes.
  • Registro de agentes: Registra automáticamente tus agentes y herramientas en el registro de agentes de tu organización para conectarte de forma segura a otros desarrolladores y agentes. Consulta Configura las funciones de Agent Platform para Cloud Run.
  • Servidores y herramientas de MCP: Protege los servidores de MCP implementados en Cloud Run con la autenticación de Identity-Aware Proxy y los controles de acceso detallados. Consulta Autentica servidores de MCP.

Entrega modelos de IA/AA para la inferencia

Implementa tus modelos de aprendizaje automático entrenados como extremos HTTP escalables.

  • Inferencia en tiempo real: Entrega predicciones de modelos compilados con frameworks como TensorFlow, PyTorch, scikit-learn o con modelos abiertos como Gemma. Consulta Ejecuta Gemma 3 en Cloud Run para ver un ejemplo.
  • Aceleración de GPU: Usa GPUs de NVIDIA para acelerar la inferencia de modelos más exigentes. Consulta Configura la GPU para los servicios para obtener más información.
  • Realiza integraciones con Vertex AI: Entrega modelos entrenados o implementados en Vertex AI con Cloud Run como un frontend escalable.
  • Desvincula archivos de modelos grandes de tu contenedor: El adaptador Cloud Storage FUSE te permite activar un bucket de Cloud Storage y hacerlo accesible como un directorio local dentro de tu contenedor de Cloud Run.

Compila sistemas de Generación mejorada por recuperación (RAG)

Compila aplicaciones de RAG conectando servicios o instancias de Cloud Run a tus fuentes de datos.

  • Bases de datos vectoriales: Conéctate a bases de datos vectoriales alojadas en Cloud SQL (con pgvector), AlloyDB para PostgreSQL, Memorystore para Redis o en otras tiendas de vectores especializadas para recuperar el contexto pertinente para tus LLMs. Consulta un ejemplo de infraestructura del uso de Cloud Run para alojar una aplicación de IA generativa compatible con RAG y el procesamiento de datos con Vertex AI y Vector Search.
  • Acceso a los datos: Recupera datos de Cloud Storage, BigQuery, Firestore o de otras APIs para enriquecer las instrucciones.

Aloja APIs y backends potenciados por IA

Crea APIs y microservicios que incorporen capacidades de IA.

  • APIs inteligentes: Desarrolla APIs que usen LLMs para la comprensión del lenguaje natural, el análisis de sentimiento, la traducción, la generación de resúmenes, etcétera.
  • Flujos de trabajo automatizados: Compila servicios que activen acciones basadas en IA según eventos o solicitudes.

Crea prototipos y experimenta con ideas

Itera rápidamente sobre las ideas de IA.

  • Implementación rápida: Mueve rápidamente prototipos de entornos como Vertex AI Studio, Google AI Studio, o notebooks de Jupyter a implementaciones escalables en Cloud Run con una configuración mínima.
  • División del tráfico: Usa la función de división del tráfico de Cloud Run para realizar pruebas A/B de diferentes modelos, instrucciones o configuraciones, y Google Cloud Observability para supervisar las métricas (latencia, tasa de errores, costo) y medir el éxito de las pruebas A/B.

¿Qué sigue?

Según tu familiaridad con los conceptos de IA y tu caso de uso de IA, explora los recursos de IA de Cloud Run.