Aloja agentes de IA en recursos de Cloud Run

En esta página, se destacan los casos de uso para alojar agentes de IA en Cloud Run.

Los agentes de IA son entidades de software autónomas que usan sistemas potenciados por LLM para percibir, decidir y actuar para lograr objetivos. A medida que se crean más agentes autónomos, su capacidad de comunicarse y colaborar se vuelve crucial.

Para obtener una introducción a los agentes de IA, consulta ¿Qué es un agente de IA?.

Elige un recurso de Cloud Run

Según tu diseño de agente, puedes ejecutar el contenedor de agente como uno de los siguientes tipos de recursos de Cloud Run:

  • Servicios: Es mejor para los agentes sin estado y basados en solicitudes que controlan el tráfico de usuarios variable, se benefician del ajuste de escala automático y pueden reducirse a cero cuando están inactivos. Algunos ejemplos incluyen las APIs de chatbot y los backends de la API web.
  • Instancias: Es mejor para los bucles de agentes singleton dedicados, con estado y siempre activos que requieren comandos de estado del ciclo de vida similares a los de las VM. Algunos ejemplos incluyen agentes personales como OpenClaw y Hermes.
  • Grupos de trabajadores: Es mejor para ejecutar flotas de agentes distribuidas en segundo plano que consumen tareas de colas de mensajes, como Kafka o Pub/Sub, y se escalan horizontalmente sin exponer extremos HTTP públicos.
  • Trabajos: Es mejor para los flujos de trabajo de agentes que se ejecutan hasta completarse, como las evaluaciones por lotes, las canalizaciones de transferencia de datos a gran escala o las secuencias de comandos de sincronización programadas.

Elige tu framework de agente

Antes de implementar tu agente en Cloud Run, elige y configura tu framework de agente de forma local o en tu plataforma de desarrollo. Algunos ejemplos de frameworks de agentes incluyen el Kit de desarrollo de agentes (ADK), Dify, LangGraph y n8n.

En Cloud Run, tu código suele ejecutarse como un service o instance. Ambos tipos de recursos ejecutan instancias de contenedores en zona de pruebas en el mismo entorno de ejecución y se integran con Google Cloud services.

Arquitectura de agentes de IA en Cloud Run

Una arquitectura típica de agente de IA implementada en Cloud Run puede incluir varios componentes de Google Cloud así como de fuera de Google Cloud. La siguiente arquitectura muestra un ejemplo de implementación de un agente de IA como un servicio de Cloud Run para organizar un conjunto de tareas asíncronas y proporcionar información a través de múltiples interacciones de solicitud-respuesta.

Los cuatro componentes del agente de IA alojado en Cloud Run.
Figura 1. Arquitectura de un agente de IA en Cloud Run

En el diagrama se muestra lo siguiente:

  • Plataforma de alojamiento: Un servicio de Cloud Run es un extremo de API escalable para la lógica central de tu aplicación. Administra de manera eficiente varios usuarios simultáneos a través del ajuste de escala automático, a pedido y rápido de las instancias. Cloud Run ofrece los siguientes beneficios:

    • Admite la ejecución de cualquier framework de agente para compilar diferentes tipos de agentes y arquitecturas de agentes.
    • Compatibilidad integrada con Agent Identity. Asigna una identidad única y verificable de forma criptográfica a tu agente para llamar a Google Cloud APIs, herramientas y conectarse de forma segura a otros agentes. Para obtener más información, consulta Configura las funciones de la plataforma de agentes.
    • Integración integrada con Agent Registry. Designa tus servicios implementados como un agente o un servidor de MCP para el descubrimiento automático y los mecanismos sólidos de autenticación de agente a agente (A2A). Para obtener más información, consulta Configura las funciones de la plataforma de agentes.
    • Admite la conexión de tu framework de agente a otros servicios. Puedes conectar tu agente a herramientas propias o de terceros implementadas en Cloud Run. Por ejemplo, para obtener visibilidad de las tareas y ejecuciones de tu agente, puedes implementar y usar herramientas como Langfuse y Arize.
  • Interacciones del agente: Cloud Run admite la transmisión de respuestas HTTP al usuario y WebSockets para interacciones en tiempo real.

  • Modelos de IA generativa: La capa de organización llama a los modelos para obtener capacidades de razonamiento.Estos modelos se pueden alojar en servicios, como los siguientes:

  • Memoria: Los agentes suelen necesitar memoria para conservar el contexto y aprender de las interacciones anteriores. Puedes usar los siguientes servicios:

    • Memorystore para Redis para la memoria a corto plazo.
    • Firestore para la memoria a largo plazo, como almacenar el historial de conversaciones o recordar las preferencias del usuario en función de los datos sin procesar
    • Memory Bank de Agent Runtime para la memoria personalizada a largo plazo. Esta función extrae automáticamente del historial de conversaciones del usuario para recordar y actualizar sus preferencias con el tiempo. Ten en cuenta que debes crear al menos una instancia de Agent Engine para usar esta función con Cloud Run.
  • Base de datos de vectores: Para la Generación aumentada por recuperación (RAG) o la recuperación de datos estructurados, usa una base de datos de vectores para consultar información específica de la entidad o realizar una búsqueda de vectores en los embeddings. Usa la extensión pgvector con los siguientes servicios:

  • Herramientas: El organizador usa herramientas para realizar tareas específicas para interactuar con servicios, APIs o sitios web externos. Esto puede incluir lo siguiente:

    • Protocolo de contexto del modelo (MCP): Usa este protocolo estandarizado para comunicarte con herramientas externas que se ejecutan a través de un servidor de MCP.
    • Utilidades básicas: Cálculos matemáticos precisos, conversiones de tiempo o cualquier otra utilidad similar.
    • Llamadas a la API: Realiza llamadas a otras APIs internas o de terceros (acceso de lectura o escritura).
    • Generación de imágenes o gráficos: Crea contenido visual de forma rápida y eficaz.
    • Automatización del navegador y del SO: Ejecuta un sistema operativo sin interfaz gráfica o completo dentro de las instancias de contenedores para permitir que el agente navegue por la Web, extraiga información de sitios web o realice acciones con clics y entrada de teclado.
    • Ejecución de código: Ejecuta código en un entorno seguro con zona de pruebas de varias capas, con permisos de IAM mínimos o sin ellos.
    • Ejecución de código de Agent Runtime: Ejecuta código en entornos de zona de pruebas seguros, aislados y administrados que admiten entrada y salida de archivos, ejecución de código de menos de un segundo y memoria de larga duración. Ten en cuenta que debes crear al menos una instancia de Agent Runtime para usar esta función en Cloud Run.

¿Qué sigue?