Casos de uso de IA no Cloud Run

Se você está criando agentes, executando modelos de inferência ou fazendo a integração com vários serviços de IA, o Cloud Run oferece a escalonabilidade, a flexibilidade e a facilidade de uso necessárias para dar vida às suas inovações de IA.

Esta página destaca alguns casos de uso de alto nível para hospedar, criar e implantar cargas de trabalho de IA no Cloud Run.

Por que usar o Cloud Run para cargas de trabalho de IA?

O Cloud Run oferece várias vantagens para garantir que seus aplicativos de IA sejam escalonáveis, flexíveis e gerenciáveis. Alguns destaques incluem:

  • Suporte flexível a contêineres: empacote seu app e as dependências dele em um contêiner ou use qualquer linguagem, biblioteca ou framework com suporte. Saiba mais sobre o contrato de ambiente de execução de contêiner do Cloud Run.
  • Endpoint HTTP: depois de implantar um serviço ou instância do Cloud Run, receba um endpoint de URL do Cloud Run seguro e pronto para uso. O Cloud Run oferece streaming com suporte à codificação de transferência em partes HTTP, HTTP/2 e WebSockets.
  • Escalonamento automático ou manual: para serviços do Cloud Run, o Cloud Run escalona automaticamente seu serviço com base na demanda. Isso garante que você pague apenas pelo que usar, o que é ideal para cargas de trabalho de IA imprevisíveis. Também é possível definir o serviço para escalonamento manual com base nas necessidades de tráfego e utilização da CPU. Para instâncias do Cloud Run, o escalonamento automático não é aplicável. Elas são executadas como singletons que você inicia e interrompe manualmente.
  • Suporte a GPU: acelere seus modelos de IA configurando recursos do Cloud Run com GPUs. Os serviços do Cloud Run com GPUs ativadas podem reduzir escala vertical verticalmente para economia de custos quando não estiverem em uso.

  • Ecossistema integrado: conecte-se perfeitamente a outros Google Cloud serviços, como Vertex AI, BigQuery, Cloud SQL, Memorystore, Pub/Sub, AlloyDB para PostgreSQL, Cloud CDN, Secret Manager e domínios personalizados para criar pipelines de IA abrangentes de ponta a ponta. O Google Cloud Observability também oferece ferramentas integradas de monitoramento e geração de registros para entender o desempenho do aplicativo e solucionar problemas com eficiência.

Principais casos de uso de IA

Confira algumas maneiras de usar o Cloud Run para impulsionar seus aplicativos de IA:

Hospedar agentes e bots de IA

O Cloud Run é uma plataforma ideal para hospedar a lógica de back-end de agentes de IA, chatbots e assistentes virtuais. Esses agentes podem orquestrar chamadas para modelos de IA, como o Gemini na Vertex AI, gerenciar o estado e fazer a integração com várias ferramentas e APIs.

  • Microsserviços para agentes: implante recursos de agentes individuais como serviços ou instâncias separados do Cloud Run. Consulte Hospedar agentes de IA para saber mais.
  • Comunicação Agent2Agent (A2A): crie sistemas de agentes colaborativos usando o protocolo A2A. Consulte Hospedar agentes A2A para saber mais.
  • Servidores do Protocolo de Contexto de Modelo (MCP): implemente servidores MCP para fornecer contexto padronizado para LLMs das suas ferramentas e fontes de dados. Consulte Hospedar servidores MCP para saber mais.

Disponibilizar modelos de IA/ML para inferência

Implante seus modelos de machine learning treinados como endpoints HTTP escalonáveis.

  • Inferência em tempo real: disponibilize previsões de modelos criados com frameworks como TensorFlow, PyTorch, scikit-learn ou usando modelos abertos como o Gemma. Consulte Executar o Gemma 3 no Cloud Run para conferir um exemplo.
  • Aceleração de GPU: use GPUs NVIDIA para acelerar a inferência de modelos mais exigentes. Consulte Configurar GPU para serviços para saber mais.
  • Fazer a integração com a Vertex AI: disponibilize modelos treinados ou implantados na Vertex AI, usando o Cloud Run como um front-end escalonável.
  • Desacoplar arquivos de modelos grandes do contêiner: o adaptador Cloud Storage FUSE permite montar um bucket do Cloud Storage e o torna acessível como um diretório local dentro do contêiner do Cloud Run.

Criar sistemas de geração aumentada por recuperação (RAG)

Crie aplicativos RAG conectando serviços ou instâncias do Cloud Run às suas fontes de dados.

  • Bancos de dados de vetores: conecte-se a bancos de dados de vetores hospedados no Cloud SQL (com pgvector), AlloyDB para PostgreSQL, Memorystore for Redis ou outros repositórios de vetores especializados para recuperar o contexto relevante para seus LLMs. Consulte um exemplo de infraestrutura de uso do Cloud Run para hospedar um aplicativo de IA generativa com capacidade de RAG e processamento de dados usando a Vertex AI e a busca vetorial.
  • Acesso aos dados: busque dados do Cloud Storage, BigQuery, Firestore ou outras APIs para enriquecer comandos.

Hospedar APIs e back-ends com tecnologia de IA

Crie APIs e microsserviços que incorporam recursos de IA.

  • APIs inteligentes: desenvolva APIs que usam LLMs para compreensão de linguagem natural , análise de sentimentos, tradução, resumo e assim por diante.
  • Fluxos de trabalho automatizados: crie serviços que acionam ações orientadas por IA com base em eventos ou solicitações.

Criar protótipos e experimentar ideias

Faça iterações rápidas em ideias de IA.

  • Implantação rápida: mova rapidamente protótipos de ambientes como o Vertex AI Studio, o Google AI Studio, ou notebooks Jupyter para implantações escalonáveis no Cloud Run com configuração mínima.
  • Divisão de tráfego: use o recurso de divisão de tráfego do Cloud Run para fazer testes A/B de diferentes modelos, comandos ou configurações e o Google Cloud Observability para monitorar métricas (latência, taxa de erros, custo) para medir o sucesso do teste A/B.

A seguir

Dependendo da sua familiaridade com os conceitos de IA e do seu caso de uso de IA, explore os recursos de IA do Cloud Run.