Escolher o armazenamento para cargas de trabalho de agentes de IA

Este documento ajuda você a selecionar uma opção de armazenamento adequada para seus agentes de IA com base nas necessidades específicas de ciclo de vida de dados e nos requisitos de latência.

Para detalhes da implementação, consulte Gerenciar o armazenamento do sandbox do agente.

Considerações para escolher uma solução de armazenamento

Ao escolher uma solução de armazenamento para seus agentes de IA, considere os requisitos da plataforma agêntica, como desempenho e escalonamento, e os requisitos de gerenciamento de dados dos agentes.

Requisitos de plataforma

Avalie os seguintes requisitos operacionais e arquitetônicos da sua plataforma:

  • Escala da plataforma e frequência de rotatividade de agentes (plano de controle): o número de agentes simultâneos e o número de agentes criados, pausados, reativados, e excluídos por minuto. As plataformas que criam milhares de agentes por minuto ou pausam agentes inativos exigem armazenamento com operações de montagem e anexação de baixa latência em uma escala significativa (por exemplo, o Filestore é montado mais rápido do que o Hyperdisk pode ser anexado).
  • Tamanho do conjunto de dados e latência de carregamento (plano de dados): os agentes que carregam conjuntos de dados de vários gigabytes ou bibliotecas pesadas (como pacotes Node.js ou Python durante a inicialização exigem alto desempenho de E/S de armazenamento para ler os dados em segundos (por exemplo, o Hyperdisk oferece alta capacidade de leitura por disco).
  • Latência de inicialização a frio e reativação do agente: a latência esperada, como subsegundo ou multissegundo. Para alcançar a latência de inicialização de subsegundo, é necessário usar pools quentes do GKE Agent Sandbox. O uso da criação de sandbox direta geralmente incorre em um atraso de vários segundos para a inicialização do pod e a anexação dinâmica do disco.
  • Tamanho do armazenamento por agente: dependendo do serviço escolhido, você precisa acomodar limites de provisionamento, como um tamanho mínimo de 4 GiB para o Google Cloud Hyperdisk ou um mínimo de 10 GiB para um único compartilhamento do Filestore.
  • Modos de acesso aos dados e isolamento: como a plataforma deve oferecer suporte ao isolamento do espaço de trabalho e aos espaços de trabalho colaborativos. Isso determina se os agentes vão precisar de espaços de trabalho isolados particulares (ReadWriteOnce), espaços de trabalho colaborativos (ReadWriteMany) ou espaços de trabalho de ramificação de exploração (modelo somente leitura com um bloco de rascunho gravável).
  • Resiliência: se os agentes exigirem resiliência regional, os compartilhamentos múltiplos do Filestore para GKE (Enterprise) serão a escolha adequada.
  • Custo de armazenamento: os serviços de armazenamento variam muito de preço, com o Hyperdisk Balanced oferecendo uma opção econômica em comparação com os compartilhamentos múltiplos do Filestore.

Padrões de ciclo de vida de dados do agente

Ao decidir como sua solução processa dados permanentes e temporários, considere os seguintes padrões de ciclo de vida de dados do agente:

  • Espaço de trabalho com estado (estado contínuo): o espaço de trabalho mantém um estado contínuo entre as sessões. O agente preserva os dados quando é pausado (o sandbox do agente é excluído) e restaura esses dados do estado salvo mais recente quando reativado (o sandbox é recriado).
  • Restauração pontual e transferência de propriedade (estado de snapshot): o espaço de trabalho atua como um estado de snapshot, o que significa que ele se ramifica de um ponto congelado no tempo. O espaço de trabalho é inicializado a partir de um conjunto de dados histórico ou do estado compartilhado de outro usuário para executar uma transferência de propriedade. As modificações subsequentes são salvas em uma camada gravável particular separada, deixando a cópia principal intacta. Esse padrão é útil para cenários como clonar um conjunto de dados para executar experimentos paralelos, depurar ou realizar trabalhos independentes com base em dados compartilhados.
  • Espaço de trabalho temporário (estado de rascunho): o espaço de trabalho fornece um estado de rascunho temporário em que nenhum dado é preservado. O agente usa um volume de armazenamento estritamente para manter arquivos temporários enquanto está ativo. Quando o agente é pausado ou excluído (exclusão do sandbox do agente), os dados temporários são descartados permanentemente.

Modos de acesso aos dados do agente

Escolha um serviço de armazenamento que ofereça suporte às necessidades dos agentes se eles precisarem acessar o armazenamento em um destes modos de acesso a dados:

  • Espaço de trabalho isolado particular: um agente é iniciado com um diretório de armazenamento isolado particular ao qual ele tem acesso exclusivo de leitura e gravação.
  • Espaço de trabalho colaborativo: vários agentes de coordenação montam o mesmo diretório compartilhado no modo de leitura/gravação (RW) para atualizar arquivos de forma colaborativa em tempo real.
  • Espaço de trabalho de ramificação de exploração: o agente acessa arquivos de modelo de base no modo somente leitura (RO) para evitar alterar o modelo e faz novas gravações roteando-as para um bloco de rascunho emptyDir local separado ou um caminho permanente particular ou copiando os arquivos de modelo diretamente para um espaço de trabalho gravável particular na inicialização.

Comparar opções de armazenamento para sandboxes de agentes

Considere os cenários a seguir para comparar as opções de armazenamento:

  • Use o Hyperdisk Balanced para armazenamento econômico de agentes que toleram uma latência de inicialização de alguns segundos e usam um espaço de trabalho isolado particular com o modo de acesso ReadWriteOnce (RWO).
  • Use os compartilhamentos múltiplos do Filestore para GKE (Enterprise) para agentes que exigem um espaço de trabalho colaborativo ou resiliência regional.

A tabela a seguir compara os serviços de armazenamento para ajudar você a atender aos requisitos de desempenho, escala, acesso a dados e custo dos seus agentes de IA.

Recurso Hyperdisk Balanced Compartilhamentos múltiplos do Filestore para GKE (Enterprise)
Ideal para
  • Espaços de trabalho individuais com o modo de acesso ReadWriteOnce (RWO)
  • Cargas de trabalho que toleram latência de anexação de armazenamento de vários segundos
  • Economia
  • Criação direta de sandbox
  • Espaços de trabalho colaborativos com o modo de acesso ReadWriteMany (RWX)
  • Cargas de trabalho que exigem latência de anexação de armazenamento de subsegundo
  • Resiliência regional
Modos de acesso ReadWriteOnce (RWO)

Observação: use Hyperdisk ML para o modo ReadOnlyMany (ROX).
ReadWriteMany (RWX)
Inicialização de sandbox de agente de subsegundo (pools quentes)
  • Espaço de trabalho temporário:um volume vazio pode ser pré-anexado na criação e destruído após o término da sessão ativa.
  • Espaço de trabalho com estado ou restauração pontual: requer scripts personalizados e um DaemonSet para vinculação dinâmica de volume (exemplo no GitHub).
  • Espaço de trabalho temporário:um volume vazio pode ser pré-anexado na criação e destruído após o término da sessão ativa.
  • Espaço de trabalho com estado ou restauração pontual: requer scripts personalizados e um DaemonSet para vinculação dinâmica de volume (exemplo no GitHub).
Latência de provisionamento de armazenamento Vários segundos por volume
  • Seis minutos para criar uma instância com até 80 compartilhamentos
  • Várias instâncias podem ser criadas em paralelo
Latência de montagem e anexação de caminho quente Vários segundos para anexação de disco Subsegundo para montagem de NFS de rede
Capacidade máxima de leitura
  • 2.400 MiB/s por disco
  • A capacidade de processamento é limitada pelo limite de hardware físico do dispositivo anexado
  • 120 MiB/s por 1 TiB de capacidade provisionada
  • A capacidade de processamento é limitada a 1.200 MiB/s para uma instância de compartilhamentos múltiplos de 10 TiB de capacidade máxima
IOPS De 3.000 a 160.000, dependendo do tamanho e da configuração do volume
  • IOPS de leitura:12.000 IOPS de leitura por 1 TiB de capacidade da instância (máximo de 120.000 IOPS de leitura)
  • IOPS de gravação:4.000 IOPS de gravação por 1 TiB de capacidade da instância (máximo de 40.000 IOPS de gravação)
Limites de tamanho
  • Por disco: mínimo de 4 GiB, máximo de 64 TiB (128 TiB no C4)
  • Por nó: máximo de 247 TiB para menos de 32 vCPUs ou 512 TiB para 32 ou mais vCPUs
Limites de escala
  • Por nó:sem limites de anexação
  • Por instância de compartilhamento múltiplo:máximo de 80 compartilhamentos e até 20.000 conexões (2.000 por 1 TiB, escalonamento em incrementos de 500)
Direção de escalonamento de capacidade Somente escalonamento vertical Escalonamento vertical ou horizontal
Suporte a VolumeSnapshot da CSI Com suporte Indisponível (snapshots por compartilhamento não são compatíveis)
Preço Preços do Persistent Disk e do Google Cloud Hyperdisk Cloud Preços do Filestore

A seguir