Este documento ajuda você a selecionar uma opção de armazenamento adequada para seus agentes de IA com base nas necessidades específicas de ciclo de vida de dados e nos requisitos de latência.
Para detalhes da implementação, consulte Gerenciar o armazenamento do sandbox do agente.
Considerações para escolher uma solução de armazenamento
Ao escolher uma solução de armazenamento para seus agentes de IA, considere os requisitos da plataforma agêntica, como desempenho e escalonamento, e os requisitos de gerenciamento de dados dos agentes.
Requisitos de plataforma
Avalie os seguintes requisitos operacionais e arquitetônicos da sua plataforma:
- Escala da plataforma e frequência de rotatividade de agentes (plano de controle): o número de agentes simultâneos e o número de agentes criados, pausados, reativados, e excluídos por minuto. As plataformas que criam milhares de agentes por minuto ou pausam agentes inativos exigem armazenamento com operações de montagem e anexação de baixa latência em uma escala significativa (por exemplo, o Filestore é montado mais rápido do que o Hyperdisk pode ser anexado).
- Tamanho do conjunto de dados e latência de carregamento (plano de dados): os agentes que carregam conjuntos de dados de vários gigabytes ou bibliotecas pesadas (como pacotes Node.js ou Python durante a inicialização exigem alto desempenho de E/S de armazenamento para ler os dados em segundos (por exemplo, o Hyperdisk oferece alta capacidade de leitura por disco).
- Latência de inicialização a frio e reativação do agente: a latência esperada, como subsegundo ou multissegundo. Para alcançar a latência de inicialização de subsegundo, é necessário usar pools quentes do GKE Agent Sandbox. O uso da criação de sandbox direta geralmente incorre em um atraso de vários segundos para a inicialização do pod e a anexação dinâmica do disco.
- Tamanho do armazenamento por agente: dependendo do serviço escolhido, você precisa acomodar limites de provisionamento, como um tamanho mínimo de 4 GiB para o Google Cloud Hyperdisk ou um mínimo de 10 GiB para um único compartilhamento do Filestore.
- Modos de acesso aos dados e isolamento: como a plataforma deve oferecer suporte ao isolamento do espaço de trabalho e aos espaços de trabalho colaborativos. Isso determina se os agentes vão precisar de espaços de trabalho isolados particulares (ReadWriteOnce), espaços de trabalho colaborativos (ReadWriteMany) ou espaços de trabalho de ramificação de exploração (modelo somente leitura com um bloco de rascunho gravável).
- Resiliência: se os agentes exigirem resiliência regional, os compartilhamentos múltiplos do Filestore para GKE (Enterprise) serão a escolha adequada.
- Custo de armazenamento: os serviços de armazenamento variam muito de preço, com o Hyperdisk Balanced oferecendo uma opção econômica em comparação com os compartilhamentos múltiplos do Filestore.
Padrões de ciclo de vida de dados do agente
Ao decidir como sua solução processa dados permanentes e temporários, considere os seguintes padrões de ciclo de vida de dados do agente:
- Espaço de trabalho com estado (estado contínuo): o espaço de trabalho mantém um estado contínuo entre as sessões. O agente preserva os dados quando é pausado (o sandbox do agente é excluído) e restaura esses dados do estado salvo mais recente quando reativado (o sandbox é recriado).
- Restauração pontual e transferência de propriedade (estado de snapshot): o espaço de trabalho atua como um estado de snapshot, o que significa que ele se ramifica de um ponto congelado no tempo. O espaço de trabalho é inicializado a partir de um conjunto de dados histórico ou do estado compartilhado de outro usuário para executar uma transferência de propriedade. As modificações subsequentes são salvas em uma camada gravável particular separada, deixando a cópia principal intacta. Esse padrão é útil para cenários como clonar um conjunto de dados para executar experimentos paralelos, depurar ou realizar trabalhos independentes com base em dados compartilhados.
- Espaço de trabalho temporário (estado de rascunho): o espaço de trabalho fornece um estado de rascunho temporário em que nenhum dado é preservado. O agente usa um volume de armazenamento estritamente para manter arquivos temporários enquanto está ativo. Quando o agente é pausado ou excluído (exclusão do sandbox do agente), os dados temporários são descartados permanentemente.
Modos de acesso aos dados do agente
Escolha um serviço de armazenamento que ofereça suporte às necessidades dos agentes se eles precisarem acessar o armazenamento em um destes modos de acesso a dados:
- Espaço de trabalho isolado particular: um agente é iniciado com um diretório de armazenamento isolado particular ao qual ele tem acesso exclusivo de leitura e gravação.
- Espaço de trabalho colaborativo: vários agentes de coordenação montam o mesmo diretório compartilhado no modo de leitura/gravação (RW) para atualizar arquivos de forma colaborativa em tempo real.
- Espaço de trabalho de ramificação de exploração: o agente acessa arquivos de modelo de base no
modo somente leitura (RO) para evitar alterar o modelo e faz novas gravações
roteando-as para um bloco de rascunho
emptyDirlocal separado ou um caminho permanente particular ou copiando os arquivos de modelo diretamente para um espaço de trabalho gravável particular na inicialização.
Comparar opções de armazenamento para sandboxes de agentes
Considere os cenários a seguir para comparar as opções de armazenamento:
- Use o Hyperdisk Balanced para armazenamento econômico de agentes que toleram uma latência de inicialização de alguns segundos e usam um espaço de trabalho isolado particular com o modo de acesso ReadWriteOnce (RWO).
- Use os compartilhamentos múltiplos do Filestore para GKE (Enterprise) para agentes que exigem um espaço de trabalho colaborativo ou resiliência regional.
A tabela a seguir compara os serviços de armazenamento para ajudar você a atender aos requisitos de desempenho, escala, acesso a dados e custo dos seus agentes de IA.
| Recurso | Hyperdisk Balanced | Compartilhamentos múltiplos do Filestore para GKE (Enterprise) |
|---|---|---|
| Ideal para |
|
|
| Modos de acesso |
ReadWriteOnce (RWO) Observação: use Hyperdisk ML para o modo ReadOnlyMany (ROX). |
ReadWriteMany (RWX) |
| Inicialização de sandbox de agente de subsegundo (pools quentes) |
|
|
| Latência de provisionamento de armazenamento | Vários segundos por volume |
|
| Latência de montagem e anexação de caminho quente | Vários segundos para anexação de disco | Subsegundo para montagem de NFS de rede |
| Capacidade máxima de leitura |
|
|
| IOPS | De 3.000 a 160.000, dependendo do tamanho e da configuração do volume |
|
| Limites de tamanho |
|
|
| Limites de escala |
|
|
| Direção de escalonamento de capacidade | Somente escalonamento vertical | Escalonamento vertical ou horizontal |
| Suporte a VolumeSnapshot da CSI | Com suporte | Indisponível (snapshots por compartilhamento não são compatíveis) |
| Preço | Preços do Persistent Disk e do Google Cloud Hyperdisk Cloud | Preços do Filestore |
A seguir
- Saiba mais sobre o GKE Agent Sandbox.
- Saiba como gerenciar o armazenamento de arquivos do sandbox do agente.