Scegliere l'archiviazione per i workload agentici di AI

Questo documento ti aiuta a selezionare un'opzione di archiviazione appropriata per i tuoi agenti AI in base alle loro esigenze specifiche di ciclo di vita dei dati e ai requisiti di latenza.

Per i dettagli relativi all'implementazione, consulta Gestire lo spazio di archiviazione della sandbox dell'agente.

Considerazioni per la scelta di una soluzione di archiviazione

Quando scegli una soluzione di archiviazione per i tuoi agenti AI, devi considerare i requisiti della piattaforma agentica, come prestazioni e scalabilità, e i requisiti di gestione dei dati degli agenti.

Requisiti della piattaforma

Valuta i seguenti requisiti operativi e architetturali della tua piattaforma:

  • Scalabilità della piattaforma e frequenza di churn degli agenti (control plane): il numero di agenti simultanei e il numero di agenti creati, messi in pausa, riattivati, ed eliminati al minuto. Le piattaforme che creano migliaia di agenti al minuto o che mettono in pausa gli agenti inattivi richiedono uno spazio di archiviazione con operazioni di collegamento e montaggio a bassa latenza su una scala significativa (ad esempio, Filestore si monta più velocemente di quanto Hyperdisk possa collegarsi).
  • Dimensioni del set di dati e latenza di caricamento (data plane): gli agenti che caricano set di dati di più gigabyte o librerie pesanti (come pacchetti Node.js o Python ) durante l'avvio richiedono prestazioni di I/O di archiviazione elevate per la lettura dei dati in pochi secondi (ad esempio, Hyperdisk offre un throughput di lettura elevato per disco).
  • Latenza di avvio a freddo e riattivazione dell'agente: la latenza prevista, ad esempio in pochi secondi o in più secondi. Per ottenere una latenza di avvio in pochi secondi, è necessario utilizzare i pool di calore della sandbox dell'agente GKE. In genere, la creazione della sandbox diretta comporta un ritardo di più secondi per l'avvio del pod e il collegamento dinamico del disco.
  • Dimensioni dello spazio di archiviazione per agente: a seconda del servizio scelto, devi rispettare i limiti di provisioning, ad esempio una dimensione minima di 4 GiB per Google Cloud Hyperdisk o un minimo di 10 GiB per una singola condivisione Filestore.
  • Modalità di accesso ai dati e isolamento: in che modo la piattaforma deve supportare l'isolamento dello spazio di lavoro e gli spazi di lavoro collaborativi. Questo determina se gli agenti avranno bisogno di spazi di lavoro privati isolati (ReadWriteOnce), spazi di lavoro collaborativi (ReadWriteMany) o spazi di lavoro di ramificazione di esplorazione (modello di sola lettura con un blocco appunti scrivibile).
  • Resilienza: se gli agenti richiedono specificamente la resilienza regionale, Filestore Multishares per GKE (Enterprise) è la scelta appropriata.
  • Costo dello spazio di archiviazione: i servizi di archiviazione variano notevolmente in termini di prezzo, con Hyperdisk bilanciato che offre un'opzione conveniente rispetto a Filestore Multishares.

Pattern del ciclo di vita dei dati degli agenti

Quando decidi in che modo la tua soluzione gestisce i dati permanenti e temporanei, tieni presente i seguenti pattern del ciclo di vita dei dati degli agenti:

  • Spazio di lavoro stateful (stato continuo): lo spazio di lavoro mantiene uno stato continuo tra le sessioni. L'agente conserva i dati quando viene messo in pausa (la sandbox dell'agente viene eliminata) e li ripristina dall'ultimo stato salvato quando viene riattivato (la sandbox viene ricreata).
  • Ripristino point-in-time e trasferimento della proprietà (stato snapshot): lo spazio di lavoro funge da stato snapshot, il che significa che si ramifica da un punto nel tempo bloccato. Lo spazio di lavoro viene inizializzato da un set di dati storico o dallo stato condiviso di un altro utente, per eseguire un trasferimento della proprietà. Le modifiche successive vengono salvate in un livello scrivibile privato separato, lasciando intatta la copia principale. Questo pattern è utile per scenari come la clonazione di un set di dati per eseguire esperimenti paralleli, il debug o l'esecuzione di lavori indipendenti basati su dati condivisi.
  • Spazio di lavoro temporaneo (stato scratch): lo spazio di lavoro fornisce uno stato scratch temporaneo in cui non vengono conservati i dati. L'agente utilizza un volume di archiviazione esclusivamente per contenere i file temporanei mentre è attivo. Quando l'agente viene messo in pausa o eliminato (eliminazione della sandbox dell'agente), i dati temporanei vengono eliminati definitivamente.

Modalità di accesso ai dati degli agenti

Scegli un servizio di archiviazione che supporti le esigenze dei tuoi agenti se devono accedere allo spazio di archiviazione in una di queste modalità di accesso ai dati:

  • Spazio di lavoro privato isolato: un agente si avvia con una directory di archiviazione privata isolata a cui ha accesso in lettura e scrittura.
  • Spazio di lavoro collaborativo: più agenti di coordinamento montano esattamente la stessa directory condivisa in modalità di lettura/scrittura (RW) per aggiornare in modo collaborativo i file in tempo reale.
  • Spazio di lavoro di ramificazione di esplorazione: l'agente accede ai file del modello di base in modalità di sola lettura (RO) per evitare di modificare il modello ed esegue nuove scritture indirizzandole a un blocco appunti emptyDir locale separato o a un percorso permanente privato oppure copiando i file del modello direttamente in uno spazio di lavoro scrivibile privato all'avvio.

Confrontare le opzioni di archiviazione per le sandbox degli agenti

Tieni presente i seguenti scenari per confrontare le opzioni di archiviazione:

  • Utilizza Hyperdisk bilanciato per uno spazio di archiviazione conveniente per gli agenti che tollerano una latenza di avvio di pochi secondi e utilizzano uno spazio di lavoro privato isolato con la modalità di accesso ReadWriteOnce (RWO).
  • Utilizza Filestore Multishares per GKE (Enterprise) per gli agenti che richiedono uno spazio di lavoro collaborativo o la resilienza regionale.

La seguente tabella confronta i servizi di archiviazione per aiutarti a soddisfare i requisiti di prestazioni, scalabilità, accesso ai dati e costi dei tuoi agenti AI.

Funzionalità Hyperdisk bilanciato Filestore Multishares per GKE (Enterprise)
Ideale per
  • Spazi di lavoro individuali con la modalità di accesso ReadWriteOnce (RWO)
  • Workload che tollerano la latenza di collegamento dello spazio di archiviazione di più secondi
  • Efficienza in termini di costi
  • Creazione diretta della sandbox
  • Spazi di lavoro collaborativi con la modalità di accesso ReadWriteMany (RWX)
  • Workload che richiedono una latenza di collegamento dello spazio di archiviazione di pochi secondi
  • Resilienza regionale
Modalità di accesso ReadWriteOnce (RWO)

Nota: utilizza Hyperdisk ML per la modalità ReadOnlyMany (ROX).
ReadWriteMany (RWX)
Avvio della sandbox dell'agente in pochi secondi (pool di calore)
  • Spazio di lavoro temporaneo:un volume vuoto può essere pre-collegato al momento della creazione ed eliminato al termine della sessione attiva.
  • Spazio di lavoro stateful o ripristino point-in-time: richiede script personalizzati e un DaemonSet per il binding dinamico dei volumi (esempio in GitHub).
  • Spazio di lavoro temporaneo:un volume vuoto può essere pre-collegato al momento della creazione ed eliminato al termine della sessione attiva.
  • Spazio di lavoro stateful o ripristino point-in-time: richiede script personalizzati e un DaemonSet per il binding dinamico dei volumi (esempio in GitHub).
Latenza di provisioning dello spazio di archiviazione Diversi secondi per volume
  • Sei minuti per creare un'istanza con un massimo di 80 condivisioni
  • È possibile creare più istanze in parallelo
Latenza di collegamento e montaggio del percorso hot Diversi secondi per il collegamento del disco Pochi secondi per il montaggio NFS di rete
Throughput massimo di lettura
  • 2400 MiB/s per disco
  • Il throughput è limitato dal limite hardware fisico del dispositivo collegato
  • 120 MiB/s per 1 TiB di capacità di cui è stato eseguito il provisioning
  • Il throughput è limitato a 1200 MiB/s per un'istanza di multishare con capacità massima di 10 TiB
IOPS Da 3000 a 160.000, a seconda delle dimensioni e della configurazione del volume
  • IOPS di lettura:12.000 IOPS di lettura per 1 TiB di capacità dell'istanza (massimo 120.000 IOPS di lettura)
  • IOPS di scrittura:4000 IOPS di scrittura per 1 TiB di capacità dell'istanza (massimo 40.000 IOPS di scrittura)
Limiti di dimensioni
  • Per disco: minimo 4 GiB, massimo 64 TiB (128 TiB su C4)
  • Per nodo: massimo 247 TiB per meno di 32 vCPU o 512 TiB per 32 o più vCPU
Limiti di scalabilità
  • Per nodo:nessun limite di collegamento
  • Per istanza di multishare:massimo 80 condivisioni e fino a 20.000 connessioni (2000 per 1 TiB, scalabilità con incrementi di 500)
Direzione di scalabilità della capacità Solo scalabilità verticale Scala in alto o in basso
Supporto di VolumeSnapshot CSI Supportato Non supportato (gli snapshot per condivisione non sono supportati)
Prezzo Prezzi di Persistent Disk e Google Cloud Hyperdisk Prezzi di Filestore

Passaggi successivi