Elige el almacenamiento para las cargas de trabajo de agentes de IA

En este documento, se te ayudará a seleccionar una opción de almacenamiento adecuada para tus agentes de IA según sus necesidades específicas de ciclo de vida de los datos y requisitos de latencia.

Para obtener detalles sobre la implementación, consulta Cómo administrar el almacenamiento de la zona de pruebas del agente.

Consideraciones para elegir una solución de almacenamiento

Cuando elijas una solución de almacenamiento para tus agentes de IA, debes tener en cuenta los requisitos de la plataforma de agentes, como el rendimiento y la escala, y los requisitos de administración de datos de tus agentes.

Requisitos de la plataforma

Evalúa los siguientes requisitos operativos y de arquitectura de tu plataforma:

  • Escala de la plataforma y frecuencia de rotación de agentes (plano de control): Es la cantidad de agentes simultáneos y la cantidad de agentes creados, pausados, reactivados, y borrados por minuto. Las plataformas que crean miles de agentes por minuto o que pausan los agentes inactivos requieren almacenamiento con operaciones de conexión y activación de baja latencia a una escala significativa (por ejemplo, Filestore se activa más rápido de lo que Hyperdisk puede conectar).
  • Tamaño del conjunto de datos y latencia de carga (plano de datos): Los agentes que cargan conjuntos de datos de varios gigabytes o bibliotecas pesadas (como paquetes de Node.js o Python durante el inicio requieren un alto rendimiento de E/S de almacenamiento para leer los datos en segundos (por ejemplo, Hyperdisk ofrece una alta capacidad de procesamiento de lectura por disco).
  • Latencia de inicio en frío y reactivación del agente: Es la latencia esperada, como de menos de un segundo o de varios segundos. Para lograr una latencia de inicio de menos de un segundo, se requiere usar grupos de nodos activos de la zona de pruebas del agente de GKE. Por lo general, el uso de la creación de la zona de pruebas directa genera una demora de varios segundos para el inicio del pod y la conexión dinámica del disco.
  • Tamaño de almacenamiento por agente: Según el servicio elegido, debes tener en cuenta los límites de aprovisionamiento, como un tamaño mínimo de 4 GiB para Google Cloud Hyperdisk o un mínimo de 10 GiB para un solo recurso compartido de Filestore.
  • Modos de acceso a los datos y aislamiento: Es la forma en que la plataforma debe admitir el aislamiento del espacio de trabajo y los espacios de trabajo colaborativos. Esto determina si tus agentes necesitarán espacios de trabajo aislados privados (ReadWriteOnce), espacios de trabajo colaborativos (ReadWriteMany) o espacios de trabajo de bifurcación de exploración (plantilla de solo lectura con un bloc de notas grabable).
  • Resiliencia: Si tus agentes requieren específicamente resiliencia regional, la opción adecuada es Filestore Multishares para GKE (Enterprise).
  • Costo de almacenamiento: Los servicios de almacenamiento varían significativamente en precio, y Hyperdisk Balanceado ofrece una opción rentable en comparación con Filestore Multishares.

Patrones del ciclo de vida de los datos del agente

Cuando decidas cómo tu solución controla los datos persistentes y efímeros, ten en cuenta los siguientes patrones del ciclo de vida de los datos del agente:

  • Espacio de trabajo con estado (estado continuo): El espacio de trabajo mantiene un estado continuo en todas las sesiones. El agente conserva sus datos cuando se pausa (se borra la zona de pruebas del agente) y restablece esos datos desde el estado guardado más reciente cuando se reactiva (se vuelve a crear la zona de pruebas).
  • Restablecimiento a un momento determinado y transferencia de propiedad (estado de instantánea): el espacio de trabajo actúa como un estado de instantánea, lo que significa que se bifurca desde un momento determinado inmovilizado. El espacio de trabajo se inicializa desde un conjunto de datos histórico o el estado compartido de otro usuario para ejecutar una transferencia de propiedad. Las modificaciones posteriores se guardan en una capa grabable privada independiente, lo que deja intacta la copia maestra. Este patrón es útil para situaciones como clonar un conjunto de datos para ejecutar experimentos paralelos, depurar o realizar trabajos independientes basados en datos compartidos.
  • Espacio de trabajo efímero (estado de borrador): El espacio de trabajo proporciona un estado de borrador temporal en el que no se conservan datos. El agente usa un volumen de almacenamiento estrictamente para contener archivos temporales mientras está activo. Cuando el agente se pausa o se borra (se borra la zona de pruebas del agente), los datos temporales se descartan de forma permanente.

Modos de acceso a los datos del agente

Elige un servicio de almacenamiento que admita las necesidades de tus agentes si necesitan acceder al almacenamiento en uno de estos modos de acceso a los datos:

  • Espacio de trabajo aislado privado: Un agente se inicia con un directorio de almacenamiento aislado privado al que tiene acceso exclusivo de lectura y escritura.
  • Espacio de trabajo colaborativo: Varios agentes de coordinación activan exactamente el mismo directorio compartido en modo de lectura y escritura (RW) para actualizar archivos de forma colaborativa en tiempo real.
  • Espacio de trabajo de bifurcación de exploración: el agente accede a los archivos de plantilla base en modo de solo lectura (RO) para evitar alterar la plantilla y realiza escrituras nuevas enrutándolas a un bloc de notas emptyDir local independiente o a una ruta persistente privada, o bien copiando los archivos de plantilla directamente en un espacio de trabajo grabable privado durante el inicio.

Compara las opciones de almacenamiento para las zonas de pruebas del agente

Ten en cuenta las siguientes situaciones para ayudarte a comparar tus opciones de almacenamiento:

  • Usa Hyperdisk Balanceado para obtener almacenamiento rentable para los agentes que toleran una latencia de inicio de unos segundos y usan un espacio de trabajo aislado privado con el modo de acceso ReadWriteOnce (RWO).
  • Usa Filestore Multishares para GKE (Enterprise) para los agentes que requieren un espacio de trabajo colaborativo o resiliencia regional.

En la siguiente tabla, se comparan los servicios de almacenamiento para ayudarte a cumplir con los requisitos de rendimiento, escala, acceso a los datos y costo de tus agentes de IA.

Función Hiperdisco balanceado Filestore Multishares para GKE (Enterprise)
Ideal para
  • Espacios de trabajo individuales con modo de acceso ReadWriteOnce (RWO)
  • Cargas de trabajo que toleran la latencia de conexión de almacenamiento de varios segundos
  • Rentabilidad
  • Creación directa de la zona de pruebas
  • Espacios de trabajo colaborativos con modo de acceso ReadWriteMany (RWX)
  • Cargas de trabajo que requieren latencia de conexión de almacenamiento de menos de un segundo
  • Resiliencia regional
Modos de acceso ReadWriteOnce (RWO)

Nota: Usa Hyperdisk ML para el modo ReadOnlyMany (ROX).
ReadWriteMany (RWX)
Inicio de la zona de pruebas del agente de menos de un segundo (grupos de nodos activos)
  • Espacio de trabajo efímero: Se puede conectar previamente un volumen vacío durante la creación y destruirlo después de que finalice la sesión activa.
  • Espacio de trabajo con estado o restablecimiento a un momento determinado: Requiere secuencias de comandos personalizadas y un DaemonSet para la vinculación dinámica de volúmenes (ejemplo en GitHub).
  • Espacio de trabajo efímero: Se puede conectar previamente un volumen vacío durante la creación y destruirlo después de que finalice la sesión activa.
  • Espacio de trabajo con estado o restablecimiento a un momento determinado: Requiere secuencias de comandos personalizadas y un DaemonSet para la vinculación dinámica de volúmenes (ejemplo en GitHub).
Latencia de aprovisionamiento de almacenamiento Varios segundos por volumen
  • Seis minutos para crear una instancia con hasta 80 recursos compartidos
  • Se pueden crear varias instancias en paralelo
Latencia de conexión y activación de ruta directa Varios segundos para la conexión del disco Menos de un segundo para la activación de NFS de red
Capacidad de procesamiento de lectura máxima
  • 2,400 MiB/s por disco
  • La capacidad de procesamiento está limitada por el límite de hardware físico del dispositivo conectado.
  • 120 MiB/s por 1 TiB de capacidad aprovisionada
  • La capacidad de procesamiento está limitada a 1,200 MiB/s para una instancia de recursos compartidos de 10 TiB de capacidad máxima.
IOPS De 3,000 a 160,000, según el tamaño y la configuración del volumen
  • IOPS de lectura: 12,000 IOPS de lectura por 1 TiB de capacidad de instancia (máximo de 120,000 IOPS de lectura)
  • IOPS de escritura: 4,000 IOPS de escritura por 1 TiB de capacidad de instancia (máximo de 40,000 IOPS de escritura)
Límites de tamaño
  • Por disco: Mínimo de 4 GiB, máximo de 64 TiB (128 TiB en C4)
  • Por nodo: Máximo de 247 TiB para menos de 32 CPU virtuales o 512 TiB para 32 o más CPU virtuales
Límites de escala
  • Por nodo: Sin límites de conexión
  • Por instancia de recursos compartidos: Máximo de 80 recursos compartidos y hasta 20,000 conexiones (2,000 por 1 TiB, escalamiento en incrementos de 500)
Dirección de escalamiento de la capacidad Solo escala verticalmente Escala verticalmente o horizontalmente
Compatibilidad con VolumeSnapshot de CSI Admitido No admitido (no se admiten las instantáneas por recurso compartido)
Precio Precios de Persistent Disk y Google Cloud Hyperdisk Cloud Precios de Filestore

¿Qué sigue?