为 AI 智能体工作负载选择存储

本文档可帮助您根据 AI 智能体的具体数据生命周期需求和延迟要求,为其选择合适的存储方案。

如需了解实现详细信息,请参阅管理智能体沙盒 存储空间

选择存储解决方案时的注意事项

为 AI 智能体选择存储解决方案时,您应考虑智能体平台要求(例如性能和规模)以及智能体的数据管理要求。

平台要求

评估平台的以下运营和架构要求:

  • 平台规模和智能体流失频率(控制平面): 并发智能体的数量,以及每分钟创建、暂停、重新激活 和删除的智能体数量。每分钟创建数千个智能体或暂停空闲智能体的平台需要以显著的规模进行低延迟的挂接和装载操作(例如,Filestore 的装载速度比 Hyperdisk 的挂接速度更快)。
  • 数据集大小和加载延迟时间(数据平面):智能体在启动期间加载 多 GB 数据集或大型库(例如 Node.js 或 Python 软件包)时,需要较高的存储 I/O 性能才能在几秒内读取 数据(例如,Hyperdisk 提供较高的 单磁盘读取吞吐量)。
  • 智能体冷启动和重新激活延迟时间:预期延迟时间,例如 亚秒级或多秒级。如需实现亚秒级启动延迟时间,需要 使用 GKE 智能体沙盒暖池。使用直接 沙盒创建通常 会导致 Pod 启动和动态磁盘挂接出现多秒延迟。
  • 每个智能体的存储空间大小:根据所选服务,您必须 满足预配限制,例如 Google Cloud Hyperdisk 的最小大小为 4 GiB,或者单个 Filestore 共享的最小大小为 10 GiB。
  • 数据访问权限模式和隔离:平台应如何支持工作区隔离和协作工作区。这决定了您的智能体是否需要私有隔离工作区 (ReadWriteOnce)、协作工作区 (ReadWriteMany) 或探索分支工作区(具有可写便签的只读模板)。
  • 弹性:如果您的智能体特别需要区域弹性, Filestore Multishares for GKE (Enterprise) 是合适的选择。
  • 存储费用:存储服务的价格差异很大,与 Filestore Multishares 相比, Hyperdisk Balanced 提供经济实惠的选项。

智能体数据生命周期模式

在决定解决方案如何处理永久性和临时性数据时,请考虑以下智能体数据生命周期模式:

  • 有状态工作区(连续状态):工作区 在会话之间保持连续状态。智能体在暂停(智能体沙盒被删除)时保留其数据,并在重新激活(沙盒被重新创建)时从最新保存的状态恢复该数据。
  • 时间点恢复和所有权转移(快照状态): 工作区充当快照状态,这意味着它从冻结的时间点分支出来。工作区从历史数据集或其他用户的共享状态初始化,以执行所有权转移。 后续修改将保存到单独的私有可写层,而不会触及主副本。此模式适用于以下场景:克隆数据集以运行并行实验、调试或基于共享数据执行独立工作。
  • 临时工作区(临时状态):工作区提供临时 临时状态,不保留任何数据。智能体仅在活跃时使用存储卷来保存临时文件。当智能体被暂停或删除(智能体沙盒删除)时,临时数据将被永久丢弃。

智能体数据访问模式

如果智能体需要以以下某种数据访问模式访问存储空间,请选择支持智能体需求的存储服务:

  • 私有隔离工作区:智能体启动时会使用一个私有隔离 存储目录,它对该目录具有唯一的读写权限。
  • 协作工作区:多个协调智能体以读写 (RW) 模式装载完全相同的共享目录,以实时协作更新文件。
  • 探索分支工作区:智能体以 只读 (RO) 模式访问基本模板文件,以避免更改模板,并通过以下方式进行新写入: 将写入路由到单独的本地 emptyDir 便签或私有 永久路径,或者在启动时将模板文件直接复制到私有 可写工作区。

比较智能体沙盒的存储方案

请考虑以下场景,以帮助您比较存储方案:

  • 对于可以容忍几秒启动延迟时间并使用具有 ReadWriteOnce (RWO) 访问模式的私有隔离工作区的智能体,请使用 Hyperdisk Balanced 以实现经济实惠的存储。
  • 对于需要协作工作区或区域弹性的智能体,请使用 Filestore Multishares for GKE (Enterprise)。

下表比较了存储服务,以帮助您满足 AI 智能体的性能、规模、数据访问权限和费用要求。

功能 Hyperdisk Balanced Filestore Multishares for GKE (Enterprise)
适用场景
  • 具有 ReadWriteOnce (RWO) 访问模式的个人工作区
  • 可以容忍多秒存储挂接延迟时间的工作负载
  • 经济实惠
  • 直接沙盒创建
  • 具有 ReadWriteMany (RWX) 访问模式的协作工作区
  • 需要亚秒级存储挂接延迟时间的工作负载
  • 区域弹性
访问模式 ReadWriteOnce (RWO)

注意 :对于 ReadOnlyMany (ROX) 模式,请使用 Hyperdisk ML
ReadWriteMany (RWX)
亚秒级智能体沙盒启动(暖池
  • 临时工作区 :可以在创建时预先挂接空卷,并在活跃会话结束后销毁。
  • 有状态工作区或时间点恢复:需要自定义脚本和 DaemonSet 进行动态卷绑定(GitHub 中的示例)。
  • 临时工作区 :可以在创建时预先挂接空卷,并在活跃会话结束后销毁。
  • 有状态工作区或时间点恢复:需要自定义脚本和 DaemonSet 进行动态卷绑定(GitHub 中的示例)。
存储预配延迟时间 每个卷几秒
  • 创建最多 80 个共享的实例需要 6 分钟
  • 可以并行创建多个实例
热路径挂接和装载延迟时间 磁盘挂接需要几秒 网络 NFS 装载需要亚秒级
读取吞吐量上限
  • 每个磁盘 2,400 MiB/秒
  • 吞吐量受所挂接设备的物理硬件限制
  • 每 1 TiB 预配容量 120 MiB/秒
  • 对于最大容量为 10 TiB 的多共享实例,吞吐量上限为 1,200 MiB/秒
IOPS 3,000 到 160,000,具体取决于卷大小和配置
  • 读取 IOPS :每 1 TiB 实例容量 12,000 次读取 IOPS(最多 120,000 次读取 IOPS)
  • 写入 IOPS :每 1 TiB 实例容量 4,000 次写入 IOPS(最多 40,000 次写入 IOPS)
大小限制
  • 每个磁盘:最小 4 GiB,最大 64 TiB(C4 上为 128 TiB)
  • 每个节点:少于 32 个 vCPU 时最多 247 TiB,或 32 个或更多 vCPU 时最多 512 TiB
规模限制
  • 每个节点:最多 128 个挂接的卷(因机器类型而异
  • 每个卷:对于 Google Cloud Hyperdisk ML,ROX 模式下最多 2,500 个实例
  • 每个节点 :无挂接限制
  • 每个多共享实例 :最多 80 个共享,最多 20,000 个连接(每 1 TiB 2,000 个,以 500 为增量进行伸缩)
容量伸缩方向 仅纵向扩容 纵向扩缩
CSI VolumeSnapshot 支持 支持 不支持(不支持按共享快照)
价格 Persistent Disk 和 Google Cloud Hyperdisk 价格 Filestore 价格

后续步骤