選擇 AI 代理工作負載的儲存空間

本文可協助您根據 AI 代理程式的特定資料生命週期需求和延遲時間需求,選取合適的儲存選項。

如要進一步瞭解實作方式,請參閱「管理 Agent Sandbox 儲存空間」。

選擇儲存空間解決方案時的考量事項

為 AI 代理程式選擇儲存空間解決方案時,請考量代理程式平台需求 (例如效能和規模),以及代理程式的資料管理需求。

平台需求條件

評估平台的下列作業和架構需求:

  • 平台規模和代理程式流失頻率 (控制層):每分鐘的並行代理程式數量,以及建立、暫停、重新啟用和刪除的代理程式數量。平台每分鐘建立數千個代理程式,或暫停閒置代理程式時,需要儲存空間,且必須在大量規模下以低延遲時間附加及掛接 (例如,Filestore 掛接速度比 Hyperdisk 附加速度快)。
  • 資料集大小和載入延遲時間 (資料層):代理程式在啟動期間載入數 GB 的資料集或大型程式庫 (例如 Node.js 或 Python 套件) 時,需要高儲存空間 I/O 效能,才能在幾秒內讀取資料 (例如,Hyperdisk 提供高單一磁碟讀取處理量)。
  • 代理程式冷啟動和重新啟動延遲:預期延遲時間,例如不到一秒或數秒。如要達到低於一秒的啟動延遲時間,請使用 GKE Agent Sandbox Warm Pools。一般來說,直接建立沙箱會導致 Pod 啟動和動態磁碟附加作業延遲數秒。
  • 每個代理程式的儲存空間大小:視所選服務而定,您必須配合佈建限制,例如 Google Cloud Hyperdisk 的大小下限為 4 GiB,單一 Filestore 共用的下限為 10 GiB。
  • 資料存取權模式和隔離:平台應如何支援工作區隔離和協作工作區。這會決定代理程式是否需要私密隔離的工作區 (ReadWriteOnce)、協作工作區 (ReadWriteMany),或是探索分支工作區 (具有可寫入的暫存區的唯讀範本)。
  • 復原能力:如果代理程式特別需要區域復原能力,請選擇 GKE 適用的 Filestore 多共用區 (Enterprise)
  • 儲存空間費用:儲存空間服務的價格差異很大,相較於 Filestore Multishares,Hyperdisk Balanced 提供經濟實惠的選項。

代理程式資料生命週期模式

決定解決方案如何處理持續性和暫時性資料時,請考慮下列代理程式資料生命週期模式:

  • 具狀態工作區 (連續狀態):工作區會在工作階段之間維持連續狀態。代理程式暫停時會保留資料 (代理程式沙箱會遭到刪除),並在重新啟動時從最新儲存狀態還原資料 (沙箱會重新建立)。
  • 時間點還原和擁有權轉移 (快照狀態):工作區會做為快照狀態,也就是從凍結的時間點分支出來。工作區會從歷來資料集或其他使用者的共用狀態初始化,以執行擁有權轉移作業。後續修改內容會儲存到另一個可寫入的私密圖層,不會影響原始副本。這個模式適用於各種情境,例如複製資料集以執行平行實驗、偵錯,或根據共用資料執行獨立作業。
  • 暫時性工作區 (暫存狀態):工作區提供暫時性暫存狀態,不會保留任何資料。代理程式會使用儲存空間磁碟區,嚴格控管活動期間的暫存檔案。暫停或刪除代理程式 (刪除代理程式沙箱) 時,系統會永久捨棄暫時資料。

代理資料存取權模式

如果代理程式需要以下列其中一種資料存取模式存取儲存空間,請選擇支援代理程式需求的儲存服務:

  • 私有隔離工作區:代理程式會啟動,並使用專屬的私有隔離儲存目錄,且只有代理程式能讀取及寫入該目錄。
  • 協作工作區:多個協調代理程式以讀寫 (RW) 模式掛載完全相同的共用目錄,即時協作更新檔案。
  • 探索分支工作區:代理程式會以唯讀 (RO) 模式存取基本範本檔案,避免變更範本,並透過將新寫入內容路徑導向至獨立的本機 emptyDir 暫存區或私人持續路徑,或在啟動時將範本檔案直接複製到私人可寫入工作區,進行新的寫入作業。

比較 Agent Sandbox 的儲存空間方案

請參考下列情境,比較各種儲存空間方案:

  • 如果代理程式可容許幾秒的啟動延遲,並使用具有 ReadWriteOnce (RWO) 存取模式的私人獨立工作區,建議使用 Hyperdisk Balanced,以經濟實惠的價格取得儲存空間。
  • 如果代理程式需要協作工作區或區域復原能力,請使用 GKE 適用的 Filestore 多共用區 (Enterprise)。

下表比較各項儲存空間服務,協助您滿足 AI 代理程式的效能、規模、資料存取權和成本需求。

功能 Hyperdisk Balanced GKE Enterprise 適用的 Filestore 多共用區
適用情境
  • 存取模式設為「ReadWriteOnce (RWO)」的個別工作區
  • 可容忍儲存空間附加延遲時間 (以秒為單位) 的工作負載
  • 具成本效益
  • 直接建立沙箱
  • 存取模式設為「ReadWriteMany (RWX)」的協作工作區
  • 需要不到一秒儲存空間附加延遲時間的工作負載
  • 區域韌性
存取模式 ReadWriteOnce (RWO)

注意:如要使用 ReadOnlyMany (ROX) 模式,請使用 Hyperdisk ML
ReadWriteMany (RWX)
在不到一秒內啟動 Agent Sandbox (Warm Pools)
  • 暫時性工作區:建立時可預先附加空白磁碟區,並在有效工作階段結束後刪除。
  • 有狀態的工作區或時間點還原:需要自訂指令碼和 DaemonSet,才能動態繫結磁碟區 (GitHub 範例)。
  • 暫時性工作區:建立時可預先附加空白磁碟區,並在有效工作階段結束後刪除。
  • 具狀態的工作區或時間點還原:需要自訂指令碼和 DaemonSet,才能動態繫結磁碟區 (GitHub 範例)。
儲存空間佈建延遲 每個磁碟區幾秒
  • 六分鐘內建立最多 80 個共用區的執行個體
  • 可並行建立多個執行個體
熱路徑連結和掛接延遲 磁碟附加作業需要幾秒鐘 網路 NFS 掛接的次秒級時間
讀取處理量上限
  • 每個磁碟 2,400 MiB/秒
  • 總處理量受限於所連裝置的實體硬體限制
  • 每 1 TiB 的佈建容量為 120 MiB/秒
  • 容量上限為 10 TiB 的多重共用執行個體,總處理量上限為 1,200 MiB/秒
IOPS 3,000 到 160,000,視容量大小和設定而定
  • 讀取 IOPS:每 1 TiB 執行個體容量 12,000 讀取 IOPS (最多 120,000 讀取 IOPS)
  • 寫入 IOPS:每 1 TiB 的執行個體容量為 4,000 寫入 IOPS (最多 40,000 寫入 IOPS)
大小限制
  • 每個磁碟最低 4 GiB,最高 64 TiB (C4 為 128 TiB)
  • 每個節點如果 vCPU 不足 32 個,則最多 247 TiB;如果 vCPU 達 32 個以上,則最多 512 TiB
擴充限制
  • 每個節點:最多可連接 128 個磁碟區 (視機型而定)
  • 每個磁碟區Google Cloud Hyperdisk ML 的 ROX 模式最多可有 2,500 個執行個體
  • 每個節點:無附件限制
  • 每個多重共用執行個體:最多 80 個共用項目,以及最多 20,000 個連線 (每 1 TiB 2,000 個,以 500 個為單位調整)
容量擴充方向 僅向上擴充 向上或向下擴充
支援 CSI VolumeSnapshot 支援 不支援 (不支援每個共用項目的快照)
價格 Persistent Disk 和 Google Cloud Hyperdisk 定價 Filestore 價格

後續步驟