選擇 AI 代理工作負載的儲存空間

本文可協助您根據 AI 代理程式的特定資料生命週期需求和延遲時間需求,選取合適的儲存空間選項。

如需實作詳細資料,請參閱「管理 Agent Sandbox 儲存空間」。

選擇儲存空間解決方案的注意事項

為 AI 代理程式選擇儲存空間解決方案時,請考量代理程式平台的需求 (例如效能和規模),以及代理程式的資料管理需求。

平台需求條件

評估平台的下列作業和架構需求:

  • 平台規模和代理流失頻率 (控制層):並行代理數量,以及每分鐘建立、暫停、重新啟用和刪除的代理數量。平台每分鐘建立數千個代理程式,或暫停閒置代理程式時,需要低延遲的附加和掛接作業,才能大規模儲存資料 (例如,Filestore 掛接速度比 Hyperdisk 附加速度快)。
  • 資料集大小和載入延遲時間 (資料層):代理程式在啟動期間載入數 GB 的資料集或大型程式庫 (例如 Node.js 或 Python 套件) 時,需要高儲存空間 I/O 效能,才能在幾秒內讀取資料 (例如 Hyperdisk 提供高磁碟讀取處理量)。
  • 代理程式冷啟動和重新啟動延遲:預期延遲時間,例如低於一秒或數秒。如要達到低於一秒的啟動延遲時間,請使用 GKE Agent Sandbox Warm Pools。一般來說,直接建立沙箱會導致 Pod 啟動和動態磁碟附加作業延遲數秒。
  • 每個代理程式的儲存空間大小:視所選服務而定,您必須配合佈建限制,例如 Google Cloud Hyperdisk 的大小下限為 4 GiB,單一 Filestore 共用的下限為 10 GiB。
  • 資料存取權模式和隔離:平台應如何支援 Workspace 隔離和協作式 Workspace。這會決定代理程式是否需要私密隔離的工作區 (ReadWriteOnce)、協作工作區 (ReadWriteMany),或是探索分支工作區 (具有可寫入的暫存區的唯讀範本)。
  • 復原能力:如果代理程式特別需要區域復原能力,請選擇 GKE 適用的 Filestore 多共用區 (Enterprise)。
  • 儲存費用:儲存服務的價格差異很大,相較於 Filestore Multishares,Hyperdisk Balanced 提供經濟實惠的選項。

代理程式資料生命週期模式

決定解決方案如何處理持續性和暫時性資料時,請考量下列代理程式資料生命週期模式:

  • 具狀態的工作區 (連續狀態):工作區會在工作階段之間維持連續狀態。代理程式暫停時會保留資料 (代理程式沙箱會遭到刪除),並在重新啟用時從最新儲存狀態還原資料 (沙箱會重新建立)。
  • 時間點還原和擁有權轉移 (快照狀態):工作區會做為快照狀態,也就是從凍結的時間點分支出來。工作區會從歷來資料集或其他使用者共用的狀態初始化,以執行擁有權轉移作業。後續修改內容會儲存到另一個私人的可寫入圖層,不會影響原始副本。這個模式適用於各種情境,例如複製資料集以執行平行實驗、偵錯,或根據共用資料執行獨立作業。
  • 暫時性工作區 (暫存狀態):工作區提供暫時性暫存狀態,不會保留任何資料。代理程式會嚴格使用儲存空間磁碟區,在啟動期間保存暫存檔案。暫停或刪除代理程式 (刪除代理程式沙箱) 時,系統會永久捨棄暫時資料。

代理資料存取權模式

如果代理程式需要以下列其中一種資料存取模式存取儲存空間,請選擇支援代理程式需求的儲存服務:

  • 私有隔離工作區:代理程式會啟動私有隔離儲存目錄,並擁有該目錄的專屬讀取和寫入權限。
  • 協作工作區:多個協調代理程式以讀寫 (RW) 模式掛載完全相同的共用目錄,即時協作更新檔案。
  • 探索分支工作區:代理程式會以唯讀 (RO) 模式存取基本範本檔案,避免變更範本,並透過將新寫入內容導向至獨立的本機 emptyDir 暫存區或私人持續路徑,或在啟動時將範本檔案直接複製到私人可寫入工作區,來進行新寫入作業。

比較 Agent Sandbox 的儲存空間方案

請參考下列情境,比較各種儲存空間選項:

  • 如果代理程式可容許幾秒的啟動延遲,並使用具有 ReadWriteOnce (RWO) 存取模式的私人獨立工作區,建議使用 Hyperdisk Balanced,以經濟實惠的價格取得儲存空間。
  • 如果代理程式需要協作工作區或區域復原能力,請使用 GKE 適用的 Filestore 多共用區 (Enterprise)。

下表比較了各項儲存空間服務,可協助您滿足 AI 代理程式的效能、規模、資料存取權和成本需求。

功能 Hyperdisk Balanced GKE Enterprise 適用的 Filestore 多共用區
適用情境
  • 存取模式設為 ReadWriteOnce (RWO) 的個別工作區
  • 可容許儲存空間附加延遲時間超過數秒的工作負載
  • 具成本效益
  • 直接建立沙箱
  • 存取模式為 ReadWriteMany (RWX) 的協作工作區
  • 需要不到一秒的儲存空間附加延遲的工作負載
  • 區域韌性
存取模式 ReadWriteOnce (RWO)

注意:如要使用 ReadOnlyMany (ROX) 模式,請使用 Hyperdisk ML。
ReadWriteMany (RWX)
代理程式沙箱啟動時間不到一秒 (暖集區)
  • 暫時性工作區:可在建立時預先附加空白磁碟區,並在有效工作階段結束後刪除。
  • 具狀態的工作區或時間點還原:需要自訂指令碼和 DaemonSet,才能動態繫結磁碟區 (GitHub 範例)。
  • 暫時性工作區:可在建立時預先附加空白磁碟區,並在有效工作階段結束後刪除。
  • 有狀態的工作區或時間點還原:需要自訂指令碼和 DaemonSet,才能進行動態磁碟區繫結 (GitHub 範例)。
儲存空間佈建延遲 每卷幾秒
  • 建立最多 80 個分享項目的執行個體,只需 6 分鐘
  • 可並行建立多個執行個體
熱路徑附加和掛接延遲 磁碟連接需要幾秒鐘 網路 NFS 掛接的次秒級時間
讀取處理量上限
  • 每顆磁碟 2,400 MiB/秒
  • 處理量受限於所連裝置的實體硬體限制
  • 每 1 TiB 佈建容量 120 MiB/秒
  • 容量上限為 10 TiB 的多重共用執行個體,處理量上限為 1,200 MiB/s
IOPS 3,000 到 160,000,視磁碟區大小和設定而定
  • 讀取 IOPS:每 1 TiB 的執行個體容量為 12,000 讀取 IOPS (最多 120,000 讀取 IOPS)
  • 寫入 IOPS:每 1 TiB 執行個體容量 4,000 寫入 IOPS (最多 40,000 寫入 IOPS)
大小限制
  • 每個磁碟:最少 4 GiB,最多 64 TiB (C4 上為 128 TiB)
  • 每個節點:最多 247 TiB (少於 32 個 vCPU) 或 512 TiB (32 個以上的 vCPU)
擴充限制
  • 每個節點:最多可附加 128 個磁碟區 (視機型而異)
  • 每個磁碟區:Google Cloud Hyperdisk ML 的 ROX 模式最多可有 2,500 個執行個體
  • 每個節點:無附件限制
  • 每個多重共用執行個體:最多 80 個共用項目,以及最多 20,000 個連線 (每 1 TiB 2,000 個,以 500 個為單位調整)
容量調度方向 只會向上擴充 放大或縮小
支援 CSI VolumeSnapshot 支援 不支援 (不支援每個共用項目的快照)
價格 Persistent Disk 和 Google Cloud Hyperdisk 定價 Filestore 定價

後續步驟