密集配置政策和工作負載政策總覽

本文將概略介紹密集配置政策和工作負載政策,並比較兩者。這兩項政策都可讓您設定 Compute Engine 執行個體的配置,盡量減少網路延遲。

根據預設,您只需指定運算執行個體的可用區,即可管理其位置。如要建立彼此距離較近的運算執行個體,可以使用下列選項。詳情請參閱「AI 基礎架構資源主機代管」。

  • 下列資源已密集共置:

    • 消耗相同未來預留項目的資源,用於容量區塊。
    • 在日曆模式中,耗用相同未來預留項目的資源。
    • 透過代管執行個體群組 (MIG) 規模調整要求一併建立的資源。
  • 指定彈性啟動消耗選項時,您共同建立的資源可能會根據盡力而為的可用性,密集地共置。如果需要密集共置資源,請套用指定距離上限的密集配置政策,或指定距離上限的工作負載政策。

  • 否則,如要將資源放在附近,請套用密集配置政策或工作負載政策。

    • 如要密集共置資源,請在政策中指定最大距離。
    • 如要盡量將資源緊密共置,請勿在政策中指定最大距離。

如要進一步瞭解密集配置政策與工作負載政策的使用時機,請參閱本文的「密集配置政策與工作負載政策比較」。

密集配置政策與工作負載政策比較

下表摘要說明緊湊放置群組政策與工作負載政策之間的差異:

密集配置政策 工作負載政策
政策使用情況
  • 獨立執行個體
  • 使用 Bulk API 部署的執行個體
  • 搭載一般 GPU 的 MIG
具有叢集 GPU 的 MIG
支援的機器類型 A4X Max、A4X、A4、A3 Ultra、A3 Mega、A3 High、A3 Edge、A2、G4 和 G2
  • 彈性啟動:A4 和 A3 Ultra
  • 適用於 Spot 或預訂:A4X、A4、A3 Ultra、A3 Mega 和 A3 High (8 個 GPU)
分組語意

Compute Engine 會將使用相同密集配置政策的執行個體配置在相近的位置。

建議您為每個工作負載使用不同的放置政策。在執行不同工作負載的執行個體之間重複使用配置政策,會導致所有這些執行個體都放置在一起。當您擴展特定工作負載時,這種共置可能會導致難以建立彼此靠近的執行個體。

Compute Engine 會將執行個體放在使用工作負載政策的 MIG 中,彼此距離更近。

在執行不同工作負載的多個 MIG 中重複使用工作負載政策,會將個別 MIG 中的執行個體放在一起。如果訓練模型很大,且每組執行個體都必須彼此隔離,就非常適合重複使用。

運算執行個體共置設定

如要盡量將運算執行個體放在同一位置,請將 groupPlacementPolicy.collocation 欄位設為 COLLOCATED。

如要盡量將運算執行個體放在同一位置,請將 workloadPolicy.type 欄位設為 HIGH_THROUGHPUT。

其他設定
  • 如要嚴格放置運算執行個體,請指定 maxDistance 欄位。
  • 對於支援分割的機器系列 (例如 A4X Max 和 A4X),請指定 gpuTopology 欄位。
  • 如要嚴格放置運算執行個體,請指定 maxTopologyDistance 欄位。
  • 對於支援分割的機器系列 (例如 A4X Max 和 A4X),請指定 acceleratorTopology 欄位。

詳情請參閱下列章節:

密集配置政策

將密集配置政策套用至獨立運算執行個體或大量建立的運算執行個體時,Compute Engine 會盡可能將運算執行個體建立在彼此靠近的位置。如果應用程式需要最低網路延遲時間,請在建立密集配置政策時指定 maxDistance 欄位 (預覽版)。

詳情請參閱 Compute Engine 說明文件中的「關於密集配置政策」。

密集配置政策的距離上限值比較

最大距離值越低,運算執行個體彼此會越靠近,但也會增加因空間不足而無法建立部分運算執行個體的可能性。

下表列出各最大距離值支援的機器系列和運算執行個體數量:

maxDistance 的密集配置政策 工作負載政策中的 maxTopologyDistance 說明 支援的機器系列 運算執行個體數量上限
未指定 (不建議) 未指定 (不建議) Compute Engine 會盡量將運算執行個體放在最近的位置,但運算執行個體之間沒有最大距離。 A4X Max、A4X、A4、A3 Ultra、A3 Mega1、A3 High1、A3 Edge1、A2、G4 和 G2 1500
3 CLUSTER Compute Engine 會在相鄰的區塊中建立運算執行個體。 A4、A3 Mega1、A3 High1、A3 Edge1、A2、G4 和 G2 1,500
2 BLOCK Compute Engine 會在同一個區塊中建立運算執行個體。 A4、A3 Ultra、A3 Mega1、A3 High1、A3 Edge1、A2、G4 和 G2
  • A3 Ultra、A3 Mega1、A3 High1 和 A3 Edge1:256
  • 所有其他支援的機器系列:150
1 SUBBLOCK Compute Engine 會在同一個子區塊中建立運算執行個體。 A3 Edge1、A2、G4 和 G2 22

1 如要將密集配置政策套用至 2025 年 10 月 1 日前建立的 A3 Mega、A3 High 或 A3 Edge 執行個體,請與帳戶團隊或業務團隊聯絡。

工作負載政策

您可以透過工作負載政策,指定 MIG 中運算執行個體的配置和底層基礎架構。搭配 A4X Max、A4X、A4、A3 Ultra、A3 Mega 和 A3 High (8 個 GPU) 使用工作負載政策,有助於盡量減少運算執行個體之間的網路延遲時間,並提升效能。

視 MIG 中運算執行個體使用的機型而定,在下列情況中,工作負載政策為必要或選用:

  • 如要部署 A4X Max 或 A4X 執行個體的子區塊,必須採用工作負載政策。

  • 如要使用 A4、A3 Ultra、A3 Mega 或 A3 High (8 個 GPU) 執行個體,工作負載政策為選用項目。

  • A3 Edge、A2、G4、G2 和 N1 系列的機器不支援工作負載政策。對於使用這些機器系列的 MIG,您可以採用密集配置政策,將 VM 放置在同一位置。

詳情請參閱 Compute Engine 說明文件中的「關於 MIG 中的工作負載政策」。

後續步驟