監控 TPU VM

本指南說明如何使用 Cloud Monitoring 監控 TPU VM。Cloud Monitoring 會自動收集 TPU 和主機 VM 的指標和記錄。這些資料可用於監控 TPU 和 Compute Engine 的健康狀態。

指標可讓您追蹤一段時間內的數值,例如 CPU 使用率、網路用量或 TensorCore 閒置時間長度。記錄檔會擷取特定時間點的事件,記錄檔項目是由您自己的程式碼、 Google Cloud 服務、第三方應用程式和 Google Cloud 基礎架構所寫入。您也可以建立記錄指標,從記錄項目中的資料產生指標。您也可以根據指標值或記錄項目設定快訊政策。

您也可以使用 Capacity Planner (預覽版) 監控 TPU。您可以使用 Capacity Planner,查看專案、資料夾或機構的 TPU 用量和預測資料。這項資料每 24 小時更新一次,可用於分析用量趨勢,並規劃未來的容量需求。詳情請參閱「Capacity Planner 總覽」。

存取 TPU 指標

Compute Engine 會產生兩種 TPU 指標:TPU 執行階段指標和 TPU VM 基礎架構指標。您可以透過下列兩種方式取得指標:

  • TPU 監控程式庫:使用 TPU 監控程式庫,從 LibTPU SDK 取得 TPU 執行階段指標。這可讓應用程式從客體環境內部取得即時遙測資料。詳情請參閱「TPU 監控程式庫」。

  • AI 遙測資料收集器:透過 AI 遙測資料收集器取得執行階段指標和 VM 基礎架構指標。AI 遙測資料收集器會在 TPU VM 內執行,讓您透過 Cloud Monitoring 或自己的 Prometheus 監控管道存取指標。詳情請參閱「AI 遙測收集器」。

TPU 指標

Compute Engine VM 和 Cloud TPU 執行階段會自動產生 Cloud TPU 的Google Cloud 指標。下表中的指標是由 Compute Engine VM 產生。

這個表格中的「指標類型」字串開頭必須為 compute.googleapis.com/。表格中的項目已省略該前置字元。查詢標籤時,請使用 metric.labels 前置字串,例如 metric.labels.LABEL="VALUE"。

指標類型 推出階段 (資源階層層級)
顯示名稱
種類、類型、單位
受監控資源
說明
標籤
instance/tpu/accelerator/duty_cycle BETA 版  (專案)
加速器任務週期
GAUGE、DOUBLE、%
gce_instance
在取樣期間內,加速器主動處理作業的時間百分比。值範圍為 [0,100]。
accelerator_id: 加速器的裝置 ID。
instance/tpu/accelerator/memory_bandwidth_utilization BETA 版  (project)
加速器記憶體頻寬使用率
GAUGE、DOUBLE、%
gce_instance
目前所用加速器記憶體頻寬的百分比。計算方式為取樣期間內使用的記憶體頻寬,除以相同期間內支援的最大頻寬。
accelerator_id: 加速器的裝置 ID。
instance/tpu/accelerator/memory_total BETA 版  (專案)
加速器記憶體總量
GAUGE、INT64、By
gce_instance
目前分配的加速器記憶體總量,以位元組為單位。
accelerator_id: 加速器的裝置 ID。
instance/tpu/accelerator/memory_used BETA  (project)
加速器記憶體用量
GAUGE、INT64、By
gce_instance
目前使用的加速器記憶體總量 (以位元組為單位)。
accelerator_id: 加速器的裝置 ID。
instance/tpu/accelerator/tensorcore_utilization BETA 版  (project)
加速器 TensorCore 使用率
GAUGE、DOUBLE、%
gce_instance
目前的 Tensorcore 用量占比。將取樣期間內執行的 Tensorcore 作業數量,除以相同期間內支援的 Tensorcore 作業數量,即可得出這項指標。
accelerator_id: 加速器的裝置 ID。
instance/tpu/active_chips GA  (專案)
有效 TPU 晶片數量
GAUGE、INT64、1
gce_instance
目前正在使用的晶片數量 (即非閒置)。
accelerator_type: 加速器類型和世代。
reservation_id: 實體機器預留的 ID。
provisioning_model: 相關聯的佈建模型。
protection_tier: 相關聯的保護模型。
block_id: 託管 VM 的叢集內區塊 ID。
subblock_id: 代管 VM 的子區塊 ID。
is_exr: (BOOL) 指出晶片是否為延長預訂的一部分。
instance/tpu/chip_state BETA  (project)
TPU 晶片狀態計數
GAUGE、INT64、1
gce_instance
各種狀態 (例如健康、不健康和不明) 的 TPU 晶片數量。
state:晶片狀態。
accelerator_type: 加速器類型和世代。
block_id: 託管 VM 的叢集內區塊 ID。
subblock_id: 代管 VM 的子區塊 ID。
reservation_id: 實體機器預留的 ID。
is_exr: (BOOL) 指出晶片是否為延長預訂的一部分。
instance/tpu/infra_health BETA 版  (project)
TPU 執行個體健康狀態
GAUGE、INT64、1
gce_instance
顯示 TPU 執行個體的整體健康狀態。指標標籤可協助您找出健康狀態,以及 TPU 執行個體健康狀態不佳或異常的原因,主要著重於 TPU 硬體和系統健康狀態。健康狀態變更可能需要幾分鐘才會反映在這項指標中。取樣頻率為每 60 秒一次。取樣完畢後,會有多達 420 秒無法查看資料。
health_status: TPU 執行個體的整體健康狀態。可能的值:HEALTHY (正常運作)、UNHEALTHY (偵測到重大問題)、DEGRADED (效能問題)、UNKNOWN (無法判斷狀態)。
unhealthy_category: 說明 VM 狀態不正常的可能原因。只有在指標值為「不正常」時,才會填入這個標籤。
machine_type: 執行個體的機型 (例如 ct6e-standard-4t-tpu)。
machine_id: 託管 VM 的實體電腦 ID。
block_id: 託管 VM 的叢集內區塊 ID。
cluster_id: 託管 VM 的叢集 ID。
reservation_id: 實體機器預留的 ID。
subblock_id: 代管 VM 的子區塊 ID。
instance/tpu/runtime/uptime BETA  (project)
執行階段正常運作時間
GAUGE、INT64、s
gce_instance
自機器學習作業初始化執行階段程式庫 (libtpu.so) 後,機器學習執行階段的正常運作時間。在此期間,執行階段程式庫會封鎖 TPU 裝置,供 ML 工作使用。
ml_framework_name: 機器學習架構的名稱。
ml_framework_version: 機器學習框架版本。
instance/tpu/scheduled_chips GA  (專案)
預定 TPU 晶片數量
GAUGE、INT64、1
gce_instance
目前分配給 VM 的晶片數量,這些 VM 狀態為「HEALTHY」,且「NOT DISABLED」以進行維護。
accelerator_type: 加速器類型和世代。
reservation_id: 實體機器預留的 ID。
provisioning_model: 相關聯的佈建模型。
protection_tier: 相關聯的保護模型。
block_id: 託管 VM 的叢集內區塊 ID。
subblock_id: 代管 VM 的子區塊 ID。
is_exr: (BOOL) 指出晶片是否為延長預訂的一部分。
instance/tpu/utilized_chips BETA  (project)
已使用的 TPU 晶片
GAUGE、DOUBLE、1
gce_instance
目前使用的總容量,以有效活躍晶片數量表示。這相當於所有作用中晶片的利用率總和 (0.0 至 1.0)。
accelerator_type: 加速器類型和世代。
reservation_id: 實體機器預留的 ID。
provisioning_model: 相關聯的佈建模型。
protection_tier: 相關聯的保護模型。
block_id: 託管 VM 的叢集內區塊 ID。
subblock_id: 代管 VM 的子區塊 ID。
is_exr: (BOOL) 指出晶片是否為延長預訂的一部分。
quota/tpus_per_tpu_family/exceeded ALPHA  (project)
TPU count per TPU family. quota exceeded error
DELTA、INT64、1
compute.googleapis.com/Location
嘗試次數超出配額指標 compute.googleapis.com/tpus_per_tpu_family 的上限。取樣完畢後,會有多達 150 秒無法查看資料。
limit_name: 限制名稱。
tpu_family: TPU 系列自訂維度。
quota/tpus_per_tpu_family/limit ALPHA  (project)
每個 TPU 系列的 TPU 數量。配額限制
GAUGE、INT64、1
compute.googleapis.com/Location
目前配額指標 compute.googleapis.com/tpus_per_tpu_family 的限制。取樣頻率為每 60 秒一次。取樣完畢後,會有多達 150 秒無法查看資料。
limit_name: 限制名稱。
tpu_family: TPU 系列自訂維度。
quota/tpus_per_tpu_family/usage ALPHA  (project)
每個 TPU 系列的 TPU 數量。配額用量
GAUGE、INT64、1
compute.googleapis.com/Location
目前配額用量指標為 compute.googleapis.com/tpus_per_tpu_family。取樣完畢後,會有多達 150 秒無法查看資料。
limit_name: 限制名稱。
tpu_family: TPU 系列自訂維度。
tpu/multislice/accelerator/device_to_host_transfer_latencies BETA 版  (專案)
裝置到主機的傳輸延遲時間
CUMULATIVE、DISTRIBUTION、us
gce_instance
每個資料區塊的裝置到主機傳輸延遲時間累積分佈。當系統發出將資料轉移至主機的要求時,延遲時間就會開始計算,並在收到資料轉移完成的確認訊息時結束。
buffer_size: 緩衝區空間。
tpu/multislice/accelerator/host_to_device_transfer_latencies BETA 版  (project)
主機到裝置的傳輸延遲時間
CUMULATIVE、DISTRIBUTION、us
gce_instance
多切片流量每個資料區塊的主機到裝置傳輸延遲時間累積分布。延遲時間的計算起點為發出將資料傳輸至裝置的要求,終點為收到資料傳輸完成的確認訊息。
buffer_size: 緩衝區空間。
tpu/multislice/network/collective_end_to_end_latencies BETA 版  (project)
集體端對端延遲時間
CUMULATIVE、DISTRIBUTION、us
gce_instance
多重切片流量的集體端對端延遲時間累積分佈。延遲時間的計算方式是從發出集合要求開始,到收到資料傳輸完成的確認訊息時結束。
input_size: 集合作業的輸入大小。
collective_type: 集體作業類型。
tpu/multislice/network/dcn_transfer_latencies BETA 版  (專案)
DCN 傳輸延遲時間
CUMULATIVE、DISTRIBUTION、us
gce_instance
多切片流量的網路傳輸延遲累積分布情形。延遲時間的計算起點是發出透過 DCN 傳輸資料的要求,終點是收到資料傳輸完成的確認訊息。
buffer_size: 緩衝區空間。
type: 類型。
tpu/multislice/network/grpc_client_call_latencies Beta 版  (project)
gRPC 用戶端呼叫延遲時間
CUMULATIVE、DISTRIBUTION、us
gce_instance
gRPC 程式庫完成 RPC 時,從呼叫端角度來看的網路傳輸延遲累積分佈。
buffer_size: 緩衝區空間。
tpu/multislice/network/grpc_server_call_latencies BETA  (project)
gRPC 伺服器呼叫延遲時間
CUMULATIVE、DISTRIBUTION、us
gce_instance
從傳輸角度來看,gRPC 伺服器完成 RPC 的網路傳輸延遲累積分布。
buffer_size: 緩衝區空間。
tpu/multislice/network/grpc_tcp_delivery_rates Beta 版  (project)
gRPC TCP 傳送率
CUMULATIVE、DISTRIBUTION、Mb/s
gce_instance
TCP 連線資料傳輸速率的累積分布。每個樣本都是在最近的 TCP ACK 間隔內,特定 TCP 連線的最新平均資料傳輸速率。系統每 20 秒會從 Linux TCP 核心提取資料傳輸速率樣本,因此可以預期每個 TCP 連線每 60 秒間隔會建立約 3 個樣本。
tpu/multislice/network/grpc_tcp_min_round_trip_times BETA 版  (project)
gRPC TCP 最短來回時間
CUMULATIVE、DISTRIBUTION、us
gce_instance
每個 TCP 連線的最低網路傳輸延遲時間累積分布。
tpu/multislice/network/grpc_tcp_packets_retransmitted_count BETA  (project)
gRPC TCP Packets Retransmitted Count
CUMULATIVE、INT64、1
gce_instance
重新傳輸的封包總數。
tpu/multislice/network/grpc_tcp_packets_sent_count BETA  (project)
gRPC TCP Packets Sent Count
CUMULATIVE、INT64、1
gce_instance
TCP 傳送的封包總數。
tpu/slice/capacity/available_chips GA  (project)
Available TPU Chips Count
GAUGE、INT64、1
compute.googleapis.com/AcceleratorSlice
目前可供使用且隨時可用的擴充預訂 TPU 晶片數量。取樣頻率為每 60 秒一次。取樣完畢後,會有多達 360 秒無法查看資料。
accelerator_type: 加速器類型和世代。
reservation_id: 實體機器預留的 ID。
block_id: 與切片相關聯的區塊 ID。
subblock_id: 與切片相關聯的子區塊 ID。
provisioning_model: 相關聯的佈建模型。
protection_tier: 相關聯的保護模型。
tpu/slice/capacity/committed_chips GA  (project)
購買的 TPU 晶片數量
GAUGE、INT64、1
compute.googleapis.com/AcceleratorSlice
目前購買的延長預留 TPU 晶片數量。取樣頻率為每 60 秒一次。取樣完畢後,會有多達 360 秒無法查看資料。
accelerator_type: 加速器類型和世代。
reservation_id: 實體機器預留的 ID。
block_id: 與切片相關聯的區塊 ID。
subblock_id: 與切片相關聯的子區塊 ID。
provisioning_model: 相關聯的佈建模型。
protection_tier: 相關聯的保護模型。
instance/tpu/accelerator/core_temperature BETA 版  (project)
核心溫度
GAUGE、DOUBLE、Cel
gce_instance
TPU 的核心溫度。
accelerator_id: 加速器的裝置 ID。有效值為 0、1、2、3。
instance/tpu/accelerator/core_throttling_indicator BETA  (project)
Core Throttling Indicator
GAUGE、DOUBLE、1
gce_instance
每秒略過的時脈週期數,除以每個 TPU 核心的時脈週期總數。
accelerator_id: 加速器的裝置 ID。有效值為 0、1、2、3。
instance/tpu/accelerator/hbm_power_draw Beta 版  (專案)
HBM 耗電量
GAUGE、DOUBLE、W
gce_instance
HBM 模組的功率總和 (瓦特)。
accelerator_id: 加速器的裝置 ID。有效值為 0、1、2、3。
instance/tpu/accelerator/hbm_temperature 測試版  (專案)
HBM 溫度參數
GAUGE、DOUBLE、Cel
gce_instance
TPU 的高頻寬記憶體 (HBM) 溫度。
accelerator_id: 加速器的裝置 ID。有效值為 0、1、2、3。
hbm_id: 高頻寬記憶體 (HBM) 模組 ID。通常只有最高值,例如:hbm_0。
instance/tpu/accelerator/hbm_uncorrectable_count BETA  (project)
HBM Uncorrectable Count
CUMULATIVE、INT64、1
gce_instance
HBM 中無法修正的錯誤數量 (致命)。
accelerator_id: 加速器的裝置 ID。有效值為 0、1、2、3。
instance/tpu/accelerator/mxu_temperature BETA  (project)
MXU 溫度
GAUGE、DOUBLE、Cel
gce_instance
TPU 的矩陣乘法單元 (MXU) 溫度。
accelerator_id: 加速器的裝置 ID。有效值為 0、1、2、3。
die_id: 加速器的插槽索引。通常只有最高值,例如:die_0。
GAUGE、INT64、1
gce_instance
ICI 連結上向上和向下狀態之間的狀態變更頻率。
accelerator_id: 加速器的裝置 ID。有效值為 0、1、2、3。
GAUGE、INT64、1
gce_instance
代表 ICI 連結健康狀態的數字指標 (0 到 10)。值越高表示連結不穩定程度越高,從輕微的暫時性擺動 (1 到 5) 到持續效能下降 (6 到 9)。值為 10 代表連結發生嚴重故障,系統會自動終止運作中的工作負載。
port_id: 通訊埠 ID。
instance/tpu/accelerator/network/ici_packets_received_count BETA 版  (專案)
收到的 ICI 封包數
CUMULATIVE、INT64、1
gce_instance
TPU 加速器透過晶片間互連 (ICI) 連結接收的封包總數。
accelerator_id: 加速器的裝置 ID。有效值為 0、1、2、3。
instance/tpu/accelerator/network/ici_packets_sent_count Beta 版  (專案)
ICI 封包傳送計數
CUMULATIVE、INT64、1
gce_instance
TPU 加速器透過晶片間互連 (ICI) 連結傳輸的封包總數。
accelerator_id: 加速器的裝置 ID。有效值為 0、1、2、3。
instance/tpu/accelerator/pcie_fatal_error_count Beta 版  (專案)
PCIe 致命錯誤計數
CUMULATIVE、INT64、1
gce_instance
在 PCIe 介面發生的致命 PCIe 錯誤次數。
accelerator_id: 加速器的裝置 ID。有效值為 0、1、2、3。
instance/tpu/accelerator/pcie_nonfatal_error_count Beta 版  (專案)
PCIe 非致命錯誤計數
CUMULATIVE、INT64、1
gce_instance
在 PCIe 介面發生的非致命 PCIe 錯誤數量。
accelerator_id: 加速器的裝置 ID。有效值為 0、1、2、3。
instance/tpu/accelerator/power_draw BETA  (專案)
Power Draw
GAUGE、DOUBLE、W
gce_instance
加速器耗電量,以瓦特 (W) 為單位。
accelerator_id: 加速器的裝置 ID。有效值為 0、1、2、3。
instance/tpu/accelerator/tray_power Beta 版  (專案)
工作匣電源
GAUGE、DOUBLE、W
gce_instance
TPU 匣的總耗電量。
accelerator_id: 加速器的裝置 ID。有效值為 0、1、2、3。
instance/tpu/accelerator/tray_temperature BETA  (project)
Tray Temperature
GAUGE、DOUBLE、Cel
gce_instance
TPU 的托盤溫度。
accelerator_id: 加速器的裝置 ID。有效值為 0、1、2、3。
instance/tpu/failure_prediction_status BETA  (project)
TPU 效能降低狀態
GAUGE、INT64、1
gce_instance
這項指標表示我們專屬演算法預測的機率,也就是 TPU 機器在接下來 5 小時內進入效能降低狀態的機率。這項指標的值標籤為 NO_DEGRADATION_PREDICTED、DEGRADATION_PREDICTED、POSSIBLE_DEGRADATION_PREDICTED。取樣頻率為每 60 秒一次。取樣完畢後,會有多達 540 秒無法查看資料。
cluster_id: 託管 VM 的叢集模糊處理 ID。
block_id: 託管 VM 的叢集內模糊處理的區塊 ID。
subblock_id: 託管 VM 的模糊處理子區塊 ID。
machine_id: 主機 VM 的模糊處理名稱。
reservation_id: 預留項目 ID。
Value: 我們專有演算法預測,TPU 機器會在接下來 5 小時內進入效能降低狀態。可能的值為「NO_DEGRADATION_PREDICTED」、「DEGRADATION_PREDICTED」、「POSSIBLE_DEGRADATION_PREDICTED」。
tpu/capacity/available_chips BETA  (project)
可用的 TPU 晶片數量
GAUGE、INT64、1
compute.googleapis.com/Location
目前可供使用的 TPU 晶片數量。
accelerator_type:加速器類型和世代。
reservation_id: 實體機器預留的 ID。
provisioning_model: 相關聯的佈建模型。
protection_tier: 相關聯的保護模型。
is_exr: 指出 TPU 晶片是否屬於延長預訂。
tpu/capacity/committed_chips BETA 版  (專案)
購買的 TPU 晶片數量
GAUGE、INT64、1
compute.googleapis.com/Location
目前購買的 TPU 晶片數量。
accelerator_type:加速器類型和世代。
reservation_id: 實體機器預留的 ID。
provisioning_model: 相關聯的佈建模型。
protection_tier: 相關聯的保護模型。
is_exr: 指出 TPU 晶片是否屬於延長預訂。
tpu/network/nic_packets_dropped_count_rx Beta 版  (專案)
NIC 封包捨棄計數 Rx
CUMULATIVE、INT64、1
gce_instance
主機 NIC 捨棄的傳入或傳出封包總數 (適用於 RX)。
nic_id: Nic Id。
tpu/network/nic_packets_dropped_count_tx BETA  (project)
NIC 封包捨棄計數 Tx
CUMULATIVE、INT64、1
gce_instance
主機 NIC 捨棄的傳輸 (TX) 封包總數。
nic_id: Nic Id。
tpu/network/nic_packets_received_count BETA 版  (專案)
收到的 NIC 封包數
CUMULATIVE、INT64、1
gce_instance
NIC 收到的封包總數。
nic_id: Nic Id。
tpu/network/nic_packets_sent_count Beta 版  (專案)
傳送的 NIC 封包數
CUMULATIVE、INT64、1
gce_instance
NIC 傳送的封包總數。
nic_id: Nic Id。

如需 Compute Engine 產生的指標完整清單,請參閱「 Compute Engine 指標」。

AI 遙測資料收集器

AI 遙測收集器會收集並發布使用 Compute Engine API 建立的 TPU 指標,這些指標位於 compute.googleapis.com 命名空間下。這些是內建的系統指標,可讓您掌握健康狀態和效能。

AI 遙測收集器架構設計為輕量型專用 OpenTelemetry (OTEL) 收集器。這項功能會使用兩個主要接收器擷取資料:

  • TPU 執行階段接收器:在機器學習工作負載處於活動狀態時,直接從 TPU 執行階段擷取執行階段和工作負載指標 (例如工作週期和記憶體用量)。
  • TPU 主機接收器:直接從裝置擷取硬體使用率指標,例如 TensorCore 使用率和記憶體頻寬使用率,無論工作負載是否正在執行。

接著,AI 遙測收集器會使用處理器自動套用必要的資源標記 (例如 project_id、instance_id 和 zone),並直接將遙測資料安全地匯出至 Cloud Monitoring。

Google 的 TPU 最佳化 Ubuntu LTS 映像檔已預先安裝 AI 遙測收集器,且會在 VM 啟動時自動執行。如要使用這項設定,請在建立 TPU VM 執行個體或執行個體範本時,指定官方的 Google 加速器映像檔專案和系列。VM 啟動後,AI 遙測收集器會自動將指標傳送至 Cloud Monitoring 資訊主頁。

如果您要建構自訂作業系統映像檔,可以安裝並執行 ai-telemetry-collector Docker 映像檔後,使用 AI 遙測收集器。詳情請參閱「使用自訂 OS 映像檔」。

設定

AI 遙測收集器會自動將指標傳送至 Cloud Monitoring 資訊主頁,不需要任何額外設定步驟。不過,您可以設定 Snap 套件或 Docker 映像檔,新增外部匯出目的地、變更指標收集間隔,以及加入偵錯選項。

您可以將預設設定替換為新的設定檔,也可以在現有的預設設定中附加其他設定檔。新增設定時,系統會新增不存在的金鑰,並覆寫現有金鑰。不過,陣列和清單不會累加,因此新清單必須同時包含現有和新值。

下列 YAML 檔案會設定 AI Telemetry Collector,將指標傳送至 Prometheus,這是一套開放原始碼的系統監控和快訊工具包。此外,這項功能也會啟用偵錯選項,在控制台中列印指標。

exporters:
  prometheus:
    endpoint: 0.0.0.0:8889

service:
  pipelines:
    metrics:
      exporters:
      -   prometheus # For more: https://prometheus.io/docs/introduction/overview/
      -   googlecloud # If you do not include this, you'll lose Google Cloud Monitoring
      -   debug # print metrics within the console

預設作業系統

如果您使用 Google 的 TPU 最佳化 Ubuntu LTS 映像檔,請執行下列 Snap 指令,將新設定檔新增至現有設定:

sudo snap set \
  ai-telemetry-collector \
  extra-flags="--config /home/username/additional-config.yaml"

如要覆寫並取代現有設定,請使用 config-path 旗標,而非 extra-flags:

sudo snap set \
  ai-telemetry-collector \
  config-path="/home/username/new-config.yaml"

snap set 指令應會觸發 AI 遙測收集器自動重新啟動。如要確認收集器已重新啟動並順利套用設定,請使用下列指令查看記錄:

sudo snap logs -f ai-telemetry-collector

自訂作業系統

如果您使用自訂 OS,請執行下列 Docker 指令,將新的設定檔新增至現有設定:

# First apply the default configs via `--config=/etc/ai-telemetry-collector/config.yaml`
# Then apply your additional config by volume mount.

docker run --privileged --net=host                                                                   \
  -v <path>/additional-config.yaml:/etc/ai-telemetry-collector/additional-config.yaml \
  ai-telemetry-collector:latest                                                       \
  --config=/etc/ai-telemetry-collector/config.yaml                                    \
  --config=/etc/ai-telemetry-collector/additional-config.yaml

如要覆寫並取代現有設定,請使用下列 Docker 指令:

# Mount a volume (your config file) to `/etc/ai-telemetry-collector/config.yaml`
# The binary automatically picks up this file.

docker run --privileged --net=host                                               \
  -v <path>/my-config.yaml:/etc/ai-telemetry-collector/config.yaml   \
  ai-telemetry-collector:latest

稽核記錄

Google Cloud 服務會產生稽核記錄,用於記錄 Google Cloud 資源中的管理和存取活動。詳情請參閱「 Compute Engine 稽核記錄」。