監控 TPU VM
本指南說明如何使用 Cloud Monitoring 監控 TPU VM。Cloud Monitoring 會自動收集 TPU 和主機 VM 的指標和記錄。這些資料可用於監控 TPU 和 Compute Engine 的健康狀態。
指標可讓您追蹤一段時間內的數值,例如 CPU 使用率、網路用量或 TensorCore 閒置時間長度。記錄檔會擷取特定時間點的事件,記錄檔項目是由您自己的程式碼、 Google Cloud 服務、第三方應用程式和 Google Cloud 基礎架構所寫入。您也可以建立記錄指標,從記錄項目中的資料產生指標。您也可以根據指標值或記錄項目設定快訊政策。
您也可以使用 Capacity Planner (預覽版) 監控 TPU。您可以使用 Capacity Planner,查看專案、資料夾或機構的 TPU 用量和預測資料。這項資料每 24 小時更新一次,可用於分析用量趨勢,並規劃未來的容量需求。詳情請參閱「Capacity Planner 總覽」。
存取 TPU 指標
Compute Engine 會產生兩種 TPU 指標:TPU 執行階段指標和 TPU VM 基礎架構指標。您可以透過下列兩種方式取得指標:
TPU 監控程式庫:使用 TPU 監控程式庫,從 LibTPU SDK 取得 TPU 執行階段指標。這可讓應用程式從客體環境內部取得即時遙測資料。詳情請參閱「TPU 監控程式庫」。
AI 遙測資料收集器:透過 AI 遙測資料收集器取得執行階段指標和 VM 基礎架構指標。AI 遙測資料收集器會在 TPU VM 內執行,讓您透過 Cloud Monitoring 或自己的 Prometheus 監控管道存取指標。詳情請參閱「AI 遙測收集器」。
TPU 指標
Compute Engine VM 和 Cloud TPU 執行階段會自動產生 Cloud TPU 的Google Cloud 指標。下表中的指標是由 Compute Engine VM 產生。
這個表格中的「指標類型」字串開頭必須為 compute.googleapis.com/。表格中的項目已省略該前置字元。查詢標籤時,請使用 metric.labels 前置字串,例如 metric.labels.LABEL="VALUE"。
| 指標類型 推出階段 (資源階層層級) 顯示名稱 |
|
|---|---|
| 種類、類型、單位 受監控資源 |
說明 標籤 |
instance/tpu/accelerator/duty_cycle
BETA 版
(專案)
加速器任務週期 |
|
GAUGE、DOUBLE、%
gce_instance |
在取樣期間內,加速器主動處理作業的時間百分比。值範圍為 [0,100]。
accelerator_id:
加速器的裝置 ID。
|
instance/tpu/accelerator/memory_bandwidth_utilization
BETA 版
(project)
加速器記憶體頻寬使用率 |
|
GAUGE、DOUBLE、%
gce_instance |
目前所用加速器記憶體頻寬的百分比。計算方式為取樣期間內使用的記憶體頻寬,除以相同期間內支援的最大頻寬。
accelerator_id:
加速器的裝置 ID。
|
instance/tpu/accelerator/memory_total
BETA 版
(專案)
加速器記憶體總量 |
|
GAUGE、INT64、By
gce_instance |
目前分配的加速器記憶體總量,以位元組為單位。
accelerator_id:
加速器的裝置 ID。
|
instance/tpu/accelerator/memory_used
BETA
(project)
加速器記憶體用量 |
|
GAUGE、INT64、By
gce_instance |
目前使用的加速器記憶體總量 (以位元組為單位)。
accelerator_id:
加速器的裝置 ID。
|
instance/tpu/accelerator/tensorcore_utilization
BETA 版
(project)
加速器 TensorCore 使用率 |
|
GAUGE、DOUBLE、%
gce_instance |
目前的 Tensorcore 用量占比。將取樣期間內執行的 Tensorcore 作業數量,除以相同期間內支援的 Tensorcore 作業數量,即可得出這項指標。
accelerator_id:
加速器的裝置 ID。
|
instance/tpu/active_chips
GA
(專案)
有效 TPU 晶片數量 |
|
GAUGE、INT64、1
gce_instance |
目前正在使用的晶片數量 (即非閒置)。
accelerator_type:
加速器類型和世代。
reservation_id:
實體機器預留的 ID。
provisioning_model:
相關聯的佈建模型。
protection_tier:
相關聯的保護模型。
block_id:
託管 VM 的叢集內區塊 ID。
subblock_id:
代管 VM 的子區塊 ID。
is_exr:
(BOOL)
指出晶片是否為延長預訂的一部分。
|
instance/tpu/chip_state
BETA
(project)
TPU 晶片狀態計數 |
|
GAUGE、INT64、1
gce_instance |
各種狀態 (例如健康、不健康和不明) 的 TPU 晶片數量。
state:晶片狀態。accelerator_type:
加速器類型和世代。
block_id:
託管 VM 的叢集內區塊 ID。
subblock_id:
代管 VM 的子區塊 ID。
reservation_id:
實體機器預留的 ID。
is_exr:
(BOOL)
指出晶片是否為延長預訂的一部分。
|
instance/tpu/infra_health
BETA 版
(project)
TPU 執行個體健康狀態 |
|
GAUGE、INT64、1
gce_instance |
顯示 TPU 執行個體的整體健康狀態。指標標籤可協助您找出健康狀態,以及 TPU 執行個體健康狀態不佳或異常的原因,主要著重於 TPU 硬體和系統健康狀態。健康狀態變更可能需要幾分鐘才會反映在這項指標中。取樣頻率為每 60 秒一次。取樣完畢後,會有多達 420 秒無法查看資料。
health_status:
TPU 執行個體的整體健康狀態。可能的值:HEALTHY (正常運作)、UNHEALTHY (偵測到重大問題)、DEGRADED (效能問題)、UNKNOWN (無法判斷狀態)。
unhealthy_category:
說明 VM 狀態不正常的可能原因。只有在指標值為「不正常」時,才會填入這個標籤。
machine_type:
執行個體的機型 (例如 ct6e-standard-4t-tpu)。
machine_id:
託管 VM 的實體電腦 ID。
block_id:
託管 VM 的叢集內區塊 ID。
cluster_id:
託管 VM 的叢集 ID。
reservation_id:
實體機器預留的 ID。
subblock_id:
代管 VM 的子區塊 ID。
|
instance/tpu/runtime/uptime
BETA
(project)
執行階段正常運作時間 |
|
GAUGE、INT64、s
gce_instance |
自機器學習作業初始化執行階段程式庫 (libtpu.so) 後,機器學習執行階段的正常運作時間。在此期間,執行階段程式庫會封鎖 TPU 裝置,供 ML 工作使用。
ml_framework_name:
機器學習架構的名稱。
ml_framework_version:
機器學習框架版本。 |
instance/tpu/scheduled_chips
GA
(專案)
預定 TPU 晶片數量 |
|
GAUGE、INT64、1
gce_instance |
目前分配給 VM 的晶片數量,這些 VM 狀態為「HEALTHY」,且「NOT DISABLED」以進行維護。
accelerator_type:
加速器類型和世代。
reservation_id:
實體機器預留的 ID。
provisioning_model:
相關聯的佈建模型。
protection_tier:
相關聯的保護模型。
block_id:
託管 VM 的叢集內區塊 ID。
subblock_id:
代管 VM 的子區塊 ID。
is_exr:
(BOOL)
指出晶片是否為延長預訂的一部分。
|
instance/tpu/utilized_chips
BETA
(project)
已使用的 TPU 晶片 |
|
GAUGE、DOUBLE、1
gce_instance |
目前使用的總容量,以有效活躍晶片數量表示。這相當於所有作用中晶片的利用率總和 (0.0 至 1.0)。
accelerator_type:
加速器類型和世代。
reservation_id:
實體機器預留的 ID。
provisioning_model:
相關聯的佈建模型。
protection_tier:
相關聯的保護模型。
block_id:
託管 VM 的叢集內區塊 ID。
subblock_id:
代管 VM 的子區塊 ID。
is_exr:
(BOOL)
指出晶片是否為延長預訂的一部分。
|
quota/tpus_per_tpu_family/exceeded
ALPHA
(project)
TPU count per TPU family. quota exceeded error |
|
DELTA、INT64、1
compute.googleapis.com/Location |
嘗試次數超出配額指標 compute.googleapis.com/tpus_per_tpu_family 的上限。取樣完畢後,會有多達 150 秒無法查看資料。
limit_name:
限制名稱。
tpu_family:
TPU 系列自訂維度。
|
quota/tpus_per_tpu_family/limit
ALPHA
(project)
每個 TPU 系列的 TPU 數量。配額限制 |
|
GAUGE、INT64、1
compute.googleapis.com/Location |
目前配額指標 compute.googleapis.com/tpus_per_tpu_family 的限制。取樣頻率為每 60 秒一次。取樣完畢後,會有多達 150 秒無法查看資料。
limit_name:
限制名稱。
tpu_family:
TPU 系列自訂維度。
|
quota/tpus_per_tpu_family/usage
ALPHA
(project)
每個 TPU 系列的 TPU 數量。配額用量 |
|
GAUGE、INT64、1
compute.googleapis.com/Location |
目前配額用量指標為 compute.googleapis.com/tpus_per_tpu_family。取樣完畢後,會有多達 150 秒無法查看資料。
limit_name:
限制名稱。
tpu_family:
TPU 系列自訂維度。
|
tpu/multislice/accelerator/device_to_host_transfer_latencies
BETA 版
(專案)
裝置到主機的傳輸延遲時間 |
|
CUMULATIVE、DISTRIBUTION、us
gce_instance |
每個資料區塊的裝置到主機傳輸延遲時間累積分佈。當系統發出將資料轉移至主機的要求時,延遲時間就會開始計算,並在收到資料轉移完成的確認訊息時結束。
buffer_size:
緩衝區空間。
|
tpu/multislice/accelerator/host_to_device_transfer_latencies
BETA 版
(project)
主機到裝置的傳輸延遲時間 |
|
CUMULATIVE、DISTRIBUTION、us
gce_instance |
多切片流量每個資料區塊的主機到裝置傳輸延遲時間累積分布。延遲時間的計算起點為發出將資料傳輸至裝置的要求,終點為收到資料傳輸完成的確認訊息。
buffer_size:
緩衝區空間。
|
tpu/multislice/network/collective_end_to_end_latencies
BETA 版
(project)
集體端對端延遲時間 |
|
CUMULATIVE、DISTRIBUTION、us
gce_instance |
多重切片流量的集體端對端延遲時間累積分佈。延遲時間的計算方式是從發出集合要求開始,到收到資料傳輸完成的確認訊息時結束。
input_size:
集合作業的輸入大小。
collective_type:
集體作業類型。
|
tpu/multislice/network/dcn_transfer_latencies
BETA 版
(專案)
DCN 傳輸延遲時間 |
|
CUMULATIVE、DISTRIBUTION、us
gce_instance |
多切片流量的網路傳輸延遲累積分布情形。延遲時間的計算起點是發出透過 DCN 傳輸資料的要求,終點是收到資料傳輸完成的確認訊息。
buffer_size:
緩衝區空間。
type:
類型。
|
tpu/multislice/network/grpc_client_call_latencies
Beta 版
(project)
gRPC 用戶端呼叫延遲時間 |
|
CUMULATIVE、DISTRIBUTION、us
gce_instance |
gRPC 程式庫完成 RPC 時,從呼叫端角度來看的網路傳輸延遲累積分佈。
buffer_size:
緩衝區空間。
|
tpu/multislice/network/grpc_server_call_latencies
BETA
(project)
gRPC 伺服器呼叫延遲時間 |
|
CUMULATIVE、DISTRIBUTION、us
gce_instance |
從傳輸角度來看,gRPC 伺服器完成 RPC 的網路傳輸延遲累積分布。
buffer_size:
緩衝區空間。
|
tpu/multislice/network/grpc_tcp_delivery_rates
Beta 版
(project)
gRPC TCP 傳送率 |
|
CUMULATIVE、DISTRIBUTION、Mb/s
gce_instance |
TCP 連線資料傳輸速率的累積分布。每個樣本都是在最近的 TCP ACK 間隔內,特定 TCP 連線的最新平均資料傳輸速率。系統每 20 秒會從 Linux TCP 核心提取資料傳輸速率樣本,因此可以預期每個 TCP 連線每 60 秒間隔會建立約 3 個樣本。 |
tpu/multislice/network/grpc_tcp_min_round_trip_times
BETA 版
(project)
gRPC TCP 最短來回時間 |
|
CUMULATIVE、DISTRIBUTION、us
gce_instance |
每個 TCP 連線的最低網路傳輸延遲時間累積分布。 |
tpu/multislice/network/grpc_tcp_packets_retransmitted_count
BETA
(project)
gRPC TCP Packets Retransmitted Count |
|
CUMULATIVE、INT64、1
gce_instance |
重新傳輸的封包總數。 |
tpu/multislice/network/grpc_tcp_packets_sent_count
BETA
(project)
gRPC TCP Packets Sent Count |
|
CUMULATIVE、INT64、1
gce_instance |
TCP 傳送的封包總數。 |
tpu/slice/capacity/available_chips
GA
(project)
Available TPU Chips Count |
|
GAUGE、INT64、1
compute.googleapis.com/AcceleratorSlice |
目前可供使用且隨時可用的擴充預訂 TPU 晶片數量。取樣頻率為每 60 秒一次。取樣完畢後,會有多達 360 秒無法查看資料。
accelerator_type:
加速器類型和世代。
reservation_id:
實體機器預留的 ID。
block_id:
與切片相關聯的區塊 ID。
subblock_id:
與切片相關聯的子區塊 ID。
provisioning_model:
相關聯的佈建模型。
protection_tier:
相關聯的保護模型。
|
tpu/slice/capacity/committed_chips
GA
(project)
購買的 TPU 晶片數量 |
|
GAUGE、INT64、1
compute.googleapis.com/AcceleratorSlice |
目前購買的延長預留 TPU 晶片數量。取樣頻率為每 60 秒一次。取樣完畢後,會有多達 360 秒無法查看資料。
accelerator_type:
加速器類型和世代。
reservation_id:
實體機器預留的 ID。
block_id:
與切片相關聯的區塊 ID。
subblock_id:
與切片相關聯的子區塊 ID。
provisioning_model:
相關聯的佈建模型。
protection_tier:
相關聯的保護模型。
|
instance/tpu/accelerator/core_temperature
BETA 版
(project)
核心溫度 |
|
GAUGE、DOUBLE、Cel
gce_instance |
TPU 的核心溫度。
accelerator_id:
加速器的裝置 ID。有效值為 0、1、2、3。
|
instance/tpu/accelerator/core_throttling_indicator
BETA
(project)
Core Throttling Indicator |
|
GAUGE、DOUBLE、1
gce_instance |
每秒略過的時脈週期數,除以每個 TPU 核心的時脈週期總數。
accelerator_id:
加速器的裝置 ID。有效值為 0、1、2、3。
|
instance/tpu/accelerator/hbm_power_draw
Beta 版
(專案)
HBM 耗電量 |
|
GAUGE、DOUBLE、W
gce_instance |
HBM 模組的功率總和 (瓦特)。
accelerator_id:
加速器的裝置 ID。有效值為 0、1、2、3。
|
instance/tpu/accelerator/hbm_temperature
測試版
(專案)
HBM 溫度參數 |
|
GAUGE、DOUBLE、Cel
gce_instance |
TPU 的高頻寬記憶體 (HBM) 溫度。
accelerator_id:
加速器的裝置 ID。有效值為 0、1、2、3。
hbm_id:
高頻寬記憶體 (HBM) 模組 ID。通常只有最高值,例如:hbm_0。
|
instance/tpu/accelerator/hbm_uncorrectable_count
BETA
(project)
HBM Uncorrectable Count |
|
CUMULATIVE、INT64、1
gce_instance |
HBM 中無法修正的錯誤數量 (致命)。
accelerator_id:
加速器的裝置 ID。有效值為 0、1、2、3。
|
instance/tpu/accelerator/mxu_temperature
BETA
(project)
MXU 溫度 |
|
GAUGE、DOUBLE、Cel
gce_instance |
TPU 的矩陣乘法單元 (MXU) 溫度。
accelerator_id:
加速器的裝置 ID。有效值為 0、1、2、3。
die_id:
加速器的插槽索引。通常只有最高值,例如:die_0。
|
instance/tpu/accelerator/network/ici_link_flaps
BETA
(project)
ICI 連結 Flaps |
|
GAUGE、INT64、1
gce_instance |
ICI 連結上向上和向下狀態之間的狀態變更頻率。
accelerator_id:
加速器的裝置 ID。有效值為 0、1、2、3。
|
instance/tpu/accelerator/network/ici_link_health
BETA
(project)
ICI 連結健康狀態 |
|
GAUGE、INT64、1
gce_instance |
代表 ICI 連結健康狀態的數字指標 (0 到 10)。值越高表示連結不穩定程度越高,從輕微的暫時性擺動 (1 到 5) 到持續效能下降 (6 到 9)。值為 10 代表連結發生嚴重故障,系統會自動終止運作中的工作負載。
port_id:
通訊埠 ID。
|
instance/tpu/accelerator/network/ici_packets_received_count
BETA 版
(專案)
收到的 ICI 封包數 |
|
CUMULATIVE、INT64、1
gce_instance |
TPU 加速器透過晶片間互連 (ICI) 連結接收的封包總數。
accelerator_id:
加速器的裝置 ID。有效值為 0、1、2、3。
|
instance/tpu/accelerator/network/ici_packets_sent_count
Beta 版
(專案)
ICI 封包傳送計數 |
|
CUMULATIVE、INT64、1
gce_instance |
TPU 加速器透過晶片間互連 (ICI) 連結傳輸的封包總數。
accelerator_id:
加速器的裝置 ID。有效值為 0、1、2、3。
|
instance/tpu/accelerator/pcie_fatal_error_count
Beta 版
(專案)
PCIe 致命錯誤計數 |
|
CUMULATIVE、INT64、1
gce_instance |
在 PCIe 介面發生的致命 PCIe 錯誤次數。
accelerator_id:
加速器的裝置 ID。有效值為 0、1、2、3。
|
instance/tpu/accelerator/pcie_nonfatal_error_count
Beta 版
(專案)
PCIe 非致命錯誤計數 |
|
CUMULATIVE、INT64、1
gce_instance |
在 PCIe 介面發生的非致命 PCIe 錯誤數量。
accelerator_id:
加速器的裝置 ID。有效值為 0、1、2、3。
|
instance/tpu/accelerator/power_draw
BETA
(專案)
Power Draw |
|
GAUGE、DOUBLE、W
gce_instance |
加速器耗電量,以瓦特 (W) 為單位。
accelerator_id:
加速器的裝置 ID。有效值為 0、1、2、3。
|
instance/tpu/accelerator/tray_power
Beta 版
(專案)
工作匣電源 |
|
GAUGE、DOUBLE、W
gce_instance |
TPU 匣的總耗電量。
accelerator_id:
加速器的裝置 ID。有效值為 0、1、2、3。
|
instance/tpu/accelerator/tray_temperature
BETA
(project)
Tray Temperature |
|
GAUGE、DOUBLE、Cel
gce_instance |
TPU 的托盤溫度。
accelerator_id:
加速器的裝置 ID。有效值為 0、1、2、3。
|
instance/tpu/failure_prediction_status
BETA
(project)
TPU 效能降低狀態 |
|
GAUGE、INT64、1
gce_instance |
這項指標表示我們專屬演算法預測的機率,也就是 TPU 機器在接下來 5 小時內進入效能降低狀態的機率。這項指標的值標籤為 NO_DEGRADATION_PREDICTED、DEGRADATION_PREDICTED、POSSIBLE_DEGRADATION_PREDICTED。取樣頻率為每 60 秒一次。取樣完畢後,會有多達 540 秒無法查看資料。
cluster_id:
託管 VM 的叢集模糊處理 ID。
block_id:
託管 VM 的叢集內模糊處理的區塊 ID。
subblock_id:
託管 VM 的模糊處理子區塊 ID。
machine_id:
主機 VM 的模糊處理名稱。
reservation_id:
預留項目 ID。
Value:
我們專有演算法預測,TPU 機器會在接下來 5 小時內進入效能降低狀態。可能的值為「NO_DEGRADATION_PREDICTED」、「DEGRADATION_PREDICTED」、「POSSIBLE_DEGRADATION_PREDICTED」。
|
tpu/capacity/available_chips
BETA
(project)
可用的 TPU 晶片數量 |
|
GAUGE、INT64、1
compute.googleapis.com/Location |
目前可供使用的 TPU 晶片數量。
accelerator_type:加速器類型和世代。reservation_id:
實體機器預留的 ID。
provisioning_model:
相關聯的佈建模型。
protection_tier:
相關聯的保護模型。
is_exr:
指出 TPU 晶片是否屬於延長預訂。
|
tpu/capacity/committed_chips
BETA 版
(專案)
購買的 TPU 晶片數量 |
|
GAUGE、INT64、1
compute.googleapis.com/Location |
目前購買的 TPU 晶片數量。
accelerator_type:加速器類型和世代。reservation_id:
實體機器預留的 ID。
provisioning_model:
相關聯的佈建模型。
protection_tier:
相關聯的保護模型。
is_exr:
指出 TPU 晶片是否屬於延長預訂。
|
tpu/network/nic_packets_dropped_count_rx
Beta 版
(專案)
NIC 封包捨棄計數 Rx |
|
CUMULATIVE、INT64、1
gce_instance |
主機 NIC 捨棄的傳入或傳出封包總數 (適用於 RX)。
nic_id:
Nic Id。
|
tpu/network/nic_packets_dropped_count_tx
BETA
(project)
NIC 封包捨棄計數 Tx |
|
CUMULATIVE、INT64、1
gce_instance |
主機 NIC 捨棄的傳輸 (TX) 封包總數。
nic_id:
Nic Id。
|
tpu/network/nic_packets_received_count
BETA 版
(專案)
收到的 NIC 封包數 |
|
CUMULATIVE、INT64、1
gce_instance |
NIC 收到的封包總數。
nic_id:
Nic Id。
|
tpu/network/nic_packets_sent_count
Beta 版
(專案)
傳送的 NIC 封包數 |
|
CUMULATIVE、INT64、1
gce_instance |
NIC 傳送的封包總數。
nic_id:
Nic Id。
|
如需 Compute Engine 產生的指標完整清單,請參閱「 Compute Engine 指標」。
AI 遙測資料收集器
AI 遙測收集器會收集並發布使用 Compute Engine API 建立的 TPU 指標,這些指標位於 compute.googleapis.com 命名空間下。這些是內建的系統指標,可讓您掌握健康狀態和效能。
AI 遙測收集器架構設計為輕量型專用 OpenTelemetry (OTEL) 收集器。這項功能會使用兩個主要接收器擷取資料:
- TPU 執行階段接收器:在機器學習工作負載處於活動狀態時,直接從 TPU 執行階段擷取執行階段和工作負載指標 (例如工作週期和記憶體用量)。
- TPU 主機接收器:直接從裝置擷取硬體使用率指標,例如 TensorCore 使用率和記憶體頻寬使用率,無論工作負載是否正在執行。
接著,AI 遙測收集器會使用處理器自動套用必要的資源標記 (例如 project_id、instance_id 和 zone),並直接將遙測資料安全地匯出至 Cloud Monitoring。
Google 的 TPU 最佳化 Ubuntu LTS 映像檔已預先安裝 AI 遙測收集器,且會在 VM 啟動時自動執行。如要使用這項設定,請在建立 TPU VM 執行個體或執行個體範本時,指定官方的 Google 加速器映像檔專案和系列。VM 啟動後,AI 遙測收集器會自動將指標傳送至 Cloud Monitoring 資訊主頁。
如果您要建構自訂作業系統映像檔,可以安裝並執行 ai-telemetry-collector Docker 映像檔後,使用 AI 遙測收集器。詳情請參閱「使用自訂 OS 映像檔」。
設定
AI 遙測收集器會自動將指標傳送至 Cloud Monitoring 資訊主頁,不需要任何額外設定步驟。不過,您可以設定 Snap 套件或 Docker 映像檔,新增外部匯出目的地、變更指標收集間隔,以及加入偵錯選項。
您可以將預設設定替換為新的設定檔,也可以在現有的預設設定中附加其他設定檔。新增設定時,系統會新增不存在的金鑰,並覆寫現有金鑰。不過,陣列和清單不會累加,因此新清單必須同時包含現有和新值。
下列 YAML 檔案會設定 AI Telemetry Collector,將指標傳送至 Prometheus,這是一套開放原始碼的系統監控和快訊工具包。此外,這項功能也會啟用偵錯選項,在控制台中列印指標。
exporters:
prometheus:
endpoint: 0.0.0.0:8889
service:
pipelines:
metrics:
exporters:
- prometheus # For more: https://prometheus.io/docs/introduction/overview/
- googlecloud # If you do not include this, you'll lose Google Cloud Monitoring
- debug # print metrics within the console
預設作業系統
如果您使用 Google 的 TPU 最佳化 Ubuntu LTS 映像檔,請執行下列 Snap 指令,將新設定檔新增至現有設定:
sudo snap set \
ai-telemetry-collector \
extra-flags="--config /home/username/additional-config.yaml"
如要覆寫並取代現有設定,請使用 config-path 旗標,而非 extra-flags:
sudo snap set \
ai-telemetry-collector \
config-path="/home/username/new-config.yaml"
snap set 指令應會觸發 AI 遙測收集器自動重新啟動。如要確認收集器已重新啟動並順利套用設定,請使用下列指令查看記錄:
sudo snap logs -f ai-telemetry-collector
自訂作業系統
如果您使用自訂 OS,請執行下列 Docker 指令,將新的設定檔新增至現有設定:
# First apply the default configs via `--config=/etc/ai-telemetry-collector/config.yaml`
# Then apply your additional config by volume mount.
docker run --privileged --net=host \
-v <path>/additional-config.yaml:/etc/ai-telemetry-collector/additional-config.yaml \
ai-telemetry-collector:latest \
--config=/etc/ai-telemetry-collector/config.yaml \
--config=/etc/ai-telemetry-collector/additional-config.yaml
如要覆寫並取代現有設定,請使用下列 Docker 指令:
# Mount a volume (your config file) to `/etc/ai-telemetry-collector/config.yaml`
# The binary automatically picks up this file.
docker run --privileged --net=host \
-v <path>/my-config.yaml:/etc/ai-telemetry-collector/config.yaml \
ai-telemetry-collector:latest
稽核記錄
Google Cloud 服務會產生稽核記錄,用於記錄 Google Cloud 資源中的管理和存取活動。詳情請參閱「 Compute Engine 稽核記錄」。