Monitora le VM TPU
Questa guida spiega come utilizzare Cloud Monitoring per monitorare le VM TPU. Cloud Monitoring raccoglie automaticamente metriche e log dalla TPU e dalla relativa VM host. Questi dati possono essere utilizzati per monitorare l'integrità della TPU e di Compute Engine.
Le metriche ti consentono di monitorare una quantità numerica nel tempo, ad esempio l'utilizzo della CPU, l'utilizzo della rete o la durata di inattività di TensorCore. I log acquisiscono gli eventi in un momento specifico. Le voci di log vengono scritte dal tuo codice, Google Cloud dai servizi, dalle applicazioni di terze parti e dall' Google Cloud infrastruttura. Puoi anche generare metriche dai dati presenti in una voce di log creando una metrica basata su log. Puoi anche impostare criteri di avviso in base ai valori delle metriche o alle voci di log.
Per monitorare le TPU, puoi anche utilizzare Capacity Planner (anteprima). Con Capacity Planner, puoi visualizzare i dati di utilizzo e di previsione delle TPU per il tuo progetto, la tua cartella o la tua organizzazione. Questi dati vengono aggiornati ogni 24 ore e puoi utilizzarli per analizzare le tendenze di utilizzo e pianificare le esigenze di capacità future. Per saperne di più, consulta la panoramica di Capacity Planner.
Accedere alle metriche TPU
Compute Engine genera due tipi di metriche TPU: metriche di runtime TPU e metriche dell'infrastruttura VM TPU. Puoi ottenere le metriche in due modi:
Libreria di monitoraggio TPU: recupera le metriche di runtime TPU dall'SDK LibTPU utilizzando la libreria di monitoraggio TPU. In questo modo le tue applicazioni possono ottenere telemetria in tempo reale dall'interno dell'ambiente guest. Per saperne di più, consulta la libreria di monitoraggio TPU.
AI Telemetry Collector: ottieni metriche di runtime e metriche dell'infrastruttura VM tramite AI Telemetry Collector. AI Telemetry Collector viene eseguito all'interno della VM TPU e ti consente di accedere alle metriche tramite Cloud Monitoring o tramite la tua pipeline di monitoraggio basata su Prometheus. Per saperne di più, consulta AI Telemetry Collector.
Metriche TPU
Le metricheGoogle Cloud per Cloud TPU vengono generate automaticamente dalle VM Compute Engine e dal runtime Cloud TPU. Le metriche nella tabella seguente vengono generate dalle VM Compute Engine.
Le stringhe "tipo di metrica" in questa tabella devono essere precedute dal prefisso
compute.googleapis.com/. Questo prefisso è stato omesso dalle voci della tabella. Quando esegui una query su un'etichetta, utilizza il prefisso metric.labels; ad esempio,
metric.labels.LABEL="VALUE".
| Tipo di metrica Fase di lancio (livelli della gerarchia delle risorse) Nome visualizzato |
|
|---|---|
| Tipo, Tipo, Unità Risorse monitorate |
Descrizione Etichette |
instance/tpu/accelerator/duty_cycle
BETA
(progetto)
Ciclo di servizio dell'acceleratore |
|
GAUGE, DOUBLE, %
gce_instance |
Percentuale di tempo nel periodo di campionamento durante il quale l'acceleratore ha eseguito attivamente l'elaborazione. I valori sono compresi nell'intervallo [0,100].
accelerator_id:
ID dispositivo dell'acceleratore.
|
instance/tpu/accelerator/memory_bandwidth_utilization
BETA
(progetto)
Utilizzo larghezza di banda memoria acceleratore |
|
GAUGE, DOUBLE, %
gce_instance |
Percentuale attuale della larghezza di banda della memoria dell'acceleratore in uso. Questo valore viene calcolato dividendo la larghezza di banda della memoria utilizzata in un periodo di campionamento per la larghezza di banda massima supportata nello stesso periodo di campionamento.
accelerator_id:
ID dispositivo dell'acceleratore.
|
instance/tpu/accelerator/memory_total
BETA
(progetto)
Memoria totale acceleratore |
|
GAUGE, INT64, By
gce_instance |
Memoria totale dell'acceleratore attualmente allocata in byte.
accelerator_id:
ID dispositivo dell'acceleratore.
|
instance/tpu/accelerator/memory_used
BETA
(progetto)
Memoria utilizzata dall'acceleratore |
|
GAUGE, INT64, By
gce_instance |
Memoria totale dell'acceleratore attualmente utilizzata in byte.
accelerator_id:
ID dispositivo dell'acceleratore.
|
instance/tpu/accelerator/tensorcore_utilization
BETA
(progetto)
Utilizzo Tensor Core dell'acceleratore |
|
GAUGE, DOUBLE, %
gce_instance |
Percentuale attuale di Tensorcore utilizzata. Viene calcolata dividendo il numero di operazioni Tensorcore eseguite in un periodo di campionamento per il numero di operazioni Tensorcore supportate nello stesso periodo di campionamento.
accelerator_id:
ID dispositivo dell'acceleratore.
|
instance/tpu/active_chips
GA
(progetto)
Conteggio chip TPU attivi |
|
GAUGE, INT64, 1
gce_instance |
Il numero attuale di chip utilizzati attivamente (ovvero non inattivi).
accelerator_type:
Tipo e generazione dell'acceleratore.
reservation_id:
L'ID della prenotazione della macchina fisica.
provisioning_model:
Il modello di provisioning associato.
protection_tier:
Il modello di protezione associato.
block_id:
L'ID del blocco all'interno del cluster che ospita la VM.
subblock_id:
L'ID del sotto-blocco che ospita la VM.
is_exr:
(BOOL)
Indica se il chip fa parte di una prenotazione estesa.
|
instance/tpu/chip_state
BETA
(progetto)
Conteggio stato chip TPU |
|
GAUGE, INT64, 1
gce_instance |
Il conteggio dei chip TPU in vari stati, ad esempio Integro, Non integro e Sconosciuto.
state:
Lo stato del chip.
accelerator_type:
Tipo e generazione dell'acceleratore.
block_id:
L'ID del blocco all'interno del cluster che ospita la VM.
subblock_id:
L'ID del sotto-blocco che ospita la VM.
reservation_id:
L'ID della prenotazione della macchina fisica.
is_exr:
(BOOL)
Indica se il chip fa parte di una prenotazione estesa.
|
instance/tpu/infra_health
BETA
(progetto)
Integrità dell'istanza TPU |
|
GAUGE, INT64, 1
gce_instance |
Indica lo stato di integrità generale di un'istanza TPU. Le etichette delle metriche aiutano a identificare lo stato di salute specifico e i motivi dei problemi relativi alle istanze TPU degradate o non integre, concentrandosi principalmente sull'integrità dell'hardware e del sistema TPU. Potrebbero essere necessari diversi minuti prima che le modifiche dello stato di integrità vengano visualizzate in questa metrica. Campionamento eseguito ogni 60 secondi. Dopo il campionamento, i dati non sono visibili per un massimo di 420 secondi.
health_status:
Lo stato di integrità complessivo dell'istanza TPU. Valori possibili: HEALTHY (funzionamento come previsto), UNHEALTHY (problema critico rilevato), DEGRADED (problema che influisce sulle prestazioni), UNKNOWN (lo stato non può essere determinato).
unhealthy_category:
Spiegazione dello stato non integro della VM. Questa etichetta viene compilata solo quando il valore della metrica è Unhealthy.
machine_type:
Il tipo di macchina dell'istanza (ad es. ct6e-standard-4t-tpu).
machine_id:
L'ID della macchina fisica che ospita la VM.
block_id:
L'ID del blocco all'interno del cluster che ospita la VM.
cluster_id:
L'ID del cluster che ospita la VM.
reservation_id:
L'ID della prenotazione della macchina fisica.
subblock_id:
L'ID del sotto-blocco che ospita la VM.
|
instance/tpu/runtime/uptime
BETA
(progetto)
Tempo di attività del runtime |
|
GAUGE, INT64, s
gce_instance |
Tempo di attività di ML Runtime dall'inizializzazione della libreria di runtime (libtpu.so) da parte del job ML. Durante questo periodo, la libreria di runtime blocca l'utilizzo dei dispositivi TPU per il job ML.
ml_framework_name:
Nome del framework ML.
ml_framework_version:
Versione del framework ML.
|
instance/tpu/scheduled_chips
GA
(progetto)
Conteggio chip TPU pianificati |
|
GAUGE, INT64, 1
gce_instance |
Il conteggio attuale dei chip allocati a una VM in stato INTEGRO e NON DISABILITATA per la manutenzione.
accelerator_type:
Tipo e generazione dell'acceleratore.
reservation_id:
L'ID della prenotazione della macchina fisica.
provisioning_model:
Il modello di provisioning associato.
protection_tier:
Il modello di protezione associato.
block_id:
L'ID del blocco all'interno del cluster che ospita la VM.
subblock_id:
L'ID del sotto-blocco che ospita la VM.
is_exr:
(BOOL)
Indica se il chip fa parte di una prenotazione estesa.
|
instance/tpu/utilized_chips
BETA
(progetto)
Chip TPU utilizzati |
|
GAUGE, DOUBLE, 1
gce_instance |
La capacità aggregata utilizzata corrente espressa come numero effettivo di chip attivi. È equivalente alla somma dell'utilizzo frazionario (da 0,0 a 1,0) di tutti i chip attivi.
accelerator_type:
Tipo e generazione dell'acceleratore.
reservation_id:
L'ID della prenotazione della macchina fisica.
provisioning_model:
Il modello di provisioning associato.
protection_tier:
Il modello di protezione associato.
block_id:
L'ID del blocco all'interno del cluster che ospita la VM.
subblock_id:
L'ID del sotto-blocco che ospita la VM.
is_exr:
(BOOL)
Indica se il chip fa parte di una prenotazione estesa.
|
quota/tpus_per_tpu_family/exceeded
ALPHA
(project)
TPU count per TPU family. quota exceeded error |
|
DELTA, INT64, 1
compute.googleapis.com/Location |
Numero di tentativi per superare il limite per la metrica di quota compute.googleapis.com/tpus_per_tpu_family. Dopo il campionamento, i dati non sono visibili per un massimo di 150 secondi.
limit_name:
Il nome del limite.
tpu_family:
Dimensione personalizzata della famiglia di TPU.
|
quota/tpus_per_tpu_family/limit
ALPHA
(progetto)
Numero di TPU per famiglia di TPU. Limite di quota |
|
GAUGE, INT64, 1
compute.googleapis.com/Location |
Limite attuale per il calcolo della metrica di quota compute.googleapis.com/tpus_per_tpu_family. Campionamento eseguito ogni 60 secondi. Dopo il campionamento, i dati non sono visibili per un massimo di 150 secondi.
limit_name:
Il nome del limite.
tpu_family:
Dimensione personalizzata della famiglia di TPU.
|
quota/tpus_per_tpu_family/usage
ALPHA
(progetto)
Conteggio TPU per famiglia di TPU. Utilizzo della quota |
|
GAUGE, INT64, 1
compute.googleapis.com/Location |
Utilizzo attuale del calcolo della metrica di quota compute.googleapis.com/tpus_per_tpu_family. Dopo il campionamento, i dati non sono visibili per un massimo di 150 secondi.
limit_name:
Il nome del limite.
tpu_family:
Dimensione personalizzata della famiglia di TPU.
|
tpu/multislice/accelerator/device_to_host_transfer_latencies
BETA
(progetto)
Latenze di trasferimento da dispositivo a host |
|
CUMULATIVE, DISTRIBUTION, us
gce_instance |
Distribuzione cumulativa della latenza di trasferimento da dispositivo a host per ogni blocco di dati. Una latenza inizia quando viene emessa la richiesta di trasferimento dei dati all'host e termina quando viene ricevuta una conferma che il trasferimento dei dati è stato completato.
buffer_size:
Dimensione del buffer.
|
tpu/multislice/accelerator/host_to_device_transfer_latencies
BETA
(progetto)
Latenze di trasferimento da host a dispositivo |
|
CUMULATIVE, DISTRIBUTION, us
gce_instance |
Distribuzione cumulativa della latenza di trasferimento da host a dispositivo per ogni blocco di dati del traffico multislice. Una latenza inizia quando viene emessa la richiesta di trasferimento dei dati al dispositivo e termina quando viene ricevuta una conferma che il trasferimento dei dati è stato completato.
buffer_size:
Dimensione del buffer.
|
tpu/multislice/network/collective_end_to_end_latencies
BETA
(progetto)
Latenze collettive end-to-end |
|
CUMULATIVE, DISTRIBUTION, us
gce_instance |
Distribuzione cumulativa della latenza collettiva end-to-end per il traffico multislice. Una latenza inizia quando viene emessa la richiesta per la raccolta e termina quando viene ricevuta una conferma che il trasferimento dei dati è stato completato.
input_size:
Dimensione dell'input dell'operazione collettiva.
collective_type:
Tipo di operazione collettiva.
|
tpu/multislice/network/dcn_transfer_latencies
BETA
(progetto)
Latenze di trasferimento DCN |
|
CUMULATIVE, DISTRIBUTION, us
gce_instance |
Distribuzione cumulativa delle latenze di trasferimento di rete per il traffico multislice. Una latenza inizia quando viene emessa la richiesta di trasferimento dei dati tramite la DCN e termina quando viene ricevuta la conferma che il trasferimento dei dati è stato completato.
buffer_size:
Dimensione del buffer.
type:
Tipo.
|
tpu/multislice/network/grpc_client_call_latencies
BETA
(progetto)
Latenze delle chiamate del client gRPC |
|
CUMULATIVE, DISTRIBUTION, us
gce_instance |
Distribuzione cumulativa delle latenze di trasferimento di rete per il completamento di una RPC dalla prospettiva del chiamante da parte della libreria gRPC.
buffer_size:
Dimensione del buffer.
|
tpu/multislice/network/grpc_server_call_latencies
BETA
(progetto)
Latenze delle chiamate del server gRPC |
|
CUMULATIVE, DISTRIBUTION, us
gce_instance |
Distribuzione cumulativa delle latenze di trasferimento di rete per il completamento di una RPC da parte del server gRPC dal punto di vista del trasporto.
buffer_size:
Dimensione del buffer.
|
tpu/multislice/network/grpc_tcp_delivery_rates
BETA
(progetto)
Tassi di distribuzione TCP gRPC |
|
CUMULATIVE, DISTRIBUTION, Mb/s
gce_instance |
Distribuzione cumulativa delle velocità di trasferimento dei dati delle connessioni TCP. Ogni campione è la velocità di trasferimento dati media più recente per una determinata connessione TCP nell'ultimo intervallo di ACK TCP. I campioni delle velocità di trasferimento dei dati vengono estratti dal kernel TCP di Linux ogni 20 secondi, quindi è prevedibile che ogni connessione TCP crei circa 3 campioni ogni 60 secondi. |
tpu/multislice/network/grpc_tcp_min_round_trip_times
BETA
(progetto)
Tempi di andata e ritorno minimi TCP gRPC |
|
CUMULATIVE, DISTRIBUTION, us
gce_instance |
Distribuzione cumulativa delle latenze minime di trasferimento di rete per connessione TCP. |
tpu/multislice/network/grpc_tcp_packets_retransmitted_count
BETA
(progetto)
Conteggio pacchetti TCP gRPC ritrasmessi |
|
CUMULATIVE, INT64, 1
gce_instance |
Conteggio totale dei pacchetti ritrasmessi. |
tpu/multislice/network/grpc_tcp_packets_sent_count
BETA
(project)
gRPC TCP Packets Sent Count |
|
CUMULATIVE, INT64, 1
gce_instance |
Conteggio totale dei pacchetti inviati da TCP. |
tpu/slice/capacity/available_chips
GA
(progetto)
Conteggio chip TPU disponibili |
|
GAUGE, INT64, 1
compute.googleapis.com/AcceleratorSlice |
Il numero attuale di chip TPU della prenotazione estesa che sono attivamente disponibili e pronti per l'uso. Campionamento eseguito ogni 60 secondi. Dopo il campionamento, i dati non sono visibili per un massimo di 360 secondi.
accelerator_type:
Tipo e generazione dell'acceleratore.
reservation_id:
L'ID della prenotazione della macchina fisica.
block_id:
L'ID blocco associato alla sezione.
subblock_id:
L'ID del sottoblocco associato alla sezione.
provisioning_model:
Il modello di provisioning associato.
protection_tier:
Il modello di protezione associato.
|
tpu/slice/capacity/committed_chips
GA
(progetto)
Conteggio chip TPU acquistati |
|
GAUGE, INT64, 1
compute.googleapis.com/AcceleratorSlice |
Il conteggio attuale dei chip TPU acquistati con la prenotazione estesa. Campionamento eseguito ogni 60 secondi. Dopo il campionamento, i dati non sono visibili per un massimo di 360 secondi.
accelerator_type:
Tipo e generazione dell'acceleratore.
reservation_id:
L'ID della prenotazione della macchina fisica.
block_id:
L'ID blocco associato alla sezione.
subblock_id:
L'ID del sottoblocco associato alla sezione.
provisioning_model:
Il modello di provisioning associato.
protection_tier:
Il modello di protezione associato.
|
instance/tpu/accelerator/core_temperature
BETA
(progetto)
Temperatura interna |
|
GAUGE, DOUBLE, Cel
gce_instance |
Temperatura del core della TPU.
accelerator_id:
L'ID dispositivo dell'acceleratore. I valori validi sono 0, 1, 2, 3.
|
instance/tpu/accelerator/core_throttling_indicator
BETA
(progetto)
Indicatore di limitazione principale |
|
GAUGE, DOUBLE, 1
gce_instance |
Numero di cicli di clock saltati al secondo rispetto al numero totale di cicli di clock per core TPU.
accelerator_id:
L'ID dispositivo dell'acceleratore. I valori validi sono 0, 1, 2, 3.
|
instance/tpu/accelerator/hbm_power_draw
BETA
(progetto)
Assorbimento di potenza HBM |
|
GAUGE, DOUBLE, W
gce_instance |
Somma della potenza sul modulo HBM in watt (W).
accelerator_id:
L'ID dispositivo dell'acceleratore. I valori validi sono 0, 1, 2, 3.
|
instance/tpu/accelerator/hbm_temperature
BETA
(progetto)
Temperatura HBM |
|
GAUGE, DOUBLE, Cel
gce_instance |
Temperatura della memoria ad alta larghezza di banda (HBM) della TPU.
accelerator_id:
L'ID dispositivo dell'acceleratore. I valori validi sono 0, 1, 2, 3.
hbm_id:
Identificatore del modulo di memoria a larghezza di banda elevata (HBM). Di solito ha solo il valore più alto, ad esempio hbm_0.
|
instance/tpu/accelerator/hbm_uncorrectable_count
BETA
(progetto)
Conteggio errori HBM non correggibili |
|
CUMULATIVE, INT64, 1
gce_instance |
Conteggio degli errori non correggibili in HBM (irreversibili).
accelerator_id:
L'ID dispositivo dell'acceleratore. I valori validi sono 0, 1, 2, 3.
|
instance/tpu/accelerator/mxu_temperature
BETA
(progetto)
Temperatura MXU |
|
GAUGE, DOUBLE, Cel
gce_instance |
Temperatura dell'unità di moltiplicazione della matrice (MXU) della TPU.
accelerator_id:
L'ID dispositivo dell'acceleratore. I valori validi sono 0, 1, 2, 3.
die_id:
Indice dello slot per l'acceleratore. In genere ha solo il valore più alto, ad esempio die_0.
|
instance/tpu/accelerator/network/ici_link_flaps
BETA
(progetto)
ICI Link Flaps |
|
GAUGE, INT64, 1
gce_instance |
Frequenza delle modifiche dello stato tra gli stati su e giù in un link ICI.
accelerator_id:
L'ID dispositivo dell'acceleratore. I valori validi sono 0, 1, 2, 3.
|
instance/tpu/accelerator/network/ici_link_health
BETA
(progetto)
ICI Link Health |
|
GAUGE, INT64, 1
gce_instance |
Un indicatore numerico (0-10) che rappresenta l'integrità del link ICI. Valori più elevati indicano livelli crescenti di instabilità del collegamento, da flapping minori e temporanei (1-5) a prestazioni degradate persistenti (6-9). Un valore pari a 10 rappresenta un errore irreversibile del collegamento che espelle automaticamente i carichi di lavoro attivi.
port_id:
ID porta.
|
instance/tpu/accelerator/network/ici_packets_received_count
BETA
(progetto)
Conteggio pacchetti ICMP ricevuti |
|
CUMULATIVE, INT64, 1
gce_instance |
Numero totale di pacchetti ricevuti dall'acceleratore TPU tramite i suoi link Inter-Chip Interconnect (ICI).
accelerator_id:
L'ID dispositivo dell'acceleratore. I valori validi sono 0, 1, 2, 3.
|
instance/tpu/accelerator/network/ici_packets_sent_count
BETA
(progetto)
Conteggio pacchetti ICI inviati |
|
CUMULATIVE, INT64, 1
gce_instance |
Numero totale di pacchetti trasmessi dall'acceleratore TPU tramite i suoi link Inter-Chip Interconnect (ICI).
accelerator_id:
L'ID dispositivo dell'acceleratore. I valori validi sono 0, 1, 2, 3.
|
instance/tpu/accelerator/pcie_fatal_error_count
BETA
(progetto)
Conteggio errori irreversibili PCIe |
|
CUMULATIVE, INT64, 1
gce_instance |
Numero di errori PCIe irreversibili che si verificano nell'interfaccia PCIe.
accelerator_id:
L'ID dispositivo dell'acceleratore. I valori validi sono 0, 1, 2, 3.
|
instance/tpu/accelerator/pcie_nonfatal_error_count
BETA
(progetto)
Conteggio errori non irreversibili PCIe |
|
CUMULATIVE, INT64, 1
gce_instance |
Numero di errori PCIe non irreversibili che si verificano nell'interfaccia PCIe.
accelerator_id:
L'ID dispositivo dell'acceleratore. I valori validi sono 0, 1, 2, 3.
|
instance/tpu/accelerator/power_draw
BETA
(progetto)
Assorbimento di energia |
|
GAUGE, DOUBLE, W
gce_instance |
Consumo energetico dell'acceleratore misurato in watt (W).
accelerator_id:
L'ID dispositivo dell'acceleratore. I valori validi sono 0, 1, 2, 3.
|
instance/tpu/accelerator/tray_power
BETA
(progetto)
Tray Power |
|
GAUGE, DOUBLE, W
gce_instance |
Potenza totale assorbita dal vassoio TPU.
accelerator_id:
L'ID dispositivo dell'acceleratore. I valori validi sono 0, 1, 2, 3.
|
instance/tpu/accelerator/tray_temperature
BETA
(progetto)
Temperatura del vassoio |
|
GAUGE, DOUBLE, Cel
gce_instance |
Temperatura del vassoio della TPU.
accelerator_id:
L'ID dispositivo dell'acceleratore. I valori validi sono 0, 1, 2, 3.
|
instance/tpu/failure_prediction_status
BETA
(progetto)
Stato di degrado della TPU |
|
GAUGE, INT64, 1
gce_instance |
Questa metrica indica la probabilità che una macchina TPU entri in uno stato di degrado entro le prossime 5 ore, come previsto dal nostro algoritmo proprietario. L'etichetta del valore per questa metrica è NO_DEGRADATION_PREDICTED, DEGRADATION_PREDICTED, POSSIBLE_DEGRADATION_PREDICTED. Campionamento eseguito ogni 60 secondi. Dopo il campionamento, i dati non sono visibili per un massimo di 540 secondi.
cluster_id:
L'ID cluster oscurato del cluster che ospita la VM.
block_id:
L'ID blocco oscurato all'interno del cluster che ospita la VM.
subblock_id:
L'ID del sottoblocco offuscato che ospita la VM.
machine_id:
Il nome della macchina offuscato che ospita la VM.
reservation_id:
L'ID prenotazione.
Value:
Lo stato di una macchina TPU che entrerà in uno stato di degrado nelle prossime 5 ore, come previsto dal nostro algoritmo proprietario. I valori possibili sono "NO_DEGRADATION_PREDICTED", "DEGRADATION_PREDICTED", "POSSIBLE_DEGRADATION_PREDICTED".
|
tpu/capacity/available_chips
BETA
(project)
Available TPU Chips Count |
|
GAUGE, INT64, 1
compute.googleapis.com/Location |
Il numero attuale di chip TPU disponibili e pronti all'uso.
accelerator_type:
Il tipo e la generazione dell'acceleratore.
reservation_id:
L'ID della prenotazione della macchina fisica.
provisioning_model:
Il modello di provisioning associato.
protection_tier:
Il modello di protezione associato.
is_exr:
Indica se il chip TPU fa parte di una prenotazione estesa.
|
tpu/capacity/committed_chips
BETA
(progetto)
Conteggio chip TPU acquistati |
|
GAUGE, INT64, 1
compute.googleapis.com/Location |
Il conteggio attuale dei chip TPU acquistati.
accelerator_type:
Il tipo e la generazione dell'acceleratore.
reservation_id:
L'ID della prenotazione della macchina fisica.
provisioning_model:
Il modello di provisioning associato.
protection_tier:
Il modello di protezione associato.
is_exr:
Indica se il chip TPU fa parte di una prenotazione estesa.
|
tpu/network/nic_packets_dropped_count_rx
BETA
(progetto)
Conteggio pacchetti NIC eliminati Rx |
|
CUMULATIVE, INT64, 1
gce_instance |
Il numero totale di pacchetti in entrata o in uscita eliminati dalla NIC host, per RX.
nic_id:
Nic Id.
|
tpu/network/nic_packets_dropped_count_tx
BETA
(project)
NIC Packets Dropped Count Tx |
|
CUMULATIVE, INT64, 1
gce_instance |
Il numero totale di pacchetti in entrata o in uscita eliminati dalla NIC host, per TX.
nic_id:
Nic Id.
|
tpu/network/nic_packets_received_count
BETA
(progetto)
Conteggio pacchetti NIC ricevuti |
|
CUMULATIVE, INT64, 1
gce_instance |
Il conteggio totale dei pacchetti ricevuti dalla NIC.
nic_id:
Nic Id.
|
tpu/network/nic_packets_sent_count
BETA
(progetto)
Conteggio pacchetti NIC inviati |
|
CUMULATIVE, INT64, 1
gce_instance |
Il conteggio totale dei pacchetti inviati dalla scheda di interfaccia di rete.
nic_id:
Nic Id.
|
Per un elenco completo delle metriche generate da Compute Engine, consulta Metriche di Compute Engine.
AI Telemetry Collector
AI Telemetry Collector raccoglie e pubblica le metriche TPU nello spazio dei nomi compute.googleapis.com per le TPU create utilizzando l'API Compute Engine.
Queste metriche sono metriche di sistema integrate, che forniscono visibilità sull'integrità e sulle prestazioni.
L'architettura di AI Telemetry Collector è progettata come un raccoglitore OpenTelemetry (OTEL) leggero e specializzato. Utilizza due ricevitori principali per acquisire i dati:
- Ricevitore runtime TPU: esegue lo scraping delle metriche di runtime e del carico di lavoro (come il ciclo di lavoro e la memoria utilizzata) direttamente dal runtime TPU quando è attivo un carico di lavoro di machine learning.
- Ricevitore host TPU: acquisisce le metriche di utilizzo dell'hardware, ad esempio l'utilizzo di TensorCore e l'utilizzo della larghezza di banda della memoria, direttamente dal dispositivo indipendentemente dal fatto che sia in esecuzione un workload.
Il raccoglitore di dati di telemetria AI utilizza quindi i processori per applicare automaticamente i tag delle risorse necessari (ad esempio project_id, instance_id e zone) ed esporta in modo sicuro i dati di telemetria direttamente in Cloud Monitoring.
AI Telemetry Collector è preinstallato nelle immagini Ubuntu LTS ottimizzate per le TPU di Google e viene eseguito automaticamente all'avvio della VM. Per utilizzare questa configurazione, specifica il progetto e la famiglia di immagini dell'acceleratore Google ufficiali quando crei un'istanza VM TPU o un modello di istanza. Una volta avviata la VM, AI Telemetry Collector invia automaticamente le metriche alle dashboard di Cloud Monitoring.
Se crei immagini del sistema operativo personalizzate, puoi utilizzare AI Telemetry Collector dopo aver installato ed eseguito l'immagine Docker ai-telemetry-collector. Per saperne di più, consulta Utilizzare un'immagine del sistema operativo personalizzata.
Configurazione
AI Telemetry Collector invia automaticamente le metriche alle dashboard di Cloud Monitoring e non richiede ulteriori passaggi di configurazione. Tuttavia, puoi configurare il pacchetto Snap o l'immagine Docker per aggiungere destinazioni di esportazione esterne, modificare gli intervalli di raccolta delle metriche e includere opzioni di debug.
Puoi sostituire la configurazione predefinita con un nuovo file di configurazione oppure aggiungere un file di configurazione aggiuntivo alla configurazione predefinita esistente. Quando aggiungi configurazioni, le chiavi che non esistono già vengono aggiunte e quelle che esistono già vengono sovrascritte. Tuttavia, gli array e gli elenchi non sono additivi, quindi i nuovi elenchi devono includere sia i valori esistenti che quelli nuovi.
Il seguente file YAML configura AI Telemetry Collector per inviare metriche a Prometheus, un toolkit di avviso e monitoraggio dei sistemi open source. Consente inoltre l'opzione di debug, che stampa le metriche all'interno della console.
exporters:
prometheus:
endpoint: 0.0.0.0:8889
service:
pipelines:
metrics:
exporters:
- prometheus # For more: https://prometheus.io/docs/introduction/overview/
- googlecloud # If you do not include this, you'll lose Google Cloud Monitoring
- debug # print metrics within the console
Sistema operativo predefinito
Se utilizzi le immagini Ubuntu LTS ottimizzate per le TPU di Google, esegui il seguente comando Snap per aggiungere il nuovo file di configurazione alla configurazione esistente:
sudo snap set \
ai-telemetry-collector \
extra-flags="--config /home/username/additional-config.yaml"
Se vuoi sovrascrivere e sostituire la configurazione esistente, utilizza il flag
config-path anziché extra-flags:
sudo snap set \
ai-telemetry-collector \
config-path="/home/username/new-config.yaml"
Il comando snap set dovrebbe attivare il riavvio automatico del raccoglitore di telemetria AI. Per verificare che l'agente di raccolta sia stato riavviato e abbia applicato correttamente
le configurazioni, utilizza il seguente comando per visualizzare i log:
sudo snap logs -f ai-telemetry-collector
Sistema operativo personalizzato
Se utilizzi un sistema operativo personalizzato, esegui il seguente comando Docker per aggiungere il nuovo file di configurazione alla configurazione esistente:
# First apply the default configs via `--config=/etc/ai-telemetry-collector/config.yaml`
# Then apply your additional config by volume mount.
docker run --privileged --net=host \
-v <path>/additional-config.yaml:/etc/ai-telemetry-collector/additional-config.yaml \
ai-telemetry-collector:latest \
--config=/etc/ai-telemetry-collector/config.yaml \
--config=/etc/ai-telemetry-collector/additional-config.yaml
Se vuoi sovrascrivere e sostituire la configurazione esistente, utilizza il seguente comando Docker:
# Mount a volume (your config file) to `/etc/ai-telemetry-collector/config.yaml`
# The binary automatically picks up this file.
docker run --privileged --net=host \
-v <path>/my-config.yaml:/etc/ai-telemetry-collector/config.yaml \
ai-telemetry-collector:latest
Audit log
I serviziGoogle Cloud generano audit log che registrano le attività amministrative e di accesso all'interno delle tue risorse Google Cloud . Per saperne di più, consulta Audit logging di Compute Engine.