Garantire l'operatività e le prestazioni utilizzando CloudOps

Last reviewed 2026-10-02 UTC

Questo principio del pilastro dell'eccellenza operativa del Google Cloud Well-Architected Framework ti aiuta a garantire la preparazione operativa e il rendimento dei tuoi carichi di lavoro cloud. Sottolinea la necessità di stabilire aspettative e impegni chiari per le prestazioni del servizio, implementare monitoraggio e avvisi efficaci, eseguire test delle prestazioni e pianificare in modo proattivo le esigenze di capacità.

Panoramica del principio

Organizzazioni diverse potrebbero interpretare la prontezza operativa in modo diverso. La preparazione operativa indica il modo in cui la tua organizzazione si prepara a gestire correttamente i workload su Google Cloud. La preparazione per l'operazione di un workload cloud complesso e multilivello richiede un'attenta pianificazione sia per il lancio che per le operazioni del day-2. Queste operazioni sono spesso chiamate CloudOps.

Aree di interesse della preparazione operativa

La preparazione operativa è costituita da quattro aree di interesse. Ogni area di interesse è costituita da un insieme di attività e componenti necessari per prepararsi a utilizzare un'applicazione o un ambiente complessi in Google Cloud. La seguente tabella elenca i componenti e le attività di ogni area di interesse:

Area di interesse della preparazione operativa Attività e componenti
Forza lavoro
  • Definire ruoli e responsabilità chiari per i team che gestiscono e utilizzano le risorse cloud.
  • Assicurarsi che i membri del team abbiano le competenze appropriate.
  • Sviluppare un programma di apprendimento.
  • Definizione di una struttura del team chiara.
  • Assunzione dei talenti richiesti.
Processi
  • Osservabilità.
  • Gestione delle interruzioni del servizio.
  • Distribuzione cloud.
  • Operazioni cloud principali.
Strumenti Strumenti necessari per supportare i processi CloudOps.
Governance
  • Livelli di servizio e report.
  • Finanze cloud.
  • Modello operativo cloud.
  • Board di revisione e governance dell'architettura.
  • Architettura cloud e conformità.

Consigli

Per garantire la preparazione e le prestazioni operative utilizzando CloudOps, prendi in considerazione i consigli riportati nelle sezioni seguenti. Ogni consiglio in questo documento è pertinente a una o più delle aree di interesse della preparazione operativa.

Definisci SLO e SLA

Una responsabilità fondamentale del team di operazioni cloud è definire gli obiettivi del livello di servizio (SLO) e gli accordi sul livello del servizio (SLA) per tutti i carichi di lavoro critici. Questo consiglio è pertinente all'area di interesse della governance della preparazione operativa.

  • Definisci gli SLO:

    Gli SLO devono essere specifici, misurabili, raggiungibili, pertinenti e vincolati al tempo (SMART) e devono riflettere il livello di servizio e le prestazioni che desideri.

    • Specifico: indica chiaramente il livello di servizio e le prestazioni richiesti.
    • Misurabile: quantificabile e monitorabile.
    • Raggiungibile: ottenibile entro i limiti delle capacità e delle risorse della tua organizzazione.
    • Pertinente: in linea con gli scopi e le priorità aziendali.
    • Con limiti di tempo: ha un periodo di tempo definito per la misurazione e la valutazione.

    Ad esempio, uno SLO per un'applicazione web potrebbe essere "Disponibilità del 99,9%" o "Tempo di risposta medio inferiore a 200 ms". Questi SLO definiscono chiaramente il livello di servizio e le prestazioni richiesti per l'applicazione web e possono essere misurati e monitorati nel tempo.

  • Definisci SLA:

    Gli SLA descrivono gli impegni nei confronti dei clienti in merito a disponibilità, prestazioni e assistenza del servizio, incluse eventuali sanzioni o rimedi per la mancata conformità. Gli SLA devono includere dettagli specifici sui servizi forniti, il livello di servizio che ci si può aspettare, le responsabilità del fornitore di servizi e del cliente e eventuali sanzioni o rimedi per la mancata conformità. Gli SLA fungono da accordo contrattuale tra le due parti, garantendo che entrambe abbiano una chiara comprensione delle aspettative e degli obblighi associati al servizio cloud.

  • Monitora gli SLO:

    Utilizza Cloud Monitoring e gli indicatori del livello del servizio (SLI) per monitorare gli SLO. Cloud Monitoring offre funzionalità complete di monitoraggio e osservabilità che consentono alla tua organizzazione di raccogliere e analizzare metriche relative a disponibilità, prestazioni e latenza di servizi e applicazioni basati sul cloud. Gli SLI sono metriche specifiche che puoi utilizzare per misurare e monitorare gli SLO nel tempo. Utilizzando questi strumenti, puoi monitorare e gestire in modo efficace i servizi cloud e assicurarti che soddisfino gli SLO e gli SLA.

Definire, comunicare e monitorare chiaramente gli SLO e gli SLA per tutti i tuoi servizi cloud critici contribuisce a garantire l'affidabilità e le prestazioni dei tuoi servizi e applicazioni di cui è stato eseguito il deployment.

Implementare un'osservabilità completa

Per ottenere visibilità in tempo reale sull'integrità e sulle prestazioni del tuo ambiente cloud, ti consigliamo di utilizzare una combinazione di strumenti Google Cloud Observability e soluzioni di terze parti. Questo consiglio è pertinente alle procedure e agli strumenti delle aree di interesse della preparazione operativa.

L'implementazione di una combinazione di soluzioni di osservabilità ti offre una strategia di osservabilità completa che copre vari aspetti della tua infrastruttura e delle tue applicazioni cloud. Google Cloud Observability è una piattaforma unificata per la raccolta, l'analisi e la visualizzazione di metriche, log e tracce di variGoogle Cloud servizi, applicazioni e fonti esterne. Utilizzando Cloud Monitoring, puoi ottenere informazioni dettagliate sull'utilizzo delle risorse, sulle caratteristiche delle prestazioni e sullo stato generale delle risorse.

Per garantire un monitoraggio completo, monitora metriche importanti in linea con gli indicatori di integrità del sistema, come utilizzo della CPU, memoria utilizzata, traffico di rete, I/O del disco e tempi di risposta delle applicazioni. Devi anche prendere in considerazione le metriche specifiche per la tua attività. Monitorando queste metriche, puoi identificare potenziali colli di bottiglia, problemi di prestazioni e vincoli delle risorse. Inoltre, puoi configurare avvisi per avvertire in modo proattivo i team competenti di potenziali problemi o anomalie.

Per migliorare ulteriormente le funzionalità di monitoraggio, puoi integrare soluzioni di terze parti con Google Cloud Observability. Queste soluzioni possono fornire funzionalità aggiuntive, come analisi avanzate, rilevamento di anomalie basato sul machine learning e funzionalità di gestione degli incidenti. Questa combinazione di strumenti di Google Cloud Observability e soluzioni di terze parti ti consente di creare un ecosistema di monitoraggio solido e personalizzabile, su misura per le tue esigenze specifiche. Utilizzando questo approccio combinato, puoi identificare e risolvere in modo proattivo i problemi, ottimizzare l'utilizzo delle risorse e garantire l'affidabilità e la disponibilità complessive delle tue applicazioni e dei tuoi servizi cloud.

Implementare test di carico e delle prestazioni

L'esecuzione di test delle prestazioni regolari ti aiuta a garantire che le tue applicazioni e la tua infrastruttura basate sul cloud possano gestire i picchi di carico e mantenere prestazioni ottimali. Il test di carico simula pattern di traffico realistici. Il test di stress spinge il sistema ai suoi limiti per identificare potenziali colli di bottiglia e limitazioni delle prestazioni. Questo consiglio è pertinente alle procedure e agli strumenti delle aree di interesse della preparazione operativa.

  • Testa le prestazioni: utilizza Cloud Load Balancing e servizi di test di carico per simulare pattern di traffico reali e testare la resistenza delle tue applicazioni. Questi strumenti forniscono informazioni preziose sul comportamento del sistema in varie condizioni di carico e possono aiutarti a identificare le aree che richiedono ottimizzazione.

  • Ottimizzare il rendimento: in base ai risultati dei test delle prestazioni, puoi prendere decisioni per ottimizzare l'infrastruttura cloud e le applicazioni per ottenere prestazioni e scalabilità ottimali. Questa ottimizzazione potrebbe comportare la regolazione dell'allocazione delle risorse, la messa a punto delle configurazioni o l'implementazione di meccanismi di memorizzazione nella cache.

    Ad esempio, se riscontri rallentamenti dell'applicazione durante i periodi di traffico elevato, potresti dover aumentare il numero di macchine virtuali o container allocati all'applicazione. In alternativa, potresti dover modificare la configurazione del server web o del database per migliorare le prestazioni.

Eseguendo regolarmente test delle prestazioni e implementando le ottimizzazioni necessarie, puoi assicurarti che le tue applicazioni e la tua infrastruttura basate sul cloud funzionino sempre al massimo delle prestazioni e offrano un'esperienza fluida e reattiva ai tuoi utenti. In questo modo, puoi mantenere un vantaggio competitivo e conquistare la fiducia dei tuoi clienti.

Pianificare e gestire la capacità

Per mantenere in esecuzione e scalare i tuoi sistemi cloud in risposta alle variazioni della domanda, devi pianificare e gestire attivamente la capacità delle risorse cloud. Questo consiglio supporta le procedure e gli strumenti aree di interesse della preparazione operativa.

  • Considera i limiti di servizio e gestisci le quote delle risorse: per pianificare la capacità delle tue risorse cloud, inizia con i limiti rigidi (i vincoli fissi) per i servizi che intendi utilizzare.

    • Stima i requisiti di quota per il calcolo, l'archiviazione, i limiti API e altre risorse di cui hai bisogno. Richiedi gli aggiustamenti delle quote adatti prima di aver bisogno delle risorse.
    • Carica le metriche da Cloud Monitoring in BigQuery e utilizzale per identificare i pattern di traffico e monitorare il carico del sistema nel tempo.
    • Prevedi la domanda di risorse in base alle prossime campagne di marketing, alle registrazioni degli utenti e ai lanci di funzionalità. Considera anche i tuoi impegni SLA attuali e pianificati.
  • Progetta per flessibilità ed efficienza: quando pianifichi la capacità per i tuoi deployment cloud, separa i componenti dell'applicazione da tipi di macchine specifici. Quando blocchi un carico di lavoro su un singolo tipo di macchina, non puoi sfruttare l'hardware cloud più recente o le modifiche alla capacità regionale.

    • Per i carichi di lavoro che richiedono hardware specializzato, come istanze con memoria elevata o GPU, assicurati di poter ottenere le risorse quando necessario. Utilizza le prenotazioni future per ottenere una garanzia di capacità per i tipi di macchine critici fino a un anno in anticipo.
    • Per i carichi di lavoro di elaborazione batch o di addestramento dei modelli che possono tollerare tempi di avvio variabili, pianifica la capacità in modo dinamico utilizzando le VM con avvio flessibile. Queste VM utilizzano la pianificazione dei workload dinamici (DWS) per mettere in coda le richieste e ridurre i costi di calcolo.
    • Evita di prenotare famiglie di macchine o risorse precedenti per ambienti di sviluppo temporanei.
    • Pianifica le risorse nelle regioni secondarie in modo da poter eseguire il failover in modo efficiente per il ripristino di emergenza (RE).
  • Implementa la scalabilità automatica: per adattare dinamicamente le risorse cloud alle fluttuazioni del workload in tempo reale, implementa le policy di scalabilità automatica. Gli algoritmi di scalabilità automatica valutano metriche come l'utilizzo della CPU, la pressione della memoria e la profondità della coda. In base alla valutazione, le risorse vengono scalate orizzontalmente durante i periodi di picco di traffico e scalate verticalmente durante i periodi di basso utilizzo, il che contribuisce a ottimizzare il costo delle risorse cloud.

    • Configura i gruppi di istanze gestite (MIG) con modelli di istanza misti che combinano generazioni attuali e più recenti di tipi di macchine.
    • Assicurati che le configurazioni del MIG includano sia la flessibilità delle istanze (specificando più tipi di macchine compatibili) sia la flessibilità della località (distribuendo le destinazioni in più zone di una regione). A seconda dei requisiti di capacità attuali, il sistema esegue automaticamente il provisioning del tipo di macchina preferito successivo dall'elenco di riserva senza eliminare le richieste o limitare le risorse di calcolo.

Monitora e ottimizza costantemente

Per gestire e ottimizzare i carichi di lavoro cloud, devi stabilire una procedura per monitorare e analizzare continuamente le metriche di rendimento. Questo consiglio è pertinente alle aree di interesse di preparazione operativa processi e strumenti.

  • Monitora e raccogli dati:

    Per stabilire un processo di monitoraggio e analisi continui, devi monitorare, raccogliere e valutare i dati relativi a vari aspetti del tuo ambiente cloud. Utilizzando questi dati, puoi identificare in modo proattivo le aree di miglioramento, ottimizzare l'utilizzo delle risorse e assicurarti che la tua infrastruttura cloud soddisfi o superi costantemente le tue aspettative di rendimento.

  • Esamina log e tracce:

    I log forniscono informazioni preziose su eventi di sistema, errori e avvisi. Le tracce forniscono informazioni dettagliate sul flusso di richieste attraverso la tua applicazione. Analizzando log e tracce, puoi identificare potenziali problemi, individuare le cause principali dei problemi e comprendere meglio il comportamento delle tue applicazioni in diverse condizioni. Metriche come il tempo di round trip tra i servizi possono aiutarti a identificare e comprendere i colli di bottiglia nei tuoi workload.

  • Ottimizza per il rendimento:

    Utilizza tecniche di ottimizzazione delle prestazioni per ottimizzare in modo significativo i tempi di risposta delle applicazioni e l'efficienza complessiva. Di seguito sono riportati alcuni esempi di tecniche che puoi utilizzare:

    • Memorizzazione nella cache: memorizza i dati a cui si accede di frequente in memoria per ridurre la necessità di query di database o chiamate API ripetute.
    • Ottimizzazione del database: utilizza tecniche come l'indicizzazione e l'ottimizzazione delle query per migliorare le prestazioni delle operazioni del database.
    • Profilazione del codice: identifica le aree del codice che consumano risorse eccessive o causano problemi di prestazioni.