Identificare le violazioni del piano di backup nella console di gestione dell'appliance

I modelli di policy e i profili delle risorse sono definiti nella sezione dei piani di backup della console di gestione dell'appliance. Vengono applicate ad applicazioni e VM in App Manager. Una violazione del piano di backup si verifica quando un job (o un'azione) non soddisfa i requisiti definiti da una norma in un modello di norma.

Questa sezione descrive in dettaglio le potenziali cause di una violazione del piano di backup, la modalità di identificazione da parte della console di gestione dell'appliance di una violazione del piano di backup e i metodi che puoi utilizzare per monitorare le violazioni del piano di backup man mano che si verificano. Include:

Potenziali cause di violazioni delle norme relative al piano di backup

La console di gestione degli appliance applica i piani di backup ad applicazioni e set di dati, dove la gestione dei dati di copia dell'applicazione nel servizio App Manager si basa sulle regole definite in un modello di backup e nei relativi criteri. Un modello di backup include una o più norme che definiscono l'origine dei dati (snapshot o replica) e la pianificazione (frequenza, conservazione, ora di inizio, ora di fine) per ogni origine dati. Si verifica una violazione del piano di backup quando il job (o l'azione) definito da una policy del piano di backup non inizia in base alla pianificazione della policy.

Ogni appliance di backup/recupero esegue automaticamente un'analisi del piano di backup ogni ora per contribuire a identificare le violazioni del piano di backup man mano che si verificano durante il giorno per i job pianificati. Questa operazione in background ti avvisa di possibili violazioni del piano di backup il più vicino possibile alla fine di una finestra della norma del piano di backup, vedi Come un'appliance di backup/recupero monitora le violazioni del piano di backup.

La console di gestione degli appliance consente agli amministratori di creare una raccolta di modelli di criteri. Una delle caratteristiche principali di ogni policy del piano di backup è la pianificazione che determina quando verrà eseguita questa policy.

Le violazioni del piano di backup sono spesso considerate originate da problemi con le impostazioni del conteggio degli slot di lavoro, in cui i conteggi degli slot determinano il numero di job che possono essere eseguiti contemporaneamente. Tuttavia, l'aumento del numero di slot di lavoro non garantisce l'interruzione delle violazioni del piano di backup. In realtà, una violazione del piano di backup può essere correlata a una qualsiasi delle condizioni descritte nelle sezioni seguenti.

Job non riusciti

I job non riusciti sono una causa comune di violazioni del piano di backup. Ad esempio, se un host Oracle non è accessibile, l'appliance di backup/recupero non può acquisire i dati da Oracle RMAN, il che comporta un job di snapshot non riuscito. Quando un job non va a buon fine, controlla l'ambiente per verificare che tutte le applicazioni e gli host siano accessibili.

Più applicazioni per host

Se un host ha più applicazioni e ogni applicazione è gestita da un modello di policy separato (anziché raggruppate in un gruppo di coerenza), solo un'applicazione può avere un job di snapshot in esecuzione alla volta, anche se sono disponibili slot liberi.

Se una VM viene gestita come VM e ha anche applicazioni gestite tramite l'agente di Backup e RE, solo una delle applicazioni può avere un job di acquisizione dei dati in esecuzione alla volta.

Se un host ha un'unità D:\, E:\ e F:\ e le singole unità sono gestite da modelli di backup separati, ogni unità verrà gestita in serie. Ad esempio, se la finestra di esecuzione consentita per il criterio va dalle 01:00 (UTC) alle 03:00 (UTC) e il primo disco impiega tre ore per completare il relativo job snapshot, gli altri due dischi non riceveranno un job snapshot durante la giornata.

Una possibile soluzione è estendere la finestra dei criteri del piano di backup per estendere il tempo di esecuzione totale. Un'altra soluzione è includere più applicazioni in un gruppo di coerenza.

Le violazioni del piano di backup possono essere un falso positivo

In alcuni casi, una violazione del piano di backup è in realtà un falso positivo (un risultato che indica erroneamente la presenza di una determinata condizione). Tieni presente che non tutte le violazioni del piano di backup sono effettivamente violazioni e è possibile ricevere falsi positivi come descritto in questi due esempi:

  • Stai gestendo i dati di copia di una VM con un volume in cluster. Se la policy del piano di backup è in esecuzione, ma la VM non ha il controllo del volume, questo errore viene considerato una violazione del piano di backup.
  • Se lo scheduler basato sul piano di backup di un job (ad es. VM, applicazione e così via) è disattivato, ciò può comportare una violazione del piano di backup ogni volta che deve essere applicata la relativa norma.

Risorse vincolate nell'appliance di backup/ripristino

Le risorse vincolate in un'appliance di backup/recupero possono essere correlate a problemi come la velocità effettiva della porta di rete, il numero massimo di initiator iSCSI, la capacità di velocità effettiva dell'archiviazione di backend o dell'archiviazione di frontend. In questo caso, aumentare il numero di slot non è utile.

Dimensione della finestra dei criteri o durata del tempo di esecuzione del job

I job eseguiti per molte ore occupano slot di job che potrebbero essere utilizzati da altre applicazioni. Se ogni applicazione completa il proprio job in un minuto in media e hai cinque slot, sono possibili 300 job all'ora. Se ogni applicazione richiede un'ora in media e hai cinque slot, sono possibili cinque job all'ora. Tuttavia, se la finestra totale per il criterio è di tre ore, il numero di applicazioni che tentano di utilizzare questo criterio del piano di backup avrà un impatto enorme sulla gestione dei dati di copia delle applicazioni possibile in un periodo di 24 ore.

Ad esempio, se ci sono 100 applicazioni, nel primo esempio (300 job all'ora) l'appliance terminerà tutte le applicazioni in circa 20 minuti. Tuttavia, se abbiamo 100 applicazioni nel secondo esempio (cinque lavori all'ora), l'appliance gestirà solo 15 applicazioni al giorno. Ciò comporterà 85 violazioni del piano di backup.

Anche se non puoi controllare la durata di esecuzione del job, puoi esaminare la durata di pianificazione delle applicazioni in esecuzione. Tempi di esecuzione lunghi possono verificarsi anche durante il primo job di snapshot per una nuova applicazione. Le impostazioni di on-ramp possono essere utilizzate per impedire ai job di importazione di bloccare gli slot e di escludere le applicazioni già importate.

In che modo un'appliance di backup/ripristino monitora le violazioni del piano di backup

Ogni appliance di backup/recupero esegue automaticamente un'analisi del piano di backup ogni ora per contribuire a identificare le violazioni del piano di backup man mano che si verificano durante il giorno per i job pianificati. Questa operazione in background ti avvisa di possibili violazioni del piano di backup il più vicino possibile alla fine di una finestra della norma del piano di backup.

Durante l'analisi, l'appliance verifica tutte le norme del piano di backup le cui ore lavorative sono terminate nell'ultima ora. Ogni policy viene esaminata per verificare la presenza di violazioni del piano di backup e, se una policy del piano di backup presenta una violazione del piano di backup entro 60 minuti dalla fine della finestra della policy, viene creata una voce nel database degli eventi per queste violazioni. Se una policy non presenta una violazione del piano di backup, non verrà generato alcun avviso o evento.

Quando si verifica una violazione del piano di backup entro la finestra di completamento del criterio del piano di backup di 60 minuti, viene avviato un avviso e generata una notifica di un evento. Puoi ricevere avvisi di violazione del piano di backup sotto forma di eventi di Monitor di sistema (vedi Monitoraggio) o notifiche di eventi via email. Ogni avviso include dettagli su ogni policy del piano di backup in violazione per un'applicazione specifica, incluse informazioni quali il messaggio dell'evento, il nome e il tipo di policy, l'ora e il tipo di violazione e le informazioni sul job (job previsti, tolleranza, riusciti, non riusciti). Gli avvisi di violazione del piano di backup contengono lo stesso livello di dettaglio visibile nei report sulle violazioni del piano di backup inclusi nei report di conformità del piano di backup in Report Manager.

Viene creato anche un log del server della piattaforma (il file di log udppm) per indicare quando è stata eseguita l'analisi, quali criteri sono stati analizzati e qual è stato il risultato dell'analisi.

L'analisi del piano di backup tiene conto delle discrepanze che potrebbero essere il risultato di job in corso. In determinate circostanze, un job inizia entro l'ora di inizio della policy assegnata, ma potrebbe durare più del previsto e non essere completato entro la finestra temporale della policy specificata (ad esempio, un job inizia alle 22:00, ma termina alle 23:30). Inizialmente, il job viene considerato riuscito e non genera un avviso di violazione del piano di backup. Tuttavia, al termine del job, viene rivalutato nell'ambito del ciclo di analisi del piano di backup successivo e potrebbe essere segnalato come violazione del piano di backup. L'esito positivo o negativo di un criterio del piano di backup dipende dal momento in cui un job viene effettivamente completato.

Se, durante l'analisi, l'appliance determina che l'esecuzione di uno o più job di una policy del piano di backup non è riuscita, si verifica una violazione del piano di backup e l'avviso o l'evento generato contiene le seguenti informazioni aggiuntive relative al job non riuscito:

  • Il tempo di esecuzione previsto del job
  • Il motivo per cui il job non è stato eseguito

L'appliance esamina anche la sequenza temporale per determinare se non sono stati eseguiti job perché non erano disponibili slot per quel tipo di prestazione. Se questo è il motivo, l'avviso o l'evento include queste informazioni.

Se l'applicazione ha più policy del piano di backup con finestre di policy sovrapposte e si verifica un job mancato per entrambe le policy durante questo periodo di sovrapposizione, l'appliance genererà un solo avviso. Non avvia avvisi duplicati per le norme sovrapposte per eliminare la duplicazione. Gli avvisi relativi ai job mancati vengono aggregati per applicazione, tipo di norma e intervallo di tempo.

Monitorare le violazioni del piano di backup

Puoi monitorare e visualizzare le violazioni del piano di backup dalla scheda Monitora o da un'appliance gestita tramite notifiche email o utilizzando Report Manager.

Monitoraggio

Puoi visualizzare i dettagli di una violazione del piano di backup come evento dalla scheda Monitoraggio (Monitoraggio > Eventi). Per informazioni dettagliate sull'utilizzo della scheda Monitora, vedi Monitora.

Report Manager

Nella gestione report della console di gestione dell'appliance è disponibile una libreria completa di report sulle violazioni del piano di backup. Questi report possono semplificare la modalità di conferma del tasso di successo attuale e facilitare la distinzione tra più applicazioni con lo stesso nome.

Passaggi successivi