Identificar violações do plano de backup no console de gerenciamento do dispositivo

Os modelos de política e os perfis de recursos são definidos na seção de planos de backup do console de gerenciamento de dispositivos. Eles são aplicados a aplicativos e VMs no App Manager. Uma violação do plano de backup ocorre quando um job (ou ação) não atende aos requisitos definidos por uma política em um modelo de política.

Esta seção detalha as possíveis causas de uma violação do plano de backup, como o console de gerenciamento de dispositivos identifica quando uma violação do plano de backup ocorreu e os métodos que você pode usar para monitorar as violações do plano de backup à medida que elas ocorrem. Ela inclui:

Possíveis causas de violações da política do plano de backup

O console de gerenciamento de dispositivos aplica planos de backup a aplicativos e conjuntos de dados, em que o gerenciamento dos dados de cópia do aplicativo no serviço App Manager é baseado nas regras definidas em um modelo de backup e nas políticas associadas a ele. Um modelo de backup inclui uma ou mais políticas que definem a origem dos dados (snapshot ou replicação) e a programação (frequência, retenção, horário de início e término) de cada fonte de dados. Uma violação do plano de backup ocorre quando o job (ou ação) definido por uma política do plano de backup não começa de acordo com a programação da política.

Cada dispositivo de backup/recuperação executa automaticamente uma análise do plano de backup a cada hora para ajudar a identificar violações do plano de backup à medida que elas ocorrem ao longo do dia para jobs programados. Essa operação em segundo plano alerta você sobre possíveis violações do plano de backup o mais próximo possível do final de uma janela de política do plano de backup . Consulte Como um dispositivo de backup/recuperação monitora violações do plano de backup.

O console de gerenciamento de dispositivos permite que os administradores criem uma biblioteca de modelos de política. Uma das principais características de cada política do plano de backup é a programação que determina quando essa política será executada.

As violações do plano de backup geralmente são consideradas originárias de problemas com as configurações de contagem de slots de job, em que as contagens de slots determinam quantos jobs podem ser executados simultaneamente. No entanto, aumentar as contagens de slots de job não garante que as violações do plano de backup vão parar. Na verdade, uma violação do plano de backup pode estar relacionada a qualquer uma das condições descritas nas seções a seguir.

Jobs com falha

Jobs com falha são uma causa comum de violações do plano de backup. Por exemplo, se um host da Oracle não estiver acessível, o dispositivo de backup/recuperação não poderá capturar os dados do Oracle RMAN, o que resulta em um job de snapshot com falha. Quando um job falha, verifique seu ambiente para confirmar se todos os aplicativos e hosts estão acessíveis.

Vários aplicativos por host

Se um host tiver vários aplicativos e cada um deles for gerenciado por um modelo de política separado (em vez de agrupados como um grupo de consistência), apenas um aplicativo poderá ter um job de snapshot em execução por vez, mesmo que slots livres estejam disponíveis.

Se uma VM for gerenciada como uma VM e também tiver aplicativos gerenciados pelo agente de backup e DR, apenas um dos aplicativos poderá ter um job de captura de dados em execução por vez.

Se um host tiver uma unidade D:\, E:\ e F:\ e as unidades individuais forem gerenciadas por modelos de backup separados, cada unidade será gerenciada em série. Por exemplo, se a janela de execução permitida para a política for de 01:00 (UTC) a 03:00 (UTC) e a primeira unidade levar três horas para concluir o job de snapshot, as outras duas unidades não receberão um job de snapshot durante esse dia.

Uma possível solução é estender a janela de política do plano de backup como um meio de estender o tempo total de execução. Outra solução é incluir vários aplicativos em um grupo de consistência.

As violações do plano de backup podem ser um falso positivo

Em alguns casos, uma violação do plano de backup é, na verdade, um falso positivo (um resultado que indica incorretamente que uma condição específica está presente). Lembre-se de que nem toda violação do plano de backup é realmente uma violação, e é possível receber falsos positivos, conforme descrito nestes dois exemplos:

  • Você está gerenciando os dados de cópia de uma VM que tem um volume clusterizado. Se a política do plano de backup estiver em execução, mas a VM não tiver controle do volume, essa falha será considerada uma violação do plano de backup.
  • Se um job (por exemplo, VM, aplicativo etc.) tiver o programador controlado pelo plano de backup desativado, isso poderá resultar em uma violação do plano de backup sempre que a política do plano de backup for aplicada.

Recursos restritos no dispositivo de backup/recuperação

Recursos restritos em um dispositivo de backup/recuperação podem estar relacionados a problemas como capacidade de processamento da porta de rede, número máximo de iniciadores iSCSI, capacidade de processamento do armazenamento de back-end ou do armazenamento de front-end. Aumentar as contagens de slots não ajudará nesse caso.

Tamanho da janela de política ou duração do tempo de execução do job

Jobs que são executados por muitas horas mantêm slots de job que podem ser usados por outros aplicativos. Se cada aplicativo concluir o job em um minuto em média e você tiver cinco slots, será possível executar 300 jobs por hora. Se cada aplicativo levar uma hora em média e você tiver cinco slots, será possível executar cinco jobs por hora. No entanto, se a janela total da política for de três horas, o número de aplicativos que tentam usar essa política do plano de backup terá um impacto enorme no gerenciamento total de dados de cópia de aplicativos possível em um período de 24 horas.

Por exemplo, se houver 100 aplicativos, no primeiro exemplo (300 jobs por hora), o dispositivo vai terminar todos os aplicativos em aproximadamente 20 minutos. No entanto, se tivermos 100 aplicativos no segundo exemplo (cinco jobs por hora), o dispositivo só vai gerenciar 15 aplicativos por dia. Isso resultará em 85 violações do plano de backup.

Embora não seja possível controlar o tempo de execução do job, você pode analisar o período em que os aplicativos em execução estão programados. Tempos de job longos também podem ocorrer durante o primeiro job de snapshot de um novo aplicativo. As configurações de integração podem ser usadas para impedir que os jobs de ingestão bloqueiem slots e aplicativos já ingeridos.

Como um dispositivo de backup/recuperação monitora violações do plano de backup

Cada dispositivo de backup/recuperação executa automaticamente uma análise do plano de backup a cada hora para ajudar a identificar violações do plano de backup à medida que elas ocorrem ao longo do dia para jobs programados. Essa operação em segundo plano alerta você sobre possíveis violações do plano de backup o mais próximo possível do final de uma janela de política do plano de backup.

Durante a análise, o dispositivo verifica todas as políticas do plano de backup cujas horas de trabalho terminaram na última hora. Cada política é examinada para violações do plano de backup e, se uma política do plano de backup tiver uma violação do plano de backup dentro de 60 minutos do final da janela de política, uma entrada será feita no banco de dados de eventos para essas violações. Se uma política não tiver uma violação do plano de backup, nenhum alerta ou evento será gerado.

Quando uma violação do plano de backup ocorre na janela de conclusão da política do plano de backup de 60 minutos, um alerta é iniciado e uma notificação de evento é gerada. Você pode receber alertas de violação do plano de backup na forma de eventos do System Monitor (consulte Monitoramento) ou notificações de eventos por e-mail. Cada alerta inclui detalhes sobre cada política do plano de backup em violação para um aplicativo específico, incluindo informações como a mensagem do evento, o nome e o tipo da política, o horário e o tipo da violação e informações do job (jobs esperados, tolerância, bem-sucedidos, com falha). Os alertas de violação do plano de backup contêm o mesmo nível de detalhes que podem ser encontrados nos relatórios de violação do plano de backup incluídos como parte dos relatórios de conformidade do plano de backup no Report Manager.

Um registro do servidor de plataforma (o arquivo de registro udppm) também é criado para descrever quando a análise foi executada, quais políticas foram analisadas e qual foi o resultado da análise.

A análise do plano de backup considera discrepâncias que podem ser o resultado de jobs em andamento. Em determinadas circunstâncias, um job começa dentro do horário de início da política alocado, mas pode ser executado por mais tempo do que o previsto e não ser concluído na janela de tempo da política especificada (por exemplo, um job começa às 22h e termina às 23h30). Inicialmente, o job é considerado um sucesso e não resulta em um alerta de violação do plano de backup. No entanto, após a conclusão do job, ele é reavaliado como parte do próximo ciclo de análise do plano de backup e possivelmente marcado como uma violação do plano de backup. O sucesso ou a falha de uma política do plano de backup depende de quando um job é concluído.

Se, durante a análise, o dispositivo determinar que uma política do plano de backup não conseguiu executar um ou mais jobs, ocorrerá uma violação do plano de backup e o alerta ou evento gerado conterá as seguintes informações adicionais sobre o job com falha:

  • O tempo de execução esperado do job
  • O motivo pelo qual o job não foi executado

O dispositivo também examina a linha do tempo para determinar se nenhum job foi executado porque não havia slots disponíveis para esse tipo de serviço. Se esse foi o motivo, o alerta ou evento inclui essas informações.

Se o aplicativo tiver várias políticas do plano de backup com janelas de política sobrepostas e houver um job perdido para ambas as políticas durante esse período de sobreposição, o dispositivo só vai gerar um único alerta. Ele não vai iniciar alertas duplicados para políticas sobrepostas para eliminar a duplicação. Os alertas de jobs perdidos são agregados por aplicativo, tipo de política e janela de tempo.

Monitorar violações do plano de backup

É possível monitorar e visualizar violações do plano de backup na guia Monitoramento ou em um dispositivo gerenciado por notificações por e-mail ou usando o Report Manager.

Monitoramento

É possível visualizar os detalhes de uma violação do plano de backup como um evento na guia Monitoramento (Monitoramento > Eventos). Para mais detalhes sobre como usar a guia Monitoramento, consulte Monitoramento.

Report Manager

Há uma biblioteca completa de relatórios de violação do plano de backup disponível no Report Manager do console de gerenciamento de dispositivos. Esses relatórios podem ajudar a simplificar a confirmação da taxa de sucesso atual, além de facilitar a diferenciação entre vários aplicativos com o mesmo nome.

A seguir