Causas de backups com poucos dados em dispositivos de backup/recuperação

O que é um backup de baixa atividade?

Em um dispositivo de backup/recuperação do Backup e DR em circunstâncias normais, o Backup e DR faz um backup inicial completo e demorado de um banco de dados, e todos os backups subsequentes são incrementais e muito mais rápidos. Um backup incremental compara bitmaps do snapshot atual e do anterior e aplica apenas as mudanças incrementais.

Um backup de baixa atividade é um tipo especial de job de backup que ocorre quando algum erro do sistema no job de backup anterior resulta em uma imagem de bitmap não confiável ou na incapacidade de ler o bitmap. O serviço que lê o bitmap é o cbt_server em um ambiente Linux e o AAMService em um ambiente Windows.

Os backups de baixa atividade são mais demorados do que os feitos em condições normais, porque precisam realizar uma ingestão completa novamente para recriar um bitmap confiável. Em seguida, é possível aplicar as mudanças incrementais sem precisar substituir o backup completo.

O que não causa backups de baixa atividade

  • Upgrades de conectores
  • Reinicializações normais do sistema
  • Reinicializações normais do cbt_server ou do AAMService, supondo que o serviço ainda esteja em execução no momento do backup
  • Failovers que não apresentaram os erros que causam bitmaps não confiáveis.

Causas de bitmaps não confiáveis

Um bitmap não confiável ocorre quando algo interrompe o job de backup, incluindo o seguinte:

  • Um encerramento inadequado do host:
    • Um encerramento não normal causa baixa atividade devido à falta de confiabilidade dos bitmaps. Isso inclui desligar uma máquina física ou qualquer outro método de desligar o Windows sem passar por um encerramento normal ou um erro de tela azul. Isso é verdade mesmo que uma máquina em um cluster atinja um erro de tela azul que acione o failover, já que o bitmap da máquina com falha não é confiável.
    • Se todos os servidores Windows em um cluster que hospedaram o banco de dados desde o backup anterior não estiverem disponíveis e executando o agente do Backup e DR. Extraímos bitmaps de cada host de cluster que hospedou o banco de dados desde o backup anterior para encontrar mudanças e, sem todos os bitmaps, precisamos executar a baixa atividade para manter a integridade de dados. Se um host de cluster que hospedou um banco de dados atingir um BSOD, o bitmap poderá estar disponível no backup, mas ainda não será confiável. Portanto, a recuperação de baixa atividade é necessária.
  • Uma atualização com falha do módulo do kernel
  • Uma falha ou reinicialização no daemon do modo de usuário
  • Um erro de impressão digital ao executar um backup. O Backup e DR realiza uma "verificação de impressão digital" em cada job de backup para verificar se há erros.
  • Erro durante o arquivamento, se durante o encerramento do SO o disco de armazenamento estiver cheio e o sistema não puder gravar todos os dados no vault.
  • Failover do nó do SAP HANA, fazendo com que o backup seja redirecionado para um nó diferente.
  • Backup em execução no modo degradado devido à incapacidade de carregar o módulo do kernel. Isso normalmente ocorre quando o SO é uma versão não compatível.
  • Se o cbt_server ou o AAMService for interrompido durante o backup, os bitmaps não poderão ser buscados e o job de backup será executado no modo de baixa atividade. Se o AAMService não estiver inativo por muito tempo, iniciar o AAMService resultará em bitmaps disponíveis para um backup normal.
    • Se o cbt_server ou o AAMService for interrompido por tempo suficiente para que alguns gigabytes de eventos sejam enfileirados pelo driver, os bitmaps não poderão ser recriados e o backup estará no modo de baixa atividade. O tempo necessário para isso depende da quantidade de E/S de disco que ocorre no banco de dados. Isso normalmente exige dias de inatividade do AAMService.
  • O encerramento não normal do cbt_server ou do AAMService pode fazer com que os bitmaps se tornem não confiáveis para qualquer bitmap carregado no momento. Os bitmaps são carregados se o arquivo rastreado tiver sido gravado nos últimos 15 minutos. Portanto, geralmente, para um banco de dados ocupado, isso causaria baixa atividade.
  • Se um volume que contém um arquivo rastreado (por exemplo, um arquivo .mdf do SQL Server) for desmontado no host e remontado, os bitmaps não serão confiáveis, já que não há como saber o que foi gravado no arquivo enquanto ele estava desmontado.