Blog entry by Diego Ramos

Anyone in the world Monday, 27 November 2023, 12:00 AM

Todos os backups automáticos falharam antes da migração

O diretório de destino estava sem espaço e nenhum curso possuía uma cópia recente na semana da mudança de servidor.

Na semana da migração descobrimos que os cursos não tinham cópias recentes, embora as tarefas automáticas aparecessem programadas, uma situação que tornava arriscado continuar a mudança antes de saber por que todos os arquivos novos haviam deixado de ser criados.

O primeiro cuidado foi preservar o cenário como ele aparecia naquele momento, marcamos o horário exato da lentidão, as páginas envolvidas, os perfis afetados e o que continuava respondendo normalmente, depois reunimos aplicação, banco, tarefas agendadas, cache, armazenamento e integrações no mesmo intervalo, pois olhar apenas para uso médio de processador costuma esconder consultas bloqueadas e filas concentradas.

Quando já sabíamos quem era afetado, reproduzimos a ação com medição em cada etapa e comparamos o comportamento em cursos, contas e volumes diferentes, verificando consultas, quantidade de linhas, chamadas repetidas, bloqueios e trabalho executado em segundo plano, sempre mudando uma variável por vez para não atribuir a melhora ao ajuste errado.

A causa apareceu quando colocamos lado a lado o que funcionava e o que falhava, pois o diretório de destino estava sem espaço e nenhum curso possuía uma cópia recente na semana da mudança de servidor. coincidiu com uma alteração mensurável nos registros e no tempo de resposta, a solução foi validada repetindo o cenário que provocava a falha e acompanhando o período seguinte para confirmar que a fila não estava apenas sendo empurrada para outro horário.

A análise dos relatórios levou ao diretório de destino completamente ocupado, liberamos espaço, revisamos a retenção e executamos novos backups priorizando os cursos da migração, cada arquivo foi conferido antes de seguir para o outro servidor para que a existência do nome na pasta não fosse confundida com uma cópia válida.

Foi assim que esse caso saiu da fila de chamados e passou a fazer parte dos bastidores da EAD Suporte.

Comments

  • AAAlexandre Azevedo - Fri, 12 Jan 2024, 2:19 PM
    Isso é bem real. o cenário era esse: todos os backups automáticos falharem antes de uma migração. aí vc vê como uma config pequena pode virar um problemão. em migração, saber voltar com segurança é tão importante quanto saber avançar.
  • LMLarissa Melo - Sat, 10 Feb 2024, 7:25 PM
    Já vi coisa parecida, tipo, começa com um chamado pequeno e quando olha direito o cenário era esse: todos os backups automáticos falharem antes de uma migração. o ensaio completo antes do corte costuma valer mais do que qualquer estimativa bonita.
  • CQCarolina Queiroz - Tue, 9 Apr 2024, 9:59 AM
    Em situações assim, o problema parece isolado no começo. Depois fica claro o cenário real: todos os backups automáticos falharem antes de uma migração. Em migração, saber voltar com segurança é tão importante quanto saber avançar.
  • CPCamila Paiva - Wed, 10 Apr 2024, 8:36 AM
    Esse caso é muito REAL. o problema era esse: todos os backups automáticos falharem antes de uma migração. de repente o chamado que parecia pequeno vira prioridade total. Em migração, saber voltar com segurança é tão importante quanto saber avançar.
  • CWCarlos Weber - Tue, 18 June 2024, 10:07 AM
    Bom exemplo. O problema era claro depois da reprodução: todos os backups automáticos falharem antes de uma migração. Mudança rápida sem diagnóstico poderia piorar o incidente. O ensaio completo antes do corte costuma valer mais do que qualquer estimativa bonita.