Avamar: como reunir as informações para solucionar problemas de capacidade
Summary: Este artigo descreve quais informações são necessárias ao solucionar problemas de capacidade do Avamar e como coletá-las.
Instructions
Resolução de problemas de capacidade no Avamar:
Ao lidar com problemas de capacidade em uma grade do Avamar, é crucial entender a causa raiz. Isso requer uma série de etapas, começando com a coleta de dados para uma investigação completa.
As grades do Avamar têm vários tipos de limites de capacidade. Uma compreensão abrangente desses limites, juntamente com seu contexto histórico, pode esclarecer problemas de capacidade atuais e passados experimentados pelo sistema.
-
80%: aviso de capacidade
-
95%: o limite da verificação de integridade foi atingido
-
100%: o limite somente leitura do servidor foi atingido, fazendo com que a grade alterne para o modo admin
-
A coleta de lixo (GC) falha, resultando em erros de MSG_ERR_DISKFULL ou MSG_ERR_STRIPECREATE.
-
Os checkpoints falham devido a MSG_ERR_DISKFULL erro.
-
Os backups não podem ser executados ou falham devido à capacidade total.
-
Os backups falham com MSG_ERR_STRIPECREATE erros ou mensagens indicando que o servidor de destino está cheio.
-
O estado de acesso muda para o modo admin (a menos que a manutenção esteja em execução).
-
O agendador de backup está desativado e não pode ser retomado devido aos limites de capacidade de metadados.
Entender esses aspectos pode ajudar a gerenciar e resolver problemas de capacidade em uma grade do Avamar.
Como coletar informações
Faça log-in no Avamar Utility Node como usuário "administrador".
(Estes apenas recolhem informações e não aplicam quaisquer alterações)
1. Se ainda não for conhecida, ela fornecerá o nome completo do Avamar Server ou o nome de domínio totalmente qualificado (FQDN):
hostname -f
2. Verifique se todos os serviços estão ativados, inclusive o agendador de manutenção:
dpnctl status
3. O estado geral:
status.dpn
4. Execute a capacidade.Script de subtítulo para coletar dados no valor de 60 dias e os 10 principais clientes contribuintes:
capacity.sh --days=60 --top=10
5. Logs que mostram o comportamento básico da coleta de lixo nos últimos 30 dias:
dumpmaintlogs --types=gc --days=30 | grep "4202"
6. A quantidade de dados removida da coleta de lixo, quantas passagens ela foi concluída e por quanto tempo foi executada:
dumpmaintlogs --types=gc --days=30 | grep passes | cut -d ' ' -f1,10,14,15,17
7. Verifique por quanto tempo hfscheck corre para:
dumpmaintlogs --types=hfscheck --days=30 | grep -i elapsed|cut -d ' ' -f1,12 | grep -v check
8. Detalhes de uso da capacidade por nó e por partição:
avmaint nodelist | egrep 'nodetag|fs-percent-full'
9. – Exibe uma lista de checkpoints.
cplist
10. Horários de início/parada programados do trabalho de manutenção:
avmaint sched status --ava | egrep -A 2 "maintenance-window|backup-window" | tail -16
11. Colete todas as configurações de disco:
avmaint config --ava | egrep -i 'disk|crunching|balance'
Nunca altere valores, a menos que seja aconselhado por um especialista no assunto (SME) do Avamar. Valores não padrão podem estar em vigor por um bom motivo. Entenda bem a situação.
12. Colete contagens de diferentes tipos de frações por nó por partição de dados:
avmaint nodelist --xmlperline=99 | grep 'comp='
13. Verifique a quantidade de memória (e swap) em uso em cada nó:
mapall free -m