NetWorker: o servidor do NetWorker implementado no Red tinha um cluster de failover do Enterprise Linux Pacemaker não ter um método de ajuste do intervalo de monitoramento.
摘要: Interrupções intermitentes do NetWorker observadas em ambientes de cluster grandes devido a breves interrupções de monitoramento. Por padrão, a função do monitor tenta novamente três vezes. Não há nenhum parâmetro "contagem de repetições" disponível. Este artigo da KB define possíveis soluções temporárias e uma solicitação de aprimoramento (RFE) para uma oportunidade de aprimoramento do NetWorker. ...
症狀
- O servidor do NetWorker é instalado em um Red Hat Pacemaker (
pcs) cluster de failover. - Há interrupções intermitentes no NetWorker devido a breves interrupções no Pacemaker (
pcs) para o servidor do NetWorker (o padrão énws)
原因
A causa das interrupções do cluster pode variar. Esta seção define o que é usado para executar funções de monitoramento de cluster do NetWorker.
Por padrão, o recurso Pacemaker para NetWorker tem um "monitor" operação. A operação tem "interval" e "timeout" que são definidas pelo administrador do cluster durante a configuração inicial do cluster do NetWorker.
root@NWrhelNodeA:~# pcs resource
* Resource Group: NW_group:
* fs (ocf::heartbeat:Filesystem): Started NWrhelNodeA.emclab.local
* ip (ocf::heartbeat:IPaddr): Started NWrhelNodeA.emclab.local
* nws (ocf::EMC_NetWorker:Server): Started NWrhelNodeA.emclab.local
root@NWrhelNodeA:~# pcs resource config nws
Resource: nws (class=ocf provider=EMC_NetWorker type=Server)
Meta Attrs: is-managed=true
Operations: meta-data interval=0 timeout=10 (nws-meta-data-interval-0)
migrate_from interval=0 timeout=120 (nws-migrate_from-interval-0)
migrate_to interval=0 timeout=60 (nws-migrate_to-interval-0)
start interval=0 timeout=300 (nws-start-interval-0)
stop interval=0s timeout=300 (nws-stop-interval-0s)
validate-all interval=0 timeout=10 (nws-validate-all-interval-0)
monitor interval=120s timeout=300 (nws-monitor-interval-120s)
O NetWorker está configurado para usar o OCF (Open Cluster Framework). A função de monitoramento é definida em /usr/lib/ocf/resource.d/EMC_NetWorker/Server:
NWServer_monitor() {
local count
# exit immediately if configuration is not valid
NWServer_validate_all || exit $?
quick_monitor
if [ $? -eq 0 ]; then
count=0
while [ $count -lt 3 ]; do
echo "q" | nsradmin -s ${NSR_SERVERHOST} -i - > /dev/null 2>&1
if [ $? -eq 0 ]; then
return $OCF_SUCCESS
else
count=`expr ${count} + 1`
sleep 1
fi
done
else
return $OCF_NOT_RUNNING
fi
return $OCF_NOT_RUNNING
}
NOTA: Tecnicamente, a falha do monitor nunca deve ocorrer em circunstâncias normais e deve ser indicativa de um erro irrecuperável. No entanto, alguns ambientes grandes podem observar problemas intermitentes em que
nsradmin pode falhar no teste de monitor de um Pacemaker, mesmo que apenas temporariamente, e isso resulta na interrupção total do Pacemaker.
解析度
O administrador do cluster deve investigar todos os problemas de interrupção do cluster. Os logs do cluster podem ser analisados para obter detalhes sobre interrupções:
/var/log/pcsd/pcsd.log/var/log/pacemaker/pacemaker.log/var/log/messages
Os logs do servidor do NetWorker também podem ser analisados. O daemon.log do servidor do NetWorker está localizado no disco compartilhado (por exemplo, /nsr_share).
/nsr_share/nsr/logs/daemon.log
Se a renderização em tempo real não estiver habilitada, o .raw O log pode ser renderizado em um arquivo .log com o seguinte comando:
nsr_render_log /nsr_share/nsr/logs/daemon.raw > /nsr_share/nsr/logs/daemon_`date -I`.log
O administrador de cluster pode aumentar os valores de intervalo e tempo de espera excedido do monitor para o recurso NetWorker Server pcs. Consulte a documentação do Red Hat Pacemaker para obter instruções sobre como alterar os valores de tempo de espera excedido, pois os comandos do Pacemaker podem mudar em todas as versões do Pacemaker.
Por padrão, o Pacemaker repete a função do monitor três vezes. Se você quiser que esse seja um parâmetro ajustável, entre em contato com sua conta Dell ou com seu representante de vendas para abrir uma Solicitação de aprimoramento (RFE).
其他資訊
Os /usr/lib/ocf/resource.d/EMC_NetWorker/Server nsr_monitor A função pode ser modificada pelo administrador do cluster para incluir funções adicionais; no entanto, esse script está fora do suporte do NetWorker. Todas as alterações nesses scripts são removidas durante um upgrade do servidor do NetWorker.