NetWorker: o servidor do NetWorker implementado no Red tinha um cluster de failover do Enterprise Linux Pacemaker não ter um método de ajuste do intervalo de monitoramento.

摘要: Interrupções intermitentes do NetWorker observadas em ambientes de cluster grandes devido a breves interrupções de monitoramento. Por padrão, a função do monitor tenta novamente três vezes. Não há nenhum parâmetro "contagem de repetições" disponível. Este artigo da KB define possíveis soluções temporárias e uma solicitação de aprimoramento (RFE) para uma oportunidade de aprimoramento do NetWorker. ...

本文章適用於 本文章不適用於 本文無關於任何特定產品。 本文未識別所有產品版本。

症狀

  • O servidor do NetWorker é instalado em um Red Hat Pacemaker (pcs) cluster de failover.
  • Há interrupções intermitentes no NetWorker devido a breves interrupções no Pacemaker (pcs) para o servidor do NetWorker (o padrão é nws)

原因

A causa das interrupções do cluster pode variar. Esta seção define o que é usado para executar funções de monitoramento de cluster do NetWorker. 

Por padrão, o recurso Pacemaker para NetWorker tem um "monitor" operação. A operação tem "interval" e "timeout" que são definidas pelo administrador do cluster durante a configuração inicial do cluster do NetWorker.

root@NWrhelNodeA:~# pcs resource
  * Resource Group: NW_group:
    * fs        (ocf::heartbeat:Filesystem):     Started NWrhelNodeA.emclab.local
    * ip        (ocf::heartbeat:IPaddr):         Started NWrhelNodeA.emclab.local
    * nws       (ocf::EMC_NetWorker:Server):     Started NWrhelNodeA.emclab.local
root@NWrhelNodeA:~# pcs resource config nws Resource: nws (class=ocf provider=EMC_NetWorker type=Server) Meta Attrs: is-managed=true Operations: meta-data interval=0 timeout=10 (nws-meta-data-interval-0) migrate_from interval=0 timeout=120 (nws-migrate_from-interval-0) migrate_to interval=0 timeout=60 (nws-migrate_to-interval-0) start interval=0 timeout=300 (nws-start-interval-0) stop interval=0s timeout=300 (nws-stop-interval-0s) validate-all interval=0 timeout=10 (nws-validate-all-interval-0) monitor interval=120s timeout=300 (nws-monitor-interval-120s)

O NetWorker está configurado para usar o OCF (Open Cluster Framework). A função de monitoramento é definida em /usr/lib/ocf/resource.d/EMC_NetWorker/Server:

NWServer_monitor() {
        local count

        # exit immediately if configuration is not valid
        NWServer_validate_all || exit $?

        quick_monitor
        if [ $? -eq 0 ]; then
                count=0
                while [ $count -lt 3 ]; do
                        echo "q" | nsradmin -s ${NSR_SERVERHOST} -i - > /dev/null 2>&1
                        if [ $? -eq 0 ]; then
                                return $OCF_SUCCESS
                        else
                                count=`expr ${count} + 1`
                                sleep 1
                        fi
                done
        else
                return $OCF_NOT_RUNNING
        fi

        return $OCF_NOT_RUNNING
}

NOTA: Tecnicamente, a falha do monitor nunca deve ocorrer em circunstâncias normais e deve ser indicativa de um erro irrecuperável. No entanto, alguns ambientes grandes podem observar problemas intermitentes em que nsradmin pode falhar no teste de monitor de um Pacemaker, mesmo que apenas temporariamente, e isso resulta na interrupção total do Pacemaker.

解析度

O administrador do cluster deve investigar todos os problemas de interrupção do cluster. Os logs do cluster podem ser analisados para obter detalhes sobre interrupções:

  • /var/log/pcsd/pcsd.log
  • /var/log/pacemaker/pacemaker.log
  • /var/log/messages

Os logs do servidor do NetWorker também podem ser analisados. O daemon.log do servidor do NetWorker está localizado no disco compartilhado (por exemplo, /nsr_share).

  • /nsr_share/nsr/logs/daemon.log

Se a renderização em tempo real não estiver habilitada, o .raw O log pode ser renderizado em um arquivo .log com o seguinte comando:

nsr_render_log /nsr_share/nsr/logs/daemon.raw > /nsr_share/nsr/logs/daemon_`date -I`.log

O administrador de cluster pode aumentar os valores de intervalo e tempo de espera excedido do monitor para o recurso NetWorker Server pcs. Consulte a documentação do Red Hat Pacemaker para obter instruções sobre como alterar os valores de tempo de espera excedido, pois os comandos do Pacemaker podem mudar em todas as versões do Pacemaker.

Por padrão, o Pacemaker repete a função do monitor três vezes. Se você quiser que esse seja um parâmetro ajustável, entre em contato com sua conta Dell ou com seu representante de vendas para abrir uma Solicitação de aprimoramento (RFE).

其他資訊

Os /usr/lib/ocf/resource.d/EMC_NetWorker/Server nsr_monitor A função pode ser modificada pelo administrador do cluster para incluir funções adicionais; no entanto, esse script está fora do suporte do NetWorker. Todas as alterações nesses scripts são removidas durante um upgrade do servidor do NetWorker.

受影響的產品

NetWorker

產品

NetWorker Family, NetWorker Series
文章屬性
文章編號: 000216735
文章類型: Solution
上次修改時間: 23 7月 2026
版本:  7
向其他 Dell 使用者尋求您問題的答案
支援服務
檢查您的裝置是否在支援服務的涵蓋範圍內。