NetWorker: el servidor de NetWorker implementado en Red ¿El clúster de conmutación por error de Enterprise Linux Pacemaker no tiene ningún método para ajustar el intervalo de monitoreo?

摘要: Se observaron interrupciones intermitentes de NetWorker en entornos de clúster grandes debido a breves interrupciones de monitoreo. De manera predeterminada, la función de monitoreo se reintenta tres veces. No está disponible ningún parámetro de "conteo de reintentos". En este artículo de la base de conocimientos, se definen posibles soluciones alternativas y los detalles de una solicitud de mejora (RFE) para una oportunidad de mejora de NetWorker. ...

本文章適用於 本文章不適用於 本文無關於任何特定產品。 本文未識別所有產品版本。

症狀

  • El servidor de NetWorker se instala en un marcapasos de Red Hat (pcs) del clúster de conmutación por error.
  • Hay interrupciones intermitentes en NetWorker debido a breves interrupciones en Pacemaker (pcs) para NetWorker Server (el valor predeterminado es nws)

原因

La causa de las interrupciones del clúster puede variar. En esta sección, se define lo que se utiliza para realizar funciones de monitoreo de clústeres de NetWorker. 

De manera predeterminada, el recurso Pacemaker para NetWorker tiene un "monitor" operación. La operación tiene "interval" y "timeout" que realiza el administrador del clúster durante la configuración inicial del clúster de NetWorker.

root@NWrhelNodeA:~# pcs resource
  * Resource Group: NW_group:
    * fs        (ocf::heartbeat:Filesystem):     Started NWrhelNodeA.emclab.local
    * ip        (ocf::heartbeat:IPaddr):         Started NWrhelNodeA.emclab.local
    * nws       (ocf::EMC_NetWorker:Server):     Started NWrhelNodeA.emclab.local
root@NWrhelNodeA:~# pcs resource config nws Resource: nws (class=ocf provider=EMC_NetWorker type=Server) Meta Attrs: is-managed=true Operations: meta-data interval=0 timeout=10 (nws-meta-data-interval-0) migrate_from interval=0 timeout=120 (nws-migrate_from-interval-0) migrate_to interval=0 timeout=60 (nws-migrate_to-interval-0) start interval=0 timeout=300 (nws-start-interval-0) stop interval=0s timeout=300 (nws-stop-interval-0s) validate-all interval=0 timeout=10 (nws-validate-all-interval-0) monitor interval=120s timeout=300 (nws-monitor-interval-120s)

NetWorker está configurado para utilizar Open Cluster Framework (OCF). La función de supervisión se define en /usr/lib/ocf/resource.d/EMC_NetWorker/Server:

NWServer_monitor() {
        local count

        # exit immediately if configuration is not valid
        NWServer_validate_all || exit $?

        quick_monitor
        if [ $? -eq 0 ]; then
                count=0
                while [ $count -lt 3 ]; do
                        echo "q" | nsradmin -s ${NSR_SERVERHOST} -i - > /dev/null 2>&1
                        if [ $? -eq 0 ]; then
                                return $OCF_SUCCESS
                        else
                                count=`expr ${count} + 1`
                                sleep 1
                        fi
                done
        else
                return $OCF_NOT_RUNNING
        fi

        return $OCF_NOT_RUNNING
}

NOTA: Técnicamente, la falla del monitor nunca debería ocurrir en circunstancias normales y debería indicar un error irrecuperable. Sin embargo, algunos entornos grandes pueden observar problemas intermitentes en los que nsradmin puede fallar en la prueba del monitor de un marcapasos, aunque solo sea temporalmente, y eso hace que el marcapasos sufra una interrupción completa.

解析度

El administrador del clúster debe investigar todos los problemas de interrupción del clúster. Los registros del clúster se pueden revisar para ver si hay detalles sobre las interrupciones:

  • /var/log/pcsd/pcsd.log
  • /var/log/pacemaker/pacemaker.log
  • /var/log/messages

También se pueden revisar los registros de NetWorker Server. El daemon.log de NetWorker Server se encuentra en el disco compartido (por ejemplo, /nsr_share).

  • /nsr_share/nsr/logs/daemon.log

Si la representación en tiempo real no está habilitada, el .raw El registro se puede representar en un archivo .log con el siguiente comando:

nsr_render_log /nsr_share/nsr/logs/daemon.raw > /nsr_share/nsr/logs/daemon_`date -I`.log

El administrador del clúster puede aumentar los valores del intervalo de monitoreo y del tiempo de espera agotado para el recurso de PC del servidor NetWorker Server. Consulte la documentación de Red Hat Pacemaker para obtener instrucciones sobre cómo cambiar los valores de tiempo de espera, ya que los comandos de Pacemaker pueden cambiar en todas las versiones de Pacemaker.

De manera predeterminada, Pacemaker reintenta la función de monitor tres veces. Si desea que este sea un parámetro ajustable, comuníquese con su representante de cuentas o de ventas de Dell para abrir una solicitud de mejora (RFE).

其他資訊

Las /usr/lib/ocf/resource.d/EMC_NetWorker/Server nsr_monitor El administrador del clúster puede modificar la función para incluir funciones adicionales; sin embargo, este script está fuera del soporte de NetWorker. Cualquier cambio en estos scripts se elimina durante una actualización de NetWorker Server.

受影響的產品

NetWorker

產品

NetWorker Family, NetWorker Series
文章屬性
文章編號: 000216735
文章類型: Solution
上次修改時間: 23 7月 2026
版本:  7
向其他 Dell 使用者尋求您問題的答案
支援服務
檢查您的裝置是否在支援服務的涵蓋範圍內。