NetWorker: el servidor de NetWorker implementado en Red ¿El clúster de conmutación por error de Enterprise Linux Pacemaker no tiene ningún método para ajustar el intervalo de monitoreo?

Resumen: Se observaron interrupciones intermitentes de NetWorker en entornos de clúster grandes debido a breves interrupciones de monitoreo. De manera predeterminada, la función de monitoreo se reintenta tres veces. No está disponible ningún parámetro de "conteo de reintentos". En este artículo de la base de conocimientos, se definen posibles soluciones alternativas y los detalles de una solicitud de mejora (RFE) para una oportunidad de mejora de NetWorker. ...

Este artículo se aplica a Este artículo no se aplica a Este artículo no está vinculado a ningún producto específico. No se identifican todas las versiones del producto en este artículo.

Síntomas

  • El servidor de NetWorker se instala en un marcapasos de Red Hat (pcs) del clúster de conmutación por error.
  • Hay interrupciones intermitentes en NetWorker debido a breves interrupciones en Pacemaker (pcs) para NetWorker Server (el valor predeterminado es nws)

Causa

La causa de las interrupciones del clúster puede variar. En esta sección, se define lo que se utiliza para realizar funciones de monitoreo de clústeres de NetWorker. 

De manera predeterminada, el recurso Pacemaker para NetWorker tiene un "monitor" operación. La operación tiene "interval" y "timeout" que realiza el administrador del clúster durante la configuración inicial del clúster de NetWorker.

root@NWrhelNodeA:~# pcs resource
  * Resource Group: NW_group:
    * fs        (ocf::heartbeat:Filesystem):     Started NWrhelNodeA.emclab.local
    * ip        (ocf::heartbeat:IPaddr):         Started NWrhelNodeA.emclab.local
    * nws       (ocf::EMC_NetWorker:Server):     Started NWrhelNodeA.emclab.local
root@NWrhelNodeA:~# pcs resource config nws Resource: nws (class=ocf provider=EMC_NetWorker type=Server) Meta Attrs: is-managed=true Operations: meta-data interval=0 timeout=10 (nws-meta-data-interval-0) migrate_from interval=0 timeout=120 (nws-migrate_from-interval-0) migrate_to interval=0 timeout=60 (nws-migrate_to-interval-0) start interval=0 timeout=300 (nws-start-interval-0) stop interval=0s timeout=300 (nws-stop-interval-0s) validate-all interval=0 timeout=10 (nws-validate-all-interval-0) monitor interval=120s timeout=300 (nws-monitor-interval-120s)

NetWorker está configurado para utilizar Open Cluster Framework (OCF). La función de supervisión se define en /usr/lib/ocf/resource.d/EMC_NetWorker/Server:

NWServer_monitor() {
        local count

        # exit immediately if configuration is not valid
        NWServer_validate_all || exit $?

        quick_monitor
        if [ $? -eq 0 ]; then
                count=0
                while [ $count -lt 3 ]; do
                        echo "q" | nsradmin -s ${NSR_SERVERHOST} -i - > /dev/null 2>&1
                        if [ $? -eq 0 ]; then
                                return $OCF_SUCCESS
                        else
                                count=`expr ${count} + 1`
                                sleep 1
                        fi
                done
        else
                return $OCF_NOT_RUNNING
        fi

        return $OCF_NOT_RUNNING
}

NOTA: Técnicamente, la falla del monitor nunca debería ocurrir en circunstancias normales y debería indicar un error irrecuperable. Sin embargo, algunos entornos grandes pueden observar problemas intermitentes en los que nsradmin puede fallar en la prueba del monitor de un marcapasos, aunque solo sea temporalmente, y eso hace que el marcapasos sufra una interrupción completa.

Resolución

El administrador del clúster debe investigar todos los problemas de interrupción del clúster. Los registros del clúster se pueden revisar para ver si hay detalles sobre las interrupciones:

  • /var/log/pcsd/pcsd.log
  • /var/log/pacemaker/pacemaker.log
  • /var/log/messages

También se pueden revisar los registros de NetWorker Server. El daemon.log de NetWorker Server se encuentra en el disco compartido (por ejemplo, /nsr_share).

  • /nsr_share/nsr/logs/daemon.log

Si la representación en tiempo real no está habilitada, el .raw El registro se puede representar en un archivo .log con el siguiente comando:

nsr_render_log /nsr_share/nsr/logs/daemon.raw > /nsr_share/nsr/logs/daemon_`date -I`.log

El administrador del clúster puede aumentar los valores del intervalo de monitoreo y del tiempo de espera agotado para el recurso de PC del servidor NetWorker Server. Consulte la documentación de Red Hat Pacemaker para obtener instrucciones sobre cómo cambiar los valores de tiempo de espera, ya que los comandos de Pacemaker pueden cambiar en todas las versiones de Pacemaker.

De manera predeterminada, Pacemaker reintenta la función de monitor tres veces. Si desea que este sea un parámetro ajustable, comuníquese con su representante de cuentas o de ventas de Dell para abrir una solicitud de mejora (RFE).

Información adicional

Las /usr/lib/ocf/resource.d/EMC_NetWorker/Server nsr_monitor El administrador del clúster puede modificar la función para incluir funciones adicionales; sin embargo, este script está fuera del soporte de NetWorker. Cualquier cambio en estos scripts se elimina durante una actualización de NetWorker Server.

Productos afectados

NetWorker

Productos

NetWorker Family, NetWorker Series
Propiedades del artículo
Número del artículo: 000216735
Tipo de artículo: Solution
Última modificación: 23 jul. 2026
Versión:  7
Encuentre respuestas a sus preguntas de otros usuarios de Dell
Servicios de soporte
Compruebe si el dispositivo está cubierto por los servicios de soporte.