NetWorker: el servidor de NetWorker implementado en Red ¿El clúster de conmutación por error de Enterprise Linux Pacemaker no tiene ningún método para ajustar el intervalo de monitoreo?
Resumen: Se observaron interrupciones intermitentes de NetWorker en entornos de clúster grandes debido a breves interrupciones de monitoreo. De manera predeterminada, la función de monitoreo se reintenta tres veces. No está disponible ningún parámetro de "conteo de reintentos". En este artículo de la base de conocimientos, se definen posibles soluciones alternativas y los detalles de una solicitud de mejora (RFE) para una oportunidad de mejora de NetWorker. ...
Síntomas
- El servidor de NetWorker se instala en un marcapasos de Red Hat (
pcs) del clúster de conmutación por error. - Hay interrupciones intermitentes en NetWorker debido a breves interrupciones en Pacemaker (
pcs) para NetWorker Server (el valor predeterminado esnws)
Causa
La causa de las interrupciones del clúster puede variar. En esta sección, se define lo que se utiliza para realizar funciones de monitoreo de clústeres de NetWorker.
De manera predeterminada, el recurso Pacemaker para NetWorker tiene un "monitor" operación. La operación tiene "interval" y "timeout" que realiza el administrador del clúster durante la configuración inicial del clúster de NetWorker.
root@NWrhelNodeA:~# pcs resource
* Resource Group: NW_group:
* fs (ocf::heartbeat:Filesystem): Started NWrhelNodeA.emclab.local
* ip (ocf::heartbeat:IPaddr): Started NWrhelNodeA.emclab.local
* nws (ocf::EMC_NetWorker:Server): Started NWrhelNodeA.emclab.local
root@NWrhelNodeA:~# pcs resource config nws
Resource: nws (class=ocf provider=EMC_NetWorker type=Server)
Meta Attrs: is-managed=true
Operations: meta-data interval=0 timeout=10 (nws-meta-data-interval-0)
migrate_from interval=0 timeout=120 (nws-migrate_from-interval-0)
migrate_to interval=0 timeout=60 (nws-migrate_to-interval-0)
start interval=0 timeout=300 (nws-start-interval-0)
stop interval=0s timeout=300 (nws-stop-interval-0s)
validate-all interval=0 timeout=10 (nws-validate-all-interval-0)
monitor interval=120s timeout=300 (nws-monitor-interval-120s)
NetWorker está configurado para utilizar Open Cluster Framework (OCF). La función de supervisión se define en /usr/lib/ocf/resource.d/EMC_NetWorker/Server:
NWServer_monitor() {
local count
# exit immediately if configuration is not valid
NWServer_validate_all || exit $?
quick_monitor
if [ $? -eq 0 ]; then
count=0
while [ $count -lt 3 ]; do
echo "q" | nsradmin -s ${NSR_SERVERHOST} -i - > /dev/null 2>&1
if [ $? -eq 0 ]; then
return $OCF_SUCCESS
else
count=`expr ${count} + 1`
sleep 1
fi
done
else
return $OCF_NOT_RUNNING
fi
return $OCF_NOT_RUNNING
}
NOTA: Técnicamente, la falla del monitor nunca debería ocurrir en circunstancias normales y debería indicar un error irrecuperable. Sin embargo, algunos entornos grandes pueden observar problemas intermitentes en los que
nsradmin puede fallar en la prueba del monitor de un marcapasos, aunque solo sea temporalmente, y eso hace que el marcapasos sufra una interrupción completa.
Resolución
El administrador del clúster debe investigar todos los problemas de interrupción del clúster. Los registros del clúster se pueden revisar para ver si hay detalles sobre las interrupciones:
/var/log/pcsd/pcsd.log/var/log/pacemaker/pacemaker.log/var/log/messages
También se pueden revisar los registros de NetWorker Server. El daemon.log de NetWorker Server se encuentra en el disco compartido (por ejemplo, /nsr_share).
/nsr_share/nsr/logs/daemon.log
Si la representación en tiempo real no está habilitada, el .raw El registro se puede representar en un archivo .log con el siguiente comando:
nsr_render_log /nsr_share/nsr/logs/daemon.raw > /nsr_share/nsr/logs/daemon_`date -I`.log
El administrador del clúster puede aumentar los valores del intervalo de monitoreo y del tiempo de espera agotado para el recurso de PC del servidor NetWorker Server. Consulte la documentación de Red Hat Pacemaker para obtener instrucciones sobre cómo cambiar los valores de tiempo de espera, ya que los comandos de Pacemaker pueden cambiar en todas las versiones de Pacemaker.
De manera predeterminada, Pacemaker reintenta la función de monitor tres veces. Si desea que este sea un parámetro ajustable, comuníquese con su representante de cuentas o de ventas de Dell para abrir una solicitud de mejora (RFE).
Información adicional
Las /usr/lib/ocf/resource.d/EMC_NetWorker/Server nsr_monitor El administrador del clúster puede modificar la función para incluir funciones adicionales; sin embargo, este script está fuera del soporte de NetWorker. Cualquier cambio en estos scripts se elimina durante una actualización de NetWorker Server.