NetWorker: NetWorker-Server, der auf Red bereitgestellt wurde Hatte Enterprise Linux Pacemaker-Failovercluster keine Methode zum Tuning des Überwachungsintervalls.
Сводка: In großen Clusterumgebungen treten gelegentlich NetWorker-Ausfälle aufgrund kurzer Monitoringunterbrechungen auf. Standardmäßig versucht es die Monitorfunktion dreimal erneut. Es ist kein Parameter "retry count" verfügbar. In diesem Wissensdatenbank-Artikel werden potenzielle Workarounds und RFE-Details (Request For Enhancement) für eine NetWorker-Verbesserungschance definiert. ...
Симптомы
- Der NetWorker-Server ist auf einem Red Hat Pacemaker (
pcs) Failover-Cluster. - Es gibt zeitweilige Ausfälle in NetWorker aufgrund kurzer Unterbrechungen des Pacemaker (
pcs) für NetWorker-Server (Standardeinstellungnws)
Причина
Die Ursachen von Clusterausfällen können variieren. In diesem Abschnitt wird definiert, was für die Durchführung von NetWorker Cluster Monitor-Funktionen verwendet wird.
Standardmäßig verfügt die Pacemaker-Ressource für NetWorker über ein "monitor" -Operation. Der Vorgang weist "interval" und "timeout" -Einstellungen, die vom Clusteradministrator während der Erstkonfiguration des NetWorker-Clusters konfiguriert werden.
root@NWrhelNodeA:~# pcs resource
* Resource Group: NW_group:
* fs (ocf::heartbeat:Filesystem): Started NWrhelNodeA.emclab.local
* ip (ocf::heartbeat:IPaddr): Started NWrhelNodeA.emclab.local
* nws (ocf::EMC_NetWorker:Server): Started NWrhelNodeA.emclab.local
root@NWrhelNodeA:~# pcs resource config nws
Resource: nws (class=ocf provider=EMC_NetWorker type=Server)
Meta Attrs: is-managed=true
Operations: meta-data interval=0 timeout=10 (nws-meta-data-interval-0)
migrate_from interval=0 timeout=120 (nws-migrate_from-interval-0)
migrate_to interval=0 timeout=60 (nws-migrate_to-interval-0)
start interval=0 timeout=300 (nws-start-interval-0)
stop interval=0s timeout=300 (nws-stop-interval-0s)
validate-all interval=0 timeout=10 (nws-validate-all-interval-0)
monitor interval=120s timeout=300 (nws-monitor-interval-120s)
NetWorker ist für die Verwendung von Open Cluster Framework (OCF) konfiguriert. Die Überwachungsfunktion ist definiert in /usr/lib/ocf/resource.d/EMC_NetWorker/Server:
NWServer_monitor() {
local count
# exit immediately if configuration is not valid
NWServer_validate_all || exit $?
quick_monitor
if [ $? -eq 0 ]; then
count=0
while [ $count -lt 3 ]; do
echo "q" | nsradmin -s ${NSR_SERVERHOST} -i - > /dev/null 2>&1
if [ $? -eq 0 ]; then
return $OCF_SUCCESS
else
count=`expr ${count} + 1`
sleep 1
fi
done
else
return $OCF_NOT_RUNNING
fi
return $OCF_NOT_RUNNING
}
HINWEIS: Monitorfehler sollten unter normalen Umständen technisch gesehen nie auftreten und auf einen nicht behebbaren Fehler hinweisen. In einigen großen Umgebungen kann es jedoch zu zeitweiligen Problemen kommen, bei denen
nsradmin kann beim Monitortest eines Pacemakers fehlschlagen, auch wenn es nur vorübergehend ist, was dazu führt, dass der Pacemaker einen vollständigen Ausfall erleidet.
Разрешение
ClusteradministratorInnen sollten alle Probleme mit Clusterausfällen untersuchen. In den Clusterprotokollen finden Sie Details zu Unterbrechungen:
/var/log/pcsd/pcsd.log/var/log/pacemaker/pacemaker.log/var/log/messages
NetWorker-Serverprotokolle können ebenfalls überprüft werden. Die daemon.log des NetWorker-Servers befindet sich auf der freigegebenen Festplatte (z. B. /nsr_share).
/nsr_share/nsr/logs/daemon.log
Wenn Echtzeit-Rendering nicht aktiviert ist, wird die .raw Das Protokoll kann mit dem folgenden Befehl in eine .log Datei gerendert werden:
nsr_render_log /nsr_share/nsr/logs/daemon.raw > /nsr_share/nsr/logs/daemon_`date -I`.log
Der Clusteradministrator kann die Werte für das Überwachungsintervall und die Timeouts für die Ressource PCs des NetWorker-Servers erhöhen. Anweisungen zum Ändern der Timeout-Werte finden Sie in der Red Hat Pacemaker-Dokumentation, da sich Pacemaker-Befehle über Pacemaker-Versionen hinweg ändern können.
Standardmäßig versucht der Pacemaker die Monitorfunktion dreimal erneut. Wenn dieser Parameter einstellbar sein soll, wenden Sie sich an Ihren Dell Account- oder Vertriebsmitarbeiter, um eine RFE (Request for Enhancement) zu öffnen.
Дополнительная информация
Die Tasten /usr/lib/ocf/resource.d/EMC_NetWorker/Server nsr_monitor Die Funktion kann vom Clusteradministrator geändert werden, um zusätzliche Funktionen einzubeziehen. Dieses Scripting erfolgt jedoch nicht vom NetWorker-Support. Alle Änderungen an diesen Skripten werden während eines Upgrades des NetWorker-Servers entfernt.