NetWorker: NetWorker-Server, der auf Red bereitgestellt wurde Hatte Enterprise Linux Pacemaker-Failovercluster keine Methode zum Tuning des Überwachungsintervalls.

Сводка: In großen Clusterumgebungen treten gelegentlich NetWorker-Ausfälle aufgrund kurzer Monitoringunterbrechungen auf. Standardmäßig versucht es die Monitorfunktion dreimal erneut. Es ist kein Parameter "retry count" verfügbar. In diesem Wissensdatenbank-Artikel werden potenzielle Workarounds und RFE-Details (Request For Enhancement) für eine NetWorker-Verbesserungschance definiert. ...

Данная статья применяется к Данная статья не применяется к Эта статья не привязана к какому-либо конкретному продукту. В этой статье указаны не все версии продуктов.

Симптомы

  • Der NetWorker-Server ist auf einem Red Hat Pacemaker (pcs) Failover-Cluster.
  • Es gibt zeitweilige Ausfälle in NetWorker aufgrund kurzer Unterbrechungen des Pacemaker (pcs) für NetWorker-Server (Standardeinstellung nws)

Причина

Die Ursachen von Clusterausfällen können variieren. In diesem Abschnitt wird definiert, was für die Durchführung von NetWorker Cluster Monitor-Funktionen verwendet wird. 

Standardmäßig verfügt die Pacemaker-Ressource für NetWorker über ein "monitor" -Operation. Der Vorgang weist "interval" und "timeout" -Einstellungen, die vom Clusteradministrator während der Erstkonfiguration des NetWorker-Clusters konfiguriert werden.

root@NWrhelNodeA:~# pcs resource
  * Resource Group: NW_group:
    * fs        (ocf::heartbeat:Filesystem):     Started NWrhelNodeA.emclab.local
    * ip        (ocf::heartbeat:IPaddr):         Started NWrhelNodeA.emclab.local
    * nws       (ocf::EMC_NetWorker:Server):     Started NWrhelNodeA.emclab.local
root@NWrhelNodeA:~# pcs resource config nws Resource: nws (class=ocf provider=EMC_NetWorker type=Server) Meta Attrs: is-managed=true Operations: meta-data interval=0 timeout=10 (nws-meta-data-interval-0) migrate_from interval=0 timeout=120 (nws-migrate_from-interval-0) migrate_to interval=0 timeout=60 (nws-migrate_to-interval-0) start interval=0 timeout=300 (nws-start-interval-0) stop interval=0s timeout=300 (nws-stop-interval-0s) validate-all interval=0 timeout=10 (nws-validate-all-interval-0) monitor interval=120s timeout=300 (nws-monitor-interval-120s)

NetWorker ist für die Verwendung von Open Cluster Framework (OCF) konfiguriert. Die Überwachungsfunktion ist definiert in /usr/lib/ocf/resource.d/EMC_NetWorker/Server:

NWServer_monitor() {
        local count

        # exit immediately if configuration is not valid
        NWServer_validate_all || exit $?

        quick_monitor
        if [ $? -eq 0 ]; then
                count=0
                while [ $count -lt 3 ]; do
                        echo "q" | nsradmin -s ${NSR_SERVERHOST} -i - > /dev/null 2>&1
                        if [ $? -eq 0 ]; then
                                return $OCF_SUCCESS
                        else
                                count=`expr ${count} + 1`
                                sleep 1
                        fi
                done
        else
                return $OCF_NOT_RUNNING
        fi

        return $OCF_NOT_RUNNING
}

HINWEIS: Monitorfehler sollten unter normalen Umständen technisch gesehen nie auftreten und auf einen nicht behebbaren Fehler hinweisen. In einigen großen Umgebungen kann es jedoch zu zeitweiligen Problemen kommen, bei denen nsradmin kann beim Monitortest eines Pacemakers fehlschlagen, auch wenn es nur vorübergehend ist, was dazu führt, dass der Pacemaker einen vollständigen Ausfall erleidet.

Разрешение

ClusteradministratorInnen sollten alle Probleme mit Clusterausfällen untersuchen. In den Clusterprotokollen finden Sie Details zu Unterbrechungen:

  • /var/log/pcsd/pcsd.log
  • /var/log/pacemaker/pacemaker.log
  • /var/log/messages

NetWorker-Serverprotokolle können ebenfalls überprüft werden. Die daemon.log des NetWorker-Servers befindet sich auf der freigegebenen Festplatte (z. B. /nsr_share).

  • /nsr_share/nsr/logs/daemon.log

Wenn Echtzeit-Rendering nicht aktiviert ist, wird die .raw Das Protokoll kann mit dem folgenden Befehl in eine .log Datei gerendert werden:

nsr_render_log /nsr_share/nsr/logs/daemon.raw > /nsr_share/nsr/logs/daemon_`date -I`.log

Der Clusteradministrator kann die Werte für das Überwachungsintervall und die Timeouts für die Ressource PCs des NetWorker-Servers erhöhen. Anweisungen zum Ändern der Timeout-Werte finden Sie in der Red Hat Pacemaker-Dokumentation, da sich Pacemaker-Befehle über Pacemaker-Versionen hinweg ändern können.

Standardmäßig versucht der Pacemaker die Monitorfunktion dreimal erneut. Wenn dieser Parameter einstellbar sein soll, wenden Sie sich an Ihren Dell Account- oder Vertriebsmitarbeiter, um eine RFE (Request for Enhancement) zu öffnen.

Дополнительная информация

Die Tasten /usr/lib/ocf/resource.d/EMC_NetWorker/Server nsr_monitor Die Funktion kann vom Clusteradministrator geändert werden, um zusätzliche Funktionen einzubeziehen. Dieses Scripting erfolgt jedoch nicht vom NetWorker-Support. Alle Änderungen an diesen Skripten werden während eines Upgrades des NetWorker-Servers entfernt.

Затронутые продукты

NetWorker

Продукты

NetWorker Family, NetWorker Series
Свойства статьи
Номер статьи: 000216735
Тип статьи: Solution
Последнее изменение: 23 июл. 2026
Версия:  7
Получите ответы на свои вопросы от других пользователей Dell
Услуги технической поддержки
Проверьте, распространяются ли на ваше устройство услуги технической поддержки.