NetWorker: NetWorker-Server, der auf Red bereitgestellt wurde Hatte Enterprise Linux Pacemaker-Failovercluster keine Methode zum Tuning des Überwachungsintervalls.

摘要: In großen Clusterumgebungen treten gelegentlich NetWorker-Ausfälle aufgrund kurzer Monitoringunterbrechungen auf. Standardmäßig versucht es die Monitorfunktion dreimal erneut. Es ist kein Parameter "retry count" verfügbar. In diesem Wissensdatenbank-Artikel werden potenzielle Workarounds und RFE-Details (Request For Enhancement) für eine NetWorker-Verbesserungschance definiert. ...

本文章適用於 本文章不適用於 本文無關於任何特定產品。 本文未識別所有產品版本。

症狀

  • Der NetWorker-Server ist auf einem Red Hat Pacemaker (pcs) Failover-Cluster.
  • Es gibt zeitweilige Ausfälle in NetWorker aufgrund kurzer Unterbrechungen des Pacemaker (pcs) für NetWorker-Server (Standardeinstellung nws)

原因

Die Ursachen von Clusterausfällen können variieren. In diesem Abschnitt wird definiert, was für die Durchführung von NetWorker Cluster Monitor-Funktionen verwendet wird. 

Standardmäßig verfügt die Pacemaker-Ressource für NetWorker über ein "monitor" -Operation. Der Vorgang weist "interval" und "timeout" -Einstellungen, die vom Clusteradministrator während der Erstkonfiguration des NetWorker-Clusters konfiguriert werden.

root@NWrhelNodeA:~# pcs resource
  * Resource Group: NW_group:
    * fs        (ocf::heartbeat:Filesystem):     Started NWrhelNodeA.emclab.local
    * ip        (ocf::heartbeat:IPaddr):         Started NWrhelNodeA.emclab.local
    * nws       (ocf::EMC_NetWorker:Server):     Started NWrhelNodeA.emclab.local
root@NWrhelNodeA:~# pcs resource config nws Resource: nws (class=ocf provider=EMC_NetWorker type=Server) Meta Attrs: is-managed=true Operations: meta-data interval=0 timeout=10 (nws-meta-data-interval-0) migrate_from interval=0 timeout=120 (nws-migrate_from-interval-0) migrate_to interval=0 timeout=60 (nws-migrate_to-interval-0) start interval=0 timeout=300 (nws-start-interval-0) stop interval=0s timeout=300 (nws-stop-interval-0s) validate-all interval=0 timeout=10 (nws-validate-all-interval-0) monitor interval=120s timeout=300 (nws-monitor-interval-120s)

NetWorker ist für die Verwendung von Open Cluster Framework (OCF) konfiguriert. Die Überwachungsfunktion ist definiert in /usr/lib/ocf/resource.d/EMC_NetWorker/Server:

NWServer_monitor() {
        local count

        # exit immediately if configuration is not valid
        NWServer_validate_all || exit $?

        quick_monitor
        if [ $? -eq 0 ]; then
                count=0
                while [ $count -lt 3 ]; do
                        echo "q" | nsradmin -s ${NSR_SERVERHOST} -i - > /dev/null 2>&1
                        if [ $? -eq 0 ]; then
                                return $OCF_SUCCESS
                        else
                                count=`expr ${count} + 1`
                                sleep 1
                        fi
                done
        else
                return $OCF_NOT_RUNNING
        fi

        return $OCF_NOT_RUNNING
}

HINWEIS: Monitorfehler sollten unter normalen Umständen technisch gesehen nie auftreten und auf einen nicht behebbaren Fehler hinweisen. In einigen großen Umgebungen kann es jedoch zu zeitweiligen Problemen kommen, bei denen nsradmin kann beim Monitortest eines Pacemakers fehlschlagen, auch wenn es nur vorübergehend ist, was dazu führt, dass der Pacemaker einen vollständigen Ausfall erleidet.

解析度

ClusteradministratorInnen sollten alle Probleme mit Clusterausfällen untersuchen. In den Clusterprotokollen finden Sie Details zu Unterbrechungen:

  • /var/log/pcsd/pcsd.log
  • /var/log/pacemaker/pacemaker.log
  • /var/log/messages

NetWorker-Serverprotokolle können ebenfalls überprüft werden. Die daemon.log des NetWorker-Servers befindet sich auf der freigegebenen Festplatte (z. B. /nsr_share).

  • /nsr_share/nsr/logs/daemon.log

Wenn Echtzeit-Rendering nicht aktiviert ist, wird die .raw Das Protokoll kann mit dem folgenden Befehl in eine .log Datei gerendert werden:

nsr_render_log /nsr_share/nsr/logs/daemon.raw > /nsr_share/nsr/logs/daemon_`date -I`.log

Der Clusteradministrator kann die Werte für das Überwachungsintervall und die Timeouts für die Ressource PCs des NetWorker-Servers erhöhen. Anweisungen zum Ändern der Timeout-Werte finden Sie in der Red Hat Pacemaker-Dokumentation, da sich Pacemaker-Befehle über Pacemaker-Versionen hinweg ändern können.

Standardmäßig versucht der Pacemaker die Monitorfunktion dreimal erneut. Wenn dieser Parameter einstellbar sein soll, wenden Sie sich an Ihren Dell Account- oder Vertriebsmitarbeiter, um eine RFE (Request for Enhancement) zu öffnen.

其他資訊

Die Tasten /usr/lib/ocf/resource.d/EMC_NetWorker/Server nsr_monitor Die Funktion kann vom Clusteradministrator geändert werden, um zusätzliche Funktionen einzubeziehen. Dieses Scripting erfolgt jedoch nicht vom NetWorker-Support. Alle Änderungen an diesen Skripten werden während eines Upgrades des NetWorker-Servers entfernt.

受影響的產品

NetWorker

產品

NetWorker Family, NetWorker Series
文章屬性
文章編號: 000216735
文章類型: Solution
上次修改時間: 23 7月 2026
版本:  7
向其他 Dell 使用者尋求您問題的答案
支援服務
檢查您的裝置是否在支援服務的涵蓋範圍內。