NetWorker:部署在 Red 上 的 NetWorker 服务器 Enterprise Linux Pacemaker 故障切换群集没有调整监视间隔的方法。

摘要: 由于短暂的监视中断,在大型群集环境中观察到间歇性 NetWorker 中断。默认情况下,监视功能会重试三次。没有可用的“重试计数”参数。本知识库文章定义了可能的解决方法,以及有关 NetWorker 增强机会的增强请求 (RFE) 详细信息。

本文章適用於 本文章不適用於 本文無關於任何特定產品。 本文未識別所有產品版本。

症狀

  • NetWorker 服务器安装在 Red Hat Pacemaker (pcs) 故障切换群集。
  • NetWorker由于起搏器短暂中断(pcs) NetWorker资源(默认值为 nws)

原因

群集宕机的原因可能有所不同。本节定义执行 NetWorker 群集监视器功能所用的内容。

默认情况下,NetWorker 的 Pacemaker 资源具有”monitor“操作。该操作具有”interval“ 和 ”timeout“设置,由群集管理员在初始 NetWorker 群集配置期间配置。

root@NWrhelNodeA:~# pcs resource
  * Resource Group: NW_group:
    * fs        (ocf::heartbeat:Filesystem):     Started NWrhelNodeA.emclab.local
    * ip        (ocf::heartbeat:IPaddr):         Started NWrhelNodeA.emclab.local
    * nws       (ocf::EMC_NetWorker:Server):     Started NWrhelNodeA.emclab.local
root@NWrhelNodeA:~# pcs resource config nws Resource: nws (class=ocf provider=EMC_NetWorker type=Server) Meta Attrs: is-managed=true Operations: meta-data interval=0 timeout=10 (nws-meta-data-interval-0) migrate_from interval=0 timeout=120 (nws-migrate_from-interval-0) migrate_to interval=0 timeout=60 (nws-migrate_to-interval-0) start interval=0 timeout=300 (nws-start-interval-0) stop interval=0s timeout=300 (nws-stop-interval-0s) validate-all interval=0 timeout=10 (nws-validate-all-interval-0) monitor interval=120s timeout=300 (nws-monitor-interval-120s)

NetWorker 配置为使用开放式群集框架 (OCF)。监视功能在 中定义 /usr/lib/ocf/resource.d/EMC_NetWorker/Server中的用户名和密码:

NWServer_monitor() {
        local count

        # exit immediately if configuration is not valid
        NWServer_validate_all || exit $?

        quick_monitor
        if [ $? -eq 0 ]; then
                count=0
                while [ $count -lt 3 ]; do
                        echo "q" | nsradmin -s ${NSR_SERVERHOST} -i - > /dev/null 2>&1
                        if [ $? -eq 0 ]; then
                                return $OCF_SUCCESS
                        else
                                count=`expr ${count} + 1`
                                sleep 1
                        fi
                done
        else
                return $OCF_NOT_RUNNING
        fi

        return $OCF_NOT_RUNNING
}

注意: 从技术上讲,在正常情况下,显示器故障应该永远不会发生,并且应表示无法恢复的错误。但是,某些大型环境可能会出现间歇性问题,其中 nsradmin 即使只是暂时,也可能在 Pacemaker 的显示器测试中失败,这会导致 Pacemaker 完全中断。

解析度

群集管理员应调查所有群集中断问题。可以查看群集日志以了解有关中断的任何详细信息:

  • /var/log/pcsd/pcsd.log
  • /var/log/pacemaker/pacemaker.log
  • /var/log/messages

还可以查看 NetWorker 服务器日志。NetWorker 服务器的守护程序 .log 位于共享磁盘上(例如, /nsr_share)。

  • /nsr_share/nsr/logs/daemon.log

如果未启用实时渲染,则 .raw 可以使用以下命令将日志呈现为.log文件:

nsr_render_log /nsr_share/nsr/logs/daemon.raw > /nsr_share/nsr/logs/daemon_`date -I`.log

群集管理员可以增加 NetWorker 服务器 pcs 资源的监视时间间隔和超时值。请参阅 Red Hat Pacemaker 文档了解有关更改超时值的说明,因为 Pacemaker 命令可能会因 Pacemaker 版本而异。

默认情况下,Pacemaker 会重试监视功能三次。如果您希望此参数可调,请联系您的戴尔客户或销售代表以提交增强请求 (RFE)。

其他資訊

The /usr/lib/ocf/resource.d/EMC_NetWorker/Server nsr_monitor 该功能可由集群管理员修改以包括附加功能;但是,此脚本不在 NetWorker 支持范围内。在 NetWorker 服务器升级期间删除对这些脚本的任何更改。

受影響的產品

NetWorker

產品

NetWorker Family, NetWorker Series
文章屬性
文章編號: 000216735
文章類型: Solution
上次修改時間: 23 7月 2026
版本:  7
向其他 Dell 使用者尋求您問題的答案
支援服務
檢查您的裝置是否在支援服務的涵蓋範圍內。