NetWorker:部署在 Red 上 的 NetWorker 服务器 Enterprise Linux Pacemaker 故障切换群集没有调整监视间隔的方法。
Сводка: 由于短暂的监视中断,在大型群集环境中观察到间歇性 NetWorker 中断。默认情况下,监视功能会重试三次。没有可用的“重试计数”参数。本知识库文章定义了可能的解决方法,以及有关 NetWorker 增强机会的增强请求 (RFE) 详细信息。
Данная статья применяется к
Данная статья не применяется к
Эта статья не привязана к какому-либо конкретному продукту.
В этой статье указаны не все версии продуктов.
Симптомы
- NetWorker 服务器安装在 Red Hat Pacemaker (
pcs) 故障切换群集。 - NetWorker由于起搏器短暂中断(
pcs) NetWorker资源(默认值为nws)
Причина
群集宕机的原因可能有所不同。本节定义执行 NetWorker 群集监视器功能所用的内容。
默认情况下,NetWorker 的 Pacemaker 资源具有”monitor“操作。该操作具有”interval“ 和 ”timeout“设置,由群集管理员在初始 NetWorker 群集配置期间配置。
root@NWrhelNodeA:~# pcs resource
* Resource Group: NW_group:
* fs (ocf::heartbeat:Filesystem): Started NWrhelNodeA.emclab.local
* ip (ocf::heartbeat:IPaddr): Started NWrhelNodeA.emclab.local
* nws (ocf::EMC_NetWorker:Server): Started NWrhelNodeA.emclab.local
root@NWrhelNodeA:~# pcs resource config nws
Resource: nws (class=ocf provider=EMC_NetWorker type=Server)
Meta Attrs: is-managed=true
Operations: meta-data interval=0 timeout=10 (nws-meta-data-interval-0)
migrate_from interval=0 timeout=120 (nws-migrate_from-interval-0)
migrate_to interval=0 timeout=60 (nws-migrate_to-interval-0)
start interval=0 timeout=300 (nws-start-interval-0)
stop interval=0s timeout=300 (nws-stop-interval-0s)
validate-all interval=0 timeout=10 (nws-validate-all-interval-0)
monitor interval=120s timeout=300 (nws-monitor-interval-120s)
NetWorker 配置为使用开放式群集框架 (OCF)。监视功能在 中定义 /usr/lib/ocf/resource.d/EMC_NetWorker/Server中的用户名和密码:
NWServer_monitor() {
local count
# exit immediately if configuration is not valid
NWServer_validate_all || exit $?
quick_monitor
if [ $? -eq 0 ]; then
count=0
while [ $count -lt 3 ]; do
echo "q" | nsradmin -s ${NSR_SERVERHOST} -i - > /dev/null 2>&1
if [ $? -eq 0 ]; then
return $OCF_SUCCESS
else
count=`expr ${count} + 1`
sleep 1
fi
done
else
return $OCF_NOT_RUNNING
fi
return $OCF_NOT_RUNNING
}
注意: 从技术上讲,在正常情况下,显示器故障应该永远不会发生,并且应表示无法恢复的错误。但是,某些大型环境可能会出现间歇性问题,其中
nsradmin 即使只是暂时,也可能在 Pacemaker 的显示器测试中失败,这会导致 Pacemaker 完全中断。
Разрешение
群集管理员应调查所有群集中断问题。可以查看群集日志以了解有关中断的任何详细信息:
/var/log/pcsd/pcsd.log/var/log/pacemaker/pacemaker.log/var/log/messages
还可以查看 NetWorker 服务器日志。NetWorker 服务器的守护程序 .log 位于共享磁盘上(例如, /nsr_share)。
/nsr_share/nsr/logs/daemon.log
如果未启用实时渲染,则 .raw 可以使用以下命令将日志呈现为.log文件:
nsr_render_log /nsr_share/nsr/logs/daemon.raw > /nsr_share/nsr/logs/daemon_`date -I`.log
群集管理员可以增加 NetWorker 服务器 pcs 资源的监视时间间隔和超时值。请参阅 Red Hat Pacemaker 文档了解有关更改超时值的说明,因为 Pacemaker 命令可能会因 Pacemaker 版本而异。
默认情况下,Pacemaker 会重试监视功能三次。如果您希望此参数可调,请联系您的戴尔客户或销售代表以提交增强请求 (RFE)。
Дополнительная информация
The /usr/lib/ocf/resource.d/EMC_NetWorker/Server nsr_monitor 该功能可由集群管理员修改以包括附加功能;但是,此脚本不在 NetWorker 支持范围内。在 NetWorker 服务器升级期间删除对这些脚本的任何更改。
Затронутые продукты
NetWorkerПродукты
NetWorker Family, NetWorker SeriesСвойства статьи
Номер статьи: 000216735
Тип статьи: Solution
Последнее изменение: 23 июл. 2026
Версия: 7
Получите ответы на свои вопросы от других пользователей Dell
Услуги технической поддержки
Проверьте, распространяются ли на ваше устройство услуги технической поддержки.