NetWorker:部署在紅色裝置上的 NetWorker 伺服器 Have Enterprise Linux Pacemaker 容錯移轉叢集無法調整監控間隔。

Сводка: 在大型叢集環境中,由於短暫的監控中斷,出現間歇性 NetWorker 服務中斷。默認情況下,監視功能重試三次。沒有可用的「重試計數」參數。此知識文章定義了可能的因應措施,以及 NetWorker 增強商機的增強要求 (RFE) 詳細資料。

Данная статья применяется к Данная статья не применяется к Эта статья не привязана к какому-либо конкретному продукту. В этой статье указаны не все версии продуктов.

Симптомы

  • NetWorker 伺服器安裝在 Red Hat Pacemaker 上 (pcs) 容錯移轉叢集。
  • 由於起搏器短暫中斷 (pcs) NetWorker 伺服器的資源 (預設為 nws)

Причина

叢集服務中斷的原因可能有所不同。本節定義用於執行 NetWorker 叢集監控功能的項目。

根據預設,NetWorker 的 Pacemaker 資源具有「monitor“操作。該操作具有”interval“和”timeout」這些設定是由叢集管理員在初始 NetWorker 叢集組態期間所設定。

root@NWrhelNodeA:~# pcs resource
  * Resource Group: NW_group:
    * fs        (ocf::heartbeat:Filesystem):     Started NWrhelNodeA.emclab.local
    * ip        (ocf::heartbeat:IPaddr):         Started NWrhelNodeA.emclab.local
    * nws       (ocf::EMC_NetWorker:Server):     Started NWrhelNodeA.emclab.local
root@NWrhelNodeA:~# pcs resource config nws Resource: nws (class=ocf provider=EMC_NetWorker type=Server) Meta Attrs: is-managed=true Operations: meta-data interval=0 timeout=10 (nws-meta-data-interval-0) migrate_from interval=0 timeout=120 (nws-migrate_from-interval-0) migrate_to interval=0 timeout=60 (nws-migrate_to-interval-0) start interval=0 timeout=300 (nws-start-interval-0) stop interval=0s timeout=300 (nws-stop-interval-0s) validate-all interval=0 timeout=10 (nws-validate-all-interval-0) monitor interval=120s timeout=300 (nws-monitor-interval-120s)

NetWorker 設定為使用 Open Cluster Framework (OCF)。監控功能定義於 /usr/lib/ocf/resource.d/EMC_NetWorker/Server

NWServer_monitor() {
        local count

        # exit immediately if configuration is not valid
        NWServer_validate_all || exit $?

        quick_monitor
        if [ $? -eq 0 ]; then
                count=0
                while [ $count -lt 3 ]; do
                        echo "q" | nsradmin -s ${NSR_SERVERHOST} -i - > /dev/null 2>&1
                        if [ $? -eq 0 ]; then
                                return $OCF_SUCCESS
                        else
                                count=`expr ${count} + 1`
                                sleep 1
                        fi
                done
        else
                return $OCF_NOT_RUNNING
        fi

        return $OCF_NOT_RUNNING
}

注意: 在正常情況下,顯示器技術上不應發生故障,且應表示發生無法復原的錯誤。但是,某些大型環境可能會出現間歇性問題,其中 nsradmin 在起搏器的監視器測試中可能會失敗,即使只是暫時失敗,這會導致起搏器完全中斷。

Разрешение

群集管理員應調查所有群集中斷問題。您可以檢閱叢集記錄,以取得有關中斷的任何詳細資料:

  • /var/log/pcsd/pcsd.log
  • /var/log/pacemaker/pacemaker.log
  • /var/log/messages

您也可以檢閱 NetWorker 伺服器記錄。NetWorker 伺服器的daemon.log位於共用磁碟上 (例如 /nsr_share)。

  • /nsr_share/nsr/logs/daemon.log

如果未啟用即時渲染,則 .raw 可以使用以下命令將日誌呈現為.log檔:

nsr_render_log /nsr_share/nsr/logs/daemon.raw > /nsr_share/nsr/logs/daemon_`date -I`.log

叢集系統管理員可以增加 NetWorker 伺服器電腦資源的監控間隔和逾時值。有關更改超時值的說明,請參閱紅帽起搏器文檔,因為起搏器命令可能會因起搏器版本而異。

根據預設,起搏器會重試顯示器功能三次。如果您想要讓此參數為可調參數,請聯絡您的 Dell 客戶或銷售代表,以開立增強要求 (RFE)。

Дополнительная информация

可使用 /usr/lib/ocf/resource.d/EMC_NetWorker/Server nsr_monitor 集群管理員可以修改功能以包含其他功能;但是,此指令碼不在 NetWorker 的支援範圍內。在 NetWorker 伺服器升級期間,會移除對這些指令檔所做的任何變更。

Затронутые продукты

NetWorker

Продукты

NetWorker Family, NetWorker Series
Свойства статьи
Номер статьи: 000216735
Тип статьи: Solution
Последнее изменение: 23 Jul 2026
Версия:  7
Получите ответы на свои вопросы от других пользователей Dell
Услуги технической поддержки
Проверьте, распространяются ли на ваше устройство услуги технической поддержки.