NetWorker:Redに導入されたNetWorkerサーバー Enterprise Linux Pacemakerフェールオーバー クラスターに監視間隔を調整する方法がなかった。

Сводка: 大規模なクラスター環境では、監視が短時間中断されるため、断続的なNetWorkerの停止が発生します。デフォルトでは、モニター機能は3回再試行します。使用可能な「再試行回数」パラメーターはありません。このKBでは、NetWorkerの機能拡張オポチュニティに関する潜在的な回避策とRFE(Request For Enhancement)の詳細を定義します。

Данная статья применяется к Данная статья не применяется к Эта статья не привязана к какому-либо конкретному продукту. В этой статье указаны не все версии продуктов.

Симптомы

  • NetWorkerサーバーがRed Hat Pacemaker(pcs)フェールオーバー クラスター。
  • Pacemaker (pcs)リソース(デフォルトは nws)

Причина

クラスターの停止の原因はさまざまです。このセクションでは、NetWorkerクラスター監視機能の実行に使用するものを定義します。

デフォルトでは、NetWorkerのPacemakerリソースには「monitor」操作。操作には「interval」と「timeout」設定は、NetWorkerクラスターの初期構成時にクラスター管理者によって構成されます。

root@NWrhelNodeA:~# pcs resource
  * Resource Group: NW_group:
    * fs        (ocf::heartbeat:Filesystem):     Started NWrhelNodeA.emclab.local
    * ip        (ocf::heartbeat:IPaddr):         Started NWrhelNodeA.emclab.local
    * nws       (ocf::EMC_NetWorker:Server):     Started NWrhelNodeA.emclab.local
root@NWrhelNodeA:~# pcs resource config nws Resource: nws (class=ocf provider=EMC_NetWorker type=Server) Meta Attrs: is-managed=true Operations: meta-data interval=0 timeout=10 (nws-meta-data-interval-0) migrate_from interval=0 timeout=120 (nws-migrate_from-interval-0) migrate_to interval=0 timeout=60 (nws-migrate_to-interval-0) start interval=0 timeout=300 (nws-start-interval-0) stop interval=0s timeout=300 (nws-stop-interval-0s) validate-all interval=0 timeout=10 (nws-validate-all-interval-0) monitor interval=120s timeout=300 (nws-monitor-interval-120s)

NetWorkerは、OCF(Open Cluster Framework)を使用するように構成されています。監視機能は、 /usr/lib/ocf/resource.d/EMC_NetWorker/Server:

NWServer_monitor() {
        local count

        # exit immediately if configuration is not valid
        NWServer_validate_all || exit $?

        quick_monitor
        if [ $? -eq 0 ]; then
                count=0
                while [ $count -lt 3 ]; do
                        echo "q" | nsradmin -s ${NSR_SERVERHOST} -i - > /dev/null 2>&1
                        if [ $? -eq 0 ]; then
                                return $OCF_SUCCESS
                        else
                                count=`expr ${count} + 1`
                                sleep 1
                        fi
                done
        else
                return $OCF_NOT_RUNNING
        fi

        return $OCF_NOT_RUNNING
}

メモ: モニタの障害は、通常の状況では技術的には決して発生せず、回復不能なエラーを示しているはずです。ただし、一部の大規模環境では、次のような断続的な問題が発生する可能性があります。 nsradmin ペースメーカーのモニター テストで一時的にでも失敗する可能性があり、その結果、ペースメーカーが完全に停止します。

Разрешение

クラスター管理者は、クラスター停止の問題をすべて調査する必要があります。中断の詳細については、クラスター ログで確認できます。

  • /var/log/pcsd/pcsd.log
  • /var/log/pacemaker/pacemaker.log
  • /var/log/messages

NetWorkerサーバー ログも確認できます。NetWorkerサーバーのdaemon.logが共有ディスク(たとえば、 /nsr_share)をクリックします。

  • /nsr_share/nsr/logs/daemon.log

リアルタイムレンダリングが有効になっていない場合、 .raw ログは、次のコマンドを使用して.logファイルにレンダリングできます。

nsr_render_log /nsr_share/nsr/logs/daemon.raw > /nsr_share/nsr/logs/daemon_`date -I`.log

クラスター管理者は、NetWorkerサーバーのpcsリソースのモニター間隔とタイムアウト値を増やすことができます。Pacemaker コマンドは Pacemaker のバージョンによって変更される可能性があるため、タイムアウト値の変更方法については、Red Hat Pacemaker のドキュメントを参照してください

デフォルトでは、Pacemaker はモニター機能を 3 回再試行します。これを調整可能なパラメーターにする場合は、Dellアカウントまたはセールス担当者に連絡して、Request for Enhancement (RFE)を開いてください。

Дополнительная информация

『オペレーティングシステム』ディスクはオプションなので、同梱されていないコンピューターもあります。 /usr/lib/ocf/resource.d/EMC_NetWorker/Server nsr_monitor 関数は、クラスター管理者が変更して、追加の機能を含めることができます。ただし、このスクリプトはNetWorkerのサポート範囲外です。これらのスクリプトに対する変更は、NetWorkerサーバーのアップグレード中に削除されます。

Затронутые продукты

NetWorker

Продукты

NetWorker Family, NetWorker Series
Свойства статьи
Номер статьи: 000216735
Тип статьи: Solution
Последнее изменение: 23 Jul 2026
Версия:  7
Получите ответы на свои вопросы от других пользователей Dell
Услуги технической поддержки
Проверьте, распространяются ли на ваше устройство услуги технической поддержки.