NetWorker: NetWorker-servern som distribuerats på Red Had Enterprise Linux Pacemaker-redundanskluster har ingen metod för att justera övervakningsintervallet.
摘要: Återkommande NetWorker-avbrott har observerats i stora klustermiljöer på grund av korta övervakningsavbrott. Som standard försöker övervakningsfunktionen tre gånger. Det finns ingen tillgänglig parameter för antal försök igen. I den här kunskapsbasartikeln definieras potentiella lösningar och information om en begäran om förbättring (RFE) för en NetWorker-förbättringsmöjlighet. ...
症狀
- NetWorker-servern är installerad på en Red Hat Pacemaker (
pcs) redundanskluster. - Det förekommer periodiska avbrott i NetWorker på grund av korta avbrott i pacemakern (
pcs) för NetWorker-server (standard ärnws)
原因
Orsaken till klusteravbrott kan variera. I det här avsnittet definieras vad som används för att utföra NetWorker-klusterövervakningsfunktioner.
Som standard har pacemakerresursen för NetWorker en "monitor"-operationen. Operationen har "interval" och "timeout"-inställningar som konfigureras av klusteradministratören under den inledande konfigurationen av NetWorker-klustret.
root@NWrhelNodeA:~# pcs resource
* Resource Group: NW_group:
* fs (ocf::heartbeat:Filesystem): Started NWrhelNodeA.emclab.local
* ip (ocf::heartbeat:IPaddr): Started NWrhelNodeA.emclab.local
* nws (ocf::EMC_NetWorker:Server): Started NWrhelNodeA.emclab.local
root@NWrhelNodeA:~# pcs resource config nws
Resource: nws (class=ocf provider=EMC_NetWorker type=Server)
Meta Attrs: is-managed=true
Operations: meta-data interval=0 timeout=10 (nws-meta-data-interval-0)
migrate_from interval=0 timeout=120 (nws-migrate_from-interval-0)
migrate_to interval=0 timeout=60 (nws-migrate_to-interval-0)
start interval=0 timeout=300 (nws-start-interval-0)
stop interval=0s timeout=300 (nws-stop-interval-0s)
validate-all interval=0 timeout=10 (nws-validate-all-interval-0)
monitor interval=120s timeout=300 (nws-monitor-interval-120s)
NetWorker har konfigurerats för att använda Open Cluster Framework (OCF). Övervakningsfunktionen definieras i /usr/lib/ocf/resource.d/EMC_NetWorker/Server:
NWServer_monitor() {
local count
# exit immediately if configuration is not valid
NWServer_validate_all || exit $?
quick_monitor
if [ $? -eq 0 ]; then
count=0
while [ $count -lt 3 ]; do
echo "q" | nsradmin -s ${NSR_SERVERHOST} -i - > /dev/null 2>&1
if [ $? -eq 0 ]; then
return $OCF_SUCCESS
else
count=`expr ${count} + 1`
sleep 1
fi
done
else
return $OCF_NOT_RUNNING
fi
return $OCF_NOT_RUNNING
}
OBSERVERA: Bildskärmsfel bör tekniskt sett aldrig inträffa under normala omständigheter och bör tyda på ett oåterkalleligt fel. Vissa stora miljöer kan dock observera tillfälliga problem där
nsradmin kan misslyckas vid monitortest av en pacemaker även om det bara är tillfälligt, och det resulterar i att pacemakern tar ett helt avbrott.
解析度
Klusteradministratören bör undersöka alla problem med klusteravbrott. Klusterloggarna kan granskas för information om avbrott:
/var/log/pcsd/pcsd.log/var/log/pacemaker/pacemaker.log/var/log/messages
NetWorker-serverloggar kan också granskas. NetWorker-serverns daemon.log finns på den delade disken (t.ex. /nsr_share).
/nsr_share/nsr/logs/daemon.log
Om realtidsåtergivning inte är aktiverat .raw loggen kan återges till en .log fil med följande kommando:
nsr_render_log /nsr_share/nsr/logs/daemon.raw > /nsr_share/nsr/logs/daemon_`date -I`.log
Klusteradministratören kan öka övervakningsintervall- och timeout-värdena för NetWorker-serverdatorresursen. Se Red Hat Pacemaker-dokumentationen för anvisningar om hur du ändrar timeout-värdena eftersom pacemakerkommandon kan ändras mellan pacemakerversioner.
Som standard försöker pacemakern övervaka funktionen igen tre gånger. Om du vill att detta ska vara en justerbar parameter kontaktar du ditt Dell-konto eller din säljare för att öppna en begäran om förbättring (RFE).
其他資訊
Via /usr/lib/ocf/resource.d/EMC_NetWorker/Server nsr_monitor Funktionen kan ändras av klusteradministratören för att inkludera ytterligare funktioner. Det här skriptet ligger dock utanför NetWorker-stödet. Alla ändringar i skripten tas bort när en NetWorker-server uppgraderas.