NetWorker: Server NetWorker nasazený na Red Had Enterprise Linux Cluster s podporou převzetí služeb při selhání Pacemakeru nemá žádnou metodu ladění intervalu monitorování.
摘要: Občasné výpadky NetWorker pozorované v prostředích velkých clusterů kvůli krátkým přerušením monitorování. Ve výchozím nastavení se funkce monitorování opakuje třikrát. Není k dispozici žádný parametr počtu opakování. Tento článek znalostní databáze definuje možná zástupná řešení a podrobnosti RFE (Request For Enhancement) pro příležitost vylepšení NetWorker. ...
症狀
- Server NetWorker je nainstalován na kardiostimulátoru Red Hat Pacemaker (
pcs) clusteru s podporou převzetí služeb při selhání. - V nástroji NetWorker dochází k občasným výpadkům v důsledku krátkých přerušení kardiostimulátoru (
pcs) pro server NetWorker (výchozí jenws)
原因
Příčiny výpadků clusteru mohou být různé. Tato část definuje, co se používá k provádění funkcí monitorování clusteru NetWorker.
Ve výchozím nastavení má prostředek Pacemaker pro NetWorker "monitor" operace. Operace má "interval" a "timeout", která jsou konfigurována správcem clusteru během počáteční konfigurace clusteru NetWorker.
root@NWrhelNodeA:~# pcs resource
* Resource Group: NW_group:
* fs (ocf::heartbeat:Filesystem): Started NWrhelNodeA.emclab.local
* ip (ocf::heartbeat:IPaddr): Started NWrhelNodeA.emclab.local
* nws (ocf::EMC_NetWorker:Server): Started NWrhelNodeA.emclab.local
root@NWrhelNodeA:~# pcs resource config nws
Resource: nws (class=ocf provider=EMC_NetWorker type=Server)
Meta Attrs: is-managed=true
Operations: meta-data interval=0 timeout=10 (nws-meta-data-interval-0)
migrate_from interval=0 timeout=120 (nws-migrate_from-interval-0)
migrate_to interval=0 timeout=60 (nws-migrate_to-interval-0)
start interval=0 timeout=300 (nws-start-interval-0)
stop interval=0s timeout=300 (nws-stop-interval-0s)
validate-all interval=0 timeout=10 (nws-validate-all-interval-0)
monitor interval=120s timeout=300 (nws-monitor-interval-120s)
Nástroj NetWorker je nakonfigurován tak, aby používal prostředí OCF (Open Cluster Framework). Monitorovací funkce je definována v /usr/lib/ocf/resource.d/EMC_NetWorker/Server:
NWServer_monitor() {
local count
# exit immediately if configuration is not valid
NWServer_validate_all || exit $?
quick_monitor
if [ $? -eq 0 ]; then
count=0
while [ $count -lt 3 ]; do
echo "q" | nsradmin -s ${NSR_SERVERHOST} -i - > /dev/null 2>&1
if [ $? -eq 0 ]; then
return $OCF_SUCCESS
else
count=`expr ${count} + 1`
sleep 1
fi
done
else
return $OCF_NOT_RUNNING
fi
return $OCF_NOT_RUNNING
}
POZNÁMKA: K selhání monitoru by za normálních okolností technicky nikdy nemělo dojít a mělo by být známkou neobnovitelné chyby. V některých velkých prostředích však může docházet k občasným problémům
nsradmin může selhat při testu monitoru kardiostimulátoru, i když jen dočasně, a to má za následek úplný výpadek kardiostimulátoru.
解析度
Správce clusteru by měl prozkoumat všechny problémy s výpadkem clusteru. V protokolech clusteru lze zkontrolovat jakékoli podrobnosti o přerušeních:
/var/log/pcsd/pcsd.log/var/log/pacemaker/pacemaker.log/var/log/messages
Protokoly serveru NetWorker lze také zkontrolovat. daemon.log serveru NetWorker je umístěn na sdíleném disku (například /nsr_share).
/nsr_share/nsr/logs/daemon.log
Pokud vykreslování v reálném čase není povoleno, .raw Protokol lze vykreslit do souboru .log pomocí následujícího příkazu:
nsr_render_log /nsr_share/nsr/logs/daemon.raw > /nsr_share/nsr/logs/daemon_`date -I`.log
Správce clusteru může zvýšit hodnoty intervalu sledování a časového limitu pro zdroj počítačů serveru NetWorker. Pokyny ke změně hodnot časového limitu najdete v dokumentaci k Red Hat Pacemakeru, protože příkazy Pacemakeru se můžou v různých verzích Pacemakeru měnit.
Ve výchozím nastavení Pacemaker opakuje funkci monitorování třikrát. Chcete-li, aby se jednalo o laditelný parametr, obraťte se na obchodní zástupce nebo obchodní zástupce společnosti Dell a otevřete požadavek na vylepšení (RFE).
其他資訊
Kód /usr/lib/ocf/resource.d/EMC_NetWorker/Server nsr_monitor Funkci může správce clusteru upravit tak, aby zahrnovala další funkce. Toto skriptování je však mimo podporu NetWorker. Veškeré změny těchto skriptů jsou během upgradu serveru NetWorker odebrány.