NetWorker: il server NetWorker è stato implementato nel cluster di failover Red Had Enterprise Linux Pacemaker non dispone di alcun metodo per ottimizzare l'intervallo di monitoraggio.
摘要: Interruzioni intermittenti dell'alimentazione di NetWorker osservate in ambienti cluster di grandi dimensioni a causa di brevi interruzioni nel monitoraggio. Per impostazione predefinita, la funzione monitor effettua tre tentativi. Non è disponibile alcun parametro "numero di tentativi". Questo articolo della Knowledge Base definisce le potenziali soluzioni alternative e i dettagli di una richiesta di miglioramento (RFE) per un'opportunità di miglioramento di NetWorker. ...
症狀
- Il server NetWorker è installato su un pacemaker Red Hat (
pcs) cluster di failover. - Si verificano interruzioni intermittenti dell'alimentazione in NetWorker a causa di brevi interruzioni del pacemaker (
pcs) per il server NetWorker (il valore predefinito ènws)
原因
La causa delle interruzioni dell'alimentazione del cluster può variare. Questa sezione definisce cosa viene usato per eseguire le funzioni di monitoraggio del cluster NetWorker.
Per impostazione predefinita, la risorsa Pacemaker per NetWorker dispone di "monitor" operazione. L'operazione ha "interval" e "timeout" configurate dall'amministratore del cluster durante la configurazione iniziale del cluster NetWorker.
root@NWrhelNodeA:~# pcs resource
* Resource Group: NW_group:
* fs (ocf::heartbeat:Filesystem): Started NWrhelNodeA.emclab.local
* ip (ocf::heartbeat:IPaddr): Started NWrhelNodeA.emclab.local
* nws (ocf::EMC_NetWorker:Server): Started NWrhelNodeA.emclab.local
root@NWrhelNodeA:~# pcs resource config nws
Resource: nws (class=ocf provider=EMC_NetWorker type=Server)
Meta Attrs: is-managed=true
Operations: meta-data interval=0 timeout=10 (nws-meta-data-interval-0)
migrate_from interval=0 timeout=120 (nws-migrate_from-interval-0)
migrate_to interval=0 timeout=60 (nws-migrate_to-interval-0)
start interval=0 timeout=300 (nws-start-interval-0)
stop interval=0s timeout=300 (nws-stop-interval-0s)
validate-all interval=0 timeout=10 (nws-validate-all-interval-0)
monitor interval=120s timeout=300 (nws-monitor-interval-120s)
NetWorker è configurato per l'utilizzo di Open Cluster Framework (OCF). La funzione di monitoraggio è definita in /usr/lib/ocf/resource.d/EMC_NetWorker/Server:
NWServer_monitor() {
local count
# exit immediately if configuration is not valid
NWServer_validate_all || exit $?
quick_monitor
if [ $? -eq 0 ]; then
count=0
while [ $count -lt 3 ]; do
echo "q" | nsradmin -s ${NSR_SERVERHOST} -i - > /dev/null 2>&1
if [ $? -eq 0 ]; then
return $OCF_SUCCESS
else
count=`expr ${count} + 1`
sleep 1
fi
done
else
return $OCF_NOT_RUNNING
fi
return $OCF_NOT_RUNNING
}
NOTA: Tecnicamente, un errore del monitor non dovrebbe mai verificarsi in circostanze normali e dovrebbe essere indicativo di un errore irreversibile. Tuttavia, alcuni ambienti di grandi dimensioni potrebbero osservare problemi intermittenti in cui
nsradmin può fallire il test del monitor di un pacemaker, anche se solo temporaneamente, e ciò comporta un'interruzione completa dell'alimentazione del pacemaker.
解析度
L'amministratore del cluster deve analizzare tutti i problemi relativi all'interruzione dell'alimentazione del cluster. I registri del cluster possono essere esaminati per eventuali dettagli sulle interruzioni:
/var/log/pcsd/pcsd.log/var/log/pacemaker/pacemaker.log/var/log/messages
È possibile esaminare anche i log del server NetWorker. La daemon.log del server NetWorker si trova sul disco condiviso (ad esempio, /nsr_share).
/nsr_share/nsr/logs/daemon.log
Se il rendering in tempo reale non è abilitato, l'icona .raw log può essere visualizzato in un file .log con il seguente comando:
nsr_render_log /nsr_share/nsr/logs/daemon.raw > /nsr_share/nsr/logs/daemon_`date -I`.log
L'amministratore del cluster può aumentare i valori di intervallo di monitoraggio e timeout per la risorsa pcs del server NetWorker. Consultare la documentazione di Red Hat Pacemaker per istruzioni sulla modifica dei valori di timeout in quanto i comandi di Pacemaker possono cambiare nelle versioni di Pacemaker.
Per impostazione predefinita, il pacemaker riprova a eseguire tre volte la funzione di monitoraggio. Se si desidera che questo sia un parametro regolabile, contattare il proprio account Dell o il responsabile vendite per aprire una richiesta di miglioramento (RFE).
其他資訊
I tasti /usr/lib/ocf/resource.d/EMC_NetWorker/Server nsr_monitor la funzione può essere modificata dall'amministratore del cluster per includere funzioni aggiuntive; tuttavia, questo scripting non rientra nel supporto di NetWorker. Eventuali modifiche apportate a questi script vengono rimosse durante l'upgrade del server NetWorker.