NetWorker: serwer NetWorker wdrożony w klastrze trybu failover Red Had Enterprise Linux Pacemaker nie ma metody dostrajania interwału monitorowania.
Сводка: Sporadyczne przerwy w działaniu usługi NetWorker w dużych klastrach z powodu krótkich przerw w monitorowaniu. Domyślnie funkcja monitorowania ponawia próbę trzy razy. Nie jest dostępny parametr "liczba ponownych prób". W tej bazie wiedzy zdefiniowano potencjalne obejścia problemu oraz szczegóły wniosku o ulepszenie (RFE) dotyczące możliwości ulepszenia NetWorker. ...
Симптомы
- Serwer NetWorker jest zainstalowany na rozwiązaniu Red Hat Pacemaker (
pcs) klastra awaryjnego. - Występują sporadyczne przerwy w działaniu NetWorker z powodu krótkich przerw w działaniu rozrusznika serca (
pcs) dla serwera NetWorker (wartość domyślna tonws).
Причина
Przyczyny awarii klastra mogą być różne. W tej sekcji opisano, co jest używane do wykonywania funkcji monitora klastra NetWorker.
Domyślnie zasób programu Pacemaker dla NetWorker ma "monitor". Operacja ma "interval" oraz "timeout", które są konfigurowane przez administratora klastra podczas wstępnej konfiguracji klastra NetWorker.
root@NWrhelNodeA:~# pcs resource
* Resource Group: NW_group:
* fs (ocf::heartbeat:Filesystem): Started NWrhelNodeA.emclab.local
* ip (ocf::heartbeat:IPaddr): Started NWrhelNodeA.emclab.local
* nws (ocf::EMC_NetWorker:Server): Started NWrhelNodeA.emclab.local
root@NWrhelNodeA:~# pcs resource config nws
Resource: nws (class=ocf provider=EMC_NetWorker type=Server)
Meta Attrs: is-managed=true
Operations: meta-data interval=0 timeout=10 (nws-meta-data-interval-0)
migrate_from interval=0 timeout=120 (nws-migrate_from-interval-0)
migrate_to interval=0 timeout=60 (nws-migrate_to-interval-0)
start interval=0 timeout=300 (nws-start-interval-0)
stop interval=0s timeout=300 (nws-stop-interval-0s)
validate-all interval=0 timeout=10 (nws-validate-all-interval-0)
monitor interval=120s timeout=300 (nws-monitor-interval-120s)
Rozwiązanie NetWorker jest skonfigurowane do korzystania z Open Cluster Framework (OCF). Funkcja monitorowania jest zdefiniowana w /usr/lib/ocf/resource.d/EMC_NetWorker/Server:
NWServer_monitor() {
local count
# exit immediately if configuration is not valid
NWServer_validate_all || exit $?
quick_monitor
if [ $? -eq 0 ]; then
count=0
while [ $count -lt 3 ]; do
echo "q" | nsradmin -s ${NSR_SERVERHOST} -i - > /dev/null 2>&1
if [ $? -eq 0 ]; then
return $OCF_SUCCESS
else
count=`expr ${count} + 1`
sleep 1
fi
done
else
return $OCF_NOT_RUNNING
fi
return $OCF_NOT_RUNNING
}
UWAGA: Z technicznego punktu widzenia awaria monitora nigdy nie powinna wystąpić w normalnych okolicznościach i powinna wskazywać na nieodwracalny błąd. Jednak w niektórych dużych środowiskach mogą wystąpić sporadyczne problemy, w których
nsradmin może zakończyć się niepowodzeniem podczas testu monitora rozrusznika serca, nawet jeśli tylko tymczasowo, co powoduje, że rozrusznik serca przechodzi pełną awarię.
Разрешение
Administrator klastra powinien zbadać wszystkie problemy z awarią klastra. Dzienniki klastra można przejrzeć, aby uzyskać szczegółowe informacje na temat przerw:
/var/log/pcsd/pcsd.log/var/log/pacemaker/pacemaker.log/var/log/messages
Można również przeglądać dzienniki serwera NetWorker. daemon.log serwera NetWorker znajduje się na dysku udostępnionym (na przykład /nsr_share).
/nsr_share/nsr/logs/daemon.log
Jeśli renderowanie w czasie rzeczywistym nie jest włączone, .raw Dziennik można wyrenderować do pliku .log za pomocą następującego polecenia:
nsr_render_log /nsr_share/nsr/logs/daemon.raw > /nsr_share/nsr/logs/daemon_`date -I`.log
Administrator klastra może zwiększyć wartości interwału monitorowania i limitu czasu dla zasobu Serwery NetWorker. Zapoznaj się z dokumentacją programu Red Hat Pacemaker, aby uzyskać wskazówki dotyczące zmiany wartości limitu czasu, ponieważ polecenia programu Pacemaker mogą ulec zmianie w różnych wersjach programu Pacemaker.
Domyślnie rozrusznik serca ponawia próbę wykonania funkcji monitora trzy razy. Jeśli chcesz, aby był to parametr dostrajalny, skontaktuj się z przedstawicielem klienta lub handlowym firmy Dell, aby otworzyć żądanie rozszerzenia (RFE).
Дополнительная информация
Klawisze /usr/lib/ocf/resource.d/EMC_NetWorker/Server nsr_monitor funkcja może być modyfikowana przez administratora klastra w celu uwzględnienia dodatkowych funkcji; jednak te skrypty są poza obsługą NetWorker. Wszelkie zmiany tych skryptów są usuwane podczas uaktualniania serwera NetWorker.