RecoverPoint for Virtual Machines: Falhas de processo nos vRPAs causam impacto na replicação
Summary: Os grupos de consistência (CGs) em estado de erro, pois os equipamentos RecoverPoint (RPAs) não conseguem acessar os volumes de repositório (KVOL) e registro (JVOL).
Symptoms
Em ambientes do RecoverPoint for VMs (RP4VMs), os grupos de consistência (CGs) podem entrar em um estado de erro, pois os RPAs não conseguem acessar o repositório e os volumes de registro.
Erros na saída do status do painel de indicadores ou do sistema:
ERROR: Journal volume [Copy, PROD, IOFilter_JVOL_00044] cannot be accessed by: RPA 2
Possíveis erros nos logs de controle/replicação:
2020/02/12 23:40:02.275 - #0 - 13659/13550 - MultiPath: errno=0 PathImporter::importFinished: got MPI error: SanDiscoveryBoxMgrProxy connection lost (maybe storage process died?) a_res.error = 1 2020/02/12 23:40:02.275 - #2 - 13631/13550 - MultiPath: MPVolumeConnectingState::handleImportedPaths: requesting non-optimized: a_volume = 0x483a04edc455f87e (StorageType=RP_VSTORAGE, revision= 2020/02/12 23:40:02.275 - #0 - 13631/13550 - MultiPath: errno=0 PathImporter::importFinished: got MPI error: SanDiscoveryBoxMgrProxy connection lost (maybe storage process died?) a_res.error = 1 2020/02/12 23:40:02.275 - #2 - 13631/13550 - MultiPath: MPVolumeConnectingState::handleImportedPaths: requesting all: a_volume = 0x483a04edc455f87e (StorageType=RP_VSTORAGE, revision= 2020/02/12 23:40:02.275 - #0 - 13631/13550 - MultiPath: errno=0 PathImporter::importFinished: got MPI error: SanDiscoveryBoxMgrProxy connection lost (maybe storage process died?) a_res.error = 1 2020/02/12 23:40:02.275 - #2 - 13631/13550 - MultiPath: MultiIOSender::finish: IO error m_volume.getGuid() = 0x483a04edc455f87e &m_io = 0x7f5ef4887950 this = 0x7f5ef4887940 a_status = general error MPVolumeConnectingState
O registro de armazenamento mostra que o log foi interrompido antes da hora atual (processo não em execução).
Outro sintoma pode ser a reinicialização do processo de replicação.
O log do kernel do RPA (extraído "*/files/var/log/kern.log") mostra "Out of memory killing" do processo de replicação:
Nov 26 13:36:40 localhost kernel: [4545420.314953] Out of memory: Kill process 4842 (replication) score 530 or sacrifice child Nov 26 13:36:40 localhost kernel: [4545420.354484] Out of memory: Kill process 4842 (replication) score 530 or sacrifice child
Cause
Os processos do RPA travam devido à falta de memória. As VMs do RPA não tinham toda a memória reservada.
Resolution
Solução alternativa:
Reinicialize os RPAs.
Resolução:
Verifique se todos os RPAs têm toda a memória guest reservada.
No vSphere, clique com o botão direito do mouse em vRPA VM > Edit settings... > Expanda a seção >Memória Selecione Reserve all guest memory (All locked)> Clique em OK.
