VxRail: objeto do vSAN inacessível, falha no disco, latência excessiva de E/S, integridade geral do disco vermelha
Summary: Não remova os discos durante a ressincronização do vSAN, pois isso pode resultar em perda de dados.
Symptoms
Este artigo é aplicável às versões VxRail 7.x e VxRail 8.x.
A verificação de integridade do vSAN encontra falha do disco ou vmware-vsan-health-summary-result.log Encontra physdiskoverall A saúde é vermelha ou amarela.
VxRail-Virtual-SAN-Cluster-xxxxxxxxx Overall Health : red Group physicaldisks health : red Test physdiskoverall health : red DisksWithIssues: Host Disk OverallOperationHealth Metadata Operational InCmmds/Vsi OperationalState Recommendation Uuid (Host-10, LocalToshibaDisk(Naa.50000xxxxxxxxxx), Red, Green, Red, Yes/Yes, ImpendingPermanentDiskFailure,EvacuationFailedDueToInaccessibleObjects, PleaseReferTo'Data'HealthCheckAndResolveTheInaccessibleObjects
vsandevicemonitord.log reports:
INFO vsandevicemonitord WARNING - WRITE Average Latency on VSAN device naa.50000xxxxxxxx has exceeded threshold value 2000000 us 2 times. INFO vsandevicemonitord Tier 2 (naa.50000xxxxxxxx) as unhealthy
Cause
O recurso Dying Disk Handling (DDH) do vSAN diagnostica a integridade do disco ou do grupo de discos detectando latência excessiva de E/S para um disco vSAN ou congestionamento máximo de registro que o vSAN determina como devido a problemas de vazamento de logs em um grupo de discos vSAN durante um período prolongado. O disco ou os grupos de discos não íntegros são marcados dessa forma e o disco ou os grupos de discos não são mais usados para o novo posicionamento de dados.
Quando o DDH detecta que um disco excedeu o limite de latência de E/S durante o intervalo de monitoramento, o vSAN gera uma Observação VMkernel (VOB) e registra uma mensagem no vsandevicemonitord.log no arquivo no /var/run/log diretório. A entrada de log abaixo é um exemplo de um disco que deve ser substituído depois que a evacuação de dados necessária for concluída e o disco estiver em um estado evacuado:
WARNING - WRITE Average Latency on VSAN device <NAA disk name> has exceeded threshold value <IO latency threshold for disk> us <# of intervals with excessive IO latency> times.
Quando o DDH detecta que um nível de armazenamento em cache tem congestionamento excessivo de logs durante o intervalo de monitoramento, o vSAN gera um VOB e registra no vsandevicemonitord.log . Mensagens excessivas de congestionamento de log estão nesse formato:
WARNING - Maximum log congestion on VSAN device <NAA disk name> <current intervals with excessive log congestion>/<intervals required to be unhealthy>
Em ambas as situações, o vSAN aciona a evacuação de alguns ou todos os dados do disco afetado ou dos grupos de discos. A seção geral de integridade dos discos na interface do usuário de monitoramento de integridade do vSAN relata qualquer um dos seguintes estados operacionais para o disco ou grupos de discos afetados, juntamente com recomendações para o usuário. As recomendações após a conclusão da evacuação diferem dependendo se o vSAN detectou latências excessivas de E/S ou congestionamento excessivo de registros.
Resolution
Consulte o artigo 326878 da VMware, Dying Disk Handling (DDH) in vSAN
Não remova nem substitua o disco durante as situações abaixo em que a ressincronização do vSAN estiver em andamento. Se você fizer isso, poderá ocorrer perda de dados.
Impending permanent disk failure, data evacuation failed due to insufficient resources (Health state - Red)
Ou
Impending permanent disk failure, data evacuation failed due to inaccessible objects (Health state - Red)
Não remova nem substitua um disco quando o objeto estiver inacessível.
Objeto inacessível significa que todas as cópias do objeto estão ausentes. Se você remover ou substituir um disco, isso pode causar perda de dados.
Solução temporária:
- Envolva a VMware
- Se a latência excessiva de E/S causou o status de não integridade do disco de capacidade, recupere o disco por meio de uma nova montagem. A remontagem do disco não altera o UUID do vSAN do disco.
esxcli vsan storage diskgroup unmount -u <disk group UUID> esxcli vsan storage diskgroup mount -u <disk group UUID>