PowerFlex: O SDC do ESXi para de responder no vCenter com todos os caminhos inativos
Resumo: Os servidores ESXi param de responder no vCenter devido ao estado All Paths Down (APD) em um ou mais volumes do PowerFlex.
Este artigo aplica-se a
Este artigo não se aplica a
Este artigo não está vinculado a nenhum produto específico.
Nem todas as versões do produto estão identificadas neste artigo.
Sintomas
Quando um SDC do ESXi apresenta continuamente erros de E/S em volumes do PowerFlex, ele pode entrar no estado All-Path-Down (APD) em relação a um ou mais volumes do PowerFlex. Esse estado pode fazer com que ele pare de responder no vCenter.
Normalmente:
- Alguns hosts do ESXi são exibidos como Disconnected em vSphere Clients
- Os erros de E/S acumulam-se em
vmkernel.log:
2018-01-10T22:30:08.321Z cpu29:33684)ScsiDeviceIO: 2651: Cmd(0x439e41930500) 0x28, CmdSN 0x8819c3 from world 34407 to dev "eui.<mdmId+volId>" failed H:0x0 D:0x2 P:0x0 Valid sense data: 0x4 0x0 0x0.
hostd.logpode conter os seguintes erros no início do estado APD:
2017-10-24T17:06:08.144Z info hostd[2AE0BB70] [Originator@6876 sub=Vimsvc.ha-eventmgr] Event 10313 : Lost connectivity to storage device eui.<mdmId+volId>. Path vmhba64:C0:T27:L91 is down. Affected datastores: <Datastore Name>.
2017-10-24T17:06:08.144Z info hostd[2AE0BB70] [Originator@6876 sub=Hostsvc.VmkVprobSource] VmkVprobSource::Post event: (vim.event.EventEx) {
--> key = 778923875,
--> chainId = 1635216758,
--> createdTime = "1970-01-01T00:00:00Z",
--> userName = "",
--> datacenter = (vim.event.DatacenterEventArgument) null,
--> computeResource = (vim.event.ComputeResourceEventArgument) null,
--> host = (vim.event.HostEventArgument) {
--> name = "PHSVCESQL1018.partners.org",
--> host = 'vim.HostSystem:ha-host'
--> },
--> vm = (vim.event.VmEventArgument) null,
--> ds = (vim.event.DatastoreEventArgument) null,
--> net = (vim.event.NetworkEventArgument) null,
--> dvs = (vim.event.DvsEventArgument) null,
--> fullFormattedMessage = <unset>,
--> changeTag = <unset>,
--> eventTypeId = "esx.problem.storage.apd.start",
--> severity = <unset>,
--> message = <unset>,
--> arguments = (vmodl.KeyAnyValue) [
--> (vmodl.KeyAnyValue) {
--> key = "1",
--> value = "eui.<mdmId+volId>"
--> }
--> ],
--> objectId = "ha-eventmgr",
--> objectType = "vim.HostSystem",
--> objectName = <unset>,
--> fault = (vmodl.MethodFault) null
--> }
2017-10-24T17:06:08.144Z info hostd[2AE0BB70] [Originator@6876 sub=Vimsvc.ha-eventmgr] Event 10314 : Device or filesystem with identifier eui.<mdmId+volId> has entered the All Paths Down state.
hostd.logtem a mensagemesx.problem.storage.apd.timeoutquando ohostdO serviço pára de responder:
2017-10-24T17:06:58.277Z info hostd[29A40B70] [Originator@6876 sub=Hostsvc.VmkVprobSource] VmkVprobSource::Post event: (vim.event.EventEx) {
--> key = 690973144,
--> chainId = 1635216641,
--> createdTime = "1970-01-01T00:00:00Z",
--> userName = "",
--> datacenter = (vim.event.DatacenterEventArgument) null,
--> computeResource = (vim.event.ComputeResourceEventArgument) null,
--> host = (vim.event.HostEventArgument) {
--> name = "ESXi.host.local",
--> host = 'vim.HostSystem:ha-host'
--> },
--> vm = (vim.event.VmEventArgument) null,
--> ds = (vim.event.DatastoreEventArgument) null,
--> net = (vim.event.NetworkEventArgument) null,
--> dvs = (vim.event.DvsEventArgument) null,
--> fullFormattedMessage = <unset>,
--> changeTag = <unset>,
--> eventTypeId = "esx.problem.storage.apd.timeout",
--> severity = <unset>,
--> message = <unset>,
--> arguments = (vmodl.KeyAnyValue) [
--> (vmodl.KeyAnyValue) {
--> key = "1",
--> value = "eui.<mdmId+volId>"
--> },
--> (vmodl.KeyAnyValue) {
--> key = "2",
--> value = "140"
--> }
--> ],
--> objectId = "ha-eventmgr",
--> objectType = "vim.HostSystem",
--> objectName = <unset>,
--> fault = (vmodl.MethodFault) null
--> }
2017-10-24T17:06:58.278Z info hostd[29A40B70] [Originator@6876 sub=Vimsvc.ha-eventmgr] Event 10336 : Device or filesystem with identifier eui.<mdmId+volId> has entered the All Paths Down Timeout state after being in the All Paths Down state for 140 seconds. I/Os will now be fast failed.
- Trecho de
vmkwarningque coincide com o acimahostd:
Observe que o kernel está tentando remover
vmhba64:C0:T30:L62, mas não pode devido a hostd Mantenha-o em um estado ocupado durante a nova varredura e pare de responder:
2017-10-24T17:04:38.267Z cpu8:33147)WARNING: NMP: nmpUnclaimPath:1516: NMP device "eui.<mdmId+volId>" quiesce state change failed: Busy 2017-10-24T17:04:38.267Z cpu8:33147)WARNING: ScsiPath: 4507: Path vmhba64:C0:T30:L62 is being removed 2017-10-24T17:04:38.267Z cpu8:33147)WARNING: ScsiPath: 4737: Failed to issue command 0x0 (cmdSN 0x0) on path vmhba64:C0:T30:L62: No connection 2017-10-24T17:04:38.268Z cpu8:33147)WARNING: ScsiScan: 2007: Could not delete path vmhba64:C0:T30:L62 2017-10-24T17:04:38.337Z cpu42:34088)WARNING: NMP: nmp_IssueCommandToDevice:4553: I/O could not be issued to device "eui.<mdmId+volId>" due to Not found 2017-10-24T17:04:38.337Z cpu42:34088)WARNING: NMP: nmp_DeviceRetryCommand:133: Device "eui.<mdmId+volId>": awaiting fast path state update for failover with I/O blocked. No prior reservation exists on the device. 2017-10-24T17:04:38.337Z cpu42:34088)WARNING: NMP: nmp_DeviceStartLoop:725: NMP Device "eui.<mdmId+volId>" is blocked. Not starting I/O from device. 2017-10-24T17:04:38.560Z cpu32:33507)WARNING: NMP: nmpDeviceAttemptFailover:603: Retry world failover device "eui.<mdmId+volId>" - issuing command 0x43a6402bbac0 2017-10-24T17:04:38.560Z cpu32:33507)WARNING: NMP: nmpDeviceAttemptFailover:678: Retry world failover device "eui.<mdmId+volId>" - failed to issue command due to Not found (APD), try again...
- O seguinte está ocorrendo, como visto no
storagermLogs:
2017-10-24T17:05:49.274Z: Write 0xffcda788[512] -> 68 failed. 38:Function not implemented, offset=0, bufLen=512 2017-10-24T17:05:49.274Z: <Datastore Nam, 0> Write error to fd 68, error: Function not implemented 2017-10-24T17:05:49.274Z: <Datastore Nam, 0> I/Os from datastore eui.207d160928aa82202102c97700000060 took 62.962148(>= 30.000000) seconds to complete stats computation. Reducing its polling frequency. 2017-10-24T17:06:58.277Z: Write 0xffcda788[512] -> 58 failed. 6:No such device or address, offset=0, bufLen=512 2017-10-24T17:07:04.484Z: <Datastore Name, 0> Some host is down, need to reset the slot allocation 2017-10-24T17:07:08.554Z: Skipping device eui.207d160928aa82202102c9530000003e either due to VSI read error or abnormal state 2017-10-24T17:07:08.580Z: open /vmfs/volumes//<Datastore Name>/.eui.<mdmId+volId>/slotsfile(0x202, 0x0) failed: Input/output error 2017-10-24T17:07:08.580Z: Input/output error Error -1 opening/truncating file /vmfs/volumes//<Datastore Name>/.eui.<mdmId+volId>/slotsfile
- As VMs podem ser exibidas como
/vmfs/volumes/.../...vmxarquivos em vez do nome de exibição. - As portas DVS podem começar a falhar devido à perda de conectividade com o vpxa e o vCenter:
2017-10-24T17:06:55.704Z warning hostd[29C81B70] [Originator@6876 sub=Hostsvc.NetworkProvider] Error saving dvport 38 c1 36 50 b6 92 e4 32-1f 16 2d 37 80 dd 7b 2c-14505 to file /vmfs/volumes/59553df0-a1c109ac-b164-54ab3a16bf9d/.dvsData/38 c1 36 50 b6 92 e4 32-1f 16 2d 37 80 dd 7b 2c/14505 2017-10-24T17:06:55.943Z warning hostd[29C81B70] [Originator@6876 sub=Hostsvc.NetworkProvider] Error saving dvport 38 c1 36 50 b6 92 e4 32-1f 16 2d 37 80 dd 7b 2c-8339 to file /vmfs/volumes/59553df0-a1c109ac-b164-54ab3a16bf9d/.dvsData/38 c1 36 50 b6 92 e4 32-1f 16 2d 37 80 dd 7b 2c/8339 2017-10-24T17:06:55.994Z warning hostd[29C81B70] [Originator@6876 sub=Hostsvc.NetworkProvider] Error saving dvport 38 c1 36 50 b6 92 e4 32-1f 16 2d 37 80 dd 7b 2c-15520 to file /vmfs/volumes/59553bbc-77b8edaa-15da-54ab3a16bf9d/.dvsData/38 c1 36 50 b6 92 e4 32-1f 16 2d 37 80 dd 7b 2c/15520 2017-10-24T17:06:56.017Z warning hostd[29C81B70] [Originator@6876 sub=Hostsvc.NetworkProvider] Error saving dvport 38 c1 36 50 b6 92 e4 32-1f 16 2d 37 80 dd 7b 2c-7684 to file /vmfs/volumes/59553bbc-77b8edaa-15da-54ab3a16bf9d/.dvsData/38 c1 36 50 b6 92 e4 32-1f 16 2d 37 80 dd 7b 2c/7684
- Perda de conectividade de VMs e hosts conectados ao vCenter
Também é possível:
- Não é possível estabelecer uma conexão SSH com o ESXi ou VMs (se a rede de gerenciamento estiver em um vSwitch distribuído)
- Não é possível usar
esxclina sessão do console. (Ele para de responder, uselocalcli. Consulte a seção Solução temporária.) - As VMs, incluindo SVM, podem não ser capazes de ligar ou desligar sem eliminar os processos.
- O host do ESXi pode parar de responder na reinicialização.
- Normalmente, mas não necessariamente, o processo de inicialização para de responder após o
nfs41clientO módulo está carregado. As seguintes mensagens são exibidas no console do host (DCUI).
nfs41client loaded successfully
Impacto
- Incapacidade de gerenciar hosts do ESXi por meio do vCenter ou estabelecer uma conexão SSH.
- Sem recursos do vMotion
Causa
No estado APD, as E/Ss do usuário do ESXi (hostd agente), ou quaisquer E/Ss do SO convidado que não sejam abortadas devido ao tempo de espera excedido pelo SO convidado são repetidas indefinidamente, esgotando os recursos do sistema e levando ao estado de não resposta do ESXi no vCenter.
Resolução
- Reinicializar hosts do ESXi sem corrigir a condição subjacente do APD não ajuda, pois o host pode entrar no APD novamente.
- Se houver um requisito para executar comandos em um host do ESXi que esteja enfrentando APD, use "
localcli" em vez de "esxcli", já que este último deixa de responder.
Por exemplo:
- Use o seguinte para verificar se os armazenamentos de dados estão sendo exibidos como montados:
[root@92U-16:~] localcli storage filesystem list Mount Point Volume Name UUID Mounted Type Size Free ----------------------------------------------------------------------------------------------------------------------------------------- /vmfs/volumes/5975cf1e-9306f9bc-0dbc-a0369fdaccbc SATADOM17 5975cf1e-9306f9bc-0dbc-a0369fdaccbc true VMFS-5 55834574848 53979643904 /vmfs/volumes/59916bcd-22a730ae-db91-a0369fdaccbc LocalDS17 59916bcd-22a730ae-db91-a0369fdaccbc true VMFS-6 1920118816768 986341965824 /vmfs/volumes/5975cf15-c44cea1b-de13-a0369fdaccbc 5975cf15-c44cea1b-de13-a0369fdaccbc true vfat 299712512 83927040 /vmfs/volumes/16a83277-c690cda2-9723-26fe2e41d0c3 16a83277-c690cda2-9723-26fe2e41d0c3 true vfat 261853184 97923072 /vmfs/volumes/5975cf1f-17e61cfc-a0ae-a0369fdaccbc 5975cf1f-17e61cfc-a0ae-a0369fdaccbc true vfat 4293591040 4260626432 /vmfs/volumes/79e9c87d-f55f1864-b3ce-6e24607afc68 79e9c87d-f55f1864-b3ce-6e24607afc68 true vfat 261853184 99840000
- Use o seguinte para tentar uma nova varredura no nível do host:
localcli storage filesystem rescan
- Se houver um requisito para reinicializar um host do ESXi que já esteja no estado APD, anote os volumes mapeados para ele e cancele o mapeamento deles temporariamente; Mapeie-os de volta para o host depois que o problema for corrigido.
Nota: Se o host do ESXi estiver conectado a vários sistemas MDM ou PowerFlex, somente os volumes do sistema afetado deverão ser desmapeados.
- Se a solicitação do
unmap_volumeA operação é necessária durante a recuperação, algumas das VMs podem precisar ser registradas novamente depois que os volumes são mapeados de volta e os datastores são montados novamente.
Na versão 2.0.1.3, o recurso de perda permanente de dispositivo (PDL) foi introduzido, que está desativado por padrão. Esse recurso, quando ativado, pode transformar o APD em PDL depois que o SDC não conseguir enviar E/S para um volume após 60 segundos. Esse valor de tempo de espera excedido ainda pode ser maior do que alguns ambientes podem suportar sem ver o impacto e pode exigir ajustes adicionais.
Mais informações
Leitura adicional:
Produtos afetados
PowerFlex rack, ScaleIOPropriedades do artigo
Número do artigo: 000437810
Tipo de artigo: Solution
Último modificado: 27 mar. 2026
Versão: 3
Encontre as respostas de outros usuários da Dell para suas perguntas.
Serviços de suporte
Verifique se o dispositivo está coberto pelos serviços de suporte.