PowerFlex : Le SDC ESXi cesse de répondre dans vCenter avec tous les chemins arrêtés
Résumé: Les serveurs ESXi cessent de répondre dans vCenter en raison de l’état All Paths Down (APD) sur un ou plusieurs volumes PowerFlex.
Cet article concerne
Cet article ne concerne pas
Cet article n’est associé à aucun produit spécifique.
Toutes les versions du produit ne sont pas identifiées dans cet article.
Symptômes
Lorsqu’un SDC ESXi rencontre continuellement des erreurs d’E/S sur les volumes PowerFlex, il peut passer à l’état All-Path-Down (APD) sur un ou plusieurs volumes PowerFlex. Cet état peut l’empêcher de répondre dans vCenter.
Généralement:
- Certains hôtes ESXi s’affichent comme Déconnectés dans les clients vSphere
- Les erreurs d’E/S s’accumulent dans
vmkernel.log:
2018-01-10T22:30:08.321Z cpu29:33684)ScsiDeviceIO: 2651: Cmd(0x439e41930500) 0x28, CmdSN 0x8819c3 from world 34407 to dev "eui.<mdmId+volId>" failed H:0x0 D:0x2 P:0x0 Valid sense data: 0x4 0x0 0x0.
hostd.logpeut contenir les erreurs suivantes au début de l’état APD :
2017-10-24T17:06:08.144Z info hostd[2AE0BB70] [Originator@6876 sub=Vimsvc.ha-eventmgr] Event 10313 : Lost connectivity to storage device eui.<mdmId+volId>. Path vmhba64:C0:T27:L91 is down. Affected datastores: <Datastore Name>.
2017-10-24T17:06:08.144Z info hostd[2AE0BB70] [Originator@6876 sub=Hostsvc.VmkVprobSource] VmkVprobSource::Post event: (vim.event.EventEx) {
--> key = 778923875,
--> chainId = 1635216758,
--> createdTime = "1970-01-01T00:00:00Z",
--> userName = "",
--> datacenter = (vim.event.DatacenterEventArgument) null,
--> computeResource = (vim.event.ComputeResourceEventArgument) null,
--> host = (vim.event.HostEventArgument) {
--> name = "PHSVCESQL1018.partners.org",
--> host = 'vim.HostSystem:ha-host'
--> },
--> vm = (vim.event.VmEventArgument) null,
--> ds = (vim.event.DatastoreEventArgument) null,
--> net = (vim.event.NetworkEventArgument) null,
--> dvs = (vim.event.DvsEventArgument) null,
--> fullFormattedMessage = <unset>,
--> changeTag = <unset>,
--> eventTypeId = "esx.problem.storage.apd.start",
--> severity = <unset>,
--> message = <unset>,
--> arguments = (vmodl.KeyAnyValue) [
--> (vmodl.KeyAnyValue) {
--> key = "1",
--> value = "eui.<mdmId+volId>"
--> }
--> ],
--> objectId = "ha-eventmgr",
--> objectType = "vim.HostSystem",
--> objectName = <unset>,
--> fault = (vmodl.MethodFault) null
--> }
2017-10-24T17:06:08.144Z info hostd[2AE0BB70] [Originator@6876 sub=Vimsvc.ha-eventmgr] Event 10314 : Device or filesystem with identifier eui.<mdmId+volId> has entered the All Paths Down state.
hostd.loga le messageesx.problem.storage.apd.timeoutLorsque l'hostdLe service cesse de répondre :
2017-10-24T17:06:58.277Z info hostd[29A40B70] [Originator@6876 sub=Hostsvc.VmkVprobSource] VmkVprobSource::Post event: (vim.event.EventEx) {
--> key = 690973144,
--> chainId = 1635216641,
--> createdTime = "1970-01-01T00:00:00Z",
--> userName = "",
--> datacenter = (vim.event.DatacenterEventArgument) null,
--> computeResource = (vim.event.ComputeResourceEventArgument) null,
--> host = (vim.event.HostEventArgument) {
--> name = "ESXi.host.local",
--> host = 'vim.HostSystem:ha-host'
--> },
--> vm = (vim.event.VmEventArgument) null,
--> ds = (vim.event.DatastoreEventArgument) null,
--> net = (vim.event.NetworkEventArgument) null,
--> dvs = (vim.event.DvsEventArgument) null,
--> fullFormattedMessage = <unset>,
--> changeTag = <unset>,
--> eventTypeId = "esx.problem.storage.apd.timeout",
--> severity = <unset>,
--> message = <unset>,
--> arguments = (vmodl.KeyAnyValue) [
--> (vmodl.KeyAnyValue) {
--> key = "1",
--> value = "eui.<mdmId+volId>"
--> },
--> (vmodl.KeyAnyValue) {
--> key = "2",
--> value = "140"
--> }
--> ],
--> objectId = "ha-eventmgr",
--> objectType = "vim.HostSystem",
--> objectName = <unset>,
--> fault = (vmodl.MethodFault) null
--> }
2017-10-24T17:06:58.278Z info hostd[29A40B70] [Originator@6876 sub=Vimsvc.ha-eventmgr] Event 10336 : Device or filesystem with identifier eui.<mdmId+volId> has entered the All Paths Down Timeout state after being in the All Paths Down state for 140 seconds. I/Os will now be fast failed.
- Extrait de
vmkwarningqui coïncide avec ce qui précèdehostd:
Notez que le noyau tente de supprimer
vmhba64:C0:T30:L62, mais il ne peut pas en raison de hostd En le maintenant dans un état occupé pendant la nouvelle analyse et l’arrêt de l’état de réponse :
2017-10-24T17:04:38.267Z cpu8:33147)WARNING: NMP: nmpUnclaimPath:1516: NMP device "eui.<mdmId+volId>" quiesce state change failed: Busy 2017-10-24T17:04:38.267Z cpu8:33147)WARNING: ScsiPath: 4507: Path vmhba64:C0:T30:L62 is being removed 2017-10-24T17:04:38.267Z cpu8:33147)WARNING: ScsiPath: 4737: Failed to issue command 0x0 (cmdSN 0x0) on path vmhba64:C0:T30:L62: No connection 2017-10-24T17:04:38.268Z cpu8:33147)WARNING: ScsiScan: 2007: Could not delete path vmhba64:C0:T30:L62 2017-10-24T17:04:38.337Z cpu42:34088)WARNING: NMP: nmp_IssueCommandToDevice:4553: I/O could not be issued to device "eui.<mdmId+volId>" due to Not found 2017-10-24T17:04:38.337Z cpu42:34088)WARNING: NMP: nmp_DeviceRetryCommand:133: Device "eui.<mdmId+volId>": awaiting fast path state update for failover with I/O blocked. No prior reservation exists on the device. 2017-10-24T17:04:38.337Z cpu42:34088)WARNING: NMP: nmp_DeviceStartLoop:725: NMP Device "eui.<mdmId+volId>" is blocked. Not starting I/O from device. 2017-10-24T17:04:38.560Z cpu32:33507)WARNING: NMP: nmpDeviceAttemptFailover:603: Retry world failover device "eui.<mdmId+volId>" - issuing command 0x43a6402bbac0 2017-10-24T17:04:38.560Z cpu32:33507)WARNING: NMP: nmpDeviceAttemptFailover:678: Retry world failover device "eui.<mdmId+volId>" - failed to issue command due to Not found (APD), try again...
- Ce qui suit se produit, comme on le voit dans l'
storagermJournaux:
2017-10-24T17:05:49.274Z: Write 0xffcda788[512] -> 68 failed. 38:Function not implemented, offset=0, bufLen=512 2017-10-24T17:05:49.274Z: <Datastore Nam, 0> Write error to fd 68, error: Function not implemented 2017-10-24T17:05:49.274Z: <Datastore Nam, 0> I/Os from datastore eui.207d160928aa82202102c97700000060 took 62.962148(>= 30.000000) seconds to complete stats computation. Reducing its polling frequency. 2017-10-24T17:06:58.277Z: Write 0xffcda788[512] -> 58 failed. 6:No such device or address, offset=0, bufLen=512 2017-10-24T17:07:04.484Z: <Datastore Name, 0> Some host is down, need to reset the slot allocation 2017-10-24T17:07:08.554Z: Skipping device eui.207d160928aa82202102c9530000003e either due to VSI read error or abnormal state 2017-10-24T17:07:08.580Z: open /vmfs/volumes//<Datastore Name>/.eui.<mdmId+volId>/slotsfile(0x202, 0x0) failed: Input/output error 2017-10-24T17:07:08.580Z: Input/output error Error -1 opening/truncating file /vmfs/volumes//<Datastore Name>/.eui.<mdmId+volId>/slotsfile
- Les machines virtuelles peuvent s’afficher comme
/vmfs/volumes/.../...vmxau lieu du nom d’affichage. - Les ports DVS peuvent commencer à échouer en raison d’une perte de connectivité avec vpxa et vCenter :
2017-10-24T17:06:55.704Z warning hostd[29C81B70] [Originator@6876 sub=Hostsvc.NetworkProvider] Error saving dvport 38 c1 36 50 b6 92 e4 32-1f 16 2d 37 80 dd 7b 2c-14505 to file /vmfs/volumes/59553df0-a1c109ac-b164-54ab3a16bf9d/.dvsData/38 c1 36 50 b6 92 e4 32-1f 16 2d 37 80 dd 7b 2c/14505 2017-10-24T17:06:55.943Z warning hostd[29C81B70] [Originator@6876 sub=Hostsvc.NetworkProvider] Error saving dvport 38 c1 36 50 b6 92 e4 32-1f 16 2d 37 80 dd 7b 2c-8339 to file /vmfs/volumes/59553df0-a1c109ac-b164-54ab3a16bf9d/.dvsData/38 c1 36 50 b6 92 e4 32-1f 16 2d 37 80 dd 7b 2c/8339 2017-10-24T17:06:55.994Z warning hostd[29C81B70] [Originator@6876 sub=Hostsvc.NetworkProvider] Error saving dvport 38 c1 36 50 b6 92 e4 32-1f 16 2d 37 80 dd 7b 2c-15520 to file /vmfs/volumes/59553bbc-77b8edaa-15da-54ab3a16bf9d/.dvsData/38 c1 36 50 b6 92 e4 32-1f 16 2d 37 80 dd 7b 2c/15520 2017-10-24T17:06:56.017Z warning hostd[29C81B70] [Originator@6876 sub=Hostsvc.NetworkProvider] Error saving dvport 38 c1 36 50 b6 92 e4 32-1f 16 2d 37 80 dd 7b 2c-7684 to file /vmfs/volumes/59553bbc-77b8edaa-15da-54ab3a16bf9d/.dvsData/38 c1 36 50 b6 92 e4 32-1f 16 2d 37 80 dd 7b 2c/7684
- Perte de connectivité des machines virtuelles et des hôtes connectés à vCenter
Également possible :
- Impossible d’établir une connexion SSH à ESXi ou aux VM (si le réseau de gestion se trouve sur un vSwitch distribué)
- Impossible d’utiliser
esxclidans la session de console. (Il cesse de répondre, utilisezlocalclià la place. Reportez-vous à la section Solution de contournement.) - Les machines virtuelles, y compris les SVM, peuvent ne pas être en mesure de s’allumer ou de s’éteindre sans arrêter les processus.
- L’hôte ESXi peut cesser de répondre au redémarrage ou au démarrage.
- Généralement, mais pas nécessairement, le processus de démarrage cesse de répondre une fois que
nfs41clientLe module est chargé. Les messages suivants s’affichent sur la console de l’hôte (DCUI).
nfs41client loaded successfully
Impact
- Impossibilité de gérer les hôtes ESXi via vCenter ou d’établir une connexion SSH.
- Aucune fonctionnalité vMotion
Cause
À l’état APD, les E/S de l’utilisateur ESXi (hostd ), ou toutes les E/S du système d’exploitation invité qui n’ont pas été abandonnées en raison du délai d’expiration du système d’exploitation invité, font l’objet d’une nouvelle tentative indéfiniment, ce qui épuise les ressources du système et entraîne l’absence de réponse d’ESXi dans vCenter.
Résolution
- Le redémarrage des hôtes ESXi sans avoir corrigé la condition APD sous-jacente n’aide pas, car l’hôte peut à nouveau entrer dans APD.
- S’il est nécessaire d’exécuter des commandes sur un hôte ESXi qui rencontre APD, utilisez "
localcli« au lieu de »esxcli», alors que ce dernier cesse de répondre.
Par exemple :
- Utilisez les éléments suivants pour vérifier si les datastores s’affichent comme montés :
[root@92U-16:~] localcli storage filesystem list Mount Point Volume Name UUID Mounted Type Size Free ----------------------------------------------------------------------------------------------------------------------------------------- /vmfs/volumes/5975cf1e-9306f9bc-0dbc-a0369fdaccbc SATADOM17 5975cf1e-9306f9bc-0dbc-a0369fdaccbc true VMFS-5 55834574848 53979643904 /vmfs/volumes/59916bcd-22a730ae-db91-a0369fdaccbc LocalDS17 59916bcd-22a730ae-db91-a0369fdaccbc true VMFS-6 1920118816768 986341965824 /vmfs/volumes/5975cf15-c44cea1b-de13-a0369fdaccbc 5975cf15-c44cea1b-de13-a0369fdaccbc true vfat 299712512 83927040 /vmfs/volumes/16a83277-c690cda2-9723-26fe2e41d0c3 16a83277-c690cda2-9723-26fe2e41d0c3 true vfat 261853184 97923072 /vmfs/volumes/5975cf1f-17e61cfc-a0ae-a0369fdaccbc 5975cf1f-17e61cfc-a0ae-a0369fdaccbc true vfat 4293591040 4260626432 /vmfs/volumes/79e9c87d-f55f1864-b3ce-6e24607afc68 79e9c87d-f55f1864-b3ce-6e24607afc68 true vfat 261853184 99840000
- Utilisez les éléments suivants pour tenter une nouvelle analyse au niveau de l’hôte :
localcli storage filesystem rescan
- S’il est nécessaire de redémarrer un hôte ESXi qui est déjà à l’état APD, notez les volumes qui y sont mappés et annulez temporairement leur mappage ; Mappez-les à l’hôte une fois le problème résolu.
Remarque : Si l’hôte ESXi est connecté à plusieurs systèmes MDM ou PowerFlex, seuls les volumes du système concerné doivent être démappés.
- si
unmap_volumeL’opération est nécessaire lors de la récupération. Certaines machines virtuelles devront peut-être être réenregistrées après le mappage des volumes et le montage des datastores.
Dans la version 2.0.1.3, la fonctionnalité de perte d’appareil permanente (PDL) a été introduite, qui est désactivée par défaut. Lorsque cette fonctionnalité est activée, elle peut transformer un APD en PDL lorsque le SDC est incapable d’envoyer des E/S à un volume après 60 secondes. Cette valeur de délai d’expiration peut encore être plus longue que ce que certains environnements peuvent supporter sans voir l’impact et peut nécessiter un réglage supplémentaire.
Informations supplémentaires
Lectures supplémentaires :
Produits concernés
PowerFlex rack, ScaleIOPropriétés de l’article
Numéro d’article: 000437810
Type d’article: Solution
Dernière modification: 27 Mar 2026
Version: 3
Trouvez des réponses à vos questions auprès d’autres utilisateurs Dell
Services de support
Vérifiez si votre appareil est couvert par les services de support.