PowerFlex: Risorsa gateway PowerFlex 4.x disconnessa dal sistema MDM
Riepilogo: La risorsa PowerFlex Gateway visualizza un avviso che indica che è disconnessa dal sistema MDM.
Sintomi
Scenario
PowerFlex Gateway è stato collegato al cluster MDM e non sono state apportate modifiche significative nell'ambiente, ad esempio il deployment di un nuovo PFMP.
Dal punto di vista del gruppo di risorse, potrebbe essere presente l'errore relativo all'errore di inventario:

- Diverse operazioni all'interno dell'interfaccia utente potrebbero non funzionare correttamente, come la creazione di volumi, la gestione del sistema PowerFlex, dei gruppi di risorse e così via.
- I log dei pod gateway segnalano una disconnessione continua all MDM primario
14:17:22.751 [|LiaConnectionListener1-ReceiveLoop-1672798151] INFO c.e.e.n.c.LayeredProtocolConnection - LPC-1672798151 #a1697bb310b37861 [10.23.50.50:9098]: Attempting to re-connect LPC-1672798151 #a1697bb310b37861 [10.23.50.50:9098] 14:17:22.751 [|LiaConnectionListener1-ReceiveLoop-1672798151] INFO c.e.e.n.c.LayeredProtocolConnection - LPC-1672798151 #a1697bb310b37861 [10.23.50.50:9098]: We have no cluster info, trying original ip: 10.23.50.50 14:17:22.751 [|LiaConnectionListener1-ReceiveLoop-1672798151] INFO c.e.e.n.c.LayeredProtocolConnection - LPC-1672798151 #a1697bb310b37861 [10.23.50.50:9098]: Trying to reconnect to 10.23.50.50:9098 14:17:22.756 [|LiaConnectionListener1-ReceiveLoop-1672798151] ERROR c.e.e.n.c.LayeredProtocolConnection - LPC-1672798151 #a1697bb310b37861 [10.23.50.50:9098]: IOException in receive loop: java.net.SocketException: Connection reset 14:17:22.756 [|LiaConnectionListener1-ReceiveLoop-1672798151] ERROR c.e.e.n.c.LayeredProtocolConnection - LPC-1672798151 #a1697bb310b37861 [10.23.50.50:9098]: Got exception when trying to reopen connection. will retry after 30 seconds 14:17:25.753 [|https-openssl-nio-443-exec-7] ERROR c.e.s.s.s.ConnectionServiceImpl - Got rc TIMEOUT for command QueryVersion 14:17:25.753 [|https-openssl-nio-443-exec-7] ERROR c.e.s.s.s.ConnectionServiceImpl - Got rc TIMEOUT for command QueryVersion 14:17:25.753 [|https-openssl-nio-443-exec-7] ERROR c.e.s.s.s.ConnectionServiceImpl - Got error from cluster: TIMEOUT 14:17:25.753 [|https-openssl-nio-443-exec-7] ERROR c.e.s.s.w.c.SpecialImplController - Got an exception in handleException stdout F com.emc.s3g.scaleio.common.gateway.ScaleIORemoteRuntimeException: A timeout occurred
- Il pod di presentazione segnala una disconnessione continua all MDM primario
01:16:13.009 [RxComputationThreadPool-5-ReceiveLoop-311432045|ERROR|com.emc.ecs.net.connection.LayeredProtocolConnection.errorWithState] LPC-311432045 #7466ad4d62f83d17 [10.23.50.50:8611]: IOException in receive loop: java.net.SocketException: Connection reset 01:16:13.009 [RxComputationThreadPool-5-ReceiveLoop-311432045|ERROR|com.emc.ecs.net.connection.LayeredProtocolConnection.errorWithState] LPC-311432045 #7466ad4d62f83d17 [10.23.50.50:8611]: Got exception when trying to reopen connection. will retry after 10 seconds
- In alcuni casi, i registri del server LIA su un server MDM di gestione indicano un problema. L'output riportato di seguito mostra che l'indirizzo IP 10.10.10.15 (corrispondente al nodo PFMP che ospita il pod gateway) sta tentando di connettersi al server LIA, ma ha esito negativo a causa di certificati scaduti.
2024/02/20 19:53:27.626621 LOW:7fb108372db0:netSec_Accept_CK:00310: Starting secure accept 2024/02/20 19:53:27.634301 MED:7fb108372db0:mosSecurity_PrintLibX509StoreCtxError:01112: SSL certificate verification error: certificate has expired 2024/02/20 19:53:27.634316 LOW:7fb108372db0:mosSsl_HandleError:00422: ERROR: Handshake: error:1417C086:SSL routines:tls_process_client_certificate:certificate verify failed, SSL error: 1 2024/02/20 19:53:27.634319 LOW:7fb108372db0:netSec_SslHandshake_CK:00486: ERROR: Handshake failed (CERT_VERIFY_FAILURE) 2024/02/20 19:53:27.634322 LOW:7fb108372db0:netPath_StartAsServer_CK:00556: ERROR: :: Disconnected Live SERVER path 0x7fb061044e70 of portal (nil) net 0xa9c740 socket 16 inflights 0 HS:1 secure accept failure (CERT_VERIFY_FAILURE) 2024/02/20 19:53:27.635455 LOW:7fb108372db0:netPath_StartAsServer_CK:00533: :: Disconnected Live SERVER path 0x7fb061044e70 of portal (nil) net 0xa9c740 socket 16 inflights 0 HS:0 Start connection from IP 10.10.10.15:9817 to 10.10.10.20:9098
- Tutti i certificati sul lato server LIA non sono scaduti.
- Tutti i certificati sul lato PFMP non sono scaduti.
- PFMP per mostrare che il certificato caricato è scaduto sul gateway:
echo -n | openssl s_client -connect $(kubectl get svc -A | grep -w block-legacy-gateway | grep -v mds | awk '{print $4}'):443 2>/dev/null | sed -ne '/-BEGIN CERTIFICATE-/,/-END CERTIFICATE-/p' > cert.pem ; openssl x509 -in cert.pem -noout -dates
Impatto
Impossibile gestire il sistema PowerFlex tramite l'interfaccia utente PFxM.
Causa
Il certificato del gateway PowerFlex viene sottoposto a rinnovo automatico ogni tre mesi tramite cert-manager. Tuttavia, si verifica un problema per cui il nuovo certificato non viene caricato correttamente nel gateway, con conseguente conservazione di un certificato scaduto.
Risoluzione
Per caricare il nuovo certificato, è necessario riavviare il pod del gateway a blocchi PowerFlex.
- Accedere tramite SSH a uno dei server PFMP (MVM)
- Eseguire il comando seguente per riavviare i pod del gateway a blocchi e il pod di presentazione :
kubectl get pods -n powerflex | grep -Ei'gateway|presentation'| egrep -iv'mds|metrics'| awk'{print $1}'| xargs kubectl delete pods -n powerflex - Eseguire l'inventario sulla risorsa gateway di blocchi PowerFlex nell'interfaccia utente di PFxM
Versioni
interessatePowerFlex Manager 4.x
Risolto nella versione
PowerFlex Manager 4.6.1