NetWorker: Herstel mislukt met "NDMP Service Error: Kan formaat niet identificeren"
Summary: Herstel mislukt omdat de NDMP-header (Network Data Management Protocol) beschadigd is, waardoor I/O-fouten en bestandsnummers ontstaan die de positionering verbreken, waardoor 'NDMP Service Error: Kan formaat niet identificeren." ...
Symptoms
De symptomen houden verband met twee hoofdzaken:
- De back-upbeheerder let niet goed op constant terugkerende I/O-fouten van de NMDP-header. Deze NetWorker-waarschuwing bevat een VNX-fout en moet serieus worden behandeld
- De twee producten (NetWorker en VNX) beschouwen de beschadiging van de NMDP-header als een triviale fout. Het speciale geval van back-up start de beschadiging opnieuw op en bereikt een punt dat niet automatisch kan worden opgelost bij het lezen van de gegevens
De vereiste bestanden voor herstel omvatten meerdere back-ups (volledig + differentieel + incrementeel) en meerdere volumes.
Het herstel van de NDMP saveset en het herstel van File by File (browsable) mislukken met nauw verwante fouten
Browsebaar herstelfoutlogboek:
42744:nsrndmp_recover: Tape server paused: reached the end of file
42897:nsrndmp_recover: Opened the tape device : c208t0l0
42870:nsrndmp_recover: Continuing recover from the next volume
42619:nsrndmp_recover: NDMP Service Error: Cannot identify format. <<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<
42617:nsrndmp_recover: NDMP Service Log: server_archive: emctar vol 1, 0 files, 61440 bytes read, 0 bytes written
42738:nsrndmp_recover: Data server halted: Error during the restore.
42856:nsrndmp_recover: NDMP data server has an internal error.
42871:nsrndmp_recover: Error during File NDMP Extraction.
42840:nsrndmp_recover: NDMP recover failed.
42880:nsrndmp_recover: Error during NDMP recover
16279:winworkr: NDMP retrieval: child failed with status of 1
42897:nsrndmp_recover: Opened the tape device : c208t0l5
Mover listen address is NULL(NDMP_ADDR_LOCAL)
De saveset-herstelfout treedt alleen op met de volledige back-up, back-ups op een ander niveau kunnen worden hersteld met saveset-herstel.
root@NW-server# nsrndmp_recover -s NW-server -c NAS-host -S 1011119015 -v off -m "NAS-host::/root_vdm_1/users/recover_emc" "/root_vdm_1/users/VDI_Users/v009/project/Plan04.2012"
42879:nsrndmp_recover: Peforming recover with no file mark dependency..
05/31/16 17:25:50.504040 NDMP Service Debug: The process id for NDMP service is 0xc4bd90b0
42787:nsrndmp_recover: Performing recover from NDMP type of device
05/31/16 17:26:01.269862 NDMP Service Debug: The process id for NDMP service is 0xc4bd90b0
May 31 17:26:02 NW-server root: [ID 702911 local0.alert] NetWorker media: (waiting) waiting for LTO Ultrium-5 tape VN0116L5 on NAS-host
95555:nsrmmd: ndmp tape mtio failed, I/O error
42850:nsrndmp_recover: Failed to load volume 1111782299 fnum 3 <<<<<< cannot load File Number 3
42855:nsrndmp_recover: Failed to load the tape.
42871:nsrndmp_recover: Error during File NDMP Extraction.
42840:nsrndmp_recover: NDMP recover failed.
42880:nsrndmp_recover: Error during NDMP recover
root@NW-server #
Het belangrijkste symptoom is dat de scanner niet in staat is om door de vereiste back-upvolumes te gaan, hij stopt voortijdig voordat er gegevens worden gelezen!
root@NW-server # scanner -vvv -p "rd=NAS-host:c208t0l5 (NDMP)"
8909:scanner: using 'rd=NAS-host:c208t0l5 (NDMP)' as the device name
05/31/16 17:29:08.919423 NDMP Service Debug: The process id for NDMP service is 0xda018d60
9040:scanner: Opened c208t0l5 for read
8968:scanner: Reading the label...
8969:scanner: Reading the label done
8936:scanner: scanning LTO Ultrium-5 tape VN0116L5 on rd=NAS-host:c208t0l5 (NDMP)
96367:scanner: volume id 1111782299 record size 262144 bytes
created 5/24/16 21:00:35 expires 5/24/18 21:00:35
8973:scanner: setting position from fn 0, rn 0 to fn 2, rn 0
05/31/16 17:29:09.073276 NDMP Service Debug: The process id for NDMP service is 0xda018d60
9040:scanner: Opened c208t0l5 for read
05/31/16 17:29:09.201476 NDMP Service Debug: The process id for NDMP service is 0xda018d60
9040:scanner: Opened c208t0l5 for read
8761:scanner: done with LTO Ultrium-5 tape VN0116L5 <<<<<<<< No Errors , no mention of any file after File number 2 !!
Het gebruik van het NW debug flag-bestand: /nsr/debu/ndmp_auto_pos heeft niet geholpen met de volledige back-up saveset of doorzoekbaar herstel.
Cause
Misvormde NDMP-volume-indeling veroorzaakt door beschadiging van NDMP-header die soms foutieve bestandsnummers genereert (zoals automatisch opnieuw opstarten van back-ups):
Uit de inspectie van NW-logboeken blijkt dat elke back-up is gekoppeld aan een I/O-fout bij het schrijven van de NDMP-header. Dit is een consistent probleem dat zich voordoet bij elke back-up, dit is een aanwijzing voor een consistente corruptie.
70896 05/01/16 12:18:05 0 0 2 1 23177 0 NW-server nsrd NSR info NAS-host:/root_vdm_1/userdata saving to pool 'NDMPPool' (VN0050L5)
42597 05/01/16 12:18:05 2 0 0 1 23990 0 NW-server nsrmmd NSR warning ndmp header: I/O error <<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<<
71193 05/01/16 12:18:05 0 0 0 1 23177 0 NW-server nsrd NSR info NDMP Save Notice: NAS-host:/root_vdm_1/users NDMP save running on 'NW-server'
Uit de inspectie van de NAS-logboeken blijkt dat de buffergrootte van NDMP-apparaten is ingesteld op een waarde die kleiner is dan de blokgrootte van het apparaat die is geconfigureerd in NW. De standaard NetWorker-configuratie stelt de blokgrootte van het apparaat voor LTO-5-apparaten in op 256 K, maar de buffergrootte van het NDMP-apparaat (NDMP.bufsz) is 128 K. Dit deel is alleen gerelateerd aan de NDMP-header, aangezien de grootte van het datablok op de NAS is geconfigureerd door de PAX-configuratieparameters (standaard 60k).
2016-05-25 17:30:37: NDMP: 3: Thread ndmp533 DartTapeInterface: tape read error: tape read block size (262144 bytes) > 131072 bytes (NDMP.bufsz (128 KB) x 1024)
2016-05-25 17:30:37: NDMP: 3: Thread ndmp533 set parameter NDMP.bufsz (in KB) to 256 or larger to resolve this error
2016-05-25 17:30:49: NDMP: 3: Thread ndmp535 DartTapeInterface: tape read error: tape read block size (262144 bytes) > 131072 bytes (NDMP.bufsz (128 KB) x 1024)
2016-05-25 17:30:49: NDMP: 3: Thread ndmp535 set parameter NDMP.bufsz (in KB) to 256 or larger to resolve this error
2016-05-25 17:30:50: NDMP: 3: Thread ndmp536 DartTapeInterface: tape read error: tape read block size (262144 bytes) > 131072 bytes (NDMP.bufsz (128 KB) x 1024)
2016-05-25 17:30:50: NDMP: 3: Thread ndmp536 set parameter NDMP.bufsz (in KB) to 256 or larger to resolve this error
Het VNX-logboek toont een gerelateerd bericht op het moment van de back-up:
1466097048: NDMP: 3: Session 236 (thread ndmp236) TAPE_WRITE, size(262144) > ndmpMaxBufSize (131072) Set NDMP.bufsz >= 262144 and reboot
Dit wordt niet beschouwd als een back-upprobleem omdat de gegevensstroom nog niet is gestart, maar het veroorzaakt beschadiging van de NMDP-header (zie: NDMP: 3: Sessie 384 (thread ndmp384) TAPE_WRITE, size(262144) > ndmpMaxBufSize (131072)Stel NDMP.bufsz >= 262144 en reboot in), die dit probleem oplost door de buffergrootte van de NDMP-apparaten in te stellen op 256k. Deze correctie lost het probleem van de reeds geschreven back-ups echter niet op.
De bovenstaande beschadiging van de NMDP-header kan bestaan zonder het herstelprobleem te veroorzaken, maar in het geval van opnieuw opstarten van de back-up is het geregistreerde bestandsnummer onjuist in de NW-mediadatabase. Waardoor de automatische positionering van de tape ongeldig wordt en dus de NAS antwoordt dat de bestaande gegevens op die positie niet kunnen worden herkend als geldige NDMP-gegevensstroom (NDMP-servicefout: Kan formaat niet identificeren)
Hier zijn dus twee soorten corruptie:
- IO-fouten van NDMP-header veroorzaakt door de inconsistente instelling van de blokgrootte tussen NetWorker en VNX. Dit type beschadiging wordt omzeild door de functie Automatische positionering en kan jaren blijven bestaan zonder dat iemand het merkt. Zolang bij elke saveset de juiste bestandsnummers worden geregistreerd.
- Wanneer een back-up opnieuw wordt gestart, worden meerdere NDMP-kop- en voetteksten opeenvolgend geschreven en mist de NW-server het juiste bestandsnummer waar de volgende back-up begint, waardoor automatische positionering het gebruik van de NDMP-foutopsporing voor automatische positionering ongeldig wordt (
/nsr/debug/ndmp_auto_pos) is in dit geval nutteloos omdat de Tape Management Interface (MTIO) stopt met lezen zodra deze een dubbele bestandsmarkering tegenkomt (veroorzaakt door C1 de beschadiging van de NDMP-header)
Resolution
Raadpleeg deze KB wanneer u contact opneemt met Dell Support.