RecoverPoint: Abstürze des Replikationsprozesses, die zu Journalbeschädigungen und vollständigem Sweeping führen
Summary: Replikationsprozesse stürzen ab, was zu Journalbeschädigungen und vollständigem Sweeping einer Konsistenzgruppe führt
Symptoms
Aufgrund eines Codeproblems kann ein Verteilungsfehler zu Journalverlust führen, was dazu führt, dass eine Konsistenzgruppe (Consistency Group, CG) vollständig durchsucht wird und alle Journaleinträge verloren gehen.
Dies wirkt sich auf eine Standardreplikatkopie aus, nicht jedoch auf Data Domain- oder XtremIO-Arrays.
In den Replikationsprotokollen der Site Control RecoverPoint Appliance wird Folgendes beobachtet:
2019/05/25 00:00:43.684 - #2 - 7872/7573 - DistributorGroupHandler::tryDistributeForward: highPerf m_GroupGridCopyRID = (groupCopyRID=(kVolSlot=XXXXXX,globalCopyID=GlobalCopy(SiteUID(0XXXXXXX..a) 0) ),gridCopyID=0)... 2019/05/25 00:00:46.427 - #2 - 7691/7573 - ReplicationControl_AO_IMPL::closePipe_i: enter groupCopyID = GroupCopy(XXXXXXXXXX SiteUID() 0) destCopyID = GlobalCopy(SiteUID(0x0XXXXXX..a) 0)... 2019/05/25 00:00:46.435 - #2 - 7691/7573 - DistributorGroupHandler::closeSession: close session free a_Data.m_bPartialReleaseStarted = 1 a_Data.m_bPartialReleaseSessionStarted = 1 ... a_Data.m_InitDoSnapHead = StreamPointer(streamID=13060353732993089537 blockID=1839 offset=261304942) ... ... 2019/05/25 00:00:46.575 - #2 - 7704/7573 - ReplicationControl_AO_IMPL::openPipe_i: groupCopyID = GroupCopy(XXXXXX SiteUID(0xxxxxx..a) 0)... 2019/05/25 00:01:16.552 - #2 - 10582/7573 - Fetcher_AO_IMPL::fetch_i: ... m_readLoc = StreamPointer(streamID=13060353732993089537 blockID=1839 offset=318942206) 2019/05/25 00:01:16.621 - #2 - 7869/7573 - Fetcher_AO_IMPL::read: a_startPtr = StreamPointer(streamID=13060353732993089537 blockID=1839 offset=318942206) a_isFastForward = 0 a_fastForwardTimeStamp = NoOption 2019/05/25 00:01:16.634 - #0 - 10582/7573 - PersistentObjectVersion: errno=0 Call to deserialization with unknown version=62, current version =16
Cause
Während der Initiierung wird eine Pipe geschlossen. Der Replikationsprozess gibt möglicherweise Journalblöcke frei, die dem Abrufer nicht bekannt sind, wodurch ein Snapshot unterbrochen wird und es zu Beschädigungen kommt.
Resolution
Problemumgehung: Nehmen Sie auf jeder RecoverPoint-Appliance (RPA) in jedem Cluster je nach RecoverPoint-Version die folgende Anpassung entweder innerhalb des boxmgmt- oder admin-Nutzers vor: t_maxHighPerfGroups = 0
Der Standardwert ist 3 und sollte in 0 geändert werden.
Danach muss jede RecoverPoint-Appliance neu gestartet werden, um sicherzustellen, dass die Änderung wirksam wird.
Lösung: Dieses Problem wurde in RecoverPoint Version 5.1.4.1 (5.1 SP4 Patch 1 und höher) behoben.