PowerScale:SyncIQ 关系中的一个群集报告的已用磁盘空间比另一个群集多。
Сводка: 本文介绍了为什么 syncIQ 关系中的一个群集(源或目标)报告的已用磁盘空间比另一个群集多。两个群集应显示完全相同的已用磁盘空间。SyncIQ 作业是最新的。
Симптомы
syncIQ 关系中的一个 PowerScale 群集(源或目标)的已用磁盘空间比另一个 PowerScale 群集多。两个群集应具有相同的已用空间。
示例,如 'isi status' command:
目标群集显示 349T 已使用硬盘 (HDD) 存储:
Cluster Name: TARGET-POWERSCALE Cluster Health: [ ATTN] Data Reduction: 1.00 : 1 Storage Efficiency: 0.73 : 1 Cluster Storage: HDD SSD Storage Size: 417.2T (432.5T Raw) 5.7T (5.7T Raw) VHS Size: 15.4T Used: 348.6T (84%) 669.1G (11%) ==================> Avail: 68.6T (16%) 5.1T (89%) Health Throughput (bps) HDD Storage SSD Storage ID |IP Address |DASR | In Out Total| Used / Size |Used / Size ---+---------------+-----+-----+-----+-----+-----------------+----------------- 9|1099.2.6 | OK | 1.0M| 488k| 1.5M|87.2T/ 104T( 84%)| 167G/ 1.4T( 11%) 10|10.99.2.7 | OK | 820M| 4.2M| 824M|87.2T/ 104T( 84%)| 167G/ 1.4T( 11%) 11|10.99.2.8 | OK | 678M| 2.9M| 681M|87.2T/ 104T( 84%)| 167G/ 1.4T( 11%) 12|10.99.2.9 | OK | 0| 123k| 123k|87.1T/ 104T( 84%)| 167G/ 1.4T( 11%) ---+---------------+-----+-----+-----+-----+-----------------+----------------- Cluster Totals: | 1.5G| 7.7M| 1.5G| 349T/ 417T( 84%)| 669G/ 5.7T( 11%) Health Fields: D = Down, A = Attention, S = Smartfailed, R = Read-Only
源只有 286 T 的已用硬盘存储:
Cluster Name: SOURCE-POWERSCALE Cluster Health: [ ATTN] Data Reduction: 1.00 : 1 Storage Efficiency: 0.71 : 1 Cluster Storage: HDD SSD Storage Size: 417.2T (432.5T Raw) 5.7T (5.7T Raw) VHS Size: 15.4T Used: 285.5T (68%) 721.9G (12%) ========> Avail: 131.7T (32%) 5.0T (88%) Health Throughput (bps) HDD Storage SSD Storage ID |IP Address |DASR | In Out Total| Used / Size |Used / Size ---+---------------+-----+-----+-----+-----+-----------------+----------------- 9|10.99.3.13 | OK | 290M| 9.9M| 300M|71.4T/ 104T( 68%)| 180G/ 1.4T( 12%) 10|10.99.3.11 | OK | 324M| 832M| 1.2G|71.4T/ 104T( 68%)| 181G/ 1.4T( 12%) 11|10.99.3.12 | OK | 194M| 8.4M| 202M|71.4T/ 104T( 68%)| 181G/ 1.4T( 12%) 12|10.99.3.10 | OK | 1.9M| 2.0M| 3.8M|71.4T/ 104T( 68%)| 181G/ 1.4T( 12%) ---+---------------+-----+-----+-----+-----+-----------------+----------------- Cluster Totals: | 809M| 852M| 1.7G| 286T/ 417T( 68%)| 722G/ 5.7T( 12%)
Причина
在 syncIQ 关系中,群集之间存在空间差异的常见原因如下所示:
— 位于 /ifs/.ifsvar (最常见)
--快照大小
的差异--保护级别
的差异--收集作业未在一个群集上运行,因此不会释放孤立的磁盘块。
--位于以下位置的大型支持相关文件/文件夹 /ifs/data/Isilon_Support
Разрешение
假设所有 syncIQ 作业都为最新的复制,请检查以下各项:
1) 通常情况下,使用更多空间的群集具有位于 /ifs/.ifsvar。
在每个群集上,从屏幕会话(因为命令可能需要很长时间才能返回),运行以下命令:
# du -sh /ifs/.ifsvar
在每个群集上运行该命令。
过去,PowerScale 支持人员认为这是罪魁祸首,尤其是由于有大量审核日志。
选中 /ifs/.ifsvar/audit 目录和以下子目录
Where <nodeXXX> is the node ID (for example node001):/ifs/.ifsvar/audit/logs/.
/ifs/.ifsvar/audit/logs/<nodeXXX>
/ifs/.ifsvar/audit/logs/<nodeXXX>/protocol
如果需要,请按照以下文章删除审核文件:
000167091 Powerscale 的知识库文章:如何删除审核日志文件
2) 确认两个群集之间的保护级别没有差异。
实时群集:
isi stat -p -q -v
日志:
# cat <base log set>/local/isi_stat-p
Dell Technologies 还可以检查 diskpools 使用支持协助的内部命令的保护级别。
3) 通过在每个群集上运行以下命令,确认两个群集之间的快照使用没有太大差异:
# isi snapshot usage
4) 在报告更多已用空间的群集上,检查内存中是否存在任何与支持相关的大型文件/文件夹 /ifs/data/Isilon_Support:
# du -so /ifs/data/Isilon_Support
5) 如果仍然卡住,下一步是检查上次在每个群集上运行 Collect 的时间。
(注意: 请务必注意,“MultiScan”并不总是运行 Collect 作业)。
此 Collect 作业会释放群集上的所有过时磁盘块,并且通常可能会导致一个群集显示的已用磁盘空间比另一个群集多的原因。 一种快捷的方法是检查 /var/log/messages 上次成功运行收集的节点,例如:
# grep Collect /var/log/messages|grep Succeed
# zgrep Collect /var/log/messages*
6) 如果仍然卡住,请运行 FSAnalyze 作业,并使用 InsightIQ 查看哪个文件夹在群集上占用了更多空间,且已用空间更多。
'isi stat heat' 群集上更完整的命令也可能提供有关新写入发生位置的一些线索。