PowerScale:SyncIQ 關係中的一個叢集回報的已使用磁碟空間多於另一個叢集。
Сводка: 本文說明為何 syncIQ 關係中的一個叢集 (來源或目標) 可能回報已使用磁碟空間多於另一個叢集。兩個叢集應顯示相同使用的磁碟空間。SyncIQ 工作為最新版本。
Симптомы
在 syncIQ 關係中,一個 PowerScale 叢集 (來源或目標) 的已使用磁碟空間多於另一個 PowerScale 叢集。兩個群集應具有相同使用的空間。
範例如 'isi status' 命令:
目標叢集顯示 349T 已使用硬碟 (HDD) 儲存裝置:
Cluster Name: TARGET-POWERSCALE Cluster Health: [ ATTN] Data Reduction: 1.00 : 1 Storage Efficiency: 0.73 : 1 Cluster Storage: HDD SSD Storage Size: 417.2T (432.5T Raw) 5.7T (5.7T Raw) VHS Size: 15.4T Used: 348.6T (84%) 669.1G (11%) ==================> Avail: 68.6T (16%) 5.1T (89%) Health Throughput (bps) HDD Storage SSD Storage ID |IP Address |DASR | In Out Total| Used / Size |Used / Size ---+---------------+-----+-----+-----+-----+-----------------+----------------- 9|1099.2.6 | OK | 1.0M| 488k| 1.5M|87.2T/ 104T( 84%)| 167G/ 1.4T( 11%) 10|10.99.2.7 | OK | 820M| 4.2M| 824M|87.2T/ 104T( 84%)| 167G/ 1.4T( 11%) 11|10.99.2.8 | OK | 678M| 2.9M| 681M|87.2T/ 104T( 84%)| 167G/ 1.4T( 11%) 12|10.99.2.9 | OK | 0| 123k| 123k|87.1T/ 104T( 84%)| 167G/ 1.4T( 11%) ---+---------------+-----+-----+-----+-----+-----------------+----------------- Cluster Totals: | 1.5G| 7.7M| 1.5G| 349T/ 417T( 84%)| 669G/ 5.7T( 11%) Health Fields: D = Down, A = Attention, S = Smartfailed, R = Read-Only
來源僅具有 286T 使用的 HDD 儲存裝置:
Cluster Name: SOURCE-POWERSCALE Cluster Health: [ ATTN] Data Reduction: 1.00 : 1 Storage Efficiency: 0.71 : 1 Cluster Storage: HDD SSD Storage Size: 417.2T (432.5T Raw) 5.7T (5.7T Raw) VHS Size: 15.4T Used: 285.5T (68%) 721.9G (12%) ========> Avail: 131.7T (32%) 5.0T (88%) Health Throughput (bps) HDD Storage SSD Storage ID |IP Address |DASR | In Out Total| Used / Size |Used / Size ---+---------------+-----+-----+-----+-----+-----------------+----------------- 9|10.99.3.13 | OK | 290M| 9.9M| 300M|71.4T/ 104T( 68%)| 180G/ 1.4T( 12%) 10|10.99.3.11 | OK | 324M| 832M| 1.2G|71.4T/ 104T( 68%)| 181G/ 1.4T( 12%) 11|10.99.3.12 | OK | 194M| 8.4M| 202M|71.4T/ 104T( 68%)| 181G/ 1.4T( 12%) 12|10.99.3.10 | OK | 1.9M| 2.0M| 3.8M|71.4T/ 104T( 68%)| 181G/ 1.4T( 12%) ---+---------------+-----+-----+-----+-----+-----------------+----------------- Cluster Totals: | 809M| 852M| 1.7G| 286T/ 417T( 68%)| 722G/ 5.7T( 12%)
Причина
在 syncIQ 關係中,叢集之間空間差異的常見原因如下:
--大型系統檔案或內部的稽核記錄 /ifs/.ifsvar (最常見)
--快照大小
的差異--保護等級
的差異--收集工作未在一個群集上運行,因此無法釋放孤立的磁碟塊。
--大型支援相關文件/資料夾位於其中 /ifs/data/Isilon_Support
Разрешение
假設所有 syncIQ 工作都是最新的複寫,請檢查下列事項:
1) 通常情況下,使用更多空間的叢集具有大型系統檔案或內部稽核記錄 /ifs/.ifsvar。
在每個叢集上,從篩選工作階段 (因為傳回命令可能需要很長的時間),執行下列命令:
# du -sh /ifs/.ifsvar
在每個叢集上執行該命令。
PowerScale 支援部門過去曾將此視為罪魁禍首,尤其是因為稽核記錄龐大。
勾選 /ifs/.ifsvar/audit 目錄和以下子目錄,
Where <nodeXXX> is the node ID (for example node001):/ifs/.ifsvar/audit/logs/.
/ifs/.ifsvar/audit/logs/<nodeXXX>
/ifs/.ifsvar/audit/logs/<nodeXXX>/protocol
如有需要,請透過下列文章刪除稽核檔案:
KB 000167091Powerscale:如何移除稽核記錄檔
2) 確認兩個叢集之間的保護等級沒有差異。
即時叢集:
isi stat -p -q -v
記錄:
# cat <base log set>/local/isi_stat-p
Dell Technologies 也可以查看 diskpools 在支援協助下,透過內部命令保護層級。
3) 在每個叢集上執行下列命令,確認兩個叢集之間的快照使用率沒有太大差異:
# isi snapshot usage
4) 在回報更多已使用空間的叢集上,檢查其中是否有任何與支援相關的大型檔案/資料夾 /ifs/data/Isilon_Support:
# du -so /ifs/data/Isilon_Support
5) 如果仍卡住,下一步是檢查上次在每個叢集上執行收集的時間。
(注意: 請務必注意,“多重掃描”並不總是運行收集作業)。
此收集工作會釋放叢集上任何過時的磁碟區塊,這通常可能是一個叢集顯示比另一個叢集更多已使用磁碟空間的原因。 一個快速的方法是檢查 /var/log/messages 在節點上最後一次成功執行收集,例如:
# grep Collect /var/log/messages|grep Succeed
# zgrep Collect /var/log/messages*
6) 如果仍然卡住,請執行 FSAnalyze job 並使用 InsightIQ 查看哪個資料夾佔用了叢集上更多已使用空間的空間。
'isi stat heat' 叢集上已滿的命令也可能提供一些新寫入發生位置的線索。