PowerScale: Jeden klaster w relacji SyncIQ zgłasza więcej zajętego miejsca na dysku niż drugi klaster.
Сводка: W tym artykule wyjaśniono, dlaczego jeden klaster w relacji syncIQ (źródłowy lub docelowy) może zgłaszać więcej zajętego miejsca na dysku niż drugi klaster. W obu klastrach powinno być wyświetlane identycznie wykorzystane miejsce na dysku. Zadania SyncIQ są aktualne. ...
Симптомы
Jeden klaster PowerScale w relacji syncIQ (źródłowy lub docelowy) ma więcej zajętego miejsca na dysku niż drugi klaster PowerScale. Oba klastry powinny mieć identycznie wykorzystaną przestrzeń.
Przykład, jak widać w przypadku 'isi status' polecenie:
Klaster docelowy pokazuje, że 349T zajęto miejsce na dysku twardym (HDD):
Cluster Name: TARGET-POWERSCALE Cluster Health: [ ATTN] Data Reduction: 1.00 : 1 Storage Efficiency: 0.73 : 1 Cluster Storage: HDD SSD Storage Size: 417.2T (432.5T Raw) 5.7T (5.7T Raw) VHS Size: 15.4T Used: 348.6T (84%) 669.1G (11%) ==================> Avail: 68.6T (16%) 5.1T (89%) Health Throughput (bps) HDD Storage SSD Storage ID |IP Address |DASR | In Out Total| Used / Size |Used / Size ---+---------------+-----+-----+-----+-----+-----------------+----------------- 9|1099.2.6 | OK | 1.0M| 488k| 1.5M|87.2T/ 104T( 84%)| 167G/ 1.4T( 11%) 10|10.99.2.7 | OK | 820M| 4.2M| 824M|87.2T/ 104T( 84%)| 167G/ 1.4T( 11%) 11|10.99.2.8 | OK | 678M| 2.9M| 681M|87.2T/ 104T( 84%)| 167G/ 1.4T( 11%) 12|10.99.2.9 | OK | 0| 123k| 123k|87.1T/ 104T( 84%)| 167G/ 1.4T( 11%) ---+---------------+-----+-----+-----+-----+-----------------+----------------- Cluster Totals: | 1.5G| 7.7M| 1.5G| 349T/ 417T( 84%)| 669G/ 5.7T( 11%) Health Fields: D = Down, A = Attention, S = Smartfailed, R = Read-Only
Źródło ma tylko 286 TB używanej pamięci HDD:
Cluster Name: SOURCE-POWERSCALE Cluster Health: [ ATTN] Data Reduction: 1.00 : 1 Storage Efficiency: 0.71 : 1 Cluster Storage: HDD SSD Storage Size: 417.2T (432.5T Raw) 5.7T (5.7T Raw) VHS Size: 15.4T Used: 285.5T (68%) 721.9G (12%) ========> Avail: 131.7T (32%) 5.0T (88%) Health Throughput (bps) HDD Storage SSD Storage ID |IP Address |DASR | In Out Total| Used / Size |Used / Size ---+---------------+-----+-----+-----+-----+-----------------+----------------- 9|10.99.3.13 | OK | 290M| 9.9M| 300M|71.4T/ 104T( 68%)| 180G/ 1.4T( 12%) 10|10.99.3.11 | OK | 324M| 832M| 1.2G|71.4T/ 104T( 68%)| 181G/ 1.4T( 12%) 11|10.99.3.12 | OK | 194M| 8.4M| 202M|71.4T/ 104T( 68%)| 181G/ 1.4T( 12%) 12|10.99.3.10 | OK | 1.9M| 2.0M| 3.8M|71.4T/ 104T( 68%)| 181G/ 1.4T( 12%) ---+---------------+-----+-----+-----+-----+-----------------+----------------- Cluster Totals: | 809M| 852M| 1.7G| 286T/ 417T( 68%)| 722G/ 5.7T( 12%)
Причина
Typowe przyczyny różnic w przestrzeni między klastrami w relacji syncIQ są następujące:
--duże pliki systemowe lub dzienniki inspekcji, które znajdują się wewnątrz /ifs/.ifsvar (najczęściej)
--różnice w rozmiarze
migawki--różnice w poziomach
ochrony--Zadanie zbierania, które nie działa na jednym klastrze, a tym samym nie zwalnia osieroconych bloków dysku.
--duże pliki/foldery związane z pomocą techniczną znajdujące się w /ifs/data/Isilon_Support
Разрешение
Zakładając, że wszystkie zadania syncIQ są zgodne z replikacją, sprawdź następujące kwestie:
1) Często zdarza się, że w klastrze wykorzystującym więcej miejsca znajdują się duże pliki systemowe lub dzienniki inspekcji, które znajdują się w /ifs/.ifsvar.
W każdym klastrze z sesji screen (ponieważ powrót polecenia może zająć dużo czasu) uruchom następujące polecenie:
# du -sh /ifs/.ifsvar
Uruchom to polecenie dla każdego klastra.
Dział pomocy technicznej PowerScale już w przeszłości dostrzegł tę przyczynę, zwłaszcza ze względu na duże dzienniki kontroli.
Sprawdź ikonę /ifs/.ifsvar/audit katalog i następujące podkatalogi,
Where <nodeXXX> is the node ID (for example node001):/ifs/.ifsvar/audit/logs/.
/ifs/.ifsvar/audit/logs/<nodeXXX>
/ifs/.ifsvar/audit/logs/<nodeXXX>/protocol
W razie potrzeby usuń pliki inspekcji, postępując zgodnie z artykułem:
KB 000167091Powerscale: Usuwanie plików dziennika inspekcji
2) Sprawdź, czy nie ma różnic w poziomie ochrony między dwoma klastrami.
Klaster na żywo:
isi stat -p -q -v
Dzienniki:
# cat <base log set>/local/isi_stat-p
Firma Dell Technologies może również sprawdzić diskpools poziomów ochrony za pomocą wewnętrznego polecenia z pomocą techniczną.
3) Upewnij się, że nie ma dużej różnicy w użyciu migawek między dwoma klastrami, uruchamiając następujące polecenie dla każdego klastra:
# isi snapshot usage
4) W klastrze zgłaszającym więcej zajętego miejsca sprawdź, czy w pobliżu nie znajdują się duże pliki/foldery związane z pomocą techniczną /ifs/data/Isilon_Support:
# du -so /ifs/data/Isilon_Support
5) Jeśli problem nadal występuje, następnym krokiem jest sprawdzenie, kiedy ostatnio uruchomiono funkcję Collect w każdym klastrze.
(Uwaga: ważne jest, aby pamiętać, że "MultiScan" nie zawsze uruchamia zadanie Collect).
To zadanie zbierania zwalnia wszystkie stare bloki dysku w klastrze i często może być przyczyną tego, że jeden klaster pokazuje więcej zajętego miejsca na dysku niż drugi. Jednym z szybkich sposobów, aby to zrobić, jest sprawdzenie /var/log/messages w węzłach po raz ostatni pomyślnie uruchomiono funkcję Collect, na przykład:
# grep Collect /var/log/messages|grep Succeed
# zgrep Collect /var/log/messages*
6) Jeśli nadal utknął, uruchom FSAnalyze job i użyj InsightIQ, aby zobaczyć, który folder zajmuje więcej miejsca w klastrze z większą ilością wykorzystanego miejsca.
'isi stat heat' Polecenie w klastrze, który jest bardziej zapełniony, może również dostarczyć wskazówek dotyczących miejsca nowych zapisów.