PowerScale OneFS: Odstraňování problémů s výkonem
Summary: Odstraňujte problémy s nízkým výkonem systému PowerScale OneFS pomocí komplexního průvodce konfigurací sítě, zatížením zpracování a monitorováním pomocí softwaru InsightIQ pro zvýšení efektivity clusteru. ...
Symptoms
Klientské počítače jsou pomalé. Některé úlohy, zejména ty, které běží v clusteru, selžou nebo trvají nečekaně dlouho.
Cause
Problémy s výkonem jsou obvykle způsobeny síťovým provozem, problémy s konfigurací sítě, zatížením zpracování klienta nebo clusteru nebo jejich kombinací. Tento článek popisuje několik efektivních způsobů odstraňování problémů s výkonem.
Resolution
Odstraňování problémů se softwarem InsightIQ
Obsah:
- Použití softwaru Isilon InsightIQ
- Odstraňování problémů bez softwaru InsightIQ
- Propustnost sítě
- Distribuce připojení klientů
- Propustnost clusteru
- Zpracování clusteru
- Operace ve frontě
- Procesor
Použití softwaru Isilon InsightIQ
Použití softwaru Isilon InsightIQ je nejlepší způsob, jak monitorovat výkon a odstraňovat problémy s ním spojené.
Virtuální zařízení Isilon InsightIQ umožňuje monitorovat a analyzovat aktivity clusteru Isilon prostřednictvím flexibilních, přizpůsobitelných zobrazení grafů ve webové aplikaci InsightIQ. Tyto grafy obsahují podrobné informace o hardwaru, softwaru a operacích systému souborů a protokolů. Software InsightIQ transformuje data do vizuálních informací, které zdůrazňují veškeré problémy s výkonem, což umožňuje rychlou diagnostiku problematických míst nebo optimalizaci pracovních postupů.
Podrobnosti o používání softwaru InsightIQ naleznete v informačním centru PowerScale InsightIQ.
Odstraňování problémů bez softwaru InsightIQ
Pokud software InsightIQ nepoužíváte, můžete spustit řadu příkazů za účelem prošetření problémů s výkonem. Nejdříve odstraňte problémy s výkonem kontrolou propustnosti sítě a clusteru, poté kontrolou zpracování clusteru a nakonec kontrolou frekvence procesoru jednotlivých uzlů.
Propustnost sítě
Použijte nástroj pro síťové testování, například Iperf nebo Iperf3 , abyste zjistili možnosti propustnosti počítačů clusteru a klienta v síti.
Použití IperfPomocí nástroje Iperf spusťte v clusteru a klientovi následující příkazy. Tyto příkazy definují velikost okna, která je dostatečně velká, aby bylo možné zjistit, zda je síťové připojení potenciální příčinou problémů s latencí.
- Klastr:
iperf -s -w 262144 - Klientské
iperf -c <cluster IP> -w 262144
Použití Iperf3Pomocí nástroje Iperf spusťte v clusteru a klientovi následující příkazy. Tyto příkazy definují velikost okna, která je dostatečně velká, aby bylo možné zjistit, zda je síťové připojení potenciální příčinou problémů s latencí.
- Klastr:
iperf3 -s -w 262144 Klientskéiperf3 -c <cluster IP> -w 262144
Distribuce připojení klientů
Zkontrolujte, kolik klientů NFS a SMB je připojeno ke clusteru, a ujistěte se, že neupřednostňují jeden uzel.
- Navažte připojení SSH s libovolným uzlem v clusteru a přihlaste se pomocí účtu „root“.
rootAccount: - Spusťte
příkaz pro kontrolu klientů NFS.isi statistics query current list --nodes=all --keys=node.clientstats.connected.nfs,node.clientstats.active.nfs -d
isi statistics query - nodes=all --stats=node.clientstats.connected.nfs,node.clientstats.active.nfs Výstup zobrazí počet klientů připojených k jednotlivým uzlům a kolik těchto klientů je aktivních na každém uzlu. - Spusťte
isi statistics query - nodes=all --stats=node.clientstats.connected.nfs,node.clientstats.active.nfsisi statistics query current list --keys=node.clientstats.connected.smb,node.clientstats.active.smb1,node.clientstats.active.smb2 -n all -d
Výstup zobrazí počet klientů připojených k jednotlivým uzlům a kolik těchto klientů je aktivních na každém uzlu.
Propustnost clusteru
Vyhodnoťte propustnost clusteru provedením několika testů, které měří, kolik času zabere čtení souboru a zápis do souboru. Proveďte alespoň jeden test zápisu a jeden test čtení následujícím způsobem.
- Navažte připojení SSH s libovolným uzlem v clusteru a přihlaste se pomocí účtu „root“.
rootAccount: - Změňte na
/ifsadresáře.cd /ifs - Z rozhraní příkazového řádku (CLI) v clusteru nebo z klientského počítače se systémem UNIX nebo Linux použijte příkaz
ddk zápisu nového souboru do clusteru.
Zadejte následující příkaz:dd if=/dev/zero of=1GBfile bs=1024k count=1024
Tento příkaz vytvoří ukázkový soubor o velikosti 1 GB a oznámí dobu potřebnou k jeho zápisu na disk. - Z výstupu tohoto příkazu extrapolujte, kolik MB za sekundu lze zapsat na disk v pracovních postupech s jedním datovým proudem.
- Pokud máte klienta Mac a chcete provést další analýzu:
- Spusťte nástroj Monitor aktivity.
- Spusťte
cat /dev/zero > /pathToFilepříkaz, kdepathToFileje cesta k cílovému souboru.
Tento příkaz pomáhá měřit propustnost operací zápisu v clusteru Isilon. (Ačkoli je možné spustit příkazddz klienta Mac, výsledky mohou být nekonzistentní.) - Sledujte výsledky příkazu v nástroji Monitor Aktivity na kartě Síť.
Při měření propustnosti operací čtení neprovádějte testy čtení v souboru, který jste vytvořili během testu zápisu. Protože soubor byl uložen do cache, výsledky testů čtení by byly nepřesné. Místo toho otestujte operaci čtení souboru, který nebyl uložen do cache. Vyhledejte soubor v clusteru, který je větší než 1 GB, a odkažte na tento soubor v testu čtení.
- Navažte připojení SSH s libovolným uzlem v clusteru a přihlaste se pomocí účtu „root“.
rootAccount: - Z příkazového řádku v clusteru nebo z klientského počítače se systémem UNIX nebo Linux použijte příkaz
ddke čtení souboru v clusteru.
Spusťtedd if=/pathToLargeFile of=/dev/null bs=1024kpříkaz, kdepathToFileje cesta k cílovému souboru.
Tento příkaz přečte cílový soubor a nahlásí dobu potřebnou k jeho přečtení. - Pokud máte klienta Mac a chcete provést další analýzu:
- Spusťte nástroj Monitor aktivity.
- Spusťte
time cp /pathToLargeFile > /dev/nullpříkaz, kdepathToFileje cesta k cílovému souboru.
Tento příkaz pomáhá měřit propustnost operací čtení v clusteru Isilon. (Ačkoli je možné spustit příkazddz klienta Mac, výsledky mohou být nekonzistentní.) - Sledujte výsledky příkazu v nástroji Monitor Aktivity na kartě Síť.
Zpracování clusteru
Před zahájením operací I/O (IOPS) clusteru:
- Určete, které úlohy jsou v clusteru spuštěny. Pokud jsou spuštěny úlohy opětovného prokládání, jako je AutoBalance, Collect nebo MultiScan, zvažte, proč tomu tak je a zda by měly být spuštěné i nadále.
- Tyto úlohy můžou vytvořit událost clusteru: Event 400100008: "Operace se soubory trvaly déle, než se čekalo."
- Zvažte typ zpracovávaných dat. Pokud klientské počítače pracují s velkými videosoubory nebo virtuálními počítači (VM), vyžaduje úloha opětovného prokládání větší množství operací IOPS disku, než je obvyklé.
- Zvažte dočasné pozastavení úlohy opětovného prokládání. To může významně zlepšit výkon a může jít o krátkodobé řešení problému s výkonem.
Úlohy SmartPools.
Výkon klientů NFS a SMB se může při spuštěné úloze snížit:
- Určete prioritu úlohy SmartPools
isi job status
-
- Snižte dopad zásad
isi job types modify SmartPools --policy LOW
-
- Upravit prioritu
isi job types modify SmartPools --priority 7
-
- Naplánování zásady na dobu mimo pracovní dobu
isi job types modify SmartPools --policy OFF_HOURS
-
- Kontrola konfigurace úrovní a zachování počtu úrovní pod 5
Disk I/O
Kontrola operací I/O disku může pomoci určit, zda jsou určité disky nadměrně využívány.
Ze strany clusteru
- Navažte připojení SSH s libovolným uzlem v clusteru a přihlaste se pomocí účtu „root“.
- Spusťte
příkaz ke zjištění I/O disku.isi statistics pstat Z výstupu tohoto příkazu vydělte počet operací IOPS disku celkovým počtem disků v clusteru. Například u clusteru s 8 uzly Isilon IQ 12000x, který na každém uzlu hostuje 12 disků, vydělíte počet operací IOPS disku číslem 96.
U uzlů řady X a NL byste měli očekávat, že se zobrazí maximálně 70 operací IOPS disku pro 100% náhodné pracovní postupy nebo maximálně 140 operací IOPS disku pro 100% sekvenční pracovní postupy. Protože uzly řady NL mají méně paměti RAM a nižší rychlost procesoru než uzly řady X, mohou uzly řady X zvládnout vyšší počet operací IOPS disku.
Ze strany uzlu a disku
- Navažte připojení SSH s libovolným uzlem v clusteru a přihlaste se pomocí účtu „root“.
- Spusťte
příkaz ke zjištění operací IOPS disku podle uzlu, což může pomoci zjistit disky, které jsou nadměrně využívány.isi statistics query current --nodes=all --stats=node.disk.xfers.rate.sum --format=top - Spusťte
určete, jak se dotazovat na statistiku na jednotlivých discích.isi_stats_tool -a get_key_info|grep node.disk.xfer
Operace ve frontě
Dalším způsobem, jak zjistit, zda jsou disky nadměrně využívány, je určit, kolik operací je zařazeno do fronty pro každý disk v clusteru. U pracovních postupů na bázi SMB s jedním datovým proudem může fronta 4 položek signalizovat problém, zatímco u operací oboru názvů NFS s vysokou souběžností může být fronta mnohem větší.
- Navažte připojení SSH s libovolným uzlem v clusteru a přihlaste se pomocí účtu „root“.
rootAccount: - Spusťte
určete, kolik operací je zařazeno do fronty pro každý disk v clusteru.isi statistics drive list --nodes=all --sort=queued -d - Určete, jak dlouho byla operace ve frontě:
isi statistics drive list --nodes=all --sort=queued -d
Procesor
Problémy s procesorem lze často vysledovat k operacím, které klienti provádějí v clusteru. Pomocí příkazu isi statistics můžete určit operace, které se provádějí v clusteru a které jsou katalogizovány síťovým protokolem nebo klientským počítačem.
- Navažte připojení SSH s libovolným uzlem v clusteru a přihlaste se pomocí účtu „root“.
rootAccount: - Spusťte
Pomocí následujícího příkazu určete, které operace se provádějí v celé síti, a vyhodnoťte, která z těchto operací trvá nejdéle:isi statistics protocol list --long --totalby Op,proto -d --sort TimeAvg --format top
Tento výstup příkazu poskytuje podrobné statistiky pro všechny síťové protokoly uspořádané podle toho, jak dlouho clusteru trvá, než odpoví klientům. Ačkoli výsledky tohoto příkazu nemusí určit, která operace je nejpomalejší, může vás navést správným směrem. - Spusťte
příkaz k získání dalších informací o zpracování CPU, například které procesory uzlů jsou nejvíce využívány.isi statistics system --nodes all --format top - Spusťte
Chcete-li získat 4 procesy na každém uzlu, které spotřebovávají nejvíce zdrojů procesoru, spusťte následující příkaz:isi_for_array -sX 'top -u -n |grep PID -A4'
Additional Information
Zde jsou doporučené zdroje související s tímto tématem, které by vás mohly zajímat: