PowerScale OneFS: Fejlfinding af problemer med ydeevnen
Summary: Foretag fejlfinding af langsom PowerScale OneFS-ydeevne med en omfattende vejledning om netværkskonfiguration, behandling af belastninger og overvågning med InsightIQ for forbedret klyngeeffektivitet. ...
Symptoms
Klientcomputere kører langsomt. Specifikke job, især dem, der kører på klyngen, mislykkes eller tager længere tid end forventet.
Cause
Problemer med ydeevnen skyldes typisk netværkstrafik, problemer med netværkskonfiguration, indlæsning af klient- eller klyngebehandling eller en kombination af disse faktorer. I denne artikel beskrives flere effektive metoder til fejlfinding af problemer med ydeevnen.
Resolution
Fejlfinding med InsightIQ
Indholdsfortegnelse:
- Brug af Isilon InsightIQ
- Fejlfinding uden InsightIQ
- Netværksoverførselshastighed
- Distribution af klientforbindelser
- Klyngeoverførselshastighed
- Klyngebehandling
- Handlinger i kø
- CPU
Brug af Isilon InsightIQ
Brug af Isilon InsightIQ er den bedste metode til at overvåge ydeevnen og foretage fejlfinding af problemer med ydeevnen.
Den virtuelle Isilon InsightIQ-enhed giver dig mulighed for at overvåge og analysere Isilon-klyngeaktivitet via fleksible, brugertilpassede diagramvisninger i det webbaserede InsightIQ-program. Disse diagrammer indeholder detaljerede oplysninger om klyngehardware, -software samt filsystem- og protokolhandlinger. InsightIQ omdanner data til visuel information, der fremhæver eventuelle afvigelser i ydeevnen, hvilket muliggør hurtig diagnosticering af flaskehalse eller optimerer arbejdsgange.
Du kan finde flere oplysninger om brug af InsightIQ i PowerScale InsightIQ – Info Hub.
Fejlfinding uden InsightIQ
Hvis du ikke bruger InsightIQ, kan du køre forskellige kommandoer for at undersøge problemer med ydeevnen. Foretag fejlfinding af problemer med ydeevnen først ved at undersøge netværks- og klyngeoverførselshastigheder, derefter ved at undersøge klyngebehandling og endelig ved at undersøge CPU-hastighederne for individuelle noder.
Netværksoverførselshastighed
Brug et netværkstestværktøj som f.eks. Iperf eller Iperf3 for at bestemme gennemløbsegenskaberne for klyngen og klientcomputerne på netværket.
Anvendelse af Iperf, skal du køre følgende kommandoer på klyngen og klienten. Disse kommandoer definerer en vinduesstørrelse, der er stor nok til at afsløre, om netværksforbindelsen er en potentiel årsag til problemer med ventetiden.
- Klynge:
iperf -s -w 262144 - Klient
iperf -c <cluster IP> -w 262144
Anvendelse af Iperf3, skal du køre følgende kommandoer på klyngen og klienten. Disse kommandoer definerer en vinduesstørrelse, der er stor nok til at afsløre, om netværksforbindelsen er en potentiel årsag til problemer med ventetiden.
- Klynge:
iperf3 -s -w 262144 Klientiperf3 -c <cluster IP> -w 262144
Distribution af klientforbindelser
Kontrollér, hvor mange NFS- (Network File System) og SMB-klienter (Server Message Block), der er tilsluttet klyngen, for at sikre, at de ikke favoriserer én node.
- Åbn en SSH-forbindelse på en hvilken som helst node i klyngen, og log på med root-kontoen.
rootRevisorer - Kør
kommando til at kontrollere NFS-klienter.isi statistics query current list --nodes=all --keys=node.clientstats.connected.nfs,node.clientstats.active.nfs -d
Outputtet viser antallet af tilsluttede klienter pr. node, og hvor mange af disse klienter der er aktive på hver node. - Kør
kommando til at kontrollere SMB-klienter.isi statistics query current list --keys=node.clientstats.connected.smb,node.clientstats.active.smb1,node.clientstats.active.smb2 -n all -d
Outputtet viser antallet af tilsluttede klienter pr. node, og hvor mange af disse klienter der er aktive på hver node.
Klyngeoverførselshastighed
Vurder klyngeoverførselshastighed ved at udføre skrive- og læsetest, der måler den tid, det tager at læse fra og skrive til en fil. Udfør mindst en skrivetest og en læsetest som følger.
Skriv en test.
- Åbn en SSH-forbindelse på en hvilken som helst node i klyngen, og log på med root-kontoen.
rootRevisorer - Skift til
/ifsBiblioteker:cd /ifs - Fra kommandolinjegrænsefladen (CLI) på klyngen eller fra en UNIX- eller Linux-klientcomputer skal du bruge
ddfor at skrive en ny fil til klyngen.
Kør følgende kommando:dd if=/dev/zero of=1GBfile bs=1024k count=1024
Denne kommando opretter et eksempel på en 1 GB-fil og rapporterer, hvor lang tid det tog at skrive den til disken. - Fra outputtet af denne kommando ekstrapolerer du, hvor mange MB pr. sekund der kan skrives til disk i enkeltstrømsarbejdsgange.
- Hvis du har en MAC-klient og ønsker at foretage yderligere analyser,
- Start aktivitetsovervågning.
- Kør
cat /dev/zero > /pathToFileKommando, hvorpathToFileer filstien til den målrettede fil.
Denne kommando hjælper med at måle overførselshastigheden for skrivehandlinger på Isilon-klyngen. (Selvom det er muligt at køreddfra en MAC-klient, kan resultaterne være inkonsistente.) - Overvåg resultaterne af kommandoen under fanen Netværk i Aktivitetsovervågning.
Læs testen.
Når du måler gennemløbet af læsehandlinger, skal du sørge for ikke at udføre læsetest på den fil, du oprettede under skrivetesten. Da filen er cachelagret, vil resultaterne af dine læsetest være unøjagtige. Test i stedet en læsehandling af en fil, der ikke er cachelagret. Find en fil på klyngen, der er større end 1 GB, og henvis til filen i læsetesten.
- Åbn en SSH-forbindelse på en hvilken som helst node i klyngen, og log på med root-kontoen.
rootRevisorer - Fra CLI på klyngen eller fra en UNIX- eller Linux-klientcomputer skal du bruge
ddfor at læse en fil i klyngen.
Kørdd if=/pathToLargeFile of=/dev/null bs=1024kTag kommandoen hvor:pathToFileer filstien til den målrettede fil.
Denne kommando læser den målrettede fil og rapporterer, hvor lang tid det tog at læse den. - Hvis du har en MAC-klient og ønsker at foretage yderligere analyser,
- Start aktivitetsovervågning.
- Kør
time cp /pathToLargeFile > /dev/nullTag kommandoen hvor:pathToFileer filstien til den målrettede fil.
Denne kommando hjælper med at måle gennemløbet for læsehandlinger på Isilon-klyngen. (Selvom det er muligt at køreddfra en MAC-klient, kan resultaterne være inkonsistente.) - Overvåg resultaterne af kommandoen under fanen Netværk i Aktivitetsovervågning.
Klyngebehandling
Restripe job.
Før undersøgelse af klyngens I/O-handlinger (input/output):
- Find ud af, hvilke job der kører på klyngen. Hvis restripe job som Auto-Balance, FlexProtect, Collect eller MultiScan kører, skal du overveje, hvorfor disse job kører, og om de skal fortsætte med at køre.
- Disse job kan producere klyngehændelse: Hændelse 400100008: "Filhandlinger tog længere tid end forventet."
- Overvej den type data, der forbruges. Hvis klientcomputere arbejder med store videofiler eller virtuelle maskiner (VM'er), kræver det overførte job en større mængde disk-IOPS end normalt.
- Overvej midlertidigt at sætte et restripe job på pause. Dette kan forbedre ydeevnen og kan være en levedygtig kortsigtet løsning på et præstationsproblem.
SmartPools-job.
NFS- og SMB-klientens ydeevne kan blive forringet, mens jobbet kører:
- Bestem prioriteten for SmartPools-jobbet
isi job status
-
- Reducer virkningen af politikken
isi job types modify SmartPools --policy LOW
-
- Juster prioritet
isi job types modify SmartPools --priority 7
-
- Planlæg politikken uden for åbningstiden
isi job types modify SmartPools --policy OFF_HOURS
-
- Gennemse niveaukonfiguration, så antallet af niveauer holdes under 5
Disk I/O
Undersøgelse af disk I/O kan hjælpe med at afgøre, om visse diske overbruges.
Efter klynge
- Åbn en SSH-forbindelse på en hvilken som helst node i klyngen, og log på med "root"-kontoen.
- Kør
kommando til at fastslå disk I/O.isi statistics pstat Fra outputtet af denne kommando divideres disk-IOPS med det samlede antal diske i klyngen. For en 8-nodeklynge, der bruger Isilon IQ 12000x-noder, som er vært for 12 drev pr. node, dividerer du disk-IOPS med 96.
For noder i X-serien og NL-seriens noder kan du forvente at se disk-IOPS på 70 eller mindre for 100 % tilfældige arbejdsgange eller disk-IOPS på 140 eller mindre for 100 % sekventielle arbejdsgange. Da NL-seriens noder har mindre RAM og lavere CPU-hastigheder end X-seriens noder, kan X-seriens noder håndtere højere disk-IOPS.
Efter node og disk
- Åbn en SSH-forbindelse på en hvilken som helst node i klyngen, og log på med "root"-kontoen.
- Kør
kommando til at fastslå disk-IOPS efter node, hvilket kan hjælpe med at finde diske, der er overbrugt.isi statistics query current --nodes=all --stats=node.disk.xfers.rate.sum --format=top - Kør
kommando til at bestemme, hvordan der skal forespørges efter statistik pr. disk.isi_stats_tool -a get_key_info|grep node.disk.xfer
Handlinger i kø
Du kan også finde ud af, om diske overbruges, ved at bestemme, hvor mange handlinger der er i kø for hver disk i klyngen. For en SMB-baseret arbejdsproces baseret på en enkelt strøm kan en kø på fire indikere et problem, mens køen er større for NFS-navneområdehandlinger med høj samtidighed.
- Åbn en SSH-forbindelse på en hvilken som helst node i klyngen, og log på med root-kontoen.
rootRevisorer - Kør
for at bestemme, hvor mange handlinger der er i kø for hver disk i klyngen.isi statistics drive list --nodes=all --sort=queued -d - Bestem, hvor længe handlingen var i køen:
isi statistics drive list --nodes=all --sort=queued -d
CPU
CPU-problemer spores ofte til de handlinger, klienter udfører på klyngen. Brug af isi statistics , kan du bestemme de handlinger, der udføres på klyngen, katalogiseret efter enten netværksprotokol eller klientcomputer.
- Åbn en SSH-forbindelse på en hvilken som helst node i klyngen, og log på med root-kontoen.
rootRevisorer - Kør
kommando til at bestemme, hvilke operationer der udføres på tværs af netværket, og vurdere, hvilke af disse operationer der tager mest tid.isi statistics protocol list --long --totalby Op,proto -d --sort TimeAvg --format top
Dette kommandooutput giver detaljerede statistikker for alle netværksprotokoller, organiseret efter, hvor lang tid klyngen er om at svare klienter. Selvom resultaterne af denne kommando muligvis ikke identificerer, hvilken operation der er den langsomste, kan den pege dig i den rigtige retning. - Kør
for at få flere oplysninger om CPU-behandling, f.eks. hvilke noders CPU'er der er de mest anvendte.isi statistics system --nodes all --format top - Kør
for at hente de fire processer på hver node, der bruger flest CPU-ressourcer.isi_for_array -sX 'top -u -n |grep PID -A4'
Additional Information
Her er anbefalede ressourcer relateret til dette emne, som kan være af interesse: