PowerEdge: Hvorfor mislykkes harddisker
Summary: Denne artikkelen forklarer de ulike årsakene til at harddisker kan svikte i detalj.
Instructions
Innholdsfortegnelse
- Ødelagt fastvare og skade på fastvaresonen
- Elektronisk feil
- Mekanisk svikt
- Logisk feil
- Mediefeil
- SCSI/SAS-miljø
- Forholdsregler for feil på PowerEdge-disker
Ødelagt fastvare og skade på fastvaresonen
Når fastvaren til en harddisk blir skadet eller uleselig, er datamaskinen ofte ikke i stand til å samhandle riktig med harddisken.
Elektronisk feil
Elektronisk svikt er vanligvis relatert til problemer på kontrollerkortet på harddisken. Serveren kan bli utsatt for en strømøkning eller elektrisk overspenning som slår ut kontrollerkortet på harddisken, noe som gjør det umulig å oppdage BIOS.
Mekanisk svikt
Mekanisk svikt kan ofte (spesielt hvis det ikke handles tidlig) føre til delvis og noen ganger totalt tap av data. Mekanisk svikt kommer i ulike forkledninger som lese-/skrivehodesvikt og motoriske problemer. En av de vanligste mekaniske feilene er en hodeulykke. Et hodekrasj varierer i alvorlighetsgrad når lese-/skrivehodene på harddisken kommer i kontakt, et øyeblikk eller kontinuerlig, med platene på harddisken.
En rekke årsaker kan forårsake hodekrasj, inkludert fysisk støt (for eksempel å miste disken på gulvet), bevegelse av datamaskinen, statisk elektrisitet, strømstøt og mekanisk lese-/skrivehodefeil.
Logisk feil
Logiske feil er ofte de enkleste og vanskeligste problemene å håndtere. Logiske feil kan variere fra enkle ting som en ugyldig oppføring i en filtildelingstabell til virkelig forferdelige problemer som korrupsjon og tap av filsystemet på en sterkt fragmentert stasjon.
Logiske feil er forskjellige fra de elektriske og mekaniske problemene ovenfor, da det vanligvis ikke er noe "fysisk" galt med disken, men informasjonen biter på den.
Mediefeil
Skadede sektorer er områder på harddisken som blir uleselige. Alle harddisker utvikler dårlige sektorer til slutt. Harddisken markerer sektorene som går dårlig, og disse brukes ikke lenger. Men hvis du har data som ligger på sektorer som blir skadede sektorer, kan du ikke få tilgang til dataene eller filene dine riktig. Tøffe driftsforhold (for eksempel høye temperaturer, vibrasjon og så videre) kan føre til at harddisker utvikler mange dårlige sektorer raskt. Hver type harddisk er utsatt for å utvikle dårlige sektorer "naturlig", men dette er ikke alltid tilfelle.
SCSI/SAS-miljø
SCSI-harddisker blir ofte sett på som stasjoner med høy ytelse. De spinner raskere enn sine IDE / SATA-kolleger, og derfor er dataoverføringshastighetene ofte raskere. På grunn av dette finnes SCSI-stasjoner ofte i servere som må gi mye datagjennomstrømning. Denne ytelsen har imidlertid ofte sin pris, siden det er mer sannsynlig med mekaniske feil på disse diskene.
Den vanligste årsaken til flere diskfeil i dette miljøet er dårlig signalkvalitet på tvers av SCSI-bussen. Dårlig signalkvalitet kan føre til overhead for SCSI-protokollen når den prøver å gjenopprette fra disse problemene (tidsavbrudd og tilbakestilling av bussen). Etter hvert som systemet blir travlere og etterspørselen etter data øker, øker de korrigerende tiltakene til SCSI-protokollen, og SCSI-bussen nærmer seg metning. Denne overhead begrenser til slutt de normale båndbreddene for enhetskommunikasjon. Hvis den ikke er fjernet, kan det hende at én eller flere SCSI-enheter ikke kan svare RAID-kontrolleren i tide, noe som resulterer i at RAID-kontrolleren merker harddisken som frakoblet. Feil installasjon av RAID-kontrolleren i et PCI-spor, dårlige kabeltilkoblinger, dårlig montering av diskene mot SCSI-bakplaten, feil installasjon eller plassering av backplane-datterkort og feil SCSI-bussavslutning kan forårsake denne typen signalproblemer.
Kombinasjoner av disse feiltypene er også mulige.
Alle teknikere og kunder bør lese og forstå anbefalte fremgangsmåter for vedlikehold for å maksimere oppetiden og bidra til å forhindre tap av data som følge av harddiskfeil.
Forholdsregler for feil på PowerEdge-disker
Når det gjelder diskfeil på PowerEdge-servere, er det viktig å ta følgende forholdsregler:
- Sikkerhetskopier data: Utfør alltid en sikkerhetskopi av kritiske data før du handler på diskene. Dette sikrer datasikkerhet hvis det er flere problemer.
- Skjermvarsler: Vær oppmerksom på varsler om prediktive stasjonsfeil (feilkode)
PDR6) og andre diskrelaterte feilkoder (somPDR1001ogPDR3). Disse varslene indikerer potensielle problemer som krever umiddelbar oppmerksomhet. - Fastvareoppdateringer: Før du setter inn maskinvare, må du kontrollere at fastvaren for RAID-kontrolleren og -diskene er oppdatert. Dette kan bidra til å forhindre falske varsler og forbedre den generelle stabiliteten til systemet.
- Håndter stasjonene forsiktig: Når du tar ut, installerer eller setter inn harddisker på nytt, må du unngå å bruke overdreven kraft. Dette kan bøye bakplanet og potensielt føre til at nabostasjoner mislykkes eller mister tilkoblingen.
- Kontroller tilkoblingene: Hvis en stasjon rapporteres som mislykket, setter du inn stasjonen på nytt for å utelukke tilkoblingsproblemer. Kontroller at alle tilkoblingene er sikre.
- Gjennomgå systemlogger: Kontroller iDRAC-logger og systemlogger regelmessig for alle relaterte varsler eller varmehendelser som kan indikere underliggende problemer.
- Kontakt kundestøtte: Hvis flere stasjoner rapporterer feil eller problemer vedvarer etter at du har utført handlingene ovenfor, kan du kontakte Dells kundestøtte for å få mer hjelp.