PowerEdge: Varför misslyckas hårddiskar
Resumen: Den här artikeln förklarar i detalj de olika orsakerna till att hårddiskar kan gå sönder.
Instrucciones
Innehållsförteckning
- Skadad firmware och skador på firmwarezonen
- Elektroniskt fel
- Mekaniskt fel
- Logiskt fel
- Fel i media
- SCSI/SAS-miljö
- Varningar för PowerEdge-diskfel
Skadad firmware och skador på firmwarezonen
När den fasta programvaran på en hårddisk blir skadad eller oläslig kan datorn ofta inte interagera korrekt med hårddisken.
Elektroniskt fel
Elektroniska fel är vanligtvis relaterade till problem på hårddiskens styrkort. Servern kan drabbas av en strömspik eller strömsprång som slår ut styrkortet på hårddisken och gör det omöjligt att upptäcka för BIOS.
Mekaniskt fel
Mekaniska fel kan ofta (särskilt om de inte åtgärdas tidigt) leda till en partiell och ibland total förlust av data. Mekaniska fel kommer i olika skepnader såsom läs-/skrivhuvudfel och motoriska problem. Ett av de vanligaste mekaniska felen är en huvudkrasch. En huvudkrasch varierar i svårighetsgrad och inträffar när hårddiskens läs-/skrivhuvuden kommer i kontakt, tillfälligt eller kontinuerligt, med hårddiskens skivor.
En rad olika orsaker kan orsaka en huvudkrasch, inklusive fysiska stötar (som att tappa disken på golvet), datorrörelser, statisk elektricitet, strömtoppar och mekaniskt läs-/skrivhuvudfel.
Logiskt fel
Logiska fel är ofta de enklaste och svåraste problemen att hantera. Logiska fel kan sträcka sig från enkla saker som en ogiltig post i en filallokeringstabell till verkligt fruktansvärda problem som korruption och förlust av filsystemet på en allvarligt fragmenterad enhet.
Logiska fel skiljer sig från de elektriska och mekaniska problemen ovan eftersom det vanligtvis inte är något "fysiskt" fel på disketten utan informationsbitarna på den.
Mediefel
Dåliga sektorer är områden på hårddisken som blir oläsliga. Alla hårddiskar utvecklar dåliga sektorer så småningom. Hårddisken markerar de sektorer som blir dåliga och dessa används inte längre. Men om du har data som finns i sektorer som blir dåliga sektorer kan du inte komma åt dina data eller filer korrekt. Tuffa driftsförhållanden (t.ex. höga temperaturer, vibrationer och så vidare) kan göra att hårddiskar snabbt utvecklar många dåliga sektorer. Varje typ av hårddisk är benägen att utveckla dåliga sektorer "naturligt", men så är inte alltid fallet.
SCSI/SAS-miljö
SCSI-hårddiskar betraktas ofta som högpresterande hårddiskar. De snurrar snabbare än sina IDE/SATA-motsvarigheter, och därför är dataöverföringshastigheterna ofta snabbare. På grund av detta finns SCSI-enheter ofta i servrar som måste tillhandahålla mycket datagenomströmning. Denna prestanda har dock ofta ett pris, eftersom mekaniska fel är mer sannolika på dessa enheter.
Den vanligaste orsaken till fel på flera diskar i den här miljön är dålig signalkvalitet i hela SCSI-bussen. Dålig signalkvalitet kan leda till överbelastning för SCSI-protokollet när det försöker återställa från dessa problem (tidsgränser och bussåterställningar). I takt med att systemet blir mer belastat och efterfrågan på data ökar, ökar SCSI-protokollets korrigerande åtgärder och SCSI-bussen blir närmare mättnad. Den här kostnaden begränsar så småningom enhetens normala bandbredd för enhetskommunikation. Om det inte rensas kan det hända att en eller flera SCSI-enheter inte kan svara RAID-kontrollern i tid, vilket leder till att RAID-styrenheten markerar hårddisken som offline. Felaktig installation av RAID-kontrollern i en PCI-kortplats, dåliga kabelanslutningar, dåligt placerade diskar mot SCSI-bakplanet, felaktig installation eller placering av dotterkort för bakplan och felaktig SCSI-bussterminering kan orsaka dessa typer av signalproblem.
Kombinationer av dessa feltyper är också möjliga.
Alla tekniker och kunder bör läsa och förstå bästa praxis för underhåll för att maximera drifttiden och hjälpa till att förhindra dataförlust till följd av hårddiskfel.
Varningar för PowerEdge-diskfel
När du hanterar diskfel i PowerEdge-servrar är det viktigt att vidta följande försiktighetsåtgärder:
- Säkerhetskopiera data: Säkerhetskopiera alltid kritiska data innan du vidtar åtgärder på diskarna. Detta garanterar datasäkerhet om det skulle uppstå ytterligare problem.
- Övervaka varningar: Var uppmärksam på prediktiva varningar om enhetsfel (felkod
PDR6) och Andra diskrelaterade felkoder (t.ex.PDR1001ochPDR3). Dessa varningar indikerar potentiella problem som behöver omedelbar åtgärd. - Uppdateringar av fast programvara: Innan du byter ut någon hårdvara bör du se till att den fasta programvaran för RAID-kontrollern och enheterna är uppdaterad. Detta kan hjälpa till att förhindra falska varningar och förbättra den övergripande systemstabiliteten.
- Hantera enheter försiktigt: Undvik att använda överdriven kraft när du tar bort, installerar eller sätter tillbaka hårddiskar. Detta kan böja bakplanet och eventuellt leda till att närliggande enheter slutar fungera eller förlorar anslutningen.
- Kontrollera anslutningarna: Om en enhet rapporteras som felaktig sätter du tillbaka enheten för att utesluta anslutningsproblem. Kontrollera att alla anslutningar är säkra.
- Granska systemloggar: Kontrollera regelbundet iDRAC-loggarna och systemloggarna för relaterade varningar eller termiska händelser som kan tyda på underliggande problem.
- Kontakta supporten: Om flera enheter rapporterar fel eller om problem kvarstår efter att ovanstående åtgärder har vidtagits kontaktar du Dells support för ytterligare hjälp.