PowerEdge: Dlaczego dyski twarde ulegają awarii
Resumen: W tym artykule szczegółowo opisano różne przyczyny awarii dysków twardych.
Instrucciones
Spis treści
- Uszkodzenie oprogramowania wewnętrznego i strefy oprogramowania wewnętrznego
- Awaria elektroniczna
- Awaria mechaniczna
- Błąd logiczny
- Błędy nośnika
- Środowisko SCSI/SAS
- Przestrogi dotyczące awarii dysków serwerów PowerEdge
Uszkodzenie oprogramowania wewnętrznego i strefy oprogramowania wewnętrznego
Gdy oprogramowanie wewnętrzne dysku twardego staje się uszkodzone lub nieczytelne, komputer często nie jest w stanie prawidłowo współdziałać z dyskiem twardym.
Awaria elektroniczna
Awaria elektroniczna zwykle dotyczy problemów na płycie kontrolera dysku twardego. W serwerze może dojść do skoku napięcia lub przepięcia, które spowoduje wybicie karty kontrolera na dysku twardym, czyniąc ją niewykrywalną dla systemu BIOS.
Awaria mechaniczna
Awaria mechaniczna często (zwłaszcza w przypadku braku wczesnej reakcji) może prowadzić do częściowej, a czasem całkowitej utraty danych. Awaria mechaniczna występuje pod różnymi postaciami, takimi jak awaria głowicy odczytu/zapisu i problemy z silnikiem. Jedną z najczęstszych awarii mechanicznych jest uszkodzenie głowicy. Awaria głowicy o różnym nasileniu występuje, gdy głowice odczytująco-zapisujące dysku twardego stykają się, chwilowo lub w sposób ciągły, z talerzami dysku twardego.
Awaria głowicy może być spowodowana różnymi przyczynami, w tym wstrząsem fizycznym (takim jak upuszczenie dysku na podłogę), ruchem komputera, ładunkami elektrostatycznymi, skokami napięcia i awarią mechanicznej głowicy odczytująco-zapisującej.
Błąd logiczny
Błędy logiczne są często najłatwiejszymi i najtrudniejszymi problemami do rozwiązania. Błędy logiczne mogą obejmować zarówno proste rzeczy, takie jak nieprawidłowy wpis w tabeli alokacji plików, jak i naprawdę przerażające problemy, takie jak uszkodzenie i utrata systemu plików na poważnie pofragmentowanym dysku.
Błędy logiczne różnią się od powyższych problemów elektrycznych i mechanicznych, ponieważ zwykle nie ma nic "fizycznie" złego w dysku, poza bitami informacyjnymi na nim.
Błędy nośnika
Uszkodzone sektory to obszary dysku twardego, które stają się nieczytelne. Wszystkie dyski twarde w końcu rozwijają uszkodzone sektory. Dysk twardy zaznacza sektory, które uległy uszkodzeniu i nie są one już używane. Jeśli jednak dane znajdują się w sektorach, które stają się uszkodzonymi sektorami, nie można uzyskać dostępu do danych lub plików w prawidłowy sposób. Trudne warunki pracy (takie jak wysokie temperatury, drgania itp.) mogą spowodować szybkie utworzenie uszkodzonych sektorów na dyskach twardych. Każdy typ dysku twardego jest „naturalnie” podatny na tworzenie uszkodzonych sektorów, ale nie zawsze tak jest.
Środowisko SCSI/SAS
Dyski twarde SCSI są często uważane za dyski o wysokiej wydajności. Obracają się szybciej niż ich odpowiedniki IDE/SATA, dlatego prędkość transferu danych jest często większa. Z tego powodu dyski SCSI często znajdują się na serwerach, które muszą zapewniać dużą przepustowość danych. Jednak ta wydajność często ma swoją cenę, ponieważ w tych dyskach częściej występują awarie mechaniczne.
Najczęstszą przyczyną awarii wielu dysków w tym środowisku jest słaba jakość sygnału na magistrali SCSI. Niska jakość sygnału może powodować narzut protokołu SCSI podczas próby odzyskania sprawności (przekroczenie limitu czasu i resetowanie magistrali). W miarę, jak system staje się coraz bardziej obciążony i wzrasta zapotrzebowanie na dane, działania naprawcze protokołu SCSI nasilają się, a magistrala SCSI zbliża się do nasycenia. To obciążenie ostatecznie ogranicza normalne przepustowości komunikacji urządzenia. Jeśli ta opcja nie zostanie usunięta, jedno lub więcej urządzeń SCSI może nie być w stanie odpowiedzieć kontrolerowi RAID w odpowiednim czasie, co spowoduje, że kontroler RAID oznaczy dysk twardy jako offline. Nieprawidłowa instalacja kontrolera RAID w gnieździe PCI, nieprawidłowe połączenia kabli, nieprawidłowe osadzenie dysków na płycie backplane SCSI, nieprawidłowa instalacja lub osadzenie kart towarzyszących płyty backplane oraz nieprawidłowe zakończenie magistrali SCSI mogą powodować tego typu problemy.
Możliwe są również różne kombinacje tych typów awarii.
Wszyscy technicy i klienci powinni przeczytać i opanować najlepsze praktyki w zakresie konserwacji, aby zmaksymalizować czas pracy bez przestojów i zapobiec utracie danych w wyniku awarii dysku twardego.
Przestrogi dotyczące awarii dysków serwerów PowerEdge
W przypadku awarii dysków w serwerach PowerEdge należy podjąć następujące środki ostrożności:
- Dane kopii zapasowej: Przed przystąpieniem do wykonywania czynności na dyskach należy zawsze wykonać kopię zapasową najważniejszych danych. Zapewnia to bezpieczeństwo danych w przypadku wystąpienia dalszych problemów.
- Alerty monitora: Zwróć uwagę na ostrzeżenia o predykcyjnej awarii dysku (kod błędu)
PDR6) i inne kody błędów związane z dyskiem (takie jakPDR1001iPDR3). Te alerty wskazują potencjalne problemy, które wymagają natychmiastowej uwagi. - Aktualizacje oprogramowania wewnętrznego: Przed wymianą jakiegokolwiek sprzętu upewnij się, że oprogramowanie wewnętrzne kontrolera RAID i dysków jest aktualne. Może to pomóc w zapobieganiu fałszywym alarmom i poprawić ogólną stabilność systemu.
- Z dyskami należy obchodzić się ostrożnie: Podczas wyjmowania, instalowania i ponownego osadzania dysków twardych unikaj używania nadmiernej siły. Może to spowodować wygięcie płyty backplane i awarię sąsiednich dysków lub utratę łączności.
- Sprawdź połączenia: Jeśli dysk zostanie zgłoszony jako uszkodzony, należy go ponownie osadzić, aby wykluczyć problemy z połączeniem. Sprawdź, czy wszystkie połączenia są bezpieczne.
- Przejrzyj dzienniki systemowe: Regularnie sprawdzaj dzienniki kontrolera iDRAC i dzienniki systemu pod kątem powiązanych alertów lub zdarzeń związanych z temperaturą, które mogą wskazywać na podstawowe problemy.
- Skontaktuj się z pomocą techniczną: Jeśli wiele dysków zgłasza błędy lub jeśli problemy nie ustąpią po wykonaniu powyższych czynności, skontaktuj się z działem pomocy technicznej firmy Dell w celu uzyskania dalszego wsparcia.