PowerEdge: 하드 디스크에 오류가 발생하는 이유
Resumen: 이 문서에서는 하드 드라이브에 장애가 발생할 수 있는 여러 가지 이유를 자세히 설명합니다.
Instrucciones
목차
펌웨어 손상 및 펌웨어 영역 손상
하드 디스크의 펌웨어가 손상되거나 읽을 수 없게 되면 컴퓨터가 하드 디스크와 올바르게 상호 작용할 수 없는 경우가 많습니다.
전자적 오류
전자적 오류는 일반적으로 하드 디스크의 컨트롤러 보드 문제와 관련이 있습니다. 서버의 전원 스파이크 또는 전기 서지로 인해 하드 디스크의 컨트롤러 보드가 녹아웃되어 BIOS에서 감지하지 못할 수 있습니다.
기계 불량
기계 불량은 종종(특히 조기에 조치를 취하지 않은 경우) 부분적이거나 경우에 따라 전체 데이터 손실로 이어질 수 있습니다. 기계 불량은 읽기/쓰기 헤드의 고장, 모터 문제 등 다양한 형태로 나타날 수 있습니다. 가장 흔한 기계 불량 중 하나는 헤드 충돌입니다. 심각도에 따라 다양한 헤드 충돌은 하드 디스크의 읽기/쓰기 헤드가 하드 디스크의 플래터와 일시적 또는 지속적으로 접촉할 때 발생합니다.
헤드 충돌은 물리적 충격(예: 디스크를 바닥에 떨어뜨림), 컴퓨터 움직임, 정전기, 전원 서지, 기계적 읽기/쓰기 헤드 고장 등 다양한 이유로 인해 발생할 수 있습니다.
논리적 오류
논리적 오류는 종종 다루기 가장 쉽고 가장 어려운 문제입니다. 논리적 오류는 파일 할당 테이블의 잘못된 항목과 같은 간단한 것부터 심각하게 조각난 드라이브의 파일 시스템 손상 및 손실과 같은 정말 끔찍한 문제에 이르기까지 다양합니다.
논리적 오류는 일반적으로 디스크에 '물리적으로' 문제가 없지만 디스크의 정보 비트가 있기 때문에 위의 전기적 및 기계적 문제와 다릅니다.
미디어 오류
불량 섹터는 하드 디스크에서 읽을 수 없게 된 영역입니다. 모든 하드 디스크 드라이브는 결국 불량 섹터를 개발합니다. 하드 디스크는 불량 섹터를 표시하며 더 이상 사용되지 않습니다. 그러나 불량 섹터가 되는 섹터에 상주하는 데이터가 있는 경우 데이터 또는 파일에 올바르게 액세스할 수 없습니다. 열악한 작동 조건(예: 고온, 진동 등)으로 인해 하드 디스크에서 많은 불량 섹터가 빠르게 발생할 수 있습니다. 모든 종류의 하드 디스크는 시간이 지나면서 '자연스럽게' 불량 섹터가 생길 수 있지만, 항상 그런 것은 아닙니다.
SCSI/SAS 환경
SCSI 하드 디스크는 종종 고성능 드라이브로 간주됩니다. IDE/SATA 제품보다 더 빠르게 회전하므로 데이터 전송 속도가 더 빠릅니다. 이 때문에 SCSI 드라이브는 많은 데이터 처리량을 제공해야 하는 서버에서 종종 발견됩니다. 그러나 이러한 드라이브에서 기계적 결함이 발생할 가능성이 더 높기 때문에 이러한 성능에는 종종 대가가 따릅니다.
이 환경에서 다중 디스크 장애의 가장 일반적인 원인은 SCSI 버스의 신호 품질이 좋지 않기 때문입니다. 신호 품질이 좋지 않으면 이러한 문제(시간 초과 및 버스 재설정)에서 복구하려고 할 때 SCSI 프로토콜 오버헤드가 발생할 수 있습니다. 시스템 사용량이 증가하고 데이터 수요가 증가함에 따라 SCSI 프로토콜의 수정 작업이 증가하고 SCSI 버스가 포화에 가까워집니다. 이 오버헤드는 결국 정상적인 디바이스 통신 대역폭을 제한합니다. 선택을 취소하지 않으면 하나 이상의 SCSI 디바이스가 적시에 RAID 컨트롤러에 응답하지 못해 RAID 컨트롤러가 하드 디스크 드라이브를 오프라인으로 표시합니다. PCI 슬롯에 RAID 컨트롤러를 잘못 설치하거나, 케이블 연결 불량하거나, SCSI 백플레인에 디스크를 잘못 장착하거나, 백플레인 도터 카드를 잘못 설치하거나 장착하거나, SCSI 버스 단자를 잘못 장착하면 이러한 유형의 신호 문제가 발생할 수 있습니다.
이러한 장애 유형의 조합도 가능합니다.
모든 기술 지원 담당자와 고객은 가동 시간을 극대화하고 하드 디스크 오류로 인한 데이터 손실을 방지하기 위해 유지 보수 모범 사례를 읽고 이해해야 합니다.
PowerEdge 디스크 장애에 대한 주의 사항
PowerEdge 서버에서 디스크 장애를 처리할 때는 다음과 같은 예방 조치를 취하는 것이 중요합니다.
- 백업 데이터: 디스크에 대한 작업을 수행하기 전에 항상 중요한 데이터를 백업하십시오. 이렇게 하면 추가 문제가 있는 경우 데이터 안전이 보장됩니다.
- 알림 모니터링: 드라이브 장애 예측 알림(오류 코드)에 주의
PDR6) 및 기타 디스크 관련 오류 코드(예:PDR1001및PDR3)를 제공해야 합니다. 이러한 알림은 즉각적인 주의가 필요한 잠재적인 문제를 나타냅니다. - 펌웨어 업데이트: 하드웨어를 교체하기 전에 RAID 컨트롤러 및 드라이브의 펌웨어가 최신 상태인지 확인합니다. 이를 통해 잘못된 알림을 방지하고 전반적인 시스템 안정성을 개선할 수 있습니다.
- 드라이브를 조심스럽게 다루십시오. 하드 드라이브를 분리, 설치 또는 재장착할 때 과도한 힘을 가하지 마십시오. 이로 인해 백플레인이 유연해지고 인접 드라이브에 장애가 발생하거나 연결이 끊어질 수 있습니다.
- 연결 확인: 드라이브에 장애가 발생한 것으로 보고되면 연결 문제를 배제하기 위해 드라이브를 다시 장착합니다. 모든 연결이 안전한지 확인합니다.
- 시스템 로그를 검토합니다. iDRAC 로그 및 시스템 로그를 정기적으로 확인하여 근본적인 문제를 나타낼 수 있는 관련 알림 또는 발열 이벤트를 확인합니다.
- 지원 문의: 여러 드라이브에서 오류가 보고되거나 위의 조치를 취한 후에도 문제가 지속되면 Dell 지원 부서에 문의하여 추가 지원을 받으십시오.