PowerEdge: Por que os discos rígidos falham
Resumen: Este artigo explica em detalhes os diferentes motivos pelos quais os discos rígidos podem falhar.
Instrucciones
Sumário
- Corrupção do firmware e danos à zona do firmware
- Falha eletrônica
- Falha mecânica
- Falha lógica
- Erros de mídia
- Ambiente SCSI/SAS
- Cuidados para falhas de disco do PowerEdge
Corrupção do firmware e danos à zona do firmware
Quando o firmware de um disco rígido fica corrompido ou ilegível, o computador geralmente não consegue interagir corretamente com o disco rígido.
Falha eletrônica
A falha eletrônica geralmente está relacionada a problemas na placa controladora do disco rígido. O servidor pode sofrer um pico de energia ou sobrecarga elétrica que derruba a placa do controlador no disco rígido, tornando-a indetectável para o BIOS.
Falha mecânica
Muitas vezes, a falha mecânica (especialmente quando não se reage a ela precocemente) pode levar a uma perda parcial e, às vezes, total dos dados. Ela vem em várias formas, como falha nos cabeçotes de leitura/gravação e problemas de motor. Uma das falhas mecânicas mais comuns é a pane do cabeçote. Variando em gravidade, uma falha de cabeça ocorre quando os cabeçotes de leitura/gravação do disco rígido entram em contato, momentaneamente ou continuamente, com as bandejas do disco rígido.
Uma série de motivos pode causar uma pane de cabeça, incluindo choque físico (como queda do disco no chão), movimento do computador, eletricidade estática, picos de energia e falha mecânica na cabeça de leitura/gravação.
Falha lógica
Erros lógicos são muitas vezes os problemas mais fáceis e mais difíceis de lidar. Erros lógicos podem variar de coisas simples, como uma entrada inválida em uma tabela de alocação de arquivos a problemas verdadeiramente horríveis, como a corrupção e perda do sistema de arquivos em uma unidade severamente fragmentada.
Os erros lógicos são diferentes dos problemas elétricos e mecânicos acima, pois geralmente não há nada "fisicamente" errado com o disco, mas os bits de informação nele.
Erros de mídia
Setores defeituosos são áreas do disco rígido que se tornam ilegíveis. Todas as unidades de disco rígido desenvolvem setores defeituosos eventualmente. O disco rígido marca os setores que estão com defeito e eles não são mais usados. Mas se você tiver dados que residem em setores que se tornam setores defeituosos, você não pode acessar seus dados ou arquivos corretamente. Condições operacionais adversas (como altas temperaturas, vibração, entre outras) podem causar o rápido desenvolvimento de muitos setores defeituosos dos discos rígidos. Todo tipo de disco rígido é propenso a desenvolver setores defeituosos "naturalmente", mas isso nem sempre acontece.
Ambiente SCSI/SAS
Os discos rígidos SCSI são frequentemente considerados unidades de alto desempenho. Eles giram mais rápido do que os discos IDE/SATA e, portanto, as velocidades de transferência de dados costumam ser mais rápidas. Por isso, as unidades SCSI geralmente são encontradas em servidores que precisam oferecer muito throughput de dados. No entanto, esse desempenho geralmente tem um preço, pois as falhas mecânicas são mais prováveis nessas unidades.
A causa mais comum de várias falhas de disco nesse ambiente é a baixa qualidade do sinal no barramento SCSI. A má qualidade do sinal pode resultar em sobrecarga do protocolo SCSI ao tentar se recuperar desses problemas (tempos de espera excedidos e redefinições de barramento). À medida que o sistema fica mais ocupado e a demanda por dados aumenta, as ações corretivas do protocolo SCSI aumentam e o barramento SCSI fica mais próximo da saturação. Essa sobrecarga acaba limitando as larguras de banda normais de comunicação do dispositivo. Se não forem limpos, um ou mais dispositivos SCSI podem não conseguir responder ao controlador RAID em tempo hábil, resultando na marcação da unidade de disco rígido como off-line. Instalação incorreta do controlador RAID em um slot PCI, conexões de cabo deficientes, encaixe deficiente dos discos no backplane SCSI, instalação ou encaixe inadequado das placas auxiliares do backplane e terminação inadequada do barramento SCSI podem causar esses tipos de problemas de sinal.
Combinações desses tipos de falha também são possíveis.
Todos os técnicos e clientes devem ler e entender as práticas recomendadas de manutenção para maximizar o tempo de funcionamento e ajudar a evitar a perda de dados como resultado de uma falha no disco rígido.
Cuidados para falhas de disco do PowerEdge
Ao lidar com falhas de disco em servidores PowerEdge, é essencial tomar as seguintes precauções:
- Dados de backup: Sempre execute um backup de dados críticos antes de agir nos discos. Isso garante a segurança dos dados em caso de outros problemas.
- Monitorar alertas: Preste atenção aos alertas preditivos de falha da unidade (código de erro)
PDR6) e outros códigos de erro relacionados ao disco (comoPDR1001ePDR3). Esses alertas indicam possíveis problemas que precisam de atenção imediata. - Atualizações de firmware: Antes de substituir qualquer hardware, certifique-se de que o firmware do controlador RAID e das unidades esteja atualizado. Isso pode ajudar a evitar alertas falsos e melhorar a estabilidade geral do sistema.
- Manuseie as unidades com cuidado: Ao remover, instalar ou recolocar discos rígidos, evite usar força excessiva. Isso pode flexionar o backplane e fazer com que as unidades vizinhas falhem ou percam a conectividade.
- Verifique as conexões: Se uma unidade for relatada como com falha, recoloque-a para descartar problemas de conexão. Verifique se todas as conexões são seguras.
- Analise os logs do sistema: Verifique regularmente os logs do iDRAC e logs do sistema em busca de quaisquer alertas ou eventos térmicos relacionados que possam indicar problemas subjacentes.
- Entre em contato com o suporte: Se várias unidades relatarem erros ou se os problemas persistirem após a realização das ações acima, entre em contato com o Suporte Dell para obter mais assistência.