ECS: xDoctor: RAP165: Festplatte meldet hohen Erwartungswert

Zusammenfassung: Diese Warnmeldung erkennt hohe Wartezeiten auf jeder Node-Festplatte, die auf Probleme mit der Festplattenleistung untersucht werden soll.

Dieser Artikel gilt für Dieser Artikel gilt nicht für Dieser Artikel ist nicht an ein bestimmtes Produkt gebunden. In diesem Artikel werden nicht alle Produktversionen aufgeführt.

Symptome

xDoctor meldet, dass eine Festplatte einen hohen Erwartungswert meldet, der überprüft werden muss.
---------------------------------------
ERROR - Disk reporting high await value
---------------------------------------
Node      = Nodes
Extra     = {'Nodes': {'169.254.1.1': ['sda'], '169.254.1.3': ['sdt']}}
RAP       = RAP165
Solution  = KB 215802
Timestamp = 2023-07-12_135854
PSNT      = CKMXXXXXXXXXXX @ 4.8-92.0

Ursache

Manchmal können Festplatten Probleme haben, bevor sie ausfallen, und Performanceprobleme auf dem Node oder Datenzugriff im Zusammenhang mit der problematischen Festplatte verursachen. 
  1. Bestätigen Sie, dass auf der in der Warnmeldung angegebenen Node-Festplatte ein hohes Warten erkannt wird:
Befehl:
# sar -d -p --dev=<device>
Beispiel:
HINWEIS: Wenn Sie sehen, dass drei Prüfungen in der SAR-Datei des Laufwerks über 100 warten, muss die Festplatte überprüft und behoben werden.
admin@node1:~> sar -dp --dev=sdas
[...Output Truncated...] 
                  DEV       tps     rkB/s     wkB/s   areq-sz    aqu-sz     await     svctm     %util
12:10:01          sdas     3.23     69.58    130.87     62.14     29.78   9503.41    224.33     72.36

12:10:01          DEV       tps     rkB/s     wkB/s   areq-sz    aqu-sz     await     svctm     %util
12:20:01          sdas     2.24     35.28     18.28     23.95     67.97  29994.40    371.69     83.11
12:30:01          sdas     2.72     76.23     91.17     61.48     17.16   6813.32    102.38     27.88
[...Output Truncated...]
HINWEIS: Um alle Nodes zu überprüfen, können Sie diesen Befehl ausführen
admin@node1:~> svc_exec "sar -dp  |awk '\$8>=100'"
  1. Überprüfen Sie den Status der Datenfestplatte, da die Festplatte möglicherweise Probleme aufweist, die mit weiteren Prüfungen in Schritt 4 unten behoben werden müssen. Das Laufwerk kann sich weiterhin in einem GUTEN Zustand befinden und das Problem melden.
Befehl:
# cs_hal list disks
Beispiel:
admin@node1:~> cs_hal list disks
Disks(s):
SCSI Device Block Device Enclosure   Partition Name                      Slot Serial Number       SMART
----------- ------------ ----------- ----------------------------------- ---- ------------------- ------------
/dev/sg1    /dev/sda     /dev/sg0    ECS:object:7/Nk80M/RXyPDreDA3S6dg   A0   8CGGW6ZG            GOOD
/dev/sg2    /dev/sdb     /dev/sg0    ECS:object:7/Nk80M/RXyPDreDA3S6dg   A1   8CGDPDTH            GOOD
/dev/sg3    /dev/sdc     /dev/sg0    ECS:object:7/Nk80M/RXyPDreDA3S6dg   A2   8CGDYHUH            GOOD
/dev/sg4    /dev/sdd     /dev/sg0    ECS:object:7/Nk80M/RXyPDreDA3S6dg   A3   8CGDH17H            GOOD
/dev/sg5    /dev/sde     /dev/sg0    ECS:object:7/Nk80M/RXyPDreDA3S6dg   A4   8CGDZJEH            GOOD
/dev/sg6    /dev/sdf     /dev/sg0    ECS:object:7/Nk80M/RXyPDreDA3S6dg   A5   8CGGV33G            GOOD
/dev/sg7    /dev/sdas     /dev/sg0    ECS:object:7/Nk80M/RXyPDreDA3S6dg   A6   8CGDZWJH           SUSPECT
[...Output Truncated...]
  1. Wenn es sich bei Ihrem Gerät um eine Systemfestplatte oder eine SATA-SSD-Systemfestplatte mit SATA-SSDr-Lesecache handelt, finden Sie weitere Informationen im KB-Artikel 215459, ECS: xDoctor: RAP162: Geringe verbleibende Lebensdauer der SSD-Systemfestplatte oder SSDr-Festplatte, zur Lösung
Befehl:
# sudo alldisks -v | grep non-rotational
Beispiel:
admin@node1:~> sudo alldisks -v | grep non-rotational
/dev/sdad    [9:0:0:0] host9  0:0    ahci         non-rotational   480.1     ATA DL5C SSDSC2KXXXXG7R     PHYS82800XXXX80BGN
  1. Überprüfen Sie bei Datenfestplatten, ob die Festplatte mögliche Probleme aufweist, indem Sie smartctl-Prüfungen verwenden, um die Festplatte zu untersuchen.
Befehl:
# sudo smartctl -a /dev/<device>
Beispiel:
admin@node1:~> sudo smartctl -a /dev/sda
smartctl 7.1 2019-12-30 r5022 [x86_64-linux-4.12.14-95.83-default] (local build)
Copyright (C) 2002-19, Bruce Allen, Christian Franke, www.smartmontools.org

=== START OF INFORMATION SECTION ===
Model Family:     HGST Ultrastar DC HC520 (He12)
Device Model:     HGST HUH7XXXX2ALE600
Serial Number:    8CGXXXZG
LU WWN Device Id: 5 000cca 26fc6c365
Add. Product Id:  DELL(tm)
Firmware Version: LEDENT08
User Capacity:    12,000,138,625,024 bytes [12.0 TB]
Sector Sizes:     512 bytes logical, 4096 bytes physical
Rotation Rate:    7200 rpm
Form Factor:      3.5 inches
Device is:        In smartctl database [for details use: -P show]
ATA Version is:   ACS-2, ATA8-ACS T13/1699-D revision 4
SATA Version is:  SATA 3.2, 6.0 Gb/s (current: 6.0 Gb/s)
Local Time is:    Tue Jul 25 17:40:57 2023 UTC
SMART support is: Available - device has SMART capability.
SMART support is: Enabled

=== START OF READ SMART DATA SECTION ===
SMART overall-health self-assessment test result: PASSED

General SMART Values:
Offline data collection status:  (0x82) Offline data collection activity
                                        was completed without error.
                                        Auto Offline Data Collection: Enabled.
Self-test execution status:      ( 247) Self-test routine in progress...
                                        70% of test remaining.
Total time to complete Offline
data collection:                (   90) seconds.
Offline data collection
capabilities:                    (0x5b) SMART execute Offline immediate.
                                        Auto Offline data collection on/off support.
                                        Suspend Offline collection upon new
                                        command.
                                        Offline surface scan supported.
                                        Self-test supported.
                                        No Conveyance Self-test supported.
                                        Selective Self-test supported.
SMART capabilities:            (0x0003) Saves SMART data before entering
                                        power-saving mode.
                                        Supports SMART auto save timer.
Error logging capability:        (0x01) Error logging supported.
                                        General Purpose Logging supported.
Short self-test routine
recommended polling time:        (   2) minutes.
Extended self-test routine
recommended polling time:        (1272) minutes.
SCT capabilities:              (0x003d) SCT Status supported.
                                        SCT Error Recovery Control supported.
                                        SCT Feature Control supported.
                                        SCT Data Table supported.

SMART Attributes Data Structure revision number: 16
Vendor Specific SMART Attributes with Thresholds:
ID# ATTRIBUTE_NAME          FLAG     VALUE WORST THRESH TYPE      UPDATED  WHEN_FAILED RAW_VALUE
  1 Raw_Read_Error_Rate     0x000b   100   100   016    Pre-fail  Always       -       15
  2 Throughput_Performance  0x0004   132   132   000    Old_age   Offline      -       96
  3 Spin_Up_Time            0x0007   160   160   024    Pre-fail  Always       -       411 (Average 411)
  4 Start_Stop_Count        0x0012   100   100   000    Old_age   Always       -       115
  5 Reallocated_Sector_Ct   0x0033   100   100   005    Pre-fail  Always       -       99
  7 Seek_Error_Rate         0x000a   100   100   000    Old_age   Always       -       5
  8 Seek_Time_Performance   0x0004   140   140   000    Old_age   Offline      -       15
  9 Power_On_Hours          0x0012   095   095   000    Old_age   Always       -       38129
 10 Spin_Retry_Count        0x0012   100   100   000    Old_age   Always       -       0
 12 Power_Cycle_Count       0x0032   100   100   000    Old_age   Always       -       115
 22 Helium_Level            0x0023   100   100   025    Pre-fail  Always       -       100
192 Power-Off_Retract_Count 0x0032   099   099   000    Old_age   Always       -       2217
193 Load_Cycle_Count        0x0012   099   099   000    Old_age   Always       -       2217
194 Temperature_Celsius     0x0002   214   214   000    Old_age   Always       -       28 (Min/Max 22/43)
196 Reallocated_Event_Count 0x0032   100   100   000    Old_age   Always       -       0
197 Current_Pending_Sector  0x0022   100   100   000    Old_age   Always       -       0
198 Offline_Uncorrectable   0x0008   100   100   000    Old_age   Offline      -       5
199 UDMA_CRC_Error_Count    0x000a   200   200   000    Old_age   Always       -       60
223 Load_Retry_Count        0x000a   100   100   000    Old_age   Always       -       0
241 Total_LBAs_Written      0x0012   100   100   000    Old_age   Always       -       32466844386
242 Total_LBAs_Read         0x0012   100   100   000    Old_age   Always       -       31948673445

SMART Error Log Version: 1
No Errors Logged

SMART Self-test log structure revision number 1
Num  Test_Description    Status                  Remaining  LifeTime(hours)  LBA_of_first_error
# 1  Extended offline    Completed without error       00%     36662         -
# 2  Extended offline    Completed without error       00%     35174         -
# 3  Extended offline    Completed without error       00%     33590         -
# 4  Extended offline    Completed without error       00%     32097         -
# 5  Extended offline    Completed without error       00%     29458         -
# 6  Extended offline    Completed without error       00%     27868         -
# 7  Extended offline    Completed without error       00%     26404         -
# 8  Extended offline    Completed without error       00%     24941         -
# 9  Extended offline    Completed without error       00%     23475         -
#10  Extended offline    Completed without error       00%     22010         -
#11  Extended offline    Completed without error       00%     20547         -
#12  Extended offline    Completed without error       00%     19072         -
#13  Extended offline    Completed without error       00%     17589         -
#14  Extended offline    Completed without error       00%     16125         -
#15  Extended offline    Completed without error       00%     14661         -
#16  Extended offline    Completed without error       00%     13178         -
#17  Extended offline    Completed without error       00%     11714         -
#18  Extended offline    Completed without error       00%     10250         -
#19  Extended offline    Completed without error       00%      8786         -
#20  Extended offline    Completed without error       00%      7322         -
#21  Extended offline    Completed without error       00%      5858         -

SMART Selective self-test log data structure revision number 1
 SPAN  MIN_LBA  MAX_LBA  CURRENT_TEST_STATUS
    1        0        0  Not_testing
    2        0        0  Not_testing
    3        0        0  Not_testing
    4        0        0  Not_testing
    5        0        0  Not_testing
Selective self-test flags (0x0):
  After scanning selected spans, do NOT read-scan remainder of disk.
If Selective self-test is pending on power-up, resume after 0 minute delay.

Lösung

Erfassen Sie die Ausgaben von oben und öffnen Sie dann einen Service-Request, der auf diesen Wissensdatenbank-Artikel verweist: ECS: xDoctor: RAP165: Festplatte meldet hohen Erwartungswert für eine Festplattenintegritätsprüfung und einen möglichen Austausch.

Betroffene Produkte

ECS Appliance
Artikeleigenschaften
Artikelnummer: 000215802
Artikeltyp: Solution
Zuletzt geändert: 02 Juli 2024
Version:  8
Antworten auf Ihre Fragen erhalten Sie von anderen Dell NutzerInnen
Support Services
Prüfen Sie, ob Ihr Gerät durch Support Services abgedeckt ist.