PowerFlex 4.X:SMART_AGGREGATED_STATE_FAILED - DAX 设备 - SIO03.02.0000013

Summary: PowerFlex 报告其中一个 DAX 设备即将发生故障,应进行更换。当 dax 设备并非真正出现故障时,NVDIMM 可纠正内存错误可能会导致该设备在 PowerFlex 中显示为“Failed Now”。

This article applies to This article does not apply to This article is not tied to any specific product. Not all product versions are identified in this article.

Symptoms

此错误通常是由标准 PowerFlex 设备触发的,在这种情况下,建议的操作是更换磁盘,但是,如果相关设备是 DAX 设备,该设备是 NVDIMM 而不是磁盘,则本文介绍了额外的故障处理步骤。


PowerFlex 报告以下警报,指出其中一个 DAX 设备 即将发生故障或正在以降低的性能运行。这也以 DialHome 警报的形式反映出来:

 

SIO03.02.0000013
磁盘可能即将发生故障或者性能下降。    
SMART_AGGREGATED_STATE_FAILED_NOW
SDS。Device.SMART_Aggregated_State_Failed_Now
建议的操作:考虑更换磁盘。

 

SMART_AGGREGATED_STATE_FAILED_NOW

Cause

PowerFlex 检测到存储节点的一个 NVDIMM 上发生了可纠正或不可纠正的错误。一旦检测到错误,它将生成 Smart Aggregated State Failed Now 错误。

Resolution

清理 NVDIMM 无需更换 NVDIMM 即可解决问题,只有在清理后问题仍然存在时,才更换 NVDIMM。 


  • 对于第 15 代节点,您只能净化所有 NVDIMM — 在执行净化之前删除所有设备(SDS 设备 + DAX 设备),以避免数据损坏 
  • 对于第 14 代节点,您可以仅清理一个有问题的 NVDIMM 或清理所有 NVDIMM,按照以下步骤识别发生故障的 NVDIMM 

 

验证故障

步骤1: 在 PowerFlex Manager 中,转至BlockDevices >

 

步骤2: 选择右上角的列框,然后将“S.M.A.R.T State”添加到列表中。

 

S.M.A.R.T 状态

 

步骤3: 查看 dax 设备列表,确认是否有任何设备显示“Failed Now”

 

现在失败

 

 

步骤4: 对于处于“Failed Now”状态的每个 dax 设备,确定 dax 与哪个 SDS 对应并登录到 iDRAC。

 

步骤5: 确定在生命周期日志中记录的每个 NVDIMM 是否有任何可纠正错误。

  • NVDIMM 上的可纠正内存错误可能会导致 dax 设备尽管并未出现故障,但在 PowerFlex 中仍显示“Failed Now”。

 

生命周期日志。

 

 

步骤6: 通过 SSH 连接到相应群集的主 MDM 并运行以下命令。这用于验证显示故障的 NVDIMM 的 DAX 运行状况、插槽信息和 SN:

  • 使用管理员登录登录到主 MDM。如果密码包含特殊字符,请使用单引号 ' '
    scli --login --username admin --password '<password>' --management_system_ip <pfmp_ip>

  

 

  • 运行以下命令以列出所有 SDS 详细信息:
scli --query_all_sds

  

示例:

SDS ID: 2e400d3800000004 Name: LAB10_SDS3 State: Connected, Joined IP: XXX
SDS ID: 2e400d3700000003 Name: LAB10_SDS2 State: Connected, Joined IP: XXX
SDS ID: 2e400d3600000002 Name: LAB10_SDS4 State: Connected, Joined IP: XXX
SDS ID: 2e400d3500000001 Name: LAB10_SDS1 State: Connected, Joined IP: XXX
SDS ID: 2e400d3400000000 Name: LAB10_SDS5 State: Connected, Joined IP: XXX

 


  
  • 找到受影响的 SDS 并记下 SDS 名称,然后运行以下命令
scli --query_sds --sds_name <sds name>
  • 记下此 SDS 的所有设备的设备路径,稍后将在步骤 8 中用于重新添加设备 
  • 记下受影响的设备 ID,然后运行以下命令
# scli --query_sds_device_info --device_id <device_id>

示例输出:

# scli --query_sds_device_info --device_id XXXXX

        Device ID: _________ Name: /dev/dax1.0 Path: /dev/dax1.0

                ScaleIO Device Configuration:

                        Original Path: /dev/dax1.0

                        Acceleration Pool: _________

                        Used for RFcache: no

                        Capacity Limit: 31.4 GB (32107 MB)

                        Device State: Normal

                Physical Device Information:

                        Device Type: UNKNOWN

                        Media Type: NVDIMM

                        Auto Detected Media Type: UNKNOWN

                        Vendor Name: N/A

                        Model Name: nmem2

                        Serial Number: _________

                        Slot Number: B5

                        Firmware Version: N/A

                        Cache Look-ahead: not Active

                        Write Cache: not Active

                        ATA Security: not Active

                        Logical Sector Size: 0 B

                        Physical Sector Size: 0 B

                        Capacity: 0 GB

                        LED Setting: OFF

                Background Device Scanner Information:

                        Scanned: 0 MB

                        Error Fixes: 0

                        Compare Errors: 0

                SMART Information:

                        Aggregated State: FAILED_NOW

                        Temperature State: NEVER_FAILED

                                Current Value: 34 Worst Value: 34 Threshold: 0

                        Media Wearout Indicator State: NEVER_FAILED

                                Current Value: 95 Worst Value: 95 Threshold: 5

                RAID Controller Information:

                        Serial Number: N/A

                        RAID vDisk Status: N/A

                        RAID vDisk Type: N/A

                        RAID vDisk Cache: N/A

 

 

步骤7: 确定哪个 dax 对应于所述 NVDIMM 后,如果错误可纠正,请按照标准步骤通过 iDRAC 清理 NVDIMM。如果错误无法纠正,请按照标准指导准则进行 NVDIMM 故障处理。

 

步骤8: 净化 NVDIMM 后,将 dax 设备添加回 SDS,然后根据之前记录的设备路径将 powerflex 设备添加回 SDS,dax 设备将显示为“Never Failed” 相应的警报也将自动从“Alerts”选项卡中清除。

检查文章 PowerFlex:如何更换第 15 代及更高版本的 PowerEdge 节点中的步骤 9 和 10

Additional Information

Affected Products

PowerFlex rack, ScaleIO
Article Properties
Article Number: 000438714
Article Type: Solution
Last Modified: 14 Aug 2026
Version:  4
Find answers to your questions from other Dell users
Support Services
Check if your device is covered by Support Services.