PowerVault ME4, ME5: Исследование хостов, утрачивающих доступ к дисковому массиву
Сводка: Эта статья предназначена для администраторов хранилищ, использующих массивы Dell PowerVault ME4/ME5. В нем объясняется, как собрать нужные доказательства, выполнить проверки при первом проходе и определить распространенные причины, когда хосты теряют доступ к сопоставленным томам. Если требуется более глубокая настройка операционной системы хоста или коммутатора, после выполнения шагов проверки на стороне массива ознакомьтесь с документацией поставщика операционной системы или коммутатора. ...
Инструкции
Назначение и область применения
Эта статья предназначена для администраторов хранилищ, использующих массивы Dell PowerVault ME4/ME5. В нем объясняется, как собрать нужные доказательства, выполнить проверки при первом проходе и определить распространенные причины, когда хосты теряют доступ к сопоставленным томам. Если требуется более глубокая настройка операционной системы хоста или коммутатора, после выполнения шагов проверки на стороне массива ознакомьтесь с документацией поставщика операционной системы или коммутатора.
Обзор возможностей подключения
- Serial Attached SCSI (SAS) поддерживается только как система хранения данных с прямым подключением (DAS). Коммутаторы SAS не поддерживаются в массивах ME. Используйте два пути к обоим контроллерам для резервирования.
- Интерфейс iSCSI (Internet Small Computer Systems Interface) и Fibre Channel (FC) поддерживают конфигурации с прямым подключением и подключением к коммутатору. Для обеспечения отказоустойчивости используйте две фабрики или подсети.
- Перед внесением изменений проверьте драйверы, микропрограмму и приемопередатчик хоста.
1. Сначала соберите правильные доказательства.
Соберите эту информацию перед внесением изменений. Соотнесите все с временными рамками и часовым поясом инцидента.
Из массива (ME4/ME5)
- Создайте пакет поддержки в PowerVault Manager, выбрав Maintenance, Support, а затем Collect Logs. В пакет входят события контроллера, уровни микропрограммы и состояние внешнего порта.
- Просмотр оповещений и событий в PowerVault Manager. Запишите любое событие перезагрузки контроллера, переключения при отказе, сброса канала связи или события установки шасси, соответствующие инциденту.
На что обращать внимание: состояния «соединение не работает», несоответствия скорости или согласования, увеличение количества счетчиков ошибок или отсутствие инициаторов по сравнению с ожидаемым проектом.
С хостов Windows Server
Проверьте MPIO и убедитесь, что устройства заявлены и что присутствует ожидаемое количество активных/оптимизированных путей. Экспортируйте соответствующие события дискового ввода-вывода, порта StorPort и многопутевого ввода-вывода (MPIO) из средства просмотра событий, связанные с инцидентом. Сравните версии драйверов и микропрограмм HBA (адаптера главной шины), сетевой платы с последними доступными версиями.
С хостов VMware ESXi
Выполните поиск в vmkernel.log событий APD (All Paths Down), PDL (Permanent Device Loss) и событий перехода пути.
Убедитесь, что для каждого устройства хранения данных отображается ожидаемое количество путей и что политика подходит для массивов ME, например для циклического перебора.
esxcli storage core path list
esxcli storage core device list
С хостов Linux
Убедитесь, что для многопутевого ввода-вывода отображается несколько активных путей для каждого идентификатора WWID, и соотнесите транспортные ошибки ядра со временем инцидента. Проверьте версии драйвера и микропрограммы HBA-адаптера.dmesg -T | egrep -i 'scsi|sas|reset|error'
multipath -ll
Из сети или фабрики (если используется)
- Коммутаторы iSCSI: Считывание CRC или счетчиков сброса для каждого порта, заслонок канала, настроек MTU (максимального блока передачи) и политики управления потоком. Обеспечьте согласованность значений MTU на всех уровнях при использовании пакетов крупного размера и включите по крайней мере управление потоком приема на портах хранилища. Используйте MPIO для резервирования вместо LACP на сетевых картах iSCSI хоста.
- Фабрики FC: Соберите журналы фабрики для FLOGI/PLOGI, RSCN и счетчиков ошибок для каждого порта в обеих фабриках. Убедитесь, что зонирование соответствует предполагаемому макету.
2. Сортировочные проверки, которые позволяют разрешить большинство случаев.
-
Подтвердите предполагаемую топологию. Если контроллер использует SAS, обеспечьте прямое подключение без коммутатора SAS и используйте два пути к обоим контроллерам. Для iSCSI и FC убедитесь в том, что используется компоновка с двумя фабриками или двумя подсетями.
-
Просмотр событий хранилища и работоспособности портов. Совместите метки времени событий с ошибками хоста. Убедитесь, что внешние порты работают с ожидаемой скоростью и что инициаторы вошли в систему. Исследуйте любой порт с растущими счетчиками ошибок.
-
Проверьте поддержку нескольких каналов ввода-вывода для хоста.
- Windows Server с многопутевым вводом-выводом (MPIO) Устройства должны быть заявлены и отображать предполагаемое количество активных/оптимизированных путей.
- VMware ESXi: На устройствах должно отображаться полное количество путей и соответствующая политика, например Циклический перебор.
- Linux с многопутевым устройством сопоставления устройств: Каждое устройство mpath dev должно отображать несколько активных путей.
- Проверьте устойчивость при транспортировке.
- iSCSI: две изолированные подсети и VLAN (виртуальные локальные сети), согласованное MTU и прием или симметричное управление потоком. Замените агрегирование каналов связи на MPIO для путей передачи данных.
- FC: две фабрики и согласованное зонирование; Проверьте, нет ли сброса каналов и сбоев входа.
- SAS: двухпутевое подключение к обоим контроллерам и отсутствие коммутатора в тракте; проверьте инструменты HBA на наличие ошибок PHY и переподключите или замените подозрительные кабели.
- Подтвердите версии программного обеспечения и микропрограммы. Сравните драйверы HBA хоста и сетевой платы, а также микропрограммы с таблицей поддержки и при необходимости внесите изменения.
3. Рекомендации по перевозке
SAS (прямого подключения)
- Используйте двухканальную схему DAS для обоих контроллеров. Кабели должны укладываться в пределах допустимой длины. Не размещайте коммутатор SAS в пути передачи данных.
- Для объединения Windows Server в кластер с HBA-адаптерами SAS следуйте указаниям операционной системы, если устройство определено как RAID, а не как HBA-адаптер.
- Схемы и примеры подключения кабелей см. в руководстве по развертыванию.
iSCSI (с прямым подключением или подключением к коммутатору)
- Используйте две выделенные подсети iSCSI и VLAN с согласованным MTU, а также включите управление приемом или симметричное управление потоком. В конфигурациях с прямым подключением подключите одну сетевую плату на каждую подсеть к порту на соответствующем контроллере и используйте MPIO.
- Для VMware ESXi используйте программный инициатор iSCSI. Платы разгрузки iSCSI не поддерживаются в ME5. Используйте одно VMkernel на каждую фабрику на коммутаторе vSwitch с одним vmnic.
Протокол Fibre Channel (DAS или SAN)
- Используйте две ткани. Распространенной практикой является зонирование с одним инициатором, одним целевым объектом: Используйте WWPN HBA-адаптера одного хоста с одним портом дискового массива WWPN для каждой зоны и повторите эти действия в обеих фабриках.
4. Распространенные причины и способы их подтверждения.
- Проблема переключения контроллера при отказе или микропрограммы: События массива показывают в журналах перезагрузку контроллера или переключение при отказе, которое согласуется с APD хоста или PDL. Укажите микропрограмму, если в примечаниях к выпуску указаны соответствующие исправления.
- Неправильная настройка нескольких каналов ввода-вывода: Хосты показывают уменьшенное количество путей или сообщают о неработающих путях. Скорректируйте настройки MPIO, NMP или многопутевого ввода-вывода, чтобы восстановить ожидаемые пути ввода-вывода.
- Проблемы с сетью iSCSI: Счетчики коммутаторов показывают пропускания, или ошибки CRC, либо показатель MTU не согласуется. Включите управление потоком приема или симметричное управление, согласуйте MTU и замените агрегирование каналов связи на MPIO.
- Зонирование FC или нестабильность фабрики: Затронутые хосты не могут войти в одну фабрику или часто перезагружают каналы; Исправьте зонирование или устраните оптику и кабели.
- Снижение производительности кабеля или порта SAS: В диагностике массива или HBA-адаптера отображаются растущие ошибки PHY или периодические состояния «соединение не работает». Переподключите или замените кабели.
- Неподдерживаемые драйверы или микропрограммы: Затронуты только определенные хосты или HBA-адаптеры; Обновление до версий таблицы поддержки устраняет это условие.
5. Контрольный список действий для эскалации
При открытии сервисной заявки укажите следующее:
- Пакет поддержки массива и точное окно инцидента с часовым поясом
- Схема топологии подключений хостов, фабрик и подсетей, включая информацию о том, какие хосты потеряли доступ и какие пути были затронуты.
- Доказательства хозяина:
- Windows Server. Проверьте MPIO и соответствующие записи средства просмотра событий.
- VMware ESXi: Выдержки из vmkernel.log и выходные данные команд хранилища esxcli
- Linux: Выдержки Dmesg и многопутевой вывод.
- Доказательства коммутатора или фабрики: счетчики iSCSI и фрагменты конфигурации, журналы фабрики FC и снимки экрана зонирования.
- Инвентаризация версий: Версия микропрограммы и микропрограммы массива (в комплекте), а также драйвера и микропрограммы HBA-адаптера хоста или сетевой платы.
6. Документацию Dell можно найти на support.dell.com для конкретной модели устройства
- Таблица поддержки: Поддерживаемые операционные системы, HBA-адаптеры, сетевые карты и правила
- Руководства по развертыванию Примеры прокладки кабелей, начальной настройки и топологии.
- Руководство администратора: Это необходимо для повседневного управления.
- Ссылка на интерфейс командной строки: Полный список команд show для исследования.