PowerEdge: Термічне тротлінгування GPU або проблеми з GPU не виявлено
Summary: У цій статті наведено рекомендації щодо термічного троттлінгу GPU та невиявлених проблем GPU на серверах Dell PowerEdge. Ці проблеми можуть виникати через температурні умови, проблеми з апаратною конфігурацією або налаштування системи. ...
Symptoms
- Продуктивність GPU знижується під час великого навантаження.
- Тактова частота GPU автоматично знижується для захисту апаратного забезпечення.
- Температура GPU досягає високих значень під час навантаження на навантаження.
- Журнал подій системи (SEL) показує попередження, пов'язані з температурою входу системи.
- GPU не з'являється в операційних системах чи інструментах управління.
- Командування
nvidia-smiне показує жодного GPU-пристрою. - iDRAC або BIOS не виявляють встановлену відеокарту.
Cause
- Висока температура навколишнього дата-центру
- Недостатній потік повітря або заблокований повітрозабірник у серверній стійкі
- Неправильний профіль вентилятора або налаштування теплової політики
- Відеокарта неправильно встановлена у слоті PCIe
- Непідтримувана конфігурація GPU або невідповідність прошивки
- Застарілі BIOS, iDRAC або GPU прошивки
- Проблеми з живленням або підключенням кабелю для GPU-модулів
Resolution
1. Перевірте температуру відеокарти та стан дроселя:
Виконайте наступну команду в операційній системі для перевірки продуктивності GPU та стану дроселлю GPU Nvidia:
nvidia-smi -q -d performance
Якщо причини дроселя вказані як «Неактивні», GPU працює нормально.
2. Моніторинг температури системи:
- Перевірте журнал подій системи (SEL) в iDRAC.
- Перегляньте журнал життєвого циклу для попереджень про температуру.
- Перевірте температуру входу системи у розділі Огляд температури.
3. Покращіть умови охолодження:
- Переконайтеся, що температура навколишнього середовища в дата-центрі відповідає підтримуваним межам.
- Зніміть блокування повітряного потоку в стійці.
- Переконайтеся, що всі системні вентилятори працюють належним коректно.
- Використовуйте відповідні кожухи для потоку повітря та комплекти охолодження GPU.
4. Перевірте встановлення апаратного забезпечення GPU:
- Переконайтеся, що відеокарта правильно встановлена у слоті PCIe.
- Перевірте кабелі живлення та роз'єми GPU.
- Переконайтеся, що GPU підтримується на серверній платформі.
5. Оновлення прошивки системи:
- Оновіть BIOS сервера.
- Оновіть прошивку iDRAC.
- Оновіть драйвери GPU та прошивку.
6. Перевірте виявлення GPU:
Використайте наступну команду, щоб перевірити, чи виявляється система GPU Nvidia:
nvidia-smi
Якщо відеокарта не виявлена, перевірте налаштування BIOS і встановлення апаратного забезпечення.
7. Тестуйте GPU в іншому слоті PCIe:
Якщо відеокарта не виявлена або продовжує мати проблеми з продуктивністю, спробуйте встановити її в інший вільний слот PCIe.
- Вимкніть сервер і від'єднайте кабелі живлення.
- Видаліть відеокарту з поточного PCIe-слота.
- Встановіть відеокарту в інший підтримуваний слот PCIe.
- Підключіть живлення та живлення системи.
- Перевірте, чи виявляється GPU за допомогою команди
nvidia-smiабо з апаратного арсеналу iDRAC.
Якщо GPU виявлено в іншому слоті, оригінальний слот PCIe може мати проблему з конфігурацією або апаратним забезпеченням.
8. Запустіть діагностичний тест GPU:
Запустіть діагностичний інструмент NVIDIA Data Center GPU Manager (DCGM), щоб перевірити стан GPU Nvidia та виявити потенційні апаратні або теплові проблеми.
- Доступ до операційної системи через SSH або консоль.
- Виконайте таку команду для проведення розширеного діагностичного тесту GPU:
sudo dcgmi diag
Ця команда виконує комплексний діагностичний тест, який перевіряє пам'ять GPU, підключення PCIe та теплову поведінку. Перегляньте результати, щоб виявити будь-які проблеми з апаратним забезпеченням або продуктивністю.