PowerEdge: Ograniczanie wydajności procesora GPU lub problemy z niewykryciem procesora graficznego
Summary: Ten artykuł zawiera wskazówki dotyczące rozwiązywania problemów z ograniczaniem wydajności termicznej i niewykrytymi procesorami graficznymi na serwerach Dell PowerEdge. Problemy te mogą wystąpić z powodu temperatury, problemów z konfiguracją sprzętu lub ustawień konfiguracji systemu. ...
Symptoms
- Wydajność procesora GPU jest mniejsza przy dużym obciążeniu roboczym.
- Szybkość zegara GPU spada automatycznie, aby chronić sprzęt.
- Temperatura GPU osiąga wysokie wartości podczas obciążeń roboczych.
- Rejestr zdarzeń systemu (SEL) zawiera ostrzeżenia dotyczące temperatury systemu przy wlocie do komputera.
- Procesor GPU nie pojawia się w systemie operacyjnym ani w narzędziach do zarządzania.
- Polecenie
nvidia-sminie pokazuje żadnego urządzenia GPU. - Kontroler iDRAC lub system BIOS nie wykrywa zainstalowanej karty graficznej.
Cause
- Wysoka temperatura otoczenia w centrum przetwarzania danych
- Niewystarczający przepływ powietrza lub zablokowany wlot powietrza do szafy serwerowej
- Nieprawidłowy profil wentylatora lub ustawienia zasad dotyczących temperatury
- Karta GPU nie jest prawidłowo osadzona w gnieździe PCIe
- Nieobsługiwana konfiguracja GPU lub niezgodność oprogramowania wewnętrznego
- Nieaktualne oprogramowanie wewnętrzne systemu BIOS, kontrolera iDRAC lub karty graficznej
- Problemy z zasilaniem lub połączeniem przewodowym modułów GPU
Resolution
1. Sprawdź temperaturę karty graficznej i stan ograniczenia:
Uruchom następujące polecenie w systemie operacyjnym, aby sprawdzić wydajność karty graficznej i ograniczyć wydajność procesorów graficznych Nvidia:
nvidia-smi -q -d performance
Jeśli przyczyny ograniczenia przepustowości są wyświetlane jako "Nieaktywne", procesor graficzny działa normalnie.
2. Monitorowanie temperatury systemu:
- Sprawdź dziennik zdarzeń systemu (SEL) w kontrolerze iDRAC.
- Przejrzyj dziennik cyklu eksploatacji pod kątem ostrzeżeń dotyczących temperatury.
- Sprawdź temperaturę systemu przy wlocie w sekcji Przegląd temperatury.
3. Popraw warunki chłodzenia:
- Upewnij się, że temperatura otoczenia centrum danych mieści się w obsługiwanych limitach.
- Usuń blokady przepływu powietrza w szafie serwerowej.
- Sprawdź, czy wszystkie wentylatory systemowe działają prawidłowo.
- Należy stosować odpowiednie osłony wentylacyjne i zestawy do chłodzenia karty graficznej.
4. Weryfikacja instalacji sprzętu GPU:
- Upewnij się, że karta graficzna jest prawidłowo osadzona w gnieździe PCIe.
- Sprawdź kable i złącza zasilania karty graficznej.
- Upewnij się, że procesor GPU jest obsługiwany na platformie serwera.
5. Zaktualizuj oprogramowanie wewnętrzne systemu:
- Zaktualizuj system BIOS serwera.
- Zaktualizuj oprogramowanie wewnętrzne kontrolera iDRAC.
- Zaktualizuj sterowniki i oprogramowanie wewnętrzne karty graficznej.
6. Weryfikacja wykrywania GPU:
Użyj następującego polecenia, aby sprawdzić, czy procesor graficzny Nvidia został wykryty przez system:
nvidia-smi
Jeśli procesor graficzny nie został wykryty, sprawdź ustawienia systemu BIOS i instalację sprzętu.
7. Przetestuj procesor graficzny w innym gnieździe PCIe:
Jeśli procesor graficzny nie został wykryty lub nadal występują problemy z wydajnością, spróbuj zainstalować procesor w innym dostępnym gnieździe PCIe.
- Wyłącz serwer i odłącz kable zasilające.
- Wyjmij kartę graficzną z bieżącego gniazda PCIe.
- Zainstaluj kartę graficzną w innym obsługiwanym gnieździe PCIe.
- Podłącz ponownie zasilanie i włącz system.
- Sprawdź, czy procesor graficzny został wykryty przy użyciu polecenia
nvidia-smilub z zasobów sprzętu kontrolera iDRAC.
Jeśli procesor graficzny zostanie wykryty w innym gnieździe, może to oznaczać problem z konfiguracją lub sprzętem w oryginalnym gnieździe PCIe.
8. Uruchom test diagnostyczny procesora GPU:
Uruchom narzędzie diagnostyczne NVIDIA Data Center GPU Manager (DCGM), aby zweryfikować stan karty graficznej NVIDIA i wykryć potencjalne problemy ze sprzętem lub temperaturą.
- Dostęp do systemu operacyjnego odbywa się przez SSH lub konsolę.
- Uruchom następujące polecenie, aby przeprowadzić rozszerzony test diagnostyczny procesora graficznego:
sudo dcgmi diag
To polecenie wykonuje kompleksowy test diagnostyczny, który sprawdza pamięć GPU, łączność PCIe i zachowanie temperatury. Przejrzyj dane wyjściowe, aby zidentyfikować ewentualne problemy związane ze sprzętem lub wydajnością.