PowerEdge: Ograniczanie wydajności procesora GPU lub problemy z niewykryciem procesora graficznego

Zusammenfassung: Ten artykuł zawiera wskazówki dotyczące rozwiązywania problemów z ograniczaniem wydajności termicznej i niewykrytymi procesorami graficznymi na serwerach Dell PowerEdge. Problemy te mogą wystąpić z powodu temperatury, problemów z konfiguracją sprzętu lub ustawień konfiguracji systemu. ...

Dieser Artikel gilt für Dieser Artikel gilt nicht für Dieser Artikel ist nicht an ein bestimmtes Produkt gebunden. In diesem Artikel werden nicht alle Produktversionen aufgeführt.

Symptome

 

  • Wydajność procesora GPU jest mniejsza przy dużym obciążeniu roboczym.
  • Szybkość zegara GPU spada automatycznie, aby chronić sprzęt.
  • Temperatura GPU osiąga wysokie wartości podczas obciążeń roboczych.
  • Rejestr zdarzeń systemu (SEL) zawiera ostrzeżenia dotyczące temperatury systemu przy wlocie do komputera.
  • Procesor GPU nie pojawia się w systemie operacyjnym ani w narzędziach do zarządzania.
  • Polecenie nvidia-smi nie pokazuje żadnego urządzenia GPU.
  • Kontroler iDRAC lub system BIOS nie wykrywa zainstalowanej karty graficznej.

Ursache

  • Wysoka temperatura otoczenia w centrum przetwarzania danych
  • Niewystarczający przepływ powietrza lub zablokowany wlot powietrza do szafy serwerowej
  • Nieprawidłowy profil wentylatora lub ustawienia zasad dotyczących temperatury
  • Karta GPU nie jest prawidłowo osadzona w gnieździe PCIe
  • Nieobsługiwana konfiguracja GPU lub niezgodność oprogramowania wewnętrznego
  • Nieaktualne oprogramowanie wewnętrzne systemu BIOS, kontrolera iDRAC lub karty graficznej
  • Problemy z zasilaniem lub połączeniem przewodowym modułów GPU

Lösung

1. Sprawdź temperaturę karty graficznej i stan ograniczenia:

Uruchom następujące polecenie w systemie operacyjnym, aby sprawdzić wydajność karty graficznej i ograniczyć wydajność procesorów graficznych Nvidia:

nvidia-smi -q -d performance

Jeśli przyczyny ograniczenia przepustowości są wyświetlane jako "Nieaktywne", procesor graficzny działa normalnie.

 

2. Monitorowanie temperatury systemu:

  • Sprawdź dziennik zdarzeń systemu (SEL) w kontrolerze iDRAC.
  • Przejrzyj dziennik cyklu eksploatacji pod kątem ostrzeżeń dotyczących temperatury.
  • Sprawdź temperaturę systemu przy wlocie w sekcji Przegląd temperatury.

 

3. Popraw warunki chłodzenia:

  • Upewnij się, że temperatura otoczenia centrum danych mieści się w obsługiwanych limitach.
  • Usuń blokady przepływu powietrza w szafie serwerowej.
  • Sprawdź, czy wszystkie wentylatory systemowe działają prawidłowo.
  • Należy stosować odpowiednie osłony wentylacyjne i zestawy do chłodzenia karty graficznej.

 

4. Weryfikacja instalacji sprzętu GPU:

  • Upewnij się, że karta graficzna jest prawidłowo osadzona w gnieździe PCIe.
  • Sprawdź kable i złącza zasilania karty graficznej.
  • Upewnij się, że procesor GPU jest obsługiwany na platformie serwera.

 

5. Zaktualizuj oprogramowanie wewnętrzne systemu:

  • Zaktualizuj system BIOS serwera.
  • Zaktualizuj oprogramowanie wewnętrzne kontrolera iDRAC.
  • Zaktualizuj sterowniki i oprogramowanie wewnętrzne karty graficznej.

 

6. Weryfikacja wykrywania GPU:

Użyj następującego polecenia, aby sprawdzić, czy procesor graficzny Nvidia został wykryty przez system:

nvidia-smi

Jeśli procesor graficzny nie został wykryty, sprawdź ustawienia systemu BIOS i instalację sprzętu.

 

7. Przetestuj procesor graficzny w innym gnieździe PCIe:

Jeśli procesor graficzny nie został wykryty lub nadal występują problemy z wydajnością, spróbuj zainstalować procesor w innym dostępnym gnieździe PCIe.

  • Wyłącz serwer i odłącz kable zasilające.
  • Wyjmij kartę graficzną z bieżącego gniazda PCIe.
  • Zainstaluj kartę graficzną w innym obsługiwanym gnieździe PCIe.
  • Podłącz ponownie zasilanie i włącz system.
  • Sprawdź, czy procesor graficzny został wykryty przy użyciu polecenia nvidia-smi lub z zasobów sprzętu kontrolera iDRAC.

Jeśli procesor graficzny zostanie wykryty w innym gnieździe, może to oznaczać problem z konfiguracją lub sprzętem w oryginalnym gnieździe PCIe.

 

8. Uruchom test diagnostyczny procesora GPU:

Uruchom narzędzie diagnostyczne NVIDIA Data Center GPU Manager (DCGM), aby zweryfikować stan karty graficznej NVIDIA i wykryć potencjalne problemy ze sprzętem lub temperaturą.

  1. Dostęp do systemu operacyjnego odbywa się przez SSH lub konsolę.
  2. Uruchom następujące polecenie, aby przeprowadzić rozszerzony test diagnostyczny procesora graficznego:
sudo dcgmi diag

To polecenie wykonuje kompleksowy test diagnostyczny, który sprawdza pamięć GPU, łączność PCIe i zachowanie temperatury. Przejrzyj dane wyjściowe, aby zidentyfikować ewentualne problemy związane ze sprzętem lub wydajnością.

Betroffene Produkte

C Series, Rack Servers, XE Servers
Artikeleigenschaften
Artikelnummer: 000458921
Artikeltyp: Solution
Zuletzt geändert: 01 Mai 2026
Version:  1
Antworten auf Ihre Fragen erhalten Sie von anderen Dell NutzerInnen
Support Services
Prüfen Sie, ob Ihr Gerät durch Support Services abgedeckt ist.