PowerEdge: Ograniczanie wydajności procesora GPU lub problemy z niewykryciem procesora graficznego

Summary: Ten artykuł zawiera wskazówki dotyczące rozwiązywania problemów z ograniczaniem wydajności termicznej i niewykrytymi procesorami graficznymi na serwerach Dell PowerEdge. Problemy te mogą wystąpić z powodu temperatury, problemów z konfiguracją sprzętu lub ustawień konfiguracji systemu. ...

This article applies to This article does not apply to This article is not tied to any specific product. Not all product versions are identified in this article.

Symptoms

 

  • Wydajność procesora GPU jest mniejsza przy dużym obciążeniu roboczym.
  • Szybkość zegara GPU spada automatycznie, aby chronić sprzęt.
  • Temperatura GPU osiąga wysokie wartości podczas obciążeń roboczych.
  • Rejestr zdarzeń systemu (SEL) zawiera ostrzeżenia dotyczące temperatury systemu przy wlocie do komputera.
  • Procesor GPU nie pojawia się w systemie operacyjnym ani w narzędziach do zarządzania.
  • Polecenie nvidia-smi nie pokazuje żadnego urządzenia GPU.
  • Kontroler iDRAC lub system BIOS nie wykrywa zainstalowanej karty graficznej.

Cause

  • Wysoka temperatura otoczenia w centrum przetwarzania danych
  • Niewystarczający przepływ powietrza lub zablokowany wlot powietrza do szafy serwerowej
  • Nieprawidłowy profil wentylatora lub ustawienia zasad dotyczących temperatury
  • Karta GPU nie jest prawidłowo osadzona w gnieździe PCIe
  • Nieobsługiwana konfiguracja GPU lub niezgodność oprogramowania wewnętrznego
  • Nieaktualne oprogramowanie wewnętrzne systemu BIOS, kontrolera iDRAC lub karty graficznej
  • Problemy z zasilaniem lub połączeniem przewodowym modułów GPU

Resolution

1. Sprawdź temperaturę karty graficznej i stan ograniczenia:

Uruchom następujące polecenie w systemie operacyjnym, aby sprawdzić wydajność karty graficznej i ograniczyć wydajność procesorów graficznych Nvidia:

nvidia-smi -q -d performance

Jeśli przyczyny ograniczenia przepustowości są wyświetlane jako "Nieaktywne", procesor graficzny działa normalnie.

 

2. Monitorowanie temperatury systemu:

  • Sprawdź dziennik zdarzeń systemu (SEL) w kontrolerze iDRAC.
  • Przejrzyj dziennik cyklu eksploatacji pod kątem ostrzeżeń dotyczących temperatury.
  • Sprawdź temperaturę systemu przy wlocie w sekcji Przegląd temperatury.

 

3. Popraw warunki chłodzenia:

  • Upewnij się, że temperatura otoczenia centrum danych mieści się w obsługiwanych limitach.
  • Usuń blokady przepływu powietrza w szafie serwerowej.
  • Sprawdź, czy wszystkie wentylatory systemowe działają prawidłowo.
  • Należy stosować odpowiednie osłony wentylacyjne i zestawy do chłodzenia karty graficznej.

 

4. Weryfikacja instalacji sprzętu GPU:

  • Upewnij się, że karta graficzna jest prawidłowo osadzona w gnieździe PCIe.
  • Sprawdź kable i złącza zasilania karty graficznej.
  • Upewnij się, że procesor GPU jest obsługiwany na platformie serwera.

 

5. Zaktualizuj oprogramowanie wewnętrzne systemu:

  • Zaktualizuj system BIOS serwera.
  • Zaktualizuj oprogramowanie wewnętrzne kontrolera iDRAC.
  • Zaktualizuj sterowniki i oprogramowanie wewnętrzne karty graficznej.

 

6. Weryfikacja wykrywania GPU:

Użyj następującego polecenia, aby sprawdzić, czy procesor graficzny Nvidia został wykryty przez system:

nvidia-smi

Jeśli procesor graficzny nie został wykryty, sprawdź ustawienia systemu BIOS i instalację sprzętu.

 

7. Przetestuj procesor graficzny w innym gnieździe PCIe:

Jeśli procesor graficzny nie został wykryty lub nadal występują problemy z wydajnością, spróbuj zainstalować procesor w innym dostępnym gnieździe PCIe.

  • Wyłącz serwer i odłącz kable zasilające.
  • Wyjmij kartę graficzną z bieżącego gniazda PCIe.
  • Zainstaluj kartę graficzną w innym obsługiwanym gnieździe PCIe.
  • Podłącz ponownie zasilanie i włącz system.
  • Sprawdź, czy procesor graficzny został wykryty przy użyciu polecenia nvidia-smi lub z zasobów sprzętu kontrolera iDRAC.

Jeśli procesor graficzny zostanie wykryty w innym gnieździe, może to oznaczać problem z konfiguracją lub sprzętem w oryginalnym gnieździe PCIe.

 

8. Uruchom test diagnostyczny procesora GPU:

Uruchom narzędzie diagnostyczne NVIDIA Data Center GPU Manager (DCGM), aby zweryfikować stan karty graficznej NVIDIA i wykryć potencjalne problemy ze sprzętem lub temperaturą.

  1. Dostęp do systemu operacyjnego odbywa się przez SSH lub konsolę.
  2. Uruchom następujące polecenie, aby przeprowadzić rozszerzony test diagnostyczny procesora graficznego:
sudo dcgmi diag

To polecenie wykonuje kompleksowy test diagnostyczny, który sprawdza pamięć GPU, łączność PCIe i zachowanie temperatury. Przejrzyj dane wyjściowe, aby zidentyfikować ewentualne problemy związane ze sprzętem lub wydajnością.

Affected Products

C Series, Rack Servers, XE Servers
Article Properties
Article Number: 000458921
Article Type: Solution
Last Modified: 01 May 2026
Version:  1
Find answers to your questions from other Dell users
Support Services
Check if your device is covered by Support Services.