PowerEdge: GPU 열 스로틀링 또는 GPU가 감지되지 않는 문제

Summary: 이 문서에서는 Dell PowerEdge 서버에서 GPU 열 스로틀링 및 GPU가 감지되지 않는 문제에 대한 문제 해결 지침을 제공합니다. 이러한 문제는 온도 조건, 하드웨어 구성 문제 또는 시스템 구성 설정으로 인해 발생할 수 있습니다.

This article applies to This article does not apply to This article is not tied to any specific product. Not all product versions are identified in this article.

Symptoms

 

  • 워크로드가 많을 때는 GPU 성능이 저하됩니다.
  • 하드웨어를 보호하기 위해 GPU 클록 속도가 자동으로 떨어집니다.
  • 스트레스 워크로드 중에 GPU 온도가 높은 값에 도달합니다.
  • SEL(System Event Log)에는 시스템 유입 온도와 관련된 경고가 표시됩니다.
  • GPU가 운영 체제 또는 관리 툴에 표시되지 않습니다.
  • 이 상태에서는 다음 명령을 실행할 경우 nvidia-smi 에는 GPU 장치가 표시되지 않습니다.
  • iDRAC 또는 BIOS가 설치된 GPU를 감지하지 못합니다.

Cause

  • 높은 주위 온도
  • 서버 랙의 공기 흐름이 충분하지 않거나 공기 흡입구가 막혔습니다.
  • 잘못된 팬 프로파일 또는 열 정책 설정
  • GPU가 PCIe 슬롯에 올바르게 장착되지 않음
  • 지원되지 않는 GPU 구성 또는 펌웨어 불일치
  • 오래된 BIOS, iDRAC 또는 GPU 펌웨어
  • GPU 모듈의 전원 또는 케이블 연결 문제

Resolution

1. GPU 온도 및 스로틀 상태를 확인합니다.

운영 체제에서 다음 명령을 실행하여 Nvidia GPU의 GPU 성능 및 스로틀링 상태를 확인합니다.

nvidia-smi -q -d performance

스로틀 이유가 "활성화되지 않음"으로 표시되면 GPU가 정상적으로 작동하는 것입니다.

 

2. 시스템 온도 모니터링:

  • iDRAC에서 SEL(System Event Log)을 확인합니다.
  • Lifecycle Log에서 온도 경고를 검토합니다.
  • 온도 개요 섹션에서 시스템 유입 온도를 확인합니다.

 

3. 냉각 조건 개선:

  • 데이터 센터 주변 온도가 지원되는 제한 범위 내에 있는지 확인합니다.
  • 랙의 공기 흐름 막힘을 제거합니다.
  • 모든 시스템 팬이 올바르게 작동하는지 확인합니다.
  • 적절한 공기 흐름판과 GPU 냉각 키트를 사용합니다.

 

4. GPU 하드웨어 설치 확인:

  • GPU가 PCIe 슬롯에 올바르게 장착되었는지 확인합니다.
  • GPU 전원 케이블 및 커넥터를 확인합니다.
  • GPU가 서버 플랫폼에서 지원되는지 확인합니다.

 

5. 시스템 펌웨어 업데이트:

  • 서버 BIOS를 업데이트합니다.
  • iDRAC 펌웨어를 업데이트합니다.
  • GPU 드라이버 및 펌웨어를 업데이트합니다.

 

6. GPU 감지 확인:

다음 명령을 사용하여 시스템에서 Nvidia GPU를 감지하는지 확인합니다.

nvidia-smi

GPU가 감지되지 않는 경우 BIOS 설정 및 하드웨어 설치를 확인합니다.

 

7. 다른 PCIe 슬롯에서 GPU 테스트:

GPU가 감지되지 않거나 성능 문제가 계속 발생하는 경우 사용 가능한 다른 PCIe 슬롯에 GPU를 설치해 보십시오.

  • 서버 전원을 끄고 전원 케이블을 뽑습니다.
  • 현재 PCIe 슬롯에서 GPU를 제거합니다.
  • 지원되는 다른 PCIe 슬롯에 GPU를 설치합니다.
  • 전원을 다시 연결하고 시스템의 전원을 켭니다.
  • 다음 명령을 사용하여 GPU가 감지되는지 확인합니다. nvidia-smi 또는 iDRAC 하드웨어 인벤토리에서 가져올 수 있습니다.

GPU가 다른 슬롯에서 감지되는 경우 원래 PCIe 슬롯에 구성 또는 하드웨어 문제가 있을 수 있습니다.

 

8. GPU 진단 테스트 실행:

NVIDIA DCGM(Data Center GPU Manager) 진단 툴을 실행하여 NVIDIA GPU 상태를 확인하고 잠재적인 하드웨어 또는 열 문제를 감지합니다.

  1. SSH 또는 콘솔을 통해 운영 체제에 액세스합니다.
  2. 다음 명령을 실행하여 확장 GPU 진단 테스트를 수행합니다.
sudo dcgmi diag

이 명령은 GPU 메모리, PCIe 연결 및 열 동작을 확인하는 포괄적인 진단 테스트를 수행합니다. 출력을 검토하여 하드웨어 또는 성능 관련 문제가 있는지 확인합니다.

Affected Products

C Series, Rack Servers, XE Servers
Article Properties
Article Number: 000458921
Article Type: Solution
Last Modified: 01 May 2026
Version:  1
Find answers to your questions from other Dell users
Support Services
Check if your device is covered by Support Services.