「PowerEdge:GPUサーマル スロットルまたはGPUが検出されない問題

Summary: この記事では、Dell PowerEdgeサーバーでのGPUサーマル スロットルとGPU非検出の問題のトラブルシューティングについて説明します。これらの問題は、温度条件、ハードウェア構成の問題、またはシステム構成設定が原因で発生する可能性があります。

This article applies to This article does not apply to This article is not tied to any specific product. Not all product versions are identified in this article.

Symptoms

 

  • ワークロードが高い場合、GPUのパフォーマンスが低下します。
  • GPUクロック スピードは、ハードウェアを保護するために自動的に低下します。
  • 負荷の高いワークロード中にGPUの温度が高くなる。
  • システム イベント ログ(SEL)に、システムの吸気口温度に関連する警告が表示されます。
  • GPUがオペレーティング システムまたは管理ツールに表示されない。
  • コマンド nvidia-smi GPUデバイスは表示されません。
  • iDRACまたはBIOSが取り付けられているGPUを検出しません。

Cause

  • データ センターの周囲温度が高い
  • サーバー ラック内のエアフローが不十分であるか、吸気口がふさがれている
  • ファン プロファイルまたは温度ポリシー設定が正しくない
  • GPUがPCIeスロットに正しく装着されていない
  • サポートされていないGPU構成またはファームウェアの不整合
  • BIOS、iDRAC、GPUファームウェアが古い
  • GPUモジュールの電源またはケーブル接続の問題

Resolution

1.GPUの温度とスロットルのステータスを確認します。

オペレーティング システムで次のコマンドを実行して、NVIDIA GPUのGPUパフォーマンスとスロットル ステータスを確認します。

nvidia-smi -q -d performance

スロットルの理由が「非アクティブ」と表示されている場合、GPUは正常に動作しています。

 

2.システム温度の監視:

  • iDRACでシステム イベント ログ(SEL)を確認します。
  • 温度に関する警告については、ライフサイクル ログを確認してください。
  • [Temperature Overview]セクションで[System Inlet Temperature]を確認します。

 

3.冷却条件の改善:

  • データセンターの周囲温度がサポートされている制限内であることを確認します。
  • ラック内のエアフローの遮断を取り除きます。
  • すべてのシステム ファンが正常に機能していることを確認します。
  • 適切なエアフロー カバーとGPU冷却キットを使用します。

 

4.GPUハードウェアの取り付けの確認:

  • GPUがPCIeスロットに適切に装着されていることを確認します。
  • GPUの電源ケーブルとコネクターを確認します。
  • GPUがサーバー プラットフォームでサポートされていることを確認します。

 

5.システム ファームウェアのアップデート:

  • サーバーBIOSをアップデートします。
  • iDRACファームウェアをアップデートします。
  • GPUドライバーとファームウェアをアップデートします。

 

6.GPU検出の確認:

次のコマンドを使用して、Nvidia GPUがシステムで検出されているかどうかを確認します。

nvidia-smi

GPUが検出されない場合は、BIOS設定とハードウェアの取り付けを確認してください。

 

7.別のPCIeスロットでGPUをテストします。

GPUが検出されない場合、またはパフォーマンスの問題が引き続き発生する場合は、別の使用可能なPCIeスロットにGPUを取り付けてみてください。

  • サーバーの電源を切り、電源ケーブルを外します。
  • 現在のPCIeスロットからGPUを取り外します。
  • サポートされている別のPCIeスロットにGPUを取り付けます。
  • 電源を再接続し、システムの電源を入れます。
  • コマンドを使用してGPUが検出されているかどうかを確認します nvidia-smi またはiDRACハードウェア インベントリーから。

GPUが別のスロットで検出された場合は、元のPCIeスロットに構成またはハードウェアの問題がある可能性があります。

 

8.GPU診断テストを実行します。

NVIDIA Data Center GPU Manager (DCGM)診断ツールを実行して、NVIDIA GPUの正常性を確認し、潜在的なハードウェアまたは熱の問題を検出します。

  1. SSHまたはコンソールを介してオペレーティング システムにアクセスします。
  2. 次のコマンドを実行して、拡張GPU診断テストを実行します。
sudo dcgmi diag

このコマンドは、GPUメモリー、PCIe接続、および熱挙動をチェックする包括的な診断テストを実行します。出力を確認して、ハードウェアまたはパフォーマンス関連の問題を特定します。

Affected Products

C Series, Rack Servers, XE Servers
Article Properties
Article Number: 000458921
Article Type: Solution
Last Modified: 01 May 2026
Version:  1
Find answers to your questions from other Dell users
Support Services
Check if your device is covered by Support Services.