「PowerEdge:GPUサーマル スロットルまたはGPUが検出されない問題
Summary: この記事では、Dell PowerEdgeサーバーでのGPUサーマル スロットルとGPU非検出の問題のトラブルシューティングについて説明します。これらの問題は、温度条件、ハードウェア構成の問題、またはシステム構成設定が原因で発生する可能性があります。
This article applies to
This article does not apply to
This article is not tied to any specific product.
Not all product versions are identified in this article.
Symptoms
- ワークロードが高い場合、GPUのパフォーマンスが低下します。
- GPUクロック スピードは、ハードウェアを保護するために自動的に低下します。
- 負荷の高いワークロード中にGPUの温度が高くなる。
- システム イベント ログ(SEL)に、システムの吸気口温度に関連する警告が表示されます。
- GPUがオペレーティング システムまたは管理ツールに表示されない。
- コマンド
nvidia-smiGPUデバイスは表示されません。 - iDRACまたはBIOSが取り付けられているGPUを検出しません。
Cause
- データ センターの周囲温度が高い
- サーバー ラック内のエアフローが不十分であるか、吸気口がふさがれている
- ファン プロファイルまたは温度ポリシー設定が正しくない
- GPUがPCIeスロットに正しく装着されていない
- サポートされていないGPU構成またはファームウェアの不整合
- BIOS、iDRAC、GPUファームウェアが古い
- GPUモジュールの電源またはケーブル接続の問題
Resolution
1.GPUの温度とスロットルのステータスを確認します。
オペレーティング システムで次のコマンドを実行して、NVIDIA GPUのGPUパフォーマンスとスロットル ステータスを確認します。
nvidia-smi -q -d performance
スロットルの理由が「非アクティブ」と表示されている場合、GPUは正常に動作しています。
2.システム温度の監視:
- iDRACでシステム イベント ログ(SEL)を確認します。
- 温度に関する警告については、ライフサイクル ログを確認してください。
- [Temperature Overview]セクションで[System Inlet Temperature]を確認します。
3.冷却条件の改善:
- データセンターの周囲温度がサポートされている制限内であることを確認します。
- ラック内のエアフローの遮断を取り除きます。
- すべてのシステム ファンが正常に機能していることを確認します。
- 適切なエアフロー カバーとGPU冷却キットを使用します。
4.GPUハードウェアの取り付けの確認:
- GPUがPCIeスロットに適切に装着されていることを確認します。
- GPUの電源ケーブルとコネクターを確認します。
- GPUがサーバー プラットフォームでサポートされていることを確認します。
5.システム ファームウェアのアップデート:
- サーバーBIOSをアップデートします。
- iDRACファームウェアをアップデートします。
- GPUドライバーとファームウェアをアップデートします。
6.GPU検出の確認:
次のコマンドを使用して、Nvidia GPUがシステムで検出されているかどうかを確認します。
nvidia-smi
GPUが検出されない場合は、BIOS設定とハードウェアの取り付けを確認してください。
7.別のPCIeスロットでGPUをテストします。
GPUが検出されない場合、またはパフォーマンスの問題が引き続き発生する場合は、別の使用可能なPCIeスロットにGPUを取り付けてみてください。
- サーバーの電源を切り、電源ケーブルを外します。
- 現在のPCIeスロットからGPUを取り外します。
- サポートされている別のPCIeスロットにGPUを取り付けます。
- 電源を再接続し、システムの電源を入れます。
- コマンドを使用してGPUが検出されているかどうかを確認します
nvidia-smiまたはiDRACハードウェア インベントリーから。
GPUが別のスロットで検出された場合は、元のPCIeスロットに構成またはハードウェアの問題がある可能性があります。
8.GPU診断テストを実行します。
NVIDIA Data Center GPU Manager (DCGM)診断ツールを実行して、NVIDIA GPUの正常性を確認し、潜在的なハードウェアまたは熱の問題を検出します。
- SSHまたはコンソールを介してオペレーティング システムにアクセスします。
- 次のコマンドを実行して、拡張GPU診断テストを実行します。
sudo dcgmi diag
このコマンドは、GPUメモリー、PCIe接続、および熱挙動をチェックする包括的な診断テストを実行します。出力を確認して、ハードウェアまたはパフォーマンス関連の問題を特定します。
Affected Products
C Series, Rack Servers, XE ServersArticle Properties
Article Number: 000458921
Article Type: Solution
Last Modified: 01 May 2026
Version: 1
Find answers to your questions from other Dell users
Support Services
Check if your device is covered by Support Services.