PowerEdge:使用 Volta GPU 的 R740 上的 NAMD 性能
摘要: PowerEdge R740, NAMD, NVIDIA V100-PCIe GPU, HPC, 高性能计算, HPC 和 AI 创新实验室, 性能
说明
要从 GPU 加速中受益,需要 NAMD 的 CUDA 内部版本。有关使用 CUDA 支持编译 NAMD 的说明,请参阅 此处
在本文中,我们将讨论在单个 Dell EMC PowerEdge R740 服务器中使用 NVIDIA 最新 Volta GPU V100-32GB 的 NAMD 性能。
PowerEdge R740 是一款配备英特尔 Skylake 处理器的 2U 双路服务器。它可以配置为支持多达 3 个双宽 GPU 和一个高速网络适配器。
表 1 显示有关用于测试的硬件配置和应用程序详细信息。针对此测试编译了 NAMD 的夜间内部版本,测试日期为 2018 年 8 月 17 日。
表 1 硬件和软件配置详情
| 服务器 | PowerEdge R740 |
| 处理器 | 2 个英特尔至强 6148 - 20 核处理器 @ 2.4 GHz |
| 内存 | 192 GB @ 2666 MT/s |
| GPU | 3 个 NVIDIA Volta V100-PCIe (32 GB) |
| 电源 | 2*1600 W |
| 操作系统 | RHEL 7.4
内核:3.10.0-693.el7.x86_64 |
| BIOS 选项 | 系统配置文件 - 性能
逻辑处理器 - 已禁用 Turbo 模式 - 已启用 |
| CUDA 版本和驱动程序 | CUDA 9.2 (396.26) |
| NAMD | Git-2018-08-17_Source(夜间构建版本),多核构建 |
| 编译器 | 英特尔 2018 u3 |
性能结果
NAMD 使用三个不同的数据集进行了测试:ApoA1、F1ATP 酶和 STMV,分别由 92 K、327 K 和 1066k 原子组成。与 F1ATPase 和 STMV 相比,Apoa1 是一个更小的数据集。此处的性能指标是“ns/days”。本部分中显示的数据基于 10 次测试的平均值。
图 1 显示了在三个数据集上使用 CPU 和多个 GPU 时的 NAMD 性能。按照英特尔至强 处理器 的说明编写了英特尔至强处理器的 NAMD。下图记录了从 CPU 到 GPU 的性能改进。
图 1 CPU 和 GPU 上的 NAMD 性能
- 性能相对于不同数据集中的双 CPU 结果。
- 与所有三个数据集的 CPU 版本相比,NAMD 的 GPU 版本可将速度提高多达 11.2 倍。
- 添加第二张 GPU 卡时,性能额外提高了 23%-33%。在两个 GPU 到三个 GPU 测试中,观察到的比例为 6-9%。
我们还在 1、2 和 3 个 GPU 中使用不同数量的 CPU 核心对 NAMD 进行了测试,以确定实现最佳性能所需的最小 CPU 核心数。
图 2 不同 CPU 核心计数和 GPU 下的 STMV 性能
- 如图 2 所示,使用太少的 CPU 核心会对性能产生负面影响,并且随着我们增加核心数量,性能会有所提高
- 测试一个具有 20+ 个 CPU 核心的 V100 取得了良好的性能。当我们使用 20 个以上的核心时,性能会额外获得 2-3% 的优势。
- 该测试也对其他两个数据集 ApoA1 和 F1ATPase 进行了。在它们身上观察到类似的性能行为。
摘要
此处介绍了 Dell EMC PowerEdge R740 服务器和 NVIDIA Volta V100-32GB GPU 的 NAMD 性能结果。使用 GPU 时,与仅 CPU 的测试相比,速度可提高 ~6.6 倍至 11.2 倍。带有 3 个 V100 卡的 R740 服务器提供最佳性能,而带有 2 个 V100 卡的 R740 在三个 GPU 配置的 91% 以内。如果预算有限,每台 R740 一个 GPU 将是一个不错的选择,因为与 CPU 相比,它最多可将速度提升 8 倍。我们还使用不同的 CPU 核心和 GPU 进行了测试,我们注意到使用太少的 CPU 核心(在我们的测试中少于 20 个核心)会降低 GPU 测试中的 NAMD 性能。