PowerEdge: производительность NAMD на R740 с графическими процессорами Volta
Сводка: PowerEdge R740, NAMD, графические процессоры NVIDIA V100-PCIe, HPC, высокопроизводительные вычисления, HPC и ИИ Innovation Lab, производительность
Инструкции
Чтобы воспользоваться преимуществами ускорения графического процессора, требуется сборка CUDA для NAMD. Инструкции по компиляции NAMD с поддержкой CUDA можно найти здесь
В этой статье мы обсудим производительность NAMD с новейшим графическим процессором NVIDIA Volta V100-32 Гбайт на одном сервере Dell EMC PowerEdge R740.
PowerEdge R740 — это двухпроцессорный сервер форм-фактора 2U с процессорами Intel Skylake. Его можно настроить для поддержки до 3 графических процессоров двойной ширины и высокоскоростного сетевого адаптера.
В таблице 1 приведены сведения о конфигурации оборудования и сведениях о приложениях, используемых для тестов. Для этого теста от 17.08.2018 была скомпилирована ночная сборка NAMD.
Таблица 1. Сведения о конфигурации оборудования и программного обеспечения
| Server | PowerEdge R740 |
| Процессор | 2 * Intel Xeon 6148 - 20-ядерный процессор @ 2.4 ГГц |
| Память | 192 ГБ @ 2666 МТ/с |
| Графический процессор | 3 * NVIDIA Volta V100-PCIe (32 Гбайт) |
| Блок питания | 2 * 1600 Вт |
| Операционная система | Ядро RHEL 7.4
: 3.10.0-693.el7.x86_64 |
| Параметры BIOS | Профиль системы — производительность
логического процессора — отключено , режим Turbo — включен |
| Версия и драйвер CUDA | КУДА 9.2 (396.26) |
| NAMD | Git-2018-08-17_Source (версия Nightly Build), многоядерная сборка |
| Компилятора | Intel U3 2018 г. |
Показатели производительности
NAMD был протестирован с тремя различными наборами данных: ApoA1, F1ATPase и STMV, которые состоят из 92 K, 327 K и 1066 K атомов соответственно. Apoa1 — это меньший набор данных по сравнению с F1ATPase и STMV. Метрика производительности в данном случае равна нс/дням. Данные, показанные в этом разделе, основаны на среднем значении 10 тестов.
На рис. 1 показана производительность NAMD при использовании ЦП и нескольких графических процессоров в трех наборах данных. При компиляции NAMD для процессоров Intel Xeon использовались инструкции с веб-сайта Intel. Улучшение производительности при переходе от ЦП к графическим процессорам показано на графике ниже.
Рис. 1 Производительность NAMD на ЦП и графических процессорах
- Производительность зависит от результатов для двух процессоров в различных наборах данных.
- Версии NAMD для графических процессоров обеспечивают ускорение до 11,2 раза по сравнению с версией ЦП для всех трех наборов данных.
- При добавлении второй платы графического процессора производительность увеличилась еще на 23–33%. Более скромные 6-9% наблюдались от двух тестов GPU до трех GPU.
Технология NAMD также была протестирована с различным количеством ядер ЦП на 1, 2 и 3 графических процессорах, чтобы определить минимальное количество ядер ЦП, необходимое для достижения наилучшей производительности.
Рис. 2 Производительность STMV с различным количеством ядер ЦП и графическими процессорами
- Как показано на рис. 2, использование слишком малого количества ядер ЦП отрицательно сказывается на производительности, а производительность повышается с увеличением числа ядер
- Тестирование одного V100 с 20+ ядрами процессора показало хорошую производительность. При использовании более 20 ядер мы получаем дополнительный выигрыш в производительности на 2–3%.
- Этот тест также был проведен на двух других наборах данных ApoA1 и F1ATPase. Аналогичное поведение производительности наблюдалось и у них.
Резюме
Здесь представлены результаты производительности NAMD на серверах Dell EMC PowerEdge R740 и графических процессорах NVIDIA Volta V100-32 Гбайт. При использовании графических процессоров скорость увеличивается в ~6,6–11,2 раза по сравнению с тестами только ЦП. Сервер R740 с 3 платами V100 обеспечивает наилучшую производительность, в то время как R740 с 2 платами V100 находится в пределах 91% от конфигурации с тремя графическими процессорами. Если есть бюджетные ограничения, один графический процессор на R740 будет хорошим выбором, поскольку он дает до 8-кратного ускорения по сравнению с центральным процессором. Также были проведены тесты с различными ядрами ЦП и графическими процессорами, и мы заметили, что использование слишком малого количества ядер ЦП (менее 20 ядер в наших тестах) снижает производительность NAMD в тестах графических процессоров.