PowerEdge: продуктивність NAMD на R740 з GPU Volta
概要: GPU PowerEdge R740, NAMD, NVIDIA V100-PCIe, HPC, Високопродуктивні обчислення, HPC та Лабораторія інновацій у штучному інтелекті, продуктивність
手順
Щоб скористатися прискоренням GPU, потрібна CUDA-збірка для NAMD. Інструкції щодо компіляції NAMD з підтримкою CUDA можна знайти тут
У цій статті ми обговоримо продуктивність NAMD з останньою Volta GPU V100-32GB від NVIDIA на одному сервері Dell EMC PowerEdge R740.
PowerEdge R740 — це 2U сервер з двома сокетами та процесорами Intel Skylake. Він може бути налаштований на підтримку до 3 GPU з подвійною шириною та високошвидкісного мережевого адаптера.
Таблиця 1 містить інформацію про конфігурацію апаратного забезпечення та деталі застосування для тестів. Для цього тесту була скомпільована нічна версія NAMD від 17.08.2018.
Таблиця 1 Деталі конфігурації апаратного та програмного забезпечення
| Сервер | PowerEdge R740 |
| Процесор | 2 * Intel Xeon 6148 - 20-ядерний процесор @ 2.4 ГГц |
| Пам’ять | 192 GB @ 2666 MT/s |
| графічний процесор; | 3 * NVIDIA Volta V100-PCIe (32 GB) |
| Джерело живлення | 2*1600 W |
| Операційна система | Ядро RHEL 7.4
: 3.10.0-693.el7.x86_64 |
| Опції BIOS | Профіль системи - Продуктивність
Логічний процесор - Вимкнено Турбо-режим - Увімкнено |
| Версія та драйвер CUDA | CUDA 9.2 (396.26) |
| NAMD | Git-2018-08-17_Source (версія Nightly Build), багатоядерна збірка |
| Компілятор | Intel 2018 u3 |
Результати продуктивності
NAMD тестували на трьох різних наборах даних: ApoA1, F1ATPase та STMV, які складаються з 92 K, 327 K та 1066k атомів відповідно. Apoa1 — це менший набір даних порівняно з F1ATPазою та STMV. Показник продуктивності тут — «ns/days». Дані, наведені в цьому розділі, базуються на середньому показникі 10 тестів.
Рисунок 1 показує продуктивність NAMD з процесором і кількома GPU на трьох наборах даних. Були виконані інструкції з сайту Intel для компіляції NAMD для процесорів Intel Xeon. Покращення продуктивності від CPU до GPU відзначено на графіку нижче.
Рисунок 1 Продуктивність NAMD на процесорах і GPU
- Продуктивність залежить від результатів Dual-CPU у різних наборах даних.
- GPU-версії NAMD забезпечують швидкість до 11,2x порівняно з версією процесора для всіх трьох наборів даних.
- Додаткове зростання продуктивності на 23%-33% було зафіксовано при додаванні другої відеокарти. Спостерігалося більш скромне 6-9% від двох GPU до трьох тестів GPU.
NAMD також тестували з різною кількістю ядер процесорів у 1, 2 та 3 GPU, щоб визначити мінімальну кількість ядер CPU, необхідну для найкращої продуктивності.
Рисунок 2: продуктивність STMV з різною кількістю ядер процесора та GPU
- Як видно на рисунку 2, надмірна кількість ядер процесора негативно впливає на продуктивність, і продуктивність покращується зі збільшенням кількості ядер
- Тестування однієї версії V100 з 20+ ядрами процесора показало хорошу продуктивність. При використанні понад 20 ядер є додаткова перевага у продуктивності 2-3%.
- Цей тест також проводився на двох інших наборах даних — ApoA1 та F1ATPase. Подібна поведінка у виконанні спостерігалася у них.
Резюме
Тут представлені результати продуктивності NAMD на серверах Dell EMC PowerEdge R740 та відеокартах NVIDIA Volta V100-32GB. Існує ~6.6x-11.2x прискорення при тестах лише CPU при використанні GPU. Сервер R740 з трьома картами V100 забезпечує найкращу продуктивність, тоді як R740 з двома картами V100 знаходиться в межах 91% від конфігурації трьох GPU. Якщо є обмеження бюджету, одна відеокарта на R740 буде хорошим вибором, оскільки вона дає до 8 разів прискорення порівняно з процесором. Також проводилися тести з різними ядрами CPU та GPU, і ми помітили, що використання надто малої кількості ядер CPU (менше 20 ядер у наших тестах) знижує продуктивність NAMD під час тестів GPU.