PowerEdge: производительность HPC и ИИ на DSS8440 с графическими процессорами V100S
Сводка: В этом блоге представлены результаты исследования, в ходе которого оценивались 8x V100S на DSS8440 для различных приложений HPC и глубокого обучения, включая HPL, LAMPS и пакет MLPerf-v0.6. ...
Инструкции
Авторы: Фрэнк Хан (Frank Han), Ренган Сюй (Rengan Xu), Куи Та (Quy Ta
Alienware Innovation Lab) Dell EMC HPC and AI Innovation Lab, май 2020 г.
Краткий обзор
В этом блоге представлены результаты исследования, в ходе которого оценивались 8x V100S на DSS8440 для различных приложений HPC и глубокого обучения, включая HPL, LMPS и пакет MLPerf-v0.6 (External Link). Подводя итог,
- Приложения, ограниченные пропускной способностью графического процессора , такие как LAMMPS, могут воспользоваться преимуществами новых графических процессоров V100S и повысить производительность как для одного, так и для нескольких графических процессоров.
- Приложения глубинного обучения, такие как протестированные в MLPerf, получают преимущества от более высокой тактовой частоты и более высокой пропускной способности V100S.
- Приложения, использующие вычислительные ресурсы на графическом процессоре , такие как HPL в эталонном тесте HPC, получают такую же производительность, как и V100-PCIe.
В оставшейся части этого блога подробно описаны результаты тестирования. В будущем те же приложения будут запускаться на графических процессорах RTX DSS8440 (вместо V100S), а также будут проводиться другие тесты, такие как производительность V100S на платформе AMD.
Обзор испытательного стенда
Dell DSS8440 Server — это оптимизированный для ускорителей сервер, предназначенный для рабочих нагрузок, связанных с высокопроизводительными вычислениями и глубинным обучением. NVIDIA V100S (External Link) — новейший представитель серии Tesla Volta, представляющий собой видеокарту двойной ширины 32G PCIe на базе графического процессора. В этом блоге представлены результаты исследования, в ходе которого оценивались 8x V100S на DSS8440 для различных приложений HPC и глубокого обучения, включая HPL, LMPS и пакет MLPerf-v0.6 (External Link).
Сведения об аппаратном и программном обеспечении протестированного сервера DSS 8440, а также сравнение моделей V100S и V100-PCIe приведены в Таблице 1 и Таблице 2.
Таблица 1. Сведения о конфигурации оборудования и программном обеспечении
Таблица 2. Технические характеристики V100S и V100-PCIe
Производительность приложений HPC
Рисунок 1: Результаты V100S и V100-PCIe HPL на DSS8440
На рисунке 1 показаны показатели производительности HPL. Между V100S и V100-PCIe нет большой разницы, так как HPL является приложением для экстремальных стресс-тестов. Для функции ускорения графического процессора мало места для работы (внешняя ссылка), поэтому частота графических процессоров быстро снижается до базовой тактовой частоты. Поскольку V100S и V100-PCIe имеют почти одинаковую базовую тактовую частоту, для приложений, ограниченных вычислениями на графическом процессоре, таких как HPL, V100S обеспечивает примерно тот же уровень производительности, что и V100-PCIe.
Рис. 2. Результаты LAMMPS V100S и V100-PCIe на DSS8440
На рисунке 2 приведены результаты LAMMPS с набором данных Леннарда Джонса. LAMMPS является примером кода молекулярной динамики, который, как известно, является приложением с ограниченной полосой пропускания графического процессора. Производительность V100S на 27% выше, чем у V100-PCIe в этом тестировании. Ускорению способствует не только увеличение частоты разгона на 15% и увеличение пропускной способности на 26%, но и более новая версия программного обеспечения. Номера V100-PCIe были получены с помощью старого пакета KOKKOS в версии LAMMPS 8Feb2019. Однако в более новой версии от 24 января 2020 года была добавлена поддержка использования cuFFT на графическом процессоре с KOKKOS. Более подробную информацию можно найти в этом примечании к выпуску LAMMPS от 24 января 2020 г. (внешняя ссылка).
Производительность приложений глубинного обучения
Рис. 3. Результаты V100S и V100-PCIe MLPerf на DSS8440
Версия 0.6 для обучения в закрытом отделе MLPerf (внешняя ссылка) содержит шесть субтестов, охватывающих широкий спектр областей глубокого обучения, включая классификацию изображений (ResNet-50), обнаружение объектов (Mask R-CNN и SSD), трансляцию (NMT и Transformer) и обучение с подкреплением (MiniGo). Результаты сравнения обеих плат графического процессора приведены на рис. 3. Прирост производительности при использовании пакета MLPerf для систем V100S наблюдался примерно на 1–5%, что согласуется с увеличением пропускной способности в файлах журналов результатов на 1–5%. Отслеживалась выходная тактовая частота графического процессора в режиме реального времени, и было замечено, что графические процессоры V100S работали на 1-5% выше во всех этих тестах, поэтому выигрыш в производительности был получен за счет более высокой частоты повышения частоты V100S.
Выводы и планы на будущее
В этом блоге сравнивалось производительность приложений HPC с HPL, LAMMPS и производительность глубинного обучения с MLPerf и плат графических процессоров V100S и V100-PCIe на одном сервере DSS8440. Приложения, ограниченные пропускной способностью графического процессора, такие как LAMMPS, могут воспользоваться преимуществами новых графических процессоров V100S и получить повышенную производительность как для одного, так и для нескольких графических процессоров. Приложения глубинного обучения, протестированные в MLPerf, также получают преимущества от более высокой тактовой частоты и более высокой пропускной способности V100S. Эталонный тест HPL HPL, ограниченный вычислениями на базе графических процессоров, обеспечивает такую же производительность, как и V100-PCIe. В будущем те же приложения на DSS8440 будут работать с графическими процессорами RTX, а также будут изучены некоторые другие тесты, такие как производительность V100S на платформе AMD.