PowerEdge: HPC en AI-prestaties op DSS8440 met V100S GPU's

Samenvatting: In deze blog worden de resultaten gepresenteerd van het onderzoek waarin 8x V100S on DSS8440 werden geëvalueerd voor verschillende HPC- en deep learning-applicaties, waaronder HPL, LAMMPS en MLPerf-v0.6 suite. ...

Dit artikel is van toepassing op Dit artikel is niet van toepassing op Dit artikel is niet gebonden aan een specifiek product. Niet alle productversies worden in dit artikel vermeld.

Instructies

Auteurs: Frank Han, Rengan Xu, Quy Ta
Dell EMC HPC en AI Innovation Lab, mei 2020


Beknopte samenvatting

In deze blog presenteren we de resultaten van het onderzoek waarin 8x V100S on DSS8440 werden geëvalueerd voor verschillende HPC- en deep learning-applicaties, waaronder HPL, LAMMPS en MLPerf-v0.6 (External Link) suite. Samengevat:

  • Applicaties die worden beperkt door GPU-bandbreedte , zoals LAMMPS, kunnen profiteren van de nieuwe V100S GPU's en betere prestaties krijgen voor zowel enkele als meerdere GPU's.
  • Deep learning-applicaties, zoals de applicaties die zijn getest in MLPerf, profiteren van de hogere verhoogde kloksnelheid en hogere bandbreedte van V100S.
  • GPU-compute-gebonden applicaties zoals de HPC-benchmark HPL krijgen dezelfde prestaties als V100-PCIe.

In de rest van deze blog worden de details van deze tests uiteengezet. In de toekomst worden dezelfde applicaties uitgevoerd op DSS8440 met RTX GPU's (in plaats van de V100S) en worden ook andere tests uitgevoerd, zoals V100S-prestaties op het AMD-platform.


Overzicht van het testbed 

De Dell DSS8440 server is een voor versnellers geoptimaliseerde server, ontworpen voor high-performance computing en deep learning-workloads. De NVIDIA V100S (External Link) is het nieuwste lid in de Tesla Volta-serie en is een GPU-kaart met dubbele breedte van 32G PCIe. In deze blog presenteren we de resultaten van het onderzoek waarin 8x V100S on DSS8440 werden geëvalueerd voor verschillende HPC- en deep learning-applicaties, waaronder HPL, LAMMPS en MLPerf-v0.6 (External Link) suite.

De hardware- en softwaregegevens van de geteste DSS 8440 server en de vergelijking van V100S en V100-PCIe worden vermeld in tabel 1 en tabel 2.

Hardware- en softwaregegevens 
Tabel 1: De hardware- en softwaregegevens

PCIe-verschil in specificatie 
Tabel 2: Verschil in specificatie voor V100S en V100-PCIe


HPC-applicatieprestaties 

 PCIe HPL-resultaten op DSS8440 
Figuur 1: Resultaten van V100S en V100-PCIe HPL op DSS8440

Figuur 1 toont de HPL-prestatiecijfers. Er is niet veel verschil tussen V100S en V100-PCIe, omdat HPL een extreme stresstesttoepassing is. Er is weinig ruimte voor de GPU boost-functie (External Link), waardoor de frequentie van de GPU's snel terugvalt naar de basiskloksnelheid. Omdat V100S en V100-PCIe bijna dezelfde basiskloksnelheid hebben, levert V100S voor GPU-compute-gebonden applicaties zoals HPL ongeveer hetzelfde prestatieniveau als V100-PCIe. 

LAMMPS-resultaten op DSS8440 
Afbeelding 2: V100S en V100-PCIe LAMMPS resultaten op DSS8440

Figuur 2 toont de timestep/s-resultaten van de LAMMPS met Lennard Jones-dataset. LAMMPS is een voorbeeld van moleculaire dynamicacode waarvan bekend is dat het een GPU-bandbreedtegebonden applicatie is. De V100S levert in deze tests 27% betere prestaties dan de V100-PCIe. De versnelling wordt niet alleen bijgedragen door de 15% hogere boostfrequentie en 26% meer bandbreedte, maar ook door de nieuwere softwareversie. V100-PCIe-nummers zijn verkregen met behulp van het oude KOKKOS-pakket in LAMMPS 8Feb2019-versie. De nieuwere versie 24Jan2020 had echter ondersteuning toegevoegd voor het gebruik van cuFFT op de GPU met KOKKOS. De meeste details zijn te vinden in deze LAMMPS 24Jan2020 release note (Externe link).


Deep learning-applicatieprestaties

MLPerf resultaten op DSS8440 
Afbeelding 3: V100S en V100-PCIe MLPerf resultaten op DSS8440

MLPerf training closed divisie 0.6 versie (External Link) heeft zes subtests die brede deep learning-domeinen bestrijken, waaronder beeldclassificatie (ResNet-50), objectdetectie (Mask R-CNN en SSD), vertaling (NMT en Transformer) en reinforcement learning (MiniGo). De vergelijkingsresultaten van beide GPU-kaarten staan in afbeelding 3. Er werden ongeveer 1-5% prestatiewinsten waargenomen in de MLPerf-suite voor V100S, wat consistent is met de 1-5% hogere doorvoer in de resultatenlogbestanden. De real-time output van de GPU-kloksnelheid werd gemonitord en er werd waargenomen dat V100S GPU's in al die tests 1-5% hoger werkten, dus de prestatievoordelen kwamen van de hogere verhoogde frequentie van V100S.


Conclusies en toekomstige werken 

In deze blog werden de prestaties van HPC-applicaties met HPL, LAMMPS en deep learning met MLPerf vergeleken met V100S- en V100-PCIe GPU-kaarten op dezelfde DSS8440-server. Applicaties die worden beperkt door GPU-bandbreedte, zoals LAMMPS, kunnen profiteren van de nieuwe V100S GPU's en krijgen betere prestaties voor zowel enkele als meerdere GPU's. Deep learning-applicaties die in MLPerf zijn getest, profiteren ook van de hogere kloksnelheid en hogere bandbreedte van V100S. De GPU compute bounded HPC-benchmark HPL krijgt dezelfde prestaties als V100-PCIe. In de toekomst zullen dezelfde applicaties op DSS8440 worden uitgevoerd met RTX GPU's en zullen enkele andere tests, zoals V100S-prestaties op het AMD-platform, worden onderzocht.

Getroffen producten

DSS 8440, High Performance Computing Solution Resources
Artikeleigenschappen
Artikelnummer: 000133353
Artikeltype: How To
Laatst aangepast: 18 aug. 2026
Versie:  5
Vind antwoorden op uw vragen via andere Dell gebruikers
Support Services
Controleer of uw apparaat wordt gedekt door Support Services.