PowerEdge: NAMD-ytelse på R740 med Volta GPU-er
概要: PowerEdge R740, NAMD, NVIDIA V100-PCIe GPU-er, HPC, høytytende databehandling, HPC og innovasjonslab for AI, ytelse
手順
For å dra nytte av GPU-akselerasjon er det nødvendig med en CUDA-build for NAMD. Instruksjoner for å kompilere NAMD med CUDA-støtte finner du her
I denne artikkelen skal vi diskutere NAMD-ytelsen med NVIDIAs nyeste Volta GPU V100-32 GB i en enkelt Dell EMC PowerEdge R740-server.
PowerEdge R740 er en 2U-server med to sokler med Intel Skylake-prosessorer. Den kan konfigureres til å støtte opptil 3 GPU-er med dobbel bredde og en høyhastighets nettverksadapter.
Tabell 1 viser informasjon om maskinvarekonfigurasjonen og applikasjonsdetaljene som ble brukt til testene. En nattlig byggeversjon av NAMD ble utarbeidet for denne testen datert 2018-08-17.
Tabell 1: Detaljer om maskinvare- og programvarekonfigurasjon
| Server | PowerEdge R740 |
| Prosessor | 2 * Intel Xeon 6148 - 20 kjerners prosessor @ 2,4 GHz |
| Minne | 192 GB @ 2666 MT/s |
| GPU | 3 * NVIDIA Volta V100-PCIe (32 GB) |
| Strømforsyning | 2*1600 W |
| Operativsystem | RHEL 7.4-kjerne
: 3.10.0-693.el7.x86_64 |
| Alternativer for BIOS | Systemprofil – logisk ytelsesprosessor
– deaktivert turbomodus – aktivert |
| CUDA-versjon og -driver | CUDA 9,2 (396,26) |
| NAMD | Git-2018-08-17_Source (Nightly Build-versjon), flerkjernet bygg |
| Kompilatoren | Intel 2018 u3 |
Ytelsesresultater
NAMD ble testet med tre forskjellige datasett: ApoA1, F1ATPase og STMV som består av henholdsvis 92 K, 327 K og 1066k atomer. Apoa1 er et mindre datasett sammenlignet med F1ATPase og STMV. Resultatmålingen her er "ns / dager." Dataene som vises i denne delen, er basert på gjennomsnittet av 10 tester.
Figur 1 viser NAMD-ytelsen med CPU og flere GPUer på tre datasett. Instruksjoner fra Intels nettsted ble fulgt for å kompilere NAMD for Intel Xeon-prosessorer. Ytelsesforbedring fra CPU til GPUer er notert i grafen nedenfor.
Figur 1 – NAMD-ytelse på CPU og GPU-er
- Ytelsen står i forhold til resultatene med to prosessorer på tvers av de ulike datasettene.
- GPU-versjonene av NAMD gir opptil 11,2 ganger hastighet sammenlignet med CPU-versjonen for alle tre datasettene.
- En ytterligere ytelsesøkning på 23–33 % ble målt da det andre GPU-kortet ble lagt til. En mer beskjeden 6-9% ble observert fra to GPUer til tre GPU-tester.
NAMD ble også testet med et ulikt antall CPU-kjerner på tvers av 1, 2 og 3 GPU-er for å identifisere det minste antallet CPU-kjerner som trengs for best mulig ytelse.
Figur 2 – STMV-ytelse med ulike antall CPU-kjerner og GPU-er
- Som vist i figur 2 har bruk av for få CPU-kjerner en negativ innvirkning på ytelsen, og ytelsen forbedres når vi øker antall kjerner
- Testing av en V100 med 20+ CPU-kjerner oppnådde god ytelse. Det er en ekstra ytelsesfordel på 2–3 % når vi bruker mer enn 20 kjerner.
- Denne testen ble også utført på de to andre datasettene ApoA1 og F1ATPase. Lignende ytelsesadferd ble observert med dem.
Sammendrag
NAMD-ytelsesresultater på Dell EMC PowerEdge R740-server og NVIDIA Volta V100-32 GB GPU-er er presentert her. Det er ~ 6.6x-11.2x hastighetsøkning over CPU-bare tester når du bruker GPUer. En R740-server med 3 V100-kort gir best ytelse, mens en R740 med 2 V100-kort er innenfor 91% av de tre GPU-konfigurasjonene. Hvis det er budsjettbegrensninger, vil en GPU per R740 være et godt valg, da det gir opptil 8x hastighet sammenlignet med CPU. Tester med varierte CPU-kjerner og GPU-er ble også utført, og vi la merke til at bruk av for få CPU-kjerner (færre enn 20 kjerner i testene våre) reduserer NAMD-ytelsen på GPU-tester.