適用於 HPC Lustre 儲存裝置的 Dell 就緒解決方案:串聯湖更新
摘要: 適用於 HPC Lustre 儲存裝置的 Dell 就緒解決方案:串聯湖更新
症狀
HPC 與 AI 創新實驗室的 Jyothi Bhaskar 於 2019 年 6 月撰寫文章
原因
解析度
大型底座組態的架構圖如下圖 1 所示。
請注意,伺服器和儲存機型維持與先前顯示的相同。只有新更新會顯示在表1中。
圖 1: 適用於 HPC Lustre 儲存裝置的 Dell 就緒解決方案:L 基座組態的架構圖
表 1: 更新適用於 Lustre 的就緒解決方案的技術規格,並與上一版本快速比較
| 硬體/軟體元件 | 目前 | 上一個 |
|---|---|---|
| OSS 和 MDSObject 儲存伺服器 (OSS) 和元數據伺服器 (MDS) 中的處理器 | 2 個 Intel Xeon™ 黃金級 6230 CPU,每個 OSS/MDS 有 20 個核心 (2.10 GHz) | 2 個 Intel Xeon™ 黃金級 6136,配備 12 個核心 @3.00 GHz |
| 整合式 Manger for Lustre (IML) 伺服器中的處理器 | 2 個 Intel Xeon 黃金級 5218,配備 16 個核心 (2.3 GHz) | 2 個 Intel Xeon 黃金級 5118,配備 12 個核心 (2.3 GHz) |
| OSS 和 MDS 中的記憶體 DIMM | 12 條 32 GiB 2933 MT/秒 DDR4 RDIMM | 24 條 16GiB 2666 MT/秒 DDR4 RDIMM |
| IML 伺服器中的記憶體 DIMM | 12 條 8GiB 2666MT/秒 DDR4 RDIMM | 12 條 8 GB 2666 MT/秒 DDR4 RDIMM |
| BIOS | 2.1.8 或更新版本 | 1.4.5 或更新版本 |
| 作業系統核心 | 3.10.0-957.1.3 | 3.10.0-862 |
| Lustre 版本 | 2.10.7 | 2.10.4 |
| IML 版本 | 4.0.10.0 | 4.0.7.0 |
| Mellanox OFED versi | 4.5-1.0.1.0 | 4.4-1 |
績效結果
我們設定了表 1 所列的更新就緒解決方案,並執行了效能檢查與 IIeone 順序、IIeone 隨機和 MDtest 效能指標,以驗證更新後的解決方案的效能。包含所有測試的效能指標命令的測試方法,與先前使用和描述的方法相同。
針對所有測試,我們使用客戶端測試台,如下表 2 所述
表 2: 用戶端測試台
| 用戶端節點數 | 8 |
|---|---|
| 用戶端節點 | C6420 |
| 每個用戶端節點的處理器數 | 2 個 Intel(R) Xeon(R) 黃金級 6248,配備 20 個核心 (2.50 GHz) |
| 每個用戶端節點的記憶體數 | 12 條 16GiB 2933 MT/秒 RDIMM |
| BIOS | 2.2.6 |
| 作業系統核心 | 3.10.0-957.10.1 |
| Lustre 版本 | 2.10.7 |
| Mellanox OFED | 4.5-1.0.1.0 |
循序 IOne 效能
我們使用表 2 所列的用戶端,執行了循序 IOne 3.487 版。我們執行的測試來自單一線程,最多 256 個線程,每個客戶端有超過 8 個線程的多個線程。根據測試方法,測試的匯總數據大小為 2 TB。 若線程較少於 32 個線程,則使用 32 個 Lustre 等量計數,而線程計數大於 32 時,Lustre 等量計數設定為 1。 快取效果已如先前部落格所述最小化。
用於此測試的 Lustre 用戶端調整參數如下所列
lctl set_param osc.*.checksums=0
lctl set_param timeout=600
lctl set_param at_min=250
lctl set_param at_max=600
lctl set_param ldlm.namespaces.*.lru_size=2000
lctl set_param osc .*OST*.max_rpcs_in_flight=16
lctl set_param osc.*OST*.max_dirty_mb=1024
lctl set_param osc.*.max_pages_per_rpc=1024
lctl set_param llite.*.max_read_ahead_mb=1024
lctl set_param llite.*.max_read_ahead_per_file_mb=1024
圖 2:循序 N-N 寫入。使用 Cascade Lake Lustre 伺服器和客戶
端的先前結果與目前結果的比較圖 3:循序 N-N 讀取。使用 Cascade Lake Lustre 伺服器和客戶
端的先前結果與目前結果的比較圖 2 和 3 顯示最新的 Cascade Lake 解決方案的 IOne 循序讀取和寫入效能,並將這些結果與先前的 Skylake 型解決方案進行比較。與先前的結果相比,我們發現串行讀取和寫入 Cascade Lake 型用戶端和 Lustre 伺服器的效能有所改善,線程數量低於 32 個線程。我們可以注意,連續寫入的效能提升略多於 2 倍,以低於 32 個線程的線程讀取。我們相信,此效能增量可歸結於 Cascade Lake 處理器 (ref link) 隨附的側通道利用的硬體風險降低。但是,其他因素也可能是新解決方案中的記憶體速度加快,以及更新的軟體版本。
另請注意,線程計數較高的順序效能仍與先前的解決方案非常類似。這是因為在解決方案以後端儲存控制器的全部潛能運作后,Cascade Lake 處理器的強化功能不會導致額外的效能提升。
隨機 IOne 效能
我們使用表 2 所列的用戶端,隨機執行 3.487 版 IOne。並以 16、64 和 256 個線程執行效能檢查。與先前的測試方法類似,匯總數據大小為 2 TB,等量大小則設定為 4 MB。快取效果已如先前部落格所述最小化。
用於此測試的 Lustre 用戶端調整參數如下所列
lctl set_param osc.*OST*.max_rpcs_in_flight=256
lctl set_param osc.*.max_pages_per_rpc=1024
圖 4:IOne 隨機 N-N 讀取。使用 Cascade Lake Lustre 伺服器和客戶
端比較先前結果與目前結果圖 4 會產生隨機 I/O 測試的結果。比較先前和目前的結果,我們發現趨勢維持不變,而觀察到的效能增量在統計上並不會根據執行變化而顯著。
元數據 MDtest 效能
MDTest 工具 1.9.3 版用於評估系統的元數據效能。使用的 MPI 分配是 Intel MPI。這些測試是使用具有 2 個 MDT 和目錄等量分配的 DNE 執行。所使用的測試方法、命令以及建立的檔案和目錄數目,都與先前部落格中說明的相同。
圖 5: 使用 MDtest 的元數據作業。 使用 Cascade Lake Lustre 伺服器和客戶
端的先前結果與目前結果的比較圖 5 顯示元數據測試的結果。比較目前的結果與先前的結果,我們發現所有三個元數據作業的趨勢維持不變。我們可以注意,尖峰檔案建立作業有 75.4% 的改善、尖峰檔案移除作業的下降 18%,以及檔案狀態作業中無法理解的效能增量。 我們可能將效能增量歸結於解決方案堆疊上的軟體和硬體更新,如表 1 所示。
結論
我們已驗證 Lustre Ready Solution 有關組態、安裝和效能的更新。此外,此部落格中亦包含已收集到的效能數據。
將先前結果與目前結果與 Cascade Lake 型 Lustre 伺服器和用戶端
1) 順序 IO 進行比較:我們發現效能提升最多略多於 2 倍,以低於 32 個線程的線程計算順序寫入和順序讀取。尖峰效能與先前的Skylake解決方案類似。
2) 隨機 I/O:在讀取和寫入效能方面,我們可以看到非常相似的趨勢,因為考慮到執行來執行差異,效能增量在統計上並不顯著。
3) 元資料效能測試: 我們發現在尖峰時,檔案建立作業的改善率高達 75.4%。檔案狀態作業與先前觀察到的結果非常接近,並具有無法理解的效能增量。在尖峰時,檔案移除作業減少了約 18%,而檔案移除作業的一般趨勢維持不變,而 delta 在其他線程計數中則無法存取。
參考資料
1) IIeOne 效能指標2) Mdtest 基準檢驗