ObjectScale.Next:適用於 AI 資料的一整年不間斷效能

業界效能最高的物件儲存裝置1 如何在每個版本中將效能創新轉化為現實的 AI 成果。

AI 不斷提高儲存裝置的標準。GPU 不能因為等候 I/O 而閒置。串流功能、嵌入和中繼成品不能受到小型物件瓶頸的限制。如果 KV 快取被困在 GPU 記憶體中,而不是以線路速率饋送加速器,LLM 推論就無法擴充規模。

自一年前的 4.0 版本開始,ObjectScale 在小型與大型物件、RDMA、GPU 感知資料路徑和 KV 快取卸載方面累積了效能創新,並將其搭配最新的全快閃記憶體 Dell PowerEdge 伺服器技術,同時保留企業所依賴的百萬兆級架構、效率和簡易性。

ObjectScale 對效能的專注,是獲評選為 CRN 2025 企業級儲存裝置年度產品的重要原因,該獎項為編輯評選,突顯 ObjectScale 對現今最嚴峻企業資料挑戰的影響。

單一平台,增強效能提升

在合格 Dell PowerEdge 伺服器上的軟體定義 ObjectScale 部署中,內部測試顯示每節點讀取輸送量最高可達 40 GB/秒1,最多比上一代全快閃記憶體物件平台快 8 倍1。這為 AI 團隊提供了精巧、高頻寬引擎,適用於大型訓練集、檢查點和混合大小的工作負載。

除了實驗室以外,還有非常多項目都受惠於這些提升。如今,ObjectScale 正在一些要求最嚴苛的環境中證明其價值:

  • 大規模高頻率交易:紐約一間大型高頻率交易 (HFT) 公司每天處理超過 300 億筆交易,並仰賴 ObjectScale 持續為交易、風險和分析引擎提供資料。
  • 全球金融服務:一家全球金融公司使用多站點 HDD 型 ObjectScale 環境,來處理 15 億筆每日交易,同時透過自動化自助服務為超過 1,000 個 AI、分析及備份工作負載提供服務。
  • 英國高頻率交易:一家英國高頻率交易公司在小型 ObjectScale 概念驗證叢集上維持了大約 280 GB/秒的彙總讀取輸送量

小物件,大效能:區塊存放區和金鑰值最佳化

現代 AI 管道以小型物件為主:紀錄、指標、功能、表格區段、向量區塊和中繼訓練成品。如果物件層無法有效率地處理小型物件,下游的一切都會變慢。ObjectScale 可讓客戶安心地建立小型物件繁多的 AI 管道

這是透過區塊存放區引擎實現,其將許多小型物件壓縮成 128 MB 區塊,然後再套用糾刪碼並在節點之間分配資料。對於典型的 10 KB 檔案,超過 10,000 個物件可以存在於單一區塊中,進而減少中繼資料額外負荷和重建工作。

這對客戶的意義:

  • 更高小型物件輸送量和更低延遲:特別是在全快閃記憶體 ObjectScale XF960 和 HDD 型 X560 叢集上,這些叢集專為小型物件讀取進行調整。
  • 更快的重建和更可預測的效能:區塊型糾刪碼會將要在磁碟或節點故障後重建的分區,從數十億個減少到數百萬個,因此大型 NVMe 磁碟機可以在數小時內重建,不需要數週的時間
  • 減少在背景掃描上浪費的 CPU 資源:ObjectScale 為內嵌物件建立總和檢查,然後在等量層級進行驗證,釋放 CPU 週期來進行主動讀取和寫入。

在 ObjectScale 4.2 中,重新建構的金鑰值存放區更進一步改善,為中繼資料提供了大約 4 倍的記憶體效率2,以及降低 30–60% 的磁碟使用量2。即使叢集和物件數增加,查詢依然快速且可預測。

饋送 GPU 和 LLM:S3 over RDMA 和 KV 快取

隨著 AI 團隊擴充訓練和推論規模,瓶頸也逐漸變成資料移動和情境記憶,而非原始運算。ObjectScale 的第 4 代版本著重於兩者。

S3 over RDMA:高頻寬、低延遲的物件存取

S3 over RDMA (在 ObjectScale 4.2 中導入,在 4.3 中增強) 為 S3 存取以 RDMA 取代傳統 TCP,在內部測試中提供極大用戶端優勢:

  • 輸送量提升至高達 230%
  • 延遲降低約 80%
  • CPU 使用率最高可降低 98%…

…如果與 S3 over TCP 相比。3

隨著版本 4.3 的推出,適用於 ObjectScale 的 S3 over RDMA 在所有全快閃記憶體產品組合中提供 (R7725xdXF960 EXF900 上的軟體定義 ObjectScale),可實現物件資料的超低延遲、高傳輸量存取。

ObjectScale 將 Dell 的 S3 over RDMA SDK 與 GPU 支援及 RoCEv2 網路堆疊整合,可繞過傳統的 TCP 和 CPU 瓶頸,在 GPU 與物件儲存裝置中的 NVMe SSD 之間建立近乎直接的路徑,以滿足要求嚴苛的 AI 管道需求。

KV 快取:將 ObjectScale 轉變為推論加速器

隨著 LLM 進入生產,金鑰值 (KV) 快取也變得極其重要。推論架構不會重新運算每個權杖的注意力狀態,而是重複使用 KV 快取,但此快取量很快就會超過 GPU 記憶體。將 KV 快取卸載至 ObjectScale 有助於提供更快速、反應更靈敏的 AI 體驗。

Dell 的可擴充 KV 快取卸載解決方案由 ObjectScale PowerScale 提供支援,使用 vLLMLMCache、NVIDIA 的 NIXL 程式庫,以及 Dell 的 RDMA 加速 S3 整合,將 KV 快取從 GPU 記憶體移轉到高效能共用儲存裝置。

效能指標顯示:

  • 相較於使用 GPU 重新運算 KV 快取的標準 vLLM 組態,第一權杖時間 (TTFT) 加快達 19 倍4
  • 權杖輸送量最高仍提高至 5.3 倍5 且多回合輸送量最高仍提高至近 3 倍5(在 Dell InfoHub 測試中,即使將多 GB 的 KV 快取存放在 ObjectScale 和 PowerScale 上)。
  • 在與競爭引擎的直接比較中,ObjectScale 的 KV 快取 TTFT 約為 0.86 秒6 ,在已發佈的測試中效能超越 VAST。

S3 表格:無 ETL 阻力的 AI 最佳化分析

在 ObjectScale 4.3 (技術預覽) 中,S3 表格將 Apache Iceberg 架構表格原生分析直接導入 ObjectScale 貯體。表格位於 S3 上,可以透過 Spark、Flink、Trino 和 Starburst 等引擎進行查詢,無需將資料複製到獨立的資料庫或倉儲中,減少 ETL 額外負荷和外部依存性。

內部測試顯示:

  • 擷取速度最多加快至 2 倍7
  • 查詢速度最多加快至 4.5 倍7

(與傳統以倉儲為中心的模式相比時),而自動化儲存空間回收和整合 IAM 有助於長期保持高效能和更簡易的操作。ObjectScale 從單純的登陸區域轉變為 AI 和 BI 團隊的主動式高效能分析表面。

無須犧牲規模、效率或簡易性的效能

效能只有在具有規模、效率和簡易性時才有用。ObjectScale 的第 4 代版本也在這些層面有所進步:

  • 與以前的版本相比,現代化的金鑰值存放區支援高達 122%8 的全球 VDC 增長,同時大幅減少用於中繼資料的記憶體和磁碟。
  • 貯體層級壓縮和多重演算法 (Snappy、LZ4、ZSTD、Deflate) 使團隊能夠根據工作負載調整速度或比率,且壓縮分析可將節省的資源轉化為 FinOps 訊號,而不是盲目設定。
  • ObjectScale 全新的 24+2 和 24+4 糾刪碼選項最多可將寫入放大減少 75%9,進而減少媒體耗損和背景額外負荷,讓更多的 I/O 服務應用程式;客戶可以看到在 EX500 等高容量 HDD 平台上,大型物件擷取加快 25%10,且中型物件寫入效能最多提高至 2 倍11
  • 整合式負載平衡器、改進的異地複寫空間回收,以及雲端原生工具 (Kubernetes COSI、Terraform),可讓大規模 ObjectScale 環境在成長後仍易於管理。

結果就是結合效能改善與操作簡易性,而非強迫團隊進行取捨的平台。

為何效能優先的 ObjectScale 藍圖很重要

隨著 AI 模型和資料管道變得越來越複雜,ObjectScale 的藍圖仍是效能優先,無論是提高小型和大型物件輸送量、延伸 S3 over RDMA 和 GPU 感知資料路徑,還是深化與 KV 快取、情境記憶及 AI 最佳化搜尋的整合,通通都不例外。

對於建置新一代 AI 和分析的組織來說,這構成一個簡單承諾:物件存放區不會變成您的阻力。


材料來源

1根據 Dell 分析,針對物件讀取效能比較 PowerEdge R7725xd 上的 ObjectScale 4.2 與 ECS EXF900 上的 ECS 3.8,2025 年 9 月。實際結果可能有所差異。
2根據的 Dell 分析,比較 ObjectScale 4.2 與 ObjectScale 4.1 中所使用的金鑰值存放區,2025 年 8 月。實際結果可能有所差異。
3根據 Dell 內部 ObjectScale S3 over RDMA 測試,2025 年 12 月。實際結果可能有所差異。
4根據使用 Tensor Parallelism=4 之 LLaMA‑3.3‑70B Instruct 模型的內部 Dell Technologies 測試。測試以 100% KV 快取命中率測量第一權杖時間 (TTFT) 效能,比較 PowerScale 和 ObjectScale 儲存裝置上的 Dell vLLM + LMCache + NVIDIA NIXL 堆疊與基準標準 vLLM 組態。實際結果可能有所差異。2025 年 11 月。
5根據使用 Tensor Parallelism=4 之 LLaMA‑3.3‑70B Instruct 模型的內部 Dell Technologies 測試。測試使用 LMbenchmark 多回合推論套件測量 TPS (每秒權杖數) 輸送量,比較 PowerScale 和 ObjectScale 儲存裝置上的 Dell vLLM + LMCache + NVIDIA NIXL 堆疊與使用搭配標準 vLLM 使用 GPU 僅記憶體快取的基準組態。實際結果可能有所差異。2025 年 11 月。
6根據使用 Tensor Parallelism=4 之 LLaMA‑3.3‑70B Instruct 模型的內部 Dell Technologies 測試。測試以 100% KV 快取命中率測量第一權杖時間 (TTFT) 效能。實際結果可能有所差異。2025 年 11 月。
7根據 Dell 內部 ObjectScale S3 表格測試,2025 年 9 月。實際結果可能有所差異。
8根據的 Dell 分析,比較 ObjectScale 4.2 與 ObjectScale 4.1 中所使用的金鑰值存放區,2025 年 8 月。實際結果可能有所差異。
9根據 Dell 內部測試,比較 24+4 和 24+2 EC 配置與使用 AFA 和 ObjectScale 4.3 程式碼的 12+4,2025 年 12 月。實際結果可能有所差異。
10根據 Dell 內部測試,比較使用 XF960 的 4.3 程式碼與 3 種糾刪碼配置,2025 年 12 月。實際結果可能有所差異。
11根據 HDD 上 ObjectScale 4.3 啟用功能對比停用功能的 Dell 內部測試,2025 年 12 月。實際結果可能有所差異。

Anahad Dhillon headshot

About the Author: Anahad Dhillon

Anahad Dhillon owns the strategy, planning and roadmap for Dell’s object storage product portfolio. He focuses on bringing customers the most value for their storage investments—through industry leading storage solutions for Enterprise and BigAI use cases.