

ObjectScale
ObjectScale.Next:適用於 AI 資料的一整年不間斷效能
AI 不斷提高儲存裝置的標準。GPU 不能因為等候 I/O 而閒置。串流功能、嵌入和中繼成品不能受到小型物件瓶頸的限制。如果 KV 快取被困在 GPU 記憶體中,而不是以線路速率饋送加速器,LLM 推論就無法擴充規模。
自一年前的 4.0 版本開始,ObjectScale 在小型與大型物件、RDMA、GPU 感知資料路徑和 KV 快取卸載方面累積了效能創新,並將其搭配最新的全快閃記憶體 Dell PowerEdge 伺服器技術,同時保留企業所依賴的百萬兆級架構、效率和簡易性。
ObjectScale 對效能的專注,是獲評選為 CRN 2025 企業級儲存裝置年度產品的重要原因,該獎項為編輯評選,突顯 ObjectScale 對現今最嚴峻企業資料挑戰的影響。
單一平台,增強效能提升
在合格 Dell PowerEdge 伺服器上的軟體定義 ObjectScale 部署中,內部測試顯示每節點讀取輸送量最高可達 40 GB/秒1,最多比上一代全快閃記憶體物件平台快 8 倍1。這為 AI 團隊提供了精巧、高頻寬引擎,適用於大型訓練集、檢查點和混合大小的工作負載。
除了實驗室以外,還有非常多項目都受惠於這些提升。如今,ObjectScale 正在一些要求最嚴苛的環境中證明其價值:
- 大規模高頻率交易:紐約一間大型高頻率交易 (HFT) 公司每天處理超過 300 億筆交易,並仰賴 ObjectScale 持續為交易、風險和分析引擎提供資料。
- 全球金融服務:一家全球金融公司使用多站點 HDD 型 ObjectScale 環境,來處理 15 億筆每日交易,同時透過自動化自助服務為超過 1,000 個 AI、分析及備份工作負載提供服務。
- 英國高頻率交易:一家英國高頻率交易公司在小型 ObjectScale 概念驗證叢集上維持了大約 280 GB/秒的彙總讀取輸送量。
小物件,大效能:區塊存放區和金鑰值最佳化
現代 AI 管道以小型物件為主:紀錄、指標、功能、表格區段、向量區塊和中繼訓練成品。如果物件層無法有效率地處理小型物件,下游的一切都會變慢。ObjectScale 可讓客戶安心地建立小型物件繁多的 AI 管道。
這是透過區塊存放區引擎實現,其將許多小型物件壓縮成 128 MB 區塊,然後再套用糾刪碼並在節點之間分配資料。對於典型的 10 KB 檔案,超過 10,000 個物件可以存在於單一區塊中,進而減少中繼資料額外負荷和重建工作。
這對客戶的意義:
- 更高小型物件輸送量和更低延遲:特別是在全快閃記憶體 ObjectScale XF960 和 HDD 型 X560 叢集上,這些叢集專為小型物件讀取進行調整。
- 更快的重建和更可預測的效能:區塊型糾刪碼會將要在磁碟或節點故障後重建的分區,從數十億個減少到數百萬個,因此大型 NVMe 磁碟機可以在數小時內重建,不需要數週的時間。
- 減少在背景掃描上浪費的 CPU 資源:ObjectScale 為內嵌物件建立總和檢查,然後在等量層級進行驗證,釋放 CPU 週期來進行主動讀取和寫入。
在 ObjectScale 4.2 中,重新建構的金鑰值存放區更進一步改善,為中繼資料提供了大約 4 倍的記憶體效率2,以及降低 30–60% 的磁碟使用量2。即使叢集和物件數增加,查詢依然快速且可預測。
饋送 GPU 和 LLM:S3 over RDMA 和 KV 快取
隨著 AI 團隊擴充訓練和推論規模,瓶頸也逐漸變成資料移動和情境記憶,而非原始運算。ObjectScale 的第 4 代版本著重於兩者。
S3 over RDMA:高頻寬、低延遲的物件存取
S3 over RDMA (在 ObjectScale 4.2 中導入,在 4.3 中增強) 為 S3 存取以 RDMA 取代傳統 TCP,在內部測試中提供極大用戶端優勢:
- 輸送量提升至高達 230%
- 延遲降低約 80%
- CPU 使用率最高可降低 98%…
…如果與 S3 over TCP 相比。3
隨著版本 4.3 的推出,適用於 ObjectScale 的 S3 over RDMA 在所有全快閃記憶體產品組合中提供 (R7725xd、XF960 和 EXF900 上的軟體定義 ObjectScale),可實現物件資料的超低延遲、高傳輸量存取。
ObjectScale 將 Dell 的 S3 over RDMA SDK 與 GPU 支援及 RoCEv2 網路堆疊整合,可繞過傳統的 TCP 和 CPU 瓶頸,在 GPU 與物件儲存裝置中的 NVMe SSD 之間建立近乎直接的路徑,以滿足要求嚴苛的 AI 管道需求。
KV 快取:將 ObjectScale 轉變為推論加速器
隨著 LLM 進入生產,金鑰值 (KV) 快取也變得極其重要。推論架構不會重新運算每個權杖的注意力狀態,而是重複使用 KV 快取,但此快取量很快就會超過 GPU 記憶體。將 KV 快取卸載至 ObjectScale 有助於提供更快速、反應更靈敏的 AI 體驗。
Dell 的可擴充 KV 快取卸載解決方案由 ObjectScale 和 PowerScale 提供支援,使用 vLLM、LMCache、NVIDIA 的 NIXL 程式庫,以及 Dell 的 RDMA 加速 S3 整合,將 KV 快取從 GPU 記憶體移轉到高效能共用儲存裝置。
效能指標顯示:
- 相較於使用 GPU 重新運算 KV 快取的標準 vLLM 組態,第一權杖時間 (TTFT) 加快達 19 倍4。
- 權杖輸送量最高仍提高至 5.3 倍5 且多回合輸送量最高仍提高至近 3 倍5(在 Dell InfoHub 測試中,即使將多 GB 的 KV 快取存放在 ObjectScale 和 PowerScale 上)。
- 在與競爭引擎的直接比較中,ObjectScale 的 KV 快取 TTFT 約為 0.86 秒6 ,在已發佈的測試中效能超越 VAST。
S3 表格:無 ETL 阻力的 AI 最佳化分析
在 ObjectScale 4.3 (技術預覽) 中,S3 表格將 Apache Iceberg 架構表格原生分析直接導入 ObjectScale 貯體。表格位於 S3 上,可以透過 Spark、Flink、Trino 和 Starburst 等引擎進行查詢,無需將資料複製到獨立的資料庫或倉儲中,減少 ETL 額外負荷和外部依存性。
內部測試顯示:
- 擷取速度最多加快至 2 倍7
- 查詢速度最多加快至 4.5 倍7
(與傳統以倉儲為中心的模式相比時),而自動化儲存空間回收和整合 IAM 有助於長期保持高效能和更簡易的操作。ObjectScale 從單純的登陸區域轉變為 AI 和 BI 團隊的主動式高效能分析表面。
無須犧牲規模、效率或簡易性的效能
效能只有在具有規模、效率和簡易性時才有用。ObjectScale 的第 4 代版本也在這些層面有所進步:
- 與以前的版本相比,現代化的金鑰值存放區支援高達 122%8 的全球 VDC 增長,同時大幅減少用於中繼資料的記憶體和磁碟。
- 貯體層級壓縮和多重演算法 (Snappy、LZ4、ZSTD、Deflate) 使團隊能夠根據工作負載調整速度或比率,且壓縮分析可將節省的資源轉化為 FinOps 訊號,而不是盲目設定。
- ObjectScale 全新的 24+2 和 24+4 糾刪碼選項最多可將寫入放大減少 75%9,進而減少媒體耗損和背景額外負荷,讓更多的 I/O 服務應用程式;客戶可以看到在 EX500 等高容量 HDD 平台上,大型物件擷取加快 25%10,且中型物件寫入效能最多提高至 2 倍11。
- 整合式負載平衡器、改進的異地複寫空間回收,以及雲端原生工具 (Kubernetes COSI、Terraform),可讓大規模 ObjectScale 環境在成長後仍易於管理。
結果就是結合效能改善與操作簡易性,而非強迫團隊進行取捨的平台。
為何效能優先的 ObjectScale 藍圖很重要
隨著 AI 模型和資料管道變得越來越複雜,ObjectScale 的藍圖仍是效能優先,無論是提高小型和大型物件輸送量、延伸 S3 over RDMA 和 GPU 感知資料路徑,還是深化與 KV 快取、情境記憶及 AI 最佳化搜尋的整合,通通都不例外。
對於建置新一代 AI 和分析的組織來說,這構成一個簡單承諾:物件存放區不會變成您的阻力。
材料來源
1根據 Dell 分析,針對物件讀取效能比較 PowerEdge R7725xd 上的 ObjectScale 4.2 與 ECS EXF900 上的 ECS 3.8,2025 年 9 月。實際結果可能有所差異。
2根據的 Dell 分析,比較 ObjectScale 4.2 與 ObjectScale 4.1 中所使用的金鑰值存放區,2025 年 8 月。實際結果可能有所差異。
3根據 Dell 內部 ObjectScale S3 over RDMA 測試,2025 年 12 月。實際結果可能有所差異。
4根據使用 Tensor Parallelism=4 之 LLaMA‑3.3‑70B Instruct 模型的內部 Dell Technologies 測試。測試以 100% KV 快取命中率測量第一權杖時間 (TTFT) 效能,比較 PowerScale 和 ObjectScale 儲存裝置上的 Dell vLLM + LMCache + NVIDIA NIXL 堆疊與基準標準 vLLM 組態。實際結果可能有所差異。2025 年 11 月。
5根據使用 Tensor Parallelism=4 之 LLaMA‑3.3‑70B Instruct 模型的內部 Dell Technologies 測試。測試使用 LMbenchmark 多回合推論套件測量 TPS (每秒權杖數) 輸送量,比較 PowerScale 和 ObjectScale 儲存裝置上的 Dell vLLM + LMCache + NVIDIA NIXL 堆疊與使用搭配標準 vLLM 使用 GPU 僅記憶體快取的基準組態。實際結果可能有所差異。2025 年 11 月。
6根據使用 Tensor Parallelism=4 之 LLaMA‑3.3‑70B Instruct 模型的內部 Dell Technologies 測試。測試以 100% KV 快取命中率測量第一權杖時間 (TTFT) 效能。實際結果可能有所差異。2025 年 11 月。
7根據 Dell 內部 ObjectScale S3 表格測試,2025 年 9 月。實際結果可能有所差異。
8根據的 Dell 分析,比較 ObjectScale 4.2 與 ObjectScale 4.1 中所使用的金鑰值存放區,2025 年 8 月。實際結果可能有所差異。
9根據 Dell 內部測試,比較 24+4 和 24+2 EC 配置與使用 AFA 和 ObjectScale 4.3 程式碼的 12+4,2025 年 12 月。實際結果可能有所差異。
10根據 Dell 內部測試,比較使用 XF960 的 4.3 程式碼與 3 種糾刪碼配置,2025 年 12 月。實際結果可能有所差異。
11根據 HDD 上 ObjectScale 4.3 啟用功能對比停用功能的 Dell 內部測試,2025 年 12 月。實際結果可能有所差異。

