ObjectScale.Next:深耕一载,强力性能助力 AI 数据处理

业内性能靠前的对象存储1 如何通过版本更迭,将性能创新转化为真实的 AI 成果。

AI 正在不断拉高存储的门槛。GPU 不能空等 I/O 响应。流式处理功能、嵌入和中间工件不能因小对象瓶颈而受限。如果 KV 高速缓存被锁定在 GPU 内存中,而不是以线速向加速器馈送数据,LLM 推理就无法实现规模化扩展。

自一年前发布 4.0 版本以来,ObjectScale 已在小对象与大对象、RDMA、GPU 感知数据路径和 KV 高速缓存卸载方面叠加了一系列性能创新,并将其与最新的 Dell PowerEdge 全闪存服务器技术相结合,同时保留了企业所依赖的百万兆级体系结构、效率与简易性。

这种对性能的专注,正是 ObjectScale 荣获 CRN 2025 年度企业级存储产品奖项的原因,这一奖项由编辑评选,旨在表彰 ObjectScale 为应对当今企业数据挑战所做出的贡献。

单一平台,叠加性能提升

在符合条件的 Dell PowerEdge 服务器上进行软件定义的 ObjectScale 部署时,内部测试表明,每个节点的读取吞吐量高达 40 GB/秒1,达到上一代全闪存对象平台的 8 倍1。这为 AI 团队提供了一个紧凑、高带宽的引擎,适用于大型训练集、检查点和混合规模的工作负载。

这些优势远不仅限于实验室环境。如今,ObjectScale 正在一些最严苛的环境中证明自己的实力:

  • 大规模高频交易:某位于纽约的大型高频交易 (HFT) 公司每天处理超过 300 亿笔交易,他们依赖 ObjectScale 持续为交易、风险和分析引擎提供数据。
  • 全球金融服务:某全球金融服务公司使用基于 HDD 的多站点 ObjectScale 环境,每天处理 15 亿笔交易,同时通过自动化自助服务为 1,000 多个 AI、分析和备份工作负载提供服务。
  • 英国高频交易:一家位于英国的高频交易公司在小型 ObjectScale 概念验证群集上,稳定实现了约 280 GB/秒的总读取吞吐量

小对象,大性能:块存储与键值优化

现代 AI 管道由小对象主导:日志、指标、特征、表段、向量块和中间训练工件。如果对象层无法高效处理小对象,就会全方位拖慢下游所有环节的速度。ObjectScale 使客户能够自信地构建小对象密集型 AI 管道

它通过块存储引擎来实现这一点,该引擎会在应用纠删码并跨节点分发数据之前,将许多小对象打包到 128 MB 块中。对于典型的 10 KB 文件,单个块中可容纳超过 10,000 个对象,从而减少元数据开销和重建工作量。

这对客户意味着什么:

  • 更高的小对象吞吐量和更低的延迟 — 尤其是在针对小对象读取优化的全闪存 ObjectScale XF960 和基于硬盘的 X560 群集上。
  • 更快的重建速度和更可预测的性能 — 基于块的纠删码可在磁盘或节点发生故障后,将需要重建的数据分片数量从数十亿个减少到数百万个,因此大容量 NVMe 驱动器的重建可以在几个小时而非数周内完成。
  • 减少浪费在后台扫描上的 CPU 资源 — ObjectScale 会为对象进行内联校验和计算,然后在条带级别进行验证,从而释放 CPU 周期,以用于主动读取和写入。

在 ObjectScale 4.2 中,经过重构的键值存储更进一步,实现了大约 4 倍的内存效率提升2,并使元数据的磁盘使用量减少 30% 至 60%2。即便群集规模和对象数量增长,查找依然快速且可预测。

为 GPU 和 LLM 持续馈送数据:S3 over RDMA 和 KV 高速缓存

随着 AI 团队扩大训练和推理规模,瓶颈日益转向数据迁移和上下文记忆,而非原始算力。ObjectScale 的第 4 代版本重点关注这两个方面。

S3 over RDMA:高带宽、低延迟对象访问

S3 over RDMA(在 ObjectScale 4.2 中引入,并在 4.3 中增强)在 S3 访问中采用 RDMA 取代传统 TCP,在内部测试中给客户端带来了显著的优势:

  • 吞吐量提升多达 230%
  • 延迟降低约 80%
  • CPU 使用率降低多达 98%…

…相较于 S3 over TCP。3

随着 4.3 版本的发布,S3 over RDMA for ObjectScale 现已覆盖全闪存产品组合(包括 R7725xdXF960 EXF900 上软件定义的 ObjectScale),从而实现对象数据的超低延迟、高吞吐量的访问。

通过将戴尔的 S3 over RDMA SDK 与 GPU 支持和 RoCEv2 网络协议栈相集成,ObjectScale 绕过了传统的 TCP 和 CPU 瓶颈,在对象存储中的 GPU 和 NVMe SSD 之间建立了近乎直接的路径,满足苛刻的 AI 管道要求。

KV 高速缓存:将 ObjectScale 转化为推理加速器

随着 LLM 进入生产环境,键值 (KV) 高速缓存变得至关重要。推理框架不再为每个 token 重新计算注意力状态,而是重复利用 KV 高速缓存 — 但这种高速缓存很快就会超出 GPU 显存的容量。通过将 KV 高速缓存卸载到 ObjectScale,就能帮助实现更快、响应更迅捷的 AI 体验。

戴尔的可扩展 KV 高速缓存卸载解决方案由 ObjectScale PowerScale 提供支持,利用 vLLMLMCache、NVIDIA 的 NIXL 库以及戴尔的 RDMA 加速 S3 集成,将 KV 高速缓存从 GPU 显存转移到高性能共享存储中。

基准测试表明:

  • 与在 GPU 上重新计算 KV 高速缓存的标准 vLLM 配置相比,首 token 延时 (TTFT) 快了多达 19 倍4
  • token 吞吐量提升了多达 5.3 倍5,多轮对话吞吐量提升了近 3 倍5(在 Dell InfoHub 测试中,即使是在 ObjectScale 和 PowerScale 上存储了数 GB 的 KV 高速缓存)。
  • 在与竞争对手引擎的直接对比中,ObjectScale 的 KV 高速缓存 TTFT 约为 0.86 秒6 ,在已发布的测试结果中表现优于 VAST。

S3 表:AI 优化分析,告别 ETL 拖累

在 ObjectScale 4.3(技术预览版)中,S3 表将基于 Apache Iceberg 的表原生分析直接引入 ObjectScale 存储桶。表驻留在 S3 上,可由 Spark、Flink、Trino 和 Starburst 等引擎直接查询,无需将数据复制到独立的数据库或仓库中,从而减少了 ETL 开销和外部依赖。

内部测试表明:

  • 数据摄取速度提升多达 2 倍7
  • 查询速度提升多达 4.5 倍7

相较于传统以仓库为中心的模式,自动化存储回收和统一 IAM 有助于长期保持高性能并简化运营工作。ObjectScale 正在从单纯的数据落地存储区转变为面向 AI 和 BI 团队的高性能分析平台。

在保持性能的同时,不牺牲规模、效率或简易性

仅有性能并不够,还需要具备规模、效率和简易性。ObjectScale 的第 4 代版本也提升了这些维度:

  • 现代化的键值存储系统,支持高达 122%8 的全球 VDC 增长,同时元数据占用的内存和磁盘空间远少于以往。
  • 存储桶级压缩和多种算法(Snappy、LZ4、ZSTD、Deflate)让团队能够根据工作负载调整速度或压缩率,压缩分析功能将节省的成本转化为 FinOps 指标,而非盲目设置。
  • ObjectScale 新增的 24+2 和 24+4 纠删码选项可将写入放大降低多达 75%9,减少介质磨损和后台开销,从而让更多 I/O 服务于应用程序;在 EX500 等高容量 HDD 平台上,客户可以看到大对象摄取速度提升多达 25%10,中型对象写入性能提升多达 2 倍11
  • 集成的负载平衡器、改进的异地复制空间回收和云原生工具(Kubernetes COSI、Terraform)确保大规模 ObjectScale 环境在增长时依然易于管理。

最终打造出一个性能提升与运营简易性同步发展的平台,无需团队做出取舍。

性能优先的 ObjectScale 路线图为何如此重要

随着 AI 模型和数据管道变得日益复杂,ObjectScale 的路线图始终坚守性能优先 — 无论是进一步提升小对象和大对象吞吐量,还是扩展 S3 over RDMA 和 GPU 感知数据路径,或是深化与 KV 高速缓存、上下文记忆和 AI 优化搜索的集成。

对于构建下一代 AI 和分析技术的组织来说,这意味着一个简单的承诺:您的对象存储绝不会成为发展瓶颈。


资料来源

1基于戴尔在 2025 年 9 月进行的分析,该分析对比了 PowerEdge R7725xd 上的 ObjectScale 4.2 与 ECS EXF900 上的 ECS 3.8 的对象读取性能。实际结果可能有所不同。
2基于戴尔在 2025 年 8 月进行的分析,该分析对比了 ObjectScale 4.2 与 ObjectScale 4.1 中使用的键值存储。实际结果可能有所不同。
3基于戴尔在 2025 年 12 月对 ObjectScale S3 over RDMA 进行的内部测试。实际结果可能有所不同。
4基于 Dell Technologies 内部测试,测试中使用了 LLaMA‑3.3‑70B Instruct 模型,张量并行度为 4。测试衡量了在 100% KV 高速缓存命中率下的首 token 延时 (TTFT),对比了在 PowerScale 和 ObjectScale 存储上运行的戴尔 vLLM + LMCache + NVIDIA NIXL 技术栈与标准 vLLM 基准配置。实际结果可能有所不同。2025 年 11 月。
5基于 Dell Technologies 内部测试,测试中使用了 LLaMA‑3.3‑70B Instruct 模型,张量并行度为 4。测试使用 LM‑benchmark 多轮推理套件衡量了 TPS(每秒 token 数)吞吐量,对比了在 PowerScale 和 ObjectScale 存储上运行的戴尔 vLLM + LMCache + NVIDIA NIXL 技术栈与仅使用 GPU 显存缓存的标准 vLLM 基准配置。实际结果可能有所不同。2025 年 11 月。
6基于 Dell Technologies 内部测试,测试中使用了 LLaMA‑3.3‑70B Instruct 模型,张量并行度为 4。测试衡量了在 100% KV 高速缓存命中率下的首 token 延时 (TTFT)。实际结果可能有所不同。2025 年 11 月。
7基于戴尔在 2025 年 9 月对 ObjectScale S3 表进行的内部测试。实际结果可能有所不同。
8基于戴尔在 2025 年 8 月进行的分析,该分析对比了 ObjectScale 4.2 与 ObjectScale 4.1 中使用的键值存储。实际结果可能有所不同。
9基于戴尔在 2025 年 12 月对 24+4 和 24+2 EC 方案进行的内部测试,对比了 AFA 及 ObjectScale 4.3 代码下的 12+4 方案。实际结果可能有所不同。
10基于戴尔在 2025 年 12 月在 XF960 上运行 4.3 代码对三种纠删码方案进行的内部测试。实际结果可能有所不同。
11基于戴尔在 2025 年 12 月对 ObjectScale 4.3 在 HDD 平台上开启与关闭该功能的情况进行的内部测试。实际结果可能有所不同。

Anahad Dhillon headshot

About the Author: Anahad Dhillon

Anahad Dhillon owns the strategy, planning and roadmap for Dell’s object storage product portfolio. He focuses on bringing customers the most value for their storage investments—through industry leading storage solutions for Enterprise and BigAI use cases.