

AI Data Platform
当体系结构对抗引力时,运维团队将付出代价
-
-
-
-
-
- 存储嵌入式技术栈总是认为,数据总会流入指定的命名空间。然而,现实中企业资产的客观规律却表明:这根本不可能。
- “统一命名空间”这一宣传论调,本质上是在与三种数据形式进行对赌。
- 由此带来的“体系结构税”是结构性的:管道所有权、数据对齐债务、模式耦合、治理层面的“双重记账”以及成本不透明。
- 外部力量(法规、应用程序耦合、合同、所有权)使这一“架构税”成为永久性的包袱,而非过渡期的阵痛。
- 联合控制平面直接就地对数据进行操作,只有在移动数据是最优解时,才会真正触发数据移动。
-
-
-
-
在评估 AI 数据平台时,报价单上的明细项绝非您的唯一成本。真正的账单要等到后续才会清晰 — 体现在您不得不构建的管道、指派负责维护管道的人员上,也体现在每次仅仅为了保证可用性而被迫移动数据时,您所放弃的选择权之中。
数据具有引力,真实的企业资产中充满了将数据固定在原处的扭曲力;且“数据”本身并非单一物质,而是呈现为三种形式(数据、元数据和向量),每种形式都有着截然不同的特征与需求。本文探讨的是:如果某种体系结构选择罔顾这些定律,将会付出怎样的代价。
所有存储嵌入式技术栈背后的体系结构假设
存储嵌入式 AI 技术栈(以 VAST AI OS 为最典型代表)建立在单一的体系结构假设之上:AI 服务将基于已导入该平台的数据运行。数据必须留存在平台中。从平台的角度来看,命名空间之外的任何内容都不可见。1,4
因此,该平台随附数据导入工具,同时也附带了一套关于“数据集中化如何简化运维”的宣传说辞。它提供了统一的用户界面 (UI),在演示中,将整个企业资产粉饰成一个干净利落的整体。
这套说辞在内部逻辑上确实能自洽。但这同样是在与真实企业资产中根深蒂固的结构性力量进行博弈。
这三种数据形式表明:您其实无需移动那些笨重的数据
企业口中的“数据”,实为三种截然不同的事物:
-
- 数据 — 笨重。保留在原位。文件、记录、图像、视频、遥测数据、受监管的表格。
- 元数据 — 轻量级。传播成本极低。让任何 AI 都能“看见”任何资产,无论其位于何处。
- 向量 — 具备局部敏感性。在整个企业资产中传递语义,而无需搬运数据本身。
将这三者视为同一种物质的体系结构,默认只能给出一个糟糕的答案:移动一切。而区别对待这三者的体系结构,则可以让笨重的数据就地接受治理、在整个企业资产中传播元数据,并让向量去执行 AI 真正需要的跨环境推理。
如果您唯一认可的数据形式只有原始数据,那么统一命名空间不失为一个自洽的答案。但一旦您承认元数据和向量也是“一等公民”,这一方案便成了错误的答案。
将整个企业资产向内拉扯的“体系结构税”
当一种体系结构建立在“数据必须先导入,AI 才能触及它”这一假设之上时,企业中的每一股外部力量都会转变为一项运维负担:
-
- 数据管道所有权。每个数据源(包括 Snowflake、SharePoint、S3、Kafka、第三方存储、SaaS)都需要同步作业。1而每个同步作业背后,都需要人力来维护。
- 数据对齐债务。每一个副本都会与其源数据产生偏差。当源字段长度发生改变且无人告知时,就会引发模式漂移、区域延迟尖峰以及无声的数据截断。必须始终有人去检测并纠正这种偏差,无休无止。
- 模式耦合。当源系统发生变化时,下游副本就会中断,而依赖这些副本的 AI 服务也会随之瘫痪。
- 治理的双重记账。访问控制、保留策略、监管留存和审计追踪必须维护两次 — 在源系统中维护一次,在副本中再维护一次。
- 成本不透明。在一种最初以“整合”为卖点的体系结构上,您的 FinOps 团队现在却不得不去追踪数据移动、存储复制以及数据出站费用。
这一切并不是供应商恶意隐瞒的缺陷,而是结构本身造成的必然结果。当封闭的存储嵌入式模型遇到开放的分布式数据资产,并试图将这些资产向内拉扯时,就必然会发生这种情况。1,4
此时,供应商的措辞就显得尤为关键。“同步引擎免费”和“同步操作无成本”完全是两码事。数据同步作业绝非一次性的迁移。它是两个系统之间必须永远保持一致的永久性关系,两者都要对抗模式变化、网络事件、权限变更、保留策略、监管留存以及任何一方偶尔出现的中断。4将这一工作量乘以您 AI 工作负载所触及的每一个源系统,您就会发现这根本没有简化您的体系结构。您实际上只是在其下方添加了一个供应商专属的数据副本层。1
外部力量导致这种体系结构税变成永久性支出
这种体系结构税之所以不会随着时间推移而消散,是因为产生它的力量并非过渡期间的阵痛。它们是企业固有的结构性特征:
-
- 法规和主权合规性约束。GDPR、HIPAA、数据驻留法、出口管制。某些数据必须在本地(即数据所在地)进行处理。一旦同步作业越过主权边界,就很可能演变成合规性事件。
- 应用程序需求。作为事实来源的应用程序(如 ERP、CRM、EHR 和交易系统)与其所有者深度绑定。它们的设计初衷绝不是向某个特定的供应商命名空间输送数据,而是为了支撑业务的运行。
- 合同摩擦。超大规模云服务商高昂的数据出站费用以及专有格式,使得提取数据的成本远高于将其保留在原处的成本。为了将数据导入其他地方而将其从原平台提取出来,这项成本开支迟早会被您的 CFO 发现。
- 组织动态。两个业务部门争夺同一数据的所有权、一家被收购公司的 IT 资产在一夜之间突然并入、数据管理员拒绝交出治理权 — 企业的组织架构图往往会轻易凌驾于理想中的完美的体系结构之上。
- 未知或未编目的数据。那些您明知其存在却无法编目的数据。找不到的数据,自然无法同步。而凡是您无法同步的数据,您的 AI 也就无法“看见”— 至少在存储嵌入式模型中是如此。
上述这每一股力量,都是真实企业运维环境中的固有特征。如果某种体系结构寄希望于这些限制自行消失,那么它将不得不无限期地支付这笔“体系结构税”。
联合替代方案
Dell AI Data Platform 则是基于截然不同的前提构建而成的。戴尔的方法是建立“联合控制平面”,而不是要求客户在启用数据之前,必须先将其复制到由特定供应商控制的命名空间中:联合控制平面直接对分布在 PowerScale、ObjectScale、第三方存储、数据仓库、SaaS 和公有云中的本地数据进行就地操作,且仅在移动数据确属正确选择时才进行移动。4,5
这一独特的设计决策,是对数据“三种形式”分析框架的直接应用:
-
- 原始数据保留在原地,由原有的治理团队继续进行治理。
- 元数据则全局传播,这样您选择的任何 AI 都能“看到”每一项资产,不论其位于何处。
- 向量则在整个企业资产中传递语义,因此 AI 无需预先迁移数据即可对其进行推理。
这并不是说联合体系结构绝不移动数据。当移动数据确实有意义时,它们当然也会移动。但它们不会将数据移动作为从平台中获取价值的前提条件。仅凭这一项体系结构决策,就杜绝了上述绝大部分的运维税 — 因为只有在您将体系结构建立在“必须先迁移数据,然后 AI 才能触及数据”这一假设之上时,这种高昂的体系结构税才会存在。4
除此之外,它还保留了 CFO 最关心的关键要素:选择权。联合控制平面不会将企业的数据资产锁死在某一家供应商的命名空间之中。它让数据资产保留在原处,由原有管理团队继续治理,同时可供 AI 使用。2,4
越来越多的独立分析师开始指出这一行业动态趋势。最近的一篇文章指出,尽管 VAST 支持开放标准,但其“统一的体系结构可能会产生依赖性,使未来的迁移面临挑战”— 这种说法相对委婉,如果直白地说,就是您同步进去的数据越多,日后就越难脱身。2而另一份报告也指出,VAST 的方法“更类似于超融合基础架构 (HCI) 模型,交付的是一个高度集成、由其完全主导的技术栈,VAST 控制着整个体验流程”。3HCI 的历史教训早已让业界看清:当该模型遭遇大规模异构环境时,会发生什么。同样的教训在这里同样适用。
签约前需要提出的三个问题
请直接将这些问题纳入您的 RFP 中。
-
- 在稳定运行状态下,我需要向你们的命名空间中引入并运行多少条数据管道?请要求对方根据与您类似的真实数据资产规模给出切实的估算,而不是基于全新部署环境构建的参考体系结构。将这一估算结果,与您受法规约束及存在应用程序耦合的现有资产进行对比。
- 当源系统发生变更时,由谁来负责数据对齐?如果得到的回答是“由您的团队使用我们的工具来完成”,那这就是您的隐性运维成本。请为其进行定价估算。
- 如果我在第三年想要停止同步某个源数据,那会怎么样?这一问题的答案,可以直接衡量您放弃了多少选择权,并直接反映该体系结构在您退出时会产生多大的阻碍和成本摩擦。
简而言之:不要为您在购买前毫不知情的隐性管道买单。
后续计划
在下一篇文章中,我将重新回到数据中心层面进行探讨,因为这种“体系结构税”所带来的后果,绝非仅仅是 FTE 问题。这本质上是一个 GPU 经济性问题。如果数据必须先落地,算力才能开始运行,那么您 AI 基础架构中成本极高的预算明细项,实际上就一直在为这些无谓的等待买单。
1 VAST Data,《DataSpace and SyncEngine》产品文档。
2 DataPro.news,《VAST Data: Revolutionary AI OS or Silicon Valley Hyperbole?”》2025 年 6 月。
3 NAND Research,《How to Think about VAST Data》,2026 年 2 月。
4 Prowess Consulting,《Architectural and Operational Comparison: Dell AI Data Platform vs. VAST AI OS》,受戴尔委托撰写,2026 年 4 月。
5 Dell Technologies,《Dell AI Data Platform 采用 NVIDIA 技术,通过突破性的数据编排和存储创新加速企业 AI 落地》,PR Newswire,2026 年 3 月。
