

AI Data Platform
當架構與引力對抗,營運便須付出代價
-
-
-
-
-
- 儲存嵌入式堆疊假定資料會進入命名空間,然而作用於企業環境的力量否定這個觀點。
- 「統一命名空間」的主張是在挑戰資料的三種形式。
- 架構代價是結構性的:管道所有權、資料一致性維護負擔、架構耦合、治理複式簿記、成本不透明。
- 外部力量 (監管、應用程式耦合、合約、所有權) 使這些代價成為永久的負擔,而非過渡性的成本。
- 聯合控制平面是在資料原地運行,並且僅在的確有必要時才會移動資料。
-
-
-
-
如果您正在評估 AI 資料平台,報價單上的細項並不是您唯一的成本。真正的帳單之後才會上門,體現在您必須建構的管道、維持管道運作而需指派的人員,以及每一次必須移動資料方可使用時所放棄的選擇彈性上。
資料具有引力、真正的企業環境充滿會將資料留在原地的失真問題、「資料」本身不是單一物質,它具有三種形式 (資料、中繼資料和向量),每種形式都有其不同的特質和要求。這篇文章則是要探討,當架構假裝這些定律都不適用時,會發生什麼情況。
每個儲存嵌入式堆疊背後的架構假設
儲存嵌入式 AI 堆疊 (最明顯的例子是 VAST AI OS) 是建立在一項架構假設之上:AI 服務會使用已經進入平台的資料來運行。資料必須在平台內部。從平台的角度而言,它看不見命名空間之外的任何東西。1,4
因此,平台附帶能導入資料的工具,以及一套「集中處理資料能簡化作業」的說法。它附帶統一的 UI,在產品展示中使整個環境看起來乾淨俐落。
這套說法能夠自圓其說,然而這也是在挑戰作用於真實企業環境的結構性力量
三種形式指出您不必移動繁重的資料
企業所謂的「資料」實際上是三種不同的東西:
-
- 資料 — 繁重。留在原地。檔案、記錄、影像、影片、遙測、受監管表格。
- 中繼資料 — 輕量。傳播成本低。能讓每個 AI 在任何地方查看每項資產。
- 向量 — 具有位置敏感性。在整個環境中傳播意義,而無須攜帶資料本身。
將這三者視為相同物質的架構,會預設得出一個糟糕的答案:移動所有東西。將它們視為不同東西的架構,則能夠在原地管控繁重的資料,在整個環境傳播中繼資料,並讓向量執行 AI 真正需要的跨環境推論。
如果您唯一認定的形式是資料,那麼統一命名空間就是個有條有理的解答。一旦您接受中繼資料和向量是頭等物件,就會明白前面的答案是錯的。
環境內縮的架構代價
如果以「資料必須先移入平台才能讓 AI 使用」這項假設為前提建立架構,那麼企業中的所有外部力量都會成為營運義務:
-
- 管道所有權。包括 Snowflake、SharePoint、S3、Kafka、第三方儲存裝置、SaaS 在內,每個來源都需要同步作業。1 而每項同步作業背後都需要人力。
- 資料一致性維護負擔。每個副本都從其來源開始偏離:結構偏離、區域性延遲高峰、來源欄位長度變更且缺乏溝通時發生的無訊息截斷。永遠必須有人去察覺並修正這類偏離。
- 結構耦合。當來源系統發生變化時,下游副本會中斷,依賴這些副本的 AI 服務也會隨之中斷。
- 治理複式簿記。存取控制、保留原則、依法保留和稽核軌跡都必須維護兩次,一次在來源,一次在副本。
- 成本不透明。您的 FinOps 團隊必須在一個以整合形式出售的架構中,追蹤資料移動、重複儲存和輸出。
這一切都不是惡意隱藏,而是結構性問題。當封閉的儲存嵌入式模型,遇到開放的分散式資料環境,並嘗試將環境內縮時,就會發生這種情況。1,4
廠商的用詞在這裡很重要。「同步引擎是免費的」和「同步是免費的」並不是同一個意思。同步作業不是一次性遷移。這是兩個必須永遠保持一致的系統之間的永久關係:必須面對結構變更、網路事件、權限變更、保留原則、依法保留,以及任一方偶爾發生的中斷事件。4 而且還得加上您的 AI 工作負載涉及的每一個來源系統,因此您並沒有簡化您的架構。您反而增加了一個在其下方運行、受特定廠商約束的新副本平面。1
外部力量會使代價成為永久的負擔
這種代價不會隨著時間消失的原因在於,創造它的力量不是過渡性的。它們是企業的結構性特徵:
-
- 監管與主權限制。GDPR、HIPAA、資料落地法、出口管制。某些資料必須在原地進行處理。跨越主權邊界的同步作業會造成法規遵循問題。
- 應用程式要求。ERP、CRM、EHR 和交易系統等事實來源應用程式與其所有者耦合。它們並非專為向廠商命名空間饋送資料所設計,而是為經營企業所設計。
- 合約摩擦。超大規模客戶的輸出費用和專有格式,使得擷取資料的成本高於將資料留在原地的成本。擷取資料並將其存放在其他地方的成本,終究會出現在給財務長的報表當中。
- 組織動態。兩個業務部門對相同的資料主張所有權、一家被收購的公司在一夜之間帶來新環境、一個不肯釋出治理權的管理者等情況,顯示組織結構往往會凌駕於理想架構之上。
- 未知或未編目的資料。您知道資料存在,但無法編目。您無法同步找不到的資料。而您無法同步的資料,您的 AI 也看不到,至少在儲存嵌入式模型中看不到。
這些力量當中的每一種,都是真正的企業營運環境所具備的永久特徵。架構若必須指望這些力量消失才能運作,將為此付出無止盡的代價。
聯合替代方案
Dell 的 AI Data Platform 是建立在截然不同的前提之上。Dell 不要求客戶在使用前將資料複製到由廠商控制的命名空間中,而是採用聯合技術的做法:採用一種在資料原地運行的控制平面,橫跨 PowerScale、ObjectScale、第三方儲存裝置、倉儲、SaaS 和公有雲,並且只在真的有必要時才移動資料。4,5
這一項設計決策直接應用了三種形式框架:
-
- 資料留在原地,由原本的治理團隊管控。
- 中繼資料會四處傳播,因此您選擇的每個 AI 都能看到每項資產,無論其位置為何。
- 向量在整個環境中傳播意義,因此 AI 無須先找到資料位置就能進行推論。
不是說聯合架構絕對不會移動資料。在合理前提下它會這樣做,但它不會將移動資料作為從平台獲取價值的先決條件。這一項架構選擇能消除上述大部分的營運代價,因為只有在以「資料必須移到他處才能讓 AI 使用」這項假設為前提建立架構時,這種代價才會存在。4
它還保留了財務長最關心的一件事:選擇彈性。聯合控制平面不會將資料環境困在廠商的命名空間中。它將環境留在原地,由原本的治理團隊管控,並交給 AI 來利用。2,4
有愈來愈多獨立分析師指出這樣的動態。最近的一篇文章指出,儘管 VAST 支援開放標準,但它的「統一架構可能會造成依賴關係,增加未來遷移的難度」是一種委婉說法,意思就是您同步的資料愈多,就愈難離開。2 另一篇文章則指出,VAST 的做法「更類似於超融合式基礎架構模型,提供緊密整合的專屬堆疊,並由 VAST 控制所有體驗。」3 HCI 已經讓業界明白,當該模型遇上大規模的異質性時會發生什麼事。同樣的教訓在這裡也適用。
簽約前該問的三個問題
這些問題應該直接納入您的 RFP。
-
- 在穩定狀態下,我將在貴公司的命名空間中運行多少管道?要求提出以類似您的資料環境為依據的實際預估,而不是建立在理想環境上的參考架構。將其對應您的監管及應用程式耦合環境。
- 當來源系統變更時,誰負責維護資料一致性?如果答案是「由您的團隊用我們的工具來調整」,那營運成本就是由您負擔。請把這筆成本算進去。
- 如果我想在第三年停止同步某個來源,情況會如何?對方的答案可以讓您直接衡量您會放棄多少選擇彈性,並直接掌握退出時該架構會製造多少摩擦。
簡而言之:別為那些沒人告訴您也包含在內的管道買單。
下一步
在下一篇文章中,我將回到資料中心的層次,因為這種架構代價的後果不僅僅是 FTE 問題。這是一個 GPU 經濟問題。必須先引入資料才能執行運算的話,移動資料的成本才是 AI 基礎結構中最昂貴的細項。
1 VAST Data,「DataSpace 和 SyncEngine」產品說明文件。
2 DataPro.news,《VAST Data: Revolutionary AI OS or Silicon Valley Hyperbole?》(VAST Data:革命性的 AI OS 還是矽谷的大話?)2025 年 6 月。
3 NAND Research,《How to Think about VAST Data》(如何思考 VAST Data),2026 年 2 月。
4 Prowess Consulting,《Architectural and Operational Comparison: Dell AI Data Platform vs. VAST AI OS》(架構與營運比較:Dell AI Data Platform 與 VAST AI OS 的比較),由 Dell 委託進行,2026 年 4 月。
5 Dell Technologies,《Dell AI Data Platform with NVIDIA Supercharges Enterprise AI with Breakthrough Data Orchestration and Storage Innovations》(採用 NVIDIA 的 Dell AI Data Platform 以突破性的資料協調和儲存創新來大幅強化企業 AI),美通社,2026 年 3 月。
