ObjectScale.Next: Ett år av oförtröttlig prestanda för AI-data

Hur branschens mest högpresterande objektlagring1 omvandlar prestandainnovation till verkliga AI-resultat, version efter version.

AI fortsätter att höja ribban för lagring. GPU:er kan inte stå och stampa i väntan på I/O. Streaming-funktioner, inbäddningar och mellanliggande artefakter får inte strypas av flaskhalsar för små objekt. LLM-inferens kan inte skalas om KV-cacheminnet är låst i GPU-minnet istället för att mata acceleratorer vid linjehastighet.

Sedan 4.0-lanseringen för bara ett år sedan har ObjectScale levererat en rad prestandaförbättringar för små och stora objekt, RDMA, GPU-medvetna datasökvägar och KV-cacheavlastning, kombinerade med Dells senaste all-flash-serverteknik i PowerEdge. Samtidigt har den exascale-arkitektur, effektivitet och enkelhet som företagen förlitar sig på bevarats.

Prestandafokuset är en stor anledning till att ObjectScale utsågs till CRN:s Årets produkt 2025 för lagring i företagsklass – en redaktionell utmärkelse som lyfter fram ObjectScales inverkan på dagens tuffaste datautmaningar för företag.

En plattform med kumulativa prestandavinster

I programvarudefinierade ObjectScale-driftsättningar på kvalificerade Dell PowerEdge-servrar har interna tester visat en läsningsgenomströmning per nod på upp till 40 GB/s1 – upp till 8 gånger snabbare1 än tidigare generationers all-flash-objektplattformar. Det ger AI-team en kompakt motor med hög bandbredd för stora träningsuppsättningar, kontrollpunkter och arbetsbelastningar av blandad storlek.

Och vinsterna märks långt utanför labbet. ObjectScale bevisar idag sitt värde i några av de mest krävande miljöerna:

  • Högfrekvenshandel i stor skala: Ett stort New York-baserat högfrekvenshandelsföretag (HFT) bearbetar över 30 miljarder transaktioner per dag och förlitar sig på ObjectScale för att kontinuerligt försörja handels-, risk- och analysmotorer med data.
  • Globala finansiella tjänster: Ett globalt finansföretag använder en HDD-baserad ObjectScale-miljö på flera platser för att bearbeta 1,5 miljarder transaktioner om dagen, samtidigt som den hanterar över 1 000 AI-, analys- och säkerhetskopieringsarbetsbelastningar via automatiserad självbetjäning.
  • Högfrekvenshandel i Storbritannien: Ett brittiskt högfrekvenshandelsföretag har upprätthållit ungefär 280 GB/s i total läsningsgenomströmning på ett litet ObjectScale proof-of-concept-kluster.

Små objekt, stor prestanda: chunk store och nyckelvärdesoptimeringar

Moderna AI-pipelines domineras av små objekt: loggar, mätvärden, funktioner, tabellsegment, vektor-chunks och mellanliggande träningsartefakter. Om objektnivån inte kan hantera små objekt effektivt saktar allt nedströms in. Med ObjectScale kan kunderna tryggt bygga AI-pipelines med fokus på små objekt.

Det sker genom en chunklagermotor som packar många små objekt i 128 MB chunks innan raderingskodning tillämpas och data fördelas över noderna. För typiska 10 KB-filer kan över 10 000 objekt få plats i en enda chunk, vilket minskar både metadata-omkostnader och ombyggnadsarbete.

Vad detta innebär för kunderna:

  • Högre genomströmning för små objekt och lägre latens – särskilt på all-flash-kluster av ObjectScale XF960 och HDD-baserade X560-kluster optimerade för läsning av små objekt.
  • Snabbare ombyggnader och mer förutsägbar prestanda – chunkbaserad raderingskodning minskar antalet skärvor som måste återskapas efter disk- eller nodfel från miljarder till miljoner, så att stora NVMe-enheter kan byggas om på timmar istället för veckor.
  • Mindre CPU-kapacitet går åt till bakgrundssökning – ObjectScale kontrollsummerar objekt inline och verifierar sedan på stripe-nivå, vilket frigör CPU-cykler för aktiva läsningar och skrivningar.

I ObjectScale 4.2 tar en omdesignad Key‑Value Store detta vidare och levererar ungefär 4 gånger högre minneseffektivitet2 och 30–60 % lägre diskanvändning2 för metadata. Detta ger snabba och förutsägbara sökningar även när antalet kluster och objekt växer.

Matning av GPU:er och LLM:er: S3 över RDMA och KV-cache

När AI-team skalar träning och inferens blir flaskhalsen allt oftare dataförflyttning och kontextminne, inte ren beräkningskraft. ObjectScale versioner i fjärde generationen fokuserar på båda.

S3 över RDMA: objektåtkomst med hög bandbredd och låg latens

S3 över RDMA (introducerades i ObjectScale 4.2 och förbättrades i 4.3) ersätter traditionell TCP med RDMA för S3-åtkomst och levererar betydande klientfördelar i interna tester:

  • Upp till 230 % högre genomströmning
  • Ungefär 80 % lägre latens
  • Och upp till 98 % lägre CPU-användning …

… jämfört med S3 över TCP.3

Med version 4.3 är S3 över RDMA för ObjectScale tillgängligt i hela all-flash-portföljen – programvarudefinierad ObjectScale på R7725xd, XF960 och EXF900 – vilket möjliggör åtkomst till objektdata med ultralåg latens och hög genomströmning.

ObjectScale integrerar Dells S3 över RDMA SDK med GPU-stöd och en RoCEv2-nätverksstack och kringgår därmed traditionella TCP- och CPU-flaskhalsar, vilket skapar en nästan direkt väg mellan GPU:er och NVMe SSD:er i objektlagringen för krävande AI-pipelines.

KV-cache: gör ObjectScale till en inferensaccelerator

När LLM:er går i produktion blir Key‑Value (KV) Cache oumbärligt. Istället för att omräkna uppmärksamhetstillstånd för varje token återanvänder inferensramverken KV-cacheminnet, men cacheminnet blir snabbt större än GPU-minnets kapacitet. Att avlasta KV-cacheminnet till ObjectScale ger snabbare och mer responsiva AI-upplevelser.

Dells skalbara lösning för avlastning av KV-cacheminne, som drivs av ObjectScale och PowerScale, flyttar KV-cacheminnet från GPU-minne till högpresterande delad lagring med hjälp av vLLM, LMCache, NVIDIAs NIXL-bibliotek och Dells RDMA-accelererade S3-integration.

Prestandatester visar:

  • Upp till 19 gånger kortare tid till första token (TTFT)4 jämfört med en standardkonfiguration för vLLM som omberäknar KV-cacheminnet på GPU:n.
  • Upp till 5,3 gånger högre tokengenomströmning5 och nästan 3 gånger högre genomströmning vid multikörning5 i Dells InfoHub-tester, även när KV-cacheminnen på flera gigabyte lagras på ObjectScale och PowerScale.
  • KV-cacheminnets TTFT på cirka 0,86 sekunder6 på ObjectScale i direktjämförelser med en konkurrerande motor, vilket slår VAST i publicerade tester.

S3 Tables: AI-optimerad analys utan ETL-flaskhalsen

I ObjectScale 4.3 (Tech Preview) ger S3 Tables Apache Iceberg-baserad, tabellnativ analys direkt till ObjectScale-buckets. Tabellerna finns på S3 och kan nås med förfrågningar från motorer som Spark, Flink, Trino och Starburst utan att data kopieras till separata databaser eller lager, vilket minskar ETL-omkostnader och externa beroenden.

Interna tester har visat:

  • Upp till 2 gånger snabbare inläsning7
  • Upp till 4,5 gånger snabbare förfrågningar7

jämfört med traditionella lagercentrerade mönster, medan automatiserad lagringsåtervinning och enhetlig IAM hjälper till att hålla prestandan hög och driften enklare över tid. ObjectScale övergår från att bara vara en landningszon till att fungera som en aktiv, högpresterande analysyta för AI- och BI-team.

Prestanda utan kompromiss på skala, effektivitet eller enkelhet

Prestanda är bara användbar i kombination med skala, effektivitet och enkelhet. ObjectScale versioner i fjärde generationen främjar även dessa dimensioner:

  • En moderniserad Key‑Value Store stödjer global VDC-tillväxt på upp till 122 %8 jämfört med tidigare versioner samtidigt som den använder betydligt mindre minne och disk för metadata.
  • Komprimering på bucket-nivå och flera algoritmer (Snappy, LZ4, ZSTD, Deflate) låter teamen finjustera för hastighet eller komprimeringsgrad per arbetsbelastning. Komprimeringsanalys förvandlar besparingar till en FinOps-signal istället för en blind inställning.
  • ObjectScales nya 24+2- och 24+4-alternativ för raderingskodning minskar skrivförstärkningen med upp till 75 %9. Detta sänker medieslitaget och bakgrundsbelastningen så att mer I/O-kapacitet frigörs till applikationerna. Kunderna får upp till 25 % snabbare inläsning av stora objekt10 och upp till 2 gånger högre skrivprestanda för medelstora objekt11 på HDD-plattformar med hög kapacitet, exempelvis EX500.
  • En integrerad lastbalanserare, förbättrad utrymmesåtervinning för georeplikering och molnintegrerade verktyg (Kubernetes COSI, Terraform) utmynnar i hanterbara storskaliga ObjectScale-miljöer när de växer.

Resultatet är en plattform där prestandaförbättringar och enkel drift går hand i hand, istället för att teamen tvingas välja mellan dessa två.

Varför en prestandafokuserad handlingsplan för ObjectScale är viktig

När AI-modeller och datapipelines blir allt mer komplexa fortsätter ObjectScales att fokusera främst på prestanda, oavsett om det handlar om att driva vidare på genomströmning för små och stora objekt, utöka S3 över RDMA och GPU-medvetna datasökvägar eller fördjupa integreringen med KV-cache, kontextminne och AI-optimerad sökning.

För organisationer som bygger nästa generationens AI och analys innebär detta helt enkelt att objektlagringen inte är det som bromsar utvecklingen.


Källor

1Baserat på Dells analys där ObjectScale 4.2 på PowerEdge R7725xd jämförs med ECS 3.8 på ECS EXF900 för objektläsningsprestanda, september 2025. De faktiska resultaten kan variera.
2Baserat på Dells analys där Key‑Value Store i ObjectScale 4.2 jämförs med den som används i ObjectScale 4.1, augusti 2025. De faktiska resultaten kan variera.
3Baserat på Dells interna tester av ObjectScale S3 över RDMA, december 2025. De faktiska resultaten kan variera.
4Baserat på interna tester av Dell Technologies med modellen LLaMA‑3.3‑70B Instruct och Tensor Parallelism=4. Testerna mätte prestanda för Time to First Token (TTFT) med 100 % KV-cacheträffar och jämförde Dells stack med vLLM + LMCache + NVIDIA NIXL på PowerScale- och ObjectScale-lagring med en standardkonfiguration för vLLM som baslinje. De faktiska resultaten kan variera. November 2025.
5Baserat på interna tester av Dell Technologies med modellen LLaMA‑3.3‑70B Instruct och Tensor Parallelism=4. Testerna mätte TPS-genomströmning (tokens per sekund) med LMbenchmarks svit för multikörningsinferens och jämförde Dells stack med vLLM + LMCache + NVIDIA NIXL på PowerScale- och ObjectScale-lagring med en baskonfiguration som använder standard-vLLM med enbart GPU-minnescachning. De faktiska resultaten kan variera. November 2025.
6Baserat på interna tester av Dell Technologies med modellen LLaMA‑3.3‑70B Instruct och Tensor Parallelism=4. Testerna mätte prestanda för Time to First Token (TTFT) med 100 % KV-cacheträffar. De faktiska resultaten kan variera. November 2025.
7Baserat på Dells interna ObjectScale S3 Tables-tester, september 2025. De faktiska resultaten kan variera.
8Baserat på Dells analys där Key‑Value Store i ObjectScale 4.2 jämförs med den som används i ObjectScale 4.1, augusti 2025. De faktiska resultaten kan variera.
9Baserat på Dells interna tester av 24+4- och 24+2-EC-scheman jämfört med 12+4 på AFA och ObjectScale 4.3-kod, december 2025. De faktiska resultaten kan variera.
10Baserat på Dells interna tester av 4.3-koden på XF960 med jämförelse av de 3 raderingskodningsschemana, december 2025. De faktiska resultaten kan variera.
11Baserat på Dells interna tester av funktionen aktiverad på ObjectScale 4.3 på HDD jämfört med funktionen avaktiverad, december 2025. De faktiska resultaten kan variera.

Anahad Dhillon headshot

About the Author: Anahad Dhillon

Anahad Dhillon owns the strategy, planning and roadmap for Dell’s object storage product portfolio. He focuses on bringing customers the most value for their storage investments—through industry leading storage solutions for Enterprise and BigAI use cases.