

ObjectScale
1년 동안 거둔 뛰어난 AI 데이터 관련 성과
AI는 계속해서 스토리지의 기준을 높이고 있습니다. GPU는 I/O를 기다리는 동안 유휴 상태일 수 없습니다. 스트리밍 기능, 임베딩 및 중간 아티팩트는 소규모 오브젝트 병목 현상으로 인해 제한될 수 없습니다. KV 캐시가 회선 속도로 가속기를 제공하는 대신 GPU 메모리에 갇힌 경우 LLM 추론을 확장할 수 없습니다.
불과 1년 전에 4.0이 출시된 이후 ObjectScale 에서는 소규모 및 대규모 오브젝트, RDMA, GPU 인식 데이터 경로, KV 캐시 오프로드 전반에 걸쳐 성능 혁신이 누적되었고, 기업이 사용하는 엑사스케일 아키텍처, 효율성 및 사용 편의성을 유지하는 동시에 최신 올플래시 Dell PowerEdge 서버 기술과 결합되었습니다.
이렇게 성능에 중점을 둔 것이 엔터프라이즈급 스토리지 부문에서 CRN의 2025 Product of the Year로 선정된 주요 이유입니다. 주최 측은 ObjectScale이 오늘날 까다로운 엔터프라이즈 데이터 당면 과제에 미치는 영향을 강조하면서 ObjectScale을 수상 제품으로 선정했습니다.
단일 플랫폼을 활용한 성능 향상
검증된 Dell PowerEdge 서버에 대한 소프트웨어 정의 ObjectScale 배포를 기반으로 실시한 내부 테스트 결과, 노드당 읽기 처리량이 최대 40GB/sec1인 것으로 나타났습니다. 이는 이전 세대 올플래시 오브젝트 플랫폼보다 최대 8배 더 빠른1 수치입니다. 이를 통해 AI 팀은 대규모 학습 데이터 세트, 체크포인트 및 혼합 크기 워크로드를 위한 컴팩트한 고대역폭 엔진을 제공합니다.
이러한 이점은 실험에서만 드러난 결과가 아닙니다. 현재 ObjectScale은 까다로운 환경에서도 그 가치를 입증하고 있습니다.
- 대규모의 고빈도 거래: 뉴욕에 본사를 둔 대형 HFT(High Frequency Trading) 기업 한 곳은 하루 30억 건 이상의 거래를 처리하며 ObjectScale을 사용하여 거래, 위험 및 분석 엔진에 지속적으로 데이터를 공급합니다.
- 글로벌 금융 서비스: 한 글로벌 금융 회사는 멀티 사이트 HDD 기반 ObjectScale 환경을 사용하여 하루 1.5억 건의 거래를 처리하면서 자동화된 셀프 서비스를 통해 1,000개 이상의 AI, 분석 및 백업 워크로드를 처리합니다.
- 영국의 고빈도 거래: 영국의 한 고빈도 거래 회사는 소규모 ObjectScale 개념 증명 클러스터에서 초당 약 280GB의 총 읽기 처리량을 유지했습니다.
소규모 오브젝트, 뛰어난 성능: 청크 저장소 및 키‑값 최적화
최신 AI 파이프라인은 로그, 메트릭, 기능, 테이블 세그먼트, 벡터 청크, 중급 학습 아티팩트와 같은 소규모 오브젝트에 의해 좌우됩니다. 오브젝트 계층이 소규모 오브젝트를 효율적으로 처리할 수 없는 경우 모든 다운스트림이 느려집니다. ObjectScale을 사용하면 고객은 소규모 오브젝트 사용량이 많은 AI 파이프라인을 확실하게 구축할 수 있습니다.
이레이저 코딩을 적용하고 노드 전반에 데이터를 분산하기 전에 많은 소규모 오브젝트를 128MB 청크로 압축하는 청크 저장소 엔진을 통해 수행합니다. 일반적인 10KB 파일의 경우, 하나의 청크 안에 10,000개 이상의 오브젝트가 존재할 수 있어 메타데이터 오버헤드와 재구축 작업을 줄일 수 있습니다.
고객이 얻을 수 있는 이점:
- 소규모 오브젝트 처리량 증가와 짧은 레이턴시 – 특히 소규모 오브젝트 읽기에 맞게 튜닝된 올플래시 ObjectScale XF960 및 HDD 기반 X560 클러스터에서 더욱 그렇습니다.
- 재구축 시간 단축 및 성능 예측 가능성 증가 – 청크 기반 이레이저 코딩은 샤드를 수십억 개에서 수백만 개로 줄여 디스크 또는 노드 장애 발생 후 다시 생성할 수 있으므로 대규모 NVMe 드라이브를 몇 주가 아닌 몇 시간 만에 재구축할 수 있습니다.
- 백그라운드 검사 시 CPU 낭비 감소 – ObjectScale은 오브젝트를 인라인으로 체크섬한 다음 스트라이프 수준에서 확인하여 활성 읽기 및 쓰기를 위한 CPU 주기를 확보합니다.
ObjectScale 4.2에서 새롭게 설계된 키‑값 저장소는 여기서 더 나아가, 메타데이터에 대해 약 4배 더 높은 메모리 효율성2 및 30~60% 더 낮은 디스크 사용량2을 제공합니다. 클러스터 및 오브젝트 수가 증가하더라도 빠르면서 예측 가능한 조회가 가능합니다.
GPU 및 LLM 공급: RDMA 기반 S3 및 KV 캐시
AI 팀이 학습과 추론을 확장함에 따라 병목 현상은 점점 원시 컴퓨팅이 아닌 데이터 이동 및 컨텍스트 메모리가 되고 있습니다. ObjectScale의 4세대 릴리스는 두 가지 모두에 중점을 둡니다.
RDMA 기반 S3: 고대역폭, 짧은 레이턴시의 오브젝트 액세스
RDMA 기반 S3(ObjectScale 4.2에서 도입, 4.3에서 개선)는 S3 액세스에서 기존 TCP를 RDMA로 대체하고, 내부 테스트 결과 클라이언트에 엄청난 이점을 제공합니다.
- 최대 230% 더 많은 처리량
- 약 80% 짧은 레이턴시
- 최대 98% CPU 사용량 감소…
…TCP 기반 S3와 비교.3
릴리스 4.3에서는 R7725xd, XF960 및 EXF900의 소프트웨어 정의 ObjectScale인 올플래시 포트폴리오 전반에서 ObjectScale에 대해 RDMA 기반의 S3를 사용할 수 있으므로 오브젝트 데이터에 대한 매우 짧은 레이턴시, 높은 처리량 액세스를 지원합니다.
ObjectScale은 GPU 지원 및 RoCEv2 네트워킹 스택과 Dell Technologies의 RDMA SDK 기반 S3를 통합함으로써 기존 TCP 및 CPU 병목 현상을 우회하여 오브젝트 스토리지에서 까다로운 AI 파이프라인을 위해 GPU와 NVMe SSD 간에 거의 직접적인 경로를 생성합니다.
KV 캐시: ObjectScale을 추론 가속기로 활용
LLM을 운영 환경에 배포함에 따라 KV(Key‑Value) 캐시가 필수적입니다. 추론 프레임워크는 모든 토큰에 대한 주의 상태를 재계산하는 대신 KV 캐시를 재사용하지만 이 캐시는 GPU 메모리를 빠르게 초과합니다. KV 캐시를 ObjectScale으로 오프로드하면 더 빠르고 응답성이 뛰어난 AI 경험을 제공하는 데 도움이 됩니다.
ObjectScale 및 PowerScale을 기반으로 하는 Dell Technologies의 확장 가능한 KV 캐시 오프로드 솔루션은 vLLM, LMCache, NVIDIA의 NIXL 라이브러리 및 Dell Technologies의 RDMA 가속 S3 통합을 사용하여 KV 캐시를 GPU 메모리에서 고성능 공유 스토리지로 전환합니다.
벤치마크 결과:
- 최대 19배 더 빠른 TTFT(Time to First Token)4와 GPU에서 KV 캐시를 재계산하는 표준 vLLM 구성.
- 최대 5.3배 더 많은 토큰 처리량5 및 거의 3배 더 많은 멀티턴 처리량5 (Dell InfoHub 테스트, ObjectScale 및 PowerScale에 저장된 멀티 기가바이트 KV 캐시를 사용하는 경우에도).
- 경쟁 엔진과의 일대일 비교 시 ObjectScale에서 약 0.86초의 KV 캐시 TTFT6 (공개된 테스트에서 VAST 능가).
S3 테이블: ETL 드래그를 사용하지 않는 AI 최적화 분석
ObjectScale 4.3(Tech Preview)에서 S3 테이블은 ObjectScale 버킷에 Apache Iceberg 기반 테이블 네이티브 분석을 직접 가져옵니다. 테이블은 S3에 유지되고 Spark, Flink, Trino, Starburst와 같은 엔진에서 쿼리할 수 있으며, 이 과정에서 별도의 데이터베이스나 데이터 웨어하우스로 데이터를 복사하지 않아도 되기에 ETL 오버헤드와 외부 의존성을 줄일 수 있습니다.
내부 테스트 결과:
- 최대 2배 더 빠른 수집7
- 최대 4.5배 더 빠른 쿼리7
기존의 웨어하우스 중심 패턴과 비교하면 자동화된 스토리지 재확보 및 통합 IAM을 통해 시간이 지남에 따라 높은 성능을 유지하고 운영을 더 간소화할 수 있습니다. ObjectScale은 단순한 랜딩 존에서 AI 및 BI 팀을 위한 적극적인 고성능 분석 표면의 역할로 전환합니다.
확장성, 효율성 또는 사용 편의성을 놓치지 않으면서 성능 발휘
성능은 확장성, 효율성 및 사용 편의성과 담보된 상태에서만 유용합니다. ObjectScale의 4세대 릴리스도 이러한 관점을 발전시킵니다.
- 현대화된 키‑값 저장소는 이전 버전에 비해 최대 122%8의 글로벌 VDC 성장을 지원하며 메타데이터에 메모리와 디스크를 훨씬 적게 사용합니다.
- 버킷 수준 압축과 여러 알고리듬(Snappy, LZ4, ZSTD, Deflate)을 사용하면 압축 분석을 통해 블라인드 설정 대신 FinOps 신호로 비용 절감을 전환하여 팀에서 워크로드별 속도 또는 비율을 조정할 수 있습니다.
- ObjectScale의 새로운 24+2 및 24+4 이레이저 코딩 옵션은 쓰기 증폭을 최대 75%9까지 줄이고 미디어 마모와 백그라운드 오버헤드를 줄이기 때문에 더 많은 I/O가 애플리케이션을 지원합니다. 고객은 EX500과 같은 대용량 HDD 플랫폼에서 최대 25% 더 빠른 대규모 오브젝트 수집10과 최대 2배 더 높은 중간 크기 오브젝트 쓰기 성능11을 경험할 수 있습니다.
- 통합 로드 밸런서, 향상된 원거리 복제 공간 재확보 및 클라우드 네이티브 툴(Kubernetes COSI, Terraform)을 통해 대규모 ObjectScale 환경이 성장함에 따라 지속적으로 관리할 수 있습니다.
그에 따라 팀이 강제로 선택하는 것이 아니라 성능 개선 사항과 운영 편의성이 함께 작동하는 플랫폼이 탄생했습니다.
성능 최우선 ObjectScale 로드맵이 중요한 이유
AI 모델과 데이터 파이프라인이 점점 더 복잡해짐에 따라 ObjectScale의 로드맵은 성능을 최우선으로 유지합니다. 즉, 소규모 및 대규모 오브젝트 처리량을 더욱 강화하거나, RDMA 및 GPU 인식 데이터 경로 기반의 S3를 확장하거나 KV 캐시, 컨텍스트 메모리 및 AI 최적화 검색과의 통합을 더욱 강화하는 것입니다.
차세대 AI 및 분석을 구축하는 조직은 오브젝트 저장소가 방해가 되지 않는다는 간단한 약속을 덧붙일 수 있습니다.
출처
1오브젝트 읽기 성능을 위해 PowerEdge R7725xd의 ObjectScale 4.2와 ECS EXF900의 ECS 3.8을 비교한 Dell 분석 기준, 2025년 9월. 실제 결과는 달라질 수 있습니다.
2ObjectScale 4.2의 키‑값 저장소를 ObjectScale 4.1에서 사용된 것과 비교한 Dell 분석 기준, 2025년 8월. 실제 결과는 달라질 수 있습니다.
3RDMA 기반의 ObjectScale S3에 대한 Dell 내부 테스트 기준, 2025년 12월. 실제 결과는 달라질 수 있습니다.
4Tensor 병렬 처리=4로 LLaMA‑3.3‑70B Instruct 모델을 사용한 Dell Technologies 내부 테스트 기준. PowerScale 및 ObjectScale 스토리지의 Dell vLLM + LMCache + NVIDIA NIXL 스택을 기본 표준 vLLM 구성과 비교하여 100% KV 캐시 적중률로 측정한 TTFT(Time to First Token) 성능을 테스트합니다. 실제 결과는 달라질 수 있습니다. 2025년 11월.
5Tensor 병렬 처리=4로 LLaMA‑3.3‑70B Instruct 모델을 사용한 Dell Technologies 내부 테스트 기준. PowerScale 및 ObjectScale 스토리지의 Dell vLLM + LMCache + NVIDIA NIXL 스택을 GPU 메모리 전용 캐싱과 함께 표준 vLLM을 사용하는 기준 구성과 비교하여 LMbenchmark 멀티턴 추론 제품군을 사용하여 측정한 TPS(Tokens Per Second) 처리량을 테스트합니다. 실제 결과는 달라질 수 있습니다. 2025년 11월.
6Tensor 병렬 처리=4로 LLaMA‑3.3‑70B Instruct 모델을 사용한 Dell Technologies 내부 테스트 기준. 100% KV 캐시 적중률로 측정한 TTFT(Time to First Token) 성능을 테스트합니다. 실제 결과는 달라질 수 있습니다. 2025년 11월.
7ObjectScale S3 테이블에 대한 Dell 내부 테스트 기준, 2025년 9월. 실제 결과는 달라질 수 있습니다.
8ObjectScale 4.2의 키‑값 저장소를 ObjectScale 4.1에서 사용된 것과 비교한 Dell 분석 기준, 2025년 8월. 실제 결과는 달라질 수 있습니다.
9AFA 및 ObjectScale 4.3 코드에서 24+4 및 24+2 EC 체계를 12+4 체계와 비교한 Dell 내부 테스트 기준, 2025년 12월. 실제 결과는 달라질 수 있습니다.
103개의 이레이저 코딩 스키마 비교를 포함하여 XF960에서 4.3 코드를 대상으로 한 Dell 내부 테스트 기준, 2025년 12월. 실제 결과는 다를 수 있습니다.
11HDD의 ObjectScale 4.3에서 활성화된 기능과 비활성화된 기능을 비교한 Dell 내부 테스트 기준, 2025년 12월. 실제 결과는 달라질 수 있습니다.

