

ObjectScale
ObjectScale.Next: Un año de rendimiento constante para los datos de IA
La IA sigue subiendo el listón en materia de almacenamiento. Las GPU no pueden permanecer inactivas a la espera de operaciones de E/S. Las funciones de streaming, las integraciones y los artefactos intermedios no pueden verse limitados por cuellos de botella de objetos pequeños. La inferencia de LLM no se puede ampliar si la caché KV está atrapada en la memoria de la GPU, en lugar de alimentar los aceleradores a velocidad de línea.
Desde la versión 4.0, lanzada hace tan solo un año, ObjectScale ha acumulado innovaciones en rendimiento en objetos pequeños y grandes, RDMA, rutas de datos optimizadas para las GPU y descarga de caché KV, combinándolas con la última tecnología de servidores Dell PowerEdge totalmente flash, al tiempo que ha preservado la arquitectura a exaescala, la eficiencia y la sencillez en las que confían las empresas.
Ese enfoque en el rendimiento es una de las principales razones por las que ObjectScale fue nombrado Producto del año de CRN 2025 en la categoría de almacenamiento de clase empresarial, un premio seleccionado por la redacción que destaca el impacto de ObjectScale en los retos de datos empresariales más difíciles de hoy en día.
Una plataforma, ganancias en el rendimiento compuesto
En las implementaciones de ObjectScale definidas por software en servidores Dell PowerEdge cualificados, las pruebas internas han mostrado un rendimiento de lectura por nodo de hasta 40 GB/s1 –hasta 8 veces más rápido1 que las plataformas de objetos totalmente flash de la generación anterior. Esto proporciona a los equipos de IA un motor compacto de gran ancho de banda para grandes conjuntos de entrenamiento, puntos de control y cargas de trabajo de tamaño mixto.
Esos beneficios van mucho más allá del laboratorio. Hoy en día, ObjectScale está demostrando su eficacia en algunos de los entornos más exigentes:
- Comercio de alta frecuencia a gran escala: Una gran empresa de comercio de alta frecuencia (HFT) con sede en Nueva York procesa más de 30 000 millones de transacciones al día, y confía en ObjectScale para mantener los motores de comercio, riesgo y análisis continuamente abastecidos de datos.
- Servicios financieros globales: Una empresa financiera global utiliza un entorno ObjectScale basado en HDD y con múltiples sitios para procesar 1500 millones de transacciones diarias, al tiempo que atiende a más de 1000 cargas de trabajo de IA, análisis y copias de seguridad mediante un autoservicio automatizado.
- Comercio de alta frecuencia en el Reino Unido: Una empresa de comercio de alta frecuencia con sede en el Reino Unido ha mantenido aproximadamente un rendimiento total de lectura de 280 GB/s en un pequeño clúster de prueba de concepto de ObjectScale.
Objetos pequeños, gran rendimiento: optimizaciones de almacenamiento por fragmentos y de clave‑valor
Los pipelines de IA modernos están dominados por objetos pequeños: registros, métricas, funciones, segmentos de tabla, fragmentos de vectores y artefactos de entrenamiento intermedios. Si el nivel de objetos no puede manejar objetos pequeños de manera eficiente, todo lo que sucede a continuación se ralentiza. ObjectScale permite a los clientes crear con confianza pipelines de IA de objetos pequeños y pesados.
Lo hace a través de un motor de almacenamiento por fragmentos que empaqueta muchos objetos pequeños en fragmentos de 128 MB antes de aplicar los códigos de corrección de errores de borrado y distribuir los datos entre los nodos. En el caso de los archivos de 10 kB típicos, un solo fragmento puede albergar más de 10 000 objetos, lo que reduce la sobrecarga de metadatos y el trabajo de reconstrucción.
Qué significa esto para los clientes:
- Mayor rendimiento de objetos pequeños y menor latencia – especialmente en clústeres ObjectScale XF960 totalmente flash y X560 basados en HDD ajustados para lecturas de objetos pequeños.
- Reconstrucciones más rápidas y un rendimiento más predecible – Los códigos de corrección de errores de borrado basados en fragmentos reducen los fragmentos que hay que recrear después de fallos de disco o nodo de miles de millones a millones, por lo que las unidades NVMe grandes se pueden reconstruir en horas en lugar de semanas.
- Menos desperdicio de CPU en el análisis en segundo plano – ObjectScale calcula las sumas de comprobación de los objetos en línea y, a continuación, las verifica en el nivel de banda, liberando ciclos de CPU para lecturas y escrituras activas.
En ObjectScale 4.2, un almacén de clave‑valor rediseñado lleva esto aún más lejos, ya que ofrece aproximadamente una eficiencia de memoria 4 veces mayor2 y un uso de disco entre 30 % y 60 % menor2 para metadatos. Las búsquedas siguen siendo rápidas y predecibles, incluso a medida que crecen los clústeres y el número de objetos.
Alimentación de GPU y LLM: S3 a través de RDMA y caché KV
A medida que los equipos de IA amplían el entrenamiento y la inferencia, el cuello de botella se convierte cada vez más en movimiento de datos y memoria de contexto, no en computación sin procesar. Las versiones de 4.ª generación de ObjectScale se centran en ambos.
S3 a través de RDMA: Acceso a objetos de alto ancho de banda y baja latencia
S3 a través de RDMA (introducido en ObjectScale 4.2 y mejorado en 4.3) reemplaza el TCP tradicional por RDMA para el acceso a S3, lo que ofrece enormes beneficios para el cliente en las pruebas internas:
- Rendimiento hasta un 230 % mayor
- Una latencia aproximadamente un 80 % menor
- Y hasta un 98 % menos de uso de la CPU…
…en comparación con S3 a través de TCP.3
Con la versión 4.3, S3 a través de RDMA para ObjectScale está disponible en toda la cartera totalmente flash (ObjectScale definido por software en R7725xd, XF960 y EXF900), lo que permite acceder a los datos de objetos con una latencia ultrabaja y un alto rendimiento.
Al integrar el SDK S3 a través de RDMA de Dell con compatibilidad con GPU y una pila de red RoCEv2, ObjectScale evita los cuellos de botella tradicionales de TCP y CPU, creando una ruta casi directa entre las GPU y las SSD NVMe en el almacenamiento de objetos para pipelines de IA exigentes.
Caché KV: Convertir ObjectScale en un acelerador de inferencia
A medida que los LLM pasan a producción, la caché de clave‑valor (KV) se vuelve esencial. En lugar de volver a calcular los estados de atención para cada token, las infraestructuras de inferencia reutilizan la caché KV, pero esa caché desborda rápidamente la memoria de la GPU. Descargar la caché KV a ObjectScale ayuda a ofrecer experiencias de IA más rápidas y con mayor capacidad de respuesta.
La solución de descarga de caché KV ampliable de Dell, con tecnología ObjectScale y PowerScale, cambia la caché KV de la memoria GPU al almacenamiento compartido de alto rendimiento mediante vLLM, LMCache, la biblioteca NIXL de NVIDIA y la integración S3 acelerada de RDMA de Dell.
Los benchmarks muestran:
- Tiempo hasta el primer token (TTFT) hasta 19 veces más rápido4 en comparación con una configuración estándar de vLLM que vuelve a calcular la caché KV en la GPU.
- Rendimiento de tokens hasta 5,3 veces mayor5 y rendimiento de varios turnos casi 3 veces superior5 en las pruebas de Dell InfoHub, incluso con cachés KV de varios gigabytes almacenadas en ObjectScale y PowerScale.
- TTFT de caché KV de aproximadamente 0,86 segundos6 en ObjectScale en comparaciones directas con un motor de la competencia, superando a VAST en pruebas publicadas.
Tablas S3: Análisis optimizados para IA sin la carga de ETL
En ObjectScale 4.3 (vista previa técnica), las tablas S3 llevan los análisis nativos de tablas basados en Apache Iceberg directamente a los depósitos de ObjectScale. Las tablas se encuentran en S3 y pueden consultarlas motores como Spark, Flink, Trino y Starburst sin copiar datos en bases de datos o almacenes independientes, lo que reduce la sobrecarga de ETL y las dependencias externas.
Las pruebas internas han mostrado:
- Recopilación hasta el doble de rápida7
- Consultas hasta 4,5 veces más rápidas7
en comparación con los patrones tradicionales centrados en almacenes, mientras que la recuperación de almacenamiento automatizada y el IAM unificado ayudan a mantener un alto rendimiento y a simplificar las operaciones a lo largo del tiempo. ObjectScale pasa de ser solo una zona de inicio a actuar como una superficie de análisis activa y de alto rendimiento para los equipos de IA y BI.
Rendimiento sin renunciar a la capacidad de ampliación, la eficiencia o la sencillez
El rendimiento solo es útil si incluye capacidad de ampliación, eficiencia y sencillez. Las versiones de 4.ª generación de ObjectScale también mejoran en esos aspectos:
- Un almacén de clave‑valor modernizado admite un crecimiento global de VDC de hasta el 122 %8 en comparación con versiones anteriores, al tiempo que consume mucha menos memoria y espacio en disco para metadatos.
- La compresión en el nivel de depósito y varios algoritmos (Snappy, LZ4, ZSTD, Deflate) permiten a los equipos ajustar la velocidad o la relación según la carga de trabajo, con análisis de compresión que convierten el ahorro en una señal de FinOps en lugar de un ajuste a ciegas.
- Las nuevas opciones de códigos de corrección de errores de borrado 24+2 y 24+4 de ObjectScale rebajan la amplificación de escritura hasta en un 75 %9, lo que reduce el desgaste de los soportes y la sobrecarga en segundo plano para que haya más E/S al servicio de las aplicaciones; los clientes observan una recopilación de objetos hasta un 25 % más rápida10, además de un rendimiento de escritura de objetos de tamaño medio hasta dos veces superior11 en plataformas de HDD de alta capacidad como EX500.
- Un equilibrador de carga integrado, la recuperación mejorada del espacio de replicación geográfica y las herramientas nativas de cloud (Kubernetes COSI, Terraform) mantienen gestionables los entornos de ObjectScale a gran escala a medida que crecen.
El resultado es una plataforma en la que las mejoras de rendimiento y la sencillez operativa se combinan, en lugar de obligar a los equipos a elegir.
Por qué es importante una hoja de ruta de ObjectScale centrada en el rendimiento
A medida que los modelos de IA y los pipelines de datos se vuelven más complejos, el roadmap de ObjectScale sigue centrándose en el rendimiento en primer lugar: ya sea impulsando aún más el rendimiento de objetos pequeños y grandes, ampliando S3 a través de RDMA y rutas de datos optimizadas para las GPU, o profundizando en la integración con la caché KV, la memoria de contexto y la búsqueda optimizada para IA.
Para las organizaciones que están desarrollando su próxima generación de IA y análisis, esto se suma a una simple promesa: su almacén de objetos no será lo que le frene.
Fuentes
1Datos basados en un análisis de Dell que compara el rendimiento de lectura de objetos de ObjectScale 4.2 en PowerEdge R7725xd con el de ECS 3.8 en ECS EXF900, septiembre de 2025. Los resultados reales pueden variar.
2Datos basados en un análisis de Dell en el que se compara el almacén de clave‑valor de ObjectScale 4.2 con el utilizado en ObjectScale 4.1, agosto de 2025. Los resultados reales pueden variar.
3Datos basados en pruebas internas de Dell con ObjectScale S3 a través de RDMA, diciembre de 2025. Los resultados reales pueden variar.
4Datos basados en pruebas internas de Dell Technologies con el modelo LLaMA‑3.3‑70B Instruct con paralelismo de tensor=4. Las pruebas midieron el rendimiento del tiempo hasta el primer token (TTFT) con una tasa de aciertos de caché KV del 100 %, comparando la pila vLLM + LMCache + NVIDIA NIXL de Dell en los sistemas de almacenamiento PowerScale y ObjectScale con una configuración de vLLM estándar de referencia. Los resultados reales pueden variar. noviembre de 2025.
5Datos basados en pruebas internas de Dell Technologies con el modelo LLaMA‑3.3‑70B Instruct con paralelismo de tensor=4. Las pruebas midieron el rendimiento de TPS (tokens por segundo) con la suite de inferencia de varios turnos de LMbenchmark, comparando la pila vLLM + LMCache + NVIDIA NIXL de Dell en los sistemas de almacenamiento PowerScale y ObjectScale con una configuración de referencia que utilizaba vLLM estándar con almacenamiento en caché solo en la memoria de la GPU. Los resultados reales pueden variar. noviembre de 2025.
6Datos basados en pruebas internas de Dell Technologies con el modelo LLaMA‑3.3‑70B Instruct con paralelismo de tensor=4. Las pruebas midieron el rendimiento del tiempo hasta el primer token (TTFT) con una tasa de aciertos de caché KV del 100 %. Los resultados reales pueden variar. noviembre de 2025.
7Datos basados en pruebas internas de Dell con tablas de ObjectScale S3, septiembre de 2025. Los resultados reales pueden variar.
8Datos basados en un análisis de Dell en el que se compara el almacén de clave‑valor de ObjectScale 4.2 con el utilizado en ObjectScale 4.1, agosto de 2025. Los resultados reales pueden variar.
9Datos basados en pruebas internas de Dell de esquemas de EC 24+4 y 24+2 en comparación con 12+4 en el código ObjectScale 4.3 y AFA, diciembre de 2025. Los resultados reales pueden variar.
10Datos basados en pruebas internas de Dell del código de 4.3 en XF960 con la comparación de los tres esquemas de códigos de corrección de errores de borrado, diciembre de 2025. Los resultados reales pueden variar.
11Datos basados en pruebas internas de Dell de la función activada en ObjectScale 4.3 en HDD en comparación con la función desactivada, diciembre de 2025. Los resultados reales pueden variar.

