Qué cambia en esta ronda

MLCommons publicó el 16 de septiembre los resultados de MLPerf Inference v6.1, la referencia del sector para medir con qué rapidez el hardware y el software sirven modelos de IA. Enviaron resultados 30 organizaciones, un récord según MLCommons, entre ellas seis debutantes: Atlas Inference, Crusoe, Orrick Industries, ScitiX, VibeHPC y el colaborador individual Naeem Khoshnevis.

La ronda incorpora dos pruebas. Una de generación aumentada por recuperación (RAG) de extremo a extremo mide un flujo completo de preguntas y respuestas en el que colaboran un modelo de embeddings, un recuperador, un reordenador y un modelo de lenguaje. Otra de inferencia agéntica en el borde mide conversaciones de varios turnos cuyo contexto crece, con tareas de programación y umbrales de precisión que el sistema debe cumplir.

«Añadimos la prueba de RAG de extremo a extremo porque responder consultas ya va más allá de un LLM entrenado con un corpus», dijo Miro Hodak, copresidente del grupo de trabajo de MLPerf Inference.

Filas de servidores en rack iluminados en azul
El mayor sistema de la ronda usó 512 aceleradores, según MLCommons. Imagen ilustrativa. panumas nikhomkhai · pexels · Pexels License

Nuevo hardware y sistemas mayores

Entre los aceleradores nuevos figuran los Ryzen AI Max+ 395 e Instinct MI350P de AMD, el Arc Pro B70 de Intel y el Rubin de Nvidia. El rack Vera Rubin NVL72 de Nvidia aparece como envío en vista previa. MLCommons dice que el mayor sistema presentado usó 512 aceleradores y que hubo dos sistemas heterogéneos, uno que combina fabricantes y otro repartido entre ubicaciones.

El consorcio informa de que los resultados en la prueba de modelos de visión y lenguaje mejoraron 2,99 veces en seis meses y que el rendimiento en su prueba de DeepSeek-R1 ha mejorado 5,7 veces en un año. También enviaron resultados AMD, Cisco, CoreWeave, Dell, Google, Hewlett Packard Enterprise, Intel, Microsoft Azure, Nebius, Oracle, Red Hat y Supermicro.

Lo que afirma Nvidia

En su propia entrada, Nvidia asegura que Vera Rubin NVL72 logró hasta 3,7 veces el rendimiento de su GB300 NVL72 en la prueba Qwen3-VL y hasta 2,5 veces en DeepSeek-R1. Dice que GB300 NVL72 escaló con un 99 % de eficiencia en cuatro racks, 288 GPU, y que solo las mejoras de software elevaron el rendimiento hasta 1,6 veces desde la ronda anterior.

Un portátil muestra un gráfico sobre una mesa
MLCommons informa de grandes mejoras en sus pruebas de visión y lenguaje y de DeepSeek-R1. Imagen ilustrativa. ThisIsEngineering · pexels · Pexels License

Esos múltiplos son comparaciones de Nvidia a partir de sus propios envíos. Las cifras de Vera Rubin proceden de una entrada en vista previa, que abarca hardware aún no disponible de forma general. Nvidia añade que 19 socios enviaron resultados con sus plataformas.

Por qué importan las nuevas pruebas

Las pruebas de inferencia se han centrado durante años en un solo modelo que responde a una sola consulta. Las de RAG y agentes miden los sistemas que muchas empresas despliegan hoy, con varios modelos en cadena y un contexto que crece durante la conversación. Cuántos fabricantes participen en ellas en la próxima ronda dirá si se convierten en las cifras que comparan los compradores.