Qué se ha publicado
Inception, la empresa fundada por los investigadores de Stanford, UCLA y Cornell responsables del primer gran modelo de lenguaje por difusión, lanzó Mercury 2.5 el 8 de septiembre. La compañía lo describe como el mayor modelo de lenguaje por difusión entrenado hasta la fecha.
Inception afirma que el modelo funciona a más de 1.100 tokens por segundo en producción —AlphaSignal recoge una cifra de 1.107— sobre GPU estándar de Nvidia y no sobre hardware especializado, y que su ventana de contexto ha pasado de 128.000 a 260.000 tokens. El modelo incorpora razonamiento ajustable, uso nativo de herramientas, un modo JSON y llamadas paralelas a herramientas.
Sobre la calidad, la empresa dice que Mercury 2.5 obtiene diez puntos más que Mercury 2 en la medida de inteligencia que cita, y describe el resultado como una mejora de en torno al 40%. Lo sitúa a la altura de GPT-5.6 Luna y Claude Haiku 4.5. Son cifras de Inception sobre un modelo de Inception, y no se publicó ninguna evaluación independiente junto a ellas.
Por qué la difusión es distinta
Un modelo de lenguaje convencional es autorregresivo: produce un token, se condiciona a él, produce el siguiente, y así sucesivamente. La secuencia es el cuello de botella, y todo lo que hace el sector para acelerar la inferencia —agrupación por lotes, decodificación especulativa, mejores núcleos— rodea esa restricción en lugar de eliminarla.

Un modelo de lenguaje por difusión parte de un borrador aproximado de toda la salida y refina los tokens en paralelo a lo largo de pasadas sucesivas. Eso cambia lo que hace el hardware. Es la razón por la que una empresa con mucho menos capital que los laboratorios de frontera puede publicar una cifra de rendimiento varias veces superior a la suya, y por la que el titular es esa cifra y no la puntuación en un banco de pruebas.
El precio y el cliente al que apunta
El precio estándar es de 0,20 dólares por millón de tokens de entrada y 0,75 por millón de salida, con un descuento de lanzamiento del 80% que los deja en 0,04 y 0,15. Los usuarios nuevos reciben 100 millones de tokens gratis. El modelo está disponible a través de la API de Inception, OpenRouter y Baseten.

El cliente para el que está pensado se ve en el caso práctico que publicó Inception: un directivo de OpenCall dijo que su tiempo de respuesta P99 bajó de varios minutos a un segundo tras adoptar Mercury, con una latencia mediana por debajo de 0,2 segundos. Es una carga de trabajo de voz y atención al cliente, donde una respuesta lenta es una respuesta fallida por buena que sea. Inception está respaldada por Menlo Ventures, Mayfield y M12, el fondo de Microsoft.
Qué vigilar a partir de ahora
Si la promesa de calidad sobrevive a una evaluación externa. Los modelos de lenguaje por difusión han cambiado precisión por velocidad de forma sistemática, y la paridad con la clase Haiku es un listón modesto pero real. Conviene ver si el modelo aparece en una clasificación independiente y si el descuento de lanzamiento del 80% se convierte en uso sostenido cuando expire.