Un modelo a escala de frontera sin atención completa en ninguna capa

NaiveAI, un laboratorio de Pekín fundado en febrero que no había publicado ningún modelo, ha lanzado Naive-N0.5-Flash con licencia MIT. Es un modelo de mezcla de expertos con 309.000 millones de parámetros totales y 15.500 millones activos, y declara una ventana de contexto nativa de un millón de tokens. Lo insólito es lo que falta: según la ficha del modelo, no hay ninguna capa de atención completa en toda la red.

Los transformadores suelen conservar al menos unas cuantas capas que atienden a todo el contexto. Esas capas son las que preservan la información de largo alcance y, con longitudes de un millón de tokens, también son donde se concentra la mayor parte del coste de decodificación. Naive-N0.5-Flash las elimina por completo. Sus 48 capas se reparten en ocho módulos de seis capas: cinco de atención por ventana deslizante seguidas de una de DeepSeek Sparse Attention, con la primera capa del primer módulo también sustituida por DSA. Resultan 39 capas de ventana deslizante y 9 dispersas.

La ventana deslizante es de 128 tokens. Las capas dispersas ejecutan un indexador ligero de 16 cabezas sobre todo el historial y después calculan la atención únicamente sobre los 2.048 tokens principales que selecciona. La caché completa de claves y valores se conserva y el indexador sigue recorriéndolo todo, así que el ahorro está en el cálculo de la atención y en el tráfico de memoria, no en el almacenamiento.

Filas de bastidores de servidores dentro de una sala de datos
El modelo conserva toda la caché de claves y valores: el ahorro está en el cálculo, no en el almacenamiento. Imagen de archivo. ThisIsEngineering · pexels · Pexels License

Construido sobre el modelo base abierto de Xiaomi

Naive-N0.5-Flash no se ha entrenado desde cero. Parte de la base de pesos abiertos MiMo-V2.5 de Xiaomi, a la que NaiveAI acredita en sus agradecimientos junto a DeepSeek por el diseño de atención dispersa y al proyecto SGLang por la infraestructura de inferencia. Adaptar el modelo base a la nueva estructura de atención fue, según la empresa, uno de los objetivos del preentrenamiento continuado: 3,25 billones de tokens en tres etapas, con 50.000 millones de tokens de calentamiento del indexador, 3 billones de entrenamiento con atención dispersa y 200.000 millones de decaimiento de la tasa de aprendizaje.

Ese linaje importa para leer el lanzamiento. Se trata de una reconversión arquitectónica considerable del modelo base de otra empresa, publicada de forma abierta, y no de un nuevo entrenamiento completo, y se ofrece como prueba de que las pilas híbridas de atención dispersa y deslizante pueden mantener la calidad hasta un millón de tokens.

NaiveAI también ha publicado NaiveRT, su propio sistema de inferencia, que según la empresa combina fusión de megakernels, Programmatic Dependent Launch y decodificación especulativa para ofrecer 50 tokens por segundo y usuario en modo estándar y hasta 2.000 en un modo “Ultrafast”. Los pesos y el código de inferencia llevan licencia MIT; la API alojada cuesta 0,10 dólares por millón de tokens de entrada, 0,40 de salida y 0,01 por millón de lecturas de caché.

Las cifras de los tests son de la propia empresa

La ficha del modelo recoge resultados en tareas de programación y agénticas —SWE-Bench Pro, DeepSWE v1.1, Terminal-Bench 2.1, ALE-CLI, ProgramBench— y en un conjunto de pruebas de investigación y desarrollo de IA que incluye PostTrainBench, MLE-bench-30 y PaperBench. Son evaluaciones propias de NaiveAI, no resultados independientes, y la empresa detalla el entorno: salvo indicación contraria, ejecutó las pruebas con Claude Code 2.1.207, un contexto de un millón de tokens, temperatura 1,0 y top-p 0,95, exponiendo solo entrada y salida de archivos y herramientas Bash. Las puntuaciones de los rivales se citan de blogs, fichas y tablas públicas de otros fabricantes en lugar de repetirse.

Ingenieros comentando un diagrama ante una pizarra
NaiveAI afirma que su sistema de inferencia se construyó mediante investigación centrada en la IA. Imagen de archivo. Godfrey Atima · pexels · Pexels License

Un laboratorio valorado antes de tener producto

NaiveAI fue fundado en febrero de 2026 por Dai Jifeng, profesor asociado de la Universidad de Tsinghua que antes trabajó en Microsoft Research Asia y en la empresa de visión por computador SenseTime. Con respaldo de Tencent, el laboratorio levantó unos 400 millones de dólares y alcanzó una valoración estimada de unos 1.420 millones, una cifra que llamó la atención la semana pasada precisamente porque la empresa no había lanzado nada todavía.

Ahora ya lo ha hecho, y el argumento de la ficha del modelo es el eslogan de la casa más que una puntuación: “Construir IA de frontera con IA”. NaiveAI sostiene que NaiveRT se diseñó y optimizó mediante lo que llama investigación y desarrollo centrados en la IA, y remite a un estudio de caso en su blog técnico para el proceso.

Lo que hay que vigilar es si la arquitectura aguanta el contacto con cargas de trabajo ajenas. Un modelo sin ninguna capa de atención completa es una prueba real de si una ventana de 128 tokens más 2.048 tokens seleccionados de forma dispersa pueden sustituir a la atención global con un contexto de un millón, y la licencia MIT permite que grupos externos hagan esa prueba en lugar de aceptar las cifras de la empresa. Los pesos exigen hardware Nvidia con soporte FP8 y ocupan unos 315 GB, así que la prueba no será barata.