Um modelo de fronteira sem atenção completa em camada alguma
A NaiveAI, um laboratório de Pequim fundado em fevereiro que nunca havia publicado um modelo, lançou o Naive-N0.5-Flash sob licença MIT. É um modelo de mistura de especialistas com 309 mil milhões de parâmetros no total e 15,5 mil milhões activos, e declara uma janela de contexto nativa de um milhão de tokens. O invulgar está no que falta: segundo a ficha do modelo, não existe qualquer camada de atenção completa em toda a rede.
Os transformadores costumam manter pelo menos algumas camadas que percorrem todo o contexto. São essas que preservam a informação de longo alcance e, em comprimentos de um milhão de tokens, concentram também a maior parte do custo de descodificação. O Naive-N0.5-Flash elimina-as por inteiro. As suas 48 camadas dividem-se em oito módulos de seis: cinco camadas de atenção por janela deslizante seguidas de uma de DeepSeek Sparse Attention, sendo a primeira camada do primeiro módulo também substituída por DSA. Ficam 39 camadas de janela deslizante e 9 esparsas.
A janela deslizante tem 128 tokens. As camadas esparsas correm um indexador leve de 16 cabeças sobre todo o histórico e só depois calculam a atenção sobre os 2.048 tokens que ele selecciona. A cache completa de chaves e valores é mantida e o indexador continua a varrer tudo, pelo que a poupança está no cálculo da atenção e no tráfego de memória, não no armazenamento.

Construído sobre o modelo base aberto da Xiaomi
O Naive-N0.5-Flash não foi treinado a partir do zero. Parte do modelo base de pesos abertos MiMo-V2.5 da Xiaomi, que a NaiveAI credita nos agradecimentos, ao lado da DeepSeek pelo desenho da atenção esparsa e do projecto SGLang pela infra-estrutura de inferência. Adaptar o modelo base à nova estrutura de atenção foi, diz a empresa, um dos objectivos do pré-treino continuado: 3,25 bilhões de tokens em três fases, com 50 mil milhões de aquecimento do indexador, 3 bilhões de treino com atenção esparsa e 200 mil milhões de decaimento da taxa de aprendizagem.
Essa linhagem importa para ler o lançamento. Trata-se de uma reconversão arquitectónica considerável do modelo base de outra empresa, publicada de forma aberta, e não de um novo pré-treino completo — e é apresentada como prova de que pilhas híbridas de atenção esparsa e deslizante conseguem manter a qualidade até um milhão de tokens.
A NaiveAI publicou também o NaiveRT, o seu sistema de inferência, que segundo a empresa combina fusão de mega-kernels, Programmatic Dependent Launch e descodificação especulativa para entregar 50 tokens por segundo por utilizador em modo padrão e até 2.000 num modo “Ultrafast”. Os pesos e o código de inferência têm licença MIT; a API alojada custa 0,10 dólares por milhão de tokens de entrada, 0,40 de saída e 0,01 por milhão de leituras de cache.
Os números dos testes são da própria empresa
A ficha do modelo apresenta resultados em tarefas de programação e de agentes — SWE-Bench Pro, DeepSWE v1.1, Terminal-Bench 2.1, ALE-CLI, ProgramBench — e num conjunto de testes de investigação e desenvolvimento em IA que inclui PostTrainBench, MLE-bench-30 e PaperBench. São avaliações da própria NaiveAI, não resultados independentes, e a empresa detalha o ambiente: salvo indicação em contrário, correu os testes com o Claude Code 2.1.207, contexto de um milhão de tokens, temperatura 1,0 e top-p 0,95, expondo apenas ferramentas básicas de ficheiros e Bash. As pontuações dos rivais são citadas a partir de blogues, fichas e tabelas públicas de outros fabricantes, em vez de repetidas.

Um laboratório avaliado antes de ter produto
A NaiveAI foi fundada em fevereiro de 2026 por Dai Jifeng, professor associado da Universidade de Tsinghua que passou pela Microsoft Research Asia e pela empresa de visão computacional SenseTime. Com apoio da Tencent, o laboratório levantou cerca de 400 milhões de dólares e alcançou uma avaliação estimada em cerca de 1,42 mil milhões — número que chamou a atenção na semana passada precisamente porque a empresa nada tinha lançado.
Já lançou, e o argumento da ficha técnica é o slogan da casa e não uma pontuação: “Building Frontier AI with AI”. A NaiveAI sustenta que o próprio NaiveRT foi construído e optimizado através daquilo a que chama investigação e desenvolvimento centrados na IA, e remete para um estudo de caso no seu blogue técnico.
O que há a acompanhar é se a arquitectura resiste ao contacto com as cargas de trabalho de terceiros. Um modelo sem qualquer camada de atenção completa é um teste real a saber se uma janela de 128 tokens mais 2.048 tokens escolhidos de forma esparsa podem substituir a atenção global com um contexto de um milhão, e a licença MIT permite que grupos externos façam esse teste em vez de aceitarem os números da empresa. Os pesos exigem hardware Nvidia com suporte FP8 e ocupam cerca de 315 GB, pelo que o teste não será barato.