Um modelo de um bilião de parâmetros sob licença MIT

A Xiaomi lançou na segunda-feira a série MiMo-V2.6 e colocou os pesos no Hugging Face sob licença MIT. O modelo principal, MiMo-V2.6-Pro, é uma mistura esparsa de especialistas com 1,02 biliões de parâmetros no total e 42 mil milhões ativos por token. O mais barato, MiMo-V2.6-Flash, tem 309 mil milhões no total e 15 mil milhões ativos. Ambos aceitam texto, imagens, áudio e vídeo, e ambos têm uma janela de contexto de um milhão de tokens.

A Artificial Analysis, que faz as suas próprias avaliações em vez de republicar as tabelas dos fabricantes, pontuou o MiMo-V2.6-Pro com 46 no seu Intelligence Index e coloca-o em primeiro entre os 114 modelos de pesos abertos que acompanha. A mediana desse índice está em 18.

O preço é o argumento

Na API da Xiaomi, o modelo Pro custa 0,43 dólares por milhão de tokens de entrada e 0,87 por milhão de saída, com 99 por cento de desconto na entrada em cache. O Flash custa 0,14 e 0,28. A Artificial Analysis calcula cerca de 0,13 dólares por tarefa para percorrer todo o índice com o Pro, o que coloca o modelo na fronteira entre inteligência e custo.

Um portátil sobre uma secretária de madeira a mostrar linhas de código
O modelo Pro custa 0,43 dólares por milhão de tokens de entrada. Imagem ilustrativa. Daniil Komov · pexels · Pexels License

Isso é cerca de um quinto do que cobra a comparação ocidental mais próxima. O Grok 4.7, da SpaceXAI, que a Artificial Analysis também pontuou com 46 na mesma segunda-feira, tem preço de 2 dólares por milhão de tokens de entrada e 6 por milhão de saída.

O índice independente regista igualmente os compromissos práticos. O Pro gera 125 tokens por segundo, o décimo segundo mais rápido entre os modelos abertos acompanhados, e demora 2,19 segundos até ao primeiro token. É prolixo: o avaliador precisou de 140 milhões de tokens para correr o índice completo.

Treinado à vista de todos

A Xiaomi apresentou o lançamento como construído em público. Desde 15 de setembro, um painel em direto transmitiu os treinos por reforço dos dois modelos: passos, curvas de recompensa, débito de tokens, resultados de testes e um contador de custo acumulado.

Engenheiros a comentar dados mostrados em monitores de computador
Um painel em direto mostrou as curvas de recompensa e o custo do treino. Imagem ilustrativa. ThisIsEngineering · pexels · Pexels License

Segundo as contas da própria Xiaomi, cada modelo completou 30 passos de aprendizagem por reforço sobre cerca de 750.000 trajetórias, a um custo aproximado de 2,62 milhões de dólares para o Pro e 850.000 para o Flash. A empresa diz ter usado duas técnicas para impedir que os modelos manipulem a própria recompensa: uma constrói uma grelha por tarefa comparando várias tentativas, outra desloca o peso do treino para as melhores soluções válidas dentro de um grupo. São descrições da própria empresa sobre o seu método; ninguém de fora as reproduziu.

O que é aberto e o que não é

A licença MIT cobre os pesos, e a Xiaomi publica ainda o relatório técnico, os ambientes de treino por reforço e o código de reforço. É uma abertura mais ampla do que a da Alibaba na semana passada, quando o Qwen-Image-2.1 chegou com pesos abertos mas licença limitada à investigação.

Uma terceira variante, MiMo-V2.6-Pro-UltraSpeed, é um serviço alojado e não um download: a Xiaomi vende-a com sobretaxa por uma saída até vinte vezes mais rápida.

O que observar

A primeira questão é se a classificação sobrevive ao contacto com avaliadores que não a Artificial Analysis. A segunda é a adoção: uma licença MIT sobre um modelo de um bilião de parâmetros só serve a quem tenha hardware para servir 42 mil milhões de parâmetros ativos, e a maior parte da procura acabará na API alojada e nos encaminhadores, não em GPU próprias.