Uma beta que durou 48 horas
A DeepSeek tornou o V4.1 Flash geralmente disponível a 10 de setembro, dois dias depois de abrir um ponto de acesso em beta cujo encerramento estava marcado para essa mesma data. A empresa tinha chamado ao modelo de teste deepseek-v4.1-flash-expires-on-0910, pelo que a data de desligamento foi publicada antes do próprio modelo.
No seu registo de alterações, a DeepSeek descreve o V4.1 Flash como o modelo mais pequeno de uma nova família de arquitetura, com compreensão visual multimodal nativa integrada no modelo de base em vez de acrescentada por cima. A empresa diz que o desenho procura um teto de capacidade mais alto, inferência mais rápida, maior débito e a possibilidade de escalar para modelos maiores — o que diz tanto sobre o que aí vem como sobre o que foi lançado.
O que substitui o quê
Dois nomes de modelo desaparecem dentro do novo. Os pedidos a deepseek-v4-flash e a deepseek-v4-flash-vision-exp são agora encaminhados para o V4.1 Flash. O ponto de acesso experimental de visão é o sinal mais claro: a compreensão de imagens deixou de ser um ramo lateral da linha Flash.

A mudança maior está no topo da gama. A DeepSeek diz que, a partir de 14 de setembro, os pedidos a deepseek-v4-pro passam igualmente a ser encaminhados para o V4.1 Flash e faturados ao preço do Flash, reformando o V4 Pro até chegar um futuro V4.1 Pro. Quem escolheu o Pro pela capacidade receberá um modelo mais pequeno até esse substituto surgir, e a empresa não disse quando será.
Preços e contexto
A página de preços da DeepSeek indica para o V4.1 Flash uma janela de contexto de um milhão de tokens. Fora das horas de ponta, a entrada custa 0,15 dólares por milhão de tokens em caso de falha de cache e 0,003 em caso de acerto, com a saída a 0,60 dólares por milhão. Nas horas de ponta as tarifas duplicam: 0,30, 0,006 e 1,20. A DeepSeek define a ponta como 01:00–04:00 e 06:00–10:00 UTC em dias úteis, e cobra a tarifa reduzida no resto do tempo.

A empresa afirma que os preços foram reduzidos com o lançamento, sem publicar uma tabela comparativa. O valor do acerto de cache é o número que salta à vista: a 0,003 dólares por milhão de tokens fora de ponta, repetir o início de um prompt quase não custa nada, que é a forma de uma tarifa pensada para ciclos de agentes e documentos longos e não para conversas avulsas.
O que observar
A DeepSeek não publicou resultados de referência para o V4.1 Flash com o lançamento, e os números que circulam da janela de beta são medições de débito feitas por utilizadores, não pontuações de capacidade. Há duas coisas a seguir: se avaliações independentes confirmam a afirmação sobre a arquitetura, e quando aparece o V4.1 Pro — porque, até lá, o modelo público mais capaz da empresa é um de gama Flash.