Uma beta que durou 48 horas

A DeepSeek tornou o V4.1 Flash geralmente disponível a 10 de setembro, dois dias depois de abrir um ponto de acesso em beta cujo encerramento estava marcado para essa mesma data. A empresa tinha chamado ao modelo de teste deepseek-v4.1-flash-expires-on-0910, pelo que a data de desligamento foi publicada antes do próprio modelo.

No seu registo de alterações, a DeepSeek descreve o V4.1 Flash como o modelo mais pequeno de uma nova família de arquitetura, com compreensão visual multimodal nativa integrada no modelo de base em vez de acrescentada por cima. A empresa diz que o desenho procura um teto de capacidade mais alto, inferência mais rápida, maior débito e a possibilidade de escalar para modelos maiores — o que diz tanto sobre o que aí vem como sobre o que foi lançado.

O que substitui o quê

Dois nomes de modelo desaparecem dentro do novo. Os pedidos a deepseek-v4-flash e a deepseek-v4-flash-vision-exp são agora encaminhados para o V4.1 Flash. O ponto de acesso experimental de visão é o sinal mais claro: a compreensão de imagens deixou de ser um ramo lateral da linha Flash.

Uma pessoa a fotografar folhas impressas com um telemóvel
A compreensão de imagens está integrada no modelo de base em vez de depender de um ponto de acesso de visão à parte. https://kaboompics.com/ · pexels · Pexels License

A mudança maior está no topo da gama. A DeepSeek diz que, a partir de 14 de setembro, os pedidos a deepseek-v4-pro passam igualmente a ser encaminhados para o V4.1 Flash e faturados ao preço do Flash, reformando o V4 Pro até chegar um futuro V4.1 Pro. Quem escolheu o Pro pela capacidade receberá um modelo mais pequeno até esse substituto surgir, e a empresa não disse quando será.

Preços e contexto

A página de preços da DeepSeek indica para o V4.1 Flash uma janela de contexto de um milhão de tokens. Fora das horas de ponta, a entrada custa 0,15 dólares por milhão de tokens em caso de falha de cache e 0,003 em caso de acerto, com a saída a 0,60 dólares por milhão. Nas horas de ponta as tarifas duplicam: 0,30, 0,006 e 1,20. A DeepSeek define a ponta como 01:00–04:00 e 06:00–10:00 UTC em dias úteis, e cobra a tarifa reduzida no resto do tempo.

Uma pessoa a programar no teclado de um portátil
A partir de 14 de setembro, os pedidos ao V4 Pro são respondidos pelo V4.1 Flash e faturados ao preço do Flash. TREEDEO.ST · pexels · Pexels License

A empresa afirma que os preços foram reduzidos com o lançamento, sem publicar uma tabela comparativa. O valor do acerto de cache é o número que salta à vista: a 0,003 dólares por milhão de tokens fora de ponta, repetir o início de um prompt quase não custa nada, que é a forma de uma tarifa pensada para ciclos de agentes e documentos longos e não para conversas avulsas.

O que observar

A DeepSeek não publicou resultados de referência para o V4.1 Flash com o lançamento, e os números que circulam da janela de beta são medições de débito feitas por utilizadores, não pontuações de capacidade. Há duas coisas a seguir: se avaliações independentes confirmam a afirmação sobre a arquitetura, e quando aparece o V4.1 Pro — porque, até lá, o modelo público mais capaz da empresa é um de gama Flash.