Une bêta de 48 heures
DeepSeek a rendu V4.1 Flash généralement disponible le 10 septembre, deux jours après avoir ouvert un point d’accès en bêta dont la fermeture était fixée à cette même date. L’entreprise avait nommé le modèle de test deepseek-v4.1-flash-expires-on-0910, si bien que la date d’extinction a été publiée avant le modèle lui-même.
Dans son journal des modifications, DeepSeek décrit V4.1 Flash comme le plus petit modèle d’une nouvelle famille d’architecture, avec une compréhension visuelle multimodale native intégrée au modèle de base plutôt qu’ajoutée par-dessus. La société affirme que cette conception vise un plafond de capacités plus élevé, une inférence plus rapide, un débit supérieur et la possibilité de monter en taille — ce qui en dit autant sur la suite que sur ce qui vient de sortir.
Ce qui remplace quoi
Deux noms de modèle disparaissent dans le nouveau. Les requêtes vers deepseek-v4-flash et deepseek-v4-flash-vision-exp sont désormais redirigées vers V4.1 Flash. Le point d’accès expérimental de vision est le signal le plus net : la compréhension d’images n’est plus une branche latérale de la ligne Flash.

Le changement le plus important se situe en haut de gamme. DeepSeek indique qu’à partir du 14 septembre, les requêtes vers deepseek-v4-pro seront elles aussi redirigées vers V4.1 Flash et facturées au tarif Flash, mettant V4 Pro à la retraite jusqu’à l’arrivée d’un futur V4.1 Pro. Ceux qui avaient choisi Pro pour ses capacités recevront un modèle plus petit en attendant ce remplaçant, dont l’entreprise n’a pas annoncé la date.
Prix et contexte
La page tarifaire de DeepSeek indique pour V4.1 Flash une fenêtre de contexte d’un million de tokens. Hors heures de pointe, l’entrée coûte 0,15 dollar par million de tokens en cas d’échec de cache et 0,003 en cas de succès, la sortie étant à 0,60 dollar par million. Aux heures de pointe, les tarifs doublent : 0,30, 0,006 et 1,20. DeepSeek définit les heures de pointe comme 01:00–04:00 et 06:00–10:00 UTC en semaine, et applique le tarif réduit le reste du temps.

L’entreprise affirme avoir baissé ses prix avec cette sortie, sans publier de tableau comparatif. Le tarif en cas de succès de cache est le chiffre marquant : à 0,003 dollar par million de tokens hors pointe, répéter le début d’une invite ne coûte presque rien, ce qui est la forme d’une tarification pensée pour les boucles d’agents et les longs documents plutôt que pour des échanges isolés.
Ce qu’il faut surveiller
DeepSeek n’a publié aucun résultat de référence pour V4.1 Flash au moment de la sortie, et les chiffres qui circulent depuis la fenêtre de bêta sont des mesures de débit faites par des utilisateurs, pas des scores de capacité. Deux choses méritent d’être suivies : si des évaluations indépendantes confirment l’affirmation sur l’architecture, et quand V4.1 Pro apparaîtra — car d’ici là, le modèle public le plus capable de l’entreprise appartient à la gamme Flash.