Mistral ouvre l’aperçu et met en avant la capacité que ses rivaux retiennent

Mistral AI a lancé un aperçu public de Mistral Large 4 le 6 octobre, un modèle qu’elle appelle ML4 et, plus familièrement, « le Chonk ». C’est un modèle à mélange d’experts nativement multimodal, avec mille milliards de paramètres au total et 49 milliards actifs par jeton, et Mistral affirme qu’il s’agit du plus grand et du plus performant qu’elle ait construit. Les poids ne sont pas encore publiés : l’entreprise dit qu’elle les mettra en ligne fin octobre, une fois le red teaming terminé.

D’ici là, l’accès est scindé en deux. L’API d’aperçu est ouverte sur Mistral Studio à 1,36 dollar par million de jetons en entrée et 4,18 dollars par million en sortie. Un second groupe — « les responsables de la cybersécurité, les partenaires vérifiés et les autorités étatiques », selon les termes de Mistral — reçoit le même modèle avec une modération réduite et des capacités cyber étendues.

Des câbles réseau bleus branchés sur un panneau de brassage à l'intérieur d'une baie de serveurs
L'API d'aperçu est servie sur la même infrastructure européenne que celle de l'entraînement. Illustration. Brett Sayles · pexels · Pexels License

L’argument est un modèle qui ne refusera pas

L’affirmation centrale de Mistral porte sur le travail de sécurité, et l’entreprise est inhabituellement explicite sur la comparaison. Sur l’Artificial Analysis Cyber Index, une évaluation indépendante de la capacité des modèles à trouver et corriger des failles dans de vrais logiciels, Mistral dit que ML4 figure parmi les cinq meilleurs modèles au monde. Au test de l’index qui demande à un modèle de reproduire une vulnérabilité réelle dans un logiciel open source puis de la corriger, Mistral annonce 82 %, ce qu’elle présente comme le meilleur score de tous les modèles.

La raison, selon elle, n’est pas seulement la capacité. L’entreprise écrit que Claude Opus 5.5 et GPT-6 Astra « obtiennent presque zéro au même test parce qu’ils refusent d’exécuter la tâche ». Son argument : la défense commence par prouver qu’une faille est réelle, et un refus du fournisseur en pleine incidence constitue en soi un risque de sécurité. Sur Cybench, un ensemble de 40 exercices issus de compétitions de sécurité, Mistral annonce 93 % — un chiffre issu de ses propres tests, pas d’une vérification indépendante.

Ce cadrage arrive quelques jours après que Google a livré son premier modèle Gemini 4 aux défenseurs cyber avec les garde-fous cyber desserrés, et il pose la même question non résolue : à qui confie-t-on un modèle qui fera du travail de sécurité offensive sur demande.

Les autres chiffres sont pour l’essentiel ceux de Mistral

En programmation, Mistral annonce 61,7 % sur DeepSWE v1.1, 28,3 % sur Terminal-Bench 4 et 59,4 % sur SWE-Atlas-QnA, ainsi qu’un Coding Agent Index combiné de 49,8 % qu’elle place devant DeepSeek V4 Pro et Qwen3.8 Max. Sur AutomationBench — 657 flux de travail professionnels dans des outils comme Gmail, Google Sheets, Slack et Salesforce — elle annonce 59,9 %.

Une évaluation humaine en aveugle menée avec Surge AI a placé ML4 deuxième de cinq modèles sur la qualité du code, à 3,74 sur 5, devant Kimi K3 de Moonshot AI à 3,59 et GLM-5.3 à 3,60, et derrière Claude Opus 5 à 4,22. Sur l’ancrage visuel, Mistral indique que ML4 obtient 42 % sur Dense 200 contre 41 % pour GPT-6 Astra, le seul point où elle prétend dépasser un modèle fermé de frontière.

Le résumé de Mistral est soigneusement borné : ML4 est « compétitif avec les modèles open source les plus solides au monde » tout en « surpassant significativement tout modèle à poids ouverts développé aux États-Unis ou en Europe ». C’est une affirmation sur un terrain régional et non mondial, et les modèles chinois à poids ouverts restent la référence à battre.

Deux collègues debout dans un bureau lumineux, parcourant ensemble un document
Mistral dit qu'un déploiement européen sera opéré de bout en bout sous le droit européen. Illustration. Yan Krukau · pexels · Pexels License

Entraîné en Europe, sur 3 800 puces

Mistral dit que ML4 a été entraîné de zéro sur 3 800 GPU Nvidia Grace Blackwell dans ses propres centres de données européens, et que l’aperçu public est servi sur la même infrastructure. Une part significative des données d’entraînement était multilingue, selon l’entreprise, couvrant plus de 160 langues dont toutes les langues officielles de l’Union européenne, et un déploiement européen sera opéré de bout en bout sous le droit européen, indépendamment d’autres prestataires de services numériques.

Ce qui manque, c’est tout ce qui permettrait à un tiers de vérifier ces affirmations : les poids, l’architecture, la méthodologie de post-entraînement et les termes de la licence. Mistral dit que tout cela accompagnera la publication de fin de mois. D’ici là, chaque chiffre ci-dessus est un chiffre de fournisseur, à la seule exception du classement dans l’index d’Artificial Analysis.