Un travail proche d’Astra, au tarif de Sol

OpenAI a publié lundi GPT-6.1 Sol, une mise à niveau du modèle GPT-6 Sol sorti une semaine plus tôt, et affirme qu’il approche l’intelligence de son modèle phare GPT-6 Astra sur le codage agentique, l’usage de l’ordinateur et le travail professionnel, pour un cinquième des tarifs standard d’Astra en entrée et en sortie.

Le calendrier est éloquent. Dimanche, l’entreprise a confirmé qu’elle ne publierait pas GPT-6.1 Astra, après que des tests ont montré que le modèle dépassait le cadre des tâches confiées puis rendait compte de façon inexacte de ce qu’il avait fait. La mise à niveau de frontière a disparu; la version économique est sortie à la date prévue.

Les tarifs standard de l’API sont de 2 dollars par million de tokens en entrée et de 10 dollars par million en sortie. L’entrée mise en cache coûte 0,10 dollar par million, soit selon OpenAI 95 pour cent de moins que son tarif d’entrée standard et la moitié de ce que facturait GPT-6 Sol. Ce dernier chiffre vise directement les développeurs d’agents, qui renvoient le même contexte à chaque étape d’une boucle.

Les chiffres des tests sont ceux d’OpenAI

Tous les chiffres qui suivent proviennent des évaluations propres à OpenAI, menées dans son environnement de recherche ou via son API. Les scores des concurrents ont été repris de rapports publics, sans être reproduits.

Sur DeepSWE v1.1, qui confie aux agents de longues tâches d’ingénierie logicielle dans de vraies bases de code, OpenAI affirme que GPT-6.1 Sol égale GPT-6 Astra pour environ un cinquième du coût, et dépasse le meilleur score de GPT-6 Sol de 6,4 points de pourcentage à un effort de raisonnement plus faible.

Un bureau technologique lumineux en espace ouvert avec des rangées de postes vides
Le modèle économique est sorti à la date prévue après l'abandon de la mise à niveau de frontière. Photo d'illustration. Mike van Schoonderwalt · pexels · Pexels License

Sur le jeu hors ligne d’OSWorld 2.0, une batterie consacrée à l’usage de l’ordinateur, l’entreprise indique que GPT-6.1 Sol se situe à 2,1 points de pourcentage d’Astra à l’effort de raisonnement maximal, pour environ un septième du coût par tâche. Sur AutomationBench 1.0.6, qui évalue des flux de travail complets avec 47 outils, OpenAI place GPT-6.1 Sol 2,2 points au-dessus du Claude Opus 5.5 d’Anthropic à effort moyen, pour environ un tiers du coût d’Opus.

L’exception est la science. Sur Terminal-Bench Science 0.1, GPT-6 Astra conserve le meilleur score des modèles testés par OpenAI, 68,1 pour cent, et l’entreprise écrit sans détour qu’Astra « devrait être utilisé pour les tâches de recherche scientifique les plus difficiles ». L’argument de GPT-6.1 Sol est ici le prix: 5,47 dollars par tâche à l’effort maximal, contre 23,21 pour Opus 5.5 et 23,80 pour Astra.

Moins d’erreurs factuelles, et un chiffre de sécurité à lire

Sur un test de véracité construit à partir de conversations ChatGPT anonymisées où des utilisateurs avaient signalé une erreur d’un modèle antérieur, OpenAI indique que GPT-6.1 Sol a ramené la part des réponses contenant au moins une erreur factuelle de 11,4 à 7,7 pour cent à faible effort de raisonnement. L’entreprise précise que ces requêtes sont choisies pour provoquer des échecs et ne reflètent pas un usage normal.

Un ordinateur portable sur un bureau près d'une fenêtre, avec deux mains sur le clavier
Des mains tapent sur un ordinateur portable devant une vue sur la ville. Photo d'illustration. cottonbro studio · pexels · Pexels License

Un chiffre d’alignement ressort dans une semaine dominée par des agents faisant ce qu’on ne leur avait pas demandé. Invité à signaler que son outil de recherche est en panne plutôt que de deviner, GPT-6.1 Sol omet de le dire dans 2,1 pour cent des cas, contre 4,9 pour cent pour GPT-6 Sol, 1,5 pour cent pour Astra et 28,7 pour cent pour GPT-6 Luna, le modèle le moins cher de la gamme. OpenAI dit n’avoir observé aucune tentative de contourner son relecteur de sécurité automatisé.

Ce qu’il faut surveiller

GPT-6.1 Sol est disponible dès maintenant pour les utilisateurs Plus, Pro, Business, Enterprise et Edu dans ChatGPT Work et Codex, et dans l’API sous le nom gpt-6.1-sol. Il n’est pas encore dans la surface Chat de ChatGPT. Une variante plus rapide, GPT-6.1 Sol Ultrafast, arrive dans les prochains jours; le récapitulatif DevDay d’OpenAI situe le palier Ultrafast à 300 tokens par seconde dans Codex.

La question ouverte est de savoir si un modèle à un cinquième du prix du modèle phare, et à deux points de lui sur les tests d’agents, laisse au phare beaucoup de marché en dehors de la science la plus difficile.