Le chiffre qu’OpenAI a choisi de publier

OpenAI a annoncé le 6 septembre avoir atteint l’objectif qu’elle s’était fixé à l’automne 2025 : un “stagiaire de recherche automatisé”, un système qui exécute des tâches de recherche bien définies sous direction humaine. Dans un billet décrivant le fonctionnement actuel de son organisation de recherche, l’entreprise indique qu’à la mi-août elle consommait 3,1 journées d’agent pour chaque journée de travail humain, rapportées à une journée standard de huit heures.

Avant juin 2026, précise-t-elle, le temps d’exécution total des agents dans l’organisation de recherche restait inférieur au travail humain total. Le croisement a pris environ deux mois.

Ce que le ratio ne signifie pas

OpenAI y a joint sa propre mise en garde, qu’il vaut la peine de répéter car le chiffre invite à une lecture erronée. Le ratio n’équivaut pas à une productivité triplée : le travail des agents s’exécute en parallèle, se duplique et exige souvent un pilotage humain lourd. L’entreprise précise aussi que le système ne fixe pas d’agenda de recherche, ne décide pas quelles questions ouvertes méritent des ressources et ne juge pas de l’importance d’un résultat. Cela reste du travail humain.

Des programmeurs travaillant à des bureaux dans un espace ouvert
L'entreprise dit que les agents ne fixent pas d'agenda de recherche ni ne jugent quels résultats comptent. Photographie d'archive. Yan Krukau · pexels · Pexels License

Ce que cela coûte

Les chiffres de dépense sont la partie qui dépasse le cas d’OpenAI. À la mi-août, le chercheur médian dépensait plus de 600 dollars par jour en inférence via des agents de programmation, et le 90e centile plus de 7 000 dollars par jour. Août a établi un record d’expériences par chercheur actif depuis le début du suivi en janvier 2025.

Le calcul acheté est devenu une ligne du travail quotidien d’un chercheur plutôt qu’une décision d’investissement prise une fois par an. À mesure que le code assisté par agents devient moins cher, dit OpenAI, les contraintes se déplacent : vers le calcul expérimental, la qualité des données et le jugement de recherche.

Les incidents de sécurité apparaissent dans les journaux de calcul

Le billet est inhabituellement précis sur la manière dont les décisions de sécurité mordent. Après les compromissions de l’infrastructure d’agents le 20 juillet, le calcul consacré à l’apprentissage par renforcement a fortement chuté. Quand OpenAI a restreint Astra le 7 août pour ses capacités cyber, l’allocation de GPU de classe Astra a baissé de 59,2 % tandis que celle des autres modèles montait de 17,2 % : le travail s’est déplacé plutôt qu’arrêté.

L’entreprise a aussi rappelé une limite à sa propre ambition : “Nous ne savons pas encore comment aller en sécurité jusqu’à une RSI complète et alignée”, écrit-elle à propos de l’auto-amélioration récursive, ajoutant qu’elle ralentirait ou s’arrêterait là où les risques deviendraient inacceptables.

Un couloir de refroidissement entre des rangées de baies de serveurs
Les restrictions sur Astra ont déplacé l'allocation de GPU vers d'autres modèles au lieu de réduire la recherche. Photographie d'archive. panumas nikhomkhai · pexels · Pexels License

Ce qu’il faut surveiller

Le prochain jalon annoncé est un chercheur en IA entièrement automatisé pour mars 2028, dans environ dix-huit mois. La même semaine, le directeur scientifique d’OpenAI, Jakub Pachocki, publiait un essai soutenant qu’aucun laboratoire n’a assez résolu l’alignement pour continuer à monter en échelle à vitesse maximale. Les deux textes viennent de la même entreprise le même jour, et la tension entre eux est ce qu’il faut suivre.