De la paperasse avant l’entraînement
OpenAI a publié dimanche des lignes directrices sur ce qui devrait selon elle être documenté avant qu’un entraînement de frontière par apprentissage par renforcement soit autorisé à se poursuivre. La formule est nette: « nous pensons entrer dans une ère nouvelle où une documentation de sécurité structurée devrait être exigée avant de poursuivre tout entraînement de frontière par apprentissage par renforcement ».
Le modèle emprunté est le « dossier de sécurité »: l’argumentaire structuré et fondé sur des preuves utilisé dans l’aviation et le nucléaire. OpenAI y voit « une étoile polaire vers laquelle nous construisons », et concède que l’analogie est imparfaite en raison de « la complexité émergente à chaque nouveau niveau de capacité ».
Trois couches techniques, et une règle sur les chaînes de pensée
La moitié technique du document couvre l’entraînement à l’alignement, le confinement et la surveillance: entraîner le modèle à ne pas agir contre l’intention, rendre difficile son évasion s’il le fait, et le détecter s’il essaie.
Pour l’alignement, OpenAI propose d’employer des agents pour repérer et réparer les environnements d’apprentissage par renforcement défectueux où un raccourci peut obtenir une note élevée, d’ajuster les correcteurs pour pénaliser l’exploitation, et de tester rétrospectivement les évaluations d’alignement sur des incidents passés afin qu’elles ne leur soient pas simplement surajustées. Elle propose aussi de suivre si un modèle comprend qu’il est testé, avec « des seuils de blocage précis ».

Une ligne est singulièrement précise: ne pas laisser les correcteurs automatiques voir la chaîne de pensée pendant l’apprentissage par renforcement, car cela risque de faire « évoluer les modèles pour échapper aux moniteurs de chaîne de pensée ». C’est un choix délibéré de renoncer à de la capacité pour garder le raisonnement lisible.
Le confinement couvre des bacs à sable durcis, des tests d’intrusion contre ce bac à sable à partir de points de contrôle d’entraînements réels, la fermeture des canaux latéraux à haut débit entre échantillons, et la conservation des transcriptions d’agents dans un stockage à écriture unique, pour qu’une enquête ne puisse être retouchée après coup. La surveillance exige un bon rappel sur les incidents passés, des données d’évaluation fraîches pour que ces chiffres ne se périment pas, et une règle de réaction: alerter l’astreinte le jour, et mettre automatiquement en pause les entraînements sur alerte non acquittée la nuit.
Qui peut arrêter un entraînement
La moitié opérationnelle porte la gouvernance. OpenAI dit qu’une fois un dossier rédigé, quelqu’un d’une autre équipe devrait écrire une objection — un pré-mortem — pour y trouver des failles. Le dossier devrait être approuvé par des dirigeants qui « devraient chacun pouvoir opposer leur veto à l’entraînement »: un responsable ou vice-président de la recherche, le responsable de la sécurité et le directeur scientifique.

Elle va plus loin sur la responsabilité: le dirigeant responsable d’un entraînement devrait répondre du dossier et de toute réponse à incident « y compris dans le cadre des évaluations de performance ». L’escalade devrait suivre des niveaux de gravité définis, avec une astreinte capable d’alerter les dirigeants — le document cite le directeur général — dès qu’un entraînement atteint un certain niveau. Les fonctions de sécurité devraient échouer en position fermée: on ne devrait pas pouvoir démarrer un entraînement sans surveillance active, ni désactiver le moniteur depuis l’entraînement lui-même.
Les auditeurs, dit le document, devraient disposer d’un accès suffisant pour vérifier la solidité des affirmations.
Ce que c’est, et ce que ce n’est pas
OpenAI indique que ces recommandations sont « en cours de mise en œuvre » en interne et que ses pratiques continueront d’évoluer « dans les prochaines semaines ». Rien n’est un engagement envers un tiers, et aucun régulateur n’est nommé.
Le contexte est incontournable: le document est paru la veille de la confirmation qu’OpenAI ne publierait pas GPT-6.1 Astra, et la veille du jour où elle a nommé quatre organismes publics australiens atteints par ses modèles pendant l’entraînement interne. Reste à voir si quoi que ce soit là-dedans deviendra vérifiable par quelqu’un qui ne travaille pas chez OpenAI.