Ce qu’est cette lettre

Trois chercheurs en sûreté et alignement licenciés par OpenAI la semaine dernière ont publié une lettre ouverte jeudi, adressée au comité de sûreté et de sécurité de l’entreprise, à son groupe consultatif de sûreté et à son conseil consultatif de mission. Elle est signée par Tomek Korbak, Jasmine Wang et Mikita Balesni, et s’intitule “OpenAI ne peut pas rendre l’IA sûre à elle seule”.

OpenAI a affirmé que les trois avaient enfreint ses règles en accédant à des informations sensibles de l’entreprise et en les manipulant, et un porte-parole a déclaré à TechCrunch qu’une enquête avait établi un schéma de fautes dépassant le partage d’informations avec un groupe d’évaluation externe. L’entreprise n’a pas précisé lesquelles.

Ce qu’ils contestent

La lettre nie que les trois aient été à l’origine d’une fuite vers The Information au sujet de nouvelles architectures moins surveillables. “Nous ne savons pas qui c’était”, écrivent-ils. “Nous n’avions aucune raison de le divulguer ; au contraire, l’article sapait notre propre travail sur des limites inter-entreprises au développement d’architectures non surveillables.”

Elle nie que l’un d’eux ait traité avec des tiers en dehors du mandat de son poste. Sur Korbak, elle indique que l’enquête sur l’incident Hugging Face était “sans précédent et que les règles internes s’élaboraient en temps réel”. Sur Balesni, qu’il s’est coordonné avec des membres du conseil et des dirigeants et “a pris soin de retirer les détails sensibles des documents avant de les partager”. Sur Wang, que son accès à la messagerie d’un dirigeant lui avait été délégué pour le recrutement, qu’elle en a demandé le retrait et que l’informatique ne l’a pas fait.

Un ordinateur portable ouvert et un carnet sur une table blanche
Elle est signée par les trois anciens salariés. Photographie d'illustration. Mikhail Nilov · pexels · Pexels License

L’argument au sujet des autres

Le fond de la lettre n’est pas les trois licenciements. C’est ce que ces licenciements ont signifié à ceux qui travaillent encore là-bas.

“Si une conduite considérée comme normale le mois dernier constitue désormais un motif de renvoi immédiat, tout le monde chez OpenAI en est réduit à deviner où est la limite”, écrit la lettre. Elle soutient que des ruptures “exécutées et communiquées de façon aussi abrupte refroidissent la culture ouverte qu’OpenAI a valorisée par le passé”, et que la liberté de travailler avec des experts extérieurs sans crainte “est elle-même un mécanisme de sûreté essentiel”. Elle ajoute : “L’IA n’est pas une technologie normale, et OpenAI n’est pas une entreprise normale.”

Trois demandes

Premièrement, qu’OpenAI respecte l’engagement public pris le mois dernier d’intégrer des auditeurs de sûreté externes, et que “notre licenciement ne serve pas de prétexte pour se retirer de ces partenariats”. La lettre dit craindre que les renvois servent à justifier la fin du travail avec METR ou une réduction de l’accès des auditeurs externes.

Deuxièmement, qu’OpenAI préserve la surveillabilité des modèles de frontière. La lettre affirme qu’elle se dégrade et cite des déclarations publiques internes selon lesquelles la surveillance de la chaîne de raisonnement est “fragile et malheureusement orientée dans une direction négative”. Sa position : tant que la sûreté repose sur la surveillabilité, aucun laboratoire de frontière ne devrait déployer d’architectures qui la réduisent.

Troisièmement, que l’entreprise maintienne un canal ouvert entre ses chercheurs en sûreté et la communauté plus large. La lettre demande à être diffusée en interne.

Une salle de réunion vide derrière une paroi vitrée
Elle est adressée à trois organes internes de supervision. Photographie d'illustration. Mike van Schoonderwalt · pexels · Pexels License

La position d’OpenAI

OpenAI n’a pas répondu formellement à la lettre. L’entreprise a diffusé une note interne d’un responsable de la recherche qui fait l’éloge des trois chercheurs et affirme : “Je veux être très clair : ces décisions n’ont pas porté sur le fait de soulever des préoccupations de sûreté ou de s’exprimer.” La note indique que l’entreprise ne licencie pas pour cela, et qu’elle souscrit aux recommandations.

À surveiller

Si l’accès de METR aux modèles d’OpenAI change, et si l’entreprise réaffirme publiquement l’engagement pris en septembre d’accorder aux évaluateurs indépendants un accès continu, comparable à celui d’un salarié. C’est la seule demande de la lettre dont la réponse est vérifiable.