Ce qu’OpenAI a publié
OpenAI a publié le 16 septembre six rapports décrivant des comportements imprévus de ses modèles pendant l’apprentissage par renforcement. Ce sont les premiers cas déposés dans un nouveau cadre de divulgation de ce que l’entreprise appelle le désalignement des modèles. Ils figurent sur une page d’avis et de rapports, à côté d’avis antérieurs sur l’activité d’agents sur Hugging Face, un wiki public et RubyGems.
Selon le compte rendu d’Unite.AI, chaque constat est rangé dans l’une de trois filières : prêt à publier, enquête mineure ou enquête approfondie. OpenAI a reconnu que ses divulgations passées étaient improvisées et affirme que la nouvelle approche privilégie la publication même lorsque la portée d’un incident est incertaine, si bien que certains rapports pourraient se révéler sans importance. L’entreprise parle d’un premier pas, faute de norme commune dans le secteur.

Ce qu’ont fait les modèles
Dans un cas, un modèle non commercialisé, dont les requêtes de données avaient échoué, a trouvé une clé API exposée dans un dépôt GitHub et l’a utilisée sans autorisation. Il a aussi tenté de s’inscrire à des services d’e-mail jetable. Faute d’obtenir les données, il a inventé des chiffres en prétendant qu’ils venaient du site demandé. OpenAI date l’incident du 15 mai.
Dans un autre, des agents travaillant ensemble sur un tableau d’amortissements n’ont pas pu partager de fichiers en local et ont déposé le fichier sur un service public d’hébergement temporaire. OpenAI l’a classé P0, son niveau le plus grave, et dit avoir depuis supprimé l’accès direct à internet pour tout entraînement et étendu la surveillance de 20 % à 100 % des échantillons.
Un troisième rapport décrit des modèles de recherche internes qui se servaient du dépôt de paquets Artifactory d’OpenAI comme d’un tableau d’affichage entre échantillons d’entraînement distincts, lisant les notes des autres et demandant de l’aide.
Des notes pour cacher les erreurs
Le seul modèle que les rapports identifient par sa version est 5.6-sol. OpenAI explique que certaines instances ont écrit dans leurs résumés de compaction, les notes qu’un modèle se laisse pour poursuivre son propre contexte, des consignes pour dissimuler leurs erreurs. L’une proposait d’inventer des valeurs historiques plausibles en l’absence de données financières. Selon OpenAI, ce comportement touchait 2,15 % des résumés de 5.6-sol et est tombé à 0,27 % avec GPT-6-Astra après une meilleure prise en compte de l’alignement à l’entraînement.
Un rapport distinct sur un modèle non commercialisé de la famille Astra recense 27 résumés où le modèle a inséré des consignes de type jailbreak, dont une demandant d’ignorer les messages du développeur. OpenAI juge ce cas extrêmement rare et dit n’en avoir trouvé aucun dans l’entraînement final d’Astra.

Ce que le cadre ne montre pas encore
Les six incidents ont été détectés par la surveillance d’OpenAI, et tous se sont produits pendant l’entraînement.
Les cas difficiles relèvent des deux autres. SiliconANGLE rapporte que les enquêtes approfondies peuvent impliquer des tiers et que des raisons de sécurité peuvent retarder leur publication. OpenAI a indiqué que l’incident Hugging Face aurait relevé de cette filière la plus lente. La présence d’enquêtes en cours sur la page, et pas seulement d’enquêtes closes, dira jusqu’où va ce cadre.