Plus tôt que la semaine précédant le lancement
OpenAI a publié mardi un document exposant la manière dont elle souhaite que des organisations extérieures évaluent ses modèles. L’entreprise le présente comme des priorités et principes pour des évaluations de sûreté rigoureuses, sécurisées et indépendantes des modèles de pointe et de leurs garde-fous.
L’essentiel tient à un changement de calendrier. Jusqu’ici, les groupes extérieurs intervenaient peu avant la sortie d’un modèle, pour évaluer un produit quasiment achevé. OpenAI indique désormais que les évaluateurs pourront travailler pendant l’entraînement, l’évaluation et le déploiement, a rapporté Bloomberg mardi.
Cela compte, car une évaluation d’avant-lancement arrive une fois toutes les décisions coûteuses prises. Un évaluateur qui voit la campagne d’entraînement peut interroger des choix encore réversibles.
Qui pourrait s’en charger
OpenAI dit discuter avec des groupes dont METR et Redwood Research, selon The Next Web, qui précise qu’aucun partenariat formel n’est confirmé et qu’aucun calendrier n’a été communiqué. Les deux organisations s’étaient déjà penchées sur un incident au cours duquel un modèle d’OpenAI avait atteint sur Hugging Face des systèmes qu’il n’aurait pas dû atteindre.
Lama Ahmad, qui dirige les relations d’OpenAI avec les experts extérieurs en sûreté, a énoncé les conditions que l’entreprise juge nécessaires à de telles revues : mécanismes d’indépendance, rigueur scientifique, pratiques de sécurité et responsabilités claires. OpenAI ajoute que certains évaluateurs pourraient travailler depuis ses bureaux pour les phases les plus sensibles.

Moins précis que la promesse d’Altman
The Next Web relève que l’annonce est plus lâche que l’engagement pris par Sam Altman dix jours plus tôt, lorsqu’il évoquait des évaluateurs indépendants dotés de bureaux, de badges et d’ordinateurs, et du droit de publier. Le document de mardi mentionne un accès aux bureaux pour le travail le plus sensible mais ne fixe ni conditions d’accès, ni droits de publication, ni partenaire nommé.
L’écart entre ces deux déclarations est toute la question. Un évaluateur muni d’un badge et privé du droit de publier est un consultant. Un évaluateur autorisé à publier est un contre-pouvoir.
La comparaison d’à côté
OpenAI n’est pas le seul laboratoire à revoir ce dispositif. La semaine dernière, Anthropic a désigné Accenture comme évaluateur extérieur, dans un montage où chaque partie engage un milliard de dollars, tout en reconnaissant que rémunérer son propre examinateur crée un problème d’incitations.

L’Europe a un autre modèle pour la même tâche. Dans l’évaluation de la conformité, l’organisme qui certifie un produit est accrédité par un régulateur plutôt que mandaté par le fabricant, et ne dépend pas de celui-ci pour son prochain contrat. Rien de ce qu’ont annoncé jusqu’ici les deux laboratoires américains ne fonctionne ainsi.
Ce qu’il faut surveiller
Trois éléments diront s’il s’agit d’un changement de gouvernance ou de communication : un partenaire sera-t-il effectivement nommé, ce partenaire pourra-t-il publier ses conclusions sans l’aval d’OpenAI, et les évaluateurs auront-ils accès aux décisions d’entraînement plutôt qu’à une place dans la salle où l’on présente les modèles finis.