L’accord

Anthropic a annoncé jeudi avoir retenu Faculty, l’unité IA spécialisée d’Accenture, comme premier évaluateur intégré. Faculty prendra en charge “l’évaluation et le red teaming des modèles, les analyses d’alignement et le test des garde-fous”. Les deux entreprises disent prévoir d’investir chacune au moins un milliard de dollars sur les cinq prochaines années pour bâtir cette capacité.

Le trait distinctif, c’est l’accès. Aujourd’hui, les évaluateurs externes voient un modèle tardivement, via une interface de programmation et pendant une fenêtre fixée. Les évaluateurs intégrés, selon la description d’Anthropic, travaillent à l’intérieur de l’entreprise avec un accès comparable à celui d’un salarié : ils peuvent suivre la formation d’un modèle pendant l’entraînement, suivre les décisions qui régissent sa construction et son déploiement, et parler directement aux équipes.

Accenture a racheté Faculty en janvier. Son action a gagné environ 8 % après la clôture le jour de l’annonce.

Le premier test d’une idée très discutée

L’évaluation intégrée est la proposition concrète au milieu d’un mois de débat abstrait sur le ralentissement. Dario Amodei a demandé aux laboratoires de régler ensemble l’allure à la frontière ; Sam Altman a engagé OpenAI sur des évaluateurs de sécurité intégrés le 13 septembre ; OpenAI, Anthropic et Google DeepMind discutent d’un organisme d’autorégulation inspiré de la FINRA.

C’est le premier de ces engagements à nommer une contrepartie et un montant.

Deux personnes se serrent la main au-dessus d'une table de réunion
Illustration : chaque entreprise dit prévoir au moins un milliard de dollars sur cinq ans. Thirdman · pexels · Pexels License

Anthropic précise que l’accord n’est pas exclusif. L’entreprise dit discuter aussi avec METR et d’autres organisations à but non lucratif de projets pilotes d’évaluation intégrée financés par ces organisations elles-mêmes.

L’objection

Le choix a surpris ceux qui attendaient une organisation de recherche en sécurité. Le débat public sur les évaluateurs intégrés tournait autour de METR, Redwood Research et Apollo Research, de petites structures dont le seul métier est d’examiner des modèles. Accenture est un cabinet dont le métier est d’aider entreprises et administrations à déployer l’IA, y compris, potentiellement, celle d’Anthropic.

Anthropic répond qu’Accenture apporte une expérience pratique du déploiement de l’IA à grande échelle dans de grandes organisations, et qu’une société cotée antérieure à l’industrie actuelle de l’IA offre ce qu’Anthropic appelle une indépendance fonctionnelle vis-à-vis de son propre écosystème.

Un ingénieur examine des graphiques sur un grand écran mural
Illustration : la mission couvre le red teaming, l'alignement et le test des garde-fous. https://kaboompics.com/ · pexels · Pexels License

Les critiques lisent le dispositif autrement : un régime de sécurité que les laboratoires conçoivent, financent et dotent en personnel serait une façon de devancer la responsabilité plutôt que de l’assumer. Anthropic répond que “la sécurité de nos modèles reste notre responsabilité” et que les évaluateurs ne la réduisent pas mais la rendent vérifiable. Le directeur général de Cohere, Aidan Gomez, a qualifié cette semaine la démarche normative des trois plus grands laboratoires de cartel sous un autre nom.

Ce qui manque encore

L’annonce d’Anthropic est franche sur les lacunes. Il n’existe pas encore de normes sur les informations auxquelles un évaluateur intégré devrait avoir accès, ni sur la façon dont il devrait rendre compte de ses constats. Il n’existe pas non plus de mode de financement stabilisé pour l’évaluation indépendante : Anthropic paie Accenture directement pour l’instant et estime qu’à terme l’argent devrait venir de fonds mutualisés ou publics, pas de l’entreprise évaluée.

C’est la question que l’accord laisse ouverte. Un évaluateur payé par le laboratoire qu’il évalue a un problème évident, et les deux parties le disent. Le décret californien du 18 septembre et la loi FRONTIER examinée à la Chambre des représentants envisagent tous deux une version légale de ce rôle. Reste à voir si la version volontaire fixera les termes la première.