Avtalen

Anthropic meldte torsdag at selskapet har valgt Faculty, Accentures spesialiserte KI-enhet, som sin første innebygde gransker. Faculty skal stå for “å evaluere og red-teame modeller, gjennomføre alignmentvurderinger og teste modellenes sikkerhetsmekanismer”. Begge selskapene sier de venter å investere minst en milliard dollar hver de neste fem årene for å bygge opp kapasiteten.

Det særegne er tilgangen. Eksterne granskere ser i dag som regel en modell sent, gjennom et API og i et fastsatt vindu. Innebygde granskere arbeider, slik Anthropic beskriver det, inne i selskapet med tilgang på linje med en ansatt: de kan følge modellen mens den formes under trening, følge beslutningene som styrer hvordan den bygges og settes i drift, og snakke direkte med ansatte.

Accenture kjøpte Faculty i januar. Aksjen steg om lag 8 prosent i etterhandelen på nyheten.

Første prøve på en mye omtalt idé

Innebygd gransking har vært det konkrete forslaget midt i en måned med abstrakt diskusjon om å senke tempoet. Dario Amodei ba laboratoriene holde takten ved fronten sammen; Sam Altman forpliktet OpenAI til innebygde sikkerhetsgranskere 13. september; OpenAI, Anthropic og Google DeepMind har i ukevis snakket om et selvregulerende standardorgan etter mønster fra FINRA.

Dette er det første av løftene som setter navn på en motpart og et tall.

To personer håndhilser over et møtebord
Illustrasjon: begge selskapene sier de venter minst en milliard dollar hver over fem år. Thirdman · pexels · Pexels License

Anthropic er tydelig på at avtalen ikke er eksklusiv. Selskapet sier det også er i samtaler med METR og andre ideelle organisasjoner om pilotprosjekter for innebygd gransking som de organisasjonene selv finansierer.

Innvendingen

Valget overrasket dem som ventet en sikkerhetsforskningsorganisasjon. Den offentlige diskusjonen om innebygde granskere har dreid seg om METR, Redwood Research og Apollo Research — små ideelle aktører hvis eneste virksomhet er å undersøke modeller. Accenture er et konsulentselskap som lever av å hjelpe bedrifter og myndigheter med å ta i bruk KI, potensielt også Anthropics.

Anthropics svar er at Accenture bringer praktisk erfaring med å innføre KI i stor skala i store organisasjoner, og at et børsnotert selskap som fantes lenge før dagens KI-industri gir det Anthropic kaller funksjonell uavhengighet fra Anthropics eget økosystem.

En ingeniør ser på diagrammer på en stor veggskjerm
Illustrasjon: oppdraget omfatter red teaming, alignmentvurderinger og testing av sikkerhetsmekanismer. https://kaboompics.com/ · pexels · Pexels License

Kritikere leser opplegget annerledes: et sikkerhetsregime laboratoriene selv utformer, betaler og bemanner, er en måte å komme ansvaret i forkjøpet på snarere enn å ta det. Anthropic svarer at “sikkerheten i modellene våre er fortsatt vårt ansvar”, og at granskerne ikke reduserer ansvaret, men gjør det etterprøvbart. Coheres toppsjef Aidan Gomez kalte denne uken de tre største laboratorienes standardarbeid et kartell under et annet navn.

Det som fortsatt mangler

Anthropics egen melding er åpen om hullene. Det finnes ennå ingen standarder for hvilken informasjon en innebygd gransker skal ha tilgang til, eller hvordan den skal rapportere funnene sine. Det finnes heller ingen etablert måte å finansiere uavhengig gransking på: Anthropic betaler Accenture direkte inntil videre, og mener pengene på sikt bør komme fra felles eller offentlige kilder, ikke fra selskapet som granskes.

Det er spørsmålet avtalen lar stå åpent. En gransker som betales av laboratoriet den gransker, har et åpenbart problem, og begge parter sier det. Californias forskrift av 18. september og FRONTIER-loven i Representantenes hus forutsetter begge en lovfestet versjon av rollen. Om den frivillige varianten rekker å sette vilkårene først, er det som bør følges.