Uppgörelsen

Anthropic meddelade på torsdagen att bolaget valt Faculty, Accentures specialiserade AI-enhet, till sin första inbäddade granskare. Faculty ska ta sig an att “utvärdera och red-teama modeller, genomföra alignmentbedömningar och testa modellernas skyddsmekanismer”. Båda bolagen säger sig räkna med att investera minst en miljard dollar var under de kommande fem åren för att bygga upp kapaciteten.

Det som skiljer ut upplägget är tillgången. Externa granskare ser i dag oftast en modell sent, via ett API och under ett bestämt fönster. Inbäddade granskare arbetar, enligt Anthropics beskrivning, inne i bolaget med tillgång i nivå med en anställd: de kan följa hur en modell växer fram under träningen, se de beslut som styr hur den byggs och släpps, och tala direkt med personalen.

Accenture köpte Faculty i januari. Aktien steg omkring 8 procent i efterhandeln på beskedet.

Första provet på en mycket omtalad idé

Inbäddad granskning har varit det konkreta förslaget mitt i en månad av abstrakt diskussion om att sakta ned. Dario Amodei bad laboratorierna att hålla takten vid fronten gemensamt; Sam Altman band upp OpenAI vid inbäddade säkerhetsgranskare den 13 september; OpenAI, Anthropic och Google DeepMind har i veckor talat om ett självreglerande normorgan efter mönster från FINRA.

Det här är det första av de löftena som sätter namn på en motpart och en siffra.

Två personer skakar hand över ett konferensbord
Illustration: båda bolagen säger sig räkna med minst en miljard dollar var över fem år. Thirdman · pexels · Pexels License

Anthropic är tydligt med att uppgörelsen inte är exklusiv. Bolaget säger sig också föra samtal med METR och andra ideella organisationer om pilotprojekt för inbäddad granskning som de organisationerna själva finansierar.

Invändningen

Valet överraskade dem som väntat sig en säkerhetsforskningsorganisation. Den offentliga diskussionen om inbäddade granskare har kretsat kring METR, Redwood Research och Apollo Research — små ideella aktörer vars enda verksamhet är att undersöka modeller. Accenture är en konsultfirma vars affär är att hjälpa företag och myndigheter att införa AI, potentiellt även Anthropics.

Anthropics svar är att Accenture tillför praktisk erfarenhet av att införa AI i stor skala i stora organisationer, och att ett börsnoterat bolag som fanns långt före dagens AI-industri har vad Anthropic kallar funktionellt oberoende från Anthropics eget ekosystem.

En ingenjör granskar diagram på en stor väggskärm
Illustration: uppdraget omfattar red teaming, alignmentbedömningar och test av skyddsmekanismer. https://kaboompics.com/ · pexels · Pexels License

Kritiker läser upplägget annorlunda: ett säkerhetssystem som laboratorierna själva utformar, betalar och bemannar är ett sätt att komma undan ansvar snarare än att ta det. Anthropic svarar att “säkerheten i våra modeller förblir vårt ansvar” och att granskarna inte minskar det ansvaret utan gör det mer kontrollerbart. Coheres vd Aidan Gomez kallade i veckan de tre största laboratoriernas normarbete för en kartell under annat namn.

Det som fortfarande saknas

Anthropics eget besked är uppriktigt om luckorna. Det finns ännu inga normer för vilken information en inbäddad granskare ska ha tillgång till, eller hur den ska rapportera det den hittar. Det finns heller inget etablerat sätt att finansiera oberoende granskning: Anthropic betalar Accenture direkt tills vidare och menar att pengarna på sikt bör komma från gemensamma fonder eller det offentliga, inte från det bolag som granskas.

Det är frågan uppgörelsen lämnar öppen. En granskare som betalas av det laboratorium den granskar har ett uppenbart problem, och båda parter säger det. Kaliforniens beslut den 18 september och FRONTIER-lagen i USA:s representanthus förutsätter båda en lagstadgad version av rollen. Om den frivilliga varianten hinner sätta villkoren först är det som bör följas.