Vad som släpptes

OpenAI släppte GPT-Live-1 i sitt API den 10 september och beskrev den som en modell som ger “naturliga röstsamtal i full duplex i API:et, med bättre instruktionsföljsamhet, egna röster och telefonistöd”, enligt bolagets utvecklarmeddelande. Priset är 0,05 dollar per minut.

Full duplex är hela poängen. Modellen kan lyssna medan den talar och reagera mitt i en mening på avbrott, instämmanden, pauser, riktningsbyten och bakgrundsprat medan dess eget ljud fortfarande löper. Föregångaren, gpt-realtime-2.1, turades om: den talade färdigt och lyssnade sedan.

Varför turtagningen var flaskhalsen

Alla som använt en röstassistent känner igen felet. Du börjar rätta den, den talar vidare över dig och du väntar på en lucka. Halvduplexmodeller löser det genom att lyssna efter tystnad, och därför tolkar de en eftertänksam paus som slutet på meningen och ett utfyllnadsord som en ny instruktion.

Närbild på en studiomikrofon
Fullduplexmodeller kan lyssna medan de talar i stället för att vänta på tystnad. RDNE Stock project · pexels · Pexels License

Att ta bort den begränsningen ändrar vad en röstagent går att använda till. Ett supportsamtal där den som ringer säger “nej, vänta, den andra ordern” tre ord in i ett svar är normalt mänskligt beteende och har hittills varit ett besvärligt fall att bygga runt.

Siffrorna, och vem som lämnat dem

OpenAI uppger att modellen är omkring 30 procentenheter bättre än gpt-realtime-2.1 på Full Duplex Bench, och att den i kombination med GPT-6 Astra på medelhög resonemangsnivå hamnar först i Tau3-utvärderingarna, enligt Data Studios sammanfattning. Båda siffrorna kommer från OpenAI om OpenAI:s egen modell, och det finns ännu ingen oberoende upprepning.

Vad det kostar i praktiken

De 0,05 dollarna per minut täcker röstlagret och debiteras per sekund utan uppåtavrundning. Anrop mot Responses-API:et i bakgrunden och all verktygsanvändning kostar sina vanliga priser, så en röstagent som resonerar med en frontmodell och anropar tre verktyg per tur kostar inte fem cent i minuten totalt.

En utvecklare som arbetar vid en dator
Resonemangsanrop i bakgrunden och verktygsanvändning debiteras separat från röstlagret. cottonbro studio · pexels · Pexels License

Släppet omfattar också telefonistöd och en utökad uppsättning röster med fler accenter, dialekter och språk. Egna röster kräver en separat behörighetsprocess.

Att hålla ögonen på

Påståendet som behöver oberoende prövning är latensen under belastning: ett fullduplexbeteende som håller i en demo kan försämras när modellen samtidigt anropar verktyg och väntar på en backend. Det andra är vad utvecklarna gör med delegeringen — GPT-Live-1 är byggd för att lämna över resonemanget till en separat bakgrundsmodell, vilket gör att den intressanta frågan inte är hur bra den talar utan hur bra den väntar.