Vad som släpptes
OpenAI släppte GPT-Live-1 i sitt API den 10 september och beskrev den som en modell som ger “naturliga röstsamtal i full duplex i API:et, med bättre instruktionsföljsamhet, egna röster och telefonistöd”, enligt bolagets utvecklarmeddelande. Priset är 0,05 dollar per minut.
Full duplex är hela poängen. Modellen kan lyssna medan den talar och reagera mitt i en mening på avbrott, instämmanden, pauser, riktningsbyten och bakgrundsprat medan dess eget ljud fortfarande löper. Föregångaren, gpt-realtime-2.1, turades om: den talade färdigt och lyssnade sedan.
Varför turtagningen var flaskhalsen
Alla som använt en röstassistent känner igen felet. Du börjar rätta den, den talar vidare över dig och du väntar på en lucka. Halvduplexmodeller löser det genom att lyssna efter tystnad, och därför tolkar de en eftertänksam paus som slutet på meningen och ett utfyllnadsord som en ny instruktion.

Att ta bort den begränsningen ändrar vad en röstagent går att använda till. Ett supportsamtal där den som ringer säger “nej, vänta, den andra ordern” tre ord in i ett svar är normalt mänskligt beteende och har hittills varit ett besvärligt fall att bygga runt.
Siffrorna, och vem som lämnat dem
OpenAI uppger att modellen är omkring 30 procentenheter bättre än gpt-realtime-2.1 på Full Duplex Bench, och att den i kombination med GPT-6 Astra på medelhög resonemangsnivå hamnar först i Tau3-utvärderingarna, enligt Data Studios sammanfattning. Båda siffrorna kommer från OpenAI om OpenAI:s egen modell, och det finns ännu ingen oberoende upprepning.
Vad det kostar i praktiken
De 0,05 dollarna per minut täcker röstlagret och debiteras per sekund utan uppåtavrundning. Anrop mot Responses-API:et i bakgrunden och all verktygsanvändning kostar sina vanliga priser, så en röstagent som resonerar med en frontmodell och anropar tre verktyg per tur kostar inte fem cent i minuten totalt.

Släppet omfattar också telefonistöd och en utökad uppsättning röster med fler accenter, dialekter och språk. Egna röster kräver en separat behörighetsprocess.
Att hålla ögonen på
Påståendet som behöver oberoende prövning är latensen under belastning: ett fullduplexbeteende som håller i en demo kan försämras när modellen samtidigt anropar verktyg och väntar på en backend. Det andra är vad utvecklarna gör med delegeringen — GPT-Live-1 är byggd för att lämna över resonemanget till en separat bakgrundsmodell, vilket gör att den intressanta frågan inte är hur bra den talar utan hur bra den väntar.