AI-assistenter som ChatGPT utvecklas ständigt och erbjuder allt fler funktioner med varje ny modell. Även om generativ AI inte är felfri och inte bör betraktas som en ofelbar informationskälla, kan den som omfamnat teknologin nu dra nytta av röstkonversationer som ett alternativ till att skriva. ChatGPT:s ursprungliga röstläge från 2023 var beroende av tre olika system: att omvandla tal till text, generera ett svar med en språkmodell och sedan använda en text-till-tal-modell för att läsa upp svaret.
Den nya avancerade röstläget introducerades senare och använde en enda multimodal modell som förbättrade funktionaliteten avsevärt. Nu levereras ChatGPT med GPT-Live-modellen för att hantera röstkonversationer, vilket är ett stort steg framåt i hur naturliga dessa samtal känns. OpenAI beskriver det som en ”full-duplex”-arkitektur vilket tillåter systemet att lyssna och tala samtidigt. Detta löser ett tidigare problem där modellen ibland kunde börja svara innan användaren avslutat sin mening.
En ny funktion i GPT-Live är att den ibland ger korta bekräftelser som ”mhmm” eller ”ja” medan användaren talar, likt hur en människa skulle göra i ett samtal. Dessutom kan GPT-Live delegera mer komplexa uppgifter till andra modeller som GPT-5.5 i bakgrunden när en fråga kräver resonemang eller forskning.
GPT-Live-röstmodellen är tillgänglig genom ChatGPT-appen på Android och iOS-enheter samt via webbläsare. Användare med ChatGPT Pro, Plus och Go-planer har tillgång till GPT-Live-1-modellen, medan de med gratisplanen kan använda GPT-Live-1 mini-modellen. GPT-Live ersätter den tidigare turbaserade röstmodellen som standard. För att komma igång, trycker man helt enkelt på ChatGPT Voice-ikonen, symboliserad av en vågform, längst till höger i textfältet. Vid första användningen kan det krävas att man tillåter appen att använda enhetens mikrofon.
När man väl är i röstläge visas en responsiv flytande sfär på skärmen. Man kan börja tala som vanligt. Genom att trycka på inställningsikonen i övre högra hörnet kan man ändra röstmodellens intelligensnivå med tre alternativ: Instant, Medium och High. Denna anpassning kräver dock en betald plan, och är inte tillgänglig för GPT-Live-1 mini-modellen. ChatGPT Voice förblir aktiv även om man byter till en annan app eller låser enheten.
Trots att den nya versionen av ChatGPT:s röstläge är ett stort steg framåt, stöder GPT-Live för närvarande inte skärm- eller videodelning. Användaren kan dock återgå till den äldre röstmodellen genom att navigera till inställningarna i ChatGPT, välja **Röst** och välja en annan modell. Här kan man också välja en annan röst för ChatGPT, ändra språk eller ställa in ChatGPT Voice som standardläge vid appstart.
Som någon som föredrar att skriva hade jag till en början inte tänkt mycket på den uppgraderade versionen av ChatGPT Voice. Men efter att ha provat några längre konversationer blev jag mest imponerad av hur naturligt det kändes att prata med en AI. ChatGPT Voice avbryter inte längre mitt i en mening och man behöver inte vänta på att den ska tala klart innan man svarar. Vid längre frågor kändes det nästan som om GPT-Live kunde förutse vad jag skulle säga härnäst.
GPT-Live:s snabbhet gör det också till ett utmärkt verktyg för att genomföra liveöversättningar. Under samtalet kan man bläddra ner för att se en transkription av allt som sägs. Om ChatGPT får en fråga som bättre besvaras visuellt, skapar den en interaktiv widget tillsammans med sitt talade svar.
GPT-Live:s intelligensnivå är som standard inställd på **Instant**, vilket hanterar vardagliga frågor med lätthet samtidigt som det prioriterar snabba svar. För mer komplexa samtal kan man överväga att byta till **Medium** eller **High**-nivåerna, vilket ger en kort extra betänketid, men inte påverkar det naturliga samtalsflödet negativt.