OpenAI:s senaste språkmodell, GPT-5, har nyligen lanserats med höga förväntningar inom teknikvärlden. Men en tidig utvärdering av modellens kodförmåga avslöjar att den kanske inte lever upp till hypen. Testresultat visar att GPT-5 misslyckades med att klara hälften av utmaningarna i en serie programmeringstester. Dessa tester har tidigare fungerat som måttstock för att bedöma AI-modellers kodprestanda.
Ett av de första testerna innebar att skapa ett WordPress-plugin, en uppgift som tidigare modeller som GPT-3.5 och GPT-4 klarat med bravur. GPT-5 lyckades delvis genom att generera en kod som gick att köra, men stötte på problem när den skulle randomisera en lista. Istället för att utföra uppgiften korrekt, omdirigerades användaren till en annan sida, vilket markerade ett tydligt misslyckande.
Efter att ha fått feedback om problemet, föreslog GPT-5 en lösning som krävde manuell kodändring, vilket inte ansågs vara en idealisk lösning. När modellen sedan fick en ny chans att generera en komplett plugin-kod, lyckades den till slut. Trots detta bedöms detta som ett misslyckande eftersom den initiala koden inte fungerade korrekt.
I ett annat test, som fokuserade på att skriva om en strängfunktion för att hantera valuta med centbelopp, presterade GPT-5 bättre. Här följde den instruktionerna exakt, även om den inte inkluderade felkontroll, vilket inte heller krävdes av uppgiften. Detta resultat betraktades som godkänt.
Det tredje testet innebar att identifiera en svårupptäckt bugg i en WordPress-miljö, något som kräver djupgående kunskap om ramverkets filterfunktioner. GPT-5 klarade detta test och visade på en stark förståelse för problemet och en klar lösning.
Den fjärde utmaningen, som involverade att skriva ett skript med hjälp av Mac-verktyget Keyboard Maestro, AppleScript och Chrome, visade sig vara en riktig utmaning. Trots att GPT-5 hanterade Keyboard Maestro-delen bra, misslyckades den med AppleScript. Modellen visade bristande förståelse för hur skiftlägeskänslighet fungerar i AppleScript och gjorde felaktiga antaganden om variabler, vilket resulterade i en felaktig lösning.
Reaktionerna från användarna har varit överväldigande, med många som uttryckt sin frustration över GPT-5:s prestanda. OpenAI, som övergick alla användare till den nya modellen och tog bort tidigare versioner, möttes av omfattande kritik. Företaget har sedan dess återintroducerat möjligheten att använda de äldre modellerna för betalande användare, vilket lugnade många av de missnöjda rösterna.
Trots de tidiga misslyckandena är det troligt att GPT-5 kommer att förbättras över tid, särskilt med tanke på de djupa resonemangsförmågor som modellen uppvisar. För nuvarande användare av AI-verktyg för kodning kan det dock vara klokt att fortsätta använda tidigare modeller, såsom GPT-4o, tills GPT-5:s barnsjukdomar är åtgärdade.
Framåtblickande blir det intressant att se hur OpenAI kommer att hantera feedbacken och förbättra GPT-5:s prestanda inom kodning. Användare av AI-verktyg för programmering kommer säkerligen att hålla ett vakande öga på framtida uppdateringar och förbättringar.