Under de senaste månaderna har känsliga och privata konversationer med ChatGPT oväntat läckt ut till Google Search Console (GSC), ett verktyg som utvecklare vanligen använder för att övervaka söktrafik, snarare än att exponera privata chattar. När webbplatsansvariga vanligtvis använder GSC, ser de sökfrågor baserade på nyckelord eller korta fraser som internetanvändare skriver in i Google för att hitta relevant innehåll. Men sedan september har märkliga frågor, ibland över 300 tecken långa, också dykt upp i GSC. Dessa frågor, som enbart visade användarinmatningar, verkade komma från personer som använt en chatbot för att lösa relations- eller affärsproblem, och som troligen trodde att dessa samtal skulle förbli privata.
Jason Packer, ägare av analyskonsultföretaget Quantable, var en av de första att uppmärksamma problemet i en detaljerad blogg. I sin undersökning, tillsammans med webbanalyskonsulten Slobodan Manić, fann de vad de tror kan vara det första definitiva beviset på att OpenAI direkt skrapar Google Search med faktiska användarfrågor. Deras undersökning tyder på att AI-jätten komprometterade användarnas integritet, i vissa fall för att behålla engagemanget genom att ta till sig sökdata som Google annars inte skulle dela.
OpenAI avböjde att bekräfta om Packer och Manićs teori stämde eller att svara på några av deras kvarvarande frågor som kunde hjälpa användare att förstå omfattningen av problemet. En talesperson för OpenAI bekräftade dock att företaget var ”medvetet” om problemet och har ”åtgärdat” en bugg som ”tillfälligt påverkade hur ett litet antal sökfrågor dirigerades.”
Google avböjde att kommentera.
Den första märkliga ChatGPT-frågan som dök upp i GSC var en ström av medvetande från en troligen kvinnlig användare som bad ChatGPT att bedöma vissa beteenden för att hjälpa henne avgöra om en pojke som retade henne hade känslor för henne. En annan märklig fråga verkade komma från en kontorschef som delade affärsinformation medan han planerade ett återvändande till kontoret.
Dessa var bara två av 200 märkliga frågor—inklusive ”några ganska galna,” enligt Packer—som han granskade på en webbplats ensam. I sin blogg drog Packer slutsatsen att frågorna borde fungera som ”en påminnelse om att promptar inte är så privata som du tror att de är!”
Packer misstänkte att dessa frågor var kopplade till rapportering från The Information i augusti som citerade källor som hävdade att OpenAI skrapade Googles sökresultat för att driva ChatGPT-svar. Källor hävdade att OpenAI lutade sig mot Google för att svara på promptar till ChatGPT som sökte information om aktuella händelser, som nyheter eller sport.
OpenAI har inte bekräftat att de skrapar Googles sökresultatsidor (SERP). Packer tror dock att hans test av ChatGPT-läckor kan vara bevis på att OpenAI inte bara skrapar ”SERP i allmänhet för att förvärva data”, utan också skickar användarfrågor till Google Search.
Manić hjälpte Packer att lösa en stor del av gåtan. Han upptäckte att de märkliga frågorna dök upp i en webbplats GSC eftersom den rankades högt i Google Search för ”https://openai.com/index/chatgpt/”—en ChatGPT-URL som lades till i början av varje konstig fråga som dök upp i GSC.
Det verkade som om Google hade tokeniserat en, vilket bröt ner det till en sökning efter nyckelord ”openai + index + chatgpt.” Webbplatser som använde GSC och rankades högt för dessa nyckelord var därför troliga att stöta på ChatGPT-läckor, föreslog Parker och Manić, inklusive webbplatser som täckte tidigare ChatGPT-läckor där chattar indexerades i Googles sökresultat.
Det är oklart vad exakt OpenAI fixade, men Packer och Manić har en teori om en möjlig väg för läckande chattar. När man besöker en som startar varje märklig fråga som hittats i GSC, stöter ChatGPT-användare på en promptbox som verkade buggig.
OpenAI hävdade att endast ett litet antal frågor läckte men avböjde att ge en mer exakt uppskattning. Det är därför oklart hur många av de 700 miljoner människor som använder ChatGPT varje vecka som hade promptar dirigerade till GSC. OpenAI:s svar lämnar användare med ”kvarstående frågor” om hur långt OpenAI:s fix kommer att gå för att stoppa problemet.