
Pew leidis AI-autorsuse märke 35% uuematest kuupäevaga veebilehtedest
Pew leidis juuli 2026 veebivalimis AI-autorsuse märke 10% lehtedest ja 35% uuematest kuupäevaga lehtedest. Detektor näitab trendi, mitte kindlat autorlust.
Lühidalt
- Pew Research Center analüüsis Common Crawli 49 veebikoopia põhjal 490 000 ingliskeelset lehte ajavahemikust jaanuar 2021 kuni juuli 2026.
- 2026. aasta juuli 10 000 lehe juhuvalimis näitas 10% lehtedest olulisi AI-autorsuse või AI-toimetamise tunnuseid.
- Avaldamiskuupäevaga lehtedest, mis ilmusid pärast ChatGPT avalikku käivitamist 30. novembril 2022, oli vastav osakaal 35%; see alamvalim ei esinda kogu veebi.
- Tulemus mõõdab Open Pangrami detektori leitud keelemustreid, mitte tõendatud autorlust; üksiku lehe märgistust ei tohi käsitleda lõpliku otsusena.
Pew Research Center avaldas 20. augustil 2026 uuringu, mis püüab hinnata AI-ga kirjutatud või tugevalt toimetatud teksti levikut avalikus ingliskeelses veebis. Uurijad võtsid Common Crawli 49 kuisest veebikoopiast igaühest juhuslikult 10 000 lehte ja analüüsisid kokku 490 000 lehe põhiteksti Open Pangrami mudeliga.
Kõige lihtsam pealkirjanumber on 10%: nii suur osa 2026. aasta juuli juhuvalimist ületas Pewa seatud „oluliste AI-autorsuse tunnuste“ lävendi. Kui vaadata ainult tuvastatava avaldamiskuupäevaga lehti, mis ilmusid pärast ChatGPT käivitamist, tõusis juuli näit 35 protsendini.
Need kaks arvu vastavad eri küsimustele. Kümme protsenti kirjeldab juhuslikku hetkevõtet, milles on nii vanu kui ka uusi lehti. Kolmkümmend viis protsenti kirjeldab väiksemat kuupäevaga sisu alamvalimit. Uuring ei ütle, et kolmandik kogu internetist on AI kirjutatud, ega võimalda ühe märgistatud artikli autorit kindlaks teha.
Kuidas Pew 490 000 lehte valis
Common Crawl teeb ligikaudu kord kuus avalikust veebist koopia. Pew valis 49 indekseeritud koopiat perioodist jaanuar 2021 kuni juuli 2026 ning võttis igast 10 000 ingliskeelset lehte. Analüüsi sisendiks oli WET-faili põhitekst, kust HTML, pildid ja muu meedia olid eemaldatud.
Valim hõlmab avalikult ligipääsetavaid lehti. Sisselogimise või maksumüüri taga olev sisu on tõenäoliselt alaesindatud ning uuring ei kirjelda rakendusi, privaatseid kogukondi ega kogu sotsiaalmeediat. Samuti piirdub tulemus ingliskeelse veebiga; sellest ei saa otse tuletada Eesti veebisisu osakaalu.
Avaldamiskuupäev leiti HTML-ist vaid umbes 10–15 protsendil iga veebikoopia lehtedest. Pew rõhutab, et see ei ole veebi juhuslik alamvalim. Seega kehtib 35% kuupäevaga sisu kohta, mitte kõigi pärast 2022. aasta novembrit loodud lehtede kohta.
Detektor annab tõenäosuse, mitte autoritunnistuse
Pew kasutas Pangrami avatud kaaludega mudelit editlens_Llama-3.2-3B. Mudel annab tekstile skoori nullist üheni, kus suurem väärtus viitab tugevamatele AI-mustritele. Uuringus loeti vähemalt 0,2 skooriga leht „oluliste“ AI-autorsuse või toimetamise tunnustega sisuks.
Lävend on analüütiline otsus, mitte loodusseadus. Detektor õpib statistilisi erinevusi sõnavalikus ja lauseehituses ning võib eksida mõlemas suunas. Inimene võib kirjutada mudelile tüüpiliselt, mudeli teksti võib põhjalikult ümber teha ning uus mudel võib kasutada teistsuguseid mustreid kui detektori treeningandmetes.
Pew kontrollis osa tulemusest Pangrami kommertsmudeliga. 62 370 lehe puhul langesid mudelite otsused kokku 96 protsendil juhtudest, kuid Cohen’i kappa oli 0,61 ehk kooskõla polnud täielik. Eriti 2021. ja 2022. aasta lehtedel andis avatud mudel ligikaudu üheprotsendise määra, mida Pew peab tõenäoliselt osaliselt valepositiivseks.
Miks suurte kogumite trend võib olla kasulik
Üksiku dokumendi puhul võib detektori viga rikkuda autori maine või tekitada vale süüdistuse. Suure ja järjepidevalt valitud valimi puhul võivad juhuslikud vead osaliselt tasanduda ning ajas kasvav trend jääda nähtavaks. Pewa paralleelkontroll toetas järeldust, et osakaal suureneb, kuigi täpne protsent sõltub mudelist ja lävendist.
Sõltumatu 2026. aasta uurimus „The Impact of AI-Generated Text on the Internet“ jõudis eri andme- ja analüüsimeetodiga samuti järeldusele, et 35% uuematest veebisaitidest sisaldas AI-ga loodud või abistatud teksti. Tulemuste sarnasus tugevdab trendihüpoteesi, kuid ei muuda detektorit üksikjuhtumi kohtunikuks.
TechCrunchi praktiline Pangrami test leidis, et süsteem tuvastas sageli täielikult genereeritud ja kergelt toimetatud teksti, kuid märgistas mõnikord ka reporteri enda ümber kirjutatud lauseid. See on hea illustratsioon Pewa metodoloogilisest hoiatusest: tööriist võib aidata sõeluda, kuid otsus vajab päritolu- ja protsessitõendeid.
Veebi sünteetilisus muudab allikakontrolli
Kui sama algteade kirjutatakse AI-ga ümber kümneteks lehtedeks, võib otsing jätta mulje mitmest sõltumatust kinnitusest. Tegelikult võivad kõik versioonid pärineda ühest pressiteatest ja korrata sama viga. Domeenide arv ei võrdu enam automaatselt sõltumatute vaatlejate arvuga.
RAG-süsteemide ja treeningandmete jaoks tähendab see, et URL-i, kuupäeva ja semantilise sarnasuse kontroll muutub olulisemaks. Sisu tuleb rühmitada sündmuse ja algallika järgi, tuvastada peaaegu identsed ümberjutustused ning anda suurem kaal dokumentidele, mis sisaldavad kontrollitavaid esmaandmeid, autorit ja paranduste ajalugu.
Risk ei ole pelgalt „mudel õpib mudelilt“. Sünteetiline tekst võib muuta veebi stiililt ühetaolisemaks, võimendada levinud vigu ja suruda haruldasemad kohalikud teadmised otsingutulemustes tahaplaanile. Eestikeelse info puhul on algallika, dokumendinumbri, sündmuse aja ja vastutava asutuse talletamine eriti tähtis.
Buildrya praktiline allikakvaliteedi reegel
- Leia iga väite algallikas: ametlik dokument, andmestik, teadusartikkel, kohtudokument või otsene teade.
- Kontrolli sündmuse kuupäeva eraldi artikli avaldamiskuupäevast ja märgi hilisemad uuendused.
- Rühmita sarnased lood üheks allikapereks, et viis ümberkirjutust ei paistaks viie sõltumatu kinnitusena.
- Kasuta AI-detektorit ainult sõelumiseks ning nõua üksikjuhtumi puhul päritolu-, versiooni- või tööprotsessi tõendeid.
- Salvesta allika URL, väljaandja, tüüp ja keskne kontrollitud väide nii, et järeldus oleks hiljem taastatav.
Korduma kippuvad küsimused
Kas Pew leidis, et kolmandik kogu internetist on AI kirjutatud?
Ei. 35% puudutas juuli 2026 valimi tuvastatava kuupäevaga lehti, mis olid avaldatud pärast ChatGPT käivitamist. Kogu juuli juhuvalimi näit oli 10%.
Kui suur oli uuringu valim?
Pew analüüsis 490 000 ingliskeelset lehte: 10 000 lehte igast 49 Common Crawli veebikoopiast jaanuarist 2021 kuni juulini 2026.
Millist AI-detektorit kasutati?
Pew kasutas Pangrami avatud kaaludega mudelit editlens_Llama-3.2-3B ja luges oluliseks skoori vähemalt 0,2. Osa valimist kontrolliti Pangram 3.3 kommertsmudeliga.
Kas detektor tõestab, et konkreetse lehe kirjutas AI?
Ei. Detektor annab keelemustritel põhineva tõenäosusliku hinnangu. Pew hoiatab, et üksiku lehe tulemust ei tohiks käsitleda lõpliku autorluse otsusena.
Kas uuring hõlmas eestikeelset veebi?
Ei. Valim koosnes ingliskeelsetest avalikest lehtedest, mistõttu tulemusi ei saa Eesti veebile otse üle kanda.
Miks 2021. aasta valimis üldse AI-märke leiti?
Pew peab varaste veebikoopiate ligikaudu üheprotsendist määra tõenäoliselt osaliselt Open Pangrami valepositiivseks, mitte tõendiks laialdasest generatiivsest AI-st enne ChatGPT-d.
Mida peaks sisu- või RAG-süsteem tegema?
Eelistada tuleks algallikaid, rühmitada ümberkirjutused, salvestada päritolu ja kuupäevad ning kontrollida olulisi väiteid dokumendi või esmaandmete vastu.
Allikad
- 01
Pew Research Center
Pew Research Center, „How Much of the Internet Is Written With AI?“, 20. august 2026
pewresearch.org(avaneb uuel vahelehel) - 02
Pew Research Center
Pew Research Center, uuringu metoodika, 20. august 2026
pewresearch.org(avaneb uuel vahelehel) - 03
Dolezal jt
Dolezal jt, „The Impact of AI-Generated Text on the Internet“, arXiv, 2026
arxiv.org(avaneb uuel vahelehel) - 04
TechCrunch
TechCrunch, „As AI content floods the internet, Pangram raises $9M to detect it“, 29. juuli 2026
techcrunch.com(avaneb uuel vahelehel)
Saa järgmine AI-RADAR postkasti
Kui järgmine praktiline AI-signaal või tööriistamuutus avaldatakse, saad selle otse e-postile.
Arutelu
0 kommentaari
Seotud teemad AI-RADARis
33 mõõdikut, millega hinnata keelemudeleid ja tehisaru agente
Keelemudeli või tehisaru agendi valikul ei piisa ühest edetabelist. Vaata 33 mõõdikut kiiruse, hinna, hallutsinatsioonide, allikapõhisuse, tööriistakutsete ja turvariskide hindamiseks.

OpenAI raport: kodeerimisagent kiirendab teostust, kuid pudelikaelaks saab valideerimine
OpenAI kaheksa teadustarkvara projekti näitavad, et kodeerimisagent kiirendab teostust, kuid õigsuse tõendamine ja hooldus jäävad inimese vastutada.