Een op de drie webpagina’s toont sporen van AI-schrijvers

Meer dan een derde van de webpagina’s die sinds de lancering van ChatGPT zijn gepubliceerd, bevat waarschijnlijk door AI geschreven of zwaar bewerkte tekst. Dat blijkt uit een analyse van bijna een half miljoen Engelstalige pagina’s.

Tablet met het OpenAI-logo in een kantoorruimte
Tablet met het OpenAI-logo in een kantoorruimte · Beeld: Netgebeurd (AI-illustratie)

Meer dan een derde van de webpagina’s die sinds de lancering van ChatGPT zijn gepubliceerd, vertoont duidelijke aanwijzingen voor AI-auteurschap. In een steekproef van pagina’s die in juli 2026 zijn verzameld, ging het om 35 procent.

De analyse is uitgevoerd door Pew Research. De onderzoekers onderzochten bijna een half miljoen Engelstalige webpagina’s uit de afgelopen vijf jaar. De gegevens kwamen uit het webarchief Common Crawl. Met technologie van Open Pangram werd vervolgens vastgesteld welke pagina’s waarschijnlijk volledig door AI waren geschreven of er sterk door waren bewerkt.

Oudere pagina’s drukken percentage

In een willekeurige selectie van 10.000 pagina’s bleek ongeveer 10 procent duidelijke signalen van AI-gebruik te bevatten. Die selectie omvatte echter ook pagina’s die vóór de introductie van ChatGPT in november 2022 waren gepubliceerd. Zulke pagina’s konden niet met de huidige generatieve AI zijn geschreven.

Daarom verwijderden de onderzoekers de oudere pagina’s uit dezelfde verzameling. In de overgebleven groep, met alleen pagina’s van na de lancering van ChatGPT, kwam het aandeel uit op 35 procent. Het gaat daarbij om aanwijzingen voor AI-bewerking of AI-auteurschap, niet om een vaststelling over de identiteit van de schrijver.

Het verschil tussen domeinen is groot. Webadressen met een .com-extensie vertoonden ongeveer tien keer zo vaak signalen van AI-gebruik als adressen met .edu of .gov. Bij die laatste twee categorieën lag het aandeel rond 1 procent. Bij .org-websites werd 4,6 procent van de pagina’s als waarschijnlijk door AI geschreven of ingrijpend bewerkt aangemerkt.

De onderzoekers benadrukken dat AI-detectors fouten kunnen maken. Tekst van mensen kan daardoor ten onrechte als AI-tekst worden aangemerkt. Op de schaal van het onderzoek geven de cijfers volgens Pew Research wel een bruikbare indicatie van de ontwikkeling.

Ook andere kenmerken die vaak met AI-tekst worden geassocieerd, kwamen de afgelopen jaren vaker voor. Het gaat onder meer om het gebruik van gedachtestreepjes, Oxford-komma’s en formuleringen met een tegenstelling in de vorm van ‘het is niet X, maar Y’. De analyse zegt niet hoeveel van deze pagina’s door mensen zijn gecontroleerd of aangepast.

Lees ook