niedziela, 6 września 2026

Nowości

Co trzecia strona internetowa powstala od premiery ChatGPT jest pisana przez AI, pokazuje badanie Pew Research

BadaniaPatryk Raba
Co trzecia strona internetowa powstala od premiery ChatGPT jest pisana przez AI, pokazuje badanie Pew Research
Fot. Pixabay, Pexels (Pexels License (CC0))

Analiza niemal pol miliona anglojezycznych stron przeprowadzona przez Pew Research Center pokazuje, ze 35 procent stron opublikowanych po debiucie ChatGPT nosi slady autorstwa sztucznej inteligencji, a domeny .com generuja az dziesieciokrotnie wiecej takich tresci niz .edu czy .gov.

Spis treści
  1. Skala zjawiska
  2. Jak rozpoznano tekst AI
  3. Co to znaczy dla jakosci sieci
  4. Znaczenie dla polskich uzytkownikow i firm

Amerykanski osrodek badawczy Pew Research Center opublikowal analize pokazujaca, jak gleboko sztuczna inteligencja zmienila sposob powstawania tresci w internecie. Wsrod stron internetowych opublikowanych po premierze ChatGPT w listopadzie 2022 roku, az 35 procent nosi wyrazne slady autorstwa lub wspoltworzenia przez AI.

Badanie przeprowadzil zespol Pew Research Center pod kierunkiem Samuela Bestvatera, starszego analityka danych w organizacji, wraz z Aaronem Smithem, dyrektorem badan Data Labs, oraz wspolpracownikami Carsonem TerBushem, Chrisem Baronavskim i Janakee Chavdą. Analitycy wykorzystali dane z Common Crawl, non-profitowej organizacji zbierajacej archiwum stron internetowych siegajace 2008 roku, oraz narzedzie Open Pangram do wykrywania tekstu wygenerowanego przez modele jezykowe.

Skala zjawiska

Z probki blisko 500 tysiecy anglojezycznych stron pobranych w lipcu 2026 roku wynika, ze 10 procent wszystkich analizowanych stron, niezaleznie od daty publikacji, wykazuje znaczace cechy autorstwa AI. Odsetek ten rosnie jednak gwaltownie, gdy spojrzec wylacznie na tresci powstale po debiucie ChatGPT - tam siega 35 procent. Trend wzrostowy zaczal sie pod koniec 2022 roku i od tego czasu utrzymuje sie konsekwentnie, bez oznak spowolnienia.

Autorzy podkreslaja, ze zjawisko rozklada sie bardzo nierowno w zaleznosci od typu domeny. Okolo jedna na dziesiec stron z konowka .com wykazuje cechy tekstu generowanego przez AI. To dwukrotnie wiecej niz w przypadku domen .org, gdzie odsetek wynosi 4,6 procent, i okolo dziesieciokrotnie wiecej niz na domenach .edu oraz .gov, gdzie wskaznik utrzymuje sie na poziomie okolo 1 procent.

Jak rozpoznano tekst AI

Badacze nie polegali wylacznie na jednym narzedziu detekcyjnym - przeanalizowali rowniez charakterystyczne cechy stylistyczne, ktore statystycznie czesciej pojawiaja sie w tekstach generowanych przez modele jezykowe. Wsrod nich znalazly sie: czestsze uzycie myslnikow polaczeniowych, wyzsza czestotliwosc przecinka oksfordzkiego w wyliczeniach, charakterystyczne slownictwo typu delve, interplay, testament, bolstered czy pivotal, a takze konstrukcje rownolegle w rodzaju nie tylko X, ale i Y.

Skala zmian jest wyrazna. Czestotliwosc myslnikow polaczeniowych wzrosla z 5,79 na 10 tysiecy slow w styczniu 2023 roku do 11,19 w styczniu 2026 - niemal dwukrotnie. Uzycie przecinka oksfordzkiego zwiekszylo sie o 63 procent w tym samym okresie, a czestotliwosc typowego dla AI slownictwa wzrosla ponad dwukrotnie, z 11,94 do 28,15 wystapien na 10 tysiecy slow. Najbardziej dynamicznie, niemal trzykrotnie, urosla czestotliwosc konstrukcji negatywnego paralelizmu.

Co to znaczy dla jakosci sieci

Autorzy zwracaja uwage, ze wplyw AI na internet nie ogranicza sie do samej liczby stron. Modele jezykowe uczone na coraz wiekszej ilosci tekstu generowanego przez inne modele jezykowe moga utrwalac powtarzalne wzorce stylistyczne i zawezac roznorodnosc jezykowa sieci. To zjawisko bywa okreslane jako efekt zapetlenia danych treningowych - im wiecej tresci AI trafia do internetu, tym wiecej trafia potem do zbiorow treningowych kolejnych modeli.

Wnioski Pew Research Center wpisuja sie w szersza dyskusje o wiarygodnosci tresci internetowych, ktora toczy sie rownolegle z rosnaca rola AI w wyszukiwaniu i rekomendacjach. Serwisy komercyjne, ktore najsilniej odczuwaja presje na szybka produkcje tresci pod SEO, okazuja sie najbardziej podatne na masowe wykorzystanie generatorow tekstu, podczas gdy instytucje akademickie i rzadowe zachowuja znacznie wiekszy dystans.

Znaczenie dla polskich uzytkownikow i firm

Badanie dotyczy wylacznie tresci anglojezycznych, ale trend ma znaczenie takze dla polskiego rynku. Firmy zarzadzajace serwisami internetowymi, redakcje i agencje marketingowe coraz czesciej korzystaja z generatorow tekstu do szybkiego skalowania publikacji, co rodzi pytania o jakosc informacji docierajacych do odbiorcow oraz o to, jak wyszukiwarki i asystenci AI beda w przyszlosci traktowac tresci pisane przez inne modele AI. Rosnacy udzial tekstow generowanych maszynowo utrudnia tez czytelnikom odroznienie materialu przygotowanego przez czlowieka od tego wygenerowanego automatycznie.

Autorzy zastrzegaja, ze metoda detekcji jest wiarygodna przy analizie duzych zbiorow danych, ale pojedyncze dokumenty moga zostac blednie sklasyfikowane. Mimo tego zastrzezenia skala i konsekwencja trendu - utrzymujacego sie nieprzerwanie od konca 2022 roku - wskazuja, ze udzial AI w tworzeniu tresci internetowych bedzie w kolejnych latach nadal rosnac.

Udostępnij: