Jak walczyć ze sprofanowanymi treściami i duplikacją generowaną przez generatory AI?

Problem nie jest w narzędziu, a w braku wkładu

Baner wejsciowyParallax

Jak walczyć ze sprofanowanymi treściami i duplikacją generowaną przez generatory AI?

Problem nie jest w narzędziu, a w braku wkładu

Autor nie posiada zdjęcia
Tomasz Piasecki
30 czerwca 2023

Od kilku miesięcy dostaję dwa pytania, które wyglądają na przeciwstawne, a mają wspólny korzeń. Pierwsze: czy wolno używać generatorów tekstu do treści na stronę. Drugie: co zrobić, gdy konkurencja zalewa rynek setkami wygenerowanych artykułów na te same frazy.

Wspólny korzeń jest taki, że w obu przypadkach chodzi o to samo — o wkład. Czy tekst wnosi coś, czego wcześniej w sieci nie było, czy jest kolejnym przetworzeniem tego, co już wielokrotnie napisano.

To rozróżnienie jest też podstawą oficjalnego stanowiska Google, które warto znać dokładnie, bo w obiegu funkcjonuje w wersji uproszczonej i przez to fałszywej.

Co Google faktycznie powiedziało

W lutym Google opublikowało stanowisko wobec treści generowanych przez sztuczną inteligencję i zostało ono szeroko streszczone jako „AI jest dozwolone”. To streszczenie jest niepełne w sposób, który prowadzi do złych decyzji.

Sedno tego stanowiska brzmi inaczej: nie ma znaczenia, czym tekst został wytworzony — znaczenie ma to, czy powstał z myślą o człowieku, czy o manipulowaniu wynikami wyszukiwania. Automatyzacja użyta do produkowania masy treści pod frazy pozostaje tym, czym była zawsze, czyli spamem. Automatyzacja użyta do pomocy w tworzeniu czegoś użytecznego nie jest problemem.

Praktycznie oznacza to, że pytanie „czy Google wykryje, że to AI” jest źle postawione. Właściwe brzmi: czy ten tekst wnosi coś, czego nie ma w dziesięciu innych na ten temat. Jeśli nie wnosi, to nieistotne, czy napisał go człowiek, czy model — i tak nie ma powodu, żeby wygrał.

Warto przy tym pamiętać, że dostępne narzędzia do rozpoznawania tekstu maszynowego są zawodne w obie strony: oznaczają ludzkie teksty jako maszynowe i przepuszczają maszynowe jako ludzkie. Opieranie strategii na ich wskazaniach jest budowaniem na piasku.

Na czym polega realny problem duplikacji

Duplikacja z generatorów rzadko wygląda jak kopiowanie słowo w słowo. Wygląda jak duplikacja na poziomie struktury i treści merytorycznej.

Dziesięć artykułów o tym samym zagadnieniu, każdy z inną kolejnością słów, ma tę samą listę podpunktów, te same przykłady, tę samą definicję i te same wnioski. Żaden nie jest kopią, wszystkie są nieodróżnialne. Klasyczne narzędzia do wykrywania plagiatu tego nie pokażą, bo na poziomie zdań teksty są różne.

Skutki są dwa i dotykają różnych osób. Dla właściciela serwisu, który tak produkuje treści, skutkiem jest to, że żadna z tych stron nie ma powodu wygrać — a dodatkowo konkurują ze sobą wewnątrz własnej witryny. Dla konkurenta, który pisze rzetelnie, skutkiem jest zaszumienie wyników i konieczność wyraźniejszego odróżnienia się.

Jest jeszcze trzeci skutek, o którym mówi się rzadziej: koszt utrzymania. Serwis z tysiącem powierzchownych tekstów jest praktycznie nieaktualizowalny. Gdy zmienia się rzeczywistość opisywana w tych treściach, nikt tego nie przejrzy.

Jak wykryć duplikację u siebie

Zanim ocenisz konkurencję, warto sprawdzić własny serwis. Kilka metod w kolejności od najprostszej.

  • Raport skuteczności w Search Console — filtruj po zapytaniu i sprawdź, ile różnych stron wyświetla się na tę samą frazę. Jeśli na jedno zapytanie pracują trzy Twoje podstrony, masz kanibalizację niezależnie od tego, jak powstały te teksty.
  • Porównanie nagłówków — wyeksportuj listę nagłówków wszystkich artykułów z jednej kategorii do arkusza i posortuj. Powtarzające się struktury widać wtedy natychmiast i to najszybsza znana mi metoda diagnozy.
  • Wyszukiwanie fraz w cudzysłowie — weź charakterystyczne zdanie ze swojego tekstu i poszukaj go w wyszukiwarce. Jeśli znajdziesz je na innych stronach, wiesz, że materiał źródłowy był wspólny.
  • Porównanie fragmentów między własnymi tekstami — prosty skrypt liczący powtarzające się ciągi kilku słów między artykułami wyłapuje to, czego oko nie zauważy przy setkach stron.

Ostatnia metoda jest tą, którą sam stosuję najczęściej, i polecam ją każdemu, kto publikuje regularnie. Powtarzalne akapity powstają nie tylko z generatorów — powstają też u ludzi piszących wiele tekstów na pokrewne tematy, bo pewne sformułowania po prostu wracają.

Co zrobić z duplikacją, którą już masz

Kolejność ma znaczenie, bo pierwsza decyzja jest najtrudniejsza organizacyjnie.

Najpierw rozstrzygnij, które strony mają zostać. Przy grupie kilku tekstów o tym samym zostawiam jeden — ten z najlepszą historią widoczności — i scalam do niego to, co wartościowe z pozostałych. Reszta idzie do przekierowania na ten jeden adres, nie do usunięcia bez śladu.

Potem dodaj wkład tam, gdzie go nie ma. Nie chodzi o rozbudowanie tekstu, a o dopisanie tego, czego nie ma w innych źródłach: własne obserwacje, konkretne przykłady z własnej praktyki, opis sytuacji, w których rada się nie sprawdza, dane, które sam zebrałeś.

Na końcu ustal zasadę na przyszłość. Moja jest prosta: tekst może powstać z pomocą narzędzia, ale musi zawierać przynajmniej jedną rzecz, której to narzędzie nie mogło wiedzieć. Jeśli autor nie umie wskazać, co to jest, tekst nie idzie do publikacji.

Jak konkurować z serwisami zalewającymi rynek

Uczciwie: nie ilością. Tej wojny nie da się wygrać, bo koszt wytworzenia kolejnego powierzchownego tekstu jest po tamtej stronie bliski zeru.

Da się natomiast konkurować rzeczami, których generator nie ma dostępu do wytworzenia.

Własne dane. Cokolwiek zmierzysz, policzysz albo zaobserwujesz w swojej praktyce, jest nieodtwarzalne. To najmocniejszy dostępny wyróżnik.

Doświadczenie z konkretnych sytuacji. Opis tego, co nie zadziałało i dlaczego, jest treścią, której nie znajdziesz w materiałach ogólnych.

Aktualność. Serwisy produkujące masowo rzadko wracają do starych tekstów. Utrzymywanie treści w zgodzie ze zmieniającą się rzeczywistością jest realną przewagą, zwłaszcza w dziedzinach, gdzie coś zmienia się co kwartał.

Wąska specjalizacja. Lepiej być najlepszym źródłem w małym obszarze niż przeciętnym w szerokim. To także spójne z kierunkiem, w którym idzie ocena treści — autorytet w temacie liczy się bardziej niż liczba tekstów.

I rzecz, którą warto powiedzieć na koniec, bo bywa pomijana w dyskusjach o AI i treściach: dzisiejsze wyniki wyszukiwania to nie jest jedyne miejsce, gdzie to się rozgrywa. Google zapowiedziało w maju generatywne odpowiedzi w wyszukiwarce — na razie w programie testowym i poza Europą — a Bing udostępnił swoje szerzej na początku maja. Nie wiemy jeszcze, jak to zmieni ruch na strony. Wiemy natomiast, że w obu rozwiązaniach cytowane są konkretne źródła, a materiał wnoszący coś własnego ma większe szanse być takim źródłem niż kolejne przetworzenie tego, co już jest.

Podziel się tym artykułem z innymi!

Twitter Facebook Linke.din
Autor nie posiada zdjęcia
Tomasz Piasecki
Specjalista Google Ads / SEM
Zajmuję się kampaniami Google Ads i widocznością stron w wyszukiwarce. Na blogu UDI Group piszę o tym, jak ustawienia kampanii i decyzje techniczne przekładają się na realne wyniki. Staram się tłumaczyć mechanizmy, a nie tylko podawać gotowe przepisy.