Porządkowanie indeksacji serwisów typu User-Generated Content (forum, sekcje komentarzy) pod SEO.

Kilkadziesiąt tysięcy adresów bez nadzoru

Baner wejsciowyParallax

Porządkowanie indeksacji serwisów typu User-Generated Content (forum, sekcje komentarzy) pod SEO.

Kilkadziesiąt tysięcy adresów bez nadzoru

Autor nie posiada zdjęcia
Tomasz Piasecki
30 sierpnia 2024

Serwisy z treścią tworzoną przez użytkowników mają w SEO specyficzny problem: ich struktura adresów rośnie sama, bez decyzji redakcji. Każdy nowy wątek, każdy profil, każda strona paginacji, każde sortowanie listy tematów to osobny adres, który Google może odwiedzić i zaindeksować.

Efekt widzę zawsze podobny. Serwis ma kilkaset stron, które ktoś świadomie stworzył, i kilkadziesiąt tysięcy, które powstały automatycznie. Wśród nich są wątki z realnie wartościowymi odpowiedziami, po które ludzie przychodzą z wyszukiwarki — i całe kategorie adresów, których nie powinno tam być w ogóle.

Porządkowanie takiego serwisu nie polega na masowym blokowaniu wszystkiego, co wygląda niechlujnie. Kilka razy widziałem, jak taka operacja zabrała stronie najlepiej pracujący ruch. Poniżej opisuję kolejność, w której to robię, i decyzje, które trzeba podjąć świadomie.

Skąd bierze się problem w tego typu serwisach

Zanim zacznę cokolwiek zmieniać, rozumiem, skąd biorą się adresy. Prawie zawsze są to te same kilka rodzin.

  • Wątki i pojedyncze wpisy — zwykle najwartościowsza część serwisu, ale o skrajnie zróżnicowanej jakości: od wyczerpujących odpowiedzi do pytań bez ani jednej reakcji.
  • Strony paginacji — długie wątki dzielone na strony, listy tematów w kategoriach, archiwa. Rosną liniowo z aktywnością serwisu.
  • Profile użytkowników — jeden adres na konto, w większości puste albo zawierające wyłącznie nazwę i datę rejestracji. Przy serwisie z historią to potrafi być największa rodzina adresów w całym systemie.
  • Wyniki wyszukiwania wewnętrznego i filtry — adresy z parametrami, generowane przez każde zapytanie wpisane w wyszukiwarkę serwisu. Zbiór nieskończony, jeśli jest dostępny dla robotów.
  • Warianty tego samego adresu — z sortowaniem, z identyfikatorem sesji, ze stroną tagu utworzoną przez użytkownika, z odnośnikiem do konkretnego posta w wątku.

Dopóki tego podziału nie ma na papierze, każda decyzja o indeksacji jest zgadywaniem. Sam podział zajmuje mi zwykle więcej czasu niż późniejsze wdrożenie.

Inwentaryzacja: co Google faktycznie widzi

Do inwentaryzacji używam trzech źródeł i żadne z nich osobno nie wystarcza.

Pierwsze to raport indeksowania stron w Search Console. Interesuje mnie nie tyle liczba stron zaindeksowanych, ile rozkład przyczyn wykluczenia: ile adresów jest zablokowanych, ile ma inny adres kanoniczny, ile zostało przeskanowanych i nie zaindeksowanych. Ta ostatnia kategoria przy serwisach z treścią użytkowników jest zwykle największa i to ona mówi najwięcej o jakości.

Drugie to własne przejście serwisu programem skanującym witrynę. Daje pełną listę adresów, do których prowadzą odnośniki, wraz z tytułami i statusami. Dopiero po zestawieniu tej listy z danymi z Search Console widać rozdźwięk: adresy, które istnieją, ale nie są linkowane, i adresy linkowane, których Google nie odwiedza.

Trzecie to raport statystyk indeksowania. Pokazuje, na co robot poświęca czas. Widok, w którym połowa żądań idzie na profile użytkowników albo na wyniki wyszukiwania wewnętrznego, jest bardzo częsty i bardzo wymowny.

Które adresy zostawić w indeksie

Regułę mam prostą, choć jej zastosowanie wymaga pracy: w indeksie zostaje adres, który potrafi być najlepszą odpowiedzią na jakieś realne zapytanie. Wszystko inne jest kandydatem do wypadnięcia.

W praktyce oznacza to trzy grupy do zostawienia: wątki z odpowiedziami, których nie ma nigdzie indziej w tej formie, strony kategorii, które sensownie grupują tematy, i pojedyncze strony pomocnicze serwisu. To zwykle kilka procent całości.

Z indeksowania wyłączam profile użytkowników, wyniki wyszukiwania wewnętrznego, adresy sortowań i filtrów, strony tagów z jedną pozycją oraz wątki, które nie mają ani jednej odpowiedzi. Ostatnia kategoria jest sporna i klienci najczęściej się przy niej opierają, bo „przecież to pytanie ktoś kiedyś wpisze”. Odpowiadam wtedy pytaniem, czy strona z pytaniem bez odpowiedzi jest dla kogoś przydatna. Rozwiązanie kompromisowe, które stosuję na aktywnych forach: wątek wchodzi do indeksu automatycznie po pierwszej merytorycznej odpowiedzi, a przed nią zostaje wyłączony. To da się zrobić szablonem, bez ręcznej pracy moderatorów.

Sekcje komentarzy pod artykułami to inny przypadek — komentarze zwykle nie mają osobnych adresów, więc nie są problemem indeksacyjnym. Problemem staje się dopiero podział komentarzy na strony i osobne adresy dla pojedynczego komentarza.

Właściwe narzędzie do właściwego celu

Tu popełnia się najwięcej błędów, bo mechanizmy wyglądają na wymienne, a nie są.

  • Znacznik noindex — chcę, żeby adres nie był w wynikach, ale robot może go odwiedzać i podążać za odnośnikami. To domyślne narzędzie dla profili, wyników wyszukiwania wewnętrznego i słabych wątków.
  • Blokada w pliku robots — chcę oszczędzić czas robota i nie zależy mi na przekazywaniu niczego z tych adresów. Uwaga: zablokowanego adresu Google nie odwiedzi, więc nie zobaczy też znacznika noindex. Połączenie obu naraz to najczęstszy błąd w tej pracy i skutkuje adresami, które zostają w indeksie bez opisu.
  • Adres kanoniczny — mam kilka adresów tej samej treści i wskazuję jeden główny. Właściwe narzędzie dla sortowań, parametrów i odnośników do konkretnego posta w wątku. Nie jest narzędziem do ukrywania stron słabej jakości.
  • Kod 410 albo 404 — treść zniknęła i nie wróci. Przy usuwaniu tysięcy pustych profili to uczciwsze i szybsze rozwiązanie niż utrzymywanie ich z noindeksem przez lata.

Kolejność wdrożenia ma znaczenie. Najpierw ustawiam noindex i czekam, aż Google przetworzy zmianę na zauważalnej części adresów. Dopiero potem, jeśli chcę dodatkowo ograniczyć skanowanie, dokładam blokadę w pliku robots. Odwrotna kolejność zamraża stan na miesiące.

Paginacja i długie wątki

Osobny temat, bo w serwisach dyskusyjnych paginacja to nie dodatek, a główna część struktury.

Strony dalsze niż pierwsza traktuję jako normalne, indeksowalne adresy z własnym adresem kanonicznym wskazującym na siebie. Wskazywanie kanonicznego na pierwszą stronę wątku jest błędem: treść drugiej i trzeciej strony jest inna, a takim ustawieniem mówimy Google, że jej nie ma. Traci się wtedy ruch z długiego ogona zapytań, na które odpowiada właśnie dalsza część dyskusji.

Nie stosuję też starych znaczników wskazujących następną i poprzednią stronę — Google przestało ich używać kilka lat temu i potwierdziło to publicznie. Zamiast nich liczy się to, czy z każdej strony paginacji prowadzą zwykłe odnośniki do sąsiednich stron, dostępne bez skryptów.

Warto dopracować tytuły. Dziesięć stron wątku z identycznym tytułem to dziesięć adresów, które w oczach wyszukiwarki konkurują ze sobą o to samo zapytanie. Dodanie numeru strony do tytułu jest zmianą na kilka minut, a rozwiązuje realny problem.

Jakość treści użytkowników a ocena całej witryny

To wątek, który w tym roku zrobił się ważniejszy niż wcześniej.

W marcu Google ogłosiło nowe zasady dotyczące spamu, wśród nich dwie istotne dla serwisów z treścią użytkowników. Pierwsza dotyczy masowej produkcji treści bez wartości dodanej, bez względu na to, kto lub co je wyprodukowało. Druga dotyczy wykorzystywania reputacji witryny do publikowania obcych treści bez nadzoru gospodarza — pisano o niej głównie w kontekście dużych wydawców goszczących cudze artykuły, ale mechanizm jest ten sam: na naszej domenie odpowiadamy za to, co publikują inni.

Praktyczny wniosek dla forum czy sekcji komentarzy jest prosty. Brak moderacji przestaje być kwestią estetyki, a staje się kwestią oceny całej domeny. Sekcja z tysiącami wpisów niskiej jakości, generowanych masowo i wystawionych w indeksie, obciąża także tę część serwisu, którą redakcja przygotowuje sama.

Nie oznacza to, że treść użytkowników jest ryzykiem, którego lepiej unikać. Dobre forum jest jednym z najtrudniejszych do skopiowania zasobów, jakie firma może mieć — właśnie dlatego, że zawiera prawdziwe pytania i prawdziwe odpowiedzi. Oznacza to, że część tej treści świadomie zostawia się poza indeksem.

Monitorowanie po wdrożeniu

Zmiany indeksacyjne działają z opóźnieniem i to jest najtrudniejszy element tej pracy do wytrzymania.

Zanim cokolwiek wdrożę, zapisuję stan wyjściowy: liczbę adresów w każdej kategorii raportu indeksowania, liczbę kliknięć i wyświetleń dla najważniejszych sekcji, rozkład żądań robota w statystykach indeksowania. Bez tej fotografii za dwa miesiące nie odpowiem na pytanie, czy operacja pomogła.

Potem wdrażam etapami, po jednej rodzinie adresów, z odstępem kilku tygodni. Najpierw rzeczy bezdyskusyjne — wyniki wyszukiwania wewnętrznego, sortowania, puste profile. Dopiero na końcu rzeczy sporne, czyli słabe wątki, bo tylko przy nich istnieje realne ryzyko utraty ruchu. Mapę witryny zostawiam wyłącznie z adresami, które mają być w indeksie.

Na koniec rzecz, którą mówię klientom przed startem: spadek liczby zaindeksowanych stron nie jest porażką tej operacji, a jej celem. Wskaźnikiem sukcesu jest ruch i to, ile żądań robota trafia na strony, na których nam zależy — nie licznik w raporcie indeksowania.

Podziel się tym artykułem z innymi!

Twitter Facebook Linke.din
Autor nie posiada zdjęcia
Tomasz Piasecki
Specjalista Google Ads / SEM
Zajmuję się kampaniami Google Ads i widocznością stron w wyszukiwarce. Na blogu UDI Group piszę o tym, jak ustawienia kampanii i decyzje techniczne przekładają się na realne wyniki. Staram się tłumaczyć mechanizmy, a nie tylko podawać gotowe przepisy.