Czy roboty indeksujące modele LLM (np. GPTBot) powinny być blokowane w pliku robots.txt?

Decyzja, którą warto podjąć świadomie

Baner wejsciowyParallax

Czy roboty indeksujące modele LLM (np. GPTBot) powinny być blokowane w pliku robots.txt?

Decyzja, którą warto podjąć świadomie

Autor nie posiada zdjęcia
Tomasz Piasecki
28 lutego 2025

Prośbę „zablokujmy AI-boty” słyszę od zeszłego roku regularnie i zwykle przychodzi z góry, jako decyzja już podjęta. Rzadko towarzyszy jej pytanie, co dokładnie zostanie wyłączone.

Tymczasem to nie jest jedna decyzja, a kilka osobnych, bo pod hasłem „roboty AI” kryją się mechanizmy o różnym przeznaczeniu. Jednym tokenem odcina się zbieranie materiału do trenowania modelu. Innym — pobieranie strony na potrzeby odpowiedzi, w której pojawia się link do niej. Wpisanie obu w jednej linijce to najczęstsze nieporozumienie, jakie w tym temacie widzę.

Poniżej rozkładam to na części: kto puka do serwera, czego robots.txt w ogóle nie potrafi, jakie argumenty stoją po obu stronach i jak konfiguruję plik, gdy klient chce blokady.

Kto właściwie puka do serwera

W logach z ostatnich miesięcy powtarza się kilka nazw i warto je rozróżniać, bo służą do różnych rzeczy.

  • GPTBot — crawler OpenAI zbierający materiał do trenowania modeli. Dokumentacja i token do robots.txt pojawiły się w sierpniu 2023 roku, po fali protestów wydawców.
  • OAI-SearchBot — osobny robot OpenAI obsługujący wyszukiwanie w ChatGPT, uruchomione pod koniec października 2024. To on odpowiada za to, że strona może zostać wskazana jako źródło.
  • ChatGPT-User — pobranie strony wywołane wprost przez użytkownika, który podał adres albo poprosił o sprawdzenie. Dostawca opisuje to jako działanie w imieniu człowieka, nie jako automatyczne indeksowanie.
  • Google-Extended — nie jest crawlerem. To dyrektywa, którą Google udostępnił we wrześniu 2023 roku i która mówi wyłącznie o tym, czy pobrana treść może posłużyć do trenowania modeli generatywnych.
  • Reszta stawki — roboty pozostałych dostawców modeli oraz Common Crawl, z którego zbiorów korzystało wiele projektów. Ta lista rośnie i nikt jej centralnie nie prowadzi.

Czego robots.txt nie zrobi

Zanim dojdziemy do argumentów, cztery ograniczenia, które trzeba mieć z tyłu głowy.

Plik nie działa wstecz. Treść pobrana rok temu jest już pobrana. Blokada wpisana dzisiaj dotyczy przyszłych wizyt i nie usuwa niczego z żadnego zbioru.

Plik nie jest mechanizmem wymuszającym, tylko prośbą. Roboty dużych dostawców zwykle jej przestrzegają, bo mają w tym interes reputacyjny. W zeszłym roku pojawiły się jednak doniesienia o pobieraniu treści z pominięciem tych reguł — jeżeli blokada ma być szczelna, musi być realizowana po stronie serwera albo warstwy ochronnej, nie tekstowym plikiem.

Plik nie zatrzyma człowieka, który skopiuje tekst do okna rozmowy. Ani systemu, który weźmie Twoją treść z cudzej strony, która ją przepisała.

I najważniejsze: blokada tokenu związanego z trenowaniem nie wyłącza strony z wyszukiwarki ani z generatywnych podsumowań w wynikach. Google sam to opisuje — materiał do tych podsumowań pochodzi z indeksu zbieranego przez Googlebota. Chcąc z nich wyjść, trzeba by zablokować Googlebota, czyli zniknąć z wyników.

Rozdzielenie treningu od cytowania

To jest według mnie oś całej decyzji, a jednocześnie rzecz, którą pomija większość poradników.

Zgoda na trenowanie to oddanie treści jako materiału do nauki. Zwrotu nie ma żadnego: model nie odeśle ruchu, nie poda nazwy firmy w podziękowaniu i nie zapłaci. Korzyść jest długa i niepewna — polega na tym, że marka może w ogóle zaistnieć w tym, co model „wie” o rynku.

Zgoda na pobieranie strony w celu udzielenia odpowiedzi z odnośnikiem to inna umowa. Tu istnieje możliwość, że użytkownik przejdzie na stronę albo przynajmniej zapamięta nazwę. To bliższe klasycznemu indeksowaniu, a nie oddawaniu materiału.

Dlatego prawie nigdy nie rekomenduję blokady hurtowej. Sensowna konfiguracja to zwykle: trening — zablokowany, wyszukiwanie i pobrania inicjowane przez użytkownika — otwarte. W praktyce oznacza to wpisanie do robots.txt reguł tylko dla robotów treningowych i pozostawienie w spokoju tych, które obsługują wyszukiwanie.

Kiedy blokada ma sens

Widzę kilka sytuacji, w których nie mam wątpliwości.

Pierwsza to treść, która sama jest produktem: kursy, raporty, bazy danych, wydawnictwa branżowe. Jeśli klient sprzedaje dostęp do wiedzy, oddawanie jej jako materiału treningowego jest oddawaniem towaru z magazynu.

Druga to obowiązki wynikające z umów. Zdarzają się licencje na zdjęcia i teksty, które nie przewidują takiego użycia — w takim wypadku blokada nie jest decyzją marketingową, a wykonaniem zobowiązania.

Trzecia to strony z dużą ilością danych generowanych przez użytkowników. Tu poza kwestią praw dochodzi zwykła przyzwoitość wobec ludzi, którzy te treści dodali w innym celu.

Czwarta, całkiem prozaiczna: obciążenie serwera. Widziałem serwisy z bardzo dużą liczbą podstron, na których ruch automatów zauważalnie podnosił koszty. Jeżeli sam ruch jest problemem, blokada niektórych robotów jest po prostu tańsza niż większy serwer.

Kiedy blokada szkodzi

Odwrotna sytuacja jest częstsza i mniej oczywista.

Firma usługowa, kancelaria, przychodnia, producent — dla nich treść nie jest towarem, a narzędziem sprzedaży. Odcięcie się od mechanizmów, które mogą podać nazwę firmy w odpowiedzi na pytanie klienta, jest w takim wypadku pracą przeciwko sobie. To trochę jak wypisanie się z katalogu branżowego w obawie, że ktoś przeczyta opis usługi.

Druga rzecz to blokady wpisane niedokładnie. Widziałem plik, w którym reguła dla robotów AI została dodana pod nagłówkiem zbiorczym z gwiazdką i zablokowała katalog również dla Googlebota. Efekt zauważono po dwóch tygodniach, po spadku wyświetleń. Przy edycji robots.txt jedna linijka za wysoko potrafi kosztować bardzo dużo.

Trzecia to koszt utrzymania. Lista robotów zmienia się co kilka miesięcy. Blokada wpisana raz i zapomniana daje złudzenie kontroli, a nie kontrolę.

Jak to konfiguruję w praktyce

Kolejność, której się trzymam, gdy klient chce działania.

Najpierw czytam logi serwera, zamiast zgadywać. Filtruję po nazwach robotów i sprawdzam, ile żądań faktycznie przychodzi i po co. Bywa, że problem, o którym mówi klient, w logach nie istnieje.

Potem ustalam z klientem jedną rzecz: czy odmawiamy udziału w trenowaniu, czy w cytowaniu. To pytanie biznesowe i nie podejmuję za niego tej decyzji, choć przedstawiam konsekwencje obu.

Reguły wpisuję osobnymi blokami z jawną nazwą robota, nigdy zbiorczo, i zawsze na końcu pliku, żeby nie mieszać ich z regułami dla wyszukiwarek. Każdy blok komentuję jednym zdaniem: data, powód, kto zdecydował. Po pół roku nikt tego nie pamięta.

Po wdrożeniu weryfikuję plik w Search Console i przez zwykłe pobranie adresu, a potem wracam do logów po tygodniu. Jeżeli żądania nie ustają, to znaczy, że blokada tekstowa nie wystarcza i rozmowa przenosi się do administratora serwera.

Do kalendarza wpisuję przegląd co kwartał. To najnudniejszy element całej procedury i jednocześnie ten, który decyduje, czy po roku plik nadal robi to, co miał robić.

Podziel się tym artykułem z innymi!

Twitter Facebook Linke.din
Autor nie posiada zdjęcia
Tomasz Piasecki
Specjalista Google Ads / SEM
Zajmuję się kampaniami Google Ads i widocznością stron w wyszukiwarce. Na blogu UDI Group piszę o tym, jak ustawienia kampanii i decyzje techniczne przekładają się na realne wyniki. Staram się tłumaczyć mechanizmy, a nie tylko podawać gotowe przepisy.