Jak optymalizować artykuły blogowe, aby stawały się bezpośrednim źródłem odpowiedzi dla modeli AI (LLM)?

Redakcja tekstu pod cytowanie w odpowiedzi

Baner wejsciowyParallax

Jak optymalizować artykuły blogowe, aby stawały się bezpośrednim źródłem odpowiedzi dla modeli AI (LLM)?

Redakcja tekstu pod cytowanie w odpowiedzi

Autor nie posiada zdjęcia
Tomasz Piasecki
28 czerwca 2024

Od kilku tygodni w każdej rozmowie o treściach pojawia się to samo pytanie: co zrobić, żeby nasz artykuł był tym, z którego korzysta model, kiedy ktoś zadaje pytanie zamiast wpisywać frazę. Pytanie jest uzasadnione — w maju Google uruchomiło w Stanach AI Overviews, czyli generowane podsumowania nad wynikami, a asystenci oparci na modelach językowych od miesięcy chodzą po sieci i podają odnośniki do stron, z których korzystali.

Chcę od razu ustawić proporcje, bo to temat, w którym łatwo o naciąganie. Nie znam nikogo, kto ma sprawdzoną, powtarzalną metodę „wchodzenia do odpowiedzi modelu”. Nie ma tu panelu, statystyk ani dokumentacji z listą czynników. Google konsekwentnie powtarza, że nie istnieją osobne wymagania techniczne ani specjalne znaczniki, żeby pojawić się w tych funkcjach.

Da się natomiast powiedzieć, co utrudnia wykorzystanie tekstu jako źródła, i to jest treść tego artykułu. Piszę o warsztacie redakcyjnym, nie o sztuczkach.

Co się właściwie zmieniło

Do niedawna cel był jeden: wejść wysoko na listę linków, żeby użytkownik kliknął. Teraz doszedł drugi mechanizm — tekst może zostać przeczytany, streszczony i pokazany bez kliknięcia, z odnośnikiem do źródła obok.

Warto rozdzielić dwie sytuacje, bo działają inaczej. Pierwsza to podsumowania w samej wyszukiwarce. AI Overviews wystartowały w maju w Stanach Zjednoczonych i w polskich wynikach ich nie ma; przez ostatnie tygodnie widzieliśmy zresztą, jak Google je koryguje po fali błędnych i kompromitujących odpowiedzi. Druga sytuacja to asystenci i wyszukiwarki oparte na modelach, do których użytkownik idzie zamiast do wyszukiwarki i które również podają źródła.

Dla mnie praktyczna różnica jest taka, że w pierwszym przypadku nadal obowiązuje wszystko, co wiem o SEO, a w drugim liczy się to, czy tekst da się w ogóle pobrać i czy da się z niego wyjąć spójny fragment. Obie sytuacje mają jeden wspólny warunek wstępny: strona musi być indeksowalna i czytelna bez wykonywania skomplikowanych skryptów. Treść wstrzykiwana po kliknięciu w zakładkę bywa niewidoczna dla tego, kto ją zbiera.

Jak model dobiera fragment, który zacytuje

Uproszczony obraz, który mi wystarcza do pracy: najpierw następuje wyszukanie kilku źródeł, potem złożenie z nich odpowiedzi. Model nie ocenia całej strony w skali od jednego do dziesięciu. Wybiera fragmenty, które pasują do pytania, i próbuje z nich zrobić spójny akapit.

To ma bardzo konkretny skutek dla sposobu pisania. Jeśli odpowiedź na pytanie „ile trwa okres uczenia strategii stawek” jest u mnie rozproszona na cztery akapity w trzech różnych sekcjach, to nawet dobry model ma trudność, żeby ją stamtąd wyciągnąć w całości. Jeśli ta sama odpowiedź stoi w jednym miejscu jako dwa zdania, szansa jest większa.

Druga konsekwencja: kontekst musi być w tym samym fragmencie. Zdanie „w takim wypadku lepiej tego nie robić” jest bezużyteczne w oderwaniu, bo nie wiadomo, o co chodzi. Piszę więc częściej niż dawniej pełnymi, samodzielnymi zdaniami, powtarzając podmiot zamiast zastępować go zaimkiem. Wygląda to trochę mniej elegancko i przez pierwsze tygodnie mnie to drażniło.

Struktura: jedno pytanie, jedno miejsce

Praktyka, którą przyjąłem, sprowadza się do jednej reguły: każde pytanie, na które artykuł odpowiada, ma w tekście swoje jedno miejsce.

W praktyce oznacza to kilka nawyków:

  • Nagłówek sekcji formułowany tak, jak pyta człowiek, a nie hasłowo. „Jak długo trwa okres uczenia” zamiast „Okres uczenia”.
  • Odpowiedź w pierwszym albo drugim akapicie sekcji, nie w podsumowaniu na końcu. Rozbudowanie, zastrzeżenia i wyjątki idą za odpowiedzią, nie przed nią.
  • Definicje pojęć w jednym zdaniu, zanim zaczynam ich używać. Zdanie definicyjne jest najczęściej cytowanym typem zdania i warto, żeby było dobre.
  • Listy tam, gdzie treść naprawdę jest listą — kroki, warunki, typy. Nie tam, gdzie chcę rozbić ścianę tekstu.
  • Brak treści istotnej wyłącznie w grafice. To, co jest tylko na obrazku, nie istnieje dla nikogo, kto czyta tekst maszynowo, a często też dla czytelnika na telefonie.

Nie zmieniłem przy tym niczego w kwestii długości. Nadal uważam, że artykuł ma być tak długi, jak wymaga temat. Zmieniło się rozmieszczenie treści wewnątrz artykułu.

Fakty, które da się sprawdzić

Model nie ma powodu, żeby zaufać akurat mnie, ale ma powód, żeby wybrać fragment, który jest konkretny i wewnętrznie spójny.

Dlatego twarde rzeczy w tekście traktuję poważniej niż kiedyś. Podaję datę przy każdej informacji o zmianie w produkcie — „od marca 2024″ mówi więcej niż „niedawno” i pozostaje prawdziwe po roku. Nazwy produktów piszę pełne, w wersji obowiązującej dziś, bo tekst z nieaktualną nazwą jest gorszym źródłem niż tekst, który jej nie zawiera wcale. Liczby podaję tylko wtedy, gdy mam je z konkretnego, wskazanego miejsca, i mówię, skąd pochodzą.

Osobna sprawa to autorstwo. Nie mam dowodów, że podpis pod tekstem wpływa na to, czy fragment zostanie zacytowany. Wiem natomiast, że tekst bez autora, bez daty i bez informacji o tym, kto stoi za stroną, jest trudniejszy do oceny przez kogokolwiek — człowieka, algorytm rankingowy i model. Skoro to jest tanie w zrobieniu, to nie widzę powodu, żeby tego nie mieć.

Rzecz, której świadomie nie robię: nie doklejam do tekstu list pytań i odpowiedzi wyłącznie po to, żeby „nakarmić” model. Widzę takie artykuły coraz częściej i czyta się je fatalnie. Jeżeli sekcja z pytaniami ma sens dla czytelnika — piszę ją. Jeżeli nie — nie.

Co możesz kontrolować technicznie

Tu jest kilka rzeczy, które warto rozumieć, bo bywają mylone.

  • Fragmenty w wynikach i w podsumowaniach Google kontrolujesz tymi samymi narzędziami co zawsze — dyrektywą zabraniającą pokazywania fragmentu, ograniczeniem jego długości oraz atrybutem wyłączającym pojedynczy element ze strony. Google mówi wprost, że treść w podsumowaniach opiera się na normalnym indeksowaniu, a nie na osobnym mechanizmie.
  • Osobny wpis w pliku robots dla Google-Extended dotyczy wykorzystania treści do trenowania modeli Google, a nie obecności w wyszukiwarce. To dwie różne decyzje i warto podjąć je świadomie, zamiast blokować wszystko odruchowo.
  • Roboty innych firm również da się blokować w pliku robots, każdego pod jego nazwą. Zablokowanie ich oznacza jednak, że przestajesz być cytowany także tam, gdzie cytowanie daje ruch.
  • Dane strukturalne nie są warunkiem pojawienia się w podsumowaniu, ale porządkują to, co strona mówi o sobie: kto jest autorem, kiedy powstał tekst, czego dotyczy.

Decyzja o blokowaniu robotów AI jest biznesowa, nie techniczna. Wydawcy, którzy żyją z ruchu, mają inny interes niż firma, dla której blog jest wsparciem sprzedaży. Sam na stronach usługowych ich nie blokuję.

Jak to mierzyć, żeby się nie oszukiwać

Najsłabszy punkt całego tematu. Nie ma raportu pokazującego, ile razy zostałeś użyty jako źródło odpowiedzi, i nie zapowiedziano narzędzia, które by to pokazywało.

Co robię w zamian: raz na jakiś czas biorę listę kilkunastu pytań, na które odpowiadają moje teksty, i po prostu je zadaję — w asystentach, które podają źródła. Zapisuję, czy pojawia się moja strona, czy konkurencja, i czy odpowiedź jest zgodna z tym, co napisałem. To ręczna, niereprezentatywna próbka, ale wyłapuje rzecz najważniejszą: czy jestem cytowany poprawnie. Zdarzyło mi się zobaczyć streszczenie mojego tekstu, które odwracało wniosek — i to był sygnał, że napisałem niejasno, a nie że model zawinił.

Poza tym pilnuję zwykłych danych: wyświetleń i kliknięć w raporcie skuteczności, ruchu z wyszukiwarki, zapytań. Jeśli kiedyś podsumowania trafią do polskich wyników i zabiorą część kliknięć, zobaczę to jako rozjazd między wyświetleniami a klikami, nie jako nagły spadek pozycji.

I ostatnia rzecz, bardziej porządkowa niż techniczna: nie przebudowuję dziś całego bloga pod hipotezę. Zmieniam sposób pisania nowych tekstów i porządkuję te, które i tak wymagały aktualizacji. Gdyby okazało się, że mechanizmy działają inaczej, niż zakładam, nie stracę na tym nic — bo wszystkie te zabiegi robią tekst czytelniejszym dla człowieka.

Podziel się tym artykułem z innymi!

Twitter Facebook Linke.din
Autor nie posiada zdjęcia
Tomasz Piasecki
Specjalista Google Ads / SEM
Zajmuję się kampaniami Google Ads i widocznością stron w wyszukiwarce. Na blogu UDI Group piszę o tym, jak ustawienia kampanii i decyzje techniczne przekładają się na realne wyniki. Staram się tłumaczyć mechanizmy, a nie tylko podawać gotowe przepisy.