Oficjalny debiut Google AI Overviews (USA) – co wiemy o sposobie cytowania źródeł przez sztuczną inteligencję?

Co Google powiedziało, a czego nie

Baner wejsciowyParallax

Oficjalny debiut Google AI Overviews (USA) – co wiemy o sposobie cytowania źródeł przez sztuczną inteligencję?

Co Google powiedziało, a czego nie

Autor nie posiada zdjęcia
Tomasz Piasecki
31 maja 2024

Czternastego maja, na Google I/O, wyszukiwarka dostała funkcję, o której mówiło się od roku. AI Overviews — czyli to, co do niedawna nazywało się Search Generative Experience i siedziało w Search Labs za listą oczekujących — ruszyło w Stanach Zjednoczonych dla wszystkich użytkowników, bez zapisów i bez etykiety eksperymentu.

W Polsce tego nie zobaczysz i przez najbliższy czas prawdopodobnie nie zobaczysz. To jednak nie powód, żeby odłożyć temat. Sposób, w jaki generowane podsumowanie wybiera i pokazuje źródła, jest pierwszą konkretną informacją o tym, jak Google zamierza dzielić się ruchem w wynikach tworzonych przez model językowy.

Zebrałem tu to, co na koniec maja faktycznie wiadomo, i osobno to, czego nie wiadomo, a bywa przedstawiane jako pewnik. Ostatnie dwa tygodnie dostarczyły przy tym materiału, którego w Mountain View nikt nie planował.

Co dokładnie zostało uruchomione

Warto uporządkować nazwy, bo w polskich publikacjach panuje bałagan. Od maja 2023 roku Google testowało generatywne odpowiedzi pod nazwą Search Generative Experience, dostępne w Search Labs — najpierw w USA, potem w kolejnych krajach, ale nigdy w Unii Europejskiej. To był opt-in: użytkownik musiał świadomie włączyć eksperyment.

Teraz zmieniły się dwie rzeczy. Pierwsza to nazwa: funkcja nazywa się AI Overviews i przestała być eksperymentem. Druga, znacznie ważniejsza, to sposób dystrybucji — podsumowanie pojawia się domyślnie, nad organicznymi wynikami, dla części zapytań, bez żadnej akcji ze strony użytkownika.

Zakres na dziś to Stany Zjednoczone i język angielski. Google zapowiedziało rozszerzenie na kolejne rynki, ale nie podało ani listy krajów, ani terminów. Dla Polski nie ma nawet nieoficjalnej daty, a europejskie regulacje są dodatkową zmienną, której nikt publicznie nie skwantyfikował.

Nie każde zapytanie dostaje podsumowanie. Google konsekwentnie powtarza, że AI Overviews uruchamia się tam, gdzie model uznaje, że synteza kilku źródeł da lepszą odpowiedź niż lista linków. W praktyce oznacza to zapytania złożone, wieloczłonowe, porównawcze i „jak coś zrobić”. Przy zapytaniach nawigacyjnych i czysto transakcyjnych podsumowania zwykle nie ma.

Skąd bierze się treść podsumowania

To najważniejszy element całej układanki i jednocześnie ten, o którym Google mówi najoględniej.

Oficjalne stanowisko brzmi tak: podsumowanie nie jest swobodną wypowiedzią modelu, ale odpowiedzią opartą na treściach z czołowych wyników wyszukiwania. Google nazywa to zakotwiczeniem w wynikach organicznych i argumentuje, że dlatego AI Overviews nie konfabuluje w takim stopniu, w jakim robią to samodzielne chatboty. Model dostaje materiał ze stron, które i tak są w indeksie i i tak rankują.

Praktyczna konsekwencja jest dla mnie oczywista, choć rzadko wypowiadana wprost: żeby trafić do podsumowania, trzeba najpierw rankować. Nie ma osobnego kanału, osobnego zgłoszenia ani osobnego znacznika, który wpuszcza treść do generowanej odpowiedzi. To ten sam indeks i ten sam ranking, tylko inaczej zaprezentowany.

Google podkreśla też, że nie ma osobnego mechanizmu opt-in dla AI Overviews. Strona, która jest w indeksie i pozwala na wyświetlanie fragmentów, może zostać wykorzystana jako źródło. Kontrolę daje to samo, co wcześniej: znacznik nosnippet, ograniczenie max-snippet i atrybut data-nosnippet. Są to jednak narzędzia bardzo tępe — użycie ich wycina fragmenty także z klasycznych wyników, więc rozwiązanie ma cenę, której większość witryn nie chce zapłacić.

Jak wyglądają odnośniki do źródeł

Tu obserwacje są jeszcze świeże i różnią się między zapytaniami, więc formułuję je ostrożnie.

  • Podsumowanie ma linki do stron, z których pochodzą informacje. Google mówi o nich jako o wyróżnionych odnośnikach umieszczonych przy odpowiednich fragmentach tekstu, a nie o jednej wspólnej bibliografii na końcu.
  • Liczba widocznych źródeł jest niewielka. To zwykle kilka pozycji, nie kilkanaście, i część z nich jest ukryta pod elementem rozwijanym.
  • Źródła nie odpowiadają jeden do jednego pierwszym pozycjom organicznym. Zdarza się, że w podsumowaniu jest strona z dalszej części pierwszej dziesiątki, a wynik z pierwszego miejsca nie jest cytowany wcale.
  • Podsumowanie zajmuje dużą część pierwszego ekranu. Klasyczne wyniki nie znikają, ale schodzą niżej — na telefonie znacznie niżej.

Jednej rzeczy Google nie ujawniło: kryteriów doboru cytowanych źródeł. Nie wiemy, czy decyduje pozycja, dopasowanie fragmentu do konkretnego zdania podsumowania, sygnały jakościowe, czy kombinacja tych rzeczy. Każdy, kto twierdzi inaczej, opiera się na obserwacji próbki, nie na dokumentacji.

Czego nie wiemy, a bywa podawane jako fakt

Pierwsza rzecz: wpływ na ruch. Google mówi o wyższej satysfakcji użytkowników i o kliknięciach lepszej jakości, ale nie publikuje żadnych danych, które dałyby się zweryfikować. Nie ma też danych po drugiej stronie — funkcja działa w szerokiej dystrybucji od dwóch tygodni, na jednym rynku, więc każda liczba krążąca w branży jest albo szacunkiem, albo obserwacją z pojedynczego serwisu.

Druga: brak raportowania. Nie ma ani osobnego wymiaru w Search Console, ani filtra, który pozwoliłby oddzielić wejścia z podsumowania od wejść z klasycznych wyników. Kliknięcia i wyświetlenia lądują w tym samym worku. Dla mnie to najpoważniejszy problem operacyjny, bo bez pomiaru nie da się prowadzić rozmowy o skutkach.

Trzecia: brak wskazówek optymalizacyjnych. Google nie opublikowało żadnego zestawu zaleceń typu „zrób to, żeby być cytowany”. Powtarza wytyczne, które zna każdy — twórz treści dla ludzi, dbaj o techniczne podstawy, pokazuj doświadczenie i wiarygodność. Traktuję to jako informację prawdziwą, tylko niesatysfakcjonującą.

Dwa tygodnie wpadek i reakcja Google

Nie da się opisać tego debiutu bez tego, co stało się po nim, bo to również mówi coś o mechanizmie cytowania.

W ciągu kilku dni od uruchomienia w mediach społecznościowych zaczęły krążyć zrzuty ekranu z absurdalnymi odpowiedziami. Część była autentyczna, część — jak przyznało Google i co potwierdzali niezależni obserwatorzy — sfabrykowana. Wśród prawdziwych przypadków powtarzał się jeden schemat: model traktował poważnie treść, która poważna nie była, na przykład żartobliwy wpis z forum, albo składał odpowiedź z fragmentów, które osobno były prawdziwe, a razem tworzyły nonsens.

Trzydziestego maja Liz Reid, szefowa wyszukiwarki, opublikowała wyjaśnienie. Najciekawsze w nim jest rozróżnienie: według Google problem nie polegał na tym, że model wymyślał informacje, ale na błędnej interpretacji zapytania, niezrozumieniu ironii albo na tym, że w sieci brakowało dobrego materiału do odpowiedzi. Google zapowiedziało też konkretne poprawki, w tym ograniczenie wykorzystywania treści tworzonych przez użytkowników i ostrożniejsze podejście do zapytań zdrowotnych.

Dla mnie płynie z tego prosty wniosek: zakotwiczenie w wynikach organicznych nie jest gwarancją poprawności. Jeśli źródło jest słabe albo dwuznaczne, podsumowanie odziedziczy ten problem. To zmienia sposób, w jaki patrzę na treści na forach i w sekcjach komentarzy — także na własnych stronach klientów.

Co to zmienia w pracy nad treścią

Na razie niewiele, i mówię to świadomie, bo widzę już oferty na „optymalizację pod AI Overviews”.

Rzeczy, które robię i tak, zyskują dodatkowe uzasadnienie. Jednoznaczna, samodzielna odpowiedź na konkretne pytanie, umieszczona wysoko na stronie, jest łatwiejsza do wykorzystania przez model niż akapit, który dopiero po pięciu zdaniach dochodzi do sedna. Precyzyjne nagłówki, uporządkowana struktura i dane, które da się zweryfikować, działają w tę samą stronę.

Zmienia się natomiast sposób myślenia o zapytaniach informacyjnych. Jeśli podsumowanie odpowiada na pytanie w całości, kliknięcie przestaje być potrzebne. Dlatego przy planowaniu treści zaczynam rozdzielać dwa cele: teksty, które mają przyprowadzić ruch, i teksty, które mają zbudować obecność w odpowiedzi. Do pierwszej grupy coraz słabiej nadają się proste definicje i krótkie poradniki.

Warto też zacząć zbierać dane porównawcze już teraz. Nawet jeśli w Polsce funkcji nie ma, warto mieć zapisany stan Search Console i ruchu organicznego z okresu przed jej wejściem. Nie da się odtworzyć punktu odniesienia po fakcie.

Czego bym teraz nie robił

Nie blokowałbym Google przed korzystaniem z fragmentów. Rachunek jest niekorzystny: tracisz widoczność w klasycznych wynikach, a nie masz w zamian nic pewnego.

Nie przepisywałbym całego serwisu pod hipotezę, której nikt nie potwierdził. Kryteria doboru źródeł nie są znane, a pierwsze tygodnie działania funkcji to najgorszy moment na wyciąganie trwałych wniosków — Google właśnie zapowiedziało kilkanaście zmian technicznych, więc obserwacje z ostatnich dwóch tygodni mogą się zdezaktualizować.

Nie kupowałbym też narzędzi, które obiecują pomiar wpływu podsumowań na ruch. Skoro Google nie udostępnia takiego wymiaru, każdy taki pomiar jest modelowaniem, a nie odczytem.

Co bym zrobił: ustawił regularne, ręczne sprawdzanie kilkunastu najważniejszych zapytań na rynku amerykańskim, jeśli firma tam działa, i uważnie czytał komunikaty Search Central. To nudne, ale na tym etapie uczciwsze niż każda alternatywa.

Podziel się tym artykułem z innymi!

Twitter Facebook Linke.din
Autor nie posiada zdjęcia
Tomasz Piasecki
Specjalista Google Ads / SEM
Zajmuję się kampaniami Google Ads i widocznością stron w wyszukiwarce. Na blogu UDI Group piszę o tym, jak ustawienia kampanii i decyzje techniczne przekładają się na realne wyniki. Staram się tłumaczyć mechanizmy, a nie tylko podawać gotowe przepisy.