Modelowane listy odbiorców nie zawierają konkretnych osób, tylko prawdopodobieństwa. Wyjaśniam, jak powstają, gdzie ich szukać w panelu i jak czytać ich raporty.
Mam wobec modeli językowych podejście dość przyziemne. Nie używam ich do pisania tekstów za mnie, natomiast używam ich codziennie do rzeczy, których nikt w agencji nigdy porządnie nie robił, bo były zbyt nudne i zbyt czasochłonne.
Dwa najlepsze przykłady to opinie o produktach i raporty wyszukiwanych haseł. W obu przypadkach mamy tysiące krótkich, chaotycznych zdań napisanych przez ludzi i w obu przypadkach przeczytanie ich w całości zajęłoby kilka dni. Zwykle więc nikt tego nie robi — patrzy się na średnią ocenę i na pierwsze trzydzieści wierszy raportu.
Poniżej opisuję, jak podchodzę do takiej analizy, jakie polecenia formułuję i gdzie ta metoda potrafi mnie wyprowadzić w pole. Piszę o narzędziach ogólnodostępnych, bez własnych integracji programistycznych.
Model językowy jest dobry w porządkowaniu tekstu, którego jest za dużo. Streści, pogrupuje, nazwie powtarzające się motywy, wyciągnie cytaty. To jest jego naturalne zadanie i wykonuje je szybciej niż człowiek.
Jest natomiast zły w liczeniu i w ocenie proporcji. Jeśli poproszę o wskazanie, ile procent opinii dotyczy trwałości, dostanę liczbę, która brzmi wiarygodnie i bywa wzięta z powietrza. Liczenie zostawiam arkuszowi, modelowi zostawiam nazywanie.
Z tego wynika prosty podział pracy, którego się trzymam. Model przypisuje kategorie, arkusz je zlicza. Wszystko, co da się policzyć formułą, powinno być policzone formułą — nawet jeśli to mniej efektowne.
Druga granica dotyczy wniosków biznesowych. Model zaproponuje rekomendacje, ale zrobi to na podstawie ogólnych wzorców, nie znajomości tej firmy. Rekomendacje piszę sam, na podstawie tego, co mi pogrupował.
Przy opiniach o produktach najprostszym źródłem jest własny sklep — jeśli zbiera opinie i da się je wyeksportować. Drugie źródło to opinie o produktach zbierane przez zewnętrzne platformy, którymi sklep i tak się posługuje.
Sięgam też po opinie o produktach konkurencji, jeśli są publicznie dostępne, i po opinie o tej samej kategorii u zagranicznych sprzedawców. Zastrzeżenie jest ważne: sprawdzam warunki korzystania z danego serwisu, zanim cokolwiek pobiorę. Dostępność w przeglądarce nie oznacza zgody na masowe kopiowanie.
Przy słowach kluczowych mam dwa podstawowe zbiory. Raport wyszukiwanych haseł z Google Ads, czyli realne zapytania, na które ktoś zapłacił — najbardziej wartościowy materiał, jaki istnieje. Oraz raport skuteczności z Search Console, gdzie widać zapytania organiczne razem z liczbą wyświetleń i kliknięć.
Oba eksportuję do arkusza i tam zostają. Do modelu wysyłam wyłącznie kolumnę z tekstem, bez identyfikatorów zamówień, adresów i nazwisk.
Robię to w trzech przejściach, bo jedno polecenie do wszystkiego daje kiepski wynik.
W pierwszym przejściu proszę o zbudowanie listy kategorii tematycznych na losowej próbce kilkuset opinii — bez narzucania własnych. To ważne, bo jeśli podam kategorie z góry, dostanę potwierdzenie swoich założeń. Z tej listy wybieram te, które faktycznie mają sens dla tej kategorii produktów, i scalam duplikaty.
W drugim przejściu przypisuję kategorie do wszystkich opinii, partiami, z jasnym zastrzeżeniem, że jedna opinia może trafić do kilku kategorii, a przy braku dopasowania powinna zostać nieprzypisana. Wynik wraca do arkusza jako kolumny do zliczania.
W trzecim przejściu pracuję już tylko na wybranych kategoriach — tych z największą liczbą negatywnych wzmianek. Proszę o wyciągnięcie oryginalnych cytatów, nie streszczeń. Cytat od klienta jest wart w rozmowie z właścicielem sklepu więcej niż każdy wykres.
Największa wartość tej pracy nie leży dla mnie w SEO ani w kampaniach, lecz w ofercie. Kilka razy wyszło z tego, że najczęstszy zarzut w opiniach dotyczył rzeczy, o której nie było ani słowa na karcie produktu — na przykład sposobu montażu albo tego, co jest w zestawie.
Narzędzia do słów kluczowych grupują frazy po podobieństwie napisu. Model potrafi grupować po tym, czego człowiek chce — i to jest tu prawdziwa przewaga.
Zaczynam od raportu wyszukiwanych haseł posortowanego po koszcie, bo tam siedzą pieniądze. Proszę o przypisanie każdemu zapytaniu etapu decyzji: rozpoznanie problemu, porównywanie rozwiązań, wybór dostawcy, obsługa po zakupie. Dodatkowo o oznaczenie zapytań, które w ogóle nie dotyczą oferty.
Ta ostatnia kolumna zwykle daje najszybszy zysk. Zapytania bez związku z ofertą wracają do mnie jako propozycja listy wykluczeń, którą sam przeglądam wiersz po wierszu. Model bywa nadmiernie surowy i wykluczyłby frazy, które konwertują.
Drugie zastosowanie to szukanie luk. Zestawiam pogrupowane zapytania z listą podstron w serwisie i pytam, dla których grup nie ma odpowiadającej treści. Wynik trzeba weryfikować, ale jako punkt wyjścia do planu treści działa lepiej niż burza mózgów.
Kilka rzeczy, które w moim przypadku zrobiły największą różnicę.
Świadomie nie podaję gotowego szablonu polecenia do skopiowania. Za każdym razem, gdy używałem cudzego, wynik był gorszy niż przy poleceniu napisanym pod konkretny zbiór danych.
Do tego dochodzi weryfikacja, bez której nie warto zaczynać. Ustaliłem sobie prostą zasadę: zanim uwierzę w wynik na tysiącu wierszy, sprawdzam ręcznie pięćdziesiąt losowych.
Szukam trzech typów błędów. Pierwszy to przypisanie kategorii na podstawie jednego słowa bez kontekstu — opinia „szybko przyszło, ale przesyłka wygląda jakby ktoś ją kopał” trafia do pozytywnych ocen dostawy. Drugi to gubienie ironii i negacji, w polszczyźnie bardzo częste. Trzeci to sklejanie wierszy, kiedy jedna opinia zawiera znak nowej linii.
Jeśli na pięćdziesięciu wierszach znajdę kilka pomyłek tego rodzaju, wynik nadal jest użyteczny — mówimy o porządkowaniu, nie o rachunkowości. Jeśli znajdę kilkanaście, poprawiam definicje kategorii i powtarzam całość. Nie próbuję ratować złego przebiegu poprawkami.
Ten fragment jest nudny i najczęściej pomijany, a potrafi kosztować najwięcej.
Opinie klientów to często dane osobowe — bywają podpisane imieniem, zawierają numer zamówienia albo szczegóły pozwalające zidentyfikować osobę. Zanim wyślę je do zewnętrznego narzędzia, usuwam wszystko poza treścią i sprawdzam, na jakich zasadach dostawca przetwarza wprowadzane dane oraz czy nie wykorzystuje ich do trenowania modeli.
Druga rzecz to prawa do treści cudzych. Analiza opinii z serwisu konkurencji na własne potrzeby to jedno, publikowanie ich fragmentów w materiałach marketingowych to zupełnie inna sprawa. Przy pierwszym uważam, przy drugim odpuszczam.
I trzecia, praktyczna: uzgadniam z klientem, że tego rodzaju analizy w ogóle robimy. Wolę zapytać wcześniej niż tłumaczyć się później, że dane z jego sklepu były przetwarzane w narzędziu, o którym nie wiedział.
Z analizy opinii wychodzą zwykle trzy rzeczy: lista rzeczywistych obiekcji, słownik języka klientów i lista braków w opisach produktów. Obiekcje trafiają do treści reklam i do sekcji z pytaniami na stronie. Słownik trafia do nagłówków, bo klient rzadko nazywa produkt tak, jak nazywa go producent.
Z analizy zapytań wychodzi lista wykluczeń, plan treści i czasem decyzja o przebudowie struktury kampanii, gdy okazuje się, że w jednej grupie mieszają się trzy różne etapy decyzji.
Na koniec uczciwe zastrzeżenie. To narzędzie skraca czas pracy, ale nie zastępuje myślenia — sam wielokrotnie dostawałem pięknie pogrupowaną tabelę i dopiero po godzinie zauważałem, że pierwsze pytanie zadałem źle. Kolejność bywa więc odwrotna do obiecywanej: najpierw trzeba wiedzieć, czego się szuka, a dopiero potem to zautomatyzować.
Używamy plików cookies, aby ułatwić Ci nawigację oraz wykonywanie określonych funkcji. Szczegółowe informacje o wszystkich plikach cookies znajdziesz w każdej kategorii zgody poniżej.
Pliki cookies oznaczone jako "Niezbędne" są przechowywane w Twojej przeglądarce, ponieważ są one kluczowe dla zapewnienia podstawowych funkcji strony.
Używamy również plików cookies firm trzecich, które pomagają nam analizować, w jaki sposób korzystasz z tej strony, zapamiętują Twoje preferencje oraz dostarczają treści i reklamy odpowiednie dla Ciebie. Te pliki cookies będą przechowywane w Twojej przeglądarce tylko za Twoją uprzednią zgodą.
Możesz zdecydować, czy chcesz włączyć lub wyłączyć niektóre bądź wszystkie te pliki cookies, jednak wyłączenie niektórych z nich może wpłynąć na Twoje doświadczenia podczas przeglądania strony.
| Cookie | Czas przechowywania | Opis |
|---|---|---|
| __cf_bm | 13 minutes | Cloudflare bot management — distinguishes humans from bots. |
| rc::* | Persistent | Google reCAPTCHA — localStorage holding anti-bot challenge state. |
| Cookie | Czas przechowywania | Opis |
|---|---|---|
| wpEmojiSettingsSupports | Session | WordPress — sessionStorage flag caching whether the browser can render emoji (feature detection). |
| ytidb* | Persistent | YouTube — IndexedDB storing playback/search state for embedded videos. |
| Cookie | Czas przechowywania | Opis |
|---|---|---|
| _ga_* | 400 days | Google Analytics 4 — persists session state per property. |
| _ga | 400 days | Google Analytics — distinguishes unique users via a client id. |
| Cookie | Czas przechowywania | Opis |
|---|---|---|
| NID | 183 days | Google — stores preferences for personalized ads. |
| fr | 90 days | Meta — encrypted Facebook id and browser id for ads. |
| _gcl_au | 90 days | Google AdSense/Ads — experiments with advertising efficiency (conversion linker). |
| Cookie | Czas przechowywania | Opis |
|---|---|---|
| __Secure-YNID | 180 days | |
| YSC | Session | |
| __Secure-ROLLOUT_TOKEN | 180 days | |
| VISITOR_INFO1_LIVE | 180 days | |
| VISITOR_PRIVACY_METADATA | 180 days | |
| datr | 400 days | |
| sb | 400 days | |
| wd | 7 days |