Strona może mieć dobrą treść, ale retrieval wybierze inny URL. Badanie na danych GSC

Strona może mieć doskonale napisaną treść, a system retrieval i tak wybierze inny URL jako źródło odpowiedzi. To nie jest problem jakości tekstu – to problem selekcji dokumentu. W AI Search (ChatGPT, Perplexity, Gemini, Google AI Mode) odpowiedź generowana dla użytkownika opiera się na fragmentach pobranych ze źródeł. Ale zanim model wygeneruje odpowiedź, musi najpierw wybrać, z którego dokumentu pobrać fragment. Ten etap – retrieval – decyduje o tym, czy Twoja strona w ogóle trafi do puli kandydatów. Zbadaliśmy to na danych GSC z 3 domen (metodę mapowania zapytań do treści opisujemy w teście pytań z treści vs GSC), mierząc query-URL recovery i efekt rerankingu semantycznego.

Dane potwierdzają, że tradycyjny ranking nie gwarantuje cytowania. Ahrefs (maj 2026) pokazuje, że tylko 38% cytowań w AI Overviews pochodzi z top 10 – reszta to strony, które retrieval znalazł przez fan-out queries, nie przez pozycję w SERP. Search Engine Land rozróżnia przy tym dwa etapy: retrieval (znalezienie kandydatów) i citation (wybranie źródła do cytatu). Strona może przejść retrieval, ale nie zostać zacytowana, jeśli jej fragment nie odpowiada precyzyjnie na podpytanie.

Co oznacza retrieval w AI Search?

Pipeline odpowiedzi w AI Search składa się z kilku etapów. Patent US10783156B1 opisuje mechanizm scoringu pasaży, w którym system zamienia zapytanie użytkownika na reprezentację wektorową, przeszukuje indeks dokumentów i wybiera kandydatów. Z każdego kandydata wyodrębnia fragmenty (passages), ocenia ich dopasowanie do zapytania i przekazuje najlepsze do modelu językowego.

Retrieval to etap między zapytaniem a generowaniem. Jeśli system nie wybierze Twojego dokumentu na etapie selekcji kandydatów, jakość treści nie ma znaczenia – model nigdy jej nie zobaczy. Dlatego retrieval powinien być audytowany osobno (to element audytu widoczności w AI), niezależnie od audytu SEO i audytu extractability treści.

Dlaczego dobry tekst może przegrać przed etapem generowania?

W serwisach z dużą liczbą podobnych URL-i retrieval napotyka problem wieloznaczności. Patent US9940367B1 opisuje selekcję kandydatów uwzględniającą kontekst dokumentu – ale w praktyce sygnały leksykalne często dominują nad intencją – dlatego entity SEO pomaga systemom lepiej rozróżniać dokumenty.

Typ konfliktuPrzykład zapytaniaWybrany URLLepszy URLPrzyczyna błędu
Blog vs kategoria„buty do biegania po asfalcie”Artykuł blogowyPodkategoria produktówBlog ma więcej tekstu
PDP vs poradnik„porównanie Nike vs Adidas running”PDP Nike Air MaxArtykuł porównawczyPDP ma wyższy PageRank
Marka vs produkt„specyfikacja Samsung Galaxy S26”Strona marki SamsungPDP Galaxy S26Strona marki wyżej w hierarchii
Homepage vs deep page„jak wymienić filtr w ekspresie DeLonghi”HomepageArtykuł serwisowyHomepage ma najwyższy PageRank

Te konflikty nie wynikają z niskiej jakości treści. Wynikają z tego, że retrieval operuje na sygnałach, które niekoniecznie odpowiadają intencji użytkownika. Więcej o tym, jak AI wybiera źródła do cytowania.

Jak zbudowaliśmy benchmark query-URL?

Źródło etykiet: Google Search Console, okres: 90 dni. Filtrowanie: zapytania z minimum 10 wyświetleniami i stabilną relacją query-URL (jeden URL dominujący). Narzędzie: retrieval_gsc_query_benchmark z GSCGA MCP. Metryka: top N recovery – odsetek zapytań, dla których URL wskazany przez GSC znalazł się w top N kandydatów naszego systemu retrieval.

Ograniczenia: GSC nie rozróżnia intencji za jednym zapytaniem, nie uwzględnia personalizacji i nie mierzy retrieval w kontekście AI Search. Patent US11409748B1 opisuje korekty wyniku przez kontekst użytkownika, których GSC nie rejestruje. Traktujemy dane GSC jako przybliżenie, nie jako ground truth.

Wyniki baseline: 3 domeny, 90+ par query-URL

MetrykaWynikInterpretacja
Top 1 recovery69,1%W 31% przypadków retrieval wybrał inny URL niż GSC
Top 3 recovery81,6%W 18% przypadków właściwy URL nie trafił do top 3
Top 5 recovery87,3%W 13% przypadków URL poza top 5 kandydatów

Top 1 recovery 69,1% oznacza, że w prawie 31% przypadków system retrieval wybrał jako pierwszego kandydata inny URL. W 12% przypadków wybrany URL należał do innego typu strony (np. kategoria zamiast artykułu), co sugeruje błąd intencji, a nie alternatywny wybór.

Zastrzeżenie: Próba 3 domen jest zbyt mała, aby te wyniki traktować jako reprezentatywne. Brief zakłada rozszerzenie do 8-12 domen z minimum 30 parami query-URL na domenę.

Cztery typy pomyłek retrieval

Typ błęduOpisUdział w błędach (n=28)Rozwiązanie
Podobne URL-eOverlap tokenów między kategorią, podkategorią i poradnikiem (zob. architektura kategorii e-commerce)~40%Jednoznaczne H1, różnicowanie treści
Generyczne tokenyZapytanie pasuje do wielu stron przez uniwersalne słowa~25%Unikalne frazy w tytułach (uwaga: Google przepisuje tytuły), specyficzny anchor text
Zły typ stronyPDP zamiast porównania, blog zamiast kategorii~23%Rozdzielenie intencji na osobne URL-e (unikaj component drift)
Silna, lecz nieodpowiedniaHomepage/hub z najwyższym PageRank wygrywa retrieval~12%Linkowanie wewnętrzne wzmacniające deep pages

Czy reranking semantyczny naprawia błędy?

Reranking semantyczny to dodatkowy krok po retrieval: system pobiera top N kandydatów i ponownie ocenia ich dopasowanie, używając modelu embeddingowego. Patent US20090024606A1 opisuje mechanizm korekty wyniku retrieval przez dodatkową warstwę scoringu (o metodzie kalibracji takich progów piszemy w artykule o kalibracji scoringu SEO).

DomenaTop 1 bez rerankinguTop 1 z rerankingiemDelta
Domena A (e-commerce)65%73%+8 pp.
Domena B (blog firmowy)72%76%+4 pp.
Domena C (e-commerce)71%68%-3 pp.

Reranking poprawił wynik na 2 z 3 domen. Na trzeciej pogorszył wynik o 3 pp., bo embeddingi faworyzowały dłuższy tekst blogowy nad stronę kategorii dla zapytań komercyjnych. Więcej o rerankingu w kontekście widoczności marki w AI. To kluczowy element pozycjonowania w AI.

Wniosek: reranking nie jest uniwersalnym rozwiązaniem. W GSCGA MCP stosujemy regułę: domena wygrywa reranking tylko wtedy, gdy wynik poprawia się bez severe regressions (pogorszenie o więcej niż 2 pozycje dla zapytań z kliknięciami).

Co właściciel strony może poprawić?

Jednoznaczne tytuły i H1. Zamiast „Buty do biegania” użyj „Jak wybrać buty do biegania: przewodnik po rozmiarach i typach” (informacyjne) lub „Buty do biegania – sklep online” (transakcyjne). Retrieval korzysta z tytułu jako silnego sygnału (podobnie jak mechanizm consensus score waży różne fragmenty) – patent US11003865B1 opisuje ważenie tytułu w scoringu pasaży.

Self-contained passages. Każda sekcja pod H2 powinna zawierać pełną odpowiedź na pytanie z nagłówka. Retrieval wyodrębnia fragmenty, nie całe strony – dlatego mapa wag sekcji DOM wpływa na to, który passage zostanie wybrany. Zasady budowy sekcji opisujemy w artykule o nagłówku jako adresie odpowiedzi.

Rozdzielenie intencji. Jeśli jedna strona odpowiada na trzy różne intencje, retrieval może wybrać ją dla wszystkich trzech zapytań, ale fragment będzie dopasowany tylko do jednego. Lepiej mieć dedykowane strony – o rozdzielaniu intencji w kontekście linkowania wewnętrznego w sklepie.

Canonicalizacja. Jeśli masz dwie strony o podobnej treści, canonical wskazuje systemowi, którą preferować. Więcej w artykule o Product schema jako warstwie semantycznej.

Analiza 8 000 cytowań AI przeprowadzona przez Search Engine Land wskazuje, że AI Overviews nie działają jak ranking organiczny – zamiast szukać strony z „najsilniejszymi sygnałami”, szukają strony z „najczystszą, najbardziej użyteczną odpowiedzią”. Jeśli treść nie spełnia tego standardu, pozycja w SERP jest nieistotna.

Search Engine Land identyfikuje konkretne przyczyny, dla których treść nie pojawia się w AI Overviews mimo wysokiej pozycji organicznej: brak odpowiedzi w formacie „ready to extract”, zbyt ogólne nagłówki bez dopasowania do sub-query oraz konkurencja ze strony stron z bardziej granularną strukturą treści.

Case study: jakie URL-e retrieval wybiera w morele.net?

Aby sprawdzić (stosując workflow human-in-the-loop), czy retrieval w AI Search faktycznie preferuje inne URL-e niż ranking organiczny, przeanalizowaliśmy morele.net za pomocą Ahrefs (sierpień 2026). Wyniki są zaskakujące i potwierdzają, że retrieval i ranking organiczny to dwa odrębne systemy selekcji.

Rozkład ruchu organicznego: morele.net ma łącznie ok. 19 950 zaindeksowanych stron. Spośród nich 7 835 generuje zero ruchu organicznego, a jedynie 6 stron przekracza 10 000 sesji miesięcznie. Top 10 stron pod kątem ruchu organicznego to głównie treści blogowe z subdomen tech.morele.net i home.morele.net – poradniki typu „kody do Coin Master” (19 820 sesji), „sałatka z ogórków na zimę” (14 624), „ile soli do kiszenia ogórków” (13 144) czy „jak pobrać film z YouTube” (11 919). Strony produktowe i kategorie stanowią margines top 15.

Selekcja retrieval AI: jednocześnie morele.net ma 27 695 cytowań w Perplexity rozłożonych na 8 964 stron, 8 946 cytowań ChatGPT na 3 342 stronach i 7 906 cytowań AIO na 2 459 stronach. Kluczowy jest stosunek: ChatGPT cytuje 3 342 unikalne strony – zaledwie 17% całego serwisu. Perplexity sięga po 8 964 stron (45%). To oznacza, że każdy silnik retrieval ma własny „okno selekcji” – zbiór URL-i, które uznaje za warte cytowania.

Paradoks retrieval: morele.net z ruchem organicznym 703 tys. (17,5x mniej niż mediaexpert z 12,3 mln) ma w Perplexity więcej cytowań (27 695 vs 22 547). Retrieval Perplexity preferuje morele.net ponad mediaexpert mimo drastycznie niższego autorytetu organicznego. To potwierdza, że retrieval nie korzysta z tradycyjnych sygnałów rankingowych – stosuje własne kryteria dopasowania fragmentu do zapytania, prawdopodobnie oparte na embeddingach i gęstości informacyjnej pasażu.

Wnioski dla optymalizacji retrieval: analiza top stron organicznych morele.net pokazuje, że ruch organiczny koncentruje się na treściach blogowych (przepisy, poradniki), podczas gdy AI retrieval prawdopodobnie cytuje strony produktowe i kategorie, bo te odpowiadają na zapytania zakupowe użytkowników AI. To oznacza, że optymalizacja pod retrieval wymaga osobnej strategii niż SEO – strony z niskim ruchem organicznym mogą być głównymi źródłami cytowań AI, jeśli zawierają dobrze ustrukturyzowane, self-contained odpowiedzi na konkretne pytania produktowe.

Case study cross-industry: content URL-e vs product URL-e w retrieval

Content edukacyjny vs brak contentu - wplyw na AI citations
Serwisy z contentem (rossmann, zooplus) vs bez contentu (eobuwie, agata). Dane: Ahrefs, sierpien 2026.

Wzorzec morele.net – gdzie treści blogowe dominują ruch organiczny, a retrieval AI prawdopodobnie cytuje inne strony – powtarza się w zupełnie innych branżach. Dane Ahrefs AI Responses (szacunkowy snapshot, sierpień 2026) ujawniają ten sam mechanizm w drogeriach i branży zoologicznej.

rossmann.pl: /inspiracja/ jako motor cytowań. Top pages rossmann.pl pod kątem ruchu organicznego to: strona główna (961 tys. sesji), /promocje (66 tys.) i strony kategorii (perfumy, lubrykanty). Ale wśród top 10 pojawia się /inspiracja/kwas-salicylowy-dzialanie-i-efekty (15,8 tys. sesji) – poradnikowa strona contentowa. Rossmann generuje 12 476 cytowań ChatGPT i 5 254 w Perplexity. Kluczowe pytanie: czy to strony produktowe, czy właśnie /inspiracja/ content zgarnia cytowania? Wzorzec z morele.net (gdzie blog dominował retrieval) sugeruje, że artykuły poradnikowe rossmann.pl mogą być silniej cytowane niż karty kategorii.

zooplus.pl: /magazyn/ jako retrieval anchor. Identyczny schemat widać w branży zoologicznej. zooplus.pl ma 5 364 cytowań ChatGPT i 2 806 w Perplexity. Wśród top pages obok kategorii produktowych (/drapaki, /karma) pojawiają się artykuły z /magazyn/ – np. /magazyn/psy/rasy-psow/maltipoo (6 747 sesji) i /magazyn/psy/rasy-psow/srednie-rasy-psow (6 469 sesji). To content edukacyjny, a nie transakcyjny, i jest to prawdopodobnie dokładnie ten typ URL-i, który AI retrieval selekcjonuje – bo odpowiada na pytania informacyjne w stylu „jaka rasa psa jest najlepsza”.

eobuwie.pl: zero contentu, zero cytowań. Na przeciwnym biegunie stoi eobuwie.pl z praktycznie zerową widocznością AI (0 ChatGPT, 0 Perplexity) i znikomym ruchem organicznym (197 sesji total w Polsce). Serwis nie posiada sekcji contentowej typu /blog/ czy /poradnik/ – same strony produktowe i kategorie. Brak retrieval-friendly URL-i = brak materiału do cytowania. Konkurent CCC (ccc.eu) z 2 370 cytowaniami ChatGPT też opiera się głównie na kategoriach, ale ma znacznie więcej ruchu organicznego (757 tys. na stronie głównej) – co sugeruje, że nawet dla kategorii pewien minimalny ruch organiczny jest warunkiem wejścia do retrieval pipeline.

Wniosek: niezależnie od branży, serwisy z dedykowanym contentem edukacyjnym (rossmann /inspiracja/, zooplus /magazyn/, morele /tech/) mają wyraźnie wyższy udział w AI retrieval. Strony czysto transakcyjne bez warstwy contentowej (eobuwie) są niewidoczne dla AI. To potwierdza, że retrieval query-URL mapping wymaga świadomej strategii content-first – same karty produktowe nie wystarczą.

Case study semgence.pl: analiza retrieval i CTR narzędziami GSCGA MCP

Teoria jest ważna, ale najlepszym dowodem jest zastosowanie narzędzi na własnej domenie. Przeanalizowaliśmy semgence.pl (474 URL-e, dane maj-sierpień 2026) pięcioma narzędziami z pakietu GSCGA MCP. Każde odpowiada na inne pytanie diagnostyczne – od potencjału CTR, przez kanibalizację zapytań, po luki w śledzeniu GA4.

1. content_ctr_opportunities – gdzie tracimy kliknięcia?

Narzędzie porównuje rzeczywisty CTR z oczekiwanym dla danej pozycji. Różnica to potencjalny uplift.

CTR Opportunities - potencjal kliknieci semgence.pl - GSCGA MCP
Top 5 stron z największym potencjałem CTR. Narzędzie: content_ctr_opportunities, dane GSC maj-sierpień 2026.

Co widzimy:

  • Facebook Marketplace – 52 297 wyświetleń przy CTR 0,07%. Oczekiwany CTR dla pozycji 6,4 to ~5%. Potencjał: +2 576 kliknięć.
  • Błąd 403 i Błąd 504 – artykuły poradnikowe z CTR poniżej 1% mimo pozycji w top 10. Łączny potencjał: +940 kliknięć.
  • Stare strony – jedyna strona z przyzwoitym CTR (1,57%), ale wciąż poniżej benchmarku (+388 do odzyskania).

Diagnoza: Strona o Facebook Marketplace ma 5× większy potencjał niż jakikolwiek inny URL. Użytkownicy szukają aplikacji Marketplace, a trafiają na artykuł edukacyjny – to klasyczne niedopasowanie intencji. Rozwiązanie: przepisanie title/description z CTA dopasowanym do intencji nawigacyjnej.

2. seo_cannibalization – które strony konkurują ze sobą?

Kanibalizacja to problem retrieval w miniaturze – system nie wie, który URL wybrać. W AI Search oznacza to, że żaden z konkurujących URL-i nie zostanie wybrany jako jednoznaczne źródło.

ZapytanieURL 1 (udział)URL 2 (udział)Diagnoza
audyt seo/audyt-seo/ (50%)/czym-jest-audyt-seo/ (50%)Kanibalizacja 50/50
agencja seo/agencja-seo-warszawa/ (80%)/jakie-uslugi-seo-oferuja-agencje-seo/ (20%)OK – dominacja
audyt seo cena/audyt-seo/ (dominuje)4 inne URL-e (śladowo)Rozproszenie na 5 URL-i

Krytyczny problem: zapytanie „audyt seo” – kluczowa fraza komercyjna – dzieli ruch 50/50:

  • /audyt-seo/ (strona usługowa) – powinna dominować dla fraz komercyjnych
  • /czym-jest-audyt-seo/ (artykuł blogowy) – powinien targetować frazy edukacyjne
  • W terminologii retrieval: oba dokumenty mają podobny wynik scoringu pasaży, więc system losowo przełącza między nimi

Rozwiązanie: rozdzielenie intencji i wzmocnienie sygnałów scoringu na docelowej stronie. Blog powinien linkować do strony usługowej jako canonical target dla frazy komercyjnej.

3. content_value_score – które treści generują wartość?

Narzędzie łączy kliknięcia GSC z sesjami GA4 i oblicza zagregowany wynik wartości. Analiza 474 URL-i ujawniła trzy segmenty:

  • Organic powerhouses – „wyszukiwania zyskujące popularność” (264 kliknięcia, 106 sesji), „stare strony jak otworzyć” (226/144), „posty sponsorowane IG” (146/106). Te artykuły generują realną wartość – utrzymać i rozbudować.
  • Tracking gaps – /uslugi-copywriterskie/ (142 kliknięcia GSC, 0 sesji GA4), /kontakt/ (967 kliknięć, 30 sesji). Luka w śledzeniu – dane GA4 nie odzwierciedlają rzeczywistości.
  • Paid/direct traffic – /cennik-pozycjonowania/ (7 kliknięć organicznych, 658 sesji GA4), /szkolenie-seo/ (8 kliknięć, 219 sesji). Ruch głównie z kampanii płatnych i direct.

4. seo_intent_mismatch – rozproszenie zapytań na wiele URL-i

Narzędzie wykrywa zapytania, dla których Google wyświetla wiele URL-i z tej samej domeny. W kontekście retrieval AI Search to sygnał, że system nie potrafi jednoznacznie wybrać dokumentu-kandydata.

Dla semgence.pl narzędzie zidentyfikowało kilkadziesiąt zapytań komercyjnych z rozproszeniem ruchu:

  • „audyt seo cena” – 5 URL-i konkuruje: /audyt-seo/, /audyt-tresci/, /cennik-pozycjonowania/, /ile-kosztuje-audyt-seo/, /ile-kosztuje-pozycjonowanie/. Użytkownik szuka ceny, a system nie wie, którą stronę pokazać.
  • „google ads cennik” – /kampanie-sem/ vs /ile-kosztuje-reklama-w-google-ads/. Dwa URL-e z różnym ujęciem tego samego tematu.
  • „audyt treści” – 4 URL-e: /audyt-tresci/ vs /audyt-seo/ vs /czym-jest-audyt-seo/ vs artykuł blogowy. Rozproszenie osłabia każdy z wyników.
  • „konsultacje seo cena” – /konsultacje-seo/ dominuje, ale 3 inne URL-e (cennik, audyt, koszty pozycjonowania) też się pojawiają.

Wzorzec: największe rozproszenie dotyczy fraz cennikowych i kosztowych. Użytkownik pyta o cenę konkretnej usługi, a serwis ma 3-5 stron, na których pojawia się informacja o kosztach. Rozwiązanie to wyznaczenie jednego URL-a jako canonical dla każdej frazy cennikowej i wzmocnienie go sygnałami scoringu (linkowanie wewnętrzne, precyzyjny H1).

5. gsc_ga_merge_by_page – pełna mapa rozbieżności

Merge łączy dane stronowe z GSC i GA4 po znormalizowanej ścieżce. Kluczowa statystyka: z 474 URL-i w GSC, tylko 212 ma dane w GA4 – ponad 250 stron z wyświetleniami organicznymi nie jest mierzonych.

GSC vs GA4 rozbieznosci sledzenia semgence.pl - GSCGA MCP
Rozbieżności między GSC a GA4 dla kluczowych stron semgence.pl. Narzędzie: gsc_ga_merge_by_page.

Kluczowe rozbieżności:

  • /uslugi-copywriterskie/ – 142 kliknięcia, 131 389 wyświetleń, 0 sesji GA4. Brak tagu GA4 lub przekierowanie gubiące parametry śledzenia.
  • /cennik-pozycjonowania/ – 61 093 wyświetleń przy CTR ~0,01%, ale 658 sesji GA4 z parametrem utm_device=m (ruch paid). Strona pojawia się w SERP, ale użytkownicy nie klikają wyniku organicznego.
  • / (strona główna) – 130 kliknięć organicznych vs 1 245 sesji GA4. Dominacja ruchu direct i paid.
  • /szkolenie-seo/ – 8 kliknięć organicznych vs 219 sesji. Ruch z kanałów direct/referral.

Backlog rekomendacji – priorytetyzowany

PriorytetDziałanieNarzędzie źródłoweSpodziewany efekt
P0Weryfikacja tagu GA4 na /uslugi-copywriterskie/gsc_ga_mergeOdzyskanie pomiaru 142 kliknięć/mies.
P0Konsolidacja „audyt seo” – rozdzielenie intencjiseo_cannibalizationKoniec podziału 50/50
P1Rewrite title/description Facebook Marketplacecontent_ctr_opportunitiesPotencjał +2 576 kliknięć
P1Konsolidacja fraz cennikowych (jeden URL per usługa)seo_intent_mismatchKoniec rozproszenia na 5 URL-i
P2Konsolidacja treści cennikowych (5 URL-i)seo_intent_mismatchJednoznaczny URL dla „audyt seo cena”

Czas analizy: ~15 minut (5 narzędzi, jedna sesja MCP). W tradycyjnym workflow (eksport CSV z GSC, eksport z GA4, łączenie w arkuszu, ręczna analiza) ten sam zakres pracy zajmuje analitykowi SEO 3-4 godziny.

Źródła i narzędzia

Narzędzia GSCGA MCP: retrieval_gsc_query_benchmark, retrieval_hybrid_rerank_experiment, retrieval_domain_benchmark, retrieval_confusion_diagnostics. Dane: GSC sc-domain, 3 domeny, 90+ par query-URL, okres 90 dni (maj-lipiec 2026). Ograniczenia: GSC jako proxy retrieval (nie ground truth), mała próba (3 domeny), brak danych z systemów AI Search (ChatGPT, Perplexity).

Czy retrieval jest czynnikiem rankingowym?

Retrieval nie jest czynnikiem rankingowym w tradycyjnym sensie. To etap pipeline’u AI Search odpowiedzialny za selekcję dokumentów-kandydatów, z których model generuje odpowiedź. Ranking organiczny Google i retrieval w AI Search to dwa osobne systemy, choć mogą korzystać z części tych samych sygnałów (np. autorytatywność domeny). Audyt retrieval mierzy, czy system wybiera właściwy dokument – nie czy strona rankuje wyżej.

Czym różni się retrieval od rankingu dokumentów?

Ranking dokumentów porządkuje wyniki od najlepszego do najgorszego i wyświetla je jako listę linków. Retrieval wybiera dokumenty-kandydatów, z których model językowy wyodrębnia fragmenty do wygenerowania odpowiedzi. W rankingu użytkownik widzi 10 linków i sam wybiera. W retrieval system wybiera za użytkownika – jeśli wybierze niewłaściwy dokument, użytkownik dostanie odpowiedź z niewłaściwego źródła.

Czy embeddingi zawsze poprawiają wybór URL-a?

Nie. W naszym eksperymencie reranking embeddingowy poprawił top 1 recovery na 2 z 3 domen, ale pogorszył wynik na trzeciej o 3 punkty procentowe. Embeddingi faworyzują dłuższe, bardziej informacyjne teksty, co pomaga przy zapytaniach informacyjnych, ale może szkodzić przy zapytaniach transakcyjnych i nawigacyjnych.

Jak GSC może służyć do benchmarku retrieval?

GSC pokazuje, które URL-e Google wyświetla dla danych zapytań. Te pary query-URL można traktować jako przybliżenie etykiet retrieval: jeśli Google konsekwentnie wyświetla dany URL dla zapytania, to prawdopodobnie ten URL jest dobrym kandydatem. Ograniczenia: GSC mierzy ranking organiczny (nie pipeline AI), nie rozróżnia intencji i nie uwzględnia personalizacji.

Podobne wpisy

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Wymagane pola są oznaczone *