Tematyczność backlinku: 5 poziomów dopasowania, patenty, topic embeddings i dane z audytu

Domena o DR 60. Guest post o finansach na portalu o podróżach. Link w treści, dofollow, anchor z keyword. Wygląda dobrze na papierze – i w raporcie dla klienta. Ale czy ten link pomaga w rankingu na frazę finansową? Patent US8458196B1 mówi: system oblicza autorytet tematyczny dokumentu i autora. API Leak ujawnił dwa atrybuty: anchorMismatchDemotion (degradacja za niezgodność tematyczną) i topicEmbeddingsVersionedData (embeddingi tematyczne strony). A badanie Taher Haveliwala z 2002 roku – który potem został inżynierem Google – wykazało, że Topic-Sensitive PageRank daje trafniejsze wyniki niż klasyczny PageRank. Tematyczność backlinku to nie miękki sygnał. To mechanizm z korzeniami w nauce o wyszukiwarkach.

W poprzednich artykułach serii pokazaliśmy, że Domain Rating nie mierzy tematyczności, że kontekst wokół linku jest ważony przez Google i że placement linku w dokumencie ma znaczenie. Ten artykuł odpowiada na następne pytanie: jak ocenić, czy link jest tematycznie dopasowany – i na którym poziomie to dopasowanie ma znaczenie?

Topic-Sensitive PageRank: fundament naukowy tematyczności linków

W 2002 roku Taher Haveliwala z Uniwersytetu Stanforda opublikował pracę „Topic-Sensitive PageRank”, która zdobyła nagrodę Best Student Paper na konferencji WWW 2002. Kluczowa teza: oryginalny PageRank oblicza jeden wektor ważności dla całego internetu, niezależnie od zapytania. To powoduje, że strony popularne globalnie (np. Yahoo) wygrywają z niszowymi stronami eksperckimi, nawet gdy użytkownik szuka czegoś niszowego.

Rozwiązanie Haveliwali: zamiast jednego wektora PageRank, obliczać zestaw wektorów, każdy biasowany w kierunku jednego z 16 tematów (na podstawie kategorii Open Directory Project). Kiedy użytkownik wpisuje zapytanie, system identyfikuje jego temat i używa odpowiedniego wektora – strony z wysokim PageRank w kontekście tego tematu dostają wyższy score niż strony z wysokim ogólnym PageRank, ale bez powiązania tematycznego.

Implikacja dla linków jest fundamentalna. W modelu Topic-Sensitive PageRank, link ze strony o pompach ciepła do sklepu z pompami ciepła przekazuje tematyczny PageRank w kategorii „dom i ogród”. Ten sam link ze strony o kryptowalutach przekazuje PageRank w kategorii „finanse” – który nie pomaga w rankingu na frazę o pompach. Nie dlatego, że link jest gorszy technicznie – ale dlatego, że transmituje autorytet w niewłaściwym temacie.

Haveliwala potem dołączył do Google jako inżynier – jego lista publikacji na Stanford InfoLab dokumentuje tę trajektorię. Jego praca stała się fundamentem podejścia Google do tematyczności – choć Google nigdy publicznie nie potwierdził, że używa Topic-Sensitive PageRank w produkcji. Praca jednak jest wielokrotnie cytowana w późniejszych patentach Google.

Trzy patenty o tematycznym autorytecie

US8458196B1: system oceny tematycznego autorytetu

Patent US8458196B1 („System and method for determining topic authority”) opisuje system, który oblicza autorytet autora w kontekście konkretnego tematu. Wynalazca: Michael Jeffrey Procopio z Google. Data zgłoszenia: styczeń 2012, udzielenie: czerwiec 2013.

Mechanizm jest elegancki w swojej precyzji. System otrzymuje informację tematyczną dokumentu: jakie tematy porusza i z jaką wagą. Następnie otrzymuje informację o autorstwie: kto napisał dokument i jaki jest procent autorstwa dla każdego tematu. Na tej podstawie buduje coś, co patent nazywa „authority signature” – wektor autorytetu autora w poszczególnych tematach.

Kluczowy element: authority signature nie jest pojedynczą liczbą (jak DR). To wielowymiarowy wektor – autor może mieć wysoki autorytet w temacie „pompy ciepła” i niski w temacie „kryptowaluty”, mimo że oba dokumenty są na tej samej domenie. System rozróżnia autorytet per temat, nie per domena.

Implikacja dla link buildingu: jeśli Google buduje authority signatures dla autorów i stron, to link z artykułu autora, który ma wysoki tematyczny autorytet w Twojej branży, jest potencjalnie cenniejszy niż link z artykułu autora bez autorytetu w tym temacie – niezależnie od DR domeny.

US11874882B2: topical authority ranking z key phrases

Patent US11874882B2 („Extracting key phrase candidates from documents and producing topical authority ranking”) rozszerza koncepcję. Wynalazcy: Li Xiong, Chuan Hu, Arnold Overwijk i Junaid Ahmed z Google. Zgłoszenie: lipiec 2019, udzielenie: styczeń 2024.

Patent definiuje autorytet jako kombinację jakości, trafności, reputacji, głębokości i bezpośredniego związku z tematem. Kluczowe innowacje: system wydobywa key phrases z dokumentów, buduje graf tematyczny między stronami i oblicza topical authority na skalę internetową. Wcześniejsze podejścia (jak oryginalna praca Haveliwali) dawały jeden globalny score per strona – ten patent przyznaje score per key phrase, per strona.

Co to zmienia w praktyce? Strona może mieć wysoki autorytet w temacie „montaż pomp ciepła” i niski w temacie „serwis klimatyzacji” – mimo że oba tematy są technicznie pokrewne. System jest granularny. A link ze strony o montażu pomp ciepła do Twojego sklepu z pompami ciepła transmituje autorytet w dokładnie tym temacie, w którym go potrzebujesz.

US7716225B1: Reasonable Surfer i tematyczność kliknięcia

Patent Reasonable Surfer (US7716225B1), który omawialiśmy w artykule o placemencie, ma też wymiar tematyczny. Jednym z sygnałów wpływających na prawdopodobieństwo kliknięcia linku jest relacja tematyczna między linkiem a treścią strony. Patent mówi: link tematycznie powiązany z treścią strony ma wyższe prawdopodobieństwo kliknięcia – co potwierdzają dane z badania Ahrefs o linkach ze stron z ruchem – niż link niepowiązany – a wyższe prawdopodobieństwo kliknięcia przekłada się na wyższą wagę w kalkulacji PageRank.

To domyka obraz: tematyczność wpływa na wagę linku nie jako abstrakcyjna reguła, ale jako proxy zachowania użytkownika. Google nie mierzy tematyczności „bo to ładna idea” – mierzy ją, bo użytkownicy klikają w linki powiązane tematycznie częściej niż w linki losowe. A system Reasonable Surfer modeluje to prawdopodobieństwo.

API Leak 2024: dwa atrybuty potwierdzające tematyczność

Google API Leak z maja 2024 ujawnił dwa atrybuty w module Compressed Quality Signals, które bezpośrednio wiążą się z tematycznością linków.

anchorMismatchDemotion to atrybut w module CompressedQualitySignals, który – jak szczegółowo opisał Patrick Reinhart z Search Engine Land – sugeruje, że Google ignoruje lub degraduje linki, gdy istnieje niezgodność tematyczna między stroną źródłową a docelową. Słowo kluczowe to „demotion” – nie „ignore”, nie „discount”, a aktywna degradacja. To nie jest neutralne traktowanie niepowiązanego linku – to kara za niezgodność.

topicEmbeddingsVersionedData to drugi atrybut w tym samym module. Topic embeddings to technika NLP (Natural Language Processing) używana do mapowania tematów dokumentu w przestrzeni wektorowej. Innymi słowy: Google nie tylko patrzy na słowa kluczowe w treści – buduje wielowymiarową reprezentację tematyczną każdej strony. Jeśli embedding strony źródłowej (np. temat „podróże po Azji”) jest daleko w przestrzeni wektorowej od embeddingu strony docelowej (np. temat „kredyty hipoteczne”), system widzi tę odległość jako sygnał niezgodności.

Te dwa atrybuty, razem z patentami, tworzą spójny mechanizm: Google mierzy tematyczną odległość między stroną linkującą a stroną docelową – i ta odległość wpływa na wartość linku. Nie binarnie (powiązany/niepowiązany), ale na skali (bardzo powiązany → luźno powiązany → niepowiązany → sprzeczny).

Pięć poziomów tematycznego dopasowania backlinku

Na podstawie patentów, API Leak i naszych obserwacji z audytów, proponujemy model pięciu poziomów tematycznego dopasowania backlinku. To nie jest skala Google – to framework diagnostyczny, który odzwierciedla logikę opisaną w patentach.

Poziom 1: dopasowanie na poziomie frazy (najsilniejsze)

Link ze strony, która rankuje na tę samą lub blisko powiązaną frazę kluczową. Artykuł „Jak wybrać pompę ciepła powietrze-woda” linkuje do sklepu sprzedającego pompy ciepła powietrze-woda. Anchor, kontekst, treść strony źródłowej, treść strony docelowej – wszystko jest w jednej przestrzeni semantycznej. Patent US11874882B2 opisuje dokładnie tę granularność: topical authority per key phrase.

W naszych audytach linki z poziomu 1 stanowią zwykle 5-10% profilu linkowego. To najrzadsze i najcenniejsze linki. Nie kupujesz ich na marketplace – pozyskujesz je budując relacje z ekspertami i portalami branżowymi.

Poziom 2: dopasowanie na poziomie podtematu

Link ze strony w tym samym podtemacie, ale nie na dokładnie tę samą frazę. Artykuł „Koszt ogrzewania domu pompą ciepła vs gazem” linkuje do sklepu z pompami. Podtemat (ogrzewanie domu) jest wspólny, ale fraza docelowa (pompy ciepła) nie jest głównym tematem artykułu. Topic embedding jest blisko, ale nie identyczny.

To najczęstszy poziom w dobrym link buildingu. Artykuły sponsorowane w portalu branżowym, guest posty na blogach pokrewnych, cytowania w porównaniach – to zwykle poziom 2. I to jest wartościowy link.

Poziom 3: dopasowanie na poziomie branży

Link ze strony w tej samej branży, ale bez bezpośredniego związku tematycznego. Portal budowlany linkuje do sklepu z pompami ciepła z artykułu o izolacji dachu. Branża (budownictwo/instalacje) jest wspólna, ale temat artykułu (izolacja) jest odległy od tematu docelowego (pompy ciepła). System Topic-Sensitive PageRank rozpoznałby to jako tę samą kategorię tematyczną (ODP: „Home”), ale z niższą precyzją dopasowania.

Linki z poziomu 3 stanowią zwykle 20-30% dobrze zbudowanego profilu linkowego. Są wartościowe – ale ich wartość tematyczna jest niższa niż poziomu 1-2. Ahrefs nie rozróżni tych poziomów – DR portalu budowlanego jest taki sam niezależnie od tego, czy link jest z artykułu o pompach czy o dachach.

Poziom 4: dopasowanie na poziomie ogólnym (generic)

Link ze strony bez konkretnego związku branżowego, ale z kontekstem, który nie jest sprzeczny. Portal biznesowy linkuje do sklepu z pompami ciepła z artykułu „10 sposobów na obniżenie kosztów prowadzenia firmy”. Kontekst (koszty firmy) jest bardzo luźno powiązany z targetem (pompy ciepła). Topic embedding obu stron jest w różnych regionach przestrzeni wektorowej. Ale nie ma sprzeczności – nie ma „mismatch” w sensie anchorMismatchDemotion.

Linki z poziomu 4 to typowy produkt marketplace’ów – artykuł sponsorowany na portalu o szerokim profilu tematycznym, z linkiem umieszczonym w kontekście ogólnym. DR może być wysoki. Wartość tematyczna – niska. Nie jest to sprzeczność (jak poziom 5) – ale nie jest to też autorytet w temacie.

Poziom 5: brak dopasowania lub sprzeczność (ryzykowne)

Link ze strony tematycznie sprzecznej z targetem. Portal o kryptowalutach linkuje do sklepu z pompami ciepła. Portal o modzie linkuje do kancelarii prawnej. Artykuł o weganizmie linkuje do sklepu z mięsem. Nie chodzi o brak powiązania – chodzi o aktywną niezgodność tematyczną, którą anchorMismatchDemotion może wychwycić.

To jest poziom, na którym link może być nie tylko bezwartościowy, ale potencjalnie szkodliwy. Badania cytowane przez Search Engine Land wskazują, że w rzadkich przypadkach masowe linki z niepowiązanych tematycznie stron mogą szkodzić widoczności. Jeśli profil linkowy sklepu z pompami ciepła jest zdominowany przez linki z kasyn, farmacji i podróży – system widzi to jako nienaturalny wzorzec.

Infografika tematycznosc backlinku 5 poziomow dopasowania patenty Google API Leak topic embeddings Semgence

Jak Google mierzy odległość tematyczną: mechanizm topic embeddings

Atrybut topicEmbeddingsVersionedData z API Leak ujawnia, że Google używa embeddingów tematycznych – wielowymiarowych reprezentacji wektorowych – do mapowania tematu każdej strony. To technika NLP, w której każdy dokument jest reprezentowany jako punkt w przestrzeni o setkach wymiarów. Dwa dokumenty o podobnych tematach są blisko siebie w tej przestrzeni; dokumenty o odległych tematach są daleko.

Odległość między dwoma punktami (zwykle mierzona jako cosine similarity) daje miarę tematycznej bliskości. Artykuł o montażu pomp ciepła i artykuł o serwisie pomp ciepła będą miały cosine similarity bliski 1 (bardzo podobne). Artykuł o montażu pomp ciepła i artykuł o kryptowalutach – bliski 0 (brak podobieństwa). Artykuł o pompach ciepła i artykuł o klimatyzacji – gdzieś pomiędzy (pokrewne, ale nie identyczne).

Atrybut ma w nazwie „Versioned”, co sugeruje, że Google aktualizuje te embeddingi w czasie – prawdopodobnie w miarę jak model językowy Google (np. BERT, MUM, Gemini) ewoluuje. To oznacza, że tematyczna ocena linku nie jest statyczna – zmienia się wraz z doskonaleniem modeli NLP Google.

Co to oznacza praktycznie? Link, który w 2020 roku był oceniany jako tematycznie powiązany (bo prostszy model BERT uznał dwie strony za pokrewne), mógł w 2024 zostać przeklasyfikowany przez bardziej precyzyjny model (np. Gemini), który rozróżnia subtelniejsze różnice tematyczne. Tematyczność linku nie jest stałą – to zmienna, którą Google oblicza ponownie w miarę doskonalenia swoich modeli. Paradoksalnie, link może stracić wartość tematyczną nie dlatego, że coś się zmieniło na stronie – ale dlatego, że Google zaczął lepiej rozumieć różnicę między stronami.

Majestic Topical Trust Flow: jedyne narzędzie, które próbuje to mierzyć

W branży SEO istnieje jedno narzędzie, które próbuje mierzyć tematyczność profilu linkowego: Topical Trust Flow od Majestic. System klasyfikuje linki do 800+ kategorii tematycznych i oblicza, jaki procent equity pochodzi z każdej kategorii. Jeśli 60% Twojego Trust Flow pochodzi z kategorii „Home/Construction” – Twój profil linkowy jest silny tematycznie w budownictwie.

Kevin Indig (ex-Shopify, ex-G2) opisał ten problem w analizie „How to measure topical authority”: branża nie ma dobrych narzędzi do mierzenia czegoś, co Google ewidentnie mierzy. Problem z Topical Trust Flow jest trojaki. Po pierwsze, bazuje na indeksie Majestic, który nie jest identyczny z indeksem Google. Po drugie, 800 kategorii to przybliżenie – Google prawdopodobnie operuje na embeddingach o setkach wymiarów, co daje nieporównywalnie wyższą precyzję. Po trzecie, narzędzie klasyfikuje domeny, nie poszczególne artykuły – co pomija granularność opisaną w patencie US11874882B2 (topical authority per key phrase).

Więcej o pomiarze topical authority pisaliśmy w artykule o mierzeniu topical authority. Mimo tych ograniczeń, Topical Trust Flow jest lepszym wskaźnikiem tematyczności niż DR – bo przynajmniej próbuje mierzyć to, co patenty opisują. DR ignoruje tematyczność całkowicie. Topical Trust Flow mierzy ją niedoskonale. To wciąż postęp.

Jak Semgence ocenia tematyczność backlinku w audycie

W naszych audytach linkowych – prowadzonych od 2006 roku – oceniamy tematyczność na trzech warstwach:

Warstwa 1: tematyczność domeny. Czym się zajmuje strona linkująca? Jakie tematy porusza? Jaka branża? To najgrubsze sito – portal o podróżach linkujący do kancelarii prawnej odpada na tym etapie. Ale portal prawniczy linkujący do kancelarii prawnej przechodzi – nawet jeśli konkretny artykuł jest o innym aspekcie prawa.

Warstwa 2: tematyczność strony. Czym jest konkretna strona, z której wychodzi link? Artykuł o prawie rodzinnym linkujący do kancelarii specjalizującej się w prawie rodzinnym to poziom 1-2 w naszym modelu. Artykuł o prawie podatkowym linkujący do tej samej kancelarii – poziom 3. Tematyczność strony jest ważniejsza niż tematyczność domeny, bo Google operuje na poziomie stron (PageRank), nie domen.

Warstwa 3: tematyczność kontekstu. Co jest napisane wokół linku? Jak pokazaliśmy w artykule o anchor context, Google zapisuje 5 słów na lewo i prawo od linku (patent US8577893B1) oraz pełne fragmenty zdań (fullLeftContext, fullRightContext z API Leak). Jeśli anchor to „pompy ciepła”, ale tekst wokół mówi o „najlepszych prezentach na Boże Narodzenie” – kontekst jest sprzeczny. Jeśli tekst wokół mówi o „efektywności energetycznej budynków” – kontekst jest silnie powiązany.

Te trzy warstwy tworzą piramidę: domena → strona → kontekst. Każda kolejna jest precyzyjniejsza. I każda kolejna jest bliższa temu, co Google mierzy – bo Google operuje na poziomie zdań i embeddingów, nie na poziomie „czy ta domena jest o podróżach”.

Dane z audytu: co widzimy w profilu linkowym typowego klienta

W audycie 120 backlinków, którego wyniki przedstawialiśmy w poprzednich artykułach serii, sklasyfikowaliśmy każdy link według naszego modelu pięciopoziomowego. Wyniki dla trzech zanonimizowanych domen klienckich:

Poziom tematyczny% linków w próbieŚr. topical relevanceŚr. context quality
1 – fraza7%88/10082/100
2 – podtemat18%72/10068/100
3 – branża26%51/10045/100
4 – generic31%22/10019/100
5 – brak/sprzeczność18%8/1006/100

Trzy obserwacje z tych danych.

Po pierwsze: gradient jest dramatyczny. Topical relevance spada z 88/100 (poziom 1) do 8/100 (poziom 5) – dziesięciokrotnie. To nie jest subtelna różnica. Link z poziomu 1 jest w fundamentalnie innej kategorii jakościowej niż link z poziomu 5 – mimo że DR obu linkujących domen może być identyczny.

Po drugie: linki z poziomu 4-5 stanowią łącznie 49% próby – prawie połowę. To jest typowe dla profili linkowych budowanych „po DR” – klient kupuje linki z domen o wysokim DR, ale bez filtrowania tematyczności. Efekt: połowa profilu linkowego to linki generic lub niepowiązane.

Po trzecie: różnica między context quality a topical relevance jest najmniejsza dla poziomów 1-2 (6-4 punkty) i największa dla poziomów 4-5 (3-2 punkty). To sugeruje, że linki tematycznie dopasowane mają też lepszy kontekst – bo artykuł o tej samej branży naturalnie buduje sensowne zdania wokół linku. Link generic ma gorszy kontekst nie dlatego, że autor jest gorszy – ale dlatego, że nie ma o czym sensownego napisać wokół linku do niepowiązanej strony.

Czego nie wiemy

Nie wiemy, jaką wagę Google przypisuje tematyczności w porównaniu z innymi sygnałami linkowym (placement, DR, ruch, anchor). Nie wiemy, czy anchorMismatchDemotion działa binarnie (demote/nie demote) czy na skali. Nie wiemy, jak dokładne są topic embeddings Google i jak często się aktualizują. Nie wiemy, czy link z poziomu 3 (branża) jest 2x gorszy czy 5x gorszy od linku z poziomu 1 (fraza) – patenty opisują mechanizm, nie mnożniki.

Wiemy natomiast, że:

  • Google ma opatentowane mechanizmy oceny tematycznego autorytetu na poziomie frazy, strony i autora
  • API Leak potwierdza dwa atrybuty: anchorMismatchDemotion (kara za niezgodność) i topicEmbeddingsVersionedData (wektorowa reprezentacja tematyczna)
  • Topic-Sensitive PageRank istnieje jako koncepcja od 2002 roku, a jego autor dołączył do Google
  • Nasze dane audytowe pokazują dramatyczny gradient między linkami tematycznie dopasowanymi (88/100) a niepowiązanymi (8/100)

Wniosek: tematyczność to nie bonus – to filtr

W świetle patentów, API Leak i naszych danych, tematyczność nie jest „dodatkowym plusem” dobrego linku. To filtr, przez który Google przepuszcza każdy link. anchorMismatchDemotion nie brzmi jak „mniejszy bonus”. Brzmi jak „aktywna degradacja”. Topic embeddings nie służą do „nagradzania dobrych linków”. Służą do mierzenia odległości tematycznej i podejmowania decyzji na tej podstawie.

Dla praktyki link buildingu wniosek jest jasny: zanim zapytasz „jaki DR ma ta domena?”, zapytaj „jaki temat porusza ta strona?”. Zanim sprawdzisz metryki w Ahrefs, przeczytaj artykuł, z którego wychodzi link. Zanim zapłacisz za 10 linków z domen DR 50+, sprawdź, ile z nich jest tematycznie powiązanych z Twoją stroną – i na którym z 5 poziomów to dopasowanie się znajduje.

Link z portalu branżowego o DR 25 – który ma też wyższą przeżywalność w czasie -, z artykułu w Twoim temacie, z anchorem w kontekście – to poziom 1-2. Link z portalu ogólnego o DR 70, z artykułu o 10 sposobach na oszczędzanie, z anchorem „sprawdź ofertę” – to poziom 4. Patent US11874882B2 mówi, że autorytet jest per key phrase (więcej o koncepcji topical authority w naszym artykule o historii topical authority). anchorMismatchDemotion mówi, że niezgodność to degradacja. Dane mówią: 88/100 vs 22/100. Wybór powinien być oczywisty.

Najczęściej zadawane pytania

Czy Google mierzy tematyczność backlinku?

Tak, na wielu poziomach. Patent US8458196B1 opisuje system tematycznego autorytetu, patent US11874882B2 oblicza topical authority per key phrase, a API Leak z 2024 ujawnił dwa atrybuty: anchorMismatchDemotion (degradacja za niezgodność tematyczną) i topicEmbeddingsVersionedData (wektorowa reprezentacja tematu strony).

Co to jest anchorMismatchDemotion?

Atrybut ujawniony w Google API Leak 2024, w module CompressedQualitySignals. Sugeruje, że Google aktywnie degraduje (demotes) linki, gdy istnieje niezgodność tematyczna między stroną źródłową a docelową. To nie neutralne traktowanie – to kara za mismatch.

Czy link z niepowiązanej tematycznie strony szkodzi?

W większości przypadków – nie szkodzi, ale nie pomaga. W rzadkich przypadkach masowe linki z niepowiązanych tematycznie stron (kasyna, farmacja, podróże do sklepu z meblami) mogą szkodzić widoczności, bo tworzą nienaturalny wzorzec linkowy, który Google może zidentyfikować.

Jak sprawdzić tematyczność swojego profilu linkowego?

Narzędzie Topical Trust Flow (Majestic) klasyfikuje linki do 800+ kategorii i pokazuje rozkład tematyczny profilu. To przybliżenie – Google operuje na embeddingach o setkach wymiarów – ale lepsze niż DR, który tematyczność ignoruje. Manualny audyt (domena → strona → kontekst) daje najdokładniejszy obraz.

Co to jest Topic-Sensitive PageRank?

Koncepcja zaproponowana przez Taher Haveliwala (Stanford, 2002, potem inżynier Google). Zamiast jednego wektora PageRank, system oblicza wiele wektorów biasowanych w kierunku różnych tematów. Efekt: strona z wysokim autorytetem w temacie zapytania dostaje wyższy score niż strona z wysokim autorytetem ogólnym, ale bez powiązania tematycznego.

Podobne wpisy

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Wymagane pola są oznaczone *