Robot indeksujący – jak działa i indeksuje strony internetowe?

Robot indeksujący (crawler, spider, bot) to program, który automatycznie przeszukuje strony internetowe, pobiera ich treść i zapisuje w indeksie wyszukiwarki. W 2026 roku obok klasycznych crawlerów – Googlebota czy Bingbota – pojawiła się nowa kategoria: boty AI, takie jak GPTBot, ClaudeBot czy PerplexityBot. Zrozumienie, jak działają wszystkie te roboty i jak zarządzać ich dostępem, decyduje o tym, czy Twoja strona jest widoczna zarówno w wynikach Google, jak i w odpowiedziach ChatGPT, Gemini czy Perplexity.

Czym jest robot indeksujący?

Robot indeksujący to zautomatyzowany program, który przegląda strony internetowe w sposób systematyczny. Odwiedza adresy URL, pobiera ich zawartość (tekst, obrazy, metadane, kod HTML), a następnie przekazuje zebrane informacje do indeksu – bazy danych, która umożliwia wyszukiwarce szybkie znajdowanie odpowiednich stron na zapytania użytkowników.

Roboty indeksujące nazywane są też crawlerami, spiderami (pająkami) lub botami. Każda wyszukiwarka ma własnego robota: Google używa Googlebota, Bing – Bingbota, a od 2023-2024 roku dołączyły boty systemów AI – GPTBot (OpenAI), ClaudeBot (Anthropic) czy PerplexityBot (Perplexity AI).

Oficjalna definicja Google: „Robot, nazywany również pająkiem lub botem, to program, za którego pomocą Google przetwarza i indeksuje zawartość stron internetowych. Robot indeksujący analizuje witrynę, aby określić jej zawartość, co jest potrzebne do wyświetlania odpowiednich wyników” – Google AdMob.

Jak robot indeksujący przeszukuje i indeksuje strony?

Proces od odkrycia strony do jej pojawienia się w wynikach wyszukiwania składa się z czterech etapów. Każdy z nich to osobny krok, na którym strona może zostać odrzucona.

Infografika: 4 etapy pipeline indeksowania Google - odkrywanie, crawlowanie, renderowanie, indeksowanie
Pipeline indeksowania stron przez Googlebot w 2026 roku

Etap 1 – odkrywanie (URL discovery)

Robot dowiaduje się o istnieniu strony z trzech głównych źródeł: linków z już zaindeksowanych stron, pliku sitemap XML (mapy witryny) oraz ręcznego zgłoszenia URL w Google Search Console. Gdy Googlebot znajdzie nowy link na stronie, dodaje go do kolejki crawlowania – listy adresów czekających na odwiedzenie.

Sitemap XML przyspiesza odkrywanie nowych stron, szczególnie w dużych serwisach, gdzie nie wszystkie podstrony mają wystarczającą liczbę linków wewnętrznych.

Etap 2 – crawlowanie (pobieranie)

Robot wysyła żądanie HTTP do serwera i pobiera odpowiedź – kod HTML strony wraz z nagłówkami. Na tym etapie Googlebot sprawdza kilka rzeczy: czy serwer zwrócił kod 200 (OK), czy plik robots.txt nie blokuje dostępu do URL, czy strona nie przekierowuje na inny adres (301/302).

Od marca 2026 roku wiemy dokładnie, ile danych Googlebot pobiera: maksymalnie 2 MB treści HTML na jeden URL (bez kompresji) i do 64 MB dla plików PDF. Gdy rozmiar pliku przekracza limit, Googlebot przerywa pobieranie i indeksuje tylko to, co zdążył pobrać. Testy przeprowadzone przez Spotibo potwierdziły, że indeksowana treść jest obcinana w pół zdania bez żadnego ostrzeżenia w Search Console.

Etap 3 – renderowanie (Web Rendering Service)

Strony z treścią ładowaną przez JavaScript przechodzą dodatkowy etap – renderowanie w Web Rendering Service (WRS). WRS to bezgłowa przeglądarka oparta na Chromium, która wykonuje kod JavaScript, przetwarza CSS i odtwarza finalne DOM strony – dokładnie tak, jak robi to zwykła przeglądarka.

W poście „Inside Googlebot” z marca 2026 roku zespół Google potwierdził, że WRS działa bezstanowo – nie zachowuje cookies, localStorage, sessionStorage ani IndexedDB między odwiedzinami. Jeśli Twoja strona wymaga zalogowania lub przechowuje dane w pamięci przeglądarki, WRS tego nie zobaczy.

Czas renderowania waha się od kilku godzin do kilku tygodni, w zależności od częstotliwości crawlowania domeny, wydajności serwera i dostępnych zasobów WRS. Strony, które nie polegają na JavaScript do wyświetlania treści, omijają tę kolejkę i są indeksowane szybciej.

Etap 4 – indeksowanie

Po pobraniu i (ewentualnym) renderowaniu treści, algorytmy Google analizują zawartość strony: identyfikują encje (osoby, firmy, miejsca, produkty), dane strukturalne, strukturę nagłówków, linki wewnętrzne i zewnętrzne, schema markup oraz sygnały jakości. Na tej podstawie strona zostaje dodana do indeksu lub odrzucona.

Odrzucenie strony na etapie indeksowania (status „Crawled – currently not indexed” w Search Console) jest coraz częstsze. John Mueller potwierdził w lipcu 2026 roku na podcaście Search Off the Record: „Kiedy nasze systemy mają poważne wątpliwości co do ogólnej jakości serwisu, crawlujemy mniej i indeksujemy mniej”. Gary Illyes dodał, że duża liczba stron ze statusem „crawled, currently not indexed” może wskazywać na problemy z jakością całej domeny.

Crawl budget – ile stron robot zdąży odwiedzić?

Crawl budget to liczba stron, które Googlebot może i chce odwiedzić w danym czasie. Składa się z dwóch elementów: crawl capacity limit (ile robot jest w stanie pobrać) i crawl demand (ile chce pobrać).

Crawl capacity limit

To maksymalna liczba równoległych połączeń, jakie Googlebot może otworzyć do Twojego serwera, oraz minimalne opóźnienie między kolejnymi żądaniami. Limit zależy od wydajności serwera – im szybciej serwer odpowiada, tym więcej stron robot może pobrać w tym samym czasie.

Zgodnie z dokumentacją Google zaktualizowaną 22 lipca 2026: każda strona startuje z tym samym, konserwatywnym limitem crawl capacity. Jeśli serwer odpowiada stabilnie, a czasy odpowiedzi (w tym latency i Time to First Byte) utrzymują się lub poprawiają, limit rośnie automatycznie. Jeśli serwer zwalnia lub zwraca błędy (np. HTTP 429 lub 5xx), limit spada.

Crawl demand

To zapotrzebowanie Google na ponowne odwiedzenie stron. Popularne strony (z dużą liczbą linków zwrotnych i ruchu) są crawlowane częściej. Strony rzadko aktualizowane lub z niską popularnością mogą być odwiedzane co kilka tygodni lub nawet miesięcy.

Co wpływa na crawl budget w praktyce?

Crawl budget jest istotny przede wszystkim dla dużych serwisów (powyżej 10 000 stron). Dla mniejszych witryn Googlebot zazwyczaj bez problemu crawluje wszystkie strony. Czynniki, które wpływają na efektywność wykorzystania budżetu:

Szybkość serwera. Gary Illyes podkreśla, że kosztowne zapytania do bazy danych spowalniają serwer i obniżają crawl capacity. Im szybszy czas odpowiedzi, tym więcej stron Googlebot odwiedzi.

Cachowanie HTTP 304. To nowe zalecenie z dokumentacji z lipca 2026. Jeśli strona nie zmieniła się od ostatniego crawlowania, serwer powinien zwrócić kod 304 Not Modified zamiast pełnej treści. Oszczędza to zasoby serwera i crawl budget.

Unikanie duplikatów. Strony z parametrami w URL (?sort=price, ?page=3), duplikaty bez tagów canonical i nieskończone fasetowe nawigacje marnują budżet crawlowania.

Wspólny limit dla wszystkich crawlerów. Dokumentacja Google potwierdza, że crawl capacity limit jest wspólny dla wszystkich crawlerów Google (Googlebot, Googlebot-Image, Googlebot-Video, AdsBot). Intensywne crawlowanie przez jednego robota zmniejsza zasoby dostępne dla pozostałych.

Googlebot w 2026 roku – co się zmieniło?

Rok 2026 przyniósł kilka istotnych zmian w sposobie, w jaki Googlebot crawluje i indeksuje strony.

Limit 2 MB na indeksowanie (luty 2026)

W lutym 2026 Google zaktualizowało dokumentację, obniżając opublikowany limit rozmiaru pliku z 15 MB do 2 MB. Google określa to jako „klaryfikację dokumentacji, nie zmianę zachowania” – oznacza to, że limit 2 MB obowiązywał w praktyce wcześniej, ale nie był jawnie udokumentowany.

Dwa oddzielne limity: pobieranie (fetch) zachowuje limit 15 MB, natomiast indeksowanie (processing for search) to 2 MB. Googlebot pobierze plik większy niż 2 MB, ale do indeksu trafi tylko pierwsze 2 MB treści. Dla plików PDF limit wynosi 64 MB.

W praktyce 2 MB HTML to około 500 000-700 000 znaków tekstu – wystarczy dla zdecydowanej większości stron. Problem dotyczy głównie stron z rozbudowanym kodem JavaScript, inline CSS lub dużymi tabelami danych.

Nowa dokumentacja crawl budget (lipiec 2026)

22 lipca 2026 Google przebudowało dokumentację dotyczącą crawl budget. Najważniejsza zmiana organizacyjna: dokumentacja crawlowania została przeniesiona z Google Search Central na nową stronę Google Crawling Infrastructure, ponieważ infrastruktura crawlowania jest wspólna dla wielu produktów Google – Search, Shopping, News, Gemini, AdSense.

To potwierdza, że Googlebot nie jest pojedynczym programem, ale użytkownikiem scentralizowanej platformy crawlowania. Gdy widzisz Googlebota w logach serwera, to Google Search korzysta ze wspólnej infrastruktury.

Jakość treści wpływa na crawlowanie

Gary Illyes wielokrotnie podkreślał, że jakość „wpływa na praktycznie wszystko, co robią systemy Search” – od sitemapów, przez harmonogram crawlowania, indeksowanie, aż po ranking. Strony z niską jakością treści (w tym masowo generowaną treścią AI bez wartości dodanej) mogą być crawlowane rzadziej i indeksowane w mniejszym stopniu.

W praktyce widać to w raportach Search Console: rosnąca liczba stron ze statusem „Crawled – currently not indexed” może być sygnałem, że Google obniżyło ocenę jakości domeny.

Boty AI – nowa kategoria crawlerów

Od 2023 roku internet crawluje nowa kategoria robotów – boty systemów AI. ChatGPT, Claude, Gemini, Perplexity i inne systemy AI potrzebują dostępu do treści stron, aby cytować je w swoich odpowiedziach. To fundamentalna zmiana: dotychczas crawlerów obchodziło tylko, czy strona trafi do indeksu wyszukiwarki. Teraz chodzi też o to, czy strona zostanie zacytowana w odpowiedzi AI. Audyt widoczności w AI pozwala sprawdzić, czy boty AI mają dostęp do Twojego serwisu i czy cytują go w swoich odpowiedziach.

Infografika: taksonomia botów AI - podział na boty treningowe, wyszukiwania i agentowe
Taksonomia botów AI: training, search i agent – stan na 2026 rok

Czym różnią się boty AI od klasycznych crawlerów?

Klasyczne crawlery (Googlebot, Bingbot) budują indeks wyszukiwarki – zapisują treść strony, żeby móc ją wyświetlić w wynikach na zapytanie użytkownika. Boty AI pełnią trzy różne funkcje:

Training (trening modeli). Pobierają masowo treści ze stron, żeby trenować modele językowe. Przykład: GPTBot (OpenAI), Google-Extended (Google/Gemini), CCBot (Common Crawl). Te boty nie wpływają bezpośrednio na cytowanie Twojej strony w odpowiedziach AI – zbierają dane do budowy „wiedzy ogólnej” modelu.

Search/Retrieval (wyszukiwanie i pobieranie). Budują indeks, z którego system AI pobiera treści w czasie generowania odpowiedzi. Przykład: OAI-SearchBot (indeks ChatGPT Search), PerplexityBot (indeks Perplexity). Zablokowanie tych botów oznacza, że system AI nie zacytuje Twojej strony.

Agent (pobieranie na żywo). Pobierają treść strony w czasie rzeczywistym, gdy użytkownik zadaje pytanie. Przykład: ChatGPT-User, Perplexity-User, Claude-User. Działają jak przeglądarka – odwiedzają stronę w momencie generowania odpowiedzi.

Najważniejsze boty AI w 2026 roku

BotOperatorTypFunkcjaRespektuje robots.txt
GPTBotOpenAITrainingTrening modeli GPTTak
OAI-SearchBotOpenAISearchIndeks ChatGPT SearchTak
ChatGPT-UserOpenAIAgentPobieranie na żywo dla użytkownikaTak
ClaudeBotAnthropicTrainingTrening modeli ClaudeTak
Claude-SearchBotAnthropicSearchIndeks Claude SearchTak
Claude-UserAnthropicAgentPobieranie na żywoTak
PerplexityBotPerplexity AISearchIndeks PerplexityCzęściowo
Google-ExtendedGoogleTrainingTrening Gemini (opt-out)Tak
Applebot-ExtendedAppleTrainingApple IntelligenceTak
AmazonbotAmazonSearchAlexa i RufusTak
Meta-ExternalAgentMetaTrainingMeta AITak
BytespiderByteDanceTrainingTrening modeli ByteDanceNie zawsze
CCBotCommon CrawlTrainingOtwarty dataset treningowyTak

Rozróżnienie między botami treningowymi a wyszukiwania jest kluczowe. Więcej o tym, jak AI wybiera źródła do cytowania, opisujemy w osobnym artykule. Zablokowanie GPTBot nie wpływa na cytowanie w ChatGPT Search – za to odpowiada OAI-SearchBot. To dwa oddzielne roboty z oddzielnymi dyrektywami w robots.txt.

Jak zarządzać dostępem botów przez robots.txt?

Plik robots.txt to pierwszy punkt kontaktu między robotem a Twoją stroną. Robot pobiera go przed odwiedzeniem jakiegokolwiek URL i sprawdza, które ścieżki są dozwolone, a które zablokowane. Plik znajduje się zawsze pod adresem domena.pl/robots.txt.

Podstawy robots.txt

Struktura pliku robots.txt opiera się na dyrektywach User-agent, Disallow i Allow:

User-agent: Googlebot
Disallow: /admin/
Allow: /

User-agent: *
Disallow: /prywatne/

Sitemap: https://example.com/sitemap.xml

User-agent wskazuje, którego robota dotyczy reguła (gwiazdka * oznacza wszystkie roboty). Disallow blokuje dostęp do wskazanej ścieżki. Allow jawnie zezwala na dostęp (przydatne, gdy chcesz zezwolić na podkatalog w zablokowanym katalogu). Sitemap wskazuje lokalizację mapy witryny.

Pamiętaj: robots.txt to prośba, nie bariera techniczna. Dobrze zachowujące się boty (Googlebot, Bingbot, GPTBot, ClaudeBot) respektują dyrektywy. Ale boty, które ignorują robots.txt (jak niektóre warianty Bytespider), wymagają blokowania na poziomie serwera lub WAF.

robots.txt a boty AI – strategia na 2026 rok

Dane z czerwca 2026 roku pokazują, że 44,9% dużych witryn blokuje co najmniej jednego bota AI w robots.txt. Jednocześnie raport Otterly AI Citations 2026 wskazuje, że 73% stron ma bariery techniczne blokujące dostęp crawlerów AI – często nieświadomie.

Rekomendowana strategia na 2026 rok to selektywna konfiguracja: zezwalaj botom wyszukiwania AI (OAI-SearchBot, ChatGPT-User, Claude-SearchBot, PerplexityBot) na dostęp do treści, a blokuj agresywne boty treningowe (Bytespider, CCBot), jeśli nie chcesz, żeby Twoje treści trafiały do datasetów treningowych.

Dlaczego to ważne? Jeśli zablokujesz OAI-SearchBot, ChatGPT nie zacytuje Twojej strony w wynikach ChatGPT Search – nawet jeśli GPTBot (trening) ma dostęp. To dwa oddzielne systemy.

Przykładowy robots.txt z obsługą botów AI

# Klasyczne wyszukiwarki - pełen dostęp
User-agent: Googlebot
Allow: /

User-agent: Bingbot
Allow: /

# Boty AI - wyszukiwanie i pobieranie na żywo (ALLOW)
User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Amazonbot
Allow: /

# Boty AI - trening modeli (BLOCK jeśli nie chcesz)
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: Meta-ExternalAgent
Disallow: /

# Domyślna reguła
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://example.com/sitemap.xml

Ten przykład blokuje boty treningowe, ale zezwala botom wyszukiwania AI na crawlowanie treści. Dzięki temu Twoja strona może być cytowana w ChatGPT Search, Claude i Perplexity, ale treści nie trafią do datasetów treningowych. Dostosuj konfigurację do swojej strategii – jeśli zależy Ci na maksymalnej widoczności w AI, rozważ odblokowanie również botów treningowych.

llms.txt – nowy standard dla AI

Obok robots.txt pojawił się nowy plik: llms.txt. To konwencja społecznościowa (format Markdown), która dostarcza crawlerom AI skondensowane informacje o witrynie – czym jest serwis, jakie treści oferuje, jakie ma podstrony i jak je interpretować.

16 czerwca 2026 roku W3C opublikowało working draft „AI Crawler Guidance Standardization”, otwierając 90-dniowy okres konsultacji publicznych w celu formalizacji llms.txt jako standardu webowego. Raport Cloudflare Radar z czerwca 2026 wskazuje, że pliki llms.txt istnieją już na 14% z top 100 000 witryn globalnie (wzrost z 2% rok wcześniej), a adopcja najszybciej rośnie wśród domen B2B SaaS.

Badania Princeton GEO-bench z maja 2026 wykazały, że strony z dobrze ustrukturyzowanym llms.txt uzyskiwały 23% więcej cytowań AI w ChatGPT Search, Perplexity i Google AI Mode w porównaniu z grupą kontrolną. Choć żaden duży LLM nie crawluje llms.txt na produkcyjnym harmonogramie, crawlery Microsoft i OpenAI aktywnie pobierają zarówno llms.txt, jak i llms-full.txt.

Lista najważniejszych botów indeksujących w 2026 roku

Poniższa tabela zawiera najważniejsze roboty indeksujące – zarówno klasyczne crawlery wyszukiwarek, jak i boty AI:

RobotOperatorUser-AgentFunkcja
GooglebotGoogleGooglebot/2.1Crawlowanie i indeksowanie stron dla Google Search
Googlebot-ImageGoogleGooglebot-Image/1.0Indeksowanie obrazów
Googlebot-VideoGoogleGooglebot-Video/1.0Indeksowanie wideo
AdsBot-GoogleGoogleAdsBot-GoogleSprawdzanie stron docelowych reklam
BingbotMicrosoftbingbot/2.0Crawlowanie dla Bing Search
Yandex BotYandexYandexBot/3.0Crawlowanie dla Yandex Search
DuckDuckBotDuckDuckGoDuckDuckBot/1.1Crawlowanie dla DuckDuckGo
GPTBotOpenAIGPTBot/1.2Trening modeli GPT
OAI-SearchBotOpenAIOAI-SearchBot/1.0Indeks ChatGPT Search
ChatGPT-UserOpenAIChatGPT-User/1.0Pobieranie na żywo w rozmowie
ClaudeBotAnthropicClaudeBot/1.0Trening modeli Claude
Claude-SearchBotAnthropicClaude-SearchBot/1.0Indeks Claude Web Search
PerplexityBotPerplexity AIPerplexityBot/1.0Indeks Perplexity
Google-ExtendedGoogleGoogle-ExtendedOpt-out z treningu Gemini
ApplebotAppleApplebot/0.1Siri i Spotlight Search
Applebot-ExtendedAppleApplebot-Extended/0.1Apple Intelligence (opt-out)

Jak sprawdzić, czy roboty poprawnie crawlują Twoją stronę?

Monitorowanie aktywności robotów na Twojej stronie jest kluczowe dla technicznego SEO i utrzymania widoczności zarówno w wyszukiwarkach, jak i w systemach AI.

Google Search Console – raport Pages. Sekcja „Pages” w GSC pokazuje, ile stron zostało zaindeksowanych, a ile odrzuconych i z jakich powodów. Status „Crawled – currently not indexed” (jak sprawdzić indeksację strony) oznacza, że Googlebot odwiedził stronę, ale nie uznał jej za wartą dodania do indeksu. Rosnąca liczba takich stron to sygnał ostrzegawczy – więcej o tym w artykule strona niewidoczna w Google – jak temu zaradzić.

Logi serwera. Analiza logów pozwala zobaczyć, które roboty odwiedzają Twoją stronę, jak często i jakie podstrony crawlują. Możesz zidentyfikować, czy boty AI w ogóle mają dostęp do Twojego serwisu.

Narzędzie „Sprawdź URL” w GSC. Pozwala sprawdzić status indeksacji konkretnej strony: czy została odkryta, crawlowana, renderowana i zaindeksowana. Pokazuje też datę ostatniego crawlowania.

Tester robots.txt. Google udostępnia oficjalną dokumentację robots.txt z walidatorem. Warto regularnie sprawdzać, czy plik robots.txt nie blokuje ważnych zasobów.

Podsumowanie

Roboty indeksujące w 2026 roku to nie tylko Googlebot przeszukujący strony dla wyszukiwarki Google. To ekosystem kilkunastu crawlerów, w tym botów AI, z których każdy pełni inną funkcję – od treningu modeli językowych, przez budowę indeksów wyszukiwania AI, po pobieranie treści na żywo w trakcie rozmowy z użytkownikiem.

Trzy rzeczy, które warto wdrożyć: po pierwsze, zaktualizuj robots.txt tak, żeby selektywnie zarządzać dostępem botów AI (to element szerszej strategii pozycjonowania w AI) (zezwalaj botom search, kontroluj boty treningowe). Po drugie, monitoruj indeksowanie strony w Search Console – rosnąca liczba stron „crawled, not indexed” może sygnalizować problemy z jakością. Po trzecie, zadbaj o szybkość serwera i cachowanie HTTP 304, bo to bezpośrednio wpływa na crawl budget.

Agencja Semgence przeprowadza audyty SEO, w ramach których analizujemy konfigurację robots.txt, crawl budget, indeksację i dostępność strony dla botów AI. Jeśli Twoja strona traci widoczność lub nie pojawia się w odpowiedziach AI, skontaktuj się z nami – zdiagnozujemy problem i zaproponujemy rozwiązanie.

Co to jest robot indeksujący?

Robot indeksujący (crawler, spider, bot) to program, który automatycznie przegląda strony internetowe, pobiera ich zawartość i zapisuje w indeksie wyszukiwarki. Googlebot to robot Google, Bingbot to robot Bing. Od 2023 roku działają też boty AI – GPTBot (OpenAI), ClaudeBot (Anthropic), PerplexityBot – które crawlują treści na potrzeby systemów sztucznej inteligencji.

Jak działa Googlebot?

Googlebot odkrywa strony przez linki i sitemapy, pobiera HTML (do 2 MB na URL), renderuje JavaScript w Web Rendering Service (WRS opartym na Chromium), analizuje treść i zapisuje w indeksie Google. Crawluje regularnie – popularne strony częściej, mniej popularne rzadziej. Crawl budget zależy od wydajności serwera i zapotrzebowania Google na ponowne odwiedzenie strony.

Czym różnią się boty AI od klasycznych crawlerów?

Klasyczne crawlery (Googlebot, Bingbot) budują indeks wyszukiwarki. Boty AI pełnią trzy funkcje: training (trening modeli – GPTBot, ClaudeBot), search (budowa indeksu wyszukiwania AI – OAI-SearchBot, PerplexityBot) i agent (pobieranie na żywo – ChatGPT-User). Zablokowanie bota treningowego nie wpływa na cytowanie w wyszukiwarce AI, ale zablokowanie bota search – tak.

Czy powinienem blokować boty AI w robots.txt?

Zależy od strategii. Rekomendowane podejście: zezwalaj botom search/retrieval (OAI-SearchBot, ChatGPT-User, Claude-SearchBot, PerplexityBot) na dostęp, żeby Twoja strona mogła być cytowana w odpowiedziach AI. Boty treningowe (GPTBot, ClaudeBot, CCBot) możesz zablokować, jeśli nie chcesz, żeby treści trafiały do datasetów treningowych. Pamiętaj: blokada GPTBot nie wpływa na ChatGPT Search.

Co to jest crawl budget i czy jest ważny dla mojej strony?

Crawl budget to liczba stron, które Googlebot może i chce odwiedzić w danym czasie. Składa się z crawl capacity limit (zależy od wydajności serwera) i crawl demand (zależy od popularności strony). Dla małych witryn (poniżej 10 000 stron) crawl budget zazwyczaj nie stanowi problemu. Dla dużych serwisów kluczowe jest: szybki serwer, cachowanie HTTP 304 i unikanie duplikatów URL.

Co to jest llms.txt?

llms.txt to nowy plik (obok robots.txt), który dostarcza crawlerom AI skondensowane informacje o witrynie w formacie Markdown. W czerwcu 2026 W3C rozpoczęło formalizację llms.txt jako standardu webowego. Badania Princeton wykazały, że strony z llms.txt uzyskują 23% więcej cytowań AI. Plik istnieje na 14% z top 100 000 witryn globalnie.

Podobne wpisy

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Wymagane pola są oznaczone *