Crawl budget – jak zoptymalizować w 9 prostych krokach?

Crawl budget to liczba stron, które Googlebot może i chce crawlować w Twoim serwisie w określonym czasie. Jeśli masz 500 podstron – crawl budget (zobacz też: taxonomy bloat w e-commerce) nie jest problemem. Jeśli masz 50 000 lub 500 000 URL-i (e-commerce z filtrami, duży portal) – crawl budget decyduje o tym, które strony Google w ogóle zobaczy, a które pominie. Według oficjalnej dokumentacji Google Developers, crawl budget to kombinacja crawl capacity limit i crawl demand – im szybciej odpowiada serwer i im częściej zmieniasz treści, tym więcej stron Google crawluje. W e-commerce budżet indeksowania marnują między innymi puste strony niedostępnych produktów, o czym piszemy w artykule o out of stock SEO.

Dane z Ahrefs potwierdzają, że fraza „crawl budget” generuje w Polsce 150 wyszukiwań miesięcznie (KD 0, traffic potential 50). Temat jest niszowy, ale krytyczny dla dużych serwisów – a w erze AI Search zyskuje nowy wymiar, bo boty AI (GPTBot, ClaudeBot, PerplexityBot) mają swój, znacznie mniejszy crawl budget. Według analizy Semrush opublikowanej na Search Engine Land, między majem 2024 a majem 2025 ruch crawlerów AI wzrósł o 96%, a udział GPTBot skoczył z 5% do 30%.

Semgence – agencja SEO z Warszawy – optymalizuje crawl budget jako standardowy element audytu technicznego SEO. W typowym serwisie e-commerce z faceted navigation identyfikujemy średnio 40-60% URL-i marnujących crawl budget – filtry, sortowania, paginacja, parametry sesyjne. Po optymalizacji (robots.txt + canonical + noindex) Google zaczyna crawlować ważne strony szybciej i częściej.

Infografika: crawl budget – crawl rate limit i crawl demand oraz 9 kroków optymalizacji crawl budgetu z narzędziami SEO
Jak Googlebot decyduje, co crawlować – schemat crawl budgetu z 9 krokami optymalizacji. Źródło: Google Developers, Semrush, Screaming Frog. Opracowanie: Semgence.

Czym jest crawl budget i kiedy ma znaczenie?

Crawl budget to kombinacja dwóch czynników zdefiniowanych przez Google w oficjalnym blogu Google Search Central: crawl rate limit (maksymalna liczba żądań, które Googlebot może wysłać bez przeciążenia serwera) i crawl demand (zapotrzebowanie na crawlowanie – jak bardzo Google chce odwiedzić Twoje strony). Nawet jeśli serwer wytrzyma 100 żądań na sekundę, Googlebot nie będzie crawlował tak szybko, jeśli nie widzi powodu – na przykład gdy treść się nie zmienia.

Google precyzuje w dokumentacji Crawl Budget Management: „jeśli crawl demand jest niski, Google będzie crawlował Twój serwis rzadziej, nawet jeśli crawl capacity limit nie został osiągnięty.” Crawl budget ma znaczenie przede wszystkim dla dużych serwisów – powyżej 10 000 stron. Mała strona firmowa z 50 podstronami zostanie crawlowana w całości bez problemu. Ale sklep e-commerce z 200 000 URL-i generuje miliony kombinacji, z których Googlebot odwiedzi tylko ułamek.

Jak pisze Semrush na swoim blogu: „crawl budget to czas i zasoby, które boty wyszukiwarek przeznaczają na crawlowanie Twojej witryny i indeksowanie jej stron.” Praktyczne sygnały, że Twój serwis ma problem z crawl budgetem: nowe strony nie pojawiają się w Google przez tygodnie, GSC pokazuje wzrost „Discovered – currently not indexed,” raport Crawl Stats (GSC → Settings → Crawl Stats) pokazuje, że Googlebot spędza czas na URL-ach z parametrami zamiast na stronach produktowych.

Jak sprawdzić wykorzystanie crawl budgetu?

Trzy narzędzia do diagnozy crawl budgetu. Google Search Console – raport Crawl Stats (Ustawienia → Statystyki indeksowania) pokazuje ile stron Googlebot crawluje dziennie, średni czas odpowiedzi i kody HTTP. To punkt wyjścia – jeśli 60% crawlu to URL-e z parametrami (?sort=, ?filter=, ?page=), masz jasny sygnał waste. Screaming Frog SEO Spider z integracją GSC API pozwala zestawić dane crawlu z danymi indeksowania – widzisz, które URL-e Google crawluje, ale nie indeksuje. Semrush Log File Analyzer parsuje logi serwera i pokazuje dokładnie, które URL-e Googlebot odwiedza, jak często i w jakiej kolejności. Jak podkreśla Search Engine Land: „porównaj aktywność crawlu z URL-ami generującymi przychód – jeśli strony konwertujące nie są regularnie crawlowane, masz okazję do optymalizacji.”

Jak zoptymalizować crawl budget? 9 kroków

Optymalizacja crawl budgetu to eliminacja waste (marnowanych żądań) i ukierunkowanie Googlebota na strony o najwyższej wartości SEO. Poniższe 9 kroków stosujemy w audytach Semgence – od najprostszych zmian po zaawansowaną konfigurację. Kolejność oparta na wytycznych Google i praktyce audytowej.

Krok 1: Popraw szybkość odpowiedzi serwera

Szybkość serwera bezpośrednio wpływa na crawl rate limit. Jeśli serwer odpowiada wolno (TTFB powyżej 500ms), Googlebot obniża częstotliwość żądań. Cele: TTFB poniżej 200ms, LCP poniżej 2,5 sekundy. Jak opisuje Google w artykule „Crawling December” (grudzień 2024): „każdy zasób potrzebny do renderowania strony zużywa crawl budget hosta, na którym jest hostowany.” Optymalizacja: CDN, cache’owanie, optymalizacja bazy danych. Od lipca 2024 Google indeksuje wyłącznie mobilną wersję strony (mobile-first indexing).

Krok 2: Usuń zduplikowane treści

Duplikacja treści to jeden z największych pożeraczy crawl budgetu. Parametry URL (?utm_source=, ?fbclid=, ?sort=price), warianty produktów, paginacja – każda kombinacja to osobny URL. Google w dokumentacji crawl budget explicite stwierdza: „konsoliduj zduplikowaną treść” jako pierwszą rekomendację. Narzędzia: Screaming Frog (raport Near Duplicates), Ahrefs Site Audit. Rozwiązania: canonical na czysty URL, noindex na filtrach, 301 z duplikatów.

Krok 3: Zoptymalizuj robots.txt

Robots.txt to pierwsza linia obrony crawl budgetu. Google w dokumentacji jest precyzyjny: „nie używaj noindex, bo Google musi najpierw crawlować stronę, żeby zobaczyć tag noindex – marnując crawl budget. Zamiast tego użyj robots.txt, żeby całkowicie zablokować crawlowanie stron, których Google nie powinien widzieć.” Gary Illyes (analityk Google) przestrzegał na LinkedIn przed ujawnianiem w robots.txt struktury bezpieczeństwa strony – blokowanie konkretnych ścieżek może być sygnałem dla hakerów.

Krok 4: Zredukuj błędy HTTP

Błędy 404 i awarie 5xx marnują crawl budget. Google w dokumentacji crawl budget zaleca: „zwracaj kod 404 lub 410 dla trwale usuniętych stron – to silny sygnał, żeby nie crawlować tego URL-a ponownie. Zablokowane URL-e (w robots.txt) pozostaną w kolejce crawlu znacznie dłużej.” Soft 404 są jeszcze gorsze – „strony soft 404 będą nadal crawlowane, marnując Twój budżet.” Narzędzia: GSC raport Coverage, Screaming Frog (Response Codes), Ahrefs Site Explorer (Best by Links → filter 404).

Krok 5: Zarządzaj parametrami URL

Parametry URL to najczęstszy generator waste. Sklep z 1 000 produktów i 10 filtrami może generować miliony kombinacji. Semrush zaleca w swoim poradniku: „uwzględniaj w sitemapie tylko URL-e, które chcesz widzieć w wynikach wyszukiwania.” Narzędzia: Semrush Site Audit (wykrywa parametry URL generujące duplicate content), Screaming Frog (filtrowanie URL-i po query string).

Krok 6: Zoptymalizuj linkowanie wewnętrzne

Linkowanie wewnętrzne to „mapa” dla Googlebota. Strony bez linków (orphan pages) mogą nigdy nie zostać crawlowane. Jak pisze HubSpot w swoim poradniku o crawl budget: „regularnie przeprowadzaj audyty i sprawdzaj, które strony są indeksowane – Google Search Console, Ahrefs i Semrush pokażą dokładnie, które strony wyszukiwarki widzą.” Kluczowe: max 3 kliknięcia od strony głównej do każdej ważnej strony. Narzędzia: Screaming Frog (Crawl Depth report), Ahrefs Site Audit (Orphan Pages).

Krok 7: Zaktualizuj sitemap XML

Sitemap XML powinna zawierać wyłącznie strony z kodem 200, bez noindex, bez duplikatów. Google: „nie uwzględniaj w sitemapie URL-i zablokowanych w robots.txt.” Aktualizuj automatycznie. Narzędzie: GSC (Sitemaps → monitor błędów), Screaming Frog XML Sitemap Generator.

Krok 8: Ogranicz łańcuchy przekierowań

Łańcuchy przekierowań 301 (A→B→C→D) marnują crawl budget – każdy skok to dodatkowe żądanie. Google w grudniu 2024 w artykule „Crawling December” precyzuje, że renderowanie strony z wieloma zasobami do pobrania dodatkowo zużywa crawl budget. Narzędzia: Screaming Frog (Redirect Chains report), Semrush Site Audit.

Krok 9: Usuń strony niskiej jakości

Ostatni krok to audyt URL-i i identyfikacja stron, które nie powinny być crawlowane: thin content (poniżej 200 słów), automatycznie generowane strony (tagi, archiwa), strony wewnętrznego wyszukiwania. Jak podkreśla Victorious.com: „Semrush Log File Analyzer i Screaming Frog Log File Analyzer pomogą ci posortować i zrozumieć dane z logów.” Każdy zablokowany URL to miejsce „odzyskane” dla wartościowych stron. Więcej: checklista technicznego SEO.

Crawl budget a boty AI – nowy wymiar w 2026 roku

Od 2025 roku crawl budget nie dotyczy już tylko Googlebota. Boty AI – GPTBot (OpenAI), ClaudeBot (Anthropic), PerplexityBot – crawlują strony, żeby budować kontekst dla odpowiedzi w ChatGPT, Claude i Perplexity. Według analizy opublikowanej na Search Engine Land (październik 2025), bazującej na danych Semrush z 260 miliardów wierszy clickstream data, ruch crawlerów AI wzrósł o 96% między majem 2024 a majem 2025. Udział GPTBot skoczył z 5% do 30%.

Kluczowa różnica: boty AI mają znacznie mniejszy crawl budget niż Googlebot i nie renderują JavaScript. Strony wymagające JS do wyświetlenia treści są dla botów AI niewidoczne – renderowanie JS zajmuje Googlebotowi nawet 9x dłużej niż statyczny HTML. Jeśli marnujesz czas botów AI na filtry i paginację, ważne strony – te, które mogłyby być cytowane w ChatGPT – mogą nigdy nie zostać crawlowane.

Strategia: konfiguracja robots.txt dla botów AI, minimalizacja redirectów, treść w statycznym HTML. Więcej o widoczności w AI: audyt widoczności w AI.

Jak czytać raport Crawl Stats w Google Search Console?

Raport Crawl Stats w GSC to najlepsze źródło danych o tym, jak Googlebot faktycznie crawluje Twój serwis. Znajdziesz go w: Ustawienia → Statystyki indeksowania (dawniej „Statystyki crawlowania”). Raport jest dostępny tylko dla property na poziomie domeny (Domain property) lub root-level URL-prefix. Jak podaje oficjalna dokumentacja Google Search Console: „raport Crawl Stats pokazuje statystyki historii crawlowania Twojej witryny – ile żądań zostało wysłanych, jakie były odpowiedzi serwera i czy wystąpiły problemy z dostępnością.”

3 wykresy główne – Total Requests, Download Size, Response Time

Na szczycie raportu zobaczysz trzy wykresy za ostatnie 90 dni.

Raport Crawl Stats w Google Search Console – wykresy całkowitej liczby żądań crawlowania, rozmiaru pobranych danych i średniego czasu odpowiedzi serwera
Wykresy Crawl Stats w GSC: Total Requests, Total Download Size, Average Response Time. Źródło: Google Search Central Blog. Licencja CC BY 4.0.

Total Crawl Requests (Całkowita liczba żądań) – ile razy Googlebot odpytał Twój serwer w danym dniu. Dla serwisu z 200 stronami typowa wartość to 50-200 żądań dziennie. Gwałtowny spadek może oznaczać problem z robots.txt lub dostępnością serwera. Gwałtowny wzrost – Googlebot odkrył dużo nowych stron (np. po dodaniu sitemapy) lub crawluje zasoby (CSS, JS, obrazy), które się zmieniły. Total Download Size (Rozmiar pobranych danych) – ile danych Googlebot pobrał. Wzrost przy stałej liczbie żądań oznacza, że strony stały się cięższe (duże obrazy, rozbudowany JS). Average Response Time (Średni czas odpowiedzi) – jak szybko Twój serwer odpowiada Googlebotowi. Google używa 200ms jako progu ostrzegawczego. Powyżej 200ms: sprawdź hosting, caching (np. Flying Press, Cloudflare), CDN.

Podział żądań – Response Code, File Type, Crawl Purpose

Pod wykresami znajdziesz tabele z podziałem żądań crawlowania na kategorie. Kliknij dowolny wiersz, żeby zobaczyć przykładowe URL-e.

Crawl Stats – podział żądań crawlowania wg response code, file type i crawl purpose w Google Search Console
Podział żądań Googlebota wg kodu odpowiedzi, typu pliku i celu crawlowania. Źródło: Google Search Central Blog. Licencja CC BY 4.0.

Response Code (Kod odpowiedzi): idealnie 90%+ żądań zwraca 200 (OK). Duży udział 301/302 = Googlebot traci czas na redirecty (napraw łańcuchy redirectów). 404 = Googlebot crawluje nieistniejące strony (sprawdź skąd biorą się te URL-e – stare linki wewnętrzne? sitemap?). 5xx = problemy z serwerem. File Type (Typ pliku): podział na HTML, Image, CSS, JavaScript, Other. Jeśli obrazy stanowią 60%+ żądań – Googlebot marnuje crawl budget na zasoby zamiast na treść. Rozwiązanie: lazy loading, CDN, cache headers. Crawl Purpose (Cel crawlowania): „Discovery” (odkrywanie nowych stron) vs „Refresh” (odświeżanie znanych stron). Wysoki udział Refresh = Googlebot monitoruje zmiany. Niski Discovery = Googlebot może nie odkrywać nowych treści (sprawdź linkowanie wewnętrzne i sitemapę).

Host Status – dostępność serwera

Crawl Stats host status details – szczegóły dostępności hosta: robots.txt, DNS resolution, server connectivity w Google Search Console
Host status details: robots.txt availability, DNS resolution, server connectivity. Źródło: Google Search Central Blog. Licencja CC BY 4.0.

Sekcja Host Status pokazuje, czy Google miał problemy z dostępnością Twojego serwisu w ciągu ostatnich 90 dni. Trzy wymiary: Robots.txt availability – czy Googlebot mógł pobrać robots.txt. Jeśli robots.txt jest niedostępny przez dłuższy czas, Google może wstrzymać crawlowanie. DNS resolution – czy serwer DNS odpowiada poprawnie. Server connectivity – czy serwer HTTP/HTTPS odpowiada. Zielona ikona = brak problemów. Czerwona = Googlebot miał problemy z dostępnością w ostatnim tygodniu – wymaga natychmiastowej reakcji.

W praktyce: raport Crawl Stats to pierwszy krok diagnostyki crawl budget. Jeśli widzisz spadek Total Requests + wzrost Response Time + błędy Host Status – Googlebot ogranicza crawlowanie z powodu problemów z wydajnością serwera. Rozwiązanie: szybszy hosting, CDN, optymalizacja odpowiedzi serwera. Więcej o narzędziach diagnostyki technicznej: checklista technicznego SEO.

Glenn Gabe z GSQi — specjalista od site migrations i technical SEO — wykorzystuje raport Crawl Stats jako kluczowe narzędzie diagnostyczne podczas migracji serwisów. Jego podejście: przygotuj wszystko co możesz przed migracją, miej pełne dane pod ręką w momencie push to production, a jeśli coś pójdzie nie tak (a pójdzie) — reaguj natychmiast. Gabe opisuje typowy wzorzec problemów po migracji: spadek Total Crawl Requests + jednoczesny wzrost 301/404 w Response Codes = sygnał, że redirecty nie działają poprawnie i Googlebot traci czas na przetwarzanie błędnych URL-i zamiast crawlować nowe strony. Gabe porównuje próby uzyskania logów serwera do misji z „Mission Impossible” — dlatego Crawl Stats w GSC to najlepsza alternatywa, gdy dostęp do logów jest niemożliwy.

Gabe opisuje też powszechny błąd w szacowaniu crawl budget (GSQi blog — „True Size of Your Site”): właściciele serwisów patrzą na liczbę zaindeksowanych stron (np. 73 000) i zakładają, że crawl budget nie jest problemem. Ale rzeczywisty rozmiar serwisu — uwzględniając parametry URL, facety, filtry, paginację, warianty językowe — może wynosić 29,5 miliona URL-i. I tych 29,5 miliona stron Googlebot musi przecrawlować i przetworzyć. Gdy rzeczywisty rozmiar serwisu jest 400x większy niż liczba zaindeksowanych stron, crawl budget staje się krytyczny. Dlatego raport Coverage w GSC (kategoria Excluded) jest tak ważny — pokazuje prawdziwą skalę serwisu, nie tylko to, co Google zdecydował się zaindeksować.

Najczęściej zadawane pytania o crawl budget

Co to jest crawl budget?

Crawl budget to kombinacja crawl rate limit (ile żądań Googlebot może wysłać bez przeciążenia serwera) i crawl demand (jak bardzo Google chce crawlować Twoje strony). Definicja pochodzi z oficjalnego wpisu Google z 2017 roku, zaktualizowanego w dokumentacji Google Developers. Dla małych stron (poniżej 10 000 URL) crawl budget zwykle nie jest problemem. Dla dużych serwisów e-commerce to kluczowy element technicznego SEO.

Jak sprawdzić crawl budget mojej strony?

W Google Search Console: Ustawienia → Statystyki indeksowania (Crawl Stats). Narzędzia zewnętrzne: Screaming Frog SEO Spider (crawl simulation + GSC integration), Semrush Log File Analyzer (parsowanie logów serwera), Ahrefs Site Audit (wykrywanie orphan pages i redirect chains).

Kiedy crawl budget jest problemem?

Gdy nowe strony nie pojawiają się w Google przez tygodnie, GSC pokazuje wzrost „Discovered – currently not indexed,” raport Crawl Stats wskazuje waste na parametrach URL. Dotyczy głównie serwisów z ponad 10 000 stron, faceted navigation i dynamicznym contentem. Jak pisze Semrush: „Semrush Site Audit pokaże, gdzie crawl budget jest marnowany i pomoże zoptymalizować stronę pod crawlowanie.”

Czy blokowanie stron w robots.txt oszczędza crawl budget?

Tak. Google precyzuje w dokumentacji: „Disallow zapobiega crawlowaniu, ale nie usuwa z indeksu. Do usunięcia potrzebujesz noindex – ale żeby Google zobaczył noindex, musi crawlować stronę. Nie łącz Disallow z noindex na tym samym URL.” Zablokowane URL-e „pozostaną w kolejce crawlu znacznie dłużej i będą recrawlowane po zdjęciu blokady.”

Jak crawl budget wpływa na widoczność w AI?

Boty AI (GPTBot, ClaudeBot, PerplexityBot) mają swój crawl budget, znacznie mniejszy niż Googlebot. Według Search Engine Land: „strony wymagające renderowania JavaScript zajmują botom AI 9x dłużej niż statyczny HTML – a boty AI w ogóle pomijają JS.” Optymalizacja: robots.txt dla botów AI, minimalizacja redirectów, treść w statycznym HTML.

Podobne wpisy

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Wymagane pola są oznaczone *