Crawl budget
Znane też jako: budżet indeksowania, budżet crawlera
Crawl budget to liczba adresów URL, jaką Googlebot zaindeksuje w Twojej domenie w danym czasie. Marnowanie budżetu (np. na filtry fasetowe) blokuje indeksację wartościowych stron.
Crawl budget - czym jest i jak działa?
Crawl budget jest krytyczny w e-commerce i dużych serwisach. Kanibalizują go: parametry sortowania, filtry fasetowe, warianty produktowe, duplikaty, thin content, redirect chains.
Kontrola: robots.txt (Disallow dla parametrów), rel=canonical, meta noindex dla stron małej wartości, sitemap.xml z tylko indeksowalnymi URL-ami, logi serwera do analizy zachowania Googlebota.
Dla stron do 10 tys. URL crawl budget zwykle nie jest problemem. Powyżej - staje się wąskim gardłem. Analiza logów pokazuje, ile procent wizyt Googlebota trafia na strony bezużyteczne (parametry, 404, redirects) - dobra optymalizacja odzyskuje 30-70% budżetu.
Crawl budget w praktyce - konkretne przykłady
- 1
E-commerce 200k produktów: 60% wizyt Googlebota szło na URL-e z parametrami sortowania. Po Disallow w robots.txt + canonical → 80% wizyt na produktach, indeksacja +40% w 8 tygodni.
- 2
Marketplace: 15 mln URL, z czego 12 mln to duplikaty wariantów. Konsolidacja przez canonical + noindex → deindeksacja 10 mln, ruch +65%.
- 3
Serwis newsowy: łańcuchy 4-5 redirectów po migracji. Wyprostowanie do jednego skoku → +25% freshness w indeksie.
Jak wdrożyć Crawl budget - checklista krok po kroku
- Analiza logów serwera (Screaming Frog Log Analyzer, Splunk) - podział wizyt Googlebota po typie URL.
- Robots.txt: Disallow dla parametrów sortowania, filtrów, koszyka, wewnętrznego wyszukiwania.
- Canonical na wariantach (kolor, rozmiar) wskazujący na master product.
- Noindex dla stron paginacji poza pierwszą, tagów o niskim ruchu, thin content.
- Sitemap.xml zawiera tylko strony indeksowalne, statusy 200, canonical self-referencing.
Najczęstsze błędy przy crawl budget
- Blokowanie CSS/JS w robots.txt - Google nie zrenderuje strony i obniży ocenę.
- Noindex + Disallow jednocześnie - Google nie zobaczy noindex i nie wyindeksuje strony.
- Ignorowanie łańcuchów redirectów - każdy skok kosztuje crawl budget.
O Crawl budget pisze Mateusz Iwanowski

Prowadzę projekty SEO i GEO dla firm z Polski i zagranicy - od lokalnych usług po SaaS B2B. Specjalizuję się w programmatic SEO, AI Search Optimization i twardych migracjach technicznych. Jeśli chcesz omówić Crawl budget w kontekście Twojej strony, zaproś mnie na 30-minutową bezpłatną konsultację.
Czytaj też
Indeksacja to proces dodania strony do indeksu wyszukiwarki. Bez indeksacji strona nie może pojawić się w wynikach - nawet jeśli jest technicznie doskonała.
Rel=canonical to tag w <head> wskazujący główny (kanoniczny) URL dla treści dostępnej pod wieloma adresami. Chroni przed duplikacją i skupia sygnały rankingowe na jednym URL-u.
Plik robots.txt w katalogu głównym domeny mówi crawlerom, których ścieżek nie powinny odwiedzać. Nie chroni jednak przed indeksacją - do tego służy meta noindex.
Potrzebujesz pomocy z tym tematem?
30 minut bezpłatnej konsultacji - konkretne rekomendacje na start.