Preskočiť na obsah
2.7Expert9 min

Crawl Budget 2026: Multi-Bot Governance pre AI Crawlery

Lucas Blochberger··Updated 11. júna 2026
Definition

Crawl budget sa v roku 2026 stal multi-stakeholder problémom. ChatGPT-User robí 3,6x viac požiadaviek ako Googlebot.

Key Takeaways

  • Používateľ ChatGPT realizuje 3,6x viac požiadaviek ako Googlebot
  • 133.000+ požiadaviek na stránku za 55 dní (používateľ ChatGPT)
  • Požiadavky AI-Crawlera majú iba 11ms priemernú dobu odozvy
  • AI-Crawler pristupujú k obsahu Long-Tail — 70-100% pomer Unique-Access
  • To narúša CDN-Edge-Cache, ktorý potrebuje ľudský traffic
  • 1 návšteva AI-Bota na 31 ľudských návštev (Q4 2025)
  • Analýza Log-súborov je nevyhnutná — GA4 je slepá na AI-Crawler

Časy, kedy bolo treba riadiť iba crawler-vzťah s Googlom, sú preč.

Problém objemu

Štúdia Alli-AI (január-marec 2026, 24,4 milióna proxy-požiadaviek na 69 weboch) zistila, že používatelia ChatGPT vytvárajú 3,6-krát viac požiadaviek ako Googlebot — 133 000+ požiadaviek na stránku za 55 dní. Do Q4 2025 bola 1 návšteva AI-bota na 31 ľudských návštev (v porovnaní s 1:200 v Q1 2025).

Problém cacheovania

Príspevok Cloudflare/ETH-Zürich (ACM Symposium on Cloud Computing 2025) ukazuje, že AI-crawlery zásadne narúšajú CDN-cacheovanie. Pristupujú k long-tail-obsahu, ktorý ľudia zriedka navštevujú a udržiavajú 70-100 percent unique-access-ratio na RAG-retrieval-loop. To vytláča edge-cache a nútia operátorov na výber: optimalizácia pre AI alebo pre ľudských návštevníkov.

Monitorovanie

GA4 je úplne zaslepená voči AI-crawlerom. Analýza log-súborov je nevyhnutná. Podnikové nástroje: Botify LogAnalyzer, Semrush Enterprise Bot Analytics (30+ bot-pokrytie), JetOctopus. Pre strednú triedu: Screaming Frog Log Analyzer.

Údaje a štatistiky

Google definiert Crawl Budget aus Crawl Capacity Limit und Crawl Demand; der Leitfaden richtet sich an Websites mit ueber 1 Mio. einzigartigen Seiten (woechentliche Aenderung) bzw. ueber 10.000 (taegliche Aenderung).

Google Search Central - Large Site Owner's Guide to Managing Crawl Budget (2024)

Innerhalb der reinen KI-Crawler stieg GPTBot von Mai 2024 bis Mai 2025 von 5 auf 30 Prozent Anteil (+305 % Requests); Bytespider fiel von 42 auf 7,2 Prozent.

Cloudflare Blog - From Googlebot to GPTBot: who's crawling your site in 2025 (2025)

KI-Bots machten 2025 im Jahresdurchschnitt 4,2 Prozent aller HTML-Requests aus, der Googlebot 4,5 Prozent (knapp groesser als alle KI-Bots zusammen); Menschen 47 %, nicht-KI-Bots 44 % (Jahresende).

Cloudflare Blog - The 2025 Cloudflare Radar Year in Review (2025)

Nutzergetriebenes KI-Crawling (AI 'user action' crawling, z. B. ChatGPT-User) wuchs 2025 um mehr als das 15-Fache.

Cloudflare Blog - The 2025 Cloudflare Radar Year in Review (2025)

Crawl-to-Refer Juli 2025: Anthropic rund 38.065 gecrawlte Seiten pro vermitteltem Besucher, OpenAI rund 1.091, Google 5,4; rund 80 % des KI-Crawlings dienen dem Training, 18 % der Suche, 2 % Nutzeraktionen.

Cloudflare Blog - The crawl-to-click gap: Cloudflare data on AI bots, training, and referrals (2025)

AI-Crawler in robots.txt (Desktop 2025): GPTBot 4,5 %, ClaudeBot 3,6 %, CCBot 3,5 %, Google-Extended 3,4 %; der Catch-all-User-Agent (*) erschien in 77 % der Dateien.

Web Almanac 2025 (HTTP Archive) - SEO Chapter (2025)

Nur 2,13 Prozent der Desktop-Websites stellen 2025 eine gueltige llms.txt bereit; 39,6 Prozent dieser Dateien sind dem All-in-One-SEO-Plugin zuzuordnen.

Web Almanac 2025 (HTTP Archive) - SEO Chapter (2025)

In einer Fallstudie waren 97 Prozent von rund 1 Mio. gecrawlten Seiten nicht-kanonisch (nur ~25.000 indexierbar); branchenweit werden bei unoptimierten Websites nur 40 Prozent der strategischen URLs pro Monat gecrawlt.

Botify - All About Crawl Budget Optimization (2020)

Ueber IndexNow werden mehr als 3,5 Milliarden URLs pro Tag eingereicht; 18 Prozent aller neu in den Web-Suchergebnissen geklickten URLs stammen daraus (Dezember 2024).

Bing Webmaster Blog - IndexNow Expands Adoption Across Industries (2024)

Suchmaschinen-Marktanteil in Oesterreich (Mai 2026): Google 81,87 Prozent, Bing 9,01 Prozent, DuckDuckGo 2,75 Prozent.

StatCounter Global Stats - Search Engine Market Share Austria (2026)

Často kladené otázky

Čo je Crawl Budget jednoducho vysvetlené?
Crawl Budget je množstvo URL adries, ktoré môže a chce vyhľadávač na webovej stránke prechádzať. Google ho určuje z dvoch faktorov: Crawl Capacity Limit, teda koľko záťaže server zvládne, a Crawl Demand, teda ako silná je potreba prechádzať stránku kvôli jej popularite a aktuálnosti. V roku 2026 pribúda, že okrem Googlebotu mnohé AI crawlery zaťažujú serverové zdroje, čím sa Crawl Budget stalo témou riadenia viacerých botov.
Od akého počtu stránok je Crawl Budget relevantný?
Z pohľadu čisto Googlebotu sa Googlova príručka pre Crawl Budget zameriava na veľké webové stránky s viac ako 1 miliónom jedinečných stránok s týždenne sa meniacim obsahom, ako aj na stredné až väčšie webové stránky s viac ako 10 000 jedinečnými stránkami s veľmi často, napríklad denne, sa meniacim obsahom. Pre typickú DACH B2B webovú stránku s niekoľkými stovkami stránok je Crawl Budget z pohľadu Googlu zriedka úzkym miestom. Akonáhle však fazetová navigácia alebo parametrické URL adresy nafúknu množstvo URL adries alebo pristupuje množstvo AI crawlerov, stáva sa riadenie zmysluplným aj pre menšie webové stránky.
Ako riadim AI crawlery ako GPTBot a ClaudeBot?
Prvou pákou je robots.txt, v ktorej sa dajú jednotlivé AI crawlery cieleně povoliť alebo zablokovať podľa User Agenta. Medzinárodne sa GPTBot (4,5 %), ClaudeBot (3,6 %) a Google-Extended (3,4 %) už často adresujú. Zmysluplné je rozlíšenie podľa účelu: AI vyhľadávacie crawlery s referral potenciálom povoliť, AI tréningové crawlery vedome zvážiť. Keďže robots.txt je len žiadosť, tvrdé limity sa navyše presadzujú na úrovni Edge alebo CDN, napríklad prostredníctvom Rate-Limiting a Bot-Verification.
Aký je rozdiel medzi tréningovým, vyhľadávacím a real-time crawlingom?
Tréningový crawling (napr. GPTBot, ClaudeBot, CCBot) zbiera dáta na trénovanie modelu a vytvára záťaž bez priameho referral trafficu; podľa medzinárodnej analýzy Cloudflare tvorí približne 80 percent aktivity AI botov. Vyhľadávací crawling (18 %) načítava obsah, aby ho citoval v AI odpovediach, a môže priniesť referral traffic. Používateľom riadený real-time crawling (2 %, napr. ChatGPT-User) navštívi stránku naživo ako reakciu na konkrétnu otázku používateľa. Kto chce znížiť náklady, najprv obmedzí tréningový crawling.
Prečo GA4 nestačí na analýzu AI crawlerov?
GA4 a iné JavaScript-based webové analýzy prakticky nezachytávajú AI crawlery, pretože tieto zvyčajne nevykonávajú JavaScript a nenastavujú cookies. Jediným spoľahlivým zdrojom dát je server log súbor. Ukazuje, ktorý bot kedy ktorú URL adresu s akým stavovým kódom načítal. Z toho sa dajú odvodiť frekvencia crawlovania na bota, hodnota Crawl-to-Refer a rozdelenie stavových kódov, centrálne riadiace veličiny Multi-Bot-Governance.
Podporuje Google IndexNow?
Nie. IndexNow podporujú Bing, Yandex a ďalšie vyhľadávače, nie však Google. Prostredníctvom protokolu sa podľa Bingu denne odošle viac ako 3,5 miliardy URL adries. Keďže Google v Rakúsku dominuje s 81,87 percentným podielom na trhu, je IndexNow tu zmysluplným doplnkom pre viditeľnosť v Bingu, nenahradí však čistú XML Sitemap a crawl stratégiu pre Google. Oba nástroje pôsobia komplementárne.
Ako ovplyvňuje clientside rendering Crawl Budget?
Clientside rendering (CSR) zaťažuje Crawl a Render Budget dvojnásobne, pretože vyhľadávač musí stránku nielen prechádzať, ale aj vykresliť, aby videl obsah. To spotrebúva dodatočné zdroje a oneskoruje indexáciu. AI crawlery, ktoré často vôbec nevykonávajú JavaScript, obsah potom vôbec nevidia. V Next.js architektúre sú statické (SSG) alebo server-side vykreslené (SSR) obsahy výrazne efektívnejšie, pretože každý crawler nájde kompletný obsah priamo v HTML.

Related Articles

Ako si stojí vaša stránka?

Získajte bezplatný SEO report vašej stránky e-mailom – technické SEO, on-page, kľúčové slová a konkurencia. Nezáväzne.

Vyžiadať bezplatný SEO audit