Preskočiť na obsah
2.8Expert8 min

AI Crawler Management: Kríza súladu a podniková stratégia

Lucas Blochberger··Updated 11. júna 2026
Definition

9. decembra 2025 OpenAI ticho odstránila ChatGPT-User z dokumentácie súladu s robots.txt. 12,9% AI bot požiadaviek teraz ignoruje robots.txt.

Key Takeaways

  • Používateľ ChatGPT ignoruje robots.txt od decembra 2025 (zmena dokumentácie OpenAI)
  • 12,9% požiadaviek AI-botov ignoruje robots.txt (Q1 2025, z 3,3% v Q4 2024)
  • Perplexity: Cloudflare dokumentoval porušenia robots.txt a UA-spoofing
  • OpenAI Atlas-Browser používa štandardný Chrome-UA — nerozlíšiteľný od skutočného trafficu
  • GPTBot: +305% rast YoY, z #9 na #3 medzi všetkými crawlermi
  • Anthropic crawluje 25.000-100.000 stránok na odkazovaného návštevníka
  • Vrstvené vynucovanie: robots.txt + blokovanie servera + WAF potrebné

Kríza compliance robots.txt urobila z riadenia AI-crawlerov úlohu enterprise governance.

Kríza compliance

Dňa 9. decembra 2025 aktualizoval OpenAI svoju dokumentáciu crawlerov a odstránil ChatGPT-User z compliance robots.txt. Len OAI-SearchBot a GPTBot ešte rešpektujú robots.txt. ChatGPT-User bol reklasifikovaný ako "proxy pre prehliadanie používateľmi".

Porušenia Perplexity sú závažnejšie. Cloudflare zverejnil dňa 4. augusta 2025 detailný prieskum: Perplexity ignoroval robots.txt, falšoval User-Agentov (napodobňoval Chrome na macOS) a rotoval IP adresy cez nedeklarované ASN. Cloudflare odstránil PerplexityBot zo zoznamu verified botov.

OpenAI Atlas Browser používa štandardný Chrome-UA a nie je rozlíšiteľný od bežného browser traffic.

Enterprise stratégia

Vrstva 1 — robots.txt: Pre konforme boty (OAI-SearchBot, GPTBot, Bingbot).Vrstva 2 — Server-Blocking: nginx User-Agent matching pre enforcement.Vrstva 3 — WAF/CDN: Cloudflare AI Audit, rate-limiting pri 6-10 requests/minúte na AI-bot.Vrstva 4 — IP-verifikáciaproti zverejneným IP-rozsahom.

Asymetria crawl-to-referral

Pomery ukazujú fundamentálnu nerovnováhu: Anthropic crawluje 25.000-100.000 stránok na odkazovaného návštevníka. OpenAI 401:1 až 3.700:1. Perplexity 88:1 až 200:1. Google 3:1 až 30:1. DuckDuckGo v skutočnosti posiela viac traffic ako crawluje.

Údaje a štatistiky

Ueber die letzten 12 Monate entfielen 80 Prozent des AI-Crawlings auf Training, 18 Prozent auf Suche und 2 Prozent auf Nutzeraktionen

Cloudflare Blog - The crawl-to-click gap (2025)

Crawl-to-Refer-Verhaeltnis Juli 2025: Anthropic 38.066:1, OpenAI 1.091:1, Google 5,4:1

Cloudflare Blog - The crawl-to-click gap (2025)

Perplexity nutzte einen generischen Chrome-imitierenden User-Agent bei Blockade; ueber Zehntausende Domains und Millionen Requests pro Tag beobachtet; von Cloudflare als Verified Bot delistet

Cloudflare Blog - Perplexity stealth crawlers (2025)

Knapp 21 Prozent der Top-1000-Websites fuehren Regeln fuer GPTBot in robots.txt (HTTP Archive, Juli 2025)

Paul Calvano / HTTP Archive (2025)

Seit Januar 2024 plus 50 Prozent Multimedia-Bandbreite; Bots ~35 Prozent der Pageviews, aber mindestens 65 Prozent des ressourcenintensiven Traffics

Wikimedia Diff (2025)

GEO kann die Sichtbarkeit in generativen Antworten um bis zu 40 Prozent steigern

arXiv (KDD 2024) - GEO: Generative Engine Optimization (2024)

In Deutschland beschaeftigen sich 57 Prozent der Unternehmen mit KI, 20 Prozent nutzen sie aktiv

Bitkom e. V. (2024)

2,42 Milliarden aktive Nutzer generativer KI weltweit, plus 141 Prozent gegenueber dem Vorjahr (April 2026)

DataReportal Digital 2026 Mid-Year Global Update (2026)

Často kladené otázky

Čo je AI-Crawler-Management?
AI-Crawler-Management je technické a právne riadenie prístupu AI-crawlerov na webovú stránku. Rozlišuje medzi tréningovými botmi (napr. GPTBot, ClaudeBot), vyhľadávacími botmi (napr. OAI-SearchBot, PerplexityBot) a User-Action-Botmi (napr. ChatGPT-User) a rozhoduje pre každý typ bota, či bude prístup povolený, obmedzený, zablokovaný alebo monetizovaný.
Stačí robots.txt na zablokovanie AI-crawlerov?
Nie. robots.txt je dobrovoľný protokol bez technického vynútenia. Kooperatívne boty sa ho držia, iné nie. Prípad Perplexity dokumentovaný spoločnosťou Cloudflare ukazuje, že crawlery pri blokovaní môžu prejsť na maskovaný User-Agent imitujúci Chrome. Spoľahlivejšia ochrana vyžaduje dodatočne Edge/CDN-Blocking a WAF pravidlá s User-Agent a ASN verifikáciou.
Mám AI-crawlery blokovať alebo povoliť pre väčšiu viditeľnosť?
To závisí od typu bota. Vyhľadávacie boty by mali byť väčšinou povolené, pretože umožňujú citovateľnosť v AI odpovediach; cielená Generative Engine Optimization môže zvýšiť viditeľnosť až o 40 percent. Tréningové boty väčšinou neprinášajú žiadnu referenčnú návštevnosť a môžu byť v závislosti od potreby ochrany obsahu zablokované alebo monetizované prostredníctvom Pay-per-Crawl.
Ako sa líšia tréningové boty, vyhľadávacie boty a User-Action-Boty?
Tréningové boty ako GPTBot alebo ClaudeBot zbierajú obsah pre tréning modelov a spravidla neprinášajú žiadnych návštevníkov. Vyhľadávacie boty ako OAI-SearchBot a PerplexityBot indexujú pre AI odpoveďové systémy a sú GEO-relevantné. User-Action-Boty ako ChatGPT-User načítajú stránku, pretože ju používateľ konkrétne požadoval v prompte, a sú najbližšie ku klasickému kliku.
Ako právne ochránim svoj obsah pred AI tréningom v regióne DACH?
Prostredníctvom strojovo čitateľnej výhrady využitia pre Text-und-Data-Mining podľa paragrafu 42h rakúskeho UrhG resp. paragrafu 44b nemeckého UrhG, deklarovanej napríklad v robots.txt, llms.txt alebo v podmienkach používania. Výhrada musí byť jasná, nájditeľná a strojovo čitateľná. Doplnkovo vytvárajú podmienky používania zmluvný základ proti nekompenzovanému komerčnému trénovaniu.
Koľko záťaže AI-crawlery skutočne spôsobujú?
Neúmerne veľa. Wikimedia Foundation uvádza, že boty tvoria približne 35 percent zobrazení stránok, ale spôsobujú najmenej 65 percent náročnej prevádzky na zdroje, pretože masovo načítavajú aj zriedka navštevované stránky a obchádzajú cache. Multimediálna šírka pásma vzrástla od januára 2024 o 50 percent.
Ako implementujem AI-Crawler-Management v Next.js?
Prostredníctvom troch vzájomne zladených bodov z jedného konfiguračného zdroja: dynamicky generovaná robots-Route pre bot direktívy, Middleware na kontrolu prichádzajúcich requestov voči Verified-Bot zoznamom a ASN rozsahom, ako aj CDN-Header pre caching a Edge-Blocking. Tak zostanú robots.txt, Middleware a Edge pravidlá konzistentné a revízne bezpečné.

Related Articles

Ako si stojí vaša stránka?

Získajte bezplatný SEO report vašej stránky e-mailom – technické SEO, on-page, kľúčové slová a konkurencia. Nezáväzne.

Vyžiadať bezplatný SEO audit