Preskočiť na obsah
2.15Expert10 min

robots.txt a AI: Právny rámec EÚ a TDM Opt-out

Lucas Blochberger··Updated 11. júna 2026
Definition

Hamburský súd rozhodol, že opt-outy v prirodzenom jazyku v obchodných podmienkach sú nedostatočné — opt-outy musia byť strojovo čitateľné.

Key Takeaways

  • OLG Hamburg rozhodol 10.12.2025 (Kneschke proti LAION, 5 U 104/24): TDM-opt-out je účinný len vtedy, ak je strojovo čitateľný; upozornenia v prirodzenom jazyku vo VOP sú právne nedostatočné.
  • Právnym základom je čl. 4 ods. 3 smernice EÚ DSM (2019/790), národne implementovaný v § 42h UrhG (Rakúsko) a § 44b UrhG (Nemecko): Komerčné TDM je povolené, opt-out je však online účinný len v strojovo čitateľnej forme.
  • EU AI Act (čl. 53, v platnosti od 2.8.2025) zaväzuje poskytovateľov GPAI rozpoznávať a dodržiavať autorské výhrady podľa čl. 4(3) smernice DSM prostredníctvom najmodernejších technológií; Code of Practice vyžaduje robots.txt podľa RFC 9309.
  • Strojovo čitateľné znamená robots.txt, HTML meta tagy/X-Robots-Tag hlavičky alebo W3C TDM Reservation Protocol (TDMRep); robots.txt riadi crawlovanie, TDMRep adresuje cielene autorskú výhradu.
  • robots.txt je len žiadosť, nie zábrana: Prípad Perplexity (Cloudflare, 4.8.2025) ukázal stealth crawlery s imitáciou prehliadača a rotáciou IP/ASN, ktoré ignorovali robots.txt. Skutočné presadenie vyžaduje WAF, Edge alebo Bot Management.
  • Training-opt-out a GEO-viditeľnosť sú oddelené: Google-Extended blokuje len trénovanie (Gemini/Vertex AI) bez vplyvu na Google vyhľadávanie alebo AI Overviews. Oddelené direktívy pre trénovacie a live crawlery riešia tento konflikt cieľov.
  • Odporúčaná je viacvrstvová stratégia zo strojovo čitateľnej výhrady (robots.txt + TDMRep), serverového blokovania a dokumentácie; doplnkové štandardy ako RSL 1.0 (10.12.2025) umožňujú licencovanie namiesto čistej blokády.

Prečo sú robots.txt a AI-crawler-management teraz právne relevantné

Dlho bol robots.txt čisto technickým nástrojom na riadenie crawlerov. S príchodom trénovacích dát pre AI sa z toho stala právna otázka. Hamburský vyšší krajinský súd rozhodol 10. decembra 2025 v konaní Kneschke proti LAION, že výhrada text-and-data-mining (TDM-opt-out) je účinná len vtedy, ak je strojovo čitateľná. Upozornenia v prirodzenom jazyku v podmienkach používania alebo disclaimeroch nestačia. Súd konštatoval, žedržitelia práv môžu blokovať TDM použitia, ale len ak je opt-out vyjadrený strojovo čitateľne, a že všeobecné podmienky používania alebo ľudsky čitateľné disclaimery sú nedostatočné (Nemecko, Hamburg). Je to prvé rozhodnutie vyššieho súdu v Nemecku k autorským výnimkám pri AI tréningu.

Pre B2B webové stránky v regióne DACH to posúva priority. Kto chce zabrániť tomu, aby jeho obsah bez povolenia skončil v AI trénovacích dátach, musí túto výhradu nastaviť technicky a strojovo čitateľne. Veta v impressume už nestačí. Súčasne merateľne rastie hlad AI crawlerov po dátach: Podľa Cloudflare pripadlov ročnom priemere 2025 približne 4,2 percenta všetkých HTML requestov na AI boty, zatiaľ čo samotný Googlebot tvoril 4,5 percenta (medzinárodne). robots.txt už teda nie je len otázkou crawl budgetu, ale presadzovania práva a dátovej suverenity.

Poznámka k dátovému základu: Právne kľúčové výpovede tohto článku sa vzťahujú na právo EÚ a DACH a sú ako také označené. Štatistiky crawlerov a adopcie pochádzajú prevažne z medzinárodných prieskumov (Cloudflare, HTTP Archive, Pew) a slúžia ako benchmark.

Právny základ: Čl. 4 smernice DSM a implementácia v AT a DE

Právnym základom TDM-opt-out je článok 4 smernice EÚ o autorskom práve na digitálnom jednotnom trhu (smernica DSM, 2019/790). Umožňuje text and data mining v zásade aj na komerčné účely, teda aj zber webového obsahu pre AI trénovanie. Rozhodujúci je čl. 4 ods. 3: Držitelia práv môžu toto použitie zakázať tým, že si práva výslovne vyhradia. Pri online dostupnom obsahu musí byť táto výhrada v strojovo čitateľnej forme. Práve táto polovica vety je jadrom celej debaty.

Implementácia do národného práva je dokončená. V Rakúsku upravuje § 42h zákona o autorskom práve (UrhG) text and data mining vrátane možnosti výhrady, v Nemecku je to § 44b UrhG. Obe normy implementujú požiadavku smernice DSM. Z toho vyplýva logika:

  • Základné pravidlo: Komerčné TDM je povolené. Bez účinnej výhrady môžu poskytovatelia AI používať verejne dostupný obsah na trénovanie.
  • Opt-out namiesto opt-in: Ochrana nie je automatická. Držitelia práv musia aktívne vyjadriť nesúhlas.
  • Formálna požiadavka online: Pri obsahu sprístupnenom na internete je výhrada účinná len vtedy, ak je strojovo čitateľná.

Pre rakúske podniky to konkrétne znamená: Ochrana podľa § 42h UrhG nevzniká sama od seba. Musí byť technicky spustená, a to tak, aby ju stroj mohol prečítať a vyhodnotiť.

Čo znamená strojovo čitateľné? Uznávané opt-out metódy

Pojem strojovo čitateľné nie je v zákone definitívne vymedzený. V praxi sa etablovalo niekoľko postupov, ktoré platia ako strojovo čitateľná výhrada. Dajú sa kombinovať na podporu právneho účinku.

  • robots.txt: Súbor v koreňovom adresári riadi prostredníctvom User-Agent direktív, ktoré crawlery môžu pristupovať ku ktorým cestám. Je to najznámejší a najrozšírenejší mechanizmus a väčšina poskytovateľov AI ho akceptuje ako opt-out signál.
  • HTML meta tagy a Robots direktívy: Tagy ako noindex, nosnippet alebo max-snippet na úrovni stránky riadia, ako môže byť obsah indexovaný a použitý v snippetoch alebo AI odpovediach.
  • HTTP hlavičky: Cez X-Robots-Tag hlavičku sa dajú tie isté direktívy nastaviť na strane servera, aj pre ne-HTML zdroje ako PDF alebo obrázky.
  • TDM Reservation Protocol (TDMRep): Štandard vyvinutý W3C, ktorý explicitne vyjadruje výhradu podľa čl. 4 smernice DSM, cez HTTP hlavičku, cez well-known súbor alebo cez HTML markup. TDMRep bol navrhnutý špeciálne pre právnu požiadavku čl. 4.

Dôležité je rozlíšenie medzi účelom a formou. robots.txt technicky riadi crawlovanie. TDMRep adresuje cielene autorskú výhradu. Kto chce pracovať právne isto, mal by nastaviť oboje, pretože OLG Hamburg výslovne vyžaduje strojovo čitateľnú formu, bez predpísania jediného formátu.

Rozhodnutie Kneschke-proti-LAION a jeho dôsledky pre región DACH

Prípad začal na krajinskom súde Hamburg 2024 a bol rozhodnutý v odvolaní pred OLG Hamburg (spisová značka 5 U 104/24) 10. decembra 2025. Fotograf Robert Kneschke sa bránil proti tomu, aby jeden z jeho obrázkov skončil v trénovacom datasete organizácie LAION. Jeho opt-out bol formulovaný v podmienkach používania obrazovej platformy, teda v prirodzenom jazyku.

OLG Hamburg považoval túto výhradu za neúčinnú. Odôvodnenie: Nebola strojovo čitateľná. Tým bola výnimka podľa čl. 4 smernice DSM v prospech LAION použiteľná. Súd konštatoval, žeKneschkeho TDM-opt-out bol neúčinný, pretože nebol vyjadrený strojovo čitateľne (Nemecko, Hamburg).

Dôsledky pre región DACH sú značné:

  • Strojová čitateľnosť je povinná: Kto chce účinnú výhradu, nemôže sa spoliehať na VOP alebo disclaimer. Opt-out musí byť technicky zakotvený.
  • Prvá smernica vyššieho súdu: Keďže ide o prvé rozhodnutie na úrovni odvolania v Nemecku, má signálny účinok pre celý región, aj keď rakúske súdy formálne nie sú viazané.
  • Tlak na konanie pre držiteľov práv: Kto doteraz vyjadril nesúhlas len v prirodzenom jazyku, fakticky nemá účinnú ochranu a mal by technicky doplniť.

Protiklad z USA ukazuje odlišnú právnu situáciu. V Ziff Davis proti OpenAI americké konanie prirovnalo robots.txt k značke zákaz vstupu bez vlastnej právnej vynútiteľnosti. Na rozdiel od EÚ v americkom práve neexistuje TDM-opt-out podľa čl. 4. Strojovo čitateľné výhrady tam nemajú rovnaký autorský účinok ako v regióne DACH.

EU AI Act čl. 53: Copyright povinnosť poskytovateľov AI

Druhým nosným pilierom popri smernici DSM je EU AI Act. Zaväzuje poskytovateľov AI modelov všeobecného použitia (General-Purpose AI, GPAI) rešpektovať autorské výhrady. Podľa čl. 53 ods. 1 musia poskytovatelia GPAIzaviesť politiku dodržiavania autorského práva Únie a najmä, aj prostredníctvom najmodernejších technológií, identifikovať a dodržiavať výhradu práv vyjadrenú podľa čl. 4 ods. 3 smernice 2019/790 (EÚ). Táto povinnosť nadobudla účinnosť 2. augusta 2025.

To spája oba právne akty do systému. Smernica DSM dáva držiteľovi práv nástroj strojovo čitateľnej výhrady do rúk. AI Act zaväzuje poskytovateľov AI tieto výhrady aktívne rozpoznávať a dodržiavať. V praxi formulácia prostredníctvom najmodernejších technológií znamená, že poskytovatelia musia vyhodnocovať práve tie strojovo čitateľné signály, ktoré prevádzkovateľ webovej stránky nastaví: robots.txt, TDMRep a porovnateľné štandardy.

Doplnkovo sprievodný kódex správania pre GPAI (Code of Practice) vyžaduje, aby poskytovatelia dodržiavali robots.txt podľa oficiálneho štandardu RFC 9309 (Robots Exclusion Protocol). Pre prevádzkovateľov webových stránok je to rozhodujúci most: Správne nastavený robots.txt záznam nie je len technické želanie, ale signál, ktorý musia poskytovatelia AI povinní dodržiavať compliance podľa práva EÚ.

Praktická konfigurácia robots.txt pre AI crawlery

Účinné riadenie začína poznaním relevantných User-Agentov. Každý väčší poskytovateľ AI prevádzkuje vlastné crawlery, často s oddelenými botmi pre trénovanie a pre real-time prístupy. Rozšírenie opt-outov stúpa: Podľa Web Almanac 2024 sa v desktop robots.txt súboroch nachádzaliGPTBot v 2,9 percenta, CCBot v 2,7 percenta, Google-Extended v 2,5 percenta a Anthropic-ai v 2,1 percenta (medzinárodne). Tieto podiely boli v roku 2024 ešte mladé a odvtedy rastú.

Najdôležitejšie User-Agenty a ich funkcia:

  • GPTBot: Crawler OpenAI pre trénovanie. Blokovanie zabraňuje zaradeniu do budúcich trénovacích dát.
  • ChatGPT-User: Používa sa pre real-time prístupy, keď používateľ ChatGPT aktívne pristupuje na stránku. Blokovanie sa týka live viditeľnosti, nie tréningu.
  • ClaudeBot: Trénovací crawler Anthropic. Anthropic-ai je staršia príslušná identifikácia.
  • Google-Extended: Nie vlastný crawler, ale robots.txt token, ktorý riadi trénovanie Gemini a Vertex AI modelov.
  • CCBot: Crawler Common Crawl, ktorého otvorené datasety používa mnoho AI modelov ako trénovací zdroj.
  • PerplexityBot: Crawler Perplexity pre jeho AI vyhľadávací index.

Typická blokovacia stratégia pre trénovacie crawlery vyzerá takto:

```
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /
```

Obraz v praxi je diferencovaný. Podľa Cloudflare pripadlo v roku 2025väčšina úplných Disallow direktív na AI crawlery ako GPTBot, ClaudeBot a CCBot, zatiaľ čo Googlebot a Bingbot boli prevažne len čiastočne blokované (medzinárodne). Prevádzkovatelia teda cielene blokujú čisté AI trénovacie boty, ale klasické vyhľadávacie crawlery nechávajú prejsť, aby nestratili organickú viditeľnosť.

Hranice robots.txt: dobrovoľná compliance a stealth crawlery

robots.txt má základnú slabinu: Dodržiavanie je dobrovoľné. Súbor je žiadosť, nie technická zábrana. Seriózni poskytovatelia sa ho držia a v regióne EÚ sú k tomu podľa AI Act povinní. Ale súbor môže byť technicky ignorovaný.

Prípad Perplexity to jasne ukázal. Cloudflare dokumentoval 4. augusta 2025, že Perplexitynasadzoval nedeklarované stealth crawlery, ktoré používali generický prehliadač na imitáciu Google Chrome na macOS, keď bol deklarovaný crawler blokovaný, a pritom ignorovali robots.txt alebo ho ani nenačítali (medzinárodne). Boty pritom používali IP adresy mimo oficiálneho rozsahu a rotovali cez rôzne ASN, aby obišli blokády. Cloudflare následne Perplexity odobral status Verified Bot a blokoval stealth crawlery cez vlastné heuristiky.

Z toho vyplývajú jasné hranice:

  • Žiadne technické presadenie: robots.txt nezabraňuje prístupu, len signalizuje želanie.
  • Nedeklarované boty: Crawlery, ktoré sa vydávajú za normálny prehliadač, sa nedajú spoľahlivo zastaviť pravidlom User-Agent.
  • IP a ASN rotácia: Kto pristupuje cez meniacé sa adresné rozsahy, obchádza jednoduché IP blokády.

Pre právne hodnotenie zostáva výhrada napriek tomu dôležitá. Aj keď ju crawler technicky ignoruje, strojovo čitateľný opt-out dokumentuje, že držiteľ práv vyjadril nesúhlas. To je predpoklad, aby sa vôbec mohol odvolávať na čl. 4 ods. 3 smernice DSM.

Doplnkové štandardy: ai.txt, llms.txt a Really Simple Licensing

Popri robots.txt vzniklo niekoľko doplnkových štandardov. Sledujú rôzne ciele, od čistej blokády až po licencovanie.

Rozhodujúci koncepčný rozdiel je medzi blokovaním a licencovaním. robots.txt a ai.txt hovoria len áno alebo nie crawlovaniu. RSL ide ďalej: Umožňuje sprístupniť obsah za podmienok alebo odplaty. Tým vzniká stredná cesta medzi úplnou blokádou a bezplatným sprístupnením, ktorá môže byť zaujímavá pre komerčných poskytovateľov obsahu v B2B oblasti.

Konflikt cieľov: AI-training-opt-out proti GEO-viditeľnosti

Centrálna strategická otázka je často nepochopená. Blokovanie trénovacích crawlerov a nájditeľnosť v AI odpovediach sú dve rôzne veci. Kto blokuje GPTBot alebo Google-Extended, zabraňuje zaradeniu do trénovacích dát. To však nutne neovplyvňuje, či sa obsah objaví v AI výsledkoch vyhľadávania alebo prehľadoch.

Google-Extended to dobre ilustruje. Je torobots.txt token na opt-out z AI tréningu Gemini a Vertex AI, ktorý však neovplyvňuje zaradenie do Google vyhľadávania a nie je ranking signál (medzinárodne). Riadi trénovanie, nie objavenie sa v AI Overviews. Kto blokuje Google-Extended, zostáva teda viditeľný v normálnom vyhľadávaní a v AI Overviews, ale neposkytuje trénovacie dáta.

Viditeľnosť v AI odpovediach je zároveň ekonomicky relevantný faktor, pretože AI prehľady odvádzajú kliky. Podľa medzinárodného vyhodnotenia Pew klikli používateliapri vyhľadávaní s AI prehľadom v 8 percentách prípadov na klasický výsledok, oproti 15 percentám bez AI prehľadu, a len 1 percento kliklo na odkaz v rámci AI prehľadu (medzinárodne, USA, marec 2025). Miera klikov sa teda takmer prepolí. V tomto prostredí môže byť pre B2B poskytovateľov zmysluplné byť citovaný v AI odpovediach, aby zostali vôbec viditeľní, zatiaľ čo vlastný materiál je zároveň chránený pred nekontrolovaným tréningom. Práve toto oddelenie umožňujú samostatné direktívy pre trénovacie a live crawlery.

Technické presadenie nad rámec robots.txt

Pretože robots.txt je len žiadosť, potrebuje seriózna stratégia druhú úroveň: serverové presadenie. Tu nastupuje Edge, CDN a Bot Management.

  • WAF a Edge blokovanie: Web Application Firewall alebo Edge pravidlo môže blokovať požiadavky podľa User-Agent, IP rozsahu alebo vzorca správania skôr, ako dosiahnu pôvodný server. To funguje aj proti crawlerom, ktoré ignorujú robots.txt.
  • Bot Management: Rozpoznávanie založené na správaní identifikuje automatizované prístupy na základe signálov ako frekvencia požiadaviek alebo chýbajúce znaky prehliadača, nie len podľa deklarovaného User-Agent.
  • Cloudflare AI-crawler kontroly: Cloudflare ponúka dedikované prepínače na centrálne blokovanie známych AI crawlerov a v prípade Perplexity reagoval vlastnými heuristikami proti stealth crawlovaniu.
  • Pay-per-crawl prístupy: Novšie modely umožňujú povoliť AI crawlerom prístup len za platbu. To spája technickú zábrana s licenčnou myšlienkou, podobne ako logika RSL.

Táto úroveň je jediná so skutočným technickým účinkom. Nenahrádza právnu výhradu, ale dopĺňa ju. Až kombinácia z dokumentovaného opt-out a skutočnej blokády pokrýva právnu aj praktickú stránku.

Časté chyby pri AI-crawler-managemente

  • Opt-out len vo VOP: Najčastejšia a podľa OLG Hamburg najzávažnejšia chyba. Upozornenie v prirodzenom jazyku je právne neúčinné, pretože nie je strojovo čitateľné.
  • Chápať robots.txt ako zábrana: Súbor nezabraňuje prístupu. Kto verí, že tým je ochrana technicky zaručená, mýli sa.
  • Miešať trénovanie a live prístup: Kto paušálne blokuje všetky AI boty, prípadne stráca GEO viditeľnosť, bez toho aby to chcel. Trénovacie a real-time crawlery potrebujú oddelené pravidlá.
  • Zastarané zoznamy User-Agent: Poskytovatelia AI zavádzajú nové crawlery a menia identifikátory. Raz napísaný robots.txt rýchlo zastaráva.
  • Žiadna serverová záloha: Spoliehať sa len na robots.txt nechá stealth crawlery a nedeklarované boty prejsť bez prekážky.
  • Chýbajúca dokumentácia: Bez dôkazu, kedy bola nastavená ktorá výhrada, sa v spore ťažko preukazuje, že bol aktívne vyjadrený nesúhlas.

Metriky a meranie: Zviditeľniť prístupy crawlerov

AI-crawler-management sa dá merať, aj keď neexistuje jediná hodnota úspechu. Zmysluplné ukazovatele a kontrolné body:

  • Podiel AI botov na trafficu: Vyhodnoťte server alebo CDN logy podľa AI User-Agentov. Ako benchmark platí Cloudflare nameranýpriemer približne 4,2 percenta HTML requestov v roku 2025.
  • Účinnosť blokovania: Skontrolujte, či blokované crawlery skutočne už nemajú úspešné prístupy. Pretrvávajúce prístupy napriek Disallow naznačujú nekonformné alebo stealth boty.
  • Detekcia anomálií: Všímajte si netypické vzory ako browser User-Agenty so serverovým správaním alebo prístupy z rotujúcich ASN.
  • Úplnosť výhrady: Pravidelne kontrolujte, či sú robots.txt, TDMRep signál a prípadne RSL konzistentné a aktuálne.
  • GEO viditeľnosť: Sledujte, či a ako je váš obsah citovaný v AI odpovediach a AI Overviews, aby ste riadili konflikt cieľov medzi ochranou a nájditeľnosťou.

Na začiatok stačí vyhodnotenie vlastných logov v kombinácii s bot reportmi používaného CDN. Dôležité je pravidelné opakovanie, pretože sa rýchlo mení tak krajina crawlerov, ako aj právne požiadavky.

Odporúčanie na konanie a ďalšie informácie

Pre B2B webové stránky, najmä na Next.js a Edge architektúrach, sa odporúča viacvrstvová stratégia. Pokrýva právnu aj technickú úroveň súčasne.

  • Strojovo čitateľná výhrada: Nastavte TDM výhradu podľa čl. 4 ods. 3 smernice DSM v strojovo čitateľnej forme. robots.txt s cieleným Disallow direktívami pre trénovacie crawlery tvorí základ, doplnený o TDMRep signál cez HTTP hlavičku alebo markup.
  • Oddelená crawler logika: Oddeľte trénovacie boty ako GPTBot, ClaudeBot, CCBot a Google-Extended od live a vyhľadávacích crawlerov, aby ochrana tréningu nepoškodila GEO viditeľnosť.
  • Serverové blokovanie: Doplňte výhradu o skutočné presadenie cez WAF, Edge alebo Bot Management vášho CDN, aby ste zachytili stealth crawlery a nedeklarované boty.
  • Dokumentácia: Zaznamenajte, kedy bola nastavená ktorá výhrada. V spore je dokumentovaný, strojovo čitateľný opt-out základom na odvolanie sa na čl. 4.

Právna situácia je ešte mladá a vyvíja sa. OLG Hamburg vytyčil prvú líniu, AI Act zaviedol povinnosti poskytovateľov od augusta 2025 záväzne a nové štandardy ako RSL vznikajú rýchlo. Kto koná dnes, mal by implementovať viacvrstvovú stratégiu a sledovať vývoj. Súvisiace témy sú technická konfigurácia robots.txt, štruktúrované dáta a Schema, GDPR-konformné spracovanie dát, ako aj GEO a viditeľnosť v AI odpovediach.

Údaje a štatistiky

OLG Hamburg (5 U 104/24, Urteil vom 10.12.2025): Ein natürlichsprachlicher TDM-Opt-out (in Nutzungsbedingungen/Disclaimer) ist nach Art. 4 Abs. 3 DSM-Richtlinie unzureichend; der Opt-out muss maschinenlesbar sein; Kneschkes Opt-out war unwirksam, weil nicht maschinenlesbar

Norton Rose Fulbright (Inside Tech Law) [Deutschland/Hamburg] (2025)

Art. 53(1)(c) AI Act: GPAI-Anbieter müssen eine Copyright-Policy einführen, die den Rechtevorbehalt nach Art. 4(3) DSM-Richtlinie identifiziert und einhält, auch mittels modernster Technologien; in Kraft seit 2. August 2025 (Art. 113(b))

EU Artificial Intelligence Act (artificialintelligenceact.eu), Volltext Artikel 53 [EU] (2025)

8 Prozent Klickrate auf ein Suchergebnis mit KI-Übersicht gegenüber 15 Prozent ohne (fast halbiert); 1 Prozent klickte auf einen Link innerhalb der KI-Übersicht; Basis: 68.879 Google-Suchen, 900 US-Erwachsene, März 2025

Pew Research Center [international, USA] (2025)

Perplexity nutzte undeklarierte Stealth-Crawler (Chrome/macOS-Imitation, IP-/ASN-Rotation), die robots.txt ignorierten oder teils nicht abriefen; Cloudflare entzog den Verified-Bot-Status und blockierte die Bots (4. August 2025)

Cloudflare Blog [international] (2025)

KI-Bots = 4,2 Prozent aller HTML-Requests (Jahresdurchschnitt 2025); Googlebot = 4,5 Prozent; GPTBot/ClaudeBot/CCBot hatten die meisten vollständigen Disallow-Direktiven in robots.txt; Googlebot/Bingbot überwiegend nur partiell gesperrt

Cloudflare Blog - Radar 2025 Year in Review [international] (2025)

Desktop-robots.txt-Nutzung der KI-Crawler: GPTBot 2,9 Prozent, CCBot 2,7 Prozent, Google-Extended 2,5 Prozent, Anthropic-ai 2,1 Prozent

Web Almanac 2024 (HTTP Archive), SEO-Kapitel [international] (2024)

RSL 1.0 am 10.12.2025 als offizielle Industriestandard-Spezifikation veröffentlicht; Nutzungskategorien ai-all / ai-input / ai-index ergänzen robots.txt; contribution-Zahlungsmodell enthalten; Unterstützer u. a. Yahoo, Ziff Davis, O'Reilly Media

RSL Standard - offizielle Pressemitteilung: Really Simple Licensing (RSL) 1.0 Specification [international] (2025)

Google-Extended: robots.txt-Token zum KI-Training-Opt-out (Gemini/Vertex AI), ohne Auswirkung auf die Aufnahme in die Google-Suche und kein Ranking-Signal

Search Engine Journal [international] (2026)

Často kladené otázky

Stačí opt-out vo VOP na zabránenie AI tréningu?
Nie. OLG Hamburg rozhodol 10. decembra 2025 (Kneschke proti LAION), že TDM-opt-out je účinný len vtedy, ak je strojovo čitateľný. Upozornenia v prirodzenom jazyku v podmienkach používania alebo disclaimeroch sú právne nedostatočné. Výhrada musí byť technicky zakotvená, napríklad cez robots.txt, X-Robots-Tag HTTP hlavičku alebo TDM Reservation Protocol.
Čo znamená strojovo čitateľné pri TDM-opt-out?
Strojovo čitateľné znamená, že výhrada je vo formáte, ktorý môže crawler automaticky načítať a vyhodnotiť. Uznávané metódy sú robots.txt, HTML meta tagy ako noindex alebo nosnippet, X-Robots-Tag HTTP hlavička a W3C TDM Reservation Protocol (TDMRep). Zákon nepredpisuje jediný formát, ale vyžaduje strojovo spracovateľnú formu.
Ktoré robots.txt záznamy blokujú AI crawlery?
Najdôležitejšie trénovacie crawlery sú GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl) a token Google-Extended (Gemini/Vertex AI). Záznam ako 'User-agent: GPTBot' nasledovaný 'Disallow: /' signalizuje opt-out. Pre real-time prístupy existujú samostatné identifikátory ako ChatGPT-User a PerplexityBot. Trénovacie a live crawlery by mali byť ošetrené oddelene.
Musia poskytovatelia AI dodržiavať robots.txt podľa práva EÚ?
Podľa EU AI Act áno. Čl. 53(1)(c) zaväzuje poskytovateľov AI modelov všeobecného použitia od 2. augusta 2025 rozpoznávať a dodržiavať autorské výhrady podľa čl. 4 ods. 3 smernice DSM prostredníctvom najmodernejších technológií. Sprievodný Code of Practice navyše vyžaduje dodržiavanie robots.txt podľa štandardu RFC 9309.
Zabraňuje robots.txt technicky prístupu AI crawlerov?
Nie. robots.txt je žiadosť, nie technická zábrana, a dodržiavanie je dobrovoľné. Prípad Perplexity ukázal v roku 2025 (dokumentované Cloudflare), že nedeklarované stealth crawlery ignorujú robots.txt, vydávajú sa za normálny prehliadač a pristupujú cez rotujúce IP a ASN. Pre skutočné presadenie je potrebné serverové blokovanie cez WAF, Edge alebo Bot Management.
Aký je rozdiel medzi AI-training-opt-out a GEO-viditeľnosťou?
Oboje je odlišné. Blokovanie trénovacích crawlerov ako GPTBot alebo Google-Extended zabraňuje zaradeniu do trénovacích dát. Neovplyvňuje však nutne, či sa obsah objaví v AI výsledkoch vyhľadávania alebo AI Overviews. Google-Extended napríklad riadi len trénovanie Gemini a Vertex AI a nie je ranking signál; viditeľnosť v Google vyhľadávaní zostáva nedotknutá. Takto sa dá kombinovať ochrana s nájditeľnosťou.
Čo je Really Simple Licensing (RSL) a na čo sa používa?
RSL je otvorený štandard, ktorého verzia 1.0 bola publikovaná 10. decembra 2025. Dopĺňa robots.txt o kategórie použitia ako ai-all, ai-input a ai-index a zavádza možnosť contribution, ktorou môžu byť AI systémy zaviazané k peňažným alebo nepeňažným príspevkom. Na rozdiel od robots.txt, ktorý len blokuje alebo povoľuje, RSL umožňuje licencovanie obsahu za podmienok. Medzi podporovateľov patria Yahoo, Ziff Davis a O'Reilly Media.

Related Articles

Ako si stojí vaša stránka?

Získajte bezplatný SEO report vašej stránky e-mailom – technické SEO, on-page, kľúčové slová a konkurencia. Nezáväzne.

Vyžiadať bezplatný SEO audit