---
title: "Boty AI kontra polski internet: robots.txt 1000 stron .pl"
description: "Sprawdziliśmy plik robots.txt 1000 największych stron .pl: co piąta blokuje boty AI, głównie treningowe jak GPTBot, rzadko wyszukiwarki AI. Jak to rozdzielić?"
canonical_url: "https://www.outofplace.space/pl/blog/boty-ai-polski-internet"
language: "pl"
last_updated: "2026-09-23"
alternates:
  en: "https://www.outofplace.space/blog/ai-crawlers-polish-web.md"
---

# Boty AI kontra polski internet: robots.txt 1000 stron .pl

> Sprawdziliśmy plik robots.txt 1000 największych stron .pl: co piąta blokuje boty AI, głównie treningowe jak GPTBot, rzadko wyszukiwarki AI. Jak to rozdzielić?

Opublikowano 2026-09-23 · Kategoria: Wyszukiwanie i AI · Tagi: boty AI, robots.txt, GPTBot, llms.txt, Polska

23 września 2026 nasz crawler [OutofplaceResearchBot](https://www.outofplace.space/pl/bot) przeczytał plik robots.txt tysiąca najpopularniejszych stron w domenie .pl, żebyśmy mogli sprawdzić, które boty AI wpuszczają. 20,5% z nich blokuje co najmniej jednego bota AI. Statystycznie to tyle samo, co w światowym top 1000, gdzie odsetek wynosi 22,7%.

Różnica leży w tym, _których_ botów to dotyczy. Polskie strony zamykają drzwi przed botami zbierającymi dane treningowe, a wyszukiwarki AI w większości wpuszczają. Bota wyszukiwarki AI blokuje tylko 5,4% z nich, przy 13,9% na świecie. Jeśli chcesz pojawiać się w odpowiedziach ChatGPT, Claude'a czy Perplexity, to właściwa kolejność. Tyle że czasem wychodzi przypadkiem: [stara lista skopiowana raz i nigdy nieaktualizowana](#listy-sie-starzeja).

- Co piąta strona z top 1000 .pl blokuje w robots.txt jakiegoś bota AI, tyle samo co w światowym top 1000.
- GPTBot jest najczęściej blokowanym botem w Polsce i na świecie: 15,1% i 15,4%.
- Polskie strony blokują trening, nie wyszukiwanie. Spośród stron blokujących GPTBota mniej niż jedna trzecia blokuje też OAI-SearchBota; na świecie ponad połowa.
- Liczy się wielkość: boty AI blokuje jedna trzecia stron z top 100 .pl i co szósta z miejsc 501–1000.
- Co siódma polska strona blokująca boty nie napisała tych reguł sama: używa [zarządzanego robots.txt od Cloudflare](#zarzadzany-robotstxt-od-cloudflare-i-content-signals). W próbie światowej nie znaleźliśmy ani jednej takiej.

## Boty AI: co to jest i jakie są rodzaje

„Bot AI” to trzy różne zadania i dostawcy dają dziś każdemu osobny user agent. To rozróżnienie decyduje o wszystkim, co dalej:

- **Boty treningowe** zbierają strony do trenowania modeli: [GPTBot](https://developers.openai.com/api/docs/bots) (OpenAI), [ClaudeBot](https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler) (Anthropic), [Google-Extended](https://developers.google.com/crawling/docs/crawlers-fetchers/google-common-crawlers?hl=pl), [Applebot-Extended](https://support.apple.com/pl-pl/119829), [CCBot](https://commoncrawl.org/ccbot) (Common Crawl), Bytespider (ByteDance), meta-externalagent (Meta), [Amazonbot](https://developer.amazon.com/amazonbot).
- **Boty wyszukiwarek AI** indeksują strony, żeby asystent mógł je znaleźć i zacytować: OAI-SearchBot, Claude-SearchBot, [PerplexityBot](https://docs.perplexity.ai/docs/resources/perplexity-crawlers), [DuckAssistBot](https://duckduckgo.com/duckduckgo-help-pages/results/duckassistbot).
- **Boty pobierające na prośbę użytkownika** otwierają stronę, bo ktoś poprosił o to asystenta: ChatGPT-User, Claude-User, Perplexity-User, meta-externalfetcher, [MistralAI-User](https://docs.mistral.ai/robots).

Blokada bota treningowego trzyma strony z dala od przyszłych modeli. Blokada bota wyszukiwarki albo bota pobierającego usuwa je z odpowiedzi i z linków w tych odpowiedziach.

Dwa z „botów” treningowych niczego nie pobierają. Google-Extended i Applebot-Extended to tylko tokeny: stronę ściąga [Googlebot](https://developers.google.com/search/docs/crawling-indexing/googlebot?hl=pl) albo Applebot, a token mówi Google'owi i Apple, czy wolno na niej trenować. Ich blokada zostawia stronę w wyszukiwarkach Google i Apple, a blokada Google-Extended nie wyłącza też [AI Overviews](https://developers.google.com/search/docs/appearance/ai-features?hl=pl): te słuchają reguł dla Googlebota. Drugi wyjątek to boty pobierające. OpenAI, Perplexity i Meta piszą, że ich boty mogą w ogóle nie stosować się do robots.txt, bo o stronę poprosił człowiek; Anthropic deklaruje, że Claude-User się stosuje.

## Polska blokuje tak często jak świat, ale nie te same boty

Licząc wszystkie boty AI, różnica między próbą .pl a światową wynosi 2,2 punktu procentowego, dobrze w granicach błędu. Po podziale według przeznaczenia obraz się zmienia. Boty treningowe są blokowane równie często. Boty wyszukiwarek AI i boty pobierające na prośbę użytkownika – w Polsce ponad dwa razy rzadziej.

**Polska blokuje trening tak często jak świat, wyszukiwarki AI dużo rzadziej** (Odsetek stron, których robots.txt blokuje stronę główną co najmniej jednemu botowi danego rodzaju · n = 1000 w każdej próbie · 23 września 2026)

| Pozycja | Top 1000 .pl | Globalny top 1000 |
| --- | --- | --- |
| Dowolny bot AI | 21% | 23% |
| Boty treningowe | 21% | 22% |
| Boty wyszukiwarek AI | 5,4% | 14% |
| Pobieranie na prośbę użytkownika | 5,3% | 13% |

Source: Badanie Outofplace; lista Tranco Y8YYG. Chart: https://www.outofplace.space/data/blog/ai-crawlers-polish-web/charts/pl/chart-polska-blokuje-trening-tak-czesto-jak-swiat-wyszukiwarki-ai-duzo.png Data: https://www.outofplace.space/data/blog/ai-bots-polish-web/2026-09-23/domains.csv

### GPTBot czy OAI-SearchBot: dwa osobne przełączniki

Najwyraźniej widać to u poszczególnych dostawców. Spośród polskich stron blokujących GPTBota OAI-SearchBota blokuje też 28%. W próbie światowej – 56%. U Anthropic różnica jest jeszcze większa: 24% wobec 60%.

**Większość polskich stron blokujących trening zostawia wyszukiwarki AI otwarte** (Strony blokujące bota treningowego danego dostawcy (GPTBot, ClaudeBot) według tego, czy blokują też jego bota wyszukiwarki (OAI-SearchBot, Claude-SearchBot))

| Pozycja | Blokuje też wyszukiwanie | Blokuje tylko trening | n |
| --- | --- | --- | --- |
| OpenAI · Polska | 28% | 72% | 151 |
| OpenAI · Świat | 56% | 44% | 154 |
| Anthropic · Polska | 24% | 76% | 107 |
| Anthropic · Świat | 60% | 40% | 152 |

Source: Badanie Outofplace, 23 września 2026. Chart: https://www.outofplace.space/data/blog/ai-crawlers-polish-web/charts/pl/chart-wiekszosc-polskich-stron-blokujacych-trening-zostawia-wyszukiwar.png Data: https://www.outofplace.space/data/blog/ai-bots-polish-web/2026-09-23/bot_policies.csv

Na świecie strona, która blokuje boty AI, zwykle blokuje też te wyszukujące. W Polsce typowa strona wymienia kilka botów treningowych i na tym kończy: 11,2% polskiej próby blokuje wyłącznie trening, prawie dwa razy więcej niż 5,9% na świecie.

## Które boty AI są blokowane najczęściej

Prowadzi GPTBot: 15,1% polskich stron i 15,4% na świecie. OpenAI ogłosiło go w sierpniu 2023 i od niego zaczyna się większość list blokad. Dalej są CCBot z Common Crawl, Amazonbot, Bytespider od ByteDance i ClaudeBot. Najnowsze boty są ledwo widoczne: Claude-SearchBota blokuje 2,7% polskich stron, głównie dlatego, że listy powstały, zanim się pojawił.

**GPTBot to najczęściej blokowany bot AI na stronach .pl** (Odsetek domen z top 1000 .pl, których robots.txt blokuje danemu botowi stronę główną · 95-procentowe przedziały · wyróżnione boty treningowe)

| Pozycja | Wartość | Przedział 95% | n |
| --- | --- | --- | --- |
| GPTBot | 15% | 13%–17% | 1000 |
| CCBot | 13% | 11%–16% | 1000 |
| Amazonbot | 12% | 10%–14% | 1000 |
| Bytespider | 12% | 9,7%–14% | 1000 |
| ClaudeBot | 11% | 8,9%–13% | 1000 |
| meta-externalagent | 11% | 8,8%–13% | 1000 |
| Google-Extended | 8,4% | 6,8%–10% | 1000 |
| Applebot-Extended | 8,4% | 6,8%–10% | 1000 |
| ChatGPT-User | 4,7% | 3,6%–6,2% | 1000 |
| PerplexityBot | 4,6% | 3,5%–6,1% | 1000 |
| OAI-SearchBot | 4,4% | 3,3%–5,9% | 1000 |
| meta-externalfetcher | 4% | 3%–5,4% | 1000 |
| DuckAssistBot | 3,7% | 2,7%–5,1% | 1000 |
| Perplexity-User | 3,5% | 2,5%–4,8% | 1000 |
| Claude-SearchBot | 2,7% | 1,9%–3,9% | 1000 |
| Claude-User | 2,3% | 1,5%–3,4% | 1000 |
| MistralAI-User | 2,3% | 1,5%–3,4% | 1000 |

Source: Badanie Outofplace, 23 września 2026. Chart: https://www.outofplace.space/data/blog/ai-crawlers-polish-web/charts/pl/chart-gptbot-to-najczesciej-blokowany-bot-ai-na-stronach-pl.png Data: https://www.outofplace.space/data/blog/ai-bots-polish-web/2026-09-23/summary_by_bot.csv

Prawie wszystko to świadome decyzje. Strona, która w grupie `User-agent: *` zabrania wszystkiego, blokuje każdego bota bez własnej grupy, AI czy nie. Ta „podłoga” odpowiada w przypadku GPTBota tylko za 1,9% polskich stron; reszta wymienia bota z nazwy.

Poniżej polski i światowy odsetek dla każdego bota obok siebie. Obie próby zgadzają się co do botów treningowych. Rozchodzą się przy wszystkim, co służy odpowiedziom.

**Różnica pojawia się przy wyszukiwarkach i botach pobierających** (Odsetek stron blokujących danemu botowi stronę główną · top 1000 .pl wobec światowego top 1000)

| Pozycja | Top 1000 .pl | Globalny top 1000 |
| --- | --- | --- |
| GPTBot | 15% | 15% |
| CCBot | 13% | 18% |
| Amazonbot | 12% | 13% |
| Bytespider | 12% | 17% |
| ClaudeBot | 11% | 15% |
| meta-externalagent | 11% | 14% |
| Google-Extended | 8,4% | 14% |
| Applebot-Extended | 8,4% | 13% |
| ChatGPT-User | 4,7% | 11% |
| PerplexityBot | 4,6% | 13% |
| OAI-SearchBot | 4,4% | 8,9% |
| meta-externalfetcher | 4% | 9,9% |
| DuckAssistBot | 3,7% | 9,5% |
| Perplexity-User | 3,5% | 10% |
| Claude-SearchBot | 2,7% | 9,2% |
| Claude-User | 2,3% | 9,5% |
| MistralAI-User | 2,3% | 9,6% |

Source: Badanie Outofplace, 23 września 2026. Chart: https://www.outofplace.space/data/blog/ai-crawlers-polish-web/charts/pl/chart-roznica-pojawia-sie-przy-wyszukiwarkach-i-botach-pobierajacych.png Data: https://www.outofplace.space/data/blog/ai-bots-polish-web/2026-09-23/summary_by_bot.csv

## Większe strony blokują częściej

Im popularniejsza strona, tym częściej blokuje. Co najmniej jednego bota AI blokuje 33% ze stu najpopularniejszych domen .pl i 15,8% z miejsc od 501 do 1000. Spadek jest bardziej stromy niż w próbie światowej, gdzie wynosi od 27% do 21,2%. Największe polskie strony to wydawcy, marketplace'y i portale: firmy, które mają najwięcej tekstu do ochrony i prawników, którzy zadają to pytanie.

**Jedna trzecia stron z top 100 .pl blokuje boty AI** (Odsetek blokujących co najmniej jednego bota AI według miejsca w próbie · n = 100, 400 i 500)

| Pozycja | Top 1000 .pl | Globalny top 1000 |
| --- | --- | --- |
| Top 100 | 33% | 27% |
| 101–500 | 23% | 24% |
| 501–1000 | 16% | 21% |

Source: Badanie Outofplace, 23 września 2026. Chart: https://www.outofplace.space/data/blog/ai-crawlers-polish-web/charts/pl/chart-jedna-trzecia-stron-z-top-100-pl-blokuje-boty-ai.png Data: https://www.outofplace.space/data/blog/ai-bots-polish-web/2026-09-23/domains.csv

Efekt wielkości widać przy każdym bocie z osobna. GPTBota blokuje 23% stron z top 100 i 11,6% stron z miejsc od 501 do 1000; każdy bot treningowy idzie tym samym spadkiem. Boty wyszukiwarek zostają nisko przy każdej wielkości.

**Największe strony .pl najczęściej blokują boty treningowe, a wyszukiwarki rzadko niezależnie od wielkości** (Odsetek stron .pl blokujących danemu botowi stronę główną według miejsca w próbie · n = 100, 400 i 500)

| Pozycja | Top 100 | 101–500 | 501–1000 |
| --- | --- | --- | --- |
| GPTBot | 23% | 18% | 12% |
| CCBot | 21% | 16% | 9,6% |
| Amazonbot | 16% | 16% | 8,8% |
| Bytespider | 19% | 14% | 8% |
| ClaudeBot | 14% | 13% | 8,6% |
| meta-externalagent | 15% | 14% | 6,8% |
| Google-Extended | 12% | 11% | 5,8% |
| Applebot-Extended | 11% | 11% | 5,6% |
| OAI-SearchBot | 7% | 4,3% | 4% |
| PerplexityBot | 6% | 4,8% | 4,2% |
| Claude-SearchBot | 4% | 2,3% | 2,8% |

Source: Badanie Outofplace, 23 września 2026. Chart: https://www.outofplace.space/data/blog/ai-crawlers-polish-web/charts/pl/chart-najwieksze-strony-pl-najczesciej-blokuja-boty-treningowe-a-wyszu.png Data: https://www.outofplace.space/data/blog/ai-bots-polish-web/2026-09-23/bot_policies.csv

Instytucje publiczne blokują rzadziej i nie celowo. Bota AI blokuje 11,9% spośród 42 domen gov.pl w próbie i 16,1% spośród 31 domen edu.pl; obie grupy są małe, więc traktuj to jako kierunek. Większość tych blokad to w ogóle nie polityka wobec AI. sejm.gov.pl, dziennikustaw.gov.pl i wroclaw.sa.gov.pl [wpuszczają Googlebota i zabraniają wszystkim innym](https://www.sejm.gov.pl/robots.txt), co odcina każdego bota AI, a razem z nimi Binga i DuckDuckGo. W przypadku Sejmu i Dziennika Ustaw oznacza to też, że Copilot i wyszukiwarka ChatGPT nie przeczytają źródeł, o które ludzie ich pytają.

## Listy się starzeją

Listy blokad pisze się raz i kopiuje latami. 7,2% polskich stron wciąż blokuje `anthropic-ai`, nazwę, której Anthropic przestał używać (dokumentacja wymienia dziś ClaudeBota, Claude-SearchBota i Claude-User), a Claude-SearchBota tylko 2,7%. W 4,1% próby lista jest nieaktualna w sposób, który ma znaczenie: blokuje starą nazwę, a bota, który ją zastąpił, przepuszcza.

Trzeba oddać Anthropic, że [powiedział 404 Media w 2024 roku](https://www.404media.co/websites-are-blocking-the-wrong-ai-scrapers-because-ai-companies-keep-making-new-ones/), iż ClaudeBot respektuje reguły zapisane dla dwóch wycofanych nazw. To dobra wola, nie standard: według [RFC 9309](https://www.rfc-editor.org/rfc/rfc9309.html) reguła dla `anthropic-ai` ClaudeBota nie dotyczy, a następny dostawca, który zmieni nazwę bota, może nie być tak hojny.

Porządne boty go czytają i się stosują; nic ich do tego nie zmusza. Nazwane grupy nie dziedziczą też niczego z `User-agent: *`: bot stosuje się do jednej grupy, która go wymienia, i ignoruje resztę. Jeśli dajesz botom wyszukiwarek AI własną grupę `Allow`, powtórz w niej swoje prywatne ścieżki.

## Zarządzany robots.txt od Cloudflare i Content Signals

3,1% polskich stron serwuje [zarządzany robots.txt od Cloudflare](https://developers.cloudflare.com/bots/additional-configurations/managed-robots-txt/): jeden przełącznik w panelu i CDN dokleja przed plikiem strony blok reguł, który sam aktualizuje. Blok zabrania dostępu dokładnie ośmiu botom treningowym z naszej listy, od GPTBota po Amazonbota, i żadnemu botowi wyszukiwarki. Te strony, w tym regionalne tytuły Polska Press, takie jak poranny.pl, nto.pl, pomorska.pl i gazetawroclawska.pl, to 15,1% wszystkich polskich stron blokujących boty AI i 24% stron blokujących tylko trening. Częściowo tłumaczą, czemu Polska skłania się w tę stronę, ale nie w całości: bez nich blokowanie samego treningu i tak jest częstsze niż w próbie światowej, gdzie zarządzanego pliku nie znaleźliśmy wcale. Duże międzynarodowe serwisy piszą własne.

Ten przełącznik widać w liczbach. Za Cloudflare boty AI blokuje 25,6% polskich stron, a poza nim 18,2%. Na świecie jest odwrotnie.

**W Polsce strony za Cloudflare blokują częściej** (Odsetek blokujących co najmniej jednego bota AI według tego, czy strona idzie przez Cloudflare)

| Pozycja | Za Cloudflare | Inny hosting |
| --- | --- | --- |
| Polska | 26% | 18% |
| Świat | 19% | 24% |

Source: Badanie Outofplace, 23 września 2026. Chart: https://www.outofplace.space/data/blog/ai-crawlers-polish-web/charts/pl/chart-w-polsce-strony-za-cloudflare-blokuja-czesciej.png Data: https://www.outofplace.space/data/blog/ai-bots-polish-web/2026-09-23/domains.csv

Zarządzany plik zawiera też linię `Content-Signal` (`search=yes, ai-train=no`), część [Content Signals Policy](https://contentsignals.org/), którą Cloudflare opublikował we wrześniu 2025, by deklarować, do czego wolno używać treści: wyszukiwanie, dane wejściowe dla AI, trening AI. W ten sposób `ai-train=no` deklaruje 3,9% polskich stron i 1,6% na świecie. Jeśli tester robots.txt oznacza `Content-Signal` jako nieznaną dyrektywę, to normalne i nieszkodliwe: według RFC 9309 bot pomija linie, których nie rozumie. 79% tych linii pochodzi z zarządzanego pliku, a nie od kogoś, kto je wpisał.

## Co to jest llms.txt i kto go ma?

[`llms.txt`](https://llmstxt.org) to plik Markdown, który mówi modelom językowym, czym jest serwis i gdzie są najważniejsze strony; [zaproponował go Jeremy Howard](https://www.answer.ai/posts/2024-09-03-llmstxt.html) we wrześniu 2024. Specyfikacja wymaga tylko nagłówka H1 z nazwą serwisu; my wymagaliśmy też co najmniej jednego linku, bo plik bez linków nigdzie nie prowadzi. Taki plik pod `/llms.txt` serwuje 9,2% polskiej próby. Kolejne 10% odpowiada pod `/llms.txt` stroną HTML ze statusem 200 i to właśnie dostaje model, który próbuje go przeczytać, a niedbały checker liczy jako „ma llms.txt”.

Pierwsze były firmy hostingowe: home.pl, nazwa.pl, cyberfolks.pl, dhosting.pl i kei.pl serwują poprawny plik, podobnie mbank.pl, t-mobile.pl, rossmann.pl, mediamarkt.pl, a z instytucji publicznych uokik.gov.pl. Google pisze, że [jego wyszukiwarka ten plik ignoruje](https://developers.google.com/search/docs/fundamentals/ai-optimization-guide?hl=pl); jest dla innych asystentów. Sami też go udostępniamy: [nasz llms.txt](https://www.outofplace.space/llms.txt) wymienia nasze badania, case studies i usługi, a [llms-full.txt](https://www.outofplace.space/llms-full.txt) zawiera pełny tekst każdego wpisu.

**Większość stron nie ma llms.txt; co dziesiąta odpowiada stroną WWW** (Co zwróciło GET /llms.txt · n = 1000 w każdej próbie · błędy i ścieżki, których nie wolno nam było pobrać, liczymy jako brak)

| Pozycja | Poprawny llms.txt | Zły format | Strona HTML (soft 404) | Brak | n |
| --- | --- | --- | --- | --- | --- |
| Top 1000 .pl | 9,2% | 2,4% | 10% | 78% | 1000 |
| Globalny top 1000 | 14% | 3,4% | 9,6% | 74% | 1000 |

Source: Badanie Outofplace, 23 września 2026. Chart: https://www.outofplace.space/data/blog/ai-crawlers-polish-web/charts/pl/chart-wiekszosc-stron-nie-ma-llms-txt-co-dziesiata-odpowiada-strona-ww.png Data: https://www.outofplace.space/data/blog/ai-bots-polish-web/2026-09-23/domains.csv

## Reszta sieci czytelnej dla maszyn

Boty czytają więcej niż robots.txt. Polskie strony są tu blisko świata w podstawach i odstają w szczegółach, które pomagają maszynie umiejscowić stronę: [alternatywach `hreflang`](https://developers.google.com/search/docs/specialty/international/localized-versions?hl=pl) i [mapie strony wskazanej tam, gdzie boty jej szukają](https://www.sitemaps.org/protocol.html#submit_robots). [Kompresja Zstandard](https://www.rfc-editor.org/rfc/rfc8878.html) jest na stronach głównych .pl kilka razy częstsza, ale to znowu Cloudflare: wszystkie polskie strony, które ją wysłały, poza jedną, szły przez ten CDN.

## Trzy polityki warte skopiowania

Niektóre polskie strony wyraźnie to przemyślały. Każdy z tych plików sprawdziliśmy ręcznie w dniu badania.

- **Trening nie, odpowiedzi tak.** Tytuły Wirtualnej Polski (wp.pl, o2.pl, money.pl, pudelek.pl, abczdrowie.pl, dobreprogramy.pl) [zabraniają dostępu GPTBotowi, CCBotowi i Bytespiderowi](https://www.wp.pl/robots.txt), a OAI-SearchBotowi, ChatGPT-User, PerplexityBotowi i Perplexity-User dają własne grupy `Allow: /`. Wydawca, który mówi dokładnie, czego chce.
- **Wszyscy mile widziani, z imienia.** mediamarkt.pl i euro.com.pl mają [grupy `Allow: /`](https://mediamarkt.pl/robots.txt) dla GPTBota, ClaudeBota, OAI-SearchBota, Claude-SearchBota, PerplexityBota i innych. Dla sprzedawcy asystent polecający produkt to witryna sklepowa.
- **Niech listę prowadzi CDN.** Regionalne tytuły Polska Press używają zarządzanego pliku Cloudflare, który blokuje boty treningowe i pozostaje aktualny bez niczyjej edycji.

## Jak zablokować ChatGPT i inne boty AI w robots.txt

### Czy blokować boty AI?

Nie ma jednej dobrej polityki. Wydawca, który sprzedaje archiwum, ma inne interesy niż sklep, który chce być polecany. Ale cokolwiek wybierzesz, wybieraj według przeznaczenia bota, nie według dostawcy:

### robots.txt, który blokuje trening i zostawia wyszukiwarki AI

Tak wygląda robots.txt, który blokuje trening i zostawia wyszukiwarki AI. Grupa treningowa to te same osiem botów, które blokuje zarządzany plik Cloudflare. Nasza strona robi odwrotnie i [wpuszcza wszystkie boty](https://www.outofplace.space/robots.txt), bo blog studia jest po to, żeby go cytowano.

```txt title="robots.txt"
# Wyszukiwarki AI i pobieranie na prośbę użytkownika: cytują i linkują
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
Allow: /
# Nazwane grupy nie dziedziczą z *, więc powtórz prywatne ścieżki
Disallow: /koszyk/
Disallow: /konto/

# Trenowanie modeli
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: CCBot
User-agent: Bytespider
User-agent: meta-externalagent
User-agent: Amazonbot
Disallow: /

# Wszyscy pozostali, w tym Googlebot i Bingbot
User-agent: *
Disallow: /koszyk/
Disallow: /konto/

Sitemap: https://www.example.pl/sitemap.xml
```

Trening, wyszukiwarki AI, pobieranie na prośbę użytkownika. Zapisz, czego chcesz dla każdego, zanim dotkniesz pliku.

Bierz je [ze stron dostawców](#dalsza-lektura), nie z listy, którą ktoś wrzucił w 2023.

Bot, który pasuje do nazwanej grupy, całkowicie ignoruje `User-agent: *`.

Wklej plik do narzędzia poniżej i sprawdź ścieżki, które są dla ciebie ważne.

Copilot jeździ na Bingbocie, więc steruje się nim [meta tagami `noarchive` i `nocache`](https://www.bing.com/webmasters/help/robots-meta-tags-and-attributes-that-bing-supports-5198d240). AI Overviews w Google słuchają Googlebota i [ustawień fragmentów, np. `nosnippet`](https://developers.google.com/search/docs/crawling-indexing/robots-meta-tag?hl=pl). Boty pobierające, które mogą ignorować robots.txt, zatrzyma dopiero reguła w CDN albo na serwerze.

Nowe boty pojawiają się kilka razy w roku. Nieaktualna lista jest gorsza niż żadna, bo wygląda jak decyzja.

Wklej tu swój robots.txt, żeby zobaczyć, co może pobrać każdy bot AI. Działa w przeglądarce, na tym samym parserze, którego użyliśmy w badaniu; nic nie jest nigdzie wysyłane.

## Jak mierzyliśmy

Wzięliśmy [listę Tranco Y8YYG](https://tranco-list.eu/list/Y8YYG/full) (utworzona 22 września 2026, okno 30 dni, pięć źródeł) i szliśmy od góry, zbierając pierwsze 1000 domen .pl, których serwer odpowiedział. Próba kontrolna to pierwsze 1000 domen z tej samej listy, przetworzone tak samo. 23 września nasz bot pobrał robots.txt i stronę główną każdej domeny, a także `/llms.txt`, `/llms-full.txt` i mapę strony. Przedstawiał się jako `OutofplaceResearchBot` z linkiem do strony opisującej badanie.

Każdy robots.txt parsowaliśmy zgodnie z RFC 9309 i sprawdzaliśmy ścieżkę strony głównej `/` dla 38 user agentów: 36 botów AI od 17 operatorów, łącznie z wycofanymi nazwami, oraz Googlebota i Bingbota dla porównania. Wykresy pokazują nazwy, które operatorzy obecnie dokumentują. Bot jest zablokowany, jeśli reguła, która go dotyczy, zabrania `/`, niezależnie od tego, czy jest wymieniony z nazwy, czy spada do `*`. Odsetki mają 95-procentowe przedziały Wilsona, różnice między próbami – przedziały Newcombe'a.

Próba to pierwsze 1000 domen .pl z listy Tranco, które odpowiedziały na nasze zapytania. 23 z nich zabrania naszemu botowi dostępu do strony głównej w robots.txt; ich robots.txt i tak przeczytaliśmy (z definicji jest publiczny), ale nic więcej nie pobieraliśmy. Domeny z błędem DNS, odrzuconym połączeniem albo błędem serwera pomijaliśmy i braliśmy następną z listy. Przy 1000 stron 95-procentowy przedział dla głównego wyniku wynosi od 18,1% do 23,1%.

Każda strona dostaje jedną klasę, wygrywa pierwsze dopasowanie. Blokada całkowita: zablokowany jest też Googlebot, więc reguła nie dotyczy AI. Wszystkie boty AI: zablokowane są wszystkie boty treningowe i co najmniej jeden bot wyszukiwarki lub pobierający. Nieaktualna lista: zablokowana jest nazwa, której dostawca już nie dokumentuje, a bot, który ją zastąpił, nie. Tylko trening: zablokowane boty treningowe, żaden bot wyszukiwarki ani pobierający. Niespójna: zablokowany bot wyszukiwarki lub pobierający, a przepuszczony bot treningowy. Otwarta: żaden bot AI nie jest zablokowany. Reguły i ich testy są w repozytorium.

robots.txt to tylko to, o co strona prosi. Część stron blokuje boty AI na firewallu lub w CDN, a część każdemu botowi pokazuje wyzwanie; wyzwania liczyliśmy osobno i nigdy jako „wpuszczone”. Sprawdzaliśmy tylko ścieżkę strony głównej: strona, która blokuje botom artykuły, ale nie `/`, liczy się jako otwarta. Domena .pl to nie to samo co polska firma, a listy popularności faworyzują duże serwisy. Liczby opisują najczęściej odwiedzaną część polskiego internetu w jednym dniu.

## Dalsza lektura

- [RFC 9309: Robots Exclusion Protocol](https://www.rfc-editor.org/rfc/rfc9309.html): Standard robots.txt: grupy, dopasowanie i co bot musi zrobić, gdy pliku nie ma albo jest niedostępny.

- [OpenAI: Overview of OpenAI crawlers](https://developers.openai.com/api/docs/bots): GPTBot, OAI-SearchBot i ChatGPT-User oraz do czego służy każdy z nich.

- [Anthropic: jak zablokować boty](https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler): ClaudeBot, Claude-SearchBot i Claude-User.

- [Google: Common crawlers, w tym Google-Extended](https://developers.google.com/crawling/docs/crawlers-fetchers/google-common-crawlers?hl=pl): Co kontroluje Google-Extended, a czego nie.

- [Cloudflare: Managed robots.txt](https://developers.cloudflare.com/bots/additional-configurations/managed-robots-txt/): Co blokuje plik włączany jednym kliknięciem i jaką linię Content-Signal dodaje.

- [llms.txt: propozycja i jej format](https://llmstxt.org): Oryginalna specyfikacja: gdzie leży plik i jak jest zbudowany.

- [OutofplaceResearchBot: co pobiera i jak go zablokować](https://www.outofplace.space/pl/bot): Kto uruchamia nasz bot, jak się przedstawia i jak uprzejmie pobiera strony.
