Boty AI kontra polski internet: robots.txt 1000 stron .pl

Sprawdziliśmy plik robots.txt 1000 największych stron .pl: co piąta blokuje boty AI, głównie treningowe jak GPTBot, rzadko wyszukiwarki AI. Jak to rozdzielić?

Opublikowano: Czas czytania: 13 min czytania

23 września 2026 nasz crawler OutofplaceResearchBot przeczytał plik robots.txt tysiąca najpopularniejszych stron w domenie .pl, żebyśmy mogli sprawdzić, które boty AI wpuszczają. 20,5% z nich blokuje co najmniej jednego bota AI. Statystycznie to tyle samo, co w światowym top 1000, gdzie odsetek wynosi 22,7%.

Różnica leży w tym, których botów to dotyczy. Polskie strony zamykają drzwi przed botami zbierającymi dane treningowe, a wyszukiwarki AI w większości wpuszczają. Bota wyszukiwarki AI blokuje tylko 5,4% z nich, przy 13,9% na świecie. Jeśli chcesz pojawiać się w odpowiedziach ChatGPT, Claude'a czy Perplexity, to właściwa kolejność. Tyle że czasem wychodzi przypadkiem: stara lista skopiowana raz i nigdy nieaktualizowana.

stron z top .pl blokuje bota AI
20,5%
blokuje GPTBota, najczęściej blokowanego
15,1%
blokuje bota wyszukiwarki AI
5,4%
ma poprawny llms.txt
9,2%

Boty AI: co to jest i jakie są rodzaje

„Bot AI” to trzy różne zadania i dostawcy dają dziś każdemu osobny user agent. To rozróżnienie decyduje o wszystkim, co dalej:

Blokada bota treningowego trzyma strony z dala od przyszłych modeli. Blokada bota wyszukiwarki albo bota pobierającego usuwa je z odpowiedzi i z linków w tych odpowiedziach.

Dwa z „botów” treningowych niczego nie pobierają. Google-Extended i Applebot-Extended to tylko tokeny: stronę ściąga Googlebot (otwiera się w nowej karcie) albo Applebot, a token mówi Google'owi i Apple, czy wolno na niej trenować. Ich blokada zostawia stronę w wyszukiwarkach Google i Apple, a blokada Google-Extended nie wyłącza też AI Overviews (otwiera się w nowej karcie): te słuchają reguł dla Googlebota. Drugi wyjątek to boty pobierające. OpenAI, Perplexity i Meta piszą, że ich boty mogą w ogóle nie stosować się do robots.txt, bo o stronę poprosił człowiek; Anthropic deklaruje, że Claude-User się stosuje.

Polska blokuje tak często jak świat, ale nie te same boty

Licząc wszystkie boty AI, różnica między próbą .pl a światową wynosi 2,2 punktu procentowego, dobrze w granicach błędu. Po podziale według przeznaczenia obraz się zmienia. Boty treningowe są blokowane równie często. Boty wyszukiwarek AI i boty pobierające na prośbę użytkownika – w Polsce ponad dwa razy rzadziej.

Polska blokuje trening tak często jak świat, wyszukiwarki AI dużo rzadziej

Odsetek stron, których robots.txt blokuje stronę główną co najmniej jednemu botowi danego rodzaju · n = 1000 w każdej próbie · 23 września 2026

  • Top 1000 .pl
  • Globalny top 1000
Dowolny bot AI21% · 23%
Boty treningowe21% · 22%
Boty wyszukiwarek AI5,4% · 14%
Pobieranie na prośbę użytkownika5,3% · 13%
Źródło: Badanie Outofplace; lista Tranco Y8YYGPobierz CSVPobierz PNG
Pokaż dane
PozycjaTop 1000 .plGlobalny top 1000
Dowolny bot AI21%23%
Boty treningowe21%22%
Boty wyszukiwarek AI5,4%14%
Pobieranie na prośbę użytkownika5,3%13%
Polska blokuje trening tak często jak świat, wyszukiwarki AI dużo rzadziej. Odsetek stron, których robots.txt blokuje stronę główną co najmniej jednemu botowi danego rodzaju · n = 1000 w każdej próbie · 23 września 2026

Wykres jako obraz. Możesz go użyć na licencji CC BY 4.0, podając Outofplace jako źródło i link do tej strony.

GPTBot czy OAI-SearchBot: dwa osobne przełączniki

Najwyraźniej widać to u poszczególnych dostawców. Spośród polskich stron blokujących GPTBota OAI-SearchBota blokuje też 28%. W próbie światowej – 56%. U Anthropic różnica jest jeszcze większa: 24% wobec 60%.

Większość polskich stron blokujących trening zostawia wyszukiwarki AI otwarte

Strony blokujące bota treningowego danego dostawcy (GPTBot, ClaudeBot) według tego, czy blokują też jego bota wyszukiwarki (OAI-SearchBot, Claude-SearchBot)

  • Blokuje też wyszukiwanie
  • Blokuje tylko trening
OpenAI · Polskan = 15128%72%
OpenAI · Światn = 15456%44%
Anthropic · Polskan = 10724%76%
Anthropic · Światn = 15260%40%
Źródło: Badanie Outofplace, 23 września 2026Pobierz CSVPobierz PNG
Pokaż dane
PozycjaBlokuje też wyszukiwanieBlokuje tylko treningn
OpenAI · Polska28%72%151
OpenAI · Świat56%44%154
Anthropic · Polska24%76%107
Anthropic · Świat60%40%152
Większość polskich stron blokujących trening zostawia wyszukiwarki AI otwarte. Strony blokujące bota treningowego danego dostawcy (GPTBot, ClaudeBot) według tego, czy blokują też jego bota wyszukiwarki (OAI-SearchBot, Claude-SearchBot)

Wykres jako obraz. Możesz go użyć na licencji CC BY 4.0, podając Outofplace jako źródło i link do tej strony.

Na świecie strona, która blokuje boty AI, zwykle blokuje też te wyszukujące. W Polsce typowa strona wymienia kilka botów treningowych i na tym kończy: 11,2% polskiej próby blokuje wyłącznie trening, prawie dwa razy więcej niż 5,9% na świecie.

Które boty AI są blokowane najczęściej

Prowadzi GPTBot: 15,1% polskich stron i 15,4% na świecie. OpenAI ogłosiło go w sierpniu 2023 i od niego zaczyna się większość list blokad. Dalej są CCBot z Common Crawl, Amazonbot, Bytespider od ByteDance i ClaudeBot. Najnowsze boty są ledwo widoczne: Claude-SearchBota blokuje 2,7% polskich stron, głównie dlatego, że listy powstały, zanim się pojawił.

GPTBot to najczęściej blokowany bot AI na stronach .pl

Odsetek domen z top 1000 .pl, których robots.txt blokuje danemu botowi stronę główną · 95-procentowe przedziały · wyróżnione boty treningowe

GPTBot15%
CCBot13%
Amazonbot12%
Bytespider12%
ClaudeBot11%
meta-externalagent11%
Google-Extended8,4%
Applebot-Extended8,4%
ChatGPT-User4,7%
PerplexityBot4,6%
OAI-SearchBot4,4%
meta-externalfetcher4%
DuckAssistBot3,7%
Perplexity-User3,5%
Claude-SearchBot2,7%
Claude-User2,3%
MistralAI-User2,3%

Blokuje dowolnego bota AI: 21%

Źródło: Badanie Outofplace, 23 września 2026Pobierz CSVPobierz PNG
Pokaż dane
PozycjaWartośćPrzedział 95%n
GPTBot15%13%–17%1000
CCBot13%11%–16%1000
Amazonbot12%10%–14%1000
Bytespider12%9,7%–14%1000
ClaudeBot11%8,9%–13%1000
meta-externalagent11%8,8%–13%1000
Google-Extended8,4%6,8%–10%1000
Applebot-Extended8,4%6,8%–10%1000
ChatGPT-User4,7%3,6%–6,2%1000
PerplexityBot4,6%3,5%–6,1%1000
OAI-SearchBot4,4%3,3%–5,9%1000
meta-externalfetcher4%3%–5,4%1000
DuckAssistBot3,7%2,7%–5,1%1000
Perplexity-User3,5%2,5%–4,8%1000
Claude-SearchBot2,7%1,9%–3,9%1000
Claude-User2,3%1,5%–3,4%1000
MistralAI-User2,3%1,5%–3,4%1000
GPTBot to najczęściej blokowany bot AI na stronach .pl. Odsetek domen z top 1000 .pl, których robots.txt blokuje danemu botowi stronę główną · 95-procentowe przedziały · wyróżnione boty treningowe

Wykres jako obraz. Możesz go użyć na licencji CC BY 4.0, podając Outofplace jako źródło i link do tej strony.

Prawie wszystko to świadome decyzje. Strona, która w grupie User-agent: * zabrania wszystkiego, blokuje każdego bota bez własnej grupy, AI czy nie. Ta „podłoga” odpowiada w przypadku GPTBota tylko za 1,9% polskich stron; reszta wymienia bota z nazwy.

Poniżej polski i światowy odsetek dla każdego bota obok siebie. Obie próby zgadzają się co do botów treningowych. Rozchodzą się przy wszystkim, co służy odpowiedziom.

Różnica pojawia się przy wyszukiwarkach i botach pobierających

Odsetek stron blokujących danemu botowi stronę główną · top 1000 .pl wobec światowego top 1000

  • Top 1000 .pl
  • Globalny top 1000
GPTBot15% · 15%
CCBot13% · 18%
Amazonbot12% · 13%
Bytespider12% · 17%
ClaudeBot11% · 15%
meta-externalagent11% · 14%
Google-Extended8,4% · 14%
Applebot-Extended8,4% · 13%
ChatGPT-User4,7% · 11%
PerplexityBot4,6% · 13%
OAI-SearchBot4,4% · 8,9%
meta-externalfetcher4% · 9,9%
DuckAssistBot3,7% · 9,5%
Perplexity-User3,5% · 10%
Claude-SearchBot2,7% · 9,2%
Claude-User2,3% · 9,5%
MistralAI-User2,3% · 9,6%
Źródło: Badanie Outofplace, 23 września 2026Pobierz CSVPobierz PNG
Pokaż dane
PozycjaTop 1000 .plGlobalny top 1000
GPTBot15%15%
CCBot13%18%
Amazonbot12%13%
Bytespider12%17%
ClaudeBot11%15%
meta-externalagent11%14%
Google-Extended8,4%14%
Applebot-Extended8,4%13%
ChatGPT-User4,7%11%
PerplexityBot4,6%13%
OAI-SearchBot4,4%8,9%
meta-externalfetcher4%9,9%
DuckAssistBot3,7%9,5%
Perplexity-User3,5%10%
Claude-SearchBot2,7%9,2%
Claude-User2,3%9,5%
MistralAI-User2,3%9,6%
Różnica pojawia się przy wyszukiwarkach i botach pobierających. Odsetek stron blokujących danemu botowi stronę główną · top 1000 .pl wobec światowego top 1000

Wykres jako obraz. Możesz go użyć na licencji CC BY 4.0, podając Outofplace jako źródło i link do tej strony.

Większe strony blokują częściej

Im popularniejsza strona, tym częściej blokuje. Co najmniej jednego bota AI blokuje 33% ze stu najpopularniejszych domen .pl i 15,8% z miejsc od 501 do 1000. Spadek jest bardziej stromy niż w próbie światowej, gdzie wynosi od 27% do 21,2%. Największe polskie strony to wydawcy, marketplace'y i portale: firmy, które mają najwięcej tekstu do ochrony i prawników, którzy zadają to pytanie.

Jedna trzecia stron z top 100 .pl blokuje boty AI

Odsetek blokujących co najmniej jednego bota AI według miejsca w próbie · n = 100, 400 i 500

  • Top 1000 .pl
  • Globalny top 1000
Top 10033% · 27%
101–50023% · 24%
501–100016% · 21%
Źródło: Badanie Outofplace, 23 września 2026Pobierz CSVPobierz PNG
Pokaż dane
PozycjaTop 1000 .plGlobalny top 1000
Top 10033%27%
101–50023%24%
501–100016%21%
Jedna trzecia stron z top 100 .pl blokuje boty AI. Odsetek blokujących co najmniej jednego bota AI według miejsca w próbie · n = 100, 400 i 500

Wykres jako obraz. Możesz go użyć na licencji CC BY 4.0, podając Outofplace jako źródło i link do tej strony.

Efekt wielkości widać przy każdym bocie z osobna. GPTBota blokuje 23% stron z top 100 i 11,6% stron z miejsc od 501 do 1000; każdy bot treningowy idzie tym samym spadkiem. Boty wyszukiwarek zostają nisko przy każdej wielkości.

Największe strony .pl najczęściej blokują boty treningowe, a wyszukiwarki rzadko niezależnie od wielkości

Odsetek stron .pl blokujących danemu botowi stronę główną według miejsca w próbie · n = 100, 400 i 500

PozycjaTop 100101–500501–1000
GPTBot23%18%12%
CCBot21%16%9,6%
Amazonbot16%16%8,8%
Bytespider19%14%8%
ClaudeBot14%13%8,6%
meta-externalagent15%14%6,8%
Google-Extended12%11%5,8%
Applebot-Extended11%11%5,6%
OAI-SearchBot7%4,3%4%
PerplexityBot6%4,8%4,2%
Claude-SearchBot4%2,3%2,8%
Źródło: Badanie Outofplace, 23 września 2026Pobierz CSVPobierz PNG
Pokaż jako obraz
Największe strony .pl najczęściej blokują boty treningowe, a wyszukiwarki rzadko niezależnie od wielkości. Odsetek stron .pl blokujących danemu botowi stronę główną według miejsca w próbie · n = 100, 400 i 500

Wykres jako obraz. Możesz go użyć na licencji CC BY 4.0, podając Outofplace jako źródło i link do tej strony.

Instytucje publiczne blokują rzadziej i nie celowo. Bota AI blokuje 11,9% spośród 42 domen gov.pl w próbie i 16,1% spośród 31 domen edu.pl; obie grupy są małe, więc traktuj to jako kierunek. Większość tych blokad to w ogóle nie polityka wobec AI. sejm.gov.pl, dziennikustaw.gov.pl i wroclaw.sa.gov.pl wpuszczają Googlebota i zabraniają wszystkim innym (otwiera się w nowej karcie), co odcina każdego bota AI, a razem z nimi Binga i DuckDuckGo. W przypadku Sejmu i Dziennika Ustaw oznacza to też, że Copilot i wyszukiwarka ChatGPT nie przeczytają źródeł, o które ludzie ich pytają.

Listy się starzeją

Listy blokad pisze się raz i kopiuje latami. 7,2% polskich stron wciąż blokuje anthropic-ai, nazwę, której Anthropic przestał używać (dokumentacja wymienia dziś ClaudeBota, Claude-SearchBota i Claude-User), a Claude-SearchBota tylko 2,7%. W 4,1% próby lista jest nieaktualna w sposób, który ma znaczenie: blokuje starą nazwę, a bota, który ją zastąpił, przepuszcza.

Trzeba oddać Anthropic, że powiedział 404 Media w 2024 roku (otwiera się w nowej karcie), iż ClaudeBot respektuje reguły zapisane dla dwóch wycofanych nazw. To dobra wola, nie standard: według RFC 9309 (otwiera się w nowej karcie) reguła dla anthropic-ai ClaudeBota nie dotyczy, a następny dostawca, który zmieni nazwę bota, może nie być tak hojny.

Zarządzany robots.txt od Cloudflare i Content Signals

3,1% polskich stron serwuje zarządzany robots.txt od Cloudflare (otwiera się w nowej karcie): jeden przełącznik w panelu i CDN dokleja przed plikiem strony blok reguł, który sam aktualizuje. Blok zabrania dostępu dokładnie ośmiu botom treningowym z naszej listy, od GPTBota po Amazonbota, i żadnemu botowi wyszukiwarki. Te strony, w tym regionalne tytuły Polska Press, takie jak poranny.pl, nto.pl, pomorska.pl i gazetawroclawska.pl, to 15,1% wszystkich polskich stron blokujących boty AI i 24% stron blokujących tylko trening. Częściowo tłumaczą, czemu Polska skłania się w tę stronę, ale nie w całości: bez nich blokowanie samego treningu i tak jest częstsze niż w próbie światowej, gdzie zarządzanego pliku nie znaleźliśmy wcale. Duże międzynarodowe serwisy piszą własne.

Ten przełącznik widać w liczbach. Za Cloudflare boty AI blokuje 25,6% polskich stron, a poza nim 18,2%. Na świecie jest odwrotnie.

W Polsce strony za Cloudflare blokują częściej

Odsetek blokujących co najmniej jednego bota AI według tego, czy strona idzie przez Cloudflare

  • Za Cloudflare
  • Inny hosting
Polska26% · 18%
Świat19% · 24%
Źródło: Badanie Outofplace, 23 września 2026Pobierz CSVPobierz PNG
Pokaż dane
PozycjaZa CloudflareInny hosting
Polska26%18%
Świat19%24%
W Polsce strony za Cloudflare blokują częściej. Odsetek blokujących co najmniej jednego bota AI według tego, czy strona idzie przez Cloudflare

Wykres jako obraz. Możesz go użyć na licencji CC BY 4.0, podając Outofplace jako źródło i link do tej strony.

Zarządzany plik zawiera też linię Content-Signal (search=yes, ai-train=no), część Content Signals Policy (otwiera się w nowej karcie), którą Cloudflare opublikował we wrześniu 2025, by deklarować, do czego wolno używać treści: wyszukiwanie, dane wejściowe dla AI, trening AI. W ten sposób ai-train=no deklaruje 3,9% polskich stron i 1,6% na świecie. Jeśli tester robots.txt oznacza Content-Signal jako nieznaną dyrektywę, to normalne i nieszkodliwe: według RFC 9309 bot pomija linie, których nie rozumie. 79% tych linii pochodzi z zarządzanego pliku, a nie od kogoś, kto je wpisał.

Co to jest llms.txt i kto go ma?

llms.txt (otwiera się w nowej karcie) to plik Markdown, który mówi modelom językowym, czym jest serwis i gdzie są najważniejsze strony; zaproponował go Jeremy Howard (otwiera się w nowej karcie) we wrześniu 2024. Specyfikacja wymaga tylko nagłówka H1 z nazwą serwisu; my wymagaliśmy też co najmniej jednego linku, bo plik bez linków nigdzie nie prowadzi. Taki plik pod /llms.txt serwuje 9,2% polskiej próby. Kolejne 10% odpowiada pod /llms.txt stroną HTML ze statusem 200 i to właśnie dostaje model, który próbuje go przeczytać, a niedbały checker liczy jako „ma llms.txt”.

Pierwsze były firmy hostingowe: home.pl, nazwa.pl, cyberfolks.pl, dhosting.pl i kei.pl serwują poprawny plik, podobnie mbank.pl, t-mobile.pl, rossmann.pl, mediamarkt.pl, a z instytucji publicznych uokik.gov.pl. Google pisze, że jego wyszukiwarka ten plik ignoruje (otwiera się w nowej karcie); jest dla innych asystentów. Sami też go udostępniamy: nasz llms.txt wymienia nasze badania, case studies i usługi, a llms-full.txt zawiera pełny tekst każdego wpisu.

Większość stron nie ma llms.txt; co dziesiąta odpowiada stroną WWW

Co zwróciło GET /llms.txt · n = 1000 w każdej próbie · błędy i ścieżki, których nie wolno nam było pobrać, liczymy jako brak

  • Poprawny llms.txt
  • Zły format
  • Strona HTML (soft 404)
  • Brak
Top 1000 .pln = 100078%
Globalny top 1000n = 100014%74%
Źródło: Badanie Outofplace, 23 września 2026Pobierz CSVPobierz PNG
Pokaż dane
PozycjaPoprawny llms.txtZły formatStrona HTML (soft 404)Brakn
Top 1000 .pl9,2%2,4%10%78%1000
Globalny top 100014%3,4%9,6%74%1000
Większość stron nie ma llms.txt; co dziesiąta odpowiada stroną WWW. Co zwróciło GET /llms.txt · n = 1000 w każdej próbie · błędy i ścieżki, których nie wolno nam było pobrać, liczymy jako brak

Wykres jako obraz. Możesz go użyć na licencji CC BY 4.0, podając Outofplace jako źródło i link do tej strony.

Reszta sieci czytelnej dla maszyn

Boty czytają więcej niż robots.txt. Polskie strony są tu blisko świata w podstawach i odstają w szczegółach, które pomagają maszynie umiejscowić stronę: alternatywach hreflang (otwiera się w nowej karcie)mapie strony wskazanej tam, gdzie boty jej szukają (otwiera się w nowej karcie). Kompresja Zstandard (otwiera się w nowej karcie) jest na stronach głównych .pl kilka razy częstsza, ale to znowu Cloudflare: wszystkie polskie strony, które ją wysłały, poza jedną, szły przez ten CDN.

Odsetek stron głównych z danym sygnałem · n = 977 stron .pl i 935 światowych, które zwróciły HTML
SygnałPolskaŚwiat
<html lang>89%89%
Tagi Open Graph71%70%
JSON-LD49%47%
Sitemap w robots.txt53%62%
hreflang18%35%
HTTP/282%89%
Ogłoszone HTTP/330%36%
Brotli31%32%
Zstandard8,3%2,4%
Pobierz CSV

Trzy polityki warte skopiowania

Niektóre polskie strony wyraźnie to przemyślały. Każdy z tych plików sprawdziliśmy ręcznie w dniu badania.

  • Trening nie, odpowiedzi tak. Tytuły Wirtualnej Polski (wp.pl, o2.pl, money.pl, pudelek.pl, abczdrowie.pl, dobreprogramy.pl) zabraniają dostępu GPTBotowi, CCBotowi i Bytespiderowi (otwiera się w nowej karcie), a OAI-SearchBotowi, ChatGPT-User, PerplexityBotowi i Perplexity-User dają własne grupy Allow: /. Wydawca, który mówi dokładnie, czego chce.
  • Wszyscy mile widziani, z imienia. mediamarkt.pl i euro.com.pl mają grupy Allow: / (otwiera się w nowej karcie) dla GPTBota, ClaudeBota, OAI-SearchBota, Claude-SearchBota, PerplexityBota i innych. Dla sprzedawcy asystent polecający produkt to witryna sklepowa.
  • Niech listę prowadzi CDN. Regionalne tytuły Polska Press używają zarządzanego pliku Cloudflare, który blokuje boty treningowe i pozostaje aktualny bez niczyjej edycji.

Jak zablokować ChatGPT i inne boty AI w robots.txt

Czy blokować boty AI?

Nie ma jednej dobrej polityki. Wydawca, który sprzedaje archiwum, ma inne interesy niż sklep, który chce być polecany. Ale cokolwiek wybierzesz, wybieraj według przeznaczenia bota, nie według dostawcy:

Blokada wszystkich botów AI

  • Poza przyszłymi modelami
  • Poza odpowiedziami ChatGPT, Claude'a i Perplexity
  • Brak linków z odpowiedzi AI
  • Listę trzeba ciągle aktualizować

Blokada tylko treningu

  • Poza przyszłymi modelami
  • Cytowani i linkowani w odpowiedziach AI
  • Kto pyta asystenta, wciąż cię znajdzie
  • Boty wyszukiwarek zmieniają się rzadziej

robots.txt, który blokuje trening i zostawia wyszukiwarki AI

Tak wygląda robots.txt, który blokuje trening i zostawia wyszukiwarki AI. Grupa treningowa to te same osiem botów, które blokuje zarządzany plik Cloudflare. Nasza strona robi odwrotnie i wpuszcza wszystkie boty, bo blog studia jest po to, żeby go cytowano.

robots.txt
# Wyszukiwarki AI i pobieranie na prośbę użytkownika: cytują i linkują
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
Allow: /
# Nazwane grupy nie dziedziczą z *, więc powtórz prywatne ścieżki
Disallow: /koszyk/
Disallow: /konto/
 
# Trenowanie modeli
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: CCBot
User-agent: Bytespider
User-agent: meta-externalagent
User-agent: Amazonbot
Disallow: /
 
# Wszyscy pozostali, w tym Googlebot i Bingbot
User-agent: *
Disallow: /koszyk/
Disallow: /konto/
 
Sitemap: https://www.example.pl/sitemap.xml
  1. Zdecyduj według przeznaczenia

    Trening, wyszukiwarki AI, pobieranie na prośbę użytkownika. Zapisz, czego chcesz dla każdego, zanim dotkniesz pliku.

  2. Wpisz aktualne nazwy

    Bierz je ze stron dostawców, nie z listy, którą ktoś wrzucił w 2023.

  3. Powtórz prywatne ścieżki w każdej nazwanej grupie

    Bot, który pasuje do nazwanej grupy, całkowicie ignoruje User-agent: *.

  4. Przetestuj

    Wklej plik do narzędzia poniżej i sprawdź ścieżki, które są dla ciebie ważne.

  5. Pokryj to, czego robots.txt nie obejmie

    Copilot jeździ na Bingbocie, więc steruje się nim meta tagami noarchive i nocache (otwiera się w nowej karcie). AI Overviews w Google słuchają Googlebota i ustawień fragmentów, np. nosnippet (otwiera się w nowej karcie). Boty pobierające, które mogą ignorować robots.txt, zatrzyma dopiero reguła w CDN albo na serwerze.

  6. Sprawdzaj co kwartał

    Nowe boty pojawiają się kilka razy w roku. Nieaktualna lista jest gorsza niż żadna, bo wygląda jak decyzja.

Wklej tu swój robots.txt, żeby zobaczyć, co może pobrać każdy bot AI. Działa w przeglądarce, na tym samym parserze, którego użyliśmy w badaniu; nic nie jest nigdzie wysyłane.

Narzędzie

Które crawlery AI mogą czytać Twoją stronę?

Wklej swój robots.txt. Sprawdzamy go tutaj, w Twojej przeglądarce, tym samym parserem RFC 9309 i tą samą listą botów co w naszym badaniu; nic z tego, co wkleisz, nigdzie nie wychodzi.

Jak mierzyliśmy

Które strony się liczą i dlaczego 1000

Próba to pierwsze 1000 domen .pl z listy Tranco, które odpowiedziały na nasze zapytania. 23 z nich zabrania naszemu botowi dostępu do strony głównej w robots.txt; ich robots.txt i tak przeczytaliśmy (z definicji jest publiczny), ale nic więcej nie pobieraliśmy. Domeny z błędem DNS, odrzuconym połączeniem albo błędem serwera pomijaliśmy i braliśmy następną z listy. Przy 1000 stron 95-procentowy przedział dla głównego wyniku wynosi od 18,1% do 23,1%.

Jak klasyfikujemy politykę strony

Każda strona dostaje jedną klasę, wygrywa pierwsze dopasowanie. Blokada całkowita: zablokowany jest też Googlebot, więc reguła nie dotyczy AI. Wszystkie boty AI: zablokowane są wszystkie boty treningowe i co najmniej jeden bot wyszukiwarki lub pobierający. Nieaktualna lista: zablokowana jest nazwa, której dostawca już nie dokumentuje, a bot, który ją zastąpił, nie. Tylko trening: zablokowane boty treningowe, żaden bot wyszukiwarki ani pobierający. Niespójna: zablokowany bot wyszukiwarki lub pobierający, a przepuszczony bot treningowy. Otwarta: żaden bot AI nie jest zablokowany. Reguły i ich testy są w repozytorium.

Czego te dane nie mówią

robots.txt to tylko to, o co strona prosi. Część stron blokuje boty AI na firewallu lub w CDN, a część każdemu botowi pokazuje wyzwanie; wyzwania liczyliśmy osobno i nigdy jako „wpuszczone”. Sprawdzaliśmy tylko ścieżkę strony głównej: strona, która blokuje botom artykuły, ale nie /, liczy się jako otwarta. Domena .pl to nie to samo co polska firma, a listy popularności faworyzują duże serwisy. Liczby opisują najczęściej odwiedzaną część polskiego internetu w jednym dniu.

Czy blokować boty AI?

Decyduj według przeznaczenia. Zablokuj boty treningowe (GPTBot, ClaudeBot, Google-Extended, CCBot i inne), jeśli nie chcesz, żeby twoje strony trafiały do przyszłych modeli. Zostaw boty wyszukiwarek AI (OAI-SearchBot, Claude-SearchBot, PerplexityBot), jeśli chcesz być cytowany i linkowany w odpowiedziach ChatGPT, Claude'a i Perplexity: ich blokada usuwa cię z tych odpowiedzi.

Jak zablokować ChatGPT w robots.txt?

ChatGPT ma trzy boty. GPTBot zbiera dane do trenowania modeli, OAI-SearchBot indeksuje strony dla wyszukiwarki ChatGPT, a ChatGPT-User otwiera strony na prośbę użytkownika. OpenAI traktuje je niezależnie: blokada GPTBota nie usuwa strony z wyszukiwarki ChatGPT, robi to dopiero blokada OAI-SearchBota. OpenAI zaznacza też, że reguły robots.txt mogą nie dotyczyć ChatGPT-User.

Czy blokada Google-Extended wyłącza AI w Google albo obniża pozycje?

Ani jedno, ani drugie. Google pisze, że Google-Extended nie wpływa na obecność ani pozycję w wyszukiwarce Google; decyduje o tym, czy treści służą do trenowania modeli Gemini i ugruntowywania ich odpowiedzi. AI Overviews i tryb AI są częścią wyszukiwarki i słuchają reguł dla Googlebota oraz ustawień fragmentów, takich jak nosnippet.

Jak wyłączyć stronę z Microsoft Copilot?

Microsoft nie ma osobnego bota AI: Bing i Copilot korzystają z tego samego crawla Bingbota. Zamiast tego Microsoft opisuje dwa meta tagi: noarchive wyłącza stronę z odpowiedzi Copilota i z trenowania, a nocache ogranicza Copilota do adresu, tytułu i fragmentu. Oba zostawiają stronę w wyszukiwarce Bing.

Ile polskich stron blokuje boty AI?

W naszym badaniu z września 2026 20,5% z 1000 najpopularniejszych domen .pl blokowało w robots.txt co najmniej jednego bota AI (95-procentowy przedział 18,1%–23,1%). Najczęściej blokowany był GPTBot: 15,1%.

Czy potrzebuję llms.txt?

Nie, ale to tani i nieszkodliwy plik: Markdown, zwykle pod /llms.txt, który mówi modelom językowym, czym jest serwis, i linkuje do najważniejszych stron. Google pisze, że jego wyszukiwarka go ignoruje, a żadna z dużych firm AI nie ogłosiła, że używa go przy rankingu, więc traktuj go jako uprzejmość, nie dźwignię. Poprawny ma tylko 9,2% największych stron .pl.

Czy boty AI respektują robots.txt?

Zatrzymuje te, które chcą go przestrzegać. Duzi dostawcy deklarują, że ich boty treningowe i wyszukujące stosują się do robots.txt, ale OpenAI, Perplexity i Meta piszą, że ich boty pobierające na prośbę użytkownika mogą tego nie robić, bo o stronę poprosił człowiek. robots.txt to prośba, a nie kontrola dostępu; do egzekwowania potrzebne są reguły na serwerze albo w CDN.

Dalsza lektura

RFC 9309: Robots Exclusion Protocol (otwiera się w nowej karcie)Standard robots.txt: grupy, dopasowanie i co bot musi zrobić, gdy pliku nie ma albo jest niedostępny.rfc-editor.org
OpenAI: Overview of OpenAI crawlers (otwiera się w nowej karcie)GPTBot, OAI-SearchBot i ChatGPT-User oraz do czego służy każdy z nich.developers.openai.com
Anthropic: jak zablokować boty (otwiera się w nowej karcie)ClaudeBot, Claude-SearchBot i Claude-User.support.claude.com
Google: Common crawlers, w tym Google-Extended (otwiera się w nowej karcie)Co kontroluje Google-Extended, a czego nie.developers.google.com
Cloudflare: Managed robots.txt (otwiera się w nowej karcie)Co blokuje plik włączany jednym kliknięciem i jaką linię Content-Signal dodaje.developers.cloudflare.com
llms.txt: propozycja i jej format (otwiera się w nowej karcie)Oryginalna specyfikacja: gdzie leży plik i jak jest zbudowany.llmstxt.org
OutofplaceResearchBot: co pobiera i jak go zablokowaćKto uruchamia nasz bot, jak się przedstawia i jak uprzejmie pobiera strony.

Napisz, co budujemy.

Odpowiadamy w ciągu jednego dnia roboczego.