# As a condition of accessing this website, you agree to abide by the following # content signals: # (a) If a Content-Signal = yes, you may collect content for the corresponding # use. # (b) If a Content-Signal = no, you may not collect content for the # corresponding use. # (c) If the website operator does not include a Content-Signal for a # corresponding use, the website operator neither grants nor restricts # permission via Content-Signal with respect to the corresponding use. # The content signals and their meanings are: # search: building a search index and providing search results (e.g., returning # hyperlinks and short excerpts from your website's contents). Search does not # include providing AI-generated search summaries. # ai-input: inputting content into one or more AI models (e.g., retrieval # augmented generation, grounding, or other real-time taking of content for # generative AI search answers). # ai-train: training or fine-tuning AI models. # use: how AI systems may consume the content (immediate, reference, or full). # ANY RESTRICTIONS EXPRESSED VIA CONTENT SIGNALS ARE EXPRESS RESERVATIONS OF # RIGHTS UNDER ARTICLE 4 OF THE EUROPEAN UNION DIRECTIVE 2019/790 ON COPYRIGHT # AND RELATED RIGHTS IN THE DIGITAL SINGLE MARKET. # BEGIN Cloudflare Managed content User-agent: * Content-Signal: search=yes,ai-train=no,use=reference Allow: / User-agent: Amazonbot Disallow: / User-agent: Applebot-Extended Disallow: / User-agent: Bytespider Disallow: / User-agent: CCBot Disallow: / User-agent: ClaudeBot Disallow: / User-agent: CloudflareBrowserRenderingCrawler Disallow: / User-agent: Google-Extended Disallow: / User-agent: GPTBot Disallow: / User-agent: meta-externalagent Disallow: / # END Cloudflare Managed Content User-agent: * Allow: / Allow: /firma/ Allow: /cennik Allow: /register Allow: /login Disallow: /admin/ Disallow: /konto/ Disallow: /api/ Disallow: /zmien-haslo Disallow: /reset-password Disallow: /forgot-password Disallow: /verify # Manifest agentowy (i dokumentacja API, gdy jest wystawiona) są WYJĄTKAMI od # `Disallow: /api/`. Reguła blokująca całe /api/ chroni endpointy danych przed # zaśmiecaniem crawlem, ale przy okazji zasłaniała jedyne adresy, które mają być # publicznie odkrywalne — czyli to, z czego integrator (albo agent) dowiaduje # się, że API w ogóle istnieje. Kolejność nie ma znaczenia: `Allow` bardziej # szczegółowy niż `Disallow` wygrywa u wszystkich liczących się crawlerów. # # Lista jest generowana: adresy dokumentacji pojawiają się tu tylko wtedy, gdy # Swagger jest realnie wystawiony. Wcześniej stały na sztywno i wskazywały 404. Allow: /api/agent/manifest # --- Boty AI --- # Osobne sekcje, mimo że `User-agent: *` już je obejmuje: część crawlerów AI # czyta WYŁĄCZNIE swój własny blok i ignoruje wildcard, przez co powyższe # wyjątki na /api/ by ich nie dotyczyły. # # Rozdzielamy dwie różne rzeczy, bo to są różne decyzje biznesowe: # * boty odpowiadające na pytania (cytują nas w wynikach i odsyłają ruch), # * boty zbierające korpus treningowy (nie dają nic w zamian). # Wyszukiwarki AI — chcemy być cytowani, więc wpuszczamy. To są boty, które # REALNIE pobierają stronę, żeby odpowiedzieć na pytanie użytkownika i podać # nas jako źródło. User-agent: OAI-SearchBot User-agent: ChatGPT-User User-agent: PerplexityBot User-agent: Perplexity-User User-agent: ClaudeBot User-agent: Claude-User User-agent: Claude-SearchBot User-agent: Applebot User-agent: Bingbot Allow: / Allow: /firma/ Allow: /api/agent/manifest Disallow: /admin/ Disallow: /konto/ Disallow: /zmien-haslo Disallow: /reset-password Disallow: /forgot-password Disallow: /verify # Zbieranie danych treningowych — dane rejestrowe są naszym produktem, nie # darmowym korpusem. Blokada nie wpływa na cytowanie nas w wynikach: robią to # boty wyżej, które mają osobne nazwy właśnie po to. # # `Google-Extended` i `Applebot-Extended` NIE są crawlerami — to tokeny # uprawnień dla treści pobranej już przez Googlebota i Applebota: # * Google-Extended nie decyduje o AI Overviews ani o pozycji w Search # (robią to indeksacja i `nosnippet`) — obejmuje trening Gemini oraz # grounding w aplikacjach Gemini/Vertex; # * Applebot-Extended dotyczy WYŁĄCZNIE treningu Apple Intelligence; # Spotlight, Siri i Safari jadą z osobnego `Applebot`, który jest wyżej. # Google-Extended jest jedynym realnym kompromisem w tym pliku: blokada kosztuje # grounding w aplikacjach Gemini, ale NIE kosztuje obecności w Google Search ani # w AI Overviews. Gdyby priorytetem stała się widoczność w Gemini, przenieś sam # `Google-Extended` do grupy wyżej — reszta zostaje. User-agent: GPTBot User-agent: CCBot User-agent: Bytespider User-agent: Meta-ExternalAgent User-agent: Amazonbot User-agent: Google-Extended User-agent: Applebot-Extended Disallow: / Sitemap: https://biz-gov.com/sitemap.xml