Czy sztuczna inteligencja widzi polskie firmy usługowe?
43% badanych stron nie publikuje danych strukturalnych — model językowy może taką stronę przeczytać, ale nie ma z niej ani jednego faktu o firmie do zacytowania: ani adresu, ani godzin, ani rodzaju działalności. Wśród pensjonatów jest to 69%, a na Helu — tyle samo.
Wbrew intuicji problemem nie jest blokada. Tylko 2% stron zamyka drzwi robotom AI — a 5 z tych 9 blokad to domyślne ustawienie Cloudflare, nie decyzja właściciela. Problem jest subtelniejszy: strona wpuszcza robota i nie daje mu nic konkretnego do zapamiętania.
Dlaczego to zbadaliśmy
Coraz więcej osób nie wpisuje już „hotel Karwia” w Google, tylko pyta ChatGPT albo Perplexity „gdzie przenocować w Karwii”. Odpowiedź powstaje z tego, co roboty tych modeli zdołały wcześniej przeczytać na stronach firm. Firma, której robot nie przeczytał, nie pojawi się w odpowiedzi — nie dlatego, że jest gorsza, tylko dlatego, że jej tam nie ma.
To jest mierzalne. Nie trzeba pytać modelu ani zgadywać. Wystarczy sprawdzić, co robot dostaje, kiedy wchodzi na stronę.
Jak mierzyliśmy — i jak sprawdzisz to sam
Dla każdej strony pobraliśmy dwa pliki: stronę główną i /robots.txt. Potem sprawdziliśmy siedem rzeczy, każdą z wagą punktową. Suma wag to 100 punktów i jest to skala niewidoczności: 0 = robot czyta wszystko, 100 = nie czyta nic. Każde sprawdzenie powtórzysz w przeglądarce w minutę — kolumna po prawej.
| Co sprawdzamy | Waga | Jak sprawdzić to samemu |
|---|---|---|
| robots.txt blokuje roboty AI (ChatGPT, Claude, Perplexity) | 30 | wpisz w przeglądarce swojadomena.pl/robots.txt — szukaj linii „Disallow: /” pod nazwą robota |
| treść doklejana skryptem — robot AI czyta prawie pustą stronę | 20 | Ctrl+U (podgląd źródła), potem Ctrl+F i nazwa firmy — jeśli nie ma, robot też jej nie widzi |
| brak danych strukturalnych schema.org — AI nie ma faktów o firmie | 20 | Ctrl+U, potem Ctrl+F i „application/ld+json” |
| brak adresu i telefonu w treści strony | 10 | Ctrl+U, potem Ctrl+F i własny numer telefonu |
| brak opisu meta description | 8 | Ctrl+U, potem Ctrl+F i „meta name="description"” |
| brak nagłówka H1 | 7 | Ctrl+U, potem Ctrl+F i „<h1” |
| brak mapy strony zadeklarowanej w robots.txt | 5 | swojadomena.pl/robots.txt — szukaj linii „Sitemap:” |
Blokady sprawdzaliśmy dla 13 robotów, po nazwach, którymi przedstawiają się w robots.txt: GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, anthropic-ai, Claude-Web, PerplexityBot i innych. Czego świadomie nie robiliśmy: nie pytaliśmy żadnego modelu, czy zna daną firmę. Odpowiedź modelu zmienia się przy każdym zapytaniu, więc nie da się jej ani powtórzyć, ani sprawdzić.
Wynik ogólny
Średnia niewidoczność 17.3 / 100 (mediana 14). Stron powyżej progu 40 punktów, czyli takich, gdzie brakuje więcej niż jednej rzeczy: 43 (10%).
| Czego brakuje | Stron | Udział |
|---|---|---|
| brak danych strukturalnych schema.org | 184 | 43% |
| brak mapy strony w robots.txt | 137 | 32% |
| brak nagłówka H1 | 102 | 24% |
| brak opisu meta description | 100 | 24% |
| brak adresu i telefonu w treści | 93 | 22% |
| treść doklejana skryptem (robot czyta pustą stronę) | 12 | 3% |
| robots.txt blokuje roboty AI | 9 | 2% |
Kto zamyka drzwi robotom AI? Najczęściej nie właściciel
9 z 424 stron ma w robots.txt wpis, który odsyła roboty ChatGPT, Claude czy Perplexity z kwitkiem. Sprawdziliśmy każdy z tych plików. 5 z 9 to identyczny, automatycznie wygenerowany blok „Cloudflare Managed content” — zarządzany robots.txt dostawcy CDN, z polityką ai-train=no i listą robotów z Disallow: /. Pozostałe cztery to ręczne wpisy, najczęściej w WordPressie.
Od 1 lipca 2025 Cloudflare domyślnie blokuje roboty AI dla nowych domen, a zarządzany robots.txt z sygnałem ai-train=no został włączony automatycznie na milionach domen. Dla wydawcy treści to ochrona. Dla pensjonatu, kliniki czy kancelarii, które chcą być polecane, to zamknięte drzwi, o których właściciel zwykle nie wie — bo ustawił je hosting albo wykonawca strony, jednym kliknięciem.
Naprawa jest równie prosta: jedno kliknięcie w panelu Cloudflare, albo własny robots.txt z jawnym Allow: / dla robotów, którym chcesz się pokazywać. Tak wygląda nasz.
Według branży
| Grupa | Stron | Śr. niewidoczność | Powyżej progu | Najczęstszy brak |
|---|---|---|---|---|
| Pensjonaty | 116 | 24.3 | 18 (16%) | brak danych strukturalnych — 69% |
| Kliniki i gabinety | 90 | 10.5 | 5 (6%) | nie ma nagłówka H1 — 30% |
| Hotele | 69 | 16.8 | 5 (7%) | brak danych strukturalnych — 46% |
| Biura nieruchomości | 64 | 16.9 | 5 (8%) | brak danych strukturalnych — 47% |
| Kancelarie | 37 | 8.7 | 2 (5%) | brak meta description — 27% |
| Salony beauty i SPA | 28 | 14.5 | 1 (4%) | brak adresu i telefonu — 36% |
Według miasta
| Grupa | Stron | Śr. niewidoczność | Powyżej progu | Najczęstszy brak |
|---|---|---|---|---|
| Warszawa | 122 | 12 | 6 (5%) | brak danych strukturalnych — 23% |
| Karwia | 38 | 22.5 | 7 (18%) | brak danych strukturalnych — 55% |
| Władysławowo | 35 | 21.1 | 3 (9%) | brak danych strukturalnych — 60% |
| Hel | 32 | 28.7 | 9 (28%) | brak danych strukturalnych — 69% |
| Sopot | 26 | 23.5 | 3 (12%) | brak danych strukturalnych — 69% |
Grupy liczące mniej niż 20 stron zostały pominięte — 19 stron w podziale branżowym i 88 w podziale miejskim. Procent z sześciu stron nie jest wynikiem badania, tylko anegdotą.
Co z tego wynika dla właściciela firmy
- 1. Sprawdź własny robots.txt. Wpisz swój adres i
/robots.txt. Jeśli widzisz tam nazwę któregoś z robotów i pod niąDisallow: /— albo blok „Cloudflare Managed content” — modele nie mają wstępu na Twoją stronę. To poprawka na kilka minut i najczęściej nikt jej nigdy świadomie nie ustawiał. - 2. Dodaj dane strukturalne. To najczęstszy brak w całym badaniu. Chodzi o kilkanaście linii opisujących firmę w formacie, który model rozumie bez zgadywania: nazwa, adres, telefon, godziny, rodzaj działalności.
- 3. Sprawdź, czy treść jest w kodzie strony. Jeśli po Ctrl+U nie ma nazwy Twojej firmy, to znaczy że treść dokleja skrypt już w przeglądarce. Człowiek zobaczy, robot nie zawsze.
Te same siedem sprawdzeń działa na stronie konkurencji. Jeśli Twoja ma 40 punktów, a strona obok 0 — to ona jest w odpowiedzi, nie Ty. Sprawdzenie obu zajmuje dwie minuty.
Żadna z tych rzeczy nie gwarantuje, że model zacznie polecać firmę. Gwarantuje tylko, że przestanie jej nie widzieć. Kto obiecuje pierwsze miejsce w odpowiedzi ChatGPT, obiecuje coś, czego nie da się ani ustawić, ani sprawdzić.
Metodologia, ograniczenia, dane
- Próba nie jest losowa. To firmy usługowe z sześciu branż, zebrane pod kątem działalności handlowej Deep DevOps. Wyniku nie należy uogólniać na całą polską gospodarkę.
- Nadpróbkowaliśmy wybrzeże celowo. 114 obiektów z Karwi, Władysławowa, Helu i Pucka (Puck poniżej progu 20, więc bez własnego wiersza) dobrano po to, żeby gminy nadmorskie dały się opisać osobno. Ponieważ obiekty noclegowe wypadają w tym badaniu gorzej niż kliniki czy kancelarie, podnosi to wynik ogólny — przy pierwszym pomiarze 307 stron, bez tej transzy, było to 37% zamiast 43%. Porównując branże albo miasta między sobą, korzysta się z tabel niżej, nie ze średniej ogólnej.
- Mierzyliśmy stronę główną. Podstrony mogą wyglądać inaczej.
- Pomiar jest z dnia skanu (18 sierpnia 2026 – 25 sierpnia 2026). Strona mogła się od tego czasu zmienić — i jeśli właściciel ją poprawił, ma rację, a my nie.
- Nazwy firm nie padają nigdzie — ani tutaj, ani w danych do pobrania. Każda zbadana firma może dostać swój indywidualny wynik na życzenie.
- Dane zbiorcze do pobrania: dane.json (licencja CC BY 4.0 — cytuj z linkiem do tej strony). Cięcie pod konkretne miasto albo branżę przygotuję na prośbę redakcji.
Źródła zewnętrzne
Chcesz wynik swojej strony?
Jeśli Twoja firma była w badaniu, wynik już jest — jedna kartka, z opisem, jak każdą rzecz sprawdzić samemu. Jeśli nie była, przeskanuję Twoją stronę tą samą metodą. Bez oferty i bez warunków — napisz albo zadzwoń.
Autor: Piotr Schumann, Deep DevOps — buduję strony i prowadzę własny pensjonat na Pomorzu, więc 69% wśród pensjonatów to dla mnie nie statystyka, tylko sąsiedzi.