Sari la conținut
Unealtă gratuită

Verificare robots.txt pentru roboții AI

ChatGPT, Gemini, Perplexity, Claude și încă vreo 30 de motoare trimit roboți diferiți pe site-ul tău, iar fișierul robots.txt decide cine intră. Îi verificăm pe toți 35 și vezi în câteva secunde cine are voie și cine e blocat. Fără cont.

Gratuit, fără cont și fără email. Citim doar fișierul public robots.txt.

Ce este robots.txt

robots.txt e un fișier text din rădăcina site-ului, la exemplu.ro/robots.txt. Standardul are peste 30 de ani și e prima adresă pe care o cere orice robot, înainte de orice pagină. În el scrie ce roboți au voie și pe unde.

Regula e simplă: fiecare grup începe cu User-agent: și continuă cu linii Allow: sau Disallow:. Un grup scris pe numele exact al unui robot îl scoate pe acela din grupul general. De aici vin cele mai multe surprize: cineva a pus o regulă strictă pentru un robot anume, acum trei ani, și nimeni n-a mai deschis fișierul de atunci.

Fișierul nu e o poartă cu lacăt. E o listă de reguli pe care roboții serioși le respectă de bunăvoie. Roboții motoarelor AI mari fac parte din categoria asta.

Ce roboți verificăm

Verificăm 35 de roboți AI. Zece dintre ei alimentează direct motoarele mari, iar pe aceștia îi urmărim separat, fiindcă ei contează pentru clienți:

RobotAl cui eCe se întâmplă dacă îl blochezi
GPTBotOpenAISite-ul tău nu intră în ce știe ChatGPT despre nișa ta
OAI-SearchBotOpenAIIeși din căutarea ChatGPT, cea care dă linkuri
ChatGPT-UserOpenAIChatGPT nu-ți poate deschide pagina când i-o cere un om
ClaudeBot, Claude-UserAnthropicClaude nu te citește și nu te poate cita
PerplexityBot, Perplexity-UserPerplexityIeși dintr-un motor construit special pe citări
Google-ExtendedGoogleTextul tău nu se folosește în răspunsurile Gemini
GoogleOtherGooglePierzi accesul echipelor Google din afara căutării

Restul de 25 sunt bonus de acoperire: Applebot-Extended, CCBot (arhiva Common Crawl, din care se antrenează multe modele mici), Bytespider (ByteDance, adică TikTok), PetalBot (Huawei), DuckAssistBot, Amazonbot, MistralAI-User și alții. Dacă e blocat doar unul dintre ei, nu e o dramă. Dacă sunt blocați toți, cineva a copiat de undeva o listă de blocare.

Cum funcționează verificarea

  1. Scrii adresa site-ului. Fără cont, fără email și fără să ne dai acces la nimic.
  2. Citim fișierul public robots.txt și aplicăm regulile ca un crawler real: grupul scris pe numele robotului bate grupul general, iar dintre două reguli care se bat câștigă tiparul cel mai lung.
  3. Primești verdictul pe loc, robot cu robot: cine are voie, cine e blocat, ce pierzi la fiecare și ce scrii în fișier ca să repari.

Google-Extended nu e Googlebot

E confuzia cea mai scumpă din fișierul ăsta. Sunt doi roboți diferiți, cu roluri diferite:

  • Googlebot aduce paginile în căutarea Google. Blocat, dispari din rezultate.
  • Google-Extended decide doar dacă textul tău poate fi folosit în răspunsurile Gemini. Blocat, poziția în căutare rămâne neatinsă.

Deci un site poate sta bine în Google și, în același timp, să fie invizibil în Gemini. Unealta le arată separat, tocmai ca să nu le confunzi.

Cum repari, dacă ești blocat

Repararea e o modificare de fișier text, nu o refacere de site. Fișierul minim, care lasă toți roboții să intre și le arată sitemap-ul, arată așa:

User-agent: *
Allow: /

Sitemap: https://exemplu.ro/sitemap.xml

Dacă vrei să blochezi zone reale (coșul, contul, panoul de admin), blochează CĂILE, nu roboții: Disallow: /cos lovește o singură secțiune, în timp ce un Disallow: / pus pe GPTBot te scoate din toate răspunsurile.

Fișierul se urcă în rădăcina site-ului. Verifici singur, imediat: deschizi exemplu.ro/robots.txt în browser și te uiți la ce scrie.

Greșeli frecvente

  • Lista de blocare copiată de pe un blog. Multe articole din 2023 recomandau blocarea tuturor roboților AI. Atunci se discuta despre furt de conținut. Acum acolo se caută clienți.
  • Regula rămasă de la mediul de test. Site-ul de probă era blocat cu Disallow: /, iar fișierul a plecat în producție cu tot cu rând.
  • Plugin de securitate care blochează „boții”. Blochează și pe cei care aduc clienți, nu doar pe cei răi.
  • robots.txt servit ca pagină. Unele hosturi întorc site-ul pe orice adresă, iar fișierul nu există de fapt.
  • Linia Sitemap lipsă. Nu blochează pe nimeni, dar roboții pornesc mai greu. Vezi și generatorul llms.txt, care citește exact acea linie.

Blocarea poate fi o alegere corectă

Există site-uri pentru care blocarea are sens: publicații care trăiesc din abonamente, arhive de conținut plătit, baze de date proprii. Acolo, un răspuns AI care rezumă articolul înlocuiește vizita, deci vânzarea.

Pentru o firmă care vinde servicii sau produse, socoteala e pe dos. Nimeni nu cumpără un articol de la tine. Vrei să fii numit când cineva întreabă un chatbot pe cine să aleagă, iar pentru asta roboții trebuie să intre.

Accesul e doar pasul unu. Pasul doi e să ai pe site paginile care răspund la întrebările clienților, cu prețuri și condiții. Aici intră munca noastră, iar pachetele sunt pe pagina de prețuri.

Întrebări frecvente

Pentru orice altă nelămurire pe care o ai, scrie-ne.

Ce este robots.txt și de ce e important pentru AI?
E un fișier text din rădăcina site-ului (exemplu.ro/robots.txt) care spune roboților ce au voie să citească. Roboții motoarelor AI îl citesc primii, înainte de orice pagină, și îl respectă. Dacă acolo scrie că nu au voie, nu intră, iar conținutul tău nu ajunge în răspunsurile lor.
Ce se întâmplă concret dacă am GPTBot blocat?
Conținutul tău nu intră în ce știe ChatGPT despre nișa ta. Când un client întreabă „ce firmă îmi face X”, răspunsul se construiește din site-urile care au lăsat roboții să intre. Al tău nu e printre ele, oricât de bine ar arăta.
Dacă blochez roboții AI din robots.txt, îmi protejez conținutul?
Îl scoți din răspunsuri, nu îl protejezi. Textul tău public rămâne public. Blocarea are efect doar la recomandare: nu mai poți fi citat ca sursă. E o alegere bună pentru un site care trăiește din abonamente la conținut. Pentru o firmă care vrea clienți din AI e exact pe dos.
Google-Extended blocat îmi strică poziția în căutarea Google?
Nu. Google-Extended controlează doar dacă textul tău poate fi folosit în răspunsurile Gemini. Poziția în căutarea obișnuită o decide Googlebot, care e complet separat. Sunt două lucruri diferite, iar unealta ți le arată separat.
De ce verificați și roboți de care n-am auzit?
Pentru că unii alimentează lucruri pe care clienții tăi le folosesc fără să știe că sunt AI: căutarea din TikTok, asistentul de pe telefoanele Huawei, răspunsurile DuckDuckGo. Common Crawl e un caz aparte: e arhiva publică din care se antrenează multe modele mici, unele fără nicio cale de contact.
Site-ul meu nu are robots.txt. E o problemă?
Pentru acces, nu: fără fișier nimic nu e interzis, deci toți roboții intră. Pierzi însă linia Sitemap, cea care le arată de unde să înceapă. Un robots.txt scurt, care lasă totul deschis și indică sitemap-ul, e mai bun decât niciunul.
Am reparat robots.txt. Cât durează până se vede?
Roboții revin singuri, de la câteva zile la câteva săptămâni, în funcție de cât de des îți vizitează site-ul. Nu există un buton de grăbit. De aceea contează să afli devreme că erai blocat.
Dacă roboții au acces, apar sigur în ChatGPT?
Nu, accesul e doar condiția de intrare. Mai departe contează dacă ai pagini care răspund la întrebările clienților, cu prețuri, cifre și explicații clare. Asta se urmărește în timp, iar aici intră Outglow.