robots.txt pentru crawlerele AI
Crawlerele AI se controlează în robots.txt, individual, după user-agent. Distincția care contează: unii agenți colectează date pentru antrenare (GPTBot, ClaudeBot, CCBot), alții aduc citări și trafic în timp real (OAI-SearchBot, PerplexityBot, Google-Extended). Blocarea celor din a doua categorie te scoate din răspunsuri, nu doar din datele de antrenare.
DAN CRISTIAN · FONDATOR WEBSEM ·
Cine sunt agenții și ce fac
| User-agent | Proprietar | Ce face |
|---|---|---|
| GPTBot | OpenAI | Colectează pagini pentru antrenarea modelelor. |
| OAI-SearchBot | OpenAI | Indexează pentru căutarea din ChatGPT. Aduce citări și trafic. |
| ChatGPT-User | OpenAI | Vizitează o pagină la cererea explicită a unui utilizator. |
| ClaudeBot | Anthropic | Colectează pentru antrenare. |
| Claude-SearchBot | Anthropic | Indexează pentru citare în răspunsuri. |
| PerplexityBot | Perplexity | Indexează și citează. Trimite cel mai mult trafic din toate. |
| Google-Extended | Controlează folosirea în Gemini și AI Overviews, separat de Googlebot. | |
| CCBot | Common Crawl | Corpus public folosit indirect de aproape toate modelele. |
Greșeala cea mai costisitoare
Un val de site-uri au adăugat în 2023-2024 reguli de blocare pentru „boții AI”, copiate de pe forumuri. Multe dintre acele liste amestecă agenții de antrenare cu cei de căutare. Rezultatul: site-ul nu apare în ChatGPT Search sau în Perplexity, iar proprietarul nu înțelege de ce.
Distincția e simplă. Antrenarea e o decizie strategică — poți refuza legitim ca textul tău să intre într-un model. Citarea e distribuție: e echivalentul de a apărea în rezultatele Google. Puțini vor să renunțe la ea.
Configurația recomandată
Pentru un site comercial care vrea vizibilitate maximă în răspunsuri, dar păstrează controlul asupra antrenării:
ROBOTS.TXT
# Agenți de căutare și citare — permiși User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: Claude-SearchBot Allow: / User-agent: PerplexityBot Allow: / User-agent: Google-Extended Allow: / # Agenți de antrenare — decizia ta User-agent: GPTBot Allow: / User-agent: ClaudeBot Allow: / User-agent: CCBot Allow: / # Restul User-agent: * Allow: / Disallow: /admin/ Disallow: /cos/ Sitemap: https://exemplu.ro/sitemap.xml
Dacă vrei să refuzi antrenarea, schimbă Allow în Disallow doar la GPTBot, ClaudeBot și CCBot. Lasă agenții de căutare deschiși.
Ce nu rezolvă robots.txt
- Nu e o barieră tehnică. E o convenție pe care marii jucători o respectă, dar scraperele agresive o ignoră.
- Nu retrage conținutul deja intrat într-un model antrenat. Blocarea de azi se aplică viitorului.
- Nu împiedică un utilizator să lipească URL-ul tău în chat și modelul să citească pagina.
- Nu compensează un WAF care returnează 403 crawlerelor necunoscute — verifică și acolo.