---
title: "Robots IA et agents : comment ils lisent votre site"
description: "Entraînement, index de recherche et requête utilisateur : trois robots, trois règles. Comment piloter ce que les entreprises d’IA font sur votre site en 2026."
url: https://torn.studio/fr/articles/robots-ia-et-agents-sur-votre-site
locale: fr
published: 2026-08-28
---

# Robots IA et agents : comment ils lisent votre site

> **Réponse courte:** Les robots d’IA font trois métiers : entraîner des modèles, bâtir des index de recherche et récupérer des pages pour un utilisateur. Chaque grand labo documente des robots séparés par usage, donc bloquer l’entraînement préserve la visibilité dans les réponses IA. Les requêtes utilisateur ignorent en général robots.txt, et Cloudflare active des blocages par défaut le 15 septembre 2026.

La question de bloquer les robots IA est devenue trois questions, car les robots font désormais trois métiers différents, aux trois conséquences différentes. Les traiter comme une seule décision revient le plus souvent à bloquer la mauvaise chose.

## Quels robots passent, et que font-ils ?

OpenAI documente quatre agents : GPTBot collecte des données d’entraînement, OAI-SearchBot bâtit l’index de recherche, ChatGPT-User récupère des pages à la demande d’un utilisateur et OAI-AdsBot examine les publicités. La documentation est directe sur la conséquence : un site qui ferme la porte à OAI-SearchBot restera absent des réponses de recherche de ChatGPT, tandis qu’un GPTBot bloqué arrête seulement l’entraînement. Anthropic opère le même découpage avec ClaudeBot, Claude-SearchBot et Claude-User, et Google distingue Googlebot, le réglage d’entraînement Google-Extended et le nouveau robot d’agent Google-Agent, arrivé en mars 2026.

Ce découpage rend la décision gérable : bloquer l’entraînement et conserver la visibilité sont deux lignes différentes de robots.txt. Meta documente la même division en trois dans sa [documentation crawler](https://developers.facebook.com/docs/sharing/webmasters/web-crawlers/), qui décrit aussi le robot d’index de recherche Meta-WebIndexer.

## Les robots respectent-ils robots.txt ?

En partie, et la différence est documentée. La documentation crawler de Google indique que les requêtes déclenchées par un utilisateur ignorent en général robots.txt parce qu’une personne a demandé la page, et OpenAI comme Perplexity écrivent la même chose de leurs équivalents. La mesure de TollBit sur le quatrième trimestre 2025, rapportée par Digiday en février 2026, a de plus trouvé 30 % des récupérations IA passant outre les règles robots.txt, et jusqu’à 42 % pour ChatGPT-User. Robots.txt est une déclaration d’intention ; un blocage réel passe par un pare-feu ou un CDN.

## Qu’est-ce qui change dans l’infrastructure ?

- Cloudflare classe le trafic IA en catégories recherche, agent et entraînement depuis juillet 2026, et bloque entraînement et agents par défaut pour les nouveaux domaines porteurs de publicité à partir du 15 septembre 2026
- La norme IETF sur les préférences IA, avec des auteurs de Google et Mozilla, atteint son jalon final en août 2026 avec une règle Content-Usage pour robots.txt
- Web Bot Auth permet aux robots de s’identifier cryptographiquement, et Google teste le protocole pour ses agents depuis mai 2026
- Les rails de paiement comme le pay-per-crawl de Cloudflare restent en bêta fermée, et aucun géant de l’IA ne paie encore ouvertement via la norme de licence RSL

Le très commenté fichier llms.txt appartient à la même colonne sobre : Ahrefs a examiné 137 000 domaines en juin 2026 et trouvé que 97 % des fichiers ne reçoivent jamais la moindre requête, et Google a répété que la recherche l’ignore.

## Votre site est-il construit pour les agents ?

Les agents qui font des démarches pour les utilisateurs sont devenus quotidiens en 2026 : Comet de Perplexity est gratuit et disponible sur iPhone, Claude clique et remplit des formulaires via le navigateur sur toutes les offres payantes, et Gemini de Google mène des démarches web avec les identifiants de l’utilisateur. Les conseils de Google pour un site accueillant aux agents sont concrets : de vrais boutons et liens en HTML sémantique, une mise en page stable et des formulaires correctement étiquetés, car les agents lisent le DOM, des captures d’écran et l’arbre d’accessibilité. Tout cela rend aussi le site meilleur pour les humains.

**À lire ensuite**

- [La recherche IA fin 2026 : la vue d’ensemble pour votre site](https://torn.studio/fr/articles/recherche-ia-fin-2026)
- [Gagner des clients quand l’IA répond en premier](https://torn.studio/fr/articles/gagner-des-clients-quand-lia-repond-en-premier)
- [IA et automatisation au retour mesurable](https://torn.studio/fr/prestations/ia-et-automatisation)

## Questions fréquentes

### Quels robots IA laisser passer pour gagner des clients via les réponses IA ?

Les robots d’index de recherche et de requête utilisateur : OAI-SearchBot et ChatGPT-User pour ChatGPT, Claude-SearchBot et Claude-User pour Claude, PerplexityBot pour Perplexity, plus Googlebot et bingbot. Les robots d’entraînement comme GPTBot et ClaudeBot relèvent d’une décision séparée, détachée de la visibilité.

### Le fichier robots.txt arrête-t-il vraiment les robots IA ?

Seulement les crawlers déclarés. Les requêtes déclenchées par un utilisateur ignorent en général le fichier, d’après la documentation de Google, d’OpenAI et de Perplexity, et TollBit a mesuré 30 % de récupérations IA passant outre les règles au quatrième trimestre 2025. Pour fermer vraiment la porte, il faut des règles de pare-feu ou de CDN.

### Cloudflare peut-il bloquer des robots IA à ma place ?

Oui. Pour les nouveaux domaines et les nouveaux sites porteurs de publicité, les robots d’entraînement et d’agent sont bloqués par défaut à partir du 15 septembre 2026, tandis que les robots de recherche passent. Si votre site est derrière Cloudflare, passez les réglages en revue pour que le choix par défaut soit un choix que vous avez réellement fait.

### Puis-je faire payer les entreprises d’IA qui lisent mon contenu ?

Les rails existent mais l’argent reste maigre. Le pay-per-crawl de Cloudflare est en bêta fermée, la norme de licence RSL réunit des acteurs d’infrastructure et des éditeurs mais encore aucun géant de l’IA payant ouvertement, et le partage de revenus de Perplexity couvre les éditeurs inscrits. Pour la plupart des entreprises, la visibilité reste toute la rétribution.

### Comment vérifier qu’un robot est bien celui qu’il prétend être ?

Contrôlez l’expéditeur contre les listes d’adresses IP publiées par les entreprises, comme les fichiers JSON d’OpenAI et d’Anthropic. L’étape suivante est l’identification cryptographique via Web Bot Auth, que Google teste pour ses agents depuis mai 2026 et que Cloudflare utilise déjà pour les agents signés.

### Mon site supporte-t-il les agents IA qui cliquent et remplissent des formulaires ?

Testez vous-même : le parcours principal du site se termine-t-il au clavier, les boutons et liens utilisent-ils de vrais éléments avec étiquettes, et le contenu reste-t-il en place pendant le chargement ? Les conseils de Google pour les agents recoupent presque entièrement le travail d’accessibilité, donc l’effort paie deux fois.

## Sources

- [OpenAI bots and crawlers — OpenAI developer docs](https://developers.openai.com/api/docs/bots) — La documentation de GPTBot, OAI-SearchBot, ChatGPT-User et OAI-AdsBot, et la règle qu’un OAI-SearchBot bloqué retire le site des réponses de recherche de ChatGPT.
- [Does Anthropic crawl data from the web? — Anthropic Help Center](https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler) — Le découpage d’Anthropic en ClaudeBot, Claude-SearchBot et Claude-User, avec pilotage robots.txt et listes d’IP.
- [Google user-triggered fetchers — Google Crawling Infrastructure](https://developers.google.com/crawling/docs/crawlers-fetchers/google-user-triggered-fetchers) — Google-Agent et l’indication que les requêtes déclenchées par un utilisateur ignorent en général robots.txt, mise à jour le 19 août 2026.
- [Perplexity crawlers — Perplexity docs](https://docs.perplexity.ai/guides/bots) — PerplexityBot pour l’index de recherche, et Perplexity-User qui ignore en général robots.txt lors des requêtes utilisateur.
- [Your site, your rules: new AI traffic options — Cloudflare](https://blog.cloudflare.com/content-independence-day-ai-options/) — Les catégories recherche, agent et entraînement, et les blocages par défaut arrivant le 15 septembre 2026.
- [AI licensing deals, protection measures aren’t slowing web scraping — Digiday](https://digiday.com/media/in-graphic-detail-ai-licensing-deals-protection-measures-arent-slowing-web-scraping/) — La mesure de TollBit : 30 % des récupérations IA ont contourné robots.txt au quatrième trimestre 2025, 42 % pour ChatGPT-User.
- [We Analyzed 137K Sites: 97% of llms.txt Files Never Get Read — Ahrefs](https://ahrefs.com/blog/llmstxt-study/) — L’étude de juin 2026 sur 137 210 domaines, où 97 % des fichiers llms.txt n’ont jamais reçu de requête.
- [Build agent-friendly websites — web.dev](https://web.dev/articles/ai-agent-site-ux) — Les conseils de Google pour les sites accueillants aux agents : HTML sémantique, mises en page stables, et des agents qui lisent le DOM, des captures d’écran et l’arbre d’accessibilité.
