Technique6 min de lecture
Faut-il bloquer ou autoriser les crawlers IA sur son site ?
GPTBot, ClaudeBot, PerplexityBot, Google-Extended : quatre robots, quatre usages différents, et une décision qui n'est pas la même pour une agence, un éditeur de presse ou une marque. Ce que chaque robot fait vraiment, et comment trancher.
LevuppL'équipe
Bloquer un crawler d'IA revient à demander à ne pas être cité par le moteur qui l'emploie. Pour une entreprise qui vend une prestation, c'est presque toujours une mauvaise affaire : elle échange une visibilité réelle contre une protection théorique, puisque son contenu commercial n'a aucune valeur d'entraînement particulière. La décision est inverse pour un éditeur dont le contenu est le produit vendu. Le point à comprendre avant de trancher est que l'entraînement et la citation passent par des robots différents.
Les quatre robots à connaître
Ils ne font pas le même travail, et c'est toute la question.
GPTBot, d'OpenAI. Il collecte des pages pour l'entraînement des modèles. Le bloquer retire vos contenus des futurs entraînements. Il ne conditionne pas la capacité de ChatGPT à aller lire votre page en direct pendant une conversation.
OAI-SearchBot, d'OpenAI également. Celui-ci sert la recherche : c'est lui qui alimente les citations de ChatGPT quand il consulte le web. Le bloquer vous retire des citations. Beaucoup de sites ont bloqué GPTBot en croyant se protéger et ont laissé passer celui-ci, ou l'inverse, sans mesurer la différence.
ClaudeBot, d'Anthropic, avec le même partage entre collecte et recherche selon les agents déclarés.
PerplexityBot. Perplexity fonctionne surtout en recherche directe, son robot alimente donc principalement les citations. Le bloquer revient à sortir des réponses.
Google-Extended. C'est le cas le plus mal compris, et il vaut la peine d'être posé clairement : Google-Extended n'est pas un robot d'exploration. C'est un jeton qui, dans votre robots.txt, dit à Google de ne pas utiliser votre contenu pour l'entraînement de Gemini. Il n'a aucun effet sur votre présence dans les Aperçus IA, qui reposent sur l'index de recherche classique. Le bloquer ne vous protège pas des aperçus, cela vous retire seulement des données d'entraînement.
La distinction qui décide de tout
Il y a deux usages différents de votre contenu, et confondre les deux mène à des décisions absurdes.
L'entraînement. Vos pages entrent dans le corpus qui sert à fabriquer un modèle. Vous n'êtes pas cité, vous n'apparaissez nulle part, et votre contenu contribue à une capacité générale. C'est l'usage que la plupart des gens veulent bloquer, et c'est celui dont l'impact commercial est le plus faible pour une PME.
La recherche et la citation. Le moteur va lire votre page pendant qu'il répond à quelqu'un, et il vous cite. C'est votre visibilité. C'est l'usage qu'il ne faut pas bloquer si vous cherchez des clients.
Un troisième usage existe, moins discuté : les agents qui naviguent pour le compte d'un utilisateur, par exemple pour comparer des prix ou remplir un formulaire. Ils se multiplient et posent des questions différentes, plus proches de la charge serveur que du droit d'auteur.
La décision, selon qui vous êtes
Une entreprise qui vend une prestation ou un produit. Autorisez tout. Votre site est une plaquette commerciale, sa valeur d'entraînement est nulle et sa valeur de citation est votre canal d'acquisition de demain. Bloquer, ici, c'est payer une assurance contre un risque inexistant avec une monnaie qui a de la valeur.
Un éditeur de presse ou de contenu payant. La décision est inverse, et légitime. Votre contenu est le produit. Le bloquer pour l'entraînement tout en négociant des accords de licence est une stratégie cohérente, et c'est celle qu'ont suivie plusieurs groupes français. Autoriser la recherche reste discutable au cas par cas.
Une place de marché ou un site à forte valeur de données. Le sujet est moins le droit d'auteur que le pillage de catalogue par des concurrents. Le blocage sélectif a du sens, et il doit s'accompagner de mesures qui fonctionnent réellement, ce que le robots.txt ne fait pas.
Un site institutionnel ou associatif. Autorisez. Être cité correctement vaut mieux qu'être décrit de mémoire à partir de sources tierces.
Ce que le robots.txt fait, et ne fait pas
C'est une déclaration de politesse, pas une barrière. Les robots des grands acteurs la respectent et le déclarent publiquement. Les autres, non.
Trois conséquences pratiques.
Le `robots.txt` ne protège pas contre l'aspiration. Si votre préoccupation est le vol de contenu par des acteurs non identifiés, il faut du filtrage au niveau du serveur ou du réseau, une limitation de débit, et éventuellement un service dédié. Écrire une ligne dans un fichier texte ne fait rien contre quelqu'un qui a décidé de l'ignorer.
Le blocage n'a pas d'effet rétroactif. Ce qui a déjà été collecté l'est. Bloquer aujourd'hui agit sur les entraînements futurs, pas sur les modèles existants.
Un blocage mal écrit bloque plus que prévu. L'erreur la plus fréquente est un User-agent: * suivi d'un Disallow: / posé « le temps de tester », qui retire le site de Google entier. La seconde est de bloquer l'agent de recherche en croyant bloquer celui d'entraînement.
Comment vérifier ce qui passe réellement chez vous
Ne vous fiez pas au fichier, regardez les journaux du serveur. Filtrez sur les chaînes d'agent utilisateur des robots concernés et regardez trois choses : lesquels viennent, à quelle fréquence, et quelles pages ils demandent.
Deux surprises fréquentes. La première : des robots que vous croyiez bloqués passent, parce que la règle a été écrite pour un nom d'agent qui a changé. La seconde : la charge est parfois loin d'être négligeable sur un site à catalogue, et c'est un argument technique qui vaut la discussion, indépendamment de toute considération sur le droit d'auteur.
Notre position, et pourquoi nous la publions
Le robots.txt de ce site accueille GPTBot, ClaudeBot, PerplexityBot et Google-Extended. Nous vendons une prestation, pas un contenu, et nous expliquons par ailleurs comment se rendre citable par ces moteurs. Les bloquer serait demander à ne pas être cité tout en vendant l'inverse.
Un éditeur de presse arbitre différemment, et il a de bonnes raisons. La question n'a pas de réponse unique, elle a une réponse par modèle économique.
Questions fréquentes
Bloquer GPTBot me retire-t-il de ChatGPT ?
Pas des réponses où ChatGPT consulte le web en direct, qui dépendent d'un autre agent, OAI-SearchBot. Bloquer GPTBot vous retire des données d'entraînement des futurs modèles, ce qui affecte ce que le modèle sait de vous de mémoire, pas ce qu'il peut aller lire pendant une conversation. Les deux décisions se prennent séparément.
Bloquer Google-Extended me retire-t-il des Aperçus IA ?
Non. Les Aperçus IA s'appuient sur l'index de recherche classique de Google, celui alimenté par Googlebot. Google-Extended ne concerne que l'utilisation de votre contenu pour l'entraînement des modèles Gemini. Il n'existe pas, à ce jour, de moyen de figurer dans l'index de Google tout en étant exclu des Aperçus IA.
Le blocage protège-t-il juridiquement mes contenus ?
Il matérialise une opposition, ce qui peut avoir son utilité dans un dossier, notamment au regard de l'exception de fouille de textes et de données et du droit d'opposition prévu par la directive européenne sur le droit d'auteur. Ce n'est pas un avis juridique et la matière est mouvante. Si l'enjeu est réel pour vous, faites-le qualifier par un avocat plutôt que par une agence web.
Que faire des robots qui ignorent le robots.txt ?
Passer au niveau du serveur : blocage par adresse ou par agent dans la configuration, limitation de débit, service de protection devant le site. C'est un travail d'infrastructure, pas de fichier texte. Regardez d'abord vos journaux pour savoir si le problème est réel avant d'investir.
En pratique
Ouvrez votre robots.txt, listez ce qui y est déclaré, comparez aux journaux du serveur, et vérifiez que ce que vous croyez bloquer correspond à ce que vous vouliez bloquer. Dans la majorité des cas que nous auditons, il y a un écart, et il n'a pas été choisi. Le reste du travail de visibilité dans les moteurs de réponse est décrit dans notre offre d'agence GEO et dans notre article sur l'écriture des pages citables.
À lire ensuiteTous les articles
On construit le vôtre ?
Racontez-nous ce que vous avez en tête,on vous dit ce qu'on en ferait.
Démarrer un projet




