Aller au contenu

Outil gratuit, sans compte

Votre site est-il ouvert aux robots des IA ?

ChatGPT, Claude, Perplexity, Gemini, Copilot : chaque assistant envoie ses propres robots. Indiquez un site ou une page, l'outil lit son fichier robots.txt et dit, robot par robot, qui peut passer.

Gratuit, sans compte. L'adresse saisie n'est pas enregistrée.

Trois familles de robots, trois décisions

Les robots de recherche

Ils construisent l'index dont un assistant tire les sources qu'il cite. Si votre objectif est d'apparaître dans ses réponses, ce sont eux qu'il faut laisser passer.

OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot, bingbot

Les lectures à la demande

Une personne colle une adresse ou pose une question, l'assistant ouvre la page à ce moment-là. Ces lectures sont déclenchées par quelqu'un, pas par une exploration du web.

ChatGPT-User, Claude-User, Perplexity-User, MistralAI-User

Les robots d'entraînement

Ils collectent des pages pour entraîner des modèles. Les autoriser ou les refuser est un choix d'éditeur, sans lien avec la présence du site dans la recherche des assistants.

GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, meta-externalagent, Amazonbot, CCBot, Bytespider

Dans le glossaire : GEO, robots.txt, robot d'exploration, llms.txt. Pour les moteurs de recherche classiques : indexabilité d'une page.

Refuser l'entraînement, rester lisible pour la recherche

Ce bloc, ajouté à un fichier robots.txt, refuse les robots d'entraînement listés par l'outil et ne touche ni aux robots de recherche ni aux lectures à la demande. À l'inverse, si rien dans votre fichier ne nomme ces robots, ils suivent la règle générale du site.

À ajouter au fichier robots.txt

User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: Amazonbot
User-agent: CCBot
User-agent: Bytespider
Disallow: /

Questions fréquentes

Si je refuse GPTBot, mon site disparaît-il de ChatGPT ?
Non, d'après la documentation d'OpenAI : GPTBot sert à l'entraînement des modèles, OAI-SearchBot à la recherche de ChatGPT, et les deux réglages sont indépendants. Anthropic sépare de même ClaudeBot, Claude-SearchBot et Claude-User. Chez Google, Google-Extended ne change rien à la présence d'un site dans la recherche.
Tous les robots respectent-ils le fichier robots.txt ?
Le fichier robots.txt est une consigne, pas une barrière : il n'a d'effet que sur les robots qui choisissent de le suivre. Les opérateurs listés ici documentent leurs robots et déclarent le respecter pour l'exploration ; certains préviennent que les lectures déclenchées par un utilisateur peuvent ne pas le suivre. Pour interdire réellement un accès, il faut un blocage côté serveur.
L'outil dit « autorisé », mais mon hébergeur bloque les robots des IA. Qui a raison ?
Les deux. L'outil lit le fichier robots.txt, rien d'autre. Un pare-feu, un réseau de diffusion ou un réglage de l'hébergeur peut écarter un robot que le fichier autorise : ce blocage-là ne se voit que dans les journaux du serveur ou dans la console de l'hébergeur.
Être lisible par ces robots suffit-il pour être cité par un assistant ?
Non. C'est une condition, pas une garantie : chaque assistant choisit ses sources, et personne ne peut promettre une citation. Un contenu clair, sourcé, et repris par d'autres sites de sa thématique met les chances de son côté.
À quoi sert le fichier llms.txt ?
C'est une convention récente : un fichier texte, à la racine du site, qui le présente aux assistants et pointe vers ses pages utiles. Elle est facultative, et son absence n'empêche aucun robot de lire le site. Fiablink en publie un.
L'adresse est-elle conservée ?
Non. Ni l'adresse ni le résultat ne sont enregistrés. L'outil est limité à quelques dizaines de contrôles par visiteur pour rester disponible pour tous.

Lisible par les assistants, puis présent dans ce qu'ils lisent

Les assistants composent leurs réponses à partir de contenus publiés en ligne. Un article sur un site de votre thématique sert votre référencement classique comme votre présence dans ces réponses. Nous ne promettons ni position ni citation.