Aller au contenu

Robot d'exploration

Aussi appelé : crawler, spider, bot

Un programme qui parcourt le web de lien en lien et télécharge les pages, pour le compte d'un moteur de recherche, d'un assistant IA ou d'un outil d'analyse.

Chaque robot se présente sous un nom (User-agent) : Googlebot pour Google, bingbot pour Bing, GPTBot ou ClaudeBot pour l'entraînement de modèles d'IA. C'est ce nom que vise une règle du fichier robots.txt.

Un robot respectueux lit robots.txt avant d'explorer et suit ses règles, mais rien ne l'y oblige techniquement. Et tous ne lisent pas une page comme un navigateur : beaucoup s'en tiennent au code HTML envoyé par le serveur, sans exécuter les scripts.

Voir aussi

Votre site est-il ouvert aux robots des IA ?

GPTBot, ClaudeBot, PerplexityBot : ce que votre robots.txt leur permet, robot par robot. Sans compte.