Robots.txt
Aussi appelé : fichier robots.txt
Un fichier texte à la racine d'un site, qui indique aux robots des moteurs les adresses qu'ils peuvent explorer et celles à laisser de côté.
Il s'organise en groupes : une ligne User-agent nomme le robot visé (ou « * » pour tous), suivie de règles Disallow et Allow. Quand plusieurs règles conviennent à une adresse, la plus précise l'emporte.
Il interdit l'exploration, pas l'indexation : une page bloquée peut encore apparaître dans les résultats, sans description, si des liens y mènent. Pour sortir une page de l'index, c'est la consigne noindex qu'il faut, sur une page que le robot peut lire.
Voir aussi
Une page peut-elle être indexée ?
Code HTTP, robots.txt, noindex, adresse canonique : le contrôle en quelques secondes, sans compte.