Aller au contenu

Robots.txt

Aussi appelé : fichier robots.txt

Un fichier texte à la racine d'un site, qui indique aux robots des moteurs les adresses qu'ils peuvent explorer et celles à laisser de côté.

Il s'organise en groupes : une ligne User-agent nomme le robot visé (ou « * » pour tous), suivie de règles Disallow et Allow. Quand plusieurs règles conviennent à une adresse, la plus précise l'emporte.

Il interdit l'exploration, pas l'indexation : une page bloquée peut encore apparaître dans les résultats, sans description, si des liens y mènent. Pour sortir une page de l'index, c'est la consigne noindex qu'il faut, sur une page que le robot peut lire.

Voir aussi

Une page peut-elle être indexée ?

Code HTTP, robots.txt, noindex, adresse canonique : le contrôle en quelques secondes, sans compte.