Robots.txt et indexation : comment contrôler ce que Google explore sur votre site ?
Qu'est-ce que le fichier robots.txt ?
Le fichier robots.txt est un fichier texte placé à la racine de votre site web (accessible à l'adresse votre-site.fr/robots.txt). Il contient des instructions à destination des robots des moteurs de recherche (Googlebot, Bingbot, etc.) pour leur indiquer quelles parties du site ils peuvent explorer et indexer — et lesquelles ils doivent ignorer.
Syntaxe de base du fichier robots.txt
Voici les instructions les plus courantes :
User-agent: *— s'applique à tous les robotsDisallow: /admin/— interdit l'exploration du dossier /admin/Allow: /— autorise l'exploration de tout le siteSitemap: https://votre-site.fr/sitemap.xml— indique l'emplacement de votre sitemap
Un fichier robots.txt minimal pour un site vitrine ressemble à :
User-agent: * Allow: / Sitemap: https://www.votre-site.fr/sitemap.xml
Erreurs fréquentes dans le robots.txt
- Bloquer tout le site par erreur :
Disallow: /appliqué à tous les robots empêche complètement l'indexation. Erreur fatale souvent commise lors du développement et oubliée en production. - Bloquer les ressources CSS et JS : Google a besoin d'accéder aux feuilles de style et scripts pour rendre et évaluer correctement votre page.
- Oublier le lien vers le sitemap : indiquer votre sitemap dans le robots.txt facilite son exploration par Google.
- Utiliser robots.txt pour "sécuriser" des pages sensibles : robots.txt n'est pas un mécanisme de sécurité. Les pages bloquées peuvent quand même être indexées si elles ont des liens entrants.
Qu'est-ce qu'un sitemap XML et pourquoi est-il important ?
Le sitemap XML est un fichier qui liste toutes les URLs importantes de votre site avec des métadonnées (date de dernière modification, fréquence de mise à jour, priorité). Il aide Google à découvrir et indexer toutes vos pages, même celles qui ont peu de liens internes pointant vers elles. Il est particulièrement utile pour les sites avec beaucoup de pages ou une structure complexe.
Balise meta robots vs robots.txt : quelle différence ?
Les deux permettent de contrôler l'indexation, mais à des niveaux différents :
- robots.txt : contrôle l'exploration (crawling) au niveau du site entier ou de dossiers. Si vous bloquez une URL dans robots.txt, Google ne peut pas la lire — mais elle peut quand même apparaître dans les résultats si des liens externes pointent vers elle.
- Balise meta robots (
<meta name="robots" content="noindex">) : contrôle l'indexation au niveau de la page individuelle. C'est la méthode recommandée pour exclure une page spécifique des résultats Google.
💡 Des pages importantes de votre site ne sont pas indexées par Google ? SEOscore réalise un audit d'indexation complet et corrige les problèmes de robots.txt et de balises meta. Contactez-moi →