Vérificateur d'indexabilité

Vérifier l'indexabilité
Suivant

Une page peut être parfaitement bonne mais invisible pour la recherche parce qu’une seule balise indique “noindex” ou que robots.txt bloque le crawler. Collez une URL et ce vérificateur évalue chaque signal utilisé par Google, robots.txt, méta robots, en-tête X-Robots-Tag, cible canonique, statut HTTP, et vous dit si la page est indexable, pourquoi, et ce qu’il faut changer si ce n’est pas le cas.

Comment vérifier l'indexabilité

  1. 1

    Entrez une URL

    Le vérificateur récupère l'URL comme le ferait Googlebot.

  2. 2

    Il résout les redirections

    Une chaîne de sauts 301/302 est tracée ; l'URL finale est celle évaluée.

  3. 3

    Il lit chaque signal d'indexabilité

    règles robots.txt, méta robots, X-Robots-Tag, canonique, code de statut.

  4. 4

    Verdict et raison

    Indexable / non indexable / partiel, avec le signal exact qui a causé le verdict.

Signaux d'indexabilité et leur priorité

Google évalue un ensemble de signaux dans un ordre spécifique ; un seul négatif dans la chaîne suffit à bloquer l’indexation.

Ordre d’évaluation des signaux

  1. Statut HTTP : 2xx requis. Les chaînes 3xx sont suivies ; 4xx et 5xx mettent fin à l’indexation.
  2. robots.txt : si l’URL est interdite pour Googlebot, la page n’est jamais explorée, ce qui signifie que les balises noindex ne sont jamais vues.
  3. En-tête X-Robots-Tag : noindex dans les en-têtes de réponse HTTP bloque l’indexation.
  4. Méta robots : <meta name="robots" content="noindex"> bloque l’indexation.
  5. Canonique : un canonique pointant ailleurs signifie que Google indexe cette autre URL à la place.
  6. Qualité du contenu et détection des doublons : Google peut ignorer l’indexation même sans directives explicites.

Erreurs courantes que cela détecte

Problème Cause
Section entière non indexée Règle Disallow: dans robots.txt
Page spécifique non indexée noindex dans méta robots
Indexée avec une mauvaise URL Canonique pointe ailleurs
Bloqué à 5xx Erreur serveur interrompt l’exploration
Conflit Disallow + noindex Robots.txt bloque l’exploration, balise noindex jamais lue
Fuites de staging vers la production X-Robots-Tag: noindex restant d’un environnement de test

Le piège robots.txt + noindex

Si vous Disallow: une URL dans robots.txt, Google ne l’explore jamais, donc il ne voit jamais de balise noindex. L’URL peut toujours apparaître dans les résultats de recherche comme une entrée “vide” avec seulement l’URL et sans description. Pour retirer correctement une URL de l’index, autorisez l’exploration et utilisez noindex, puis bloquez l’exploration seulement après que Google l’ait désindexée.

Test depuis la perspective de Googlebot

Le vérificateur envoie l’agent utilisateur Googlebot, donc tous les trucs côté serveur “les crawlers ne voient que X” sont visibles. Vérifiez toujours les URL de production, pas celles de staging.

Questions fréquentes

Être indexable signifie seulement qu’il n’y a pas de blocage technique ; cela ne garantit pas l’indexation. Google décide également en fonction de la qualité perçue, du contenu dupliqué et du budget d’exploration. Utilisez l’Inspection d’URL de la Search Console pour une réponse définitive de Google lui-même.

En général, juste méta robots (ou X-Robots-Tag) est la bonne réponse. Robots.txt bloque l’exploration ; méta robots bloque l’indexation. Pour les pages que vous ne voulez pas indexées, autorisez l’exploration afin que Google puisse lire votre balise noindex.

Google évalue la destination finale d’une chaîne de redirection. Un 301 de A à B signifie que Google indexe finalement B, pas A. Le vérificateur simule cela en résolvant toutes les redirections avant d’évaluer.

Non. Les pages nécessitant une authentification ne sont pas indexables par définition. Si vous avez besoin de SEO pour elles, envisagez une version de prévisualisation publique.

Outils similaires

Outil disponible dans d’autres langues