TL;DR : Google Search exige une directive « Allow » ou « Disallow » pour un groupe dans un robots.txt, sinon il considère un « Disallow » général.
Le 1er octobre 2026, j'ai constaté que, pour mon ancien blog, Google Search renvoyait : « Aucune information n'est disponible pour cette page. Découvrir pourquoi ».
Problème dans mon robots.txt, donc.
Je l'ai modifié début juin 2026 pour ajouter la directive « Crawl-delay » afin de prévenir les robots qui jouent le jeu que mon fail2ban tire à vue sur toute IP qui fera trop de requêtes.
J'ai ajouté cette directive dans le robots.txt de mon blog et dans celui de mon shaarli. Or, Google Search affiche toujours les résultats de mon shaarli.
Contenu pour mon blog :
User-agent: *
Crawl-Delay: 2
Pour mon shaarli :
User-agent: *
Crawl-Delay: 2
Disallow: /doc
La seule différence est donc une règle « Disallow » sur mon shaarli.
La norme robots.txt n'impose pas la présence d'une directive Allow ou Disallow. En l'absence de groupe (pour un User-Agent), ou en l'absence de règle au sein d'un groupe, alors le robot est autorisé. Google confirme cela dans sa documentation.
Le seul groupe applicable à Google Search sur mon blog était « * ». La directive « Crawl-Delay » est ignorée par Google. Donc groupe vide, donc autorisation de moissonner mon site web, donc aucune raison de ce comportement.
À l'encontre de ce diagnostic, le 1er octobre, j'ai complété le robots.txt de mon blog :
User-agent: *
Crawl-Delay: 2
Allow: /
Ce jour, je constate que Google Search affiche les informations pour les résultats de recherche issus de mon blog… Ce n'est pas conforme à la norme ni à la documentation de Google, mais ça fonctionne. Ne jamais lire la doc, c'est pour les faibles.