Xử lý sự cố

Google không index bài viết: 9 nguyên nhân và cách khắc phục

Đăng ngày 8 avril 20268 min de lectureCập nhật ngày 1 sept. 2026

En bref

Google không index một trang vì chín lý do thường gặp: chỉ thị noindex trong thẻ meta hoặc header X-Robots-Tag, bị chặn trong robots.txt, lỗi soft 404, nội dung trùng lặp hoặc quá mỏng, thẻ canonical trỏ sang URL khác, uy tín tên miền quá yếu, máy chủ quá chậm, kết xuất JavaScript thất bại, hoặc liên kết nội bộ quá ít. Hãy sửa các lỗi kỹ thuật trước, rồi mới yêu cầu thu thập dữ liệu lại bằng cách báo URL trực tiếp cho Google.

Commencez par l’outil d’inspection d’URL

Avant de deviner, collez l’URL dans Google Search Console → Inspection de l’URL. L’outil indique précisément pourquoi Google a écarté la page et laquelle des neuf causes ci-dessous s’applique. Les libellés les plus fréquents :

Cause 1 : une directive noindex est en place

Une balise <meta name="robots" content="noindex"> dans l’en-tête HTML, ou un en-tête HTTP X-Robots-Tag: noindex, demande explicitement à Google d’ignorer la page. C’est la première cause d’échec sur les sites récents, parce que beaucoup de frameworks livrent un noindex en mode développement que personne ne pense à retirer en production.

Correctif : lancez curl -I sur l’URL et lisez les en-têtes, puis affichez le code source et cherchez la chaîne « noindex ». Retirez-la partout où elle apparaît, redéployez, puis signalez l’URL pour une nouvelle exploration.

Cause 2 : le robots.txt bloque l’URL

Ouvrez https://votresite.fr/robots.txt et cherchez une ligne Disallow qui correspond à votre chemin. L’erreur classique consiste à livrer un Disallow: / global pour la préproduction et à oublier de le modifier en production.

Cause 3 : une soft 404

Votre page renvoie bien un code 200, mais son contenu ressemble à une page d’erreur : « désolé, cette page n’existe plus », un listing produit vide, un panneau de résultats sans résultat. Google classe cela en soft 404 et refuse d’indexer. Pire, cela dégrade la confiance accordée aux chemins voisins.

Correctif : soit vous remplissez la page avec un contenu réel, soit vous renvoyez un vrai code 404 pour que Google l’ignore proprement.

Cause 4 : contenu dupliqué ou trop court

Si votre page reprend en grande partie une autre page du site — ou de n’importe où sur le web — Google en choisit une comme canonique et écarte les autres. Les pages courtes, faites surtout d’éléments récurrents et déclinées sur des dizaines d’URL, subissent le même sort.

Correctif : regroupez les doublons avec une redirection 301 ou une balise rel=canonical. Étoffez les pages minces avec du contenu réellement utile, pas du remplissage.

Cause 5 : une balise canonique mal placée

Votre page déclare comme canonique une autre adresse, soit par accident — une canonique posée au niveau du gabarit et héritée par toutes les pages filles — soit parce qu’une extension du CMS la génère automatiquement. Google respecte la déclaration et refuse d’indexer la page que vous vouliez.

Correctif : sous Next.js, déclarez alternates: { canonical: "./" } dans les métadonnées du gabarit racine, pour que chaque page se déclare elle-même. Sous WordPress, vérifiez les réglages de Yoast ou de Rank Math. Contrôlez toujours avec curl -s <url> | grep canonical.

Cause 6 : une autorité de domaine trop faible

Un domaine neuf, sans le moindre lien entrant, n’émet aucun signal de confiance. Google explorera vos pages, mais les traitera comme peu prioritaires et pourra refuser de les indexer si le contenu n’a rien d’exceptionnel.

Correctif : c’est un chantier de plusieurs mois, pas une correction d’après-midi. Obtenez des liens légitimes — articles invités, annuaires professionnels sérieux, mentions presse — publiez du contenu de fond, et concentrez l’autorité sur vos pages prioritaires par le maillage interne.

Cause 7 : un serveur trop lent

Si Googlebot rencontre régulièrement un temps de réponse supérieur à cinq secondes ou des erreurs 5xx, il lève le pied. La fréquence d’exploration baisse, le référencement ralentit, et des pages finissent par sortir de l’index.

Correctif : consultez les statistiques d’exploration dans la Search Console. Visez un temps de réponse initial sous les 200 ms : mise en cache, hébergement plus solide, CDN, requêtes de base de données optimisées.

Cause 8 : un rendu JavaScript qui échoue

Si votre contenu n’apparaît qu’après exécution du JavaScript côté navigateur, Googlebot doit traiter la page en deux passes. La seconde est mise en file et peut prendre plusieurs jours. Si votre script échoue, Google voit une page quasi vide et n’indexe rien.

Correctif : générez le contenu essentiel côté serveur. Utilisez « Tester l’URL en direct » puis la capture d’écran de l’outil d’inspection pour voir ce que Google a réellement vu. Si la capture est blanche, votre problème est le rendu, pas le référencement.

Cause 9 : un maillage interne insuffisant

Si votre nouvelle page n’est accessible que par une ligne de sitemap, sans aucun lien depuis le reste du site, Google la traite comme secondaire. Le maillage interne est un signal d’importance, et son absence en est un aussi.

Correctif : liez chaque nouvelle page depuis l’accueil, des articles connexes, la navigation ou une page de catégorie. Le minimum acceptable est un lien entrant depuis une page explorée régulièrement.

Après la correction : redemandez une exploration

Une fois le blocage levé, rien n’oblige à attendre que Google s’en aperçoive. Signalez l’URL directement, par l’API d’indexation ou par Index Tức Thì, et Googlebot repasse en général dans la minute. Si la correction est réelle, la page repart dans le circuit sans autre intervention.

Câu hỏi thường gặp

« Đã phát hiện — hiện chưa lập chỉ mục » nghĩa là gì?

Google đã tìm ra URL qua một liên kết hoặc một sitemap nhưng chưa quét nó. Nguyên nhân thường gặp là ngân sách thu thập dữ liệu không đủ, mức ưu tiên bị đánh giá quá thấp, hoặc máy chủ chậm khiến Googlebot giảm tốc. Báo URL trực tiếp sẽ đi vòng qua hàng đợi này.

« Đã thu thập dữ liệu — hiện chưa lập chỉ mục » nghĩa là gì?

Google đã tải trang về và quyết định không giữ lại. Gần như luôn là vấn đề nội dung: trang quá ngắn, trùng lặp, lỗi soft 404 hoặc tên miền không có uy tín. Hãy sửa phần nội dung, rồi gửi lại URL.

Chờ bao lâu thì nên kết luận là Google sẽ không index trang của tôi?

Với một site đã có tuổi, 48 giờ. Với một site mới, hai tuần. Quá mốc đó, trang đang vướng một rào cản cụ thể và sẽ không vào được chỉ mục chừng nào rào cản ấy chưa được gỡ.

Có thể ép Google index một trang không?

Bạn có thể ép việc thu thập dữ liệu: đó chính xác là những gì một lần gửi URL trực tiếp làm được. Bạn không thể ép việc lập chỉ mục nếu Google cho rằng trang đó không xứng đáng. Gửi URL là điều kiện cần, không phải điều kiện đủ, và bất kỳ dịch vụ nào hứa ngược lại đều đang hứa quá tầm của mình.

Để Google quét trang của bạn ngay hôm nay

Tối đa 500 URL mỗi lần gửi, trạng thái thật cho từng dòng, API có trong mọi gói. Chúng tôi đảm bảo việc gửi URL và việc Google thu thập dữ liệu; việc index vẫn là quyết định của Google.

Đọc tiếp