SEO cho PDF

Index file PDF trên Google: hướng dẫn đầy đủ, từng bước một

Đăng ngày 22 avril 20267 min de lectureCập nhật ngày 15 juil. 2026

En bref

Google index một file PDF y như index một trang web, với ba điều kiện: file phải được lưu trữ công khai, chứa văn bản chọn được chứ không phải ảnh scan, và được liên kết từ ít nhất một trang mà Googlebot vào được. Để tăng tốc, hãy đặt file PDF lên một URL công khai, thêm vào sitemap và báo URL đó trực tiếp cho Google: khi đó việc thu thập dữ liệu thường bắt đầu trong chưa đầy một phút, đúng như với một trang HTML.

Google indexe-t-il vraiment les PDF ?

Oui, et depuis 2001. Les PDF apparaissent dans les résultats classiques avec la mention [PDF] devant le titre, accumulent de l’autorité comme les pages HTML, peuvent se positionner, transmettre du jus de lien vers d’autres PDF ou pages, et se trouvent avec l’opérateur filetype:pdf.

Ce qui a changé, c’est la vitesse. Là où un PDF mettait une à quatre semaines à être découvert naturellement, une soumission directe fait démarrer l’exploration dans la minute, exactement comme pour du HTML.

Liste de contrôle avant soumission

Avant d’envoyer l’URL, le fichier doit passer ces contrôles :

Étape 1 : optimiser le fichier lui-même

Le référencement d’un PDF se joue surtout sur ses métadonnées et sa structure :

Étape 2 : héberger sur une URL explorable

Déposez le PDF sur votre propre domaine, ou sur un CDN rattaché à votre domaine. Évitez les services tiers qui empêchent l’exploration. L’adresse doit ressembler à ceci :

text
https://votresite.fr/documents/guide-referencement.pdf

Vérifiez que le fichier est bien public : ouvrez une fenêtre de navigation privée et chargez l’URL. Si elle s’affiche, Google saura la récupérer.

Étape 3 : ajouter une page d’atterrissage

Un PDF se réfère nettement mieux quand une page HTML le décrit et le pointe. Créez une page — ou une section d’une page existante — qui :

Étape 4 : déclarer le PDF au sitemap

Les PDF sont des entrées de sitemap comme les autres. Ajoutez-les à côté de vos URL HTML :

xml
<url>
  <loc>https://votresite.fr/documents/guide-referencement.pdf</loc>
  <lastmod>2026-07-15</lastmod>
  <changefreq>yearly</changefreq>
  <priority>0.6</priority>
</url>

Étape 5 : signaler l’URL du PDF

C’est ici que le calendrier passe de plusieurs semaines à quelques minutes. Envoyez l’URL du PDF via Index Tức Thì ou directement par l’API d’indexation de Google. Le fichier est récupéré, analysé et traité dans le même circuit qu’une URL HTML.

javascript
await fetch("https://indextucthi.com/api/indexing/submit", {
  method: "POST",
  headers: {
    "Authorization": "Bearer ixvi_VOTRE_CLE",
    "Content-Type": "application/json",
  },
  body: JSON.stringify({
    urls: ["https://votresite.fr/documents/guide-referencement.pdf"],
  }),
});

Les échecs les plus fréquents

SymptômeCause probableCorrectif
Indexé sans aucun extrait de textePDF scanné, sans couche textePasser le fichier à l’OCR et le redéposer
Toujours absent après 24 heuresFichier derrière une authentification ou bloqué au robots.txtLe déplacer sur une URL publique
Indexé mais sur les mauvaises requêtesChamp Titre des métadonnées vide ou vagueRenseigner le Titre dans les propriétés
Deux versions indexéesUne version HTML et une version PDF coexistentPoser une canonique entre les deux
Indexé puis disparuSoft 404 : document presque videAjouter un contenu réel

Cas d’usage : les PDF qui portent vos liens

Les PDF hébergés sur des domaines universitaires, institutionnels ou de forte autorité sont précieux en netlinking. Mais un lien contenu dans un PDF ne transmet rien tant que Google n’a pas exploré ce PDF. Envoyez en lot les documents qui vous citent, et l’autorité arrive en quelques jours au lieu de plusieurs mois.

Câu hỏi thường gặp

Google có index được file PDF scan không?

Chỉ khi file đã được chạy OCR để rút ra phần văn bản. Một bản scan không có lớp văn bản bị coi như tài liệu rỗng và sẽ không xuất hiện ở bất kỳ truy vấn chữ nào. Hãy chạy OCR trước khi tải file lên.

Nếu đã có bản HTML thì có nên chặn file PDF không?

Không nhất thiết. Bạn có thể để cả hai cùng được index và đặt thẻ canonical trỏ về bản bạn ưu tiên. Rất nhiều người tìm kiếm đích danh file PDF — hướng dẫn sử dụng, báo cáo, bài nghiên cứu — và được lợi từ cả hai định dạng.

File PDF tối đa bao nhiêu thì còn được index?

Google xử lý file PDF tới khoảng 100 MB. Vượt mức đó, nội dung có thể bị cắt bớt. Hãy nén file trước khi tải lên, bằng công cụ tối ưu của Acrobat hoặc một tiện ích tương đương.

Liên kết trong file PDF có truyền sức mạnh không?

Có. Google xử lý liên kết trong file PDF như liên kết HTML: chúng truyền sức mạnh, anchor text được tính đến, và các thuộc tính như nofollow vẫn được tôn trọng nếu có.

Để Google quét trang của bạn ngay hôm nay

Tối đa 500 URL mỗi lần gửi, trạng thái thật cho từng dòng, API có trong mọi gói. Chúng tôi đảm bảo việc gửi URL và việc Google thu thập dữ liệu; việc index vẫn là quyết định của Google.

Đọc tiếp