Aller au contenu
HandfulTools

Extraire le texte d'un PDF (et quand c'est impossible)

Récupérez le texte d'un PDF en texte brut, comprenez pourquoi un PDF scanné ne donne rien, et nettoyez les retours à la ligne avant de le réutiliser.

· 3 min de lecture

Pour extraire le texte d'un PDF, déposez-le dans PDF en texte : l'outil lit la couche texte du fichier et vous donne du texte brut à copier ou à télécharger en .txt. Cela fonctionne pour les PDF issus d'un document ou d'une page web — pas pour les scans, qui contiennent des images de texte et non du texte.

La méthode rapide

  1. Ouvrez PDF en texte et déposez votre PDF.
  2. Cochez Ajouter des séparateurs de pages si vous voulez savoir de quelle page vient chaque passage.
  3. Cliquez sur Extraire le texte.
  4. Copiez le résultat ou téléchargez-le en fichier .txt.

Le PDF est lu dans votre navigateur et n'est envoyé nulle part.

PDF texte ou PDF scanné ?

Tous les PDF ne contiennent pas du texte, même quand ils en ont l'air.

  • Les PDF texte sont exportés depuis Word, Google Docs, un site web, un logiciel de facturation… Les lettres y sont enregistrées comme des caractères : on peut donc les extraire.
  • Les PDF scannés sont des photos de pages papier glissées dans un PDF. Ce que vous voyez comme des lettres n'est qu'un ensemble de pixels. Il n'y a aucun texte à extraire.

Le test en cinq secondes : ouvrez le PDF dans n'importe quel lecteur (votre navigateur suffit) et essayez de sélectionner une phrase à la souris. Si les mots se surlignent un par un, il y a une couche texte. Si vous ne pouvez tracer qu'un rectangle sur toute la page, ou si rien ne se sélectionne, c'est un scan.

Certains fichiers mélangent les deux — un contrat tapé avec une page de signatures scannée, par exemple. Seules les pages texte donneront un résultat.

Et si c'est un scan ?

PDF en texte ne fait pas de reconnaissance de caractères (OCR) : un PDF scanné renverra peu ou pas de texte, et l'outil vous prévient lorsqu'aucune couche texte n'est trouvée. Vos options :

  • Demander l'original. L'expéditeur dispose souvent de la version Word ou texte qui a servi à imprimer le document.
  • Passer par un outil d'OCR. Beaucoup de lecteurs PDF, d'applications de numérisation et de suites bureautiques intègrent la reconnaissance de texte. Relisez attentivement : l'OCR se trompe, surtout sur les petits caractères, les tableaux et l'écriture manuscrite.

Nettoyer le texte extrait

Le texte tiré d'un PDF garde les habitudes de mise en page du fichier : un retour à la ligne à chaque fin de ligne, des mots coupés par un tiret, des espaces doublés, des en-têtes répétés.

  1. Collez le texte dans Nettoyer un texte pour réparer les lignes coupées, les espaces en trop et autres restes de mise en page.
  2. Supprimez à la main les en-têtes ou pieds de page répétés si besoin — ils apparaissent une fois par page.
  3. Vérifiez la longueur avec le compteur de mots si vous devez respecter une limite.

Pour le détail de ce nettoyage, consultez comment nettoyer un texte copié depuis un PDF.

Problèmes fréquents

Les colonnes sortent dans le désordre. Un PDF stocke le texte par blocs positionnés, pas dans l'ordre de lecture. Les mises en page sur deux colonnes, les encadrés et les zones de texte peuvent ressortir dans un ordre inattendu. Les séparateurs de pages aident à s'y retrouver ; parfois, copier colonne par colonne depuis un lecteur va plus vite.

Les tableaux perdent leur structure. Les cellules deviennent des lignes de texte. Le contenu est bien là, mais il faudra reconstruire le tableau.

Des caractères étranges ou des lettres manquantes. Certains PDF utilisent des polices à l'encodage inhabituel, et les caractères extraits ne correspondent pas à ce qui s'affiche. Aucun extracteur n'y peut grand-chose ; le document d'origine reste la solution fiable.

Une partie seulement du texte apparaît. Le PDF mélange peut-être du vrai texte et des images de texte (une annexe scannée, une capture d'écran, un logo). Seul le vrai texte est extrait.

Les limites à connaître

  • Pas d'OCR : les pages scannées donnent peu ou pas de texte.
  • La mise en forme (gras, polices, images, mise en page) n'est pas conservée — le résultat est volontairement du texte brut.
  • Un PDF protégé par mot de passe doit être déverrouillé avant que son texte puisse être lu.

Si vous avez besoin du texte pour votre propre document, l'extraction suivie d'un rapide nettoyage est généralement le plus court chemin. Si c'est la mise en page exacte qui compte, gardez le PDF.

Outils utilisés dans ce guide

Tous les guides