araç köşesi

PDF en texte (TXT)

Récupérez l'écrit contenu dans un PDF sous forme de fichier texte

Choisissez vos fichiers PDFTouchez ou cliquez sur la zone — une fenêtre de sélection de fichier s'ouvre. Vous pouvez aussi y faire glisser un fichier.PDF — documents avec couche de texte ; les pages enregistrées en photo ne se lisent pas

Vos fichiers restent chez vous. La conversion se fait dans le navigateur ; aucun fichier n'est envoyé sur un serveur.

Comment ça marche

Choisissez vos fichiers PDF dans le cadre (touchez ou cliquez), réglez les deux commutateurs et appuyez sur Convertir en texte. Le premier concerne le repère de page : s'il reste actif, une ligne du type « --- Page 2 --- » précède chaque nouvelle page, et dans un long document vous voyez encore de quelle page vient telle phrase ; désactivé, l'écrit s'enchaîne sans coupure. Le second porte sur les fins de ligne : dans un PDF les lignes sont déjà coupées à la largeur du papier, et reprendre ces coupures transforme votre texte en colonne étroite dans n'importe quel autre programme. « Regrouper en paragraphes » recolle les lignes de continuation, tandis que « Laisser comme sur la page » convient à la poésie, aux relevés en colonnes et au code, où l'alignement porte du sens. La ligne de résultat indique le nombre de pages lues et de mots obtenus. Vous pouvez choisir plusieurs PDF à la fois ; chacun arrive en .txt sous son propre nom. Si un document réclame un mot de passe, saisissez-le dans le champ prévu ; pour un fichier ordinaire ce champ reste vide.

Cet outil est aussi connu sous le nom de convertir pdf en texte, pdf en txt, extraire le texte d'un pdf, recuperer texte pdf, pdf to text francais, copier le texte d'un pdf.

Qu'est-ce que Couche de texte ?

La couche de texte est la partie d'un PDF où les lettres sont réellement enregistrées comme des lettres : pour chaque caractère, la police et la position sur la page sont notées, et c'est ce qui rend l'écrit sélectionnable, cherchable et copiable. Tout PDF sorti d'un traitement de texte, d'un tableur ou d'un logiciel de comptabilité porte cette couche. Une page venue d'un scanner n'en a pas ; il n'y a là qu'une photo, et ce qui ressemble à une lettre n'est qu'un ensemble de points sombres. C'est précisément cette couche que lit cet outil.

Qu'est-ce que PDF numérisé ?

Un PDF numérisé est un document papier photographié au scanner ou à l'appareil du téléphone, puis placé page par page dans un PDF. De l'extérieur il ressemble à un fichier ordinaire, mais il ne contient pas une seule lettre sélectionnable : si le passage de la souris sur l'écrit ne sélectionne rien, vous tenez une numérisation. Le seul moyen d'en tirer du texte est la reconnaissance optique de caractères, un programme qui devine les lettres d'après les formes de l'image — et dont le résultat doit toujours être vérifié à l'œil.

Qu'est-ce que TXT (texte brut) ?

Le TXT est le format de document le plus dépouillé qui soit : il ne contient que des caractères et des retours à la ligne, rien d'autre — ni gras, ni police, ni couleur, ni tableau, ni image. Ce dépouillement explique qu'il s'ouvre partout ; éditeurs de texte, tableurs, outils de traduction et lecteurs vocaux s'entendent tous avec le texte brut. Le codage du fichier détermine quels caractères s'affichent correctement, et cet outil écrit en UTF-8 : accents et caractères spéciaux arrivent donc intacts dans les programmes actuels.

Quelle est la différence entre PDF et TXT ?

Un PDF fige l'apparence de la page : police, marges, colonnes et images restent au même endroit sur tous les appareils, parce que le fichier note que telle lettre doit être imprimée à tel point et à telle taille. Le TXT n'enregistre aucune apparence, seulement la suite des caractères ; le programme qui l'ouvre choisit lui-même la police et la largeur de ligne. Passer du PDF au TXT est donc un sens qui perd de l'information : filets de tableau, alignements, mise en page et images restent en arrière, et il ne demeure que l'écrit porteur du sens. Gardez le PDF si le document doit être transmis tel quel, et prenez le TXT si vous comptez travailler les mots.

Comment les espaces entre mots et les colonnes sont-ils retrouvés ?

Un PDF ne contient pas de phrases ; il contient des lettres posées une à une à des points fixes de la page. C'est pourquoi une extraction brute donne souvent des curiosités comme « JeanDupont » ou « T otal ». Cet outil regarde plutôt les coordonnées : les morceaux situés à la même hauteur forment une ligne, et lorsque l'écart horizontal entre deux morceaux dépasse le cinquième de la hauteur des lettres, une espace est insérée. Le résultat est plus propre qu'un copier-coller ordinaire.

La composition sur deux colonnes a ses limites. Les lignes se lisent de gauche à droite : les phrases de deux colonnes voisines peuvent donc s'entremêler. Dans un tel document il est plus rapide de choisir « Laisser comme sur la page » et de séparer les colonnes à l'œil. Les titres courants, les pieds de page et les numéros font aussi partie de la page et se retrouvent donc dans le résultat ; s'ils vous gênent, effacez-les ensuite dans un éditeur de texte.

À quoi sert cette conversion ?

Le but est de rendre à nouveau exploitable l'écrit d'un document qui paraît verrouillé. Les usages courants sont les suivants :

  • Chercher dans un long rapport ou reprendre une citation dans vos notes
  • Confier un document reçu par courriel à un programme de traduction ou à un correcteur
  • Regarder le relevé brut d'une facture avant de le porter dans un tableur
  • Donner l'écrit à un programme de lecture vocale — le texte brut se lit partout
  • Les documents numérisés ne passent pas : les pages sont des photos, il faut d'abord une reconnaissance OCR

Questions fréquentes

Comment convertir un PDF en texte ?

Choisissez le fichier dans le cadre, réglez le repère de page et les fins de ligne, puis appuyez sur Convertir en texte. L'écrit est extrait et un fichier .txt arrive ; tout programme de texte, y compris le Bloc-notes, l'ouvre.

Pourquoi les numéros de page et les titres apparaissent-ils dans mon texte ?

Un titre courant, un pied de page et un numéro sont des écrits posés sur la page comme les autres, et l'outil reprend ce qui s'y trouve. Le document indique rarement quelle partie est du corps et laquelle est décorative. Le plus sûr est de les supprimer dans le fichier obtenu.

Pourquoi un PDF numérisé ne se convertit-il pas ?

Une page issue d'un scanner ou d'un appareil photo de téléphone se trouve dans le PDF sous forme de photo ; les lettres y sont des points, pas de l'écriture. Cet outil ne reconnaît pas les lettres dans une image et signale alors l'absence de couche de texte.

Les caractères accentués sont-ils conservés ?

Oui. Quel que soit le codage de la police intégrée, l'outil lit la table de correspondance de cette police et remet les bonnes lettres, accents et cédilles compris. Sur des polices très anciennes ou mal intégrées une lettre peut se perdre ; relisez une fois le résultat.

Mon document est-il envoyé sur un serveur ?

Non. L'ouverture du fichier, l'extraction de l'écrit et la préparation du .txt se font dans votre navigateur ; ni le document ni son nom ne partent ailleurs. Pour un contrat ou un compte rendu médical, la différence compte.