Comment extraire le texte d’un PDF

Conversion d'un PDF Le texte est utile pour la recherche, la citation, l'examen de l'accessibilité, la prise de notes ou le transfert de contenu dans un autre système. Le résultat dépend de ce que PDF contient. Certains documents ont une couche de texte propre; d'autres stockent des glyphes dans un ordre confus; les pages numérisées peuvent contenir seulement des images et aucun caractère extractible du tout.
HatchMyPDF lit l'actuel PDF calque texte avec PDF.js dans votre navigateur. Il ne télécharge pas le document ou n'envoie pas de texte extrait à l'analyse. Le résultat est un aperçu en lecture seule avec Copier tout et un UTF-8 TXT télécharger.
En bref: choisir un PDF, entrez son mot de passe si nécessaire, sélectionnez toutes les pages ou une plage, décidez de conserver les séparateurs de page standard, extraitz séquentiellement, examinez l'aperçu, et téléchargez ou copiez le texte.
L'extraction de texte n'est pas OCR
Un numérique normal PDF contient souvent des objets texte ainsi que la conception visuelle de la page. PDF.js peuvent exposer ces objets, leurs coordonnées, leur direction d'écriture et leurs conseils de fin de ligne. L'extracteur utilise cette information pour ajouter des espaces raisonnables et des ruptures de ligne.
Un scan image seulement n'a pas de tel calque de texte. La reconnaissance optique des caractères, ou OCR, devrait analyser les pixels des pages avec un modèle ou un moteur de reconnaissance. OCR est à l'extérieur de la version 1. Lorsqu'aucun texte n'est trouvé, l'outil affiche un état distinct, éventuellement un scan, plutôt que de renvoyer un téléchargement en blanc trompeur.
Si vous pouvez sélectionner des mots dans une normale PDF L'extraction est plus susceptible de fonctionner. La sélection n'est pas une garantie : des encodages personnalisés, des cartes de caractères manquantes ou une construction de police inhabituelle peuvent encore produire un texte incomplet.
Étape par étape: convertir PDF à TXT
- Ouvrir PDF au texte et choisir PDF jusqu'à 50 Mo et 1 000 pages.
- Saisissez un mot de passe si PDF.js demande une. Le mot de passe reste en mémoire et le document source n'est pas modifié.
- Sélectionnez toutes les pages ou entrez une plage comme
2-6,9. - Gardez les séparateurs de page standard activés lorsque le logiciel en aval doit savoir où un PDF page se termine et la prochaine commence.
- Commencez l'extraction. Les pages sont lues séquentiellement, et le processus peut être annulé entre les pages.
- Passez en revue l'aperçu en lecture seule. Copier tout le texte ou télécharger un UTF-8 TXT fichier avec une marque d'octet pour une large compatibilité de l'éditeur.
<blog-post-cta typepdfTexte">
Limites des pages et caractère d'alimentation du formulaire
Par défaut, le TXT sortie utilise l'alimentation sous forme U+000C entre les pages. Le flux de formulaire est un caractère standard de contrôle de texte simple associé historiquement à une pause de page. De nombreux éditeurs l'affichent comme espace blanc ou un symbole spécial, donc HatchMyPDF montre un diviseur visible dans l'aperçu au lieu d'exposer une zone blanche ambiguë.
Désactiver les séparateurs de page lorsque le résultat doit se comporter comme un flux de texte continu. L'outil joint ensuite des pages avec des lignes vides ordinaires. Chaque choix perd la géométrie visuelle exacte du PDF parce que TXT stocke les caractères et les ruptures de ligne, pas les objets de page positionnés.
La sortie est limitée à 10 millions de caractères ou 20 Mo de UTF-8 données. Cela empêche une couche de texte exceptionnellement grande ou mal formée de consommer une mémoire de navigateur non limitée. Les PDF Les limites d'entrée et de page s'appliquent toujours séparément.
Colonnes, tableaux et ordre de lecture
PDF est un format de présentation. Une page peut dessiner la colonne de droite avant la colonne de gauche, placer chaque lettre séparément, ou placer les cellules de table sans structure sémantique de ligne. Le résultat visuel peut sembler correct alors que l'ordre d'objet interne n'est pas un ordre de lecture naturel.
L'extracteur examine les points de texte, hasEOL conseils, coordonnées, espaces et direction d'écriture. Il peut produire un texte simple utile pour les documents communs, y compris le contenu de droite à gauche, mais il ne reconstruit pas un document Word, tableur, ou accessible tag-PDF structure. Les colonnes peuvent s'entrelacer, les cellules de table peuvent s'aplatir et les en-têtes ou les pied de page peuvent apparaître au milieu d'un passage copié.
Pour la conservation visuelle plutôt que la réutilisation du texte, PDF en images exportations rendues pages. Les images conservent l'apparence mais ne créent pas de texte modifiable et ne doivent pas être confondues avec l'extraction.
Protégé PDFs et vie privée
La lecture d'un document protégé ne le modifie pas, de sorte que l'outil n'a pas besoin de re-crypter une sortie PDF. Le mot de passe est utilisé pour ouvrir le local PDF.js session et est effacé lorsque le fichier est supprimé ou la page est fermée. Les noms de fichiers, mots de passe, texte extrait, nombre de pages, pages sélectionnées et contenu du document sont exclus de l'analyse.
Le traitement local de navigateur ne rend pas chaque presse-papiers ou destination de téléchargement privée. Après avoir copié du texte, le presse-papier du système d'exploitation et toute application où vous le collez deviennent partie intégrante du flux de données. Enregistrer sensible TXT fichiers uniquement à un endroit approprié.
Dépannage
L'outil dit que PDF peut être un balayage
Ouvrez le fichier dans un visionneur et essayez de sélectionner des mots individuels. Si la sélection dessine seulement un rectangle sur toute la page, la page est probablement une image. Le ROC est requis et n'est pas inclus dans cet outil.
Les mots fonctionnent ensemble ou ont des espaces inattendus
PDF Le positionnement texte n'enregistre pas toujours les limites normales des mots. L'extracteur estime les espaces à partir des coordonnées des éléments et des conseils de ligne. Les polices personnalisées ou les glyphes positionnés individuellement peuvent encore produire des résultats inhabituels. Comparer les citations importantes avec la source visible.
Les colonnes ou les tables apparaissent dans le mauvais ordre
C'est une limitation du texte clair et PDF ordre de dessin. Extraire une plus petite gamme de pages, copier des sections séparément ou utiliser un tableau spécialisé/document flux de conversion lorsque la structure compte.
Certaines pages sont vides tandis que d'autres fonctionnent
A PDF peut mélanger des pages numériques et des images numérisées. L'extracteur retourne le texte des pages avec un calque de texte supporté et conserve les limites des pages pour les résultats vides. Utiliser [Organiser PDFOrganiser PDF Pages lorsque des pages vierges ou indésirables doivent être retirées d'une copie de travail séparée avant l'extraction.
Révision avant réutilisation
Traitement extrait TXT en tant que représentant de travail, et non en tant que remplaçant PDF. Vérifier les noms, les numéros, la ponctuation, l'ordre de lecture et la page d'origine d'une citation. Préserver l'original pour le contexte et utiliser les séparateurs de page lorsque la traçabilité compte.