PDF से टेक्स्ट कैसे निकालें

PDF से टेक्स्ट कैसे निकालें

एक परिवर्तित करना PDF पाठ करने के लिए खोज, उद्धरण, अभिगम्यता समीक्षा, नोट लेने या किसी अन्य प्रणाली में सामग्री स्थानांतरित करने के लिए उपयोगी है। परिणाम क्या पर निर्भर करता है PDF शामिल हैं। कुछ दस्तावेजों में एक साफ पाठ परत होती है; दूसरों को भ्रमित क्रम में glyph स्टोर; स्कैन किए गए पृष्ठों में केवल चित्र और सभी में कोई निकालने योग्य वर्ण शामिल हो सकते हैं।

HatchMyPDF मौजूदा पढ़ता है PDF पाठ परत के साथ PDF.js अपने ब्राउज़र में। यह दस्तावेज़ अपलोड नहीं करता है या निकाले गए पाठ को एनालिटिक्स में भेजता है। परिणाम सभी कॉपी और एक के साथ केवल एक पूर्वावलोकन है UTF-8 TXT डाउनलोड

** संक्षेप में:* चुनें PDFयदि आवश्यक हो तो अपना पासवर्ड दर्ज करें, सभी पृष्ठों या एक श्रेणी का चयन करें, यह तय करें कि मानक पृष्ठ विभाजकों को रखने, अनुक्रमिक रूप से निकालने, पूर्वावलोकन की समीक्षा करने और पाठ को डाउनलोड करने या कॉपी करने का निर्णय लें।

पाठ निष्कर्षण OCR नहीं है

सामान्य डिजिटल PDF अक्सर पाठ वस्तुओं के साथ-साथ दृश्य पृष्ठ डिजाइन भी शामिल है। PDF.js उन वस्तुओं को उजागर कर सकते हैं, उनके निर्देशांक, लेखन दिशा, और लाइन-एंड संकेत। एक्सट्रैक्टर उचित स्थान और लाइन ब्रेक जोड़ने के लिए उस जानकारी का उपयोग करता है।

एक छवि केवल स्कैन में ऐसी कोई टेक्स्ट लेयर नहीं है। ऑप्टिकल कैरेक्टर रिकॉग्निशन, या ओसीआर को एक मॉडल या रिकॉग्निशन इंजन के साथ पेज पिक्सल का विश्लेषण करने की आवश्यकता होगी। OCR संस्करण 1. जब कोई टेक्स्ट नहीं पाया जाता है, तो टूल भ्रामक खाली डाउनलोड को वापस करने के बजाय एक विशिष्ट "संभवतः एक स्कैन" स्टेट दिखाता है।

यदि आप सामान्य में शब्द चुन सकते हैं PDF दर्शक, निष्कर्षण काम करने की संभावना अधिक है। चयन एक गारंटी नहीं है: कस्टम एन्कोडिंग, लापता चरित्र मानचित्र, या असामान्य फ़ॉन्ट निर्माण अभी भी अधूरे पाठ का उत्पादन कर सकते हैं।

चरण-दर-चरण: परिवर्तित PDF to TXT

  1. खुला PDF से टेक्स्ट करें और चुनें PDF 50 MB और 1,000 पृष्ठों तक।
  2. अगर पासवर्ड दर्ज करें PDF.js एक अनुरोध करता है। पासवर्ड स्मृति में रहता है और स्रोत दस्तावेज़ को संशोधित नहीं किया जाता है।
  3. सभी पृष्ठों का चयन करें या किसी श्रेणी में प्रवेश करें जैसे 2-6,9
  4. जब डाउनस्ट्रीम सॉफ्टवेयर को जानना चाहिए तो मानक पृष्ठ विभाजक सक्षम रखें PDF पृष्ठ समाप्त होता है और अगले शुरू होता है।
  5. निष्कर्षण प्रारंभ करें। पृष्ठों को क्रमिक रूप से पढ़ा जाता है और इस प्रक्रिया को पृष्ठों के बीच रद्द कर दिया जा सकता है।
  6. केवल पढ़ने वाले पूर्वावलोकन की समीक्षा करें। सभी पाठ कॉपी करें या एक डाउनलोड करें UTF-8 TXT व्यापक संपादक संगतता के लिए बाइट-ऑर्डर मार्क के साथ फ़ाइल।

<blog-post-cta type="pdfToText/blog-post-cta>

पृष्ठ सीमाएं और फॉर्म-फीड चरित्र

डिफ़ॉल्ट रूप से, TXT उत्पादन प्रपत्र फ़ीड का उपयोग करता है U+000C पृष्ठों के बीच फॉर्म फीड एक मानक सादे पाठ नियंत्रण चरित्र है जो ऐतिहासिक रूप से पेज ब्रेक से जुड़ा हुआ है। कई संपादक इसे व्हाइटस्पेस या एक विशेष प्रतीक के रूप में प्रदर्शित करते हैं, इसलिए HatchMyPDF एक आश्चर्यजनक खाली क्षेत्र को उजागर करने के बजाय पूर्वावलोकन में एक दृश्य "पेज ब्रेक" विभक्त दिखाता है।

जब परिणाम एक सतत पाठ धारा के रूप में व्यवहार करना चाहिए पृष्ठ विभाजक को निष्क्रिय करें। तब उपकरण सामान्य रिक्त लाइनों के साथ पृष्ठों में शामिल हो जाता है। किसी भी विकल्प की सटीक दृश्य ज्यामिति खो देती है PDF क्योंकि TXT दुकानों के पात्रों और लाइन तोड़ने, नहीं तैनात पृष्ठ वस्तुओं।

आउटपुट 10 मिलियन वर्ण या 20 MB तक सीमित है। UTF-8 डेटा यह असामान्य रूप से बड़े या विकृत पाठ परत को बिना बंधे ब्राउज़र मेमोरी के उपभोग से रोकता है। The PDF इनपुट और पृष्ठ सीमाएं अभी भी अलग से लागू होती हैं।

कॉलम, टेबल और रीडिंग ऑर्डर

PDF एक प्रस्तुति प्रारूप है। एक पृष्ठ बाएं स्तंभ से पहले दाहिने स्तंभ को आकर्षित कर सकता है, प्रत्येक अक्षर को अलग से रख सकता है, या किसी क्रमिक पंक्ति संरचना के बिना स्थिति तालिका कोशिकाओं। दृश्य परिणाम सही लग सकता है जबकि आंतरिक वस्तु क्रम एक प्राकृतिक रीडिंग ऑर्डर नहीं है।

निकालने वाला टेक्स्ट आइटम पर विचार करता है, hasEOL संकेत, निर्देशांक, रिक्त स्थान और लेखन दिशा। यह सामान्य दस्तावेजों के लिए उपयोगी सादे पाठ का उत्पादन कर सकता है, जिसमें राइट-टू-लेफ्ट सामग्री शामिल है, लेकिन यह वर्ड दस्तावेज़, स्प्रेडशीट, या सुलभ टैग- का पुनर्निर्माण नहीं करता है।PDF संरचना। कॉलम में हस्तक्षेप हो सकता है, टेबल कोशिकाएं समतल हो सकती हैं, और हेडर या पाद लेख एक कॉपी किए गए मार्ग के बीच में दिखाई दे सकते हैं।

पाठ पुन: उपयोग के बजाय दृश्य संरक्षण के लिएPDF छवियाँPDF से इमेजेस निर्यात किए गए पृष्ठों का निर्यात। छवियां उपस्थिति को संरक्षित करती हैं लेकिन संपादन योग्य टेक्स्ट नहीं बनाती हैं और निष्कर्षण के साथ भ्रमित नहीं होना चाहिए।

संरक्षित PDFगोपनीयता

एक संरक्षित दस्तावेज पढ़ना इसे नहीं बदलता है, इसलिए उपकरण को आउटपुट को फिर से एन्क्रिप्ट करने की आवश्यकता नहीं है PDF। पासवर्ड स्थानीय खोलने के लिए प्रयोग किया जाता है PDF.js सत्र और जब फ़ाइल को हटा दिया जाता है या पृष्ठ बंद हो जाता है तब स्पष्ट किया जाता है। फ़ाइल नाम, पासवर्ड, निकाले गए पाठ, पृष्ठ गिनती, चयनित पृष्ठ और दस्तावेज़ सामग्री को एनालिटिक्स से बाहर रखा गया है।

ब्राउज़र-स्थानीय प्रसंस्करण हर क्लिपबोर्ड या डाउनलोड गंतव्य निजी नहीं है। पाठ की प्रतिलिपि बनाने के बाद, ऑपरेटिंग सिस्टम क्लिपबोर्ड और किसी भी एप्लिकेशन को जहां आप पेस्ट करते हैं, यह डेटा प्रवाह का हिस्सा बन जाता है। संवेदनशील TXT केवल एक उचित स्थान पर फ़ाइलों को।

समस्या निवारण

उपकरण कहते हैं PDF एक स्कैन हो सकता है

एक दर्शक में फ़ाइल खोलें और व्यक्तिगत शब्दों का चयन करने का प्रयास करें। यदि चयन केवल पूरे पृष्ठ पर एक आयत खींचता है, तो पृष्ठ शायद एक छवि है। ओसीआर की आवश्यकता है और इस उपकरण में शामिल नहीं है।

शब्द एक साथ चलाते हैं या अप्रत्याशित रिक्त स्थान होते हैं।

PDF पाठ स्थिति हमेशा सामान्य शब्द सीमाओं को रिकॉर्ड नहीं करती है। निकालने वाला आइटम निर्देशांक और लाइन संकेत से रिक्त स्थान का अनुमान लगाता है। कस्टम फोंट या व्यक्तिगत रूप से तैनात ग्लिफ़ अभी भी असामान्य परिणाम उत्पन्न कर सकते हैं। दृश्य स्रोत के साथ महत्वपूर्ण उद्धरणों की तुलना करें।

कॉलम या टेबल गलत क्रम में दिखाई देते हैं

यह सादे पाठ की सीमा है और PDF ड्राइंग ऑर्डर। एक छोटी सी पेज रेंज निकालें, अलग से कॉपी करें, या एक विशेष तालिका का उपयोग करें/document संरचना मामलों पर रूपांतरण कार्यप्रवाह।

कुछ पृष्ठ खाली होते हैं जबकि अन्य काम करते हैं

A PDF डिजिटल पृष्ठों और स्कैन की गई छवियों को मिला सकते हैं। एक्सट्रैक्टर एक समर्थित पाठ परत वाले पृष्ठों के लिए पाठ लौटाता है और रिक्त परिणामों के लिए पृष्ठ सीमाओं को रखता है। उपयोग PDF पेज व्यवस्थित करेंजब रिक्त या अवांछित पृष्ठों को निष्कर्षण से पहले एक अलग कार्य प्रतिलिपि से हटाया जाना चाहिए।

पुन: उपयोग से पहले समीक्षा करें

उपचार निकाला TXT एक कार्य प्रतिनिधित्व के रूप में, एक आधिकारिक प्रतिस्थापन के लिए नहीं PDF। नामों, संख्याओं, punctuation, पढ़ने के आदेश और पृष्ठ जहां एक उद्धरण उत्पन्न हुआ सत्यापित करें। संदर्भ के लिए मूल को संरक्षित करें और निशानेबाजी मामलों पर पृष्ठ विभाजक का उपयोग करें।