PDF बाट पाठ कसरी निकाल्ने

PDF बाट पाठ कसरी निकाल्ने

ए रूपान्तरण गर्दै PDF पाठ खोज, उद्धरण, पहुँचयोग्यता समीक्षा, नोट-लिने, वा सामग्रीलाई अर्को प्रणालीमा सार्नका लागि उपयोगी छ। परिणाम के हो भन्ने कुरामा निर्भर गर्दछ। PDF समावेश गर्दछ। केही कागजातहरूमा सफा पाठ तह हुन्छ; अरूले ग्लिफहरू भ्रमित क्रममा भण्डारण गर्छन्; स्क्यान गरिएका पृष्ठहरूमा केवल छविहरू हुन सक्छन् र कुनै पनि निकाल्न सकिने क्यारेक्टरहरू हुन सक्दैनन्।

HatchMyPDF विद्यमान पढ्नुहोस् PDF पाठ तहसँग PDF.js तपाईँको ब्राउजरमा। यसले कागजात अपलोड गर्दैन वा विश्लेषणमा निकालिएको पाठ पठाउँदैन। परिणाम सबै र एक प्रतिलिपि गरेर पढ्न-मात्र पूर्वावलोकन हो। UTF-8 TXT डाउनलोड गर्नुहोस्।

    • संक्षेपमाः * * एउटा छान्नुहोस् PDFयदि आवश्यक भएमा यसको पासवर्ड प्रविष्ट गर्नुहोस्, सबै पृष्ठहरू वा दायरा चयन गर्नुहोस्, मानक पृष्ठ विभाजकहरू राख्ने कि नगर्ने निर्णय गर्नुहोस्, क्रमिक रूपमा निकाल्नुहोस्, पूर्वावलोकन समीक्षा गर्नुहोस्, र पाठ डाउनलोड वा प्रतिलिपि गर्नुहोस्।

पाठ निकासी ओ. सि. आर होइन

सामान्य डिजिटल PDF प्रायः पाठ वस्तुहरू साथै भिजुअल पृष्ठ डिजाइन समावेश गर्दछ। PDF.js ती वस्तुहरू, तिनीहरूको निर्देशांकहरू, लेखन दिशा, र रेखा-अन्त्य सङ्केतहरू उजागर गर्न सक्छ। एक्स्ट्र्याक्टरले उचित ठाउँहरू र लाइन ब्रेकहरू थप्न त्यो जानकारी प्रयोग गर्दछ।

छवि-मात्र स्क्यानमा त्यस्तो कुनै पाठ तह हुँदैन। अप्टिकल क्यारेक्टर रिकग्निसन, वा ओ. सि. आर., ले मोडेल वा रिकग्निसन इन्जिनको साथ पृष्ठ पिक्सेलहरू विश्लेषण गर्न आवश्यक छ। ओ. सि. आर. संस्करण 1 बाहिर छ। जब कुनै पाठ फेला पर्दैन, उपकरणले भ्रामक खाली डाउनलोड फिर्ता गर्नुको सट्टा एक फरक "सम्भवतः स्क्यान" अवस्था देखाउँछ।

यदि तपाईँ सामान्य रूपमा शब्दहरू चयन गर्न सक्नुहुन्छ भने PDF दर्शक, निकासीले काम गर्ने सम्भावना बढी हुन्छ। चयन ग्यारेन्टी होइनः कस्टम एन्कोडिङहरू, हराएको क्यारेक्टर नक्सा, वा असामान्य फन्ट निर्माणले अझै पनि अपूर्ण पाठ उत्पादन गर्न सक्छ।

चरण-दर-चरणः रूपान्तरण PDF गर्न TXT

  1. खोल्नुहोस् PDF पाठमा अनि एउटा छान्नुहोस् PDF 50 एमबी र 1,000 पृष्ठहरू सम्म।
  2. पासवर्ड प्रविष्ट गर्नुहोस् यदि PDF.js एउटा अनुरोध गर्नुहोस्। पासवर्ड मेमोरीमा रहन्छ र स्रोत कागजात परिमार्जन गरिएको छैन।
  3. सबै पृष्ठहरू चयन गर्नुहोस् वा एउटा दायरा प्रविष्ट गर्नुहोस् जस्तै 2-6,9.
  4. डाउनस्ट्रीम सफ्टवेयरले कहाँ थाहा पाउनुपर्छ भने मानक पृष्ठ विभाजकहरू सक्षम राख्नुहोस् PDF पृष्ठ समाप्त हुन्छ र अर्को सुरु हुन्छ।
  5. निकासी सुरु गर्नुहोस्। पृष्ठहरू क्रमिक रूपमा पढाइन्छ, र प्रक्रिया पृष्ठहरू बिच रद्द गर्न सकिन्छ।
  6. पढ्न-मात्र पूर्वावलोकन समीक्षा गर्नुहोस्। सबै पाठ प्रतिलिपि गर्नुहोस् वा एउटा डाउनलोड गर्नुहोस् UTF-8 TXT व्यापक सम्पादक अनुकूलताका लागि बिट-अर्डर चिन्हको साथ फाइल।

<ब्लग-पोस्ट-एक्टा प्रकार = "pdfटोटेक्स्ट ">

पृष्ठ सीमाहरू र फारम-फिड क्यारेक्टर

पूर्वनिर्धारित रूपमा, TXT आउटपुटले फारम फिड प्रयोग गर्दछ U+000C पृष्ठहरू बिच। फारम फिड एक मानक सादा-पाठ नियन्त्रण चरित्र हो जुन ऐतिहासिक रूपमा पृष्ठ ब्रेकसँग सम्बन्धित छ। धेरै सम्पादकहरूले यसलाई ह्वाइटस्पेस वा विशेष प्रतीकको रूपमा प्रदर्शन गर्छन्, त्यसैले HatchMyPDF अस्पष्ट खाली क्षेत्रलाई उजागर गर्नुको सट्टा पूर्वावलोकनमा देखिने "पेज ब्रेक" विभाजक देखाउँछ।

परिणामले एक निरन्तर पाठ स्ट्रिमको रूपमा व्यवहार गर्दा पृष्ठ विभाजकहरू असक्षम गर्नुहोस्। त्यसपछि उपकरणले साधारण खाली रेखाहरूका साथ पृष्ठहरू जोड्छ। या त छनौटले यसको सही भिजुअल ज्यामिति गुमाउँछ PDF किनभने TXT वर्णहरू र लाइन ब्रेकहरू भण्डार गर्दछ, पृष्ठ वस्तुहरू राखिएको छैन।

आउटपुट 10 मिलियन क्यारेक्टर वा 20 एमबीमा सीमित छ। UTF-8 डेटा। यसले असामान्य रूपमा ठुलो वा विकृत पाठ तहलाई असीमित ब्राउजर मेमोरी उपभोग गर्नबाट रोक्छ। द PDF इनपुट र पृष्ठ सीमाहरू अझै पनि छुट्टै लागू हुन्छन्।

स्तम्भहरू, तालिकाहरू, र पठन क्रम

PDF यो एउटा प्रस्तुतीकरण ढाँचा हो। एउटा पृष्ठले बायाँ स्तम्भको अगाडि दायाँ स्तम्भ रेखाङ्कन गर्न सक्छ, प्रत्येक अक्षरलाई छुट्टै राख्न सक्छ, वा सिमेन्टिक पङ्क्ति संरचना बिना टेबल कक्षहरू राख्न सक्छ। दृश्य परिणाम सही देखिन सक्छ जबकि आन्तरिक वस्तु क्रम प्राकृतिक पठन क्रम होइन।

एक्स्ट्र्याक्टरले पाठ वस्तुहरू विचार गर्दछ, hasEOL सङ्केतहरू, निर्देशांकहरू, स्थानहरू, र लेखन दिशा। यसले सामान्य कागजातहरूका लागि उपयोगी सादा पाठ उत्पादन गर्न सक्छ, दायाँ-देखि-बायाँ सामग्री सहित, तर यसले वर्ड कागजात, स्प्रेडसिट, वा पहुँचयोग्य ट्याग गरिएको-को पुनर्निर्माण गर्दैन।PDF संरचना। स्तम्भहरू एकअर्कामा रहन सक्छन्, टेबल कक्षहरू समतल हुन सक्छन्, र हेडरहरू वा फुटरहरू प्रतिलिपि गरिएको मार्गको बिचमा देखा पर्न सक्छन्।

पाठको पुनः प्रयोगको सट्टा दृश्य संरक्षणका लागि, PDF बाट छविहरू निर्यात गरिएको पृष्ठहरू। छविहरूले उपस्थिति सुरक्षित राख्छन् तर सम्पादन योग्य पाठ सिर्जना गर्दैनन् र निकासीसँग भ्रमित हुनु हुँदैन।

संरक्षित PDFएस र गोपनीयता

सुरक्षित कागजात पढ्दा यसलाई परिवर्तन गर्दैन, त्यसैले उपकरणले आउटपुट पुनः-इन्क्रिप्ट गर्न आवश्यक पर्दैन। PDF. पासवर्ड स्थानीय खोल्न प्रयोग गरिन्छ। PDF.js सत्र र फाइल हटाइएको वा पृष्ठ बन्द हुँदा सफा हुन्छ। फाइल नाम, पासवर्ड, निकालिएको पाठ, पृष्ठ गणना, चयन गरिएका पृष्ठहरू, र कागजात सामग्रीहरू विश्लेषणबाट बाहिर राखिएका छन्।

ब्राउजर-स्थानीय प्रशोधनले प्रत्येक क्लिपबोर्ड वा डाउनलोड गन्तव्यलाई निजी बनाउँदैन। पाठ प्रतिलिपि गरेपछि, अपरेटिङ सिस्टम क्लिपबोर्ड र कुनै पनि अनुप्रयोग जहाँ तपाईँले यसलाई टाँस्नुहुन्छ डेटा प्रवाहको भाग बन्छ। संवेदनशील बचत गर्नुहोस् TXT उपयुक्त स्थानमा मात्र फाइलहरू।

समस्या निवारण

उपकरणले भन्छ कि PDF स्क्यान हुन सक्छ

दर्शकमा फाइल खोल्नुहोस् र व्यक्तिगत शब्दहरू चयन गर्ने प्रयास गर्नुहोस्। यदि चयनले सम्पूर्ण पृष्ठमा आयत मात्र तान्छ भने, पृष्ठ सम्भवतः एउटा छवि हो। ओसीआर आवश्यक छ र यो उपकरणमा समावेश गरिएको छैन।

शब्दहरू सँगै चल्छन् वा अप्रत्याशित ठाउँहरू छन्

PDF पाठ स्थितिले सधैँ सामान्य शब्द सीमाहरू रेकर्ड गर्दैन। एक्स्ट्र्याक्टरले वस्तु निर्देशांक र रेखा सङ्केतहरूबाट खाली ठाउँहरू अनुमान गर्दछ। कस्टम फन्टहरू वा व्यक्तिगत रूपमा अवस्थित ग्लिफहरूले अझै पनि असामान्य परिणामहरू उत्पादन गर्न सक्छन्। महत्त्वपूर्ण उद्धरणहरूलाई दृश्य स्रोतसँग तुलना गर्नुहोस्।

स्तम्भ वा तालिकाहरू गलत क्रममा देखा पर्छन्।

त्यो सादा पाठको सीमा हो र PDF रेखाङ्कन आदेश। सानो पृष्ठ दायरा निकाल्नुहोस्, खण्डहरू छुट्टै प्रतिलिपि गर्नुहोस्, वा विशेष तालिका प्रयोग गर्नुहोस्/document रूपान्तरण कार्यप्रवाह जब संरचना महत्त्वपूर्ण हुन्छ।

केही पृष्ठहरू खाली छन् जबकि अरूले काम गर्छन्।

ए PDF डिजिटल पृष्ठहरू र स्क्यान गरिएका छविहरू मिसाउन सक्छ। एक्स्ट्र्याक्टरले समर्थित पाठ तह भएका पृष्ठहरूका लागि पाठ फिर्ता गर्दछ र खाली परिणामहरूका लागि पृष्ठ सीमाहरू राख्छ। प्रयोग गर्नुहोस् व्यवस्थित गर्नुहोस् PDF पृष्ठहरू जब खाली वा अनावश्यक पृष्ठहरू निकाल्नु अघि छुट्टै कार्य प्रतिलिपिबाट हटाउनुपर्छ।

पुनः प्रयोग गर्नु अघि समीक्षा गर्नुहोस्

निकालिएको उपचार TXT कार्य गर्ने प्रतिनिधित्वको रूपमा, आधिकारिक प्रतिस्थापनको रूपमा होइन PDF. नाम, सङ्ख्या, विराम चिह्न, पठन क्रम, र उद्धरणको उत्पत्ति भएको पृष्ठ प्रमाणित गर्नुहोस्। सन्दर्भका लागि मूल सुरक्षित गर्नुहोस् र पत्ता लगाउने महत्त्व हुँदा पृष्ठ विभाजकहरू प्रयोग गर्नुहोस्।