PDF OCR
स्कैन किए PDF का पाठ पहचानिए और ऐसी फ़ाइल पाइए जिसे खोजा और कॉपी किया जा सके।
PDF OCR आपके उपकरण पर चलता है, इसलिए स्कैन किए अभिलेख आपके पास रहते हैं। केवल भाषा की सामग्री एक बार आती है और ब्राउज़र उसे सहेजता है।
खोजने योग्य परिणाम को Word बनाएँ
PDF OCR के बारे में
स्कैन किया PDF दस्तावेज़ की एक तस्वीर है। आप उसे पढ़ सकते हैं, पर और कुछ नहीं पढ़ सकता: खोज कुछ नहीं पाती, कॉपी कुछ नहीं देती, और पाठ पर चलने वाला हर औज़ार खाली हाथ रहता है। पाठ पहचान इसे ठीक करती है — वह अक्षरों की आकृतियाँ पढ़ती है और जो मिलता है उसे फ़ाइल में, छपे शब्दों के ठीक ऊपर बैठी अदृश्य परत की तरह लिख देती है। पेज वैसा ही दिखता है — स्कैन को छुआ नहीं जाता — पर अब दस्तावेज़ खोजा, चुना और बदला जा सकता है।
विशेषताएँ
- पहचान आपके ब्राउज़र में चलती है — पेज कभी अपलोड नहीं होते
- बारह भाषाएँ, जिनमें हिंदी, रूसी, चीनी, जापानी और अरबी शामिल
- अदृश्य पाठ परत मूल स्कैन के ऊपर बैठती है, जो वैसा ही रहता है
- दो स्कैन गुणवत्ताएँ, छोटे अक्षरों पर गति और शुद्धता का सौदा
- खोजने योग्य PDF के साथ-साथ सादा पाठ भी
- हर पेज की प्रगति, और लंबे दस्तावेज़ों के लिए रोकने का नियंत्रण
- भाषा की सामग्री एक बार आती है और ब्राउज़र में सहेजी रहती है
PDF OCR का उपयोग कैसे करें
- स्कैन किया PDF पेज पर छोड़ें
- पेज पर छपी भाषा और स्कैन गुणवत्ता चुनें
- पहचान शुरू करें और पेजों पर काम होते देखें
- खोजने योग्य PDF, या केवल पहचाना गया पाठ डाउनलोड करें
उदाहरण
इनपुट
1987-minutes.pdf — 8 scanned pages, typewritten English
आउटपुट
1987-minutes-searchable.pdf — same images, now with selectable text behind them.
दिखने वाला पेज नहीं बदलता; बदलता यह है कि शब्द अब फ़ाइल के भीतर हैं।
सामान्य त्रुटियाँ और समस्या निवारण
- पहचाना गया पाठ गलतियों से भरा है। — पहचान स्कैन पर निर्भर है। ऊँची गुणवत्ता आज़माइए और देखिए कि भाषा पेज से मेल खाती है — जर्मन पेज पर अंग्रेज़ी की सामग्री यही नतीजा देती है।
- पहचान बहुत धीमी है। — यह सचमुच भारी काम है, और सर्वर के बजाय आपके अपने संसाधक पर हो रहा है। तेज़ गुणवत्ता लीजिए और लंबे दस्तावेज़ बाँटिए।
- दो भाषाओं वाला दस्तावेज़ ठीक नहीं पहचाना जाता। — हर बार एक भाषा उपयोग होती है। दस्तावेज़ को भाषा से बाँटिए, हर हिस्सा पहचानिए और परिणाम जोड़ लीजिए।
- हाथ की लिखाई नहीं पहचानी गई। — यह छपा और टाइप किया पाठ पहचानता है। हाथ की लिखाई के लिए बिलकुल अलग तरह का मॉडल चाहिए।
अक्सर पूछे जाने वाले प्रश्न
- क्या पहचाना गया पाठ स्कैन की जगह ले लेता है?
- नहीं। छवि बिलकुल वैसी ही रहती है और पाठ उसके पीछे अदृश्य रूप में जुड़ता है। इसीलिए खोजने योग्य PDF मूल जैसा ही दिखता है।
- क्या पहचान के लिए मेरे स्कैन किए पेज अपलोड होते हैं?
- नहीं। पहचान का इंजन आपके ब्राउज़र में चलता है। केवल भाषा की सामग्री एक बार आती है, और ब्राउज़र उसे सहेज लेता है।
- एक बार में कितने पेज पहचान सकता हूँ?
- हर बार तीस तक, क्योंकि पहचान इतनी धीमी है कि लंबे दस्तावेज़ हिस्सों में बेहतर सँभलते हैं।
- कौन-सी गुणवत्ता चुननी चाहिए?
- तेज़ वाली से शुरू कीजिए। ऊँची तब लीजिए जब अक्षर छोटे हों, स्कैन पुराना हो, या पहली कोशिश गड़बड़ आई हो।
- क्या ऐसे PDF पर OCR चला सकता हूँ जिसमें पहले से पाठ है?
- चला सकते हैं, पर फ़ायदा नहीं: पहले कोई शब्द चुनकर देख लीजिए। पाठ पहले से हो तो सीधे बदल दीजिए।
संबंधित टूल
- PDF से टेक्स्ट — PDF से चयन योग्य टेक्स्ट को सादे टेक्स्ट या Markdown के रूप में निकालें।
- स्कैन करके PDF — कैमरे को स्कैनर बनाकर पेजों को PDF में सहेजें।
- PDF से Word — PDF को संपादन योग्य .docx दस्तावेज़ की तरह दोबारा बनाएँ।
- PDF से Excel — PDF की तालिकाएँ .xlsx कार्यपुस्तिका या CSV में निकालें।
- PDF से HTML — PDF को साफ़, खोजने योग्य HTML में बदलें।
- PDF कंप्रेस करें — चुनी गई गुणवत्ता और रिज़ॉल्यूशन पर हर पेज को JPEG में पुनः रेंडर करके PDF का आकार घटाएँ।
- PDF का सार — लंबे PDF का खंड-दर-खंड सार अपने उपकरण पर बनाएँ।
सभी ArrayKit टूल