फ़ाइलें कभी आपके डिवाइस से बाहर नहीं जातीं।यह कैसे काम करता है
PDF पर OCR कैसे करें
- 1ऊपर अपनी स्कैन की गई PDF डालें (या चुनने के लिए क्लिक करें)।
- 2सर्च-योग्य बनाएं पर क्लिक करें — हर पेज बारी-बारी पहचाना जाता है (OCR इंजन पहली बार उपयोग पर एक बार डाउनलोड होता है)।
- 3सर्च-योग्य PDF डाउनलोड करें।
अक्सर पूछे जाने वाले सवाल
- क्या OCR के लिए मेरी फ़ाइल अपलोड होती है?
- नहीं। पहचान पूरी तरह आपके ब्राउज़र में WebAssembly का उपयोग करके होती है — आपकी PDF आपके डिवाइस से बाहर कभी नहीं जाती। OCR इंजन और भाषा डेटा एक बार सार्वजनिक स्रोत से डाउनलोड होते हैं (वे सॉफ़्टवेयर हैं, आपकी फ़ाइल नहीं) और फिर कैश हो जाते हैं।
- OCR मेरी PDF का क्या करता है?
- यह पेज इमेज में मौजूद टेक्स्ट पढ़ता है और उसे शब्दों के ठीक ऊपर रखी एक अदृश्य लेयर के रूप में वापस जोड़ता है। पेज वैसा ही दिखता है, लेकिन अब आप किसी भी PDF रीडर में टेक्स्ट सर्च, चुन, और कॉपी कर सकते हैं।
- कौन-सी भाषाएं सपोर्ट होती हैं?
- अभी अंग्रेज़ी सबसे अच्छा काम करती है। अन्य स्क्रिप्ट, खासकर चीनी, जापानी, या अरबी जैसी नॉन-लैटिन स्क्रिप्ट, अभी सपोर्ट नहीं हैं।
- यह धीमा क्यों है?
- OCR भारी गणना है और यह सर्वर फ़ार्म के बजाय आपके डिवाइस पर स्थानीय रूप से चलता है। एक लंबा या हाई-रिज़ॉल्यूशन दस्तावेज़ थोड़ा समय ले सकता है — आपकी फ़ाइल को निजी रखने की यही कीमत है।
टेक्स्ट की तस्वीर को टेक्स्ट में बदलें
एक स्कैन की गई PDF असल में सिर्फ़ इमेज होती है — आप शब्द देख सकते हैं लेकिन उन्हें सर्च, सिलेक्ट, या कॉपी नहीं कर सकते। OCR (ऑप्टिकल कैरेक्टर रिकग्निशन) उन इमेज को पढ़ता है और हर शब्द के ठीक ऊपर बैठी एक अदृश्य लेयर के रूप में टेक्स्ट वापस जोड़ देता है। पन्ना बिल्कुल वैसा ही दिखता है, लेकिन अब यह किसी भी रीडर में सर्च किया जा सकता है। HivePDF यह सब ठीक आपके ब्राउज़र में करता है, इसलिए एक संवेदनशील स्कैन भी कभी आपकी डिवाइस से बाहर नहीं जाता।
निजी, भले ही धीमा हो
ज़्यादातर OCR टूल भारी काम करने के लिए आपके दस्तावेज़ को किसी सर्वर पर अपलोड करते हैं। HivePDF इसकी बजाय पहचान को स्थानीय रूप से WebAssembly के साथ चलाता है। OCR इंजन और उसका इंग्लिश लैंग्वेज डेटा एक बार किसी सार्वजनिक स्रोत से डाउनलोड होते हैं — यह सॉफ़्टवेयर है, आपकी फ़ाइल नहीं — और अगली बार के लिए कैश हो जाते हैं। इसका बदले में स्पीड की क़ीमत चुकानी पड़ती है: एक लंबा या हाई-रेज़ॉल्यूशन स्कैन थोड़ा समय लेता है, क्योंकि आपकी अपनी डिवाइस ही यह काम कर रही है।
जानने लायक बातें
आज इंग्लिश टेक्स्ट सबसे बेहतर काम करता है; बाकी लिपियां अभी सपोर्टेड नहीं हैं। नतीजा एक रास्टर पन्ना और एक टेक्स्ट लेयर होता है, इसलिए यह आपके स्कैन की एक भरोसेमंद कॉपी बनी रहती है। इसके बाद सर्च की जा सकने वाली PDF को छोटा करने के लिए, Compress इस्तेमाल करें; पन्नों की इमेज निकालने के लिए, PDF to JPG इस्तेमाल करें।
OCR सबसे ज़्यादा कहां मायने रखता है
पुराने स्कैन, आर्काइव किए कॉन्ट्रैक्ट, या फ़ोन से फोटो खींचा गया कागज़ों का ढेर आम उम्मीदवार हैं — इनमें से कुछ भी तब तक सर्च नहीं किया जा सकता जब तक OCR टेक्स्ट लेयर न जोड़ दे। यह एक्सेसिबिलिटी के लिए भी मायने रखता है, क्योंकि स्क्रीन रीडर को पन्ने को ज़ोर से पढ़ने के लिए टेक्स्ट की तस्वीर की बजाय असली टेक्स्ट चाहिए होता है। एक बार प्रोसेस हो जाने पर, फ़ाइल किसी भी और सर्च की जा सकने वाली PDF की तरह काम करती है: आप कोई क्लॉज़ सर्च कर सकते हैं, कोई पैराग्राफ़ कॉपी कर सकते हैं, या इसे किसी डॉक्यूमेंट आर्काइव में इंडेक्स कर सकते हैं।