फ़ाइलें कभी आपके डिवाइस से बाहर नहीं जातीं।यह कैसे काम करता है
PDF को टेक्स्ट में कैसे बदलें
- 1ऊपर अपनी PDF डालें (या चुनने के लिए क्लिक करें)।
- 2टेक्स्ट निकालें पर क्लिक करें।
- 3सारे टेक्स्ट वाली .txt फ़ाइल डाउनलोड करें।
अक्सर पूछे जाने वाले सवाल
- क्या मेरी फ़ाइल अपलोड होती है?
- नहीं। टेक्स्ट पूरी तरह आपके ब्राउज़र में पढ़ा जाता है — आपकी PDF आपके डिवाइस से बाहर कभी नहीं जाती।
- यह कहता है कि कोई टेक्स्ट नहीं मिला — क्यों?
- आपकी PDF शायद एक स्कैन (पेजों की इमेज) है जिसमें कोई टेक्स्ट लेयर नहीं है। पहले टेक्स्ट लेयर जोड़ने के लिए इसे OCR PDF से गुज़ारें, फिर टेक्स्ट निकालें।
- क्या लेआउट बना रहेगा?
- टूल पढ़ने का क्रम और लाइन ब्रेक बनाए रखता है, लेकिन कॉलम, टेबल, या सटीक स्पेसिंग नहीं — यह एक फ़ॉर्मेटेड दस्तावेज़ नहीं बल्कि साफ़ सादा टेक्स्ट बनाता है।
PDF से शब्द निकालें
जब आपको किसी PDF से असली टेक्स्ट चाहिए — उसे कोट करने, सर्च करने, किसी दूसरे टूल में डालने, या किसी दस्तावेज़ में डालने के लिए — PDF to Text फाइल की टेक्स्ट लेयर को पढ़ता है और उसे लाइन-दर-लाइन एक सादे .txt फाइल में फिर से बनाता है। यह पूरी तरह आपके ब्राउज़र में चलता है, इसलिए गोपनीय दस्तावेज़ भी कभी आपके डिवाइस से बाहर नहीं जाता।
टेक्स्ट, लेआउट नहीं
टूल पढ़ने का क्रम और लाइन ब्रेक बनाए रखता है, जो कॉपी करने और दोबारा इस्तेमाल के लिए जरूरी है, लेकिन यह कॉलम, टेबल, या सटीक पोजीशनिंग दोबारा बनाने की कोशिश नहीं करता — नतीजा साफ सादा टेक्स्ट होता है। पेज एक खाली लाइन से अलग किए जाते हैं।
स्कैन की गई PDF
स्कैन की गई PDF बिना टेक्स्ट लेयर वाले पेज इमेज का सेट होती है, इसलिए निकालने के लिए कुछ नहीं होता। टेक्स्ट पहचानने के लिए पहले इसे OCR PDF से गुजारें, फिर यहां वापस आकर उसे निकालें।
निष्कर्षण असल में कैसे काम करता है
असली टेक्स्ट वाली PDF पैराग्राफ को उस तरह स्टोर नहीं करती जैसे Word दस्तावेज़ करता है — वह पेज पर सटीक निर्देशांक पर रखे व्यक्तिगत ग्लिफ को स्टोर करती है, साथ में कैरेक्टर कोड की एक मैपिंग। PDF to Text पेज-दर-पेज उन पोजीशन किए गए ग्लिफ में जाता है और उनके निर्देशांक के आधार पर उन्हें लाइनों में फिर से जोड़ता है, यही वजह है कि पढ़ने का क्रम आमतौर पर सही रहता है भले ही PDF फॉर्मेट में खुद "लाइन" या "पैराग्राफ" की कोई असली अवधारणा न हो।
जब निष्कर्षण गलत हो जाए
कभी-कभी कोई PDF खराब या गैर-मानक फॉन्ट एनकोडिंग के साथ बनाई गई होती है — पुराने, कम इस्तेमाल होने वाले सॉफ्टवेयर से एक्सपोर्ट किए गए पुराने दस्तावेज़ों में यह आम है — और टेक्स्ट गड़बड़ करैक्टर के रूप में निकलता है भले ही वह देखने में ठीक लगे। निष्कर्षण की तरफ से इसका कोई समाधान नहीं है; फाइल के अंदर की टेक्स्ट मैपिंग ही खराब है। समाचार पत्रों या शैक्षणिक पेपर जैसे बहु-कॉलम लेआउट भी अप्रत्याशित क्रम में मिल सकते हैं, क्योंकि टूल विज़ुअल कॉलम से नहीं, पोजीशन से पढ़ता है।
लोग इसका इस्तेमाल किसलिए करते हैं
आम इस्तेमाल में किसी बड़े दस्तावेज़ में सर्च करना, संख्या या क्लॉज़ को स्प्रेडशीट में डालना, किसी दस्तावेज़ को ऐसे टूल में डालना जो सिर्फ सादा टेक्स्ट स्वीकार करता हो, या स्क्रीन रीडर के लिए सामग्री को सुलभ बनाना शामिल है। निकाले गए टेक्स्ट की बजाय खुद PDF की एक्सेसिबिलिटी के लिए, OCR PDF देखें, जो दस्तावेज़ छोड़े बिना एक असली टेक्स्ट लेयर जोड़ता है।