HivePDF
हिन्दी
← सभी टूल

PDF से टेक्स्ट

PDF से टेक्स्ट निकालकर एक सादे .txt फ़ाइल में डालें — सीधे आपके ब्राउज़र में। मुफ़्त, कोई वॉटरमार्क नहीं, कोई साइन-अप नहीं, कुछ भी अपलोड नहीं होता।

यहाँ PDF ड्रॉप करें या चुनने के लिए क्लिक करें

फ़ाइलें कभी आपके डिवाइस से बाहर नहीं जातीं।यह कैसे काम करता है

PDF को टेक्स्ट में कैसे बदलें

  1. 1ऊपर अपनी PDF डालें (या चुनने के लिए क्लिक करें)।
  2. 2टेक्स्ट निकालें पर क्लिक करें।
  3. 3सारे टेक्स्ट वाली .txt फ़ाइल डाउनलोड करें।

अक्सर पूछे जाने वाले सवाल

क्या मेरी फ़ाइल अपलोड होती है?
नहीं। टेक्स्ट पूरी तरह आपके ब्राउज़र में पढ़ा जाता है — आपकी PDF आपके डिवाइस से बाहर कभी नहीं जाती।
यह कहता है कि कोई टेक्स्ट नहीं मिला — क्यों?
आपकी PDF शायद एक स्कैन (पेजों की इमेज) है जिसमें कोई टेक्स्ट लेयर नहीं है। पहले टेक्स्ट लेयर जोड़ने के लिए इसे OCR PDF से गुज़ारें, फिर टेक्स्ट निकालें।
क्या लेआउट बना रहेगा?
टूल पढ़ने का क्रम और लाइन ब्रेक बनाए रखता है, लेकिन कॉलम, टेबल, या सटीक स्पेसिंग नहीं — यह एक फ़ॉर्मेटेड दस्तावेज़ नहीं बल्कि साफ़ सादा टेक्स्ट बनाता है।

PDF से शब्द निकालें

जब आपको किसी PDF से असली टेक्स्ट चाहिए — उसे कोट करने, सर्च करने, किसी दूसरे टूल में डालने, या किसी दस्तावेज़ में डालने के लिए — PDF to Text फाइल की टेक्स्ट लेयर को पढ़ता है और उसे लाइन-दर-लाइन एक सादे .txt फाइल में फिर से बनाता है। यह पूरी तरह आपके ब्राउज़र में चलता है, इसलिए गोपनीय दस्तावेज़ भी कभी आपके डिवाइस से बाहर नहीं जाता।

टेक्स्ट, लेआउट नहीं

टूल पढ़ने का क्रम और लाइन ब्रेक बनाए रखता है, जो कॉपी करने और दोबारा इस्तेमाल के लिए जरूरी है, लेकिन यह कॉलम, टेबल, या सटीक पोजीशनिंग दोबारा बनाने की कोशिश नहीं करता — नतीजा साफ सादा टेक्स्ट होता है। पेज एक खाली लाइन से अलग किए जाते हैं।

स्कैन की गई PDF

स्कैन की गई PDF बिना टेक्स्ट लेयर वाले पेज इमेज का सेट होती है, इसलिए निकालने के लिए कुछ नहीं होता। टेक्स्ट पहचानने के लिए पहले इसे OCR PDF से गुजारें, फिर यहां वापस आकर उसे निकालें।

निष्कर्षण असल में कैसे काम करता है

असली टेक्स्ट वाली PDF पैराग्राफ को उस तरह स्टोर नहीं करती जैसे Word दस्तावेज़ करता है — वह पेज पर सटीक निर्देशांक पर रखे व्यक्तिगत ग्लिफ को स्टोर करती है, साथ में कैरेक्टर कोड की एक मैपिंग। PDF to Text पेज-दर-पेज उन पोजीशन किए गए ग्लिफ में जाता है और उनके निर्देशांक के आधार पर उन्हें लाइनों में फिर से जोड़ता है, यही वजह है कि पढ़ने का क्रम आमतौर पर सही रहता है भले ही PDF फॉर्मेट में खुद "लाइन" या "पैराग्राफ" की कोई असली अवधारणा न हो।

जब निष्कर्षण गलत हो जाए

कभी-कभी कोई PDF खराब या गैर-मानक फॉन्ट एनकोडिंग के साथ बनाई गई होती है — पुराने, कम इस्तेमाल होने वाले सॉफ्टवेयर से एक्सपोर्ट किए गए पुराने दस्तावेज़ों में यह आम है — और टेक्स्ट गड़बड़ करैक्टर के रूप में निकलता है भले ही वह देखने में ठीक लगे। निष्कर्षण की तरफ से इसका कोई समाधान नहीं है; फाइल के अंदर की टेक्स्ट मैपिंग ही खराब है। समाचार पत्रों या शैक्षणिक पेपर जैसे बहु-कॉलम लेआउट भी अप्रत्याशित क्रम में मिल सकते हैं, क्योंकि टूल विज़ुअल कॉलम से नहीं, पोजीशन से पढ़ता है।

लोग इसका इस्तेमाल किसलिए करते हैं

आम इस्तेमाल में किसी बड़े दस्तावेज़ में सर्च करना, संख्या या क्लॉज़ को स्प्रेडशीट में डालना, किसी दस्तावेज़ को ऐसे टूल में डालना जो सिर्फ सादा टेक्स्ट स्वीकार करता हो, या स्क्रीन रीडर के लिए सामग्री को सुलभ बनाना शामिल है। निकाले गए टेक्स्ट की बजाय खुद PDF की एक्सेसिबिलिटी के लिए, OCR PDF देखें, जो दस्तावेज़ छोड़े बिना एक असली टेक्स्ट लेयर जोड़ता है।

संबंधित टूल्स