फ़ाइलें कभी आपके डिवाइस से बाहर नहीं जातीं।यह कैसे काम करता है
PDF को Markdown में कैसे बदलें
- 1ऊपर अपनी PDF डालें (या चुनने के लिए क्लिक करें)।
- 2Markdown में बदलें पर क्लिक करें।
- 3.md फ़ाइल डाउनलोड करें।
अक्सर पूछे जाने वाले सवाल
- हेडिंग और लिस्ट कैसे पहचानी जाती हैं?
- PDF में कोई संरचना स्टोर नहीं होती, इसलिए HivePDF इसे लेआउट से अनुमान लगाता है: बॉडी से काफ़ी बड़ा टेक्स्ट एक हेडिंग बन जाता है, और बुलेट या नंबर से शुरू होने वाली लाइनें लिस्ट आइटम बन जाती हैं। बाकी को पैराग्राफ़ में समूहित किया जाता है।
- क्या यह स्कैन की गई PDF पर काम करता है?
- नहीं — एक स्कैन बस इमेज होती है बिना पढ़ने के लिए किसी टेक्स्ट लेयर के। पहले टेक्स्ट लेयर जोड़ने के लिए OCR चलाएं, फिर Markdown में बदलें।
- क्या मेरी फ़ाइल अपलोड होती है?
- नहीं। टेक्स्ट पूरी तरह आपके ब्राउज़र में निकाला और कन्वर्ट होता है — आपका दस्तावेज़ आपके डिवाइस से बाहर कभी नहीं जाता।
PDF को साफ़-सुथरे Markdown में बदलें
Markdown बड़े लैंग्वेज मॉडल, स्टैटिक-साइट जनरेटर, और नोट ऐप को दस्तावेज़ खिलाने की साझा भाषा है — लेकिन PDF ऐसा स्ट्रक्चर नहीं रखते जिसे आप एक्सपोर्ट कर सकें। PDF to Markdown टेक्स्ट लेयर पढ़ता है और एक समझदार दस्तावेज़ फिर से बनाता है: यह पेज लेआउट से हेडिंग, बुलेट व नंबर वाली सूचियाँ, और पैराग्राफ़ पहचानता है और उन्हें Markdown के रूप में लिखता है।
LLM और डॉक्स वर्कफ़्लो के लिए बनाया गया
अगर आप RAG पाइपलाइन बना रहे हैं, डॉक्स ड्राफ़्ट कर रहे हैं, या चैट मॉडल में कॉन्टेंट पेस्ट कर रहे हैं, तो कच्चे PDF टेक्स्ट से Markdown के साथ काम करना कहीं ज़्यादा आसान है। आउटपुट हेडिंग लेवल और सूचियाँ बनाए रखता है ताकि स्ट्रक्चर बचा रहे, जो मॉडल को कॉन्टेंट को चंक करने और समझने में मदद करता है।
नोट्स और सीमाएँ
स्ट्रक्चर का अनुमान heuristic तरीक़े से लगाया जाता है, इसलिए जटिल मल्टी-कॉलम लेआउट या टेबल पूरी तरह ठीक से मैप नहीं हो सकते — किसी भी अहम चीज़ के लिए नतीजा जाँच लें। स्कैन की गई PDF को पहले OCR की ज़रूरत है। सब कुछ लोकल ही चलता है, इसलिए कुछ भी अपलोड नहीं होता।
लेआउट को स्ट्रक्चर के रूप में कैसे पढ़ा जाता है
अंदरूनी तौर पर, HivePDF PDF के टेक्स्ट रन में से गुज़रता है और हर एक के फ़ॉन्ट साइज़, वज़न, और पेज पर पोज़िशन रिकॉर्ड करता है। जो रन आस-पास के बॉडी टेक्स्ट से सार्थक रूप से बड़ा है, या अपनी लाइन पर बोल्ड में सेट है, उसे हेडिंग माना जाता है; बाक़ी दस्तावेज़ के मुक़ाबले उसका साइज़ तय करता है कि वह आउटपुट में H1, H2, या H3 बनेगा। डैश, बुलेट ग्लिफ़, या बिंदु के बाद नंबर से शुरू होने वाली लाइनें लिस्ट आइटम बन जाती हैं, और एक जैसे इंडेंट पर लगातार आने वाली लाइनें अलग होने के बजाय एक ही सूची में समूहित होती हैं।
कन्वर्ज़न कहाँ मुश्किल में पड़ता है
टेबल सबसे बड़ी सीमा हैं: PDF किसी टेबल को रो और कॉलम के रूप में नहीं, बल्कि पोज़िशन किए गए टेक्स्ट के रूप में स्टोर करती है, इसलिए सेल अक्सर Markdown टेबल के बजाय एक ही लाइन या पैराग्राफ़ में सिमट जाते हैं। मल्टी-कॉलम अकादमिक पेपर और ब्रोशर, अगर PDF में पढ़ने का क्रम असामान्य है, तो दोनों कॉलम के टेक्स्ट को आपस में मिला सकते हैं। फ़ुटनोट और पेज हेडर या फ़ुटर कभी-कभी बॉडी टेक्स्ट में खिंच आते हैं। आउटपुट को एक मज़बूत पहला ड्राफ़्ट मानें और परफ़ेक्ट राउंड-ट्रिप की उम्मीद करने के बजाय गड़बड़ी वाली जगहों को हाथ से ठीक करें।
एक आम अगला क़दम
बहुत से लोग स्कैन किए हुए दस्तावेज़ पर OCR के बाद इसे चलाते हैं, या Extract Images के साथ जब मूल PDF में डायग्राम और टेक्स्ट मिले-जुले हों जिन्हें वे अलग रखना चाहते हैं।