PDF से Markdown

शीर्षक, सूचियाँ, तालिकाएँ और तस्वीरें साफ़ Markdown में, और चाहें तो नॉलेज बेस के लिए चंक्स का बंडल भी। सब कुछ आपके ब्राउज़र के भीतर।

PDF ARENA में खोलें

पहले पढ़ने का क्रम

दो कॉलम, साइडबार और हर पन्ने पर दोहराते शीर्षक — एक भी अक्षर लिखे जाने से पहले सुलझा लिए जाते हैं।

फ़ैसले के साथ आती तालिकाएँ

हर तालिका विश्वास का एक आँकड़ा साथ लाती है। डगमगाती तालिका पर निशान लगता है, उसे चुपचाप गढ़ा नहीं जाता।

एक पैकेज, बेतरतीब ढेर नहीं

हर खंड के साथ उसका शीर्षक-पथ, पन्ने और छाप। सीधे नॉलेज बेस में डाल दें।

Markdown जो दस्तावेज़ का आकार बचाए रखता है

PDF में पैराग्राफ़ नहीं होते। उसमें टेक्स्ट के टुकड़े होते हैं, और हर टुकड़े के साथ एक मैट्रिक्स जो बताता है कि उसे कहाँ रंगना है। इन्हें फ़ाइल के क्रम में उगल दीजिए, और जिस पल पन्ने पर दो कॉलम, एक साइडबार या हर शीट के ऊपर दोहराता कोई बैनर आया, नतीजा बकवास हो जाता है। इसलिए असली काम Markdown के बनने से पहले होता है। टुकड़े पढ़ने की पंक्तियाँ बनते हैं, पंक्तियाँ कॉलम में छँटती हैं, दोहराते बैनर पकड़े और हटाए जाते हैं, और तभी गद्य शीर्षकों, बुलेट और ग्रिड में बदलता है। शीर्षक के स्तर उन आकारों से आते हैं जो आपका दस्तावेज़ असल में इस्तेमाल करता है, क्रम में लगाकर: सबसे बड़ा पहला, उसका माप जो भी हो। कोई तय सीमा 11-पॉइंट की रिपोर्ट में 18-पॉइंट के शीर्षक को हर बार गलत पढ़ेगी। यह सब आपके ब्राउज़र के भीतर। कुछ भी बाहर नहीं जाता।

PDF को Markdown में कैसे बदलें

1

अपना PDF खोलें

उसे यहाँ छोड़ें। बदलना तुरंत शुरू होता है और फ़ाइल आपकी मशीन पर ही रहती है।

2

जो निकला उसे पढ़ें

नतीजा एक ऐसे बॉक्स में आता है जिसे आप संपादित कर सकते हैं। कोई शीर्षक ठीक करें, टूटा वाक्य जोड़ें, भटकी पंक्ति मिटाएँ।

3

अपनी किस्म चुनें

GitHub, CommonMark, MDX, Obsidian या Notion। छवियाँ फ़ोल्डर में या इनलाइन। ग्रिड Markdown, HTML या CSV के रूप में।

4

डाउनलोड करें, या पैकेज बनाएँ

एक .md, या एक ZIP जिसमें नॉलेज बेस के लिए खंड, तस्वीरें, ग्रिड और उद्गम की जानकारी।

क्या फिर से बनाया जाता है, और किस पर निशान लगता है

कॉलम गटर खोजकर पहचाने जाते हैं: खड़ी पट्टियाँ जिन्हें कोई पंक्ति नहीं काटती और जो टेक्स्ट की पट्टी के बड़े हिस्से तक फैली रहती हैं। चौड़ाई अकेले कुछ साबित नहीं करती। एक कॉलम वाली रिपोर्ट में दो खानों की एक ग्रिड हो, तो पूरे पन्ने पर छोटे-छोटे अंतराल बिखरे मिलते हैं, और चौड़ाई पर टिकी कोई सीमा उनमें से हर एक को कॉलम की सीमा कह देगी; इसलिए बात यह तय करती है कि असली गटर वह है जिसका आदर हर मुख्य पंक्ति करती है, और फ़ैसला दोनों किनारों पर ढकी ऊँचाई का हिस्सा करता है। दोहराते बैनर अंकों को हटाकर मिलाए जाते हैं, क्योंकि "Page 3 of 40" और "Page 4 of 40" एक ही फ़ुटर हैं। दस में से छह पन्ने। उससे कम पर पंक्ति बनी रहती है। ग्रिड सबसे ईमानदार हिस्सा हैं। तीन या उससे अधिक लगातार पंक्तियाँ, जिनके टुकड़े लगभग एक ही x स्थिति से शुरू होते हैं, एक तालिका बनाती हैं; गद्य ऐसा नहीं करता। सीमाएँ टाइप के आकार के अनुपात में एक सहनशीलता के साथ गुच्छे बनाती हैं, और हर तालिका विश्वास का एक आँकड़ा साथ लेकर निकलती है: उसकी उन पंक्तियों का हिस्सा जो इन सीमाओं का सचमुच आदर करती हैं। 0.6 से नीचे भी वह लिखी जाती है, उस पर निशान लगता है और चेतावनी उठाई जाती है। खाने गढ़ना इससे बुरा होता। तस्वीरें मूल स्ट्रीम से निकाली नहीं जातीं, बल्कि रेंडर किए गए पन्ने से 216 dpi पर काटी जाती हैं। इसमें मूल रिज़ॉल्यूशन की कीमत लगती है, और बदले में PDF जो भी एन्कोडिंग ढो सकता है, उन सबके पार टिकाव मिलता है। बंडल में JSONL की हर पंक्ति पर एक खंड होता है, हर एक के साथ उसका शीर्षक-पथ, पन्ने, टोकन का अनुमान और SHA-256, और साथ में एक नक्शा जो बताता है कि कौन सा ब्लॉक किस पन्ने से आया। खंड ब्लॉक की सीमाओं पर टूटते हैं। हमेशा। टोकन की गिनती पूरी करने के लिए किसी पैराग्राफ़ को वाक्य के बीच से काटने पर ऐसे टुकड़े बनते हैं जिन्हें कोई अकेले नहीं पढ़ता, और इससे पुनर्प्राप्ति का पूरा मकसद ही मर जाता है।

यही क्यों

पढ़ने का क्रम पहले सुलझता है: कॉलम, साइडबार, दोहराते बैनर।

तालिकाएँ विश्वास का आँकड़ा साथ लाती हैं, और संदिग्ध तालिका खुद ऐसा कह देती है।

खंड, उद्गम और छापें एक ही बंडल में, आपकी मशीन पर जुड़कर।

PDF से Markdown के बारे में सवाल

छोटे जवाब, सीमाएँ भी शामिल

क्या यह दो कॉलम वाले दस्तावेज़ संभालता है?
हाँ। गटर हर पन्ने के लिए अलग खोजे जाते हैं, और अगला कॉलम शुरू होने से पहले हर कॉलम ऊपर से नीचे तक पढ़ा जाता है। शोध-पत्र और मैगज़ीन उसी क्रम में निकलते हैं जिसमें इंसान पढ़ता है, उस क्रम में नहीं जिसमें फ़ाइल उन्हें रखती है।
तालिकाएँ भरोसे की हैं?
वे एक संख्या के साथ आती हैं जो यह आपको बता देती है। PDF में खाने जैसी कोई चीज़ नहीं होती, सिर्फ़ स्थान होते हैं, इसलिए तालिका हमेशा एक पुनर्निर्माण ही है। 0.6 से ऊपर वह आम तौर पर सटीक होती है; उससे नीचे चेतावनी के साथ आती है, ताकि आप देख लें। कुछ भी गढ़ा नहीं जाता।
छवियों का क्या होता है?
उन्हें कंटेंट स्ट्रीम के ज़रिए ढूँढा जाता है, फिर रेंडर किए गए पन्ने से 216 dpi पर काटा जाता है — या तो छवियों के एक फ़ोल्डर में, या base64 के रूप में इनलाइन। आप उन्हें छोड़ भी सकते हैं।
RAG पैकेज में क्या है?
document.md; chunks.jsonl, जिसमें हर पंक्ति पर एक खंड अपने शीर्षक-पथ और पन्नों के साथ; metadata.json, गिनतियों और चेतावनियों के साथ; source-map.json, हर ब्लॉक की स्थिति के साथ; और साथ में तस्वीरें और ग्रिड CSV के रूप में।
क्या यह सूत्रों को LaTeX में बदलता है?
अभी नहीं, और उन्हें बिगाड़ने के बजाय यह इसे मान लेता है। गणित के हिस्से उन्हीं अक्षरों के रूप में निकलते हैं जो उनमें हैं: पढ़ने लायक, पर वैध LaTeX नहीं।

अंतिम अपडेट

अपने PDF के साथ और भी बहुत कुछ करें

उन सभी पेशेवर टूल खोजें जो हमने आपके लिए तैयार किए हैं। सब कुछ एक ही जगह पर।