PDF vers Markdown
Titres, listes, tableaux et images convertis en Markdown propre, avec un lot de fragments en option pour une base de connaissances. En local.
Ouvrir dans PDF ARENADéposez votre PDF ici ou cliquez pour l'ouvrir
ou cliquez pour sélectionner des fichiers
L'ordre de lecture d'abord
Les deux colonnes, les encarts latéraux et les en-têtes courants sont démêlés avant qu'un seul caractère ne soit écrit.
Des tableaux avec un verdict
Chaque tableau porte un indice de confiance. Un tableau douteux est signalé, jamais inventé en silence.
Un paquet, pas un déversoir
Des fragments avec leur chemin de titres, leurs pages et leur empreinte. À verser directement dans une base de connaissances.
Comment convertir un PDF en Markdown
Ouvrez votre PDF
Déposez-le. La conversion démarre aussitôt et le fichier reste sur votre machine.
Lisez ce qui en sort
Le résultat arrive dans un cadre modifiable. Corrigez un titre, recollez une phrase coupée, effacez une ligne parasite.
Choisissez votre variante
GitHub, CommonMark, MDX, Obsidian ou Notion. Images dans un dossier ou intégrées. Grilles en Markdown, HTML ou CSV.
Téléchargez, ou construisez le paquet
Un seul .md, ou un ZIP contenant les fragments, les images, les grilles et la provenance pour une base de connaissances.
Ce qui est reconstruit, et ce qui est signalé
Les colonnes se trouvent en traquant les gouttières : des bandes verticales qu'aucune ligne ne traverse, couvrant presque toute la hauteur du bloc de texte. La largeur seule ne prouve rien. Un rapport sur une seule colonne où traîne une grille à deux cellules présente des espaces étroits un peu partout, et un seuil posé sur la largeur prendrait chacun d'eux pour une frontière de colonne ; ce qui tranche, c'est qu'une vraie gouttière est respectée par toutes les lignes de texte courant, et la part de hauteur couverte de chaque côté décide. Les bannières courantes sont rapprochées chiffres neutralisés, puisque « Page 3 sur 40 » et « Page 4 sur 40 » sont un seul et même pied de page. Six pages sur dix. En dessous, la ligne reste. Les grilles sont la partie honnête. Trois lignes consécutives ou plus dont les fragments commencent à des positions x à peu près identiques forment un tableau ; la prose, non. Les frontières se regroupent avec une tolérance proportionnelle au corps du texte, et chaque tableau sort avec un indice de confiance : la part de ses lignes qui les respectent vraiment. En dessous de 0,6 il est tout de même écrit, signalé, et remonté en avertissement. Inventer des cellules serait pire. Les images arrivent découpées dans la page rendue à 216 ppp plutôt qu'extraites du flux d'origine. Cela coûte la résolution native, et cela achète la survie face à tous les encodages qu'un PDF peut transporter. Le paquet contient un fragment par ligne en JSONL, chacun avec son chemin de titres, ses pages, une estimation de jetons et son SHA-256, plus une carte qui nomme la page d'où sort chaque bloc. Les fragments se coupent sur les bords de bloc. Toujours. Casser un paragraphe en milieu de phrase pour atteindre un quota de jetons donne des morceaux que personne ne lit seuls, ce qui ruine la recherche.
Pourquoi celui-ci
L'ordre de lecture réglé d'abord : colonnes, encarts, bannières répétées.
Les tableaux portent un indice de confiance, et un tableau douteux le dit.
Fragments, provenance et empreintes dans un seul paquet, assemblé sur votre machine.
Questions sur PDF vers Markdown
Réponses courtes, limites comprises
Gère-t-il les documents sur deux colonnes ?
Les tableaux sont-ils fiables ?
Que deviennent les images ?
Qu'y a-t-il dans le paquet RAG ?
Convertit-il les formules en LaTeX ?
Mise à jour le
Faites-en plus avec vos PDF
Découvrez tous les outils professionnels que nous avons préparés pour vous. Tout en un seul endroit.