PDF a Markdown

Títulos, listas, tablas e imágenes convertidos en Markdown limpio, con un paquete opcional de fragmentos para una base de conocimiento. En tu navegador.

Abrir en PDF ARENA

Primero el orden de lectura

Las dos columnas, los laterales y las cabeceras repetidas se resuelven antes de escribir un solo carácter.

Tablas con veredicto

Cada tabla lleva una cifra de confianza. Si una es dudosa, se avisa; nunca se inventa en silencio.

Un paquete, no un volcado

Fragmentos con su ruta de títulos, sus páginas y su huella. Va directo a una base de conocimiento.

Markdown que conserva la forma del documento

Un PDF no guarda párrafos. Guarda fragmentos de texto, cada uno con una matriz que dice dónde pintarlo. Vuélcalos en el orden del archivo y sale un galimatías en cuanto una página tiene dos columnas, un lateral o un rótulo que se repite arriba de cada hoja. Así que el trabajo ocurre antes de que exista Markdown alguno. Los fragmentos se convierten en líneas de lectura, las líneas se ordenan en columnas, los rótulos repetidos se detectan y se descartan, y solo entonces la prosa se vuelve títulos, viñetas y cuadrículas. Los niveles de título salen de los tamaños que tu documento usa de verdad, ordenados: el mayor va primero, mida lo que mida. Un umbral fijo confunde un título de 18 puntos en un informe de 11 puntos todas y cada una de las veces. Todo dentro de tu navegador. No viaja nada.

Cómo convertir un PDF a Markdown

1

Abre tu PDF

Suéltalo aquí. La conversión arranca al momento y el archivo se queda en tu equipo.

2

Lee lo que ha salido

El resultado cae en un recuadro que puedes editar. Arregla un título, une una frase partida, borra una línea suelta.

3

Elige la variante

GitHub, CommonMark, MDX, Obsidian o Notion. Imágenes en una carpeta o incrustadas. Cuadrículas en Markdown, HTML o CSV.

4

Descarga, o monta el paquete

Un .md, o un ZIP con fragmentos, imágenes, cuadrículas y procedencia para una base de conocimiento.

Qué se reconstruye y qué se marca

Las columnas se encuentran buscando canalones: franjas verticales que ninguna línea cruza y que recorren casi toda la banda de texto. La anchura por sí sola no prueba nada. Un informe de una sola columna con una cuadrícula de dos celdas tiene huecos estrechos repartidos por todas partes, y un umbral de anchura llamaría frontera de columna a cada uno, así que lo que zanja el asunto es que un canalón de verdad lo respeta cada línea del cuerpo, y decide la proporción de altura cubierta a ambos flancos. Los rótulos repetidos se comparan normalizando los dígitos, porque "Página 3 de 40" y "Página 4 de 40" son el mismo pie. Seis páginas de cada diez. Por debajo de eso, la línea se queda. Las cuadrículas son la parte honesta. Tres o más líneas seguidas cuyos fragmentos empiezan en posiciones x parecidas forman una tabla; la prosa no. Las fronteras se agrupan con una tolerancia proporcional al tamaño de letra, y cada tabla sale con una cifra de confianza: la proporción de sus líneas que las respeta de verdad. Por debajo de 0,6 se escribe igualmente, marcada y con un aviso encima. Inventar celdas sería peor. Las imágenes vienen recortadas de la página rasterizada a 216 dpi, no sacadas del flujo original. Eso cuesta resolución nativa y compra que sobrevivan a cualquier codificación que un PDF pueda llevar. El paquete lleva un fragmento por línea en JSONL, cada uno con su ruta de títulos, sus páginas, la estimación de tokens y su SHA-256, más un mapa que dice qué página produjo cada bloque. Los fragmentos se cortan en los bordes de bloque. Siempre. Partir un párrafo a mitad de frase para cuadrar un recuento de tokens deja trozos que nadie lee por separado, y eso arruina la recuperación por completo.

Por qué esta

El orden de lectura se resuelve primero: columnas, laterales, rótulos repetidos.

Las tablas llevan una cifra de confianza, y la dudosa lo dice.

Fragmentos, procedencia y huellas en un solo paquete, montado en tu equipo.

Preguntas sobre PDF a Markdown

Respuestas cortas, límites incluidos

¿Se le dan bien los documentos a dos columnas?
Sí. Los canalones se buscan página a página y cada columna se lee de arriba abajo antes de empezar la siguiente. Los artículos y las revistas salen en el orden en que los lee una persona, no en el que los guarda el archivo.
¿Son fiables las tablas?
Llegan con un número que te lo dice. En un PDF no existe la celda, solo hay posiciones, así que una tabla siempre es una reconstrucción. Por encima de 0,6 suele ser exacta; por debajo viene con un aviso para que la mires. No se inventa nada.
¿Qué pasa con las imágenes?
Se localizan a través del flujo de contenido y luego se recortan de la página rasterizada a 216 dpi, a una carpeta de imágenes o incrustadas en base64. También puedes omitirlas.
¿Qué hay en el paquete RAG?
document.md, chunks.jsonl con un fragmento por línea, cada uno con su ruta de títulos y sus páginas, metadata.json con los recuentos y los avisos, source-map.json con la posición de cada bloque, más las imágenes y las cuadrículas en CSV.
¿Convierte las fórmulas a LaTeX?
Todavía no, y lo admite en vez de destrozarlas. Las tiradas matemáticas salen como los caracteres que contienen: legibles, pero no LaTeX válido.

Actualizada el