PDF a Markdown
Títulos, listas, tablas e imágenes convertidos en Markdown limpio, con un paquete opcional de fragmentos para una base de conocimiento. En tu navegador.
Abrir en PDF ARENASuelta aquí tu PDF o haz clic para abrirlo
o haz clic para seleccionar archivos
Primero el orden de lectura
Las dos columnas, los laterales y las cabeceras repetidas se resuelven antes de escribir un solo carácter.
Tablas con veredicto
Cada tabla lleva una cifra de confianza. Si una es dudosa, se avisa; nunca se inventa en silencio.
Un paquete, no un volcado
Fragmentos con su ruta de títulos, sus páginas y su huella. Va directo a una base de conocimiento.
Cómo convertir un PDF a Markdown
Abre tu PDF
Suéltalo aquí. La conversión arranca al momento y el archivo se queda en tu equipo.
Lee lo que ha salido
El resultado cae en un recuadro que puedes editar. Arregla un título, une una frase partida, borra una línea suelta.
Elige la variante
GitHub, CommonMark, MDX, Obsidian o Notion. Imágenes en una carpeta o incrustadas. Cuadrículas en Markdown, HTML o CSV.
Descarga, o monta el paquete
Un .md, o un ZIP con fragmentos, imágenes, cuadrículas y procedencia para una base de conocimiento.
Qué se reconstruye y qué se marca
Las columnas se encuentran buscando canalones: franjas verticales que ninguna línea cruza y que recorren casi toda la banda de texto. La anchura por sí sola no prueba nada. Un informe de una sola columna con una cuadrícula de dos celdas tiene huecos estrechos repartidos por todas partes, y un umbral de anchura llamaría frontera de columna a cada uno, así que lo que zanja el asunto es que un canalón de verdad lo respeta cada línea del cuerpo, y decide la proporción de altura cubierta a ambos flancos. Los rótulos repetidos se comparan normalizando los dígitos, porque "Página 3 de 40" y "Página 4 de 40" son el mismo pie. Seis páginas de cada diez. Por debajo de eso, la línea se queda. Las cuadrículas son la parte honesta. Tres o más líneas seguidas cuyos fragmentos empiezan en posiciones x parecidas forman una tabla; la prosa no. Las fronteras se agrupan con una tolerancia proporcional al tamaño de letra, y cada tabla sale con una cifra de confianza: la proporción de sus líneas que las respeta de verdad. Por debajo de 0,6 se escribe igualmente, marcada y con un aviso encima. Inventar celdas sería peor. Las imágenes vienen recortadas de la página rasterizada a 216 dpi, no sacadas del flujo original. Eso cuesta resolución nativa y compra que sobrevivan a cualquier codificación que un PDF pueda llevar. El paquete lleva un fragmento por línea en JSONL, cada uno con su ruta de títulos, sus páginas, la estimación de tokens y su SHA-256, más un mapa que dice qué página produjo cada bloque. Los fragmentos se cortan en los bordes de bloque. Siempre. Partir un párrafo a mitad de frase para cuadrar un recuento de tokens deja trozos que nadie lee por separado, y eso arruina la recuperación por completo.
Por qué esta
El orden de lectura se resuelve primero: columnas, laterales, rótulos repetidos.
Las tablas llevan una cifra de confianza, y la dudosa lo dice.
Fragmentos, procedencia y huellas en un solo paquete, montado en tu equipo.
Preguntas sobre PDF a Markdown
Respuestas cortas, límites incluidos
¿Se le dan bien los documentos a dos columnas?
¿Son fiables las tablas?
¿Qué pasa con las imágenes?
¿Qué hay en el paquete RAG?
¿Convierte las fórmulas a LaTeX?
Actualizada el
Haz más con tus PDFs
Descubre todas las herramientas profesionales que hemos preparado para ti. Todo en un solo lugar.