Comparar PDF

Tres comparaciones a la vez entre dos PDF: palabra por palabra, píxel a píxel, y páginas añadidas, borradas o movidas. Los dos siguen en tu navegador.

Abrir en PDF ARENA

Tres comparaciones a la vez

Texto, píxeles y estructura de páginas, cada uno por separado en vez de mezclados en una sola cifra.

Primero se emparejan las páginas

Metes una hoja en medio y la página 5 ya no es la página 5. La alineación ocurre antes de comparar nada.

Pruebas, no adjetivos

Cada cambio muestra lo que decía y lo que dice. La clasificación solo ordena la lista.

Comparar dos PDF sin mentir sobre ello

La mayoría de los comparadores ponen la página 1 contra la página 1 y siguen. Metes una hoja en medio de un contrato y todas las páginas posteriores se desplazan, así que el informe se llena de diferencias que no son diferencias. El documento no cambió cuarenta veces. Cambió una. Así que el emparejado va primero. Cada página recibe una huella a partir de su texto normalizado, las páginas se casan por similitud y el emparejado corre con penalización por huecos. Inserciones, borrados y hojas movidas salen por lo que son. Solo entonces se compara algo. Después corren tres pasadas por separado. Las palabras te dicen qué dice ahora el texto. Los píxeles te dicen qué zonas se han desplazado aunque los caracteres coincidan. La estructura te dice qué les ha pasado a las hojas.

Cómo comparar dos PDF

1

Carga los dos documentos

El original a la izquierda, la revisión a la derecha. La comparación arranca en cuanto aterriza el segundo.

2

Lee la lista de cambios

Ordenada por peso, así que las cifras, las fechas y los importes llegan antes que las comas. Cada fila muestra el texto viejo y el nuevo.

3

Mira las páginas

Lado a lado con la pareja ya alineada, o superpuestas con un control para fundir una en otra.

4

Llévate las pruebas

Un PDF marcado con recuadros en las zonas cambiadas, más el informe en JSON y los cambios en CSV.

Cómo funcionan las tres comparaciones

Las huellas de página usan conjuntos de palabras y trigramas de caracteres, con los dígitos normalizados y los rótulos repetidos fuera. La similitud es un coeficiente de Jaccard sobre ambos. El emparejado en sí es una pasada de distancia de edición con penalización por huecos, y un segundo repaso de la secuencia encuentra hojas presentes en los dos lados en orden distinto: esas se informan como movidas. No como un borrado más una inserción. La pasada de texto es un diff a nivel de palabra con un presupuesto de edición acotado, así que un documento de cien páginas reescrito de arriba abajo degrada a un informe grueso en vez de colgarte la pestaña. Cada racha lleva etiqueta: cifra, fecha, porcentaje, importe, nombre propio. La etiqueta solo asigna peso para ordenar. La fila siempre lleva el literal de antes y el de después, porque una etiqueta no es una prueba. La pasada visual renderiza las dos hojas a la misma escala y las compara en bloques de ocho por ocho píxeles, con una tolerancia que absorbe el ruido del antialiasing. Los bloques que difieren se agrupan en rectángulos, y esos rectángulos son lo que ves recuadrado en el PDF marcado. Es la pasada que pilla un logo desplazado, un margen ensanchado o una firma sustituida por otra imagen. Nada de eso toca un carácter. Los filtros existen porque dos extracciones del mismo PDF reparten los espacios en blanco de otra manera, y porque insertar una hoja renumera todos los pies que van detrás.

Por qué esta

Las hojas se emparejan antes de comparar, así que una inserción se lee como un cambio.

Las diferencias visuales se informan aparte de las textuales, nunca juntas.

Corre entero en tu navegador. Ninguno de los dos documentos se sube.

Preguntas sobre comparar PDF

Respuestas cortas, con los límites incluidos

¿Y si los dos ficheros tienen distinto número de páginas?
Ese es el caso para el que se hizo esto. Las hojas se casan por contenido, así que una insertada se informa como insertada y todo lo que va detrás sigue cuadrando con su pareja.
¿Funciona con documentos escaneados?
La pasada visual sí, y muchas veces enseña lo suficiente. La pasada de palabras necesita capa de texto, así que en un escaneo puro no encuentra nada. Pasa OCR primero.
¿Algo de esto lo hace un modelo de IA?
No. Todo es aritmética sobre texto y píxeles, en local. No se infiere nada y ningún modelo decide qué cuenta como cambio.
¿Qué sale al final?
Un PDF de la revisión con las zonas cambiadas recuadradas, el informe completo en JSON con el mapa de hojas y todos los cambios, y un CSV para hoja de cálculo.
¿Por qué hay cambios marcados como cifra o como fecha?
Para ordenar la lista. Un importe cambiado suele importar más que una coma cambiada, así que sube. El texto literal se muestra en cualquier caso.

Actualizada el