Procesamiento Digital del Heraldo del Cinematografista

Descripción del proceso de digitalización, corrección y reconocimiento de texto — corpus 1929–1932

Detección y recorte de la página

Las capturas fotográficas del Heraldo presentan un desafío inicial: la imagen incluye siempre una porción del entorno —la encuadernación, la superficie de trabajo, otras hojas— y la página del periódico aparece inclinada y con bordes que no coinciden con los bordes de la fotografía. El primer paso del procesamiento consiste en identificar automáticamente dónde está la página dentro de la imagen y recortarla con precisión.

Para lograrlo, la imagen pasa por una cadena de transformaciones. Primero se convierte a escala de grises para simplificar el análisis, y luego se normalizan los niveles de tono: el sistema examina la distribución de grises de la imagen y ajusta el rango disponible para que los negros sean negros y los blancos sean blancos, mejorando el contraste sin intervención manual. Sobre esta imagen normalizada se aplica el algoritmo de Canny, que resalta únicamente los bordes y contornos descartando el resto de la información. El resultado es una imagen binaria donde solo aparecen líneas. Sobre esas líneas opera la transformada de Hough, que detecta segmentos rectos y los agrupa. Del conjunto de líneas detectadas se seleccionan las cuatro más probables de corresponder a los bordes físicos de la página —una por cada lado— y sus intersecciones dan las cuatro esquinas del polígono de recorte. Finalmente la imagen se recorta y endereza.

Captura original
1. Captura originalLa fotografía sin procesar, en color. La página aparece con el fondo del entorno visible alrededor.
Escala de grises
2. Conversión a escala de grisesSe elimina la información de color, que no aporta al análisis de bordes y solo agrega complejidad.
Análisis del histograma
3. Análisis de la distribución tonalEl sistema examina el histograma de la imagen y detecta automáticamente los puntos de referencia de tonos: sombras, medios y luces.
Imagen normalizada
4. Normalización de nivelesLos tonos se redistribuyen para aprovechar el rango completo disponible: la imagen gana contraste sin saturar blancos ni negros.
Detección de bordes Canny
5. Detección de bordes (Canny)Solo quedan visibles los contornos. Los bordes de la página, columnas y texto aparecen como líneas sobre un fondo negro.
Líneas de Hough
6. Líneas candidatas (transformada de Hough)El sistema detecta todas las líneas rectas presentes. En rojo las horizontales, en azul las verticales. Las oblicuas se descartan.
Polígono de página detectado
7. Polígono de borde de páginaDe entre todas las líneas detectadas se seleccionan los cuatro bordes de la página y se calculan sus intersecciones, obteniendo las esquinas exactas del recorte.
Rectángulo de recorte
8. Rectángulo de recorteA partir del polígono detectado se determina el área de corte, compensando la inclinación de la captura.
Imagen final recortada
9. Resultado del recorte — La página del Heraldo aislada, recortada y alineada, lista para las siguientes etapas del procesamiento.

Problemas encontrados en las capturas y sus soluciones

Elementos del entorno que dificultan la detección de bordes

El mayor desafío para la detección automática de los bordes de página es la presencia de elementos en el entorno inmediato de las hojas: otras hojas sueltas, la encuadernación del tomo, papeles de diferente tonalidad o bordes brillantes por el lomo del libro. El algoritmo puede confundir estos elementos con el borde de la página e intentar recortar un área incorrecta.

Caso problemático 1
Diversas hojas superpuestasMúltiples páginas de diferente tonalidad crean bordes falsos que compiten con el borde real de la página a digitalizar.
Caso problemático 2
Hojas blancas intercaladasLas hojas en blanco intercaladas generan bordes de alto contraste que el sistema puede priorizar erróneamente sobre la página del periódico.
Caso problemático 3
Lomo del libroEn el extremo interior de la doble página, el lomo de la encuadernación genera sombras y bordes pronunciados que interfieren con la detección.

Se desarrolló un proceso de selección de líneas que prioriza las que se encuentran en las posiciones más extremas de la imagen —los bordes reales de la página suelen ser las líneas más hacia afuera en cada dirección— y aplica criterios de agrupamiento para descartar líneas aisladas o inconsistentes con el resto.

Para los casos que aun así resultan problemáticos, el sistema incluye un mecanismo de detección automática de recortes anómalos: se compara la proporción y el área del polígono detectado contra los valores típicos del corpus. Las imágenes que se alejan significativamente de esos valores quedan marcadas para revisión.

Inclinación de la captura

Para que el reconocimiento óptico de caracteres funcione correctamente, es fundamental que las líneas de texto sean horizontales. Las capturas fotográficas presentan habitualmente pequeñas inclinaciones debidas al posicionamiento del documento al fotografiar. El proceso de corrección de inclinación enfrenta además un inconveniente: el borde físico de la página no es un indicador fiable del ángulo correcto, ya que el corte de guillotina de los ejemplares del Heraldo no siempre es perfectamente ortogonal. En lugar de usar el borde de la página, se usan las propias líneas de texto impreso como referencia, ya que estas sí son horizontales por definición tipográfica.

Clasificación de líneas
Clasificación de líneas detectadasLas líneas de Hough se clasifican en horizontales (cian), verticales (rojo) y oblicuas (azul). Las líneas de texto producen una concentración clara en ángulos cercanos a 0°.
Inclinación detectada
Inclinación detectada: 0,91°Se aprecia claramente la discrepancia entre el ángulo del borde físico de la página y el ángulo de las líneas de texto. La corrección sigue a estas últimas.
Rectángulo de recorte con inclinación
Rectángulo de recorteEl recorte envuelve la página ya enderezada. En las esquinas se observan las áreas negras producidas por la rotación, fuera del área de la página.

Al rotar la imagen para corregir la inclinación, aparecen necesariamente zonas sin información en las esquinas —áreas negras que quedan fuera de la región de la página pero dentro del rectángulo de imagen. Estas áreas se eliminan aplicando una máscara sobre el polígono real de la página: todo lo que queda fuera del borde del papel se pinta de blanco, desapareciendo como si nunca hubiera estado.

Antes de la máscara
Antes de la máscaraLas esquinas en negro corresponden a áreas fuera del borde físico del papel, resultado de la rotación para corregir la inclinación.
Después de la máscara
Después de aplicar la máscaraEl área exterior al polígono de página queda en blanco. La imagen final representa únicamente el contenido del papel, sin artefactos de rotación.

Falta de uniformidad en la iluminación

El dispositivo de captura usado —un escáner en V, diseñado para libros encuadernados— ilumina el documento desde arriba. La curvatura natural del papel al estar abierto, combinada con la posición fija de las fuentes de luz, produce una iluminación no uniforme: el centro de la página suele recibir más luz que los bordes, y pueden aparecer reflejos locales. El resultado es un gradiente suave de brillo que recorre la imagen de un extremo al otro.

Este gradiente, imperceptible en la captura cruda, se vuelve problemático al aplicar contraste para mejorar la legibilidad: en lugar de oscurecer solo el texto, el contraste amplifica también las diferencias de iluminación, haciendo que las zonas más oscuras de la imagen queden prácticamente ilegibles.

Captura cruda
Captura crudaLa imagen tal como sale del escáner. El gradiente de iluminación no uniforme es apenas perceptible a simple vista.
Contraste sin normalización
Contraste aplicado sin corrección previaAl aumentar el contraste directamente, la no-uniformidad de la iluminación se amplifica: algunas zonas pierden detalle por exceso de oscuridad.
Imagen normalizada
Luego de la normalización de fondoEl gradiente de iluminación ha sido corregido. La imagen presenta una luminosidad uniforme, preservando la tonalidad cálida del papel original.

La corrección se realiza estimando la iluminación de fondo: se aplica un desenfoque gaussiano de gran radio a la imagen, obteniendo una versión de la misma que solo contiene las variaciones lentas de brillo —el gradiente de iluminación— sin el detalle del texto. Esta imagen de fondo estimado se usa luego para compensar la imagen original, dividiendo cada punto de la captura por el valor correspondiente de brillo en el fondo estimado. El resultado equivale a eliminar la "firma de iluminación" del escáner, dejando únicamente la reflectancia del papel y la tinta.

La corrección opera sobre el canal de luminosidad de la imagen en espacio de color LAB, lo que permite corregir el brillo sin alterar los tonos de color. Así el fondo cálido y amarillento del papel original se preserva intacto.

Preparación para la visualización en pantalla

La captura original de una página del Heraldo, aunque fiel al documento físico, no ofrece condiciones óptimas de lectura en pantalla: el contraste es bajo, el texto aparece gris sobre un fondo apenas más claro, y las variaciones de iluminación dificultan la lectura continuada.

La solución obvia —convertir la imagen a blanco y negro puro— resuelve el contraste pero elimina completamente la textura y el color del papel, dando una imagen de aspecto artificial que pierde el carácter del documento original. Se buscó un punto intermedio: una imagen con el contraste suficiente para una lectura cómoda, pero que conserve la tonalidad cálida del papel.

Esto se logra aplicando la normalización de iluminación sobre el canal de brillo de la imagen, dejando intactos los canales de color. El texto queda oscuro y definido, el fondo recupera una luminosidad uniforme, y el amarillo envejecido del papel sigue siendo perceptible. La imagen resultante es la que se embebe en los archivos PDF como capa visual.

Reconocimiento de texto (OCR)

La última etapa del procesamiento aplica reconocimiento óptico de caracteres (OCR) sobre la imagen de cada página, convirtiendo el texto impreso en texto digital buscable y copiable.

Para el OCR se usa una versión binarizada de la imagen: blanco y negro puro, sin grises intermedios. La binarización utilizada es umbralización adaptativa local (algoritmo de Sauvola): en lugar de aplicar un umbral único a toda la imagen, el algoritmo calcula un umbral específico para cada pequeña zona de la imagen, basándose en el brillo promedio y la variación de tonos de esa zona. Esto hace que el proceso sea robusto frente a variaciones locales de iluminación descriptas anteriormente, y que el texto en zonas más oscuras o más claras quede igualmente bien definido para el reconocedor.

El motor de OCR genera un archivo hOCR: un documento que contiene tanto el texto reconocido como las coordenadas exactas de cada palabra en la página. A partir de ese archivo se construye el PDF final, que combina la imagen de visualización (con la tonalidad del papel original) y una capa de texto invisible posicionada sobre cada palabra. El resultado es un documento que se ve como el periódico original pero que permite buscar, copiar y seleccionar el texto.


Procesamiento realizado con Copista-Pipeline · Abril 2026