HTR/OCR Research day

Optical Character Recognition (OCR/HTR) and extraction of spatial information from digitised historical sources

Research day
Author

Marion Maisonobe

Published

December 10, 2025

On 10 December 2025, a research day organised as part of the ANR OCEANLINKS project was held at the Condorcet Campus (Greater Paris). The event consisted of a series of presentations on methods for the optical recognition of handwritten or typewritten text for research purposes. The morning session focused on the specific case of data from higher education and research archives, whilst the afternoon session centred on the extraction and processing of spatial information derived from historical sources. Working protocols were presented, along with processing workflows designed to be reused.

The slide presentations (in French) given on this occasion can be viewed below; they are listed in the order in which the presentations were delivered.

Higher education and research archives in France and Belgium

  • Viera Rebolledo-Dhuin (Université Paris-Est Créteil, Centre de Recherche en Histoire européenne comparée). Le développement de la base PRET19 à partir de l’HTRisation des registres de prêt de bibliothèques universitaires parisiennes au XIXe siècle : conception, construction, alimentation.


Consulter en plein écran


  • Matthieu Pichon (ULB, Ratio DH). La numérisation est-elle encore un problème ? Réflexions autour de l’OCR du corpus des thèses de l’Université Libre de Bruxelles.


Consulter en plein écran


  • Pierre Verschueren (Centre Lucien-Febvre, Université Marie et Louis Pasteur). Les doctorats ès lettres et ès sciences : numérisation des thèses et prosopographie des docteur-es (XIX-XXe siècles).


Consulter en plein écran


  • Marion Maisonobe (CNRS, Géographie-cités). Le projet OCEANLINKS : des sources hétérogènes pour reconstituer les échanges savants entre stations marines.


Consulter en plein écran


  • Océane Valencia (Sorbonne Université). Cartographie et état des traitements des fonds des stations marines de Sorbonne Université.


Consulter en plein écran


Challenges and best practices for extracting spatial information from digitised historical sources

  • Carmen Brando (EHESS, Plateforme géomatique, CRH). Travaux collectifs de l’ANR TopUrbi : méthodes et impasses dans le travail textuel et cartographique du dictionnaire historique d’Alcedo.


Consulter en plein écran


  • Nathalie Abadie (LASTIG, Univ. Eiffel, IGN-ENSG). Des annuaires du commerce parisien du 19ème siècle à des graphes de connaissances géohistoriques professionnels.


Consulter en plein écran


  • Solenn Tual (LASTIG, Univ. Eiffel, IGN-ENSG). Interprétation sémantique de tables historiques : des sources anciennes aux graphes de connaissances.


Consulter en plein écran


  • Joseph Chazalon (Laboratoire de recherche de l’EPITA). Des sources sérielles aux données structurées pour les humanités numériques : présentation de l’écosystème Mezanno.

The Mezanno project team presented its overall approach, which aims to provide an ecosystem of open-source, interoperable tools centred on the production of structured data from historical serial sources (directories, registers, tables, etc.) for the digital humanities. The value of this approach and the user-friendliness of the “Corpusense” tool, which allows users to process a collection of their choice entirely independently, were illustrated using the example of cinema directories. These initial results are encouraging and enable a more precise identification of the challenges associated with this type of approach, particularly regarding the assessment of the reliability of the data produced.


Consulter en plein écran


  • Thierry Paquet (LITIS, Université de Rouen Normandie). Pop Pop Pop… : Apport des modèles génératifs multimodaux dans les projets de démographie historique.


Consulter en plein écran