Comment fonctionne, en bref, la reconnaissance de texte
Pour un ordinateur, une numérisation est une image : des points colorés, sans signification. L'OCR — la reconnaissance optique de caractères — parcourt l'image, identifie les zones contenant de l'écriture, sépare les lignes et les caractères et les transforme en texte. Au-dessus de ce texte se construit un index, c'est-à-dire une structure qui permet une recherche rapide sans devoir relire chaque document. La qualité du résultat dépend de la source : un document imprimé, numérisé bien droit, à 300 dpi, est reconnu presque parfaitement ; un document photographié de travers, avec des ombres, ou une écriture manuscrite sont reconnus seulement partiellement. C'est pourquoi la plateforme conserve toujours l'image originale à côté du texte extrait — le texte sert la recherche, l'image reste le document.
Recherche dans le contenu plus filtres sur les métadonnées
La recherche par texte seul donne trop de résultats, et la recherche par métadonnées seules suppose que quelqu'un les a correctement renseignées. C'est la combinaison des deux qui fonctionne en pratique. Vous partez d'un mot ou d'une expression qui figure sûrement dans le document, puis vous restreignez avec les filtres dont vous disposez déjà : la période, le service, la catégorie de la nomenclature, l'émetteur. Les résultats affichent l'extrait de texte où la correspondance a été trouvée, afin que vous distinguiez rapidement le document recherché parmi des documents similaires. La même recherche peut être enregistrée et réutilisée — utile pour les vérifications périodiques, où la question se répète mois après mois.
Métadonnées complétées automatiquement à partir du texte reconnu
La partie la plus chronophage de la numérisation d'une archive n'est pas la numérisation elle-même, mais le remplissage des métadonnées. L'OCR réduit considérablement ce travail : à partir du texte reconnu, les champs usuels peuvent être extraits automatiquement — la date du document, le numéro, l'émetteur, le montant. Ils sont proposés, pas imposés : l'opérateur confirme ou corrige, et les corrections améliorent les résultats suivants. Pour de gros lots de documents du même type, les modèles d'extraction peuvent être définis une fois et appliqués à tout le lot, ce qui transforme une opération de plusieurs semaines en une opération de plusieurs jours.
Ce que l'OCR ne peut pas faire, et comment éviter les surprises
Il est honnête d'énoncer aussi les limites. L'écriture manuscrite est reconnue de façon inégale, et les formulaires remplis à la main restent, en général, un problème. Les documents avec des tampons superposés au texte, les numérisations à basse résolution ou les pages pliées produisent des erreurs de reconnaissance. En pratique, cela signifie qu'un mot recherché peut manquer dans l'index alors qu'il figure sur le papier. La recommandation est simple : pour les catégories critiques, renseignez manuellement quelques métadonnées clés, afin que la recherche ne dépende pas exclusivement du texte reconnu, et numérisez à une qualité correcte dès le départ — une re-numérisation coûte plus cher qu'une numérisation bien faite du premier coup.