Comment fonctionne l'OCR sur les documents numérisés ?
L'OCR transforme une page numérisée, simple image au départ, en un document dans lequel vous pouvez rechercher n'importe quel mot.
Răspuns scurt
- OCR signifie reconnaissance optique de caractères : le texte d'une image devient un texte consultable par recherche.
- La numérisation ne produit qu'une image ; sans OCR, son contenu ne peut pas être retrouvé par une recherche.
- L'OCR s'exécute automatiquement au chargement du document et ajoute une couche de texte par-dessus l'image.
- Après traitement, vous pouvez rechercher tout ce qui figure dans le document : nom, numéro d'enregistrement, date ou montant.
Ce que dit la loi (en bref)
- La loi n° 135/2007 relative à l'archivage électronique des documents exige que le document conservé électroniquement reste lisible et non modifié : l'OCR ajoute une fonction de recherche, il ne remplace pas le document original.
- La loi n° 16/1996 sur les Archives nationales met à la charge du détenteur la récupération rapide du document, l'inventaire reste donc nécessaire même avec l'OCR.
- Le Règlement (UE) 2016/679 (RGPD), art. 5, paragraphe 1, point e) : le texte extrait par OCR contient les mêmes données personnelles et relève des mêmes délais de conservation.
- Les documents financiers-comptables numérisés restent soumis aux délais de la loi comptable n° 82/1991 et de l'Arrêté (OMFP) n° 2634/2015.
Exemples pratiques
- Vous recherchez « procès-verbal réception hall 2 » et obtenez quatre résultats parmi 3 500 pages numérisées, en moins d'une seconde.
- Un numéro d'identification fiscale mentionné dans le corps d'un courrier reçu devient consultable par recherche, alors qu'il n'apparaît nulle part dans le nom du fichier.
- À 200 pages numérisées par jour, l'indexation manuelle représenterait environ deux heures de saisie ; l'OCR le fait au chargement.
- Un dossier du personnel de 2014, numérisé rétroactivement, devient consultable par le nom du salarié le jour même.
Erreurs fréquentes
- On numérise à 150 ppp ou moins, ce qui réduit visiblement la précision de la reconnaissance ; 300 ppp est le seuil pratique.
- Les pages sont de travers ou photographiées avec un téléphone, sans redressement automatique.
- On effectue les recherches sans accents, alors que le texte reconnu les contient.
- On suppose que l'OCR est exact à 100 % : sur les documents manuscrits, le résultat reste partiel.
- On renonce à l'inventaire, au motif que « de toute façon on recherche en plein texte ».
Comment 4docs vous aide
- OCR automatique au chargement, y compris pour les imports en masse depuis l'ancienne archive.
- Recherche en plein texte dans le contenu des documents, pas seulement dans le nom du fichier.
- Filtrage combiné par année, type de document, service et délai de conservation.
- Le passage trouvé est mis en surbrillance directement dans l'aperçu de la page.