Ressources · 102
OCR : vérifier la lecture d’un document avant l’automatisation
Contrôler omissions, nombres et ordre de lecture avant qu’une transcription alimente une recherche ou une décision.
· 3 min
Ce que ce guide permet
- Distinguer les sources
- Constituer un témoin lisible
- Tester les erreurs décisives
- Vérifier la structure
- Définir le relais humain
Contrôle express
- Un score élevé suffit-il ?
- Peut-on corriger automatiquement tous les nombres ?
Méthode pas à pas
- 01
Distinguer les sources
Identifiez texte natif, image scannée et mélange des deux. Conservez page, zone et version du document ; une couche de texte existante peut déjà être incorrecte.
Livrable : inventaire des sources et coordonnées.
- 02
Constituer un témoin lisible
Choisissez pages tournées, tableaux, accents et petits caractères. Faites relever les champs importants indépendamment du moteur ; n’utilisez pas sa propre sortie comme vérité de référence.
Livrable : transcription de référence contrôlée.
- 03
Tester les erreurs décisives
Vérifiez montants, dates, identifiants, signes et séparateurs. Une confusion entre zéro et lettre O peut changer un rapprochement même si la plupart des mots sont corrects.
Livrable : erreurs par champ et conséquence.
- 04
Vérifier la structure
Contrôlez colonnes, cellules, en-têtes et pages manquantes. Comparez la lecture après préparation de l’image, en conservant aussi la source originale et les réglages utilisés.
Livrable : test d’ordre et de segmentation.
- 05
Définir le relais humain
Orientez les champs ambigus ou décisifs vers une revue. Gardez valeur brute, correction et responsable ; rejouez les mêmes exemples après modification du moteur ou du traitement.
Livrable : règles de revue et régression.
Que faire de la lecture obtenue ?
Vérifiez l’état observé avant de choisir la suite.
Lecture confirmée
Validez le champ et conservez sa zone source.
Lecture ambiguë
Demandez une revue avant d’utiliser le champ.
Page ou zone manquante
Reprenez la source et vérifiez la couverture.
Fiche de travail à réutiliser
À compléter avec vos observations autorisées. Ces champs constituent une trame de travail, pas des résultats observés.
| Champ | Information à consigner |
|---|---|
| Champ | Valeur lue, page et zone |
| Témoin | Valeur attendue et vérificateur |
| Correction | Décision, auteur et version |
Exemple d’application
Situation illustrative
Cas illustratif : un scan affiche un identifiant contenant O et 0. La transcription paraît fluide mais produit une référence différente.
Décision et preuve attendue
Comparez la zone originale, gardez la valeur ambiguë et bloquez son utilisation automatique jusqu’à confirmation.
Distinguer les mécanismes
| Mécanisme | Utilité | Point de vigilance |
|---|---|---|
| Texte natif | Extraction sans reconnaissance | Contrôler la couche de texte |
| OCR | Lecture de pixels | Conserver le lien avec l’image |
| Revue | Correction d’un champ | Tracer la source et le changement |
Indicateurs de pilotage
| Indicateur | Ce qu’il mesure | Première action |
|---|---|---|
| Champs décisifs | Champs vérifiés sur un témoin | Revoir les échecs |
| Pages couvertes | Pages attendues et effectivement lues | Traiter les omissions |
Erreurs fréquentes
- Utiliser la sortie OCR comme vérité de référence
- Valider un montant sur la seule qualité globale du texte
- Perdre le lien avec la page et la zone source
Questions fréquentes
Un score élevé suffit-il ?
Non. Vérifiez les champs dont une erreur change réellement le résultat ; un score global peut masquer une erreur de montant.
Peut-on corriger automatiquement tous les nombres ?
Évitez les corrections supposées. Comparez à la zone source et demandez une revue lorsque plusieurs lectures sont plausibles.
Références officielles
Date de consultation des références : . La méthode et la fiche de travail proposent des contrôles à adapter à votre contexte ; elles ne constituent pas une certification.






