Guide
Qu’est-ce que l’OCR ? Du document scanné au texte exploitable
Publié le
EN BREF
Comprenez ce que lit l’OCR, la différence avec l’extraction de données et comment le tester sur des factures et reçus avant toute validation.
LE PROCESSUS EN BREF
Du document à la décision
Un exemple du point de contrôle à définir pour chaque processus.

- SourceRepérer le document et la donnée de référence.
- ÉcartRendre visible ce qui manque ou ne correspond pas.
- DécisionConfier l'exception à la personne responsable.
OCR signifie reconnaissance optique de caractères. Cette technologie transforme le texte visible dans une image, une photo ou un PDF scanné en texte exploitable par un logiciel. Elle permet de rechercher ou de copier une information auparavant présente sous forme de pixels. La lecture ne décide pas si le document est correct.
Un PDF n’est pas toujours une image
Essayez de sélectionner une phrase dans votre PDF. Un fichier créé numériquement peut déjà contenir du texte exploitable : une extraction directe sera parfois plus simple. Un scan peut nécessiter l’OCR. Certains fichiers mélangent texte numérique et pages scannées ; vérifiez les pages réelles avant de choisir le traitement.
De la photo aux champs proposés
Un flux pratique conserve l’original, vérifie la présence de toutes les pages, lit le texte puis prépare les champs utiles. Lire « Total : 1 250,00 MAD » ne suffit pas à identifier le montant à payer, sa devise et la facture concernée. L’extraction structure ces informations ; la validation les contrôle selon vos règles.
Exemple fictif : un reçu affiche « 1 250,00 MAD ». L’OCR restitue les caractères, puis l’extraction propose un montant de 1250,00 et la devise MAD. L’affichage original reste disponible à côté des valeurs. Il faut vérifier la convention décimale et déterminer s’il s’agit du total, d’un sous-total ou d’un paiement avant l’enregistrement.
Quelles erreurs prévoir ?
Photos floues, coins coupés, impression effacée, écriture manuscrite et tableaux complexes constituent des cas de test utiles. Un chiffre erroné dans un numéro de facture peut associer un montant correct au mauvais dossier. Un résultat bien présenté doit être contrôlé ; lire avec plus de confiance ne retrouve pas un code chantier absent.
Certains moteurs proposent des scores de confiance. Microsoft explique que les seuils dépendent de l’usage et de la revue humaine. Utilisez le score pour orienter les dossiers, sans le prendre pour une garantie d’exactitude. Testez les seuils sur vos documents et contrôlez séparément les champs dont une erreur aurait une conséquence importante.
Faites un petit test avant de choisir l’outil
Prenez un échantillon autorisé avec des scans nets, des photos ordinaires et des cas difficiles. Relevez vous-même le fournisseur, le numéro de facture, la devise et le montant exacts. Comparez chaque champ. Comptez les corrections et le temps total de revue, au lieu de juger l’outil sur une démonstration séduisante.
Gardez les valeurs manquantes et incertaines visibles. Définissez les cas qui nécessitent une nouvelle photo, une revue ou un passage après contrôle. Avant l’export, vérifiez les formats attendus et la gestion des doublons du logiciel de destination. Comparez aussi ses fonctions de capture et d’import existantes.
Quand l’OCR suffit-il ?
L’OCR peut suffire pour rendre une archive consultable. La saisie structurée des factures exige aussi extraction et validation. Classer des pièces différentes, traiter les exceptions et transmettre des enregistrements approuvés relève d’un flux documentaire plus large. Commencez par nommer votre résultat attendu : texte consultable, champs proposés ou dossier approuvé.
Sources et lectures complémentaires
Microsoft: Document Intelligence transparency note
Appliquer à votre processus
Pour cadrer votre flux, préparez un exemple autorisé, les champs attendus, votre logiciel actuel et le responsable des exceptions. Commencez par des exemples synthétiques lorsque les données confidentielles ne sont pas nécessaires.
