Aller au contenu

OCR benchmark — analyse

DRI : Romain · Project migré comme hypothèse. Les résultats de janvier 2026 doivent être rejoués avant toute décision.

Problème

La qualité d’extraction documentaire dépend du parseur / OCR ; sans benchmark comparable, on itère à l’aveugle.

Hypothèse

Si plusieurs solutions OCR sont comparées sur les mêmes documents et la même ground truth, alors la squad peut changer de fournisseur sans régression silencieuse.

Outcome visé

Choisir ou confirmer la stack OCR/parsing sur un périmètre égal.

  • Baseline : résultats historiques de janvier 2026, non validés comme référence courante.
  • Target : précision >95 % et couverture complète sur le corpus retenu.
  • Date de mesure : [à confirmer au redémarrage].

Plus petit test

Prendre deux catégories de documents, deux exemples par catégorie et deux solutions. Rejouer extraction + scoring en une commande.

Learning goal

Identifier les catégories de documents et les champs pour lesquels le choix OCR change réellement la qualité métier.

Kill criteria

  • Arrêter si le benchmark ne distingue pas les erreurs qui comptent pour les champs métier.
  • Ne pas industrialiser tant que la ground truth n’est pas relue par un owner métier.
  • Ne pas changer de stack pour un gain inférieur à l’incertitude du benchmark.

Périmètre

  • OCR et parsing documentaire ;
  • précision, couverture, latence et coût ;
  • comparaison à périmètre égal ;
  • détection de régression.

Hors-scope

  • évaluation complète du raisonnement des agents ;
  • dashboard permanent ;
  • documents clients réels dans le repository ;
  • migration fournisseur avant un test reproductible.

DRI

Romain · owner tech à confirmer lors de la reprise.

Métriques de succès

  • Précision et couverture par catégorie.
  • Latence et coût par document.
  • Stabilité entre deux runs identiques.
  • Nombre d’erreurs critiques restantes.

Risques identifiés

  • Ground truth trop petite ou incorrecte.
  • Comparaison sur des périmètres différents.
  • Sur-optimisation du benchmark au détriment des documents réels.
  • Dépendance fournisseur masquée par un score moyen.

Liens

Sources