Aller au contenu

7 questions d'arbitrage

Statut : doctrine acquise. À passer avant chaque décision produit / archi, individuellement ou en synchro. Référence externe : assets/Memo - Parallele LIDAR et architecture Bricks OS.md.

La grille

1. Cette spécialisation d'agent bat-elle Manus one-shot sur le golden dataset ?

Si non → soit l'archi est mal pensée (cf. risque LIDAR #1), soit l'agent n'est pas mûr → on n'industrialise pas.

2. Cette étape est-elle vraiment procédurale/déterministe, ou du LLM déguisé ?

Calcul d'un ratio, formule frais de notaire, règle marge < 10% = code Python. Un Nième prompt qui relit les mêmes docs = LLM déguisé, à éviter.

3. Cette nouvelle règle est-elle de niveau A (contrat) ou B (jugement) ?

  • Niveau A : contrat public, stable (marge < 10% = refus, LTV ≥ 80% = refus). OK.
  • Niveau B : jugement hand-coded ("si surface > X et ville en zone Y et porteur a moins de Z années…"). Réponse par défaut : « et si on ajoutait 20 exemples au golden dataset à la place ? »
  • Niveau C : jugement appris du dataset. Cible.

4. Cette nouvelle source est-elle indépendante des sources existantes, ou corrélée ?

Trois prompts différents sur le même LLM lisant les mêmes docs ≠ triangulation. C'est du consensus corrélé (risque LIDAR #3). La triangulation marche si les sources peuvent se tromper pour des raisons différentes.

5. Cette amélioration agit sur la boucle d'apprentissage ou sur la spécification amont ?

  • Boucle d'apprentissage = capture passive, dataset, eval, mesure. ✅
  • Spécification amont = nouvelle règle, nouveau capteur, nouveau dashboard. ⚠️ à challenger.

6. Ce monitoring est-il une béquille temporaire ou une dette permanente ?

Si on rajoute du monitoring trimestre après trimestre sans jamais en retirer, c'est qu'on compense une fragilité structurelle. À documenter avec un sunset criteria.

7. Cette décision résout le fond (cognition, jugement) ou la surface (mesure, règle) ?

Fond = améliorer la qualité de l'analyse / du jugement. Surface = mieux mesurer ce qu'on fait déjà mal. Les deux sont utiles, mais à ne pas confondre.


Comment utiliser cette grille

En solo (avant d'ouvrir une PR)

Te poser explicitement ces 7 questions. Si une réponse est gênante → en parler avant de coder.

En synchro (atelier décision)

Lire la grille à haute voix avant de trancher. Forcer la justification sur chaque question, même rapide.

En review (PR ou design doc)

Demander au reviewer de vérifier que la grille a été passée. Idéalement, le doc de design la mentionne explicitement.


Cas réels d'application

S17 (27/04) — estimate_value V4

Question 1 (bat-elle Manus ?) → on ne sait pas, pas mesuré. Question 5 (boucle d'apprentissage ?) → non, on rajoute des règles. Décision : pas d'itération V5 avant mesure quanti V3 vs V4. Anti-LIDAR explicite.

S19 mid-week (07/05) — Validation systématique des AM

Question 5 (boucle d'apprentissage ?) → non, on demande aux AM de valider à la main → travail répétitif sans signal. Question 6 (béquille temporaire ?) → oui mais sans sunset criteria. Décision : passer à validation auto sur convergence + HITL sur conflit. Voir ADR-001.

S19 mid-week (07/05) — Doc métier in-app vs Notion

Question 5 (boucle d'apprentissage ?) → la doc in-app est consultée au moment où la question se pose (capture passive de l'utilité). La doc Notion est lue 1× et oubliée. Décision : doc co-localisée in-app. Voir ADR-006.

S18 (05/05) — Refonte fiche consolidée

Question 4 (source indépendante ?) → l'agent lit 4 sources structurellement différentes (déclaratif, OCR, AM, messagerie). ✅ Question 1 (bat-il l'existant ?) → permet aux tier 2/3 de consommer la matière AM, prouvé sur cas concret (surface Latimon). ✅ Décision : merge.

Sources