7 questions d'arbitrage¶
Statut : doctrine acquise. À passer avant chaque décision produit / archi, individuellement ou en synchro. Référence externe :
assets/Memo - Parallele LIDAR et architecture Bricks OS.md.
La grille¶
1. Cette spécialisation d'agent bat-elle Manus one-shot sur le golden dataset ?¶
Si non → soit l'archi est mal pensée (cf. risque LIDAR #1), soit l'agent n'est pas mûr → on n'industrialise pas.
2. Cette étape est-elle vraiment procédurale/déterministe, ou du LLM déguisé ?¶
Calcul d'un ratio, formule frais de notaire, règle marge < 10% = code Python. Un Nième prompt qui relit les mêmes docs = LLM déguisé, à éviter.
3. Cette nouvelle règle est-elle de niveau A (contrat) ou B (jugement) ?¶
- Niveau A : contrat public, stable (marge < 10% = refus, LTV ≥ 80% = refus). OK.
- Niveau B : jugement hand-coded ("si surface > X et ville en zone Y et porteur a moins de Z années…"). Réponse par défaut : « et si on ajoutait 20 exemples au golden dataset à la place ? »
- Niveau C : jugement appris du dataset. Cible.
4. Cette nouvelle source est-elle indépendante des sources existantes, ou corrélée ?¶
Trois prompts différents sur le même LLM lisant les mêmes docs ≠ triangulation. C'est du consensus corrélé (risque LIDAR #3). La triangulation marche si les sources peuvent se tromper pour des raisons différentes.
5. Cette amélioration agit sur la boucle d'apprentissage ou sur la spécification amont ?¶
- Boucle d'apprentissage = capture passive, dataset, eval, mesure. ✅
- Spécification amont = nouvelle règle, nouveau capteur, nouveau dashboard. ⚠️ à challenger.
6. Ce monitoring est-il une béquille temporaire ou une dette permanente ?¶
Si on rajoute du monitoring trimestre après trimestre sans jamais en retirer, c'est qu'on compense une fragilité structurelle. À documenter avec un sunset criteria.
7. Cette décision résout le fond (cognition, jugement) ou la surface (mesure, règle) ?¶
Fond = améliorer la qualité de l'analyse / du jugement. Surface = mieux mesurer ce qu'on fait déjà mal. Les deux sont utiles, mais à ne pas confondre.
Comment utiliser cette grille¶
En solo (avant d'ouvrir une PR)¶
Te poser explicitement ces 7 questions. Si une réponse est gênante → en parler avant de coder.
En synchro (atelier décision)¶
Lire la grille à haute voix avant de trancher. Forcer la justification sur chaque question, même rapide.
En review (PR ou design doc)¶
Demander au reviewer de vérifier que la grille a été passée. Idéalement, le doc de design la mentionne explicitement.
Cas réels d'application¶
S17 (27/04) — estimate_value V4¶
Question 1 (bat-elle Manus ?) → on ne sait pas, pas mesuré. Question 5 (boucle d'apprentissage ?) → non, on rajoute des règles. Décision : pas d'itération V5 avant mesure quanti V3 vs V4. Anti-LIDAR explicite.
S19 mid-week (07/05) — Validation systématique des AM¶
Question 5 (boucle d'apprentissage ?) → non, on demande aux AM de valider à la main → travail répétitif sans signal. Question 6 (béquille temporaire ?) → oui mais sans sunset criteria. Décision : passer à validation auto sur convergence + HITL sur conflit. Voir ADR-001.
S19 mid-week (07/05) — Doc métier in-app vs Notion¶
Question 5 (boucle d'apprentissage ?) → la doc in-app est consultée au moment où la question se pose (capture passive de l'utilité). La doc Notion est lue 1× et oubliée. Décision : doc co-localisée in-app. Voir ADR-006.
S18 (05/05) — Refonte fiche consolidée¶
Question 4 (source indépendante ?) → l'agent lit 4 sources structurellement différentes (déclaratif, OCR, AM, messagerie). ✅ Question 1 (bat-il l'existant ?) → permet aux tier 2/3 de consommer la matière AM, prouvé sur cas concret (surface Latimon). ✅ Décision : merge.
Sources¶
- Source migrée :
bricks-os/wiki/doctrine/7-questions-arbitrage.md - Catalogue des sources legacy