Philosophie produit — 5 piliers méta¶
Statut : doctrine acquise (formalisée S15-S19, jan-mai 2026). Voir aussi : Pari fiabilité, 7 questions d'arbitrage.
En une phrase¶
Construire le système le plus simple possible, mesurer, et n'ajouter de complexité que lorsqu'on a un signal chiffré qui le justifie.
Les 5 piliers¶
1. Boucle d'apprentissage > spécification amont¶
Chaque amélioration doit alimenter un feedback loop mesurable, pas un catalogue de règles / agents / capteurs.
Anti-pattern : ajouter une règle à chaque comité parce que Cédric a flagué un cas. Au bout d'un an, on a 200 règles imbriquées qui encodent son jugement de manière statique.
Bon pattern : capter le cas comme un exemple → ajouter au golden dataset → mesurer le delta avant/après amélioration de l'agent.
2. Less is more¶
Commencer petit, prouver la valeur sur un signal chiffré, puis scaler. Refuser l'usine à gaz prématurée.
Règles concrètes : - Pas de dashboard avant 20+ résultats accumulés à visualiser - Pas de framework d'eval avant d'avoir 5 dossiers annotés - Pas de monitoring avancé avant d'avoir un cas d'usage clair - Une boucle minimale qui prouve la valeur > un système complet qui dort
3. Activer > construire¶
Avant de lancer un chantier de dev, auditer l'existant : schéma DB, infra, libs, sources de données.
Beaucoup de briques sont modélisées sans être alimentées. On cherche le ticket d'activation avant le ticket de construction.
Cas d'application : le schéma eval_campaigns / eval_results existait depuis longtemps en DB, on l'a découvert pendant la phase de cadrage golden dataset. Conséquence : pas de nouvelle table à créer, juste à activer.
4. Capture passive > annotation forcée¶
Instrumenter le workflow existant (corrections AM, modifications Cédric, ouverture Manus par les analystes, clics de validation, edit history) plutôt que de demander aux équipes d'annoter dans un outil dédié.
Pourquoi : - Aucun coût supplémentaire pour les équipes - Le signal est honnête (action réelle vs déclaration sur formulaire) - Le volume est immédiatement scalable (chaque dossier traité = donnée)
Cas d'application : chosen_source enregistre le clic AM → capture passive de la préférence par typologie. À condition de stocker en array, pas singleton (voir ADR-005).
5. Baseline Manus¶
Benchmarker régulièrement le pipeline multi-agents vs Manus one-shot sur le golden dataset.
Si Manus bat le pipeline → c'est l'architecture le problème, pas l'entraînement des agents.
Implication forte : on garde Manus en baseline tant qu'on n'a pas démontré qu'on le bat. Tentation à résister : couper Manus pour économiser → on perd la baseline qui nous dit où on en est.
Métriques chiffrées au 05/05 : Manus = ~10-12 €/dossier (50-60 min) en full-agentique, pipeline interne = ~6-7 min/dossier (~10-12× moins cher) mais qualité moindre. Cf. metrics.
Conséquences transverses¶
Sur les freelances¶
Voir posture freelances. En résumé : un freelance = une approche structurellement indépendante des autres, pas un clone LLM. Phase test fit (livraison V0, distance) → phase post-validation (mise en boucle, channel Slack).
Sur les itérations agent¶
Pas d'itération sur un agent sans mesure quanti vs version précédente. Posture explicite acquise S17 (27/04) sur estimate_value V4 : « on ne rajoute rien sans avoir mesuré V3 vs V4 ».
Sur l'archi¶
Voir ADR-001 cascade fiabilité et ADR-002 consolidateur par agent. La fiabilité passe par convergence multi-workflow, pas par perfection d'un agent unique.
Sur le rapport humain / IA¶
Voir ADR-004 friction délibérée. On préfère un système qui dit non quand il n'a pas la matière, plutôt qu'un système qui hallucine pour ne pas faillir.
Anti-patterns à reconnaître¶
Voir le mémo assets/Memo - Parallele LIDAR et architecture Bricks OS.md. Les 4 risques LIDAR :
- Agents empilés comme des capteurs — chaque nouvel agent ajoute une modalité à fusionner. Préférer le découpage procédural/déterministe (calcul ratio, formule frais notaire) au découpage LLM déguisé (un Nième prompt qui relit les mêmes docs).
- Règles niveau B (jugement hand-coded) — règles imbriquées qui prétendent encoder le jugement Cédric → reproduisent le système expert de 2012. Réponse par défaut à toute demande de règle : « et si on ajoutait 20 exemples au golden dataset à la place ? »
- Consensus corrélé — N LLMs lisant les mêmes docs via la même pipeline = consensus simulé, pas fiabilisation. Le gain réel vient de sources structurellement indépendantes.
- Monitoring qui grossit — un monitoring qui grandit trimestre après trimestre compense une fragilité structurelle. Un système simple a besoin de moins de monitoring, pas plus.
Sources¶
- Source migrée :
bricks-os/wiki/doctrine/philosophie-produit.md - Catalogue des sources legacy