La mesure, en détail
Cette page accompagne le billet « Ce qu’on ne veut pas coder, on le paie en tokens ». Elle décrit le protocole, donne les chiffres bruts, et met le code en téléchargement — pour qui veut refaire le calcul plutôt que me croire sur parole.
Protocole
- Tâche : compter les fonctions d’un module qui renvoient un certain type. Réponse exacte établie à part, recoupée à la main et par deux autres voies : dix-huit (dont quatre dans des types-union qu’un simple mot-clé rate — il n’en voit que quatorze).
- Modèle : Claude Haiku, volontairement un petit modèle, là où l’effet est le plus visible.
- Corpus : un module figé à une version publique. L’outil dédié est ast_search (axm-forge) ; le shell générique, grep et consorts.
- Quatre régimes, huit exécutions chacun, soit trente-deux exécutions. Coût converti au tarif public Haiku (1 / 5 / 0,10 $ par million de tokens entrée / sortie / cache).
Résultats (moyenne sur huit exécutions)
| Régime | Coût/exéc. | Appels | Exactitude | |
|---|---|---|---|---|
| A — lit tout | 0,081 $ | 17,9 | 18/18 sur 8/8 | juste, mais cher |
| C — shell expert | 0,068 $ | 15,6 | 13,1/18 (min 5) | s’effondre 3 fois sur 8 |
| B — outil + libre | 0,059 $ | 10,8 | 3/8, a dit 117 une fois | dérive de périmètre |
| B' — outil borné | 0,011 $ | 1,0 | 18/18 sur 8/8 | exact, déterministe |
Le code et les chiffres
Tout est ouvert et inspectable. Les chiffres bruts (metrics.json) se lisent sans rien installer ; les deux scripts documentent le protocole exact :
run.py— bras A et Brun_bc.py— bras B' et Cmetrics.json— les 32 exécutions brutesground_truth.json— les 18 fonctions (vérité-terrain AST)RESULTS.md— la synthèse
Une précision honnête : les scripts s’appuient sur axm-harness, mon banc d’essai qui lance un agent et compte ses tokens. Ils ne tournent donc pas « clé en main » hors de mon écosystème (il faut axm-harness et des accès au modèle). Ils sont là pour montrer exactement ce que j’ai fait, pas comme un kit prêt à exécuter. Le fichier qui compte vraiment pour vérifier, lui, est lisible par tous : metrics.json, les trente-deux exécutions brutes.
Une mesure, un seul petit modèle, une seule tâche, huit exécutions par régime : c’est une illustration, pas une preuve. Un modèle plus puissant déraillerait sans doute moins.