Thèse

Le coût d'un agent se conçoit comme un plafond de travail, pas comme une facture

Angle

La consommation d'un agent outillé ne se paie pas en euros mais en lancements perdus : sur une fenêtre glissante de cinq heures, un skill à 478 000 unités interdit le quatrième départ de la journée, et c'est ce départ qui coûte. Un budget de tokens est donc une contrainte de conception, arbitrée avant l'exécution — dans ce que l'agent charge, ce qu'il régénère, ce qu'il écrit lui-même et le niveau de modèle qui le fait — et non une ligne de dépense surveillée après coup.

Synthèse

Les fuites, prises une à une, ont une forme commune : presque aucune ne porte sur ce qu'on demande au modèle de penser. Elles portent sur ce qu'on lui fait relire — une base entière pour trois fiches, un historique complet pour une nouveauté, un fichier d'instructions qui a doublé — sur ce qu'on lui fait écrire alors qu'un script produirait le même résultat, et sur le niveau de modèle laissé par défaut d'un bout à l'autre du workflow. L'intelligence demandée est rarement la dépense ; la manutention l'est.

De là suit le reste. Si la dépense est de la manutention, elle est arbitrable par construction, et elle se hiérarchise en parts d'un total plutôt qu'en volumes bruts. Parce que la décision visée est un classement et non un chiffrage, une estimation à quinze pour cent près suffit — et la même approximation interdit de prouver après coup qu'une optimisation a tenu ses promesses. Enfin, le plafond se déplace tout seul : la base grossit, le prompt s'épaissit, et un skill audité une fois redevient inconnu quelques semaines plus tard.

Tensions / contradictions

Le mode incrémental est présenté comme le remède au couplage au stock, et il produit sa propre dette : chaque passe hérite des approximations de la précédente, ce qui rappelle périodiquement une régénération complète. Les deux exigences ne se concilient pas, elles s'alternent.

Autre tension, du même dispositif contre lui-même : il se justifie par des gains chiffrés, et sa précision ne permet pas de vérifier que ces gains ont été obtenus. Ce qu'il mesure sert à décider, pas à rendre des comptes.

Questions

  • Quel relevé, pris pendant l'exécution, rapporterait la dépense d'un skill au travail utile qu'il a réellement produit ?
  • Comment un plafond partagé entre plusieurs personnes se répartit-il sans que chacune s'autocensure à l'avance ?