Idea

Nel costo di un agente, ciò che il modello scrive pesa più volte ciò che legge

Info

Scritto originalmente in francese. Tradotto dall'IA — il significato è stato preservato, non la prosa.

Idea principale

Due flussi attraversano uno skill, e non hanno la stessa tariffa. Ciò che si dà da leggere al modello — file, database, istruzioni — conta per uno. Ciò che produce — analisi redatte, schede, riepiloghi — costa circa cinque volte tanto.

Uno skill che legge 100 000 token e ne genera 20 000 non spende quindi 120 000 unità ma 200 000: metà del suo consumo dipende dai 20 000 che ha scritto. L'audit di competitor_analyze mostra lo stesso ribaltamento su scala reale — 206 000 token letti contro 38 000 generati, eppure la generazione pesa quasi la metà delle 478 000 unità totali.

Volume grezzo di token e costo non mettono quindi le fasi nello stesso ordine.

Perché è importante

Cambia l'ordine dei sospetti quando si cerca dove se ne va una quota: si guarda prima ciò che l'agente scrive, poi ciò che gli si dà da leggere. Una fase di generazione breve può costare più di una lettura massiccia.

Rende anche confrontabili, in un'unica unità, operazioni di natura diversa — aprire file, scrivere un report, chiamare uno script.

Sfumature e limiti

Il rapporto di cinque è una media tariffaria, esatta per alcuni modelli in un dato momento. I listini cambiano, e un contratto particolare può prevederne un altro.

E la ponderazione non dice nulla della latenza: la fase più cara non è per forza quella che fa aspettare.

Domande aperte

  • Come ponderare un input di cui una parte è in cache e viene fatturata meno del resto?