Ursprünglich auf Französisch verfasst. Von KI übersetzt — der Sinn wurde bewahrt, nicht der Stil.
Blickwinkel
Der Verbrauch eines mit Werkzeugen ausgestatteten Agenten wird nicht in Euro bezahlt, sondern in verlorenen Starts: In einem gleitenden Fünf-Stunden-Fenster verhindert ein Skill mit 478 000 Einheiten den vierten Start des Tages, und genau dieser Start ist es, der kostet. Ein Token-Budget ist also eine Entwurfsbeschränkung, über die vor der Ausführung abgewogen wird — bei dem, was der Agent lädt, was er neu erzeugt, was er selbst schreibt, und bei der Modellstufe, die das erledigt —, und keine Ausgabenposition, die man im Nachhinein überwacht.
Zusammenfassung
Die Lecks haben, einzeln betrachtet, eine gemeinsame Form: Fast keines betrifft das, was man das Modell denken lässt. Sie betreffen, was man es erneut lesen lässt — eine ganze Datenbank für drei Profile, einen vollständigen Verlauf für eine Neuigkeit, eine Anweisungsdatei, die sich verdoppelt hat —, was man es schreiben lässt, obwohl ein Skript dasselbe Ergebnis liefern würde, und die Modellstufe, die von einem Ende des Workflows zum anderen auf dem Standardwert bleibt. Was kostet, ist selten die verlangte Intelligenz; es ist die Handlangerarbeit.
Daraus folgt der Rest. Ist der Verbrauch Handlangerarbeit, lässt er sich per Konstruktion abwägen, und er ordnet sich nach Anteilen an einer Gesamtsumme statt nach Rohvolumen. Weil die angestrebte Entscheidung eine Rangfolge ist und keine Bezifferung, genügt eine Schätzung auf etwa fünfzehn Prozent genau — und dieselbe Näherung verbietet es, im Nachhinein zu beweisen, dass eine Optimierung gehalten hat, was sie versprach. Schließlich verschiebt sich das Limit von allein: Die Datenbank wächst, der Prompt wird dicker, und ein einmal auditierter Skill ist ein paar Wochen später wieder unbekannt.
Spannungen / Widersprüche
Der inkrementelle Modus wird als Mittel gegen die Kopplung an den Bestand dargestellt, und er erzeugt seine eigenen Schulden: Jeder Durchlauf erbt die Ungenauigkeiten des vorigen, was in regelmäßigen Abständen eine vollständige Neuerzeugung nötig macht. Die beiden Anforderungen lassen sich nicht versöhnen, sie lösen einander ab.
Eine weitere Spannung, die das Verfahren gegen sich selbst richtet: Es rechtfertigt sich durch bezifferte Gewinne, und seine Genauigkeit erlaubt nicht zu überprüfen, ob diese Gewinne erreicht wurden. Was es misst, dient dem Entscheiden, nicht der Rechenschaft.
Fragen
- Welche Erfassung während der Ausführung würde den Verbrauch eines Skills auf die nützliche Arbeit beziehen, die er tatsächlich geleistet hat?
- Wie verteilt sich ein von mehreren Personen geteiltes Limit, ohne dass sich jede im Voraus selbst zensiert?