Ursprünglich auf Französisch verfasst. Von KI übersetzt — der Sinn wurde bewahrt, nicht der Stil.
Hauptgedanke
Ein deterministisches Feature testet man durch den Vergleich mit einem erwarteten Ergebnis: Das Resultat ist konform oder nicht. Eine von einem Modell erzeugte Antwort bietet diesen Ansatzpunkt nicht. Zwei korrekte Formulierungen haben für den Nutzer nicht denselben Wert, eine falsche Antwort kann vollkommen plausibel sein, und das Erleben des Scheiterns – was das Produkt tut, wenn es etwas nicht weiß – wird ebenso Teil des Produkts wie der Erfolg.
Einen solchen Output zu bewerten betrifft daher Fragen, die keine Suite von Konformitätstests abdeckt: die Robustheit gegenüber vertrackten Fällen, die Stimmigkeit mit der Produktabsicht, das Vertrauen, das der Nutzer vernünftigerweise schenken kann, und die Fehlermarge, die er in seinem Fachgebiet hinzunehmen bereit ist.
Deshalb höhlt man diese Bewertung aus, wenn man sie auf klassische Qualitätssicherung zurückführt: Die Frage lautet nicht nur „Ist der Output richtig?“, sondern „Ist dieser Output hier, für diesen Gebrauch, akzeptabel?“ – eine Produktfrage, keine Prüffrage.
Warum das wichtig ist
Das sagt, wem die Bewertung zufällt: Sie lässt sich nicht vollständig an eine Kontrollfunktion am Ende der Kette delegieren, weil sie verlangt, über die Absicht und über das zu entscheiden, was der Nutzer toleriert.
Und es macht testbar, was viele Teams gar nicht erst zu messen versuchen: Vertrauen und Akzeptanz erarbeitet man mit fachlichen Fällen, Fehlerszenarien und schriftlich festgehaltenen Kriterien, nicht mit einem allgemeinen Qualitätseindruck.
Nuancen und Grenzen
Akzeptanz entbindet nicht von Konformität: Bei überprüfbaren Regeln – einer Berechnung, einer Zugriffsberechtigung, einem Format – bleibt die Anforderung binär, und das probabilistische Argument darf nicht als Ausrede dienen.
Und die Akzeptanzschwelle legt nicht das produzierende Team fest: Man ermittelt sie bei denen, die das Produkt nutzen, und sie schwankt je nach Fachgebiet, Tragweite und Umkehrbarkeit dessen, was der Output auslöst.
Offene Fragen
- Wie hält man eine Akzeptanzschwelle schriftlich fest, wenn es um das Vertrauen eines Nutzers geht und nicht um eine beobachtbare Fehlerquote?