Ursprünglich auf Französisch verfasst. Von KI übersetzt — der Sinn wurde bewahrt, nicht der Stil.
Hauptgedanke
Eine Maschine Bücher und Normen lesen und daraus Notizen erzeugen zu lassen, funktioniert schon beim ersten Versuch. Das ist der leichte Teil, und mit ihm rechnet man.
Was Mühe kostet, ist die Einstellung. Eine erste, großzügige Version erkennt zu breit: viele Notizen, Rauschen, unzureichende Qualität. Die nächste Version verschärft die Filter, die Qualität wird ausgezeichnet – und relevante Notizen, die die großzügige Version durchaus erfasst hatte, verschwinden. Keine Einstellung nimmt alles mit, was zählt, ohne auch anderes mitzunehmen; einstellen heißt wählen, nach welcher Seite sich das System irren wird.
Diese Einstellung lässt sich nicht in zwei Zeilen Prompt fassen. Sie nimmt die Form von mehreren Dutzend Zeilen Anweisungen an: genaue Definition jedes Notiztyps, Gültigkeitskriterien, Erkennungsregeln für regulatorische Referenzen, abschließende Terminologierunde.
Warum das wichtig ist
Es kehrt die Verteilung des Aufwands um, die man zu Beginn einplant. Man budgetiert die Extraktion und das Nachlesen der Notizen; in der Praxis steht die Extraktion von Anfang an, und das Budget gehört in die Regeln.
Und es zeigt, wo der eigentliche Wert liegt. Die Notizen lassen sich neu erzeugen; das Regelwerk, das Wochen gebraucht hat, um sich zu stabilisieren, nicht – dieses Regelwerk muss man versionieren, kommentieren und verteidigen.
Nuancen und Grenzen
Die richtige Schwelle hängt davon ab, was man mit der Basis vorhat. Material, das täglich wiederholt werden soll, verträgt weniger Rauschen als Material, das man nur bei Bedarf abfragt und bei dem eine schwache Notiz bloß eine Zeile zu viel kostet.
Und eine Schwelle, die an einem Korpus von Normen kalibriert wurde, lässt sich nicht unverändert auf ein Korpus von Meinungsartikeln übertragen: Was die Regeln lernen, ist ebenso sehr das Korpus wie das Kriterium.
Offene Fragen
- Ab wann bringt eine Verschärfung weniger an Qualität, als sie an Abdeckung kostet?