Ursprünglich auf Französisch verfasst. Von KI übersetzt — der Sinn wurde bewahrt, nicht der Stil.
Hauptgedanke
Ein Forschungsartikel, eine technische Dokumentation oder ein Analystenbericht kann fünf voneinander unabhängige Mechanismen enthalten. Zwei sehr unterschiedliche Dokumente können genau dieselbe Idee stützen. Und ein und dieselbe Quelle kann eine belastbare Aussage, eine spekulative Annahme und eine mehrdeutige Definition vermischen.
Dokumente zu zählen oder zusammenzufassen sagt also nicht, was ein Korpus weiß. Es braucht eine Zwischenschicht, in der die Quellen in Wissenseinheiten überführt werden: atomare Notizen, die jeweils eine Idee stabilisieren, thematische Notizen, die mehrere Ideen verbinden, Glossareinträge, die die Bedeutung eines Begriffs festlegen, wenn eine Mehrdeutigkeit die Deutung verändern würde.
An dieser Schicht, und nicht am Stapel der Dokumente, lassen sich die Belastbarkeit einer Aussage, ihre Abhängigkeit von einer einzigen Quelle oder der Widerspruch zwischen zwei Autoren ablesen.
Warum das wichtig ist
Es macht Dinge messbar, die eine Zusammenfassung verwischt: wie viele unabhängige Quellen eine Idee stützen, welche nur eine hat, wo zwei Quellen sich widersprechen.
Und es erlaubt, eine Recherche von dem aus zu steuern, was verstanden wurde, statt von dem aus, was gelesen wurde.
Nuancen und Grenzen
Die Extraktion hat ihren Preis, und sie bringt ihre eigene Verzerrung mit: Was nicht in eine Notiz zerlegt wurde, verschwindet aus der Diagnose genauso sicher wie das, was nie gelesen wurde.
Und eine Quelle kann mangels verlässlicher Extraktion unbrauchbar bleiben: Sie ist dann im Korpus, aber nicht im Wissen.
Offene Fragen
- Wie findet man heraus, was eine Extraktion in einer Quelle ausgelassen hat, ohne die ganze Quelle neu zu lesen?