Operationalisierung der Erkenntniskriterien mit Bewertungsskalen.
Damit die drei Antwortzustände der Versuchsanordnung systematisch miteinander verglichen werden können, müssen die zuvor beschriebenen Erkenntniskriterien in beobachtbare Merkmale übersetzt werden.
Die Bewertung darf dabei nicht davon abhängen, welche Antwort sprachlich besonders überzeugend, umfangreich oder mit meinem Vier-Ebenen-Modell vereinbar erscheint.
Bewertet werden soll ausschließlich, in welchem Umfang eine Antwort ihre Voraussetzungen, Grenzen, Abhängigkeiten und Korrekturmöglichkeiten sichtbar macht.
Für alle Kriterien kann zunächst eine gemeinsame fünfstufige Skala von 0 bis 4 Punkten verwendet werden. Dabei bedeutet 0, dass das jeweilige Merkmal vollständig fehlt; 1 bezeichnet ein nur angedeutetes oder unsystematisches Auftreten; 2 eine erkennbare, aber unvollständige Bearbeitung; 3 eine klare und überwiegend nachvollziehbare Bearbeitung; 4 eine besonders differenzierte, begründete und überprüfbare Bearbeitung. Die gemeinsame Skala erleichtert den Vergleich, während für jedes Kriterium genauer festgelegt werden muss, worauf sich diese Abstufungen beziehen.
Sichtbarkeit der Voraussetzungen
Dieses Kriterium misst, in welchem Umfang eine Antwort ihre eigenen Ausgangsannahmen erkennbar macht. Bewertet wird nicht, ob eine Antwort möglichst viele Voraussetzungen aufzählt, sondern ob die für das Ergebnis entscheidenden Annahmen ausdrücklich benannt und von Beobachtungen oder Ergebnissen unterschieden werden.
0 Punkte werden vergeben, wenn Voraussetzungen vollständig implizit bleiben und die Antwort ihre Aussagen als selbstverständlich behandelt. 1 Punkt bedeutet, dass einzelne Annahmen angedeutet, aber nicht als solche gekennzeichnet werden. 2 Punkte liegen vor, wenn mehrere relevante Voraussetzungen erkennbar sind, jedoch wesentliche Grundannahmen fehlen. 3 Punkte werden vergeben, wenn die zentralen Voraussetzungen ausdrücklich genannt und mit der Schlussfolgerung verbunden werden. 4 Punkte setzen zusätzlich voraus, dass erklärt wird, wie sich das Ergebnis verändern könnte, wenn eine dieser Voraussetzungen nicht gilt.
Der höchste Wert bezeichnet damit nicht die größte Zahl genannter Annahmen, sondern die stärkste Reflexivität gegenüber den eigenen Voraussetzungen.
Erfassung relevanter Bedingungen und Abhängigkeiten
Hier wird untersucht, ob eine Antwort die für das Problem tatsächlich bedeutsamen materiellen, organismischen, sozialen oder institutionellen Bedingungen berücksichtigt.
0 Punkte bedeuten, dass relevante Bedingungen praktisch vollständig fehlen. Bei 1 Punkt wird lediglich eine einzelne oder offensichtlich naheliegende Bedingung berücksichtigt. 2 Punkte bezeichnen eine teilweise Erfassung verschiedener Bedingungen, wobei wesentliche Abhängigkeiten fehlen. 3 Punkte werden vergeben, wenn die wesentlichen Bedingungen und ihre Beziehungen nachvollziehbar dargestellt werden. 4 Punkte liegen vor, wenn darüber hinaus Wechselwirkungen und Abhängigkeiten zwischen unterschiedlichen Bedingungsbereichen sichtbar gemacht werden.
Im Rahmen des Vier-Ebenen-Modells wäre dabei ausdrücklich nicht zu bewerten, ob E1, E2 und E3 vollständig „abgearbeitet“ werden. Entscheidend ist vielmehr, ob durch diese Unterscheidungen für die konkrete Forschungsfrage relevante Abhängigkeiten sichtbar werden.
Erkennung von Auslassungen und blinden Stellen
Dieses Kriterium bewertet, in welchem Umfang eine Antwort ihre eigenen möglichen Auslassungen identifizieren kann.
0 Punkte bedeuten, dass keinerlei mögliche Auslassung thematisiert wird. 1 Punkt bezeichnet einen allgemeinen Hinweis darauf, dass weitere Aspekte existieren könnten. Bei 2 Punkten werden einzelne konkrete Auslassungen genannt, ohne ihre Bedeutung genauer zu begründen. 3 Punkte liegen vor, wenn relevante fehlende Akteure, Folgen, Bedingungen oder Perspektiven identifiziert und ihre Bedeutung erklärt werden. 4 Punkte setzen voraus, dass zusätzlich gezeigt wird, wie diese Auslassungen das Ergebnis oder die Schlussfolgerung möglicherweise verändern.
Damit wird nicht Vollständigkeit gemessen, die bei komplexen Fragen kaum erreichbar ist. Gemessen wird die Fähigkeit zur Wahrnehmung eigener Begrenztheit.
Trennung unterschiedlicher Aussagearten
Dieses Kriterium erfasst, ob Tatsachenbehauptungen, Modellannahmen, Interpretationen, Werturteile und Prognosen voneinander unterschieden werden.
0 Punkte bedeuten, dass diese Aussagearten miteinander vermischt werden. Bei 1 Punkt sind einzelne Unterschiede erkennbar, werden aber nicht konsequent markiert. 2 Punkte bezeichnen eine überwiegend erkennbare, jedoch noch uneinheitliche Trennung. 3 Punkte werden vergeben, wenn zentrale empirische Aussagen, Annahmen und Bewertungen klar auseinandergehalten werden. 4 Punkte setzen voraus, dass zusätzlich erklärt wird, welche unterschiedlichen Prüfverfahren für die jeweiligen Aussagearten erforderlich wären.
Gerade dieses Kriterium ist für mein Modell wichtig, weil E3 sowohl wissenschaftliche Modelle als auch gesellschaftliche Wertsetzungen umfassen kann, ohne beide deshalb gleichzusetzen. Wissenschaftliche Aussagen unterscheiden sich von bloßen Setzungen gerade durch ihre spezifischen Prüfverfahren.
Prüfbarkeit der Behauptungen
Hier wird bewertet, ob erkennbar wird, woran eine Aussage überprüft, bestätigt, eingeschränkt oder widerlegt werden könnte.
0 Punkte bedeuten, dass zentrale Aussagen weder begründet noch überprüfbar formuliert werden. 1 Punkt wird vergeben, wenn allgemeine Begründungen genannt werden, aber unklar bleibt, welche Beobachtung gegen die Aussage sprechen könnte. Bei 2 Punkten sind einzelne Prüfbedingungen erkennbar. 3 Punkte liegen vor, wenn für die wesentlichen Aussagen konkrete Belege, Gegenbeispiele oder Widerlegungsbedingungen angegeben werden. 4 Punkte setzen zusätzlich voraus, dass die Antwort ausdrücklich benennt, welche neuen Informationen zu einer Änderung ihrer eigenen Schlussfolgerung führen würden.
Ein hoher Wert bezeichnet deshalb eine hohe Korrigierbarkeit der Aussage, nicht ihre vermeintliche Unangreifbarkeit.
Umgang mit Unsicherheit und Nichtwissen
Dieses Kriterium misst, wie differenziert eine Antwort ihre Wissensgrenzen behandelt.
0 Punkte bedeuten, dass Unsicherheit vollständig verdeckt oder unbegründete Gewissheit erzeugt wird. Bei 1 Punkt erscheinen lediglich allgemeine Vorsichtsformulierungen. 2 Punkte werden vergeben, wenn konkrete Unsicherheiten genannt, aber nicht genauer eingeordnet werden. 3 Punkte liegen vor, wenn zwischen gesichertem Wissen, plausibler Annahme und offenem Nichtwissen unterschieden wird. 4 Punkte setzen voraus, dass zusätzlich erläutert wird, welche weiteren Daten oder Prüfungen notwendig wären, um die Unsicherheit zu verringern.
Dabei ist eine Antwort mit höher ausgewiesener Unsicherheit nicht automatisch schwächer. Sie kann erkenntnistheoretisch gerade stärker sein, wenn sie ihre Grenzen genauer kennt.
Unterscheidung von Absicht, Ziel und tatsächlicher Wirkung
Dieses Kriterium ist besonders für soziale, politische, wirtschaftliche oder technische Fragen relevant. Es untersucht, ob eine Antwort zwischen beabsichtigten Zielen und tatsächlich möglichen Konsequenzen unterscheidet.
0 Punkte bedeuten, dass Ziel und Wirkung miteinander gleichgesetzt werden. Bei 1 Punkt werden mögliche Nebenwirkungen nur beiläufig erwähnt. 2 Punkte bezeichnen eine erkennbare, aber begrenzte Differenzierung zwischen Absicht und Wirkung. 3 Punkte werden vergeben, wenn direkte und indirekte Folgen systematisch berücksichtigt werden. 4 Punkte liegen vor, wenn zusätzlich Rückwirkungen auf die Voraussetzungen des Handelns selbst untersucht werden.
Hier wird also insbesondere sichtbar, ob die Antwort nur fragt, ob ein System sein gesetztes Ziel erreicht, oder auch, was sein Funktionieren für den größeren Zusammenhang bewirkt.
Systemgrenze und Zeithorizont
Dieses Kriterium untersucht, ob eine Antwort deutlich macht, innerhalb welcher räumlichen, sozialen und zeitlichen Grenzen ihre Aussagen gelten.
0 Punkte bedeuten, dass weder Systemgrenze noch Zeitraum erkennbar sind. 1 Punkt bezeichnet eine implizite oder sehr enge Begrenzung. 2 Punkte liegen vor, wenn Systemgrenze oder Zeithorizont teilweise benannt werden. 3 Punkte werden vergeben, wenn beide ausdrücklich bestimmt und für die Interpretation des Ergebnisses berücksichtigt werden. 4 Punkte setzen voraus, dass zusätzlich alternative Systemgrenzen oder Zeiträume geprüft werden und gezeigt wird, ob sich dadurch die Bewertung verändert.
Gerade bei spieltheoretischen oder gesellschaftlichen Fragestellungen könnte dadurch sichtbar werden, ob ein lokaler oder kurzfristiger Gewinn mit einem längerfristigen oder umfassenderen Verlust verbunden ist.
Begründbarkeit einer Meinungsänderung
Dieses Kriterium betrifft nicht die Qualität der drei Texte allein, sondern die Reaktion der Versuchsperson nach deren Vergleich.
0 Punkte bedeuten, dass eine Position übernommen oder verworfen wird, ohne Gründe nennen zu können. 1 Punkt bezeichnet eine Änderung aufgrund allgemeiner Eindrücke wie „Die KI klingt überzeugender“. Bei 2 Punkten werden einzelne inhaltliche Gründe genannt. 3 Punkte liegen vor, wenn die Person konkrete Argumente, neue Bedingungen oder erkannte Fehler benennen kann, die zur Veränderung geführt haben. 4 Punkte setzen voraus, dass sie zusätzlich unterscheiden kann, welche Teile ihrer ursprünglichen Position bestehen bleiben und welche aus welchen Gründen verändert wurden.
Auch das Beibehalten der ursprünglichen Position kann 4 Punkte erhalten, sofern dies nach der Gegenprüfung differenziert und nachvollziehbar begründet wird. Erkenntnisgewinn ist also nicht mit Meinungsänderung gleichzusetzen.
Eigenständigkeit der Prüfung
Dieses Kriterium soll verhindern, dass bloße Übernahme einer KI-Antwort als Erkenntnisgewinn interpretiert wird.
0 Punkte bedeuten eine weitgehend unkritische Übernahme. Bei 1 Punkt äußert die Person allgemeine Zustimmung oder Ablehnung, ohne die Gründe genauer prüfen zu können. 2 Punkte bezeichnen einen ersten eigenständigen Vergleich. 3 Punkte liegen vor, wenn die Person Stärken und Schwächen aller drei Antworten benennen und daraus eine eigene begründete Position entwickeln kann. 4 Punkte setzen voraus, dass sie zusätzlich neue Fragen oder Prüfkriterien formuliert, die in keiner der drei Ausgangsantworten enthalten waren.
Dieser höchste Wert wäre für die Forschungskunst besonders bedeutsam. Der Teilnehmer wird dann nicht lediglich Empfänger eines Prüfrahmens, sondern entwickelt selbst weitere E4-Tätigkeit.
Zusätzlicher Erkenntniswert des Vier-Ebenen-Rahmens
Dieses Kriterium vergleicht speziell die reguläre KI-Antwort mit der KI-Antwort des dritten Schrittes.
0 Punkte bedeuten, dass die dritte Antwort keinerlei relevanten zusätzlichen Inhalt enthält oder sogar weniger brauchbar ist. 1 Punkt bezeichnet hauptsächlich terminologische Veränderungen oder größere Textmenge ohne erkennbare neue Prüfung. 2 Punkte werden vergeben, wenn einzelne relevante zusätzliche Aspekte erscheinen. 3 Punkte liegen vor, wenn der Prüfrahmen mehrere relevante Voraussetzungen, Abhängigkeiten oder Auslassungen systematischer sichtbar macht. 4 Punkte setzen voraus, dass diese zusätzlichen Erkenntnisse nachvollziehbar zu einer Veränderung der Problembeschreibung, Modellgrenze, Schlussfolgerung oder weiteren Forschungsfrage führen.
Dieses Kriterium ist entscheidend, weil damit verhindert werden soll, dass die Verwendung meiner eigenen Begriffe bereits als Erfolg gewertet wird.
Korrekturfähigkeit des Vier-Ebenen-Modells selbst
Das letzte Kriterium richtet die Prüfung ausdrücklich auf meinen eigenen Forschungsrahmen.
0 Punkte bedeuten, dass der Rahmen dogmatisch angewandt wird und mögliche Schwächen nicht thematisiert werden. Bei 1 Punkt werden lediglich allgemeine Einschränkungen erwähnt. 2 Punkte liegen vor, wenn konkrete Probleme oder unklare Zuordnungen erkannt werden. 3 Punkte werden vergeben, wenn deutlich benannt wird, wo das Modell Kategorien vermischt, unnötige Trennungen erzeugt oder relevante Aspekte nicht erfasst. 4 Punkte setzen voraus, dass aus dieser Kritik ein begründeter Änderungsvorschlag für den Prüfrahmen selbst entsteht.
Damit würde ein hoher Wert gerade nicht bedeuten, dass das Modell besonders gut bestätigt wird. Er könnte ebenso durch eine besonders präzise Widerlegung oder Korrektur entstehen.
Vergleich der drei Versuchsschritte
Nach der Einzelbewertung können die drei Antwortzustände entlang derselben Kriterien miteinander verglichen werden. Für jedes Kriterium entstehen dadurch drei Werte zwischen 0 und 4: ein Wert für die menschliche Ausgangsantwort, ein Wert für die reguläre KI-Antwort und ein Wert für die KI-Antwort unter Anwendung des zusätzlichen Prüfrahmens.
Besonders relevant ist dabei die Differenz zwischen den Bedingungen. Wenn beispielsweise die menschliche Antwort beim Umgang mit Unsicherheit 1 Punkt, die reguläre KI-Antwort 2 Punkte und die dritte Antwort 3 Punkte erhält, zeigt dies zunächst eine Verbesserung innerhalb dieses spezifischen Kriteriums. Daraus folgt jedoch noch nicht, dass der gesamte Erkenntniswert entsprechend gestiegen ist.
Die Kriterien sollten deshalb zunächst getrennt ausgewertet werden. Ein einziger Gesamtscore könnte wichtige Unterschiede verdecken. Eine Antwort könnte etwa besonders stark in der Erkennung von Voraussetzungen sein, gleichzeitig aber schwach hinsichtlich Prüfbarkeit oder Eigenständigkeit.
Erst ergänzend kann aus den Einzelwerten ein durchschnittlicher Orientierungswert gebildet werden. Dieser darf jedoch nicht als „Wahrheitswert“ der Antwort bezeichnet werden. Er ist lediglich ein Maß für die im Versuch operationalisierte Prüf- und Reflexionsqualität.
Vergleichbarkeit und unabhängige Bewertung
Um zu verhindern, dass die Bewertung selbst durch Erwartungen an mein Modell verzerrt wird, sollten die Antworten nach Möglichkeit von mindestens zwei voneinander unabhängigen Personen anhand derselben Kriterien beurteilt werden. Idealerweise wissen diese Bewertenden nicht, welche Antwort aus welchem der drei Versuchsschritte stammt.
Anschließend kann verglichen werden, wie stark ihre Bewertungen übereinstimmen. Größere Abweichungen wären selbst ein wichtiges Ergebnis, weil sie darauf hinweisen könnten, dass ein Kriterium zu ungenau definiert ist.
Damit würde auch die Messmethode selbst in den E4-Prozess einbezogen: Nicht nur die Antworten und das Vier-Ebenen-Modell werden geprüft, sondern ebenso die Kriterien, mit denen der behauptete Erkenntnisgewinn gemessen wird.
Operationale Definition des Erkenntnisgewinns
Für diese Versuchsanordnung kann Erkenntnisgewinn damit operational definiert werden als eine messbare Zunahme der Fähigkeit, relevante Voraussetzungen, Abhängigkeiten, Aussagearten, Auslassungen, Unsicherheiten, Systemgrenzen und Konsequenzen zu erkennen, Behauptungen prüfbar zu machen und die eigene Position begründet zu bestätigen, einzuschränken, zu verändern oder zu verwerfen.
Ein Erkenntnisgewinn wäre besonders dann anzunehmen, wenn die dritte Versuchsbedingung gegenüber der menschlichen Ausgangsantwort und der regulären KI-Antwort in mehreren dieser Kriterien höhere Werte erreicht und diese Unterschiede von unabhängigen Bewertenden nachvollzogen werden können.
Ebenso wichtig wäre jedoch ein gegenteiliges Ergebnis. Wenn die dritte Antwort zwar länger oder komplizierter wird, aber bei Prüfbarkeit, Unsicherheit oder Korrekturfähigkeit keine Verbesserung zeigt, wäre dies ein Hinweis darauf, dass der zusätzliche Prüfrahmen keinen nachweisbaren Erkenntnisgewinn erzeugt.
Damit wird die Versuchsanordnung selbst dem Prinzip unterworfen, das sie untersuchen soll: Nicht die Behauptung eines Erkenntnisgewinns entscheidet, sondern dessen überprüfbare Bewährung gegenüber einem Gegenüber.
Die drei Versuchsbedingungen genauer definieren
