Messkriterien des Erkenntnisgewinns
Der Erkenntnisgewinn der Versuchsanordnung lässt sich nicht unmittelbar daran messen, ob eine Antwort länger, differenzierter oder sprachlich überzeugender erscheint.
Entscheidend ist vielmehr, ob durch die Gegenüberstellung der drei Antwortzustände zusätzliche, überprüfbare Unterschiede sichtbar werden. Erkenntnisgewinn bezeichnet hier deshalb keine endgültige Wahrheit, sondern eine verbesserte Fähigkeit zur begründeten Unterscheidung, Prüfung und Korrektur.
Ein erstes Messkriterium ist die Sichtbarkeit von Voraussetzungen. Untersucht wird, ob die jeweilige Antwort ihre eigenen Annahmen ausdrücklich benennt oder ob wesentliche Voraussetzungen unausgesprochen bleiben. Von Erkenntnisgewinn kann gesprochen werden, wenn nach der Gegenüberstellung klarer erkennbar wird, auf welchen Annahmen eine Aussage beruht und unter welchen Bedingungen sie gelten soll.
Ein zweites Kriterium betrifft die Erfassung relevanter Bedingungen und Abhängigkeiten. Hier wird geprüft, ob physikalisch-materielle Bedingungen, organismische Abhängigkeiten, gesellschaftliche Setzungen und institutionelle Rahmenbedingungen angemessen berücksichtigt werden. Erkenntnisgewinn liegt dann vor, wenn zuvor unbeachtete, aber für die Fragestellung relevante Bedingungen sichtbar werden, ohne dass lediglich immer weitere, sachlich unbedeutende Aspekte hinzugefügt werden.
Ein drittes Kriterium ist die Erkennung von Auslassungen und blinden Stellen. Eine Antwort kann in sich schlüssig erscheinen und dennoch relevante Akteure, Folgen, Zeiträume oder Abhängigkeiten nicht berücksichtigen. Gemessen werden kann deshalb, ob durch den Vergleich systematisch solche Auslassungen sichtbar werden und ob nachvollziehbar begründet werden kann, weshalb sie für die Fragestellung relevant sind.
Ein weiteres Kriterium ist die Trennung unterschiedlicher Aussagearten. Tatsachenbehauptungen, Modellannahmen, Werturteile, Rollenbeschreibungen, Prognosen und Interpretationen sollten nicht unbemerkt ineinander übergehen. Erkenntnisgewinn zeigt sich dort, wo nach der Prüfung klarer unterschieden werden kann, was beobachtet, was vorausgesetzt, was bewertet und was lediglich hypothetisch angenommen wurde.
Von besonderer Bedeutung ist die Prüfbarkeit von Behauptungen. Eine Antwort gewinnt nicht dadurch an Erkenntniswert, dass sie viele Behauptungen enthält. Entscheidend ist, ob erkennbar wird, welche Aussagen empirisch, logisch oder durch Gegenbeispiele überprüft werden können und welche Aussagen innerhalb des gegebenen Rahmens nicht entscheidbar sind. Ein höherer Erkenntniswert wäre gegeben, wenn die dritte Antwort stärker sichtbar macht, woran ihre eigenen Aussagen scheitern könnten.
Ein weiteres Messkriterium ist die Behandlung von Unsicherheit und Nichtwissen. Erkenntnisgewinn bedeutet nicht, Unsicherheit durch scheinbar eindeutige Antworten zu beseitigen. Im Gegenteil kann eine Antwort erkenntnisreicher sein, wenn sie die Grenzen des vorhandenen Wissens präziser kennzeichnet. Zu prüfen wäre daher, ob Unsicherheiten, Modellgrenzen und offene Fragen ausdrücklich ausgewiesen werden.
Wesentlich ist außerdem die Unterscheidung von Absicht und Wirkung beziehungsweise Modellziel und tatsächlicher Konsequenz. Gerade bei sozialen oder strategischen Fragestellungen kann eine Handlung innerhalb eines gesetzten Zielsystems erfolgreich erscheinen und gleichzeitig außerhalb dieses Bezugsrahmens andere Folgen erzeugen. Erkenntnisgewinn läge vor, wenn solche Tätigkeits- und Abhängigkeitskonsequenzen deutlicher sichtbar werden.
Ein weiteres Kriterium betrifft die Systemgrenze und den Zeithorizont. Untersucht werden soll, ob eine Antwort deutlich macht, auf welchen Ausschnitt des Problems sie sich bezieht. Ein Ergebnis kann kurzfristig oder lokal sinnvoll erscheinen und langfristig oder in einem größeren Zusammenhang problematisch werden. Erkenntnisgewinn besteht hier in der Fähigkeit, unterschiedliche Bezugsrahmen auseinanderzuhalten und deren Folgen miteinander zu vergleichen.
Für die Mensch-KI-Versuchsanordnung ist außerdem die Begründbarkeit einer Meinungsänderung entscheidend. Es reicht nicht festzustellen, dass eine Versuchsperson nach der KI-Nutzung ihre Meinung verändert. Relevant ist, weshalb die Veränderung erfolgt. Wird eine Position aufgrund eines neuen Arguments, eines sichtbar gewordenen Gegenbelegs oder einer korrigierten Voraussetzung verändert, spricht dies eher für Erkenntnisgewinn. Erfolgt die Veränderung lediglich aufgrund sprachlicher Autorität, Komplexität oder vermeintlicher technischer Überlegenheit der KI, wäre dies gerade kein ausreichendes Erkenntniskriterium.
Damit verbunden ist das Kriterium der Eigenständigkeit der Prüfung. Die Versuchsperson sollte nach der Gegenüberstellung nicht einfach eine der drei Antworten übernehmen, sondern in der Lage sein, Unterschiede zu benennen, Argumente abzuwägen und eine eigene begründete Position zu formulieren. Erkenntnisgewinn zeigt sich deshalb auch darin, ob die Person nach dem Versuch besser erklären kann, weshalb sie einer Aussage zustimmt oder widerspricht.
Für den dritten Versuchsschritt muss zusätzlich geprüft werden, ob der Vier-Ebenen-Rahmen einen spezifischen zusätzlichen Erkenntniswert besitzt. Dazu ist zu untersuchen, ob die dritte Antwort tatsächlich relevante neue Unterscheidungen oder Prüfungen ermöglicht, die in der regulären KI-Antwort nicht enthalten waren. Wenn sie lediglich ausführlicher formuliert ist oder bekannte Aspekte mit neuer Terminologie versieht, wäre kein zusätzlicher Erkenntnisgewinn nachgewiesen.
Ebenso wichtig ist die Korrekturfähigkeit des Prüfrahmens selbst. Ein erkenntnisfördernder Rahmen muss ermöglichen, eigene Schwächen sichtbar zu machen. Deshalb sollte dokumentiert werden, ob das Vier-Ebenen-Modell zu Fehlklassifikationen, unnötigen Trennungen oder systematischen Auslassungen führt. Ein negativer Befund wäre dabei kein Scheitern der gesamten Versuchsanordnung, sondern selbst ein Erkenntnisgewinn über die Grenzen des Modells.
Vergleich der drei Antwortzustände
Für die Auswertung sollten die drei Antworten nicht pauschal als besser oder schlechter bewertet werden. Stattdessen werden sie entlang derselben Kriterien miteinander verglichen. Dabei ist zu untersuchen, ob sich zwischen der menschlichen Ausgangsantwort, der regulären KI-Antwort und der KI-Antwort unter dem zusätzlichen Prüfrahmen Unterschiede hinsichtlich Voraussetzungen, Auslassungen, Prüfbarkeit, Unsicherheit, Systemgrenzen, Konsequenzen und Korrigierbarkeit zeigen.
Der Erkenntnisgewinn besteht somit nicht notwendig darin, dass der dritte Antwortzustand in allen Kriterien überlegen ist. Wissenschaftlich interessanter wäre gerade ein differenziertes Ergebnis. Manche Kriterien könnten sich verbessern, andere unverändert bleiben oder sich sogar verschlechtern.
Operationalisierung des Erkenntnisbegriffs
Für die Versuchsanordnung lässt sich Erkenntnisgewinn deshalb vorläufig so definieren:
Erkenntnisgewinn liegt vor, wenn eine Gegenüberstellung dazu führt, dass relevante Voraussetzungen, Abhängigkeiten, Auslassungen, Unsicherheiten oder Folgen präziser erkannt, voneinander unterschieden und begründet geprüft werden können und dadurch eine Aussage oder eigene Position nachvollziehbarer bestätigt, eingeschränkt, verändert oder verworfen werden kann.
Diese Definition vermeidet es, Erkenntnisgewinn mit bloßer Informationsmenge, sprachlicher Komplexität oder Zustimmung zum Vier-Ebenen-Modell gleichzusetzen.
Der zentrale Messgegenstand ist damit nicht die vermeintlich „beste Antwort“, sondern die Frage, ob die Versuchsanordnung die Wahrheitsfähigkeit als Prüf- und Korrekturfähigkeit tatsächlich erhöht.
Operationalisiere die Kriterien mit Bewertungsskalen
