Definition der drei Versuchsbedingungen
Für eine wissenschaftlich belastbare Versuchsanordnung müssen die drei Bedingungen so definiert sein, dass möglichst nur ein Faktor verändert wird: Im dritten Durchgang kommt der zusätzliche Prüfrahmen hinzu. Frage, Ausgangsmaterial und verwendetes KI-System sollten ansonsten möglichst gleich bleiben.
Die Versuchsanordnung besteht aus drei klar voneinander getrennten Bedingungen.
Ihr Zweck ist es, zunächst eine menschliche Ausgangsposition zu erfassen, anschließend die Bearbeitung derselben Fragestellung durch ein KI-System zu dokumentieren und schließlich zu untersuchen, was sich verändert, wenn dasselbe KI-System zusätzlich mit meinem Prüfrahmen arbeitet.
Damit ein solcher Vergleich aussagekräftig werden kann, müssen Fragestellung, zugrunde liegendes Material und Auswertungsbedingungen möglichst konstant gehalten werden.
Besonders wichtig ist, dass die drei Bedingungen unabhängig voneinander erzeugt werden. Die zweite Bedingung darf die menschliche Antwort nicht kennen, und die dritte Bedingung darf weder die erste noch die zweite Antwort als Vorlage erhalten. Andernfalls wäre nicht mehr eindeutig feststellbar, ob Unterschiede durch den zusätzlichen Prüfrahmen oder lediglich durch die Kenntnis vorheriger Antworten entstanden sind.
Versuchsbedingung 1: Eigenständige menschliche Ausgangsantwort
Die erste Versuchsbedingung dient der Erfassung der menschlichen Ausgangsposition. Eine Versuchsperson erhält eine vorher festgelegte Forschungsfrage sowie, sofern die Untersuchung mit einem gemeinsamen Quellenmaterial arbeitet, genau dieses Ausgangsmaterial. Sie bearbeitet die Fragestellung ohne Unterstützung durch ein KI-System und ohne Kenntnis meines Vier-Ebenen-Modells, der Tragwirklichkeit oder anderer für die dritte Versuchsbedingung vorgesehener Prüfkriterien.
Die Antwort soll den ursprünglichen Denk- und Begründungsstand der Person möglichst unverändert dokumentieren. Erfasst werden dabei nicht nur die eigentliche Schlussfolgerung, sondern auch die verwendeten Begriffe, Voraussetzungen, Begründungen, Wertungen und ausdrücklich benannten Unsicherheiten.
Diese erste Bedingung bildet deshalb keine Kontrollgruppe im klassischen Sinn einer anderen Personengruppe, sondern zunächst einen Referenzzustand menschlichen Urteilens vor der KI-Konfrontation.
Für die wissenschaftliche Auswertung ist entscheidend, dass die Versuchsperson ihre Antwort festhält, bevor sie irgendeine der KI-Antworten sieht. Eine nachträgliche Rekonstruktion der ursprünglichen Meinung wäre ungeeignet, weil sie bereits durch die späteren Antworten beeinflusst sein könnte.
Wenn mit vorgegebenem Quellenmaterial gearbeitet wird, sollte die Person grundsätzlich auf dasselbe Material zugreifen können, das später auch den KI-Systemen zur Verfügung gestellt wird. Dadurch wird verhindert, dass Unterschiede lediglich daraus entstehen, dass die KI mehr Ausgangsinformationen besitzt.
Versuchsbedingung 2: KI-Antwort ohne zusätzlichen Prüfrahmen
Die zweite Versuchsbedingung erfasst die reguläre Bearbeitung derselben Forschungsfrage durch ein KI-System.
Das KI-System erhält dieselbe Fragestellung und dasselbe vorgegebene Ausgangsmaterial wie die Versuchsperson. Es erhält jedoch keine Informationen über mein Vier-Ebenen-Modell, Tragwirklichkeit, Wahrheitsfähigkeit oder das Frage-, Prüf- und Rückkopplungsparadigma.
Ebenso erhält es die menschliche Ausgangsantwort nicht.
Damit soll ein möglichst unbeeinflusster zweiter Referenzzustand entstehen: Wie bearbeitet das verwendete KI-System die Fragestellung unter seinen gewöhnlichen Bedingungen?
Die zweite Versuchsbedingung ist für die Untersuchung besonders wichtig, weil sie ermöglicht, später zwischen einem allgemeinen KI-Effekt und einem spezifischen Effekt meines Prüfrahmens zu unterscheiden.
Wenn beispielsweise bereits die reguläre KI-Antwort systematisch Voraussetzungen, Unsicherheiten, Gegenargumente und langfristige Konsequenzen untersucht, kann eine vergleichbare Leistung in der dritten Bedingung nicht ohne Weiteres meinem Vier-Ebenen-Modell zugeschrieben werden.
Die zweite Bedingung bildet deshalb die eigentliche Vergleichsbedingung für den zusätzlichen Prüfrahmen.
Versuchsbedingung 3: KI-Antwort mit Vier-Ebenen-Prüfrahmen
In der dritten Versuchsbedingung erhält dasselbe KI-System dieselbe Forschungsfrage und dasselbe Ausgangsmaterial wie in der zweiten Bedingung. Zusätzlich erhält es jedoch meinen gegenwärtigen Prüfrahmen.
Dieser umfasst mindestens die Definitionen von E1 bis E4, Tragwirklichkeit und Wahrheitsfähigkeit sowie die Anweisung, die eigene Antwort nicht als endgültige Wahrheit zu behandeln, sondern ihre Voraussetzungen, Auslassungen, Unsicherheiten und möglichen Korrekturbedingungen ausdrücklich zu untersuchen.
E1 richtet die Aufmerksamkeit auf physikalisch-materielle Bedingungen und Wirkungen. E2 richtet sie auf organismische Abhängigkeiten, Körperlichkeit, Stoffwechsel, Verletzbarkeit und Handlungsvoraussetzungen. E3 untersucht menschlich hervorgebrachte Begriffe, Rollen, Wertungen, Modelle, Institutionen und andere Setzungen. E4 verlangt schließlich, diese Hervorbringungen selbst wieder einem Gegenüber auszusetzen: Welche Voraussetzungen wurden gesetzt? Welche Konsequenzen wurden nicht berücksichtigt? Welche Beobachtung könnte die Aussage verändern? Welche Grenzen besitzt das Modell?
Die dritte Versuchsbedingung soll ausdrücklich keine Antwort im Sinne meines Modells erzwingen. Die KI soll nicht angewiesen werden, das Vier-Ebenen-Modell zu bestätigen. Sie soll es als zusätzlichen Prüfrahmen verwenden und zugleich mögliche Grenzen dieses Rahmens benennen.
Auch diese Antwort wird in einer neuen, von den vorherigen Antworten getrennten Sitzung erzeugt. Sie darf weder die menschliche Ausgangsantwort noch die reguläre KI-Antwort kennen.
Damit unterscheidet sich Bedingung 3 von Bedingung 2 möglichst nur durch eine zentrale unabhängige Variable: das Hinzufügen des Vier-Ebenen-Prüfrahmens.
Konstanthaltung der übrigen Bedingungen
Damit Unterschiede zwischen der zweiten und dritten KI-Bedingung tatsächlich auf den zusätzlichen Prüfrahmen zurückgeführt werden können, sollten möglichst alle anderen Bedingungen gleich bleiben.
Verwendet werden sollte dasselbe KI-Modell in derselben Version. Auch die Forschungsfrage, das Ausgangsmaterial, die gewünschte Antwortform und möglichst der erlaubte Antwortumfang sollten identisch sein. Wenn technische Einstellungen des Systems kontrolliert werden können, sollten auch diese konstant gehalten werden.
Besonders der Antwortumfang ist relevant. Eine dritte Antwort, die allein deshalb mehr Voraussetzungen und Gegenargumente enthält, weil sie doppelt so lang sein darf, wäre kein überzeugender Nachweis eines spezifischen Erkenntnisgewinns. Deshalb sollte für die beiden KI-Bedingungen ungefähr derselbe Umfang vorgegeben werden.
Ebenso sollten keine vorherigen Chatverläufe in die zweite oder dritte Bedingung eingehen. Jede Antwort sollte möglichst in einem neuen Kontext erzeugt werden.
Die Forschungsfrage als gemeinsame Konstante
Für einen möglichst sauberen Versuch sollte nicht jede Bedingung mit einer leicht veränderten Frage arbeiten. Der Wortlaut der Ausgangsfrage muss identisch bleiben.
Auch die Auswahl des zugrunde gelegten Informationsmaterials sollte vor Beginn des Versuchs feststehen. Besonders geeignet wäre deshalb zunächst ein quellengebundener Versuch: Mensch und KI erhalten dasselbe überschaubare Text- oder Datenmaterial und beantworten dieselbe Frage ausschließlich auf dieser Grundlage.
Dadurch lässt sich besser feststellen, ob Unterschiede aus unterschiedlichen Prüfweisen entstehen und nicht lediglich daraus, dass Mensch und KI über unterschiedliche Informationsbestände verfügen.
In späteren Versuchen kann zusätzlich untersucht werden, was geschieht, wenn Menschen und KI ihr jeweiliges Vorwissen oder weitere Informationsquellen verwenden dürfen. Dies wäre jedoch bereits eine andere Versuchsbedingung und sollte nicht mit dem ersten Grundversuch vermischt werden.
Der eigentliche Vergleich erfolgt erst nach Abschluss aller drei Bedingungen
Die drei Antworten werden zunächst vollständig getrennt erzeugt. Erst danach beginnt die vergleichende Prüfphase.
Zu diesem Zeitpunkt liegen drei klar definierte Zustände vor: eine menschliche Ausgangsantwort ohne KI-Unterstützung, eine reguläre KI-Antwort ohne meinen Prüfrahmen und eine KI-Antwort mit zusätzlichem Vier-Ebenen-Prüfrahmen.
Diese drei Antworten werden anschließend anhand derselben vorher festgelegten Kriterien untersucht: Sichtbarkeit von Voraussetzungen, Berücksichtigung relevanter Abhängigkeiten, Erkennung von Auslassungen, Trennung unterschiedlicher Aussagearten, Prüfbarkeit, Umgang mit Unsicherheit, Berücksichtigung von Systemgrenzen und Zeithorizonten sowie Korrigierbarkeit.
Erst nach dieser Auswertung sieht die Versuchsperson die beiden KI-Antworten und vergleicht sie mit ihrer eigenen Ausgangsantwort.
Damit entsteht eine weitere Untersuchungsgröße: Was geschieht mit dem menschlichen Urteil durch die Gegenüberstellung?
Trennung von Antwortqualität und Wirkung auf die Versuchsperson
Wissenschaftlich sollten dabei zwei unterschiedliche Ergebnisse nicht miteinander vermischt werden.
Die erste Untersuchung betrifft die Eigenschaften der drei Antworten selbst. Hier kann beispielsweise geprüft werden, ob die dritte Antwort tatsächlich mehr relevante Voraussetzungen oder Unsicherheiten sichtbar macht als die zweite.
Die zweite Untersuchung betrifft die Wirkung auf den Menschen. Hier wird geprüft, ob und weshalb die Versuchsperson nach dem Vergleich ihre ursprüngliche Position bestätigt, differenziert oder verändert.
Eine erkenntnistheoretisch bessere KI-Antwort muss nicht automatisch zu einer besseren menschlichen Entscheidung führen. Umgekehrt kann eine sprachlich überzeugende, aber sachlich problematische KI-Antwort starken Einfluss auf die Versuchsperson besitzen.
Gerade diese Differenz ist für die Mensch-KI-Forschung besonders wichtig.
Die drei Bedingungen als experimentelle Grundstruktur
Die Versuchsanordnung lässt sich damit methodisch auf eine einfache Struktur zurückführen.
Versuchsbedingung 1 erfasst, was der Mensch vor der KI-Begegnung selbst hervorbringt. Versuchsbedingung 2 erfasst, was ein KI-System unter gewöhnlichen Bedingungen aus derselben Forschungsfrage hervorbringt. Versuchsbedingung 3 untersucht, was sich verändert, wenn lediglich ein zusätzlicher Prüf- und Rückkopplungsrahmen eingeführt wird.
Der wissenschaftlich interessanteste Vergleich liegt zunächst zwischen Bedingung 2 und Bedingung 3. Hier kann geprüft werden, ob mein Vier-Ebenen-Modell gegenüber einer regulären KI-Bearbeitung überhaupt einen spezifischen zusätzlichen Erkenntniswert erzeugt.
Der Vergleich mit Bedingung 1 untersucht dagegen zusätzlich die menschliche Ausgangsposition und ermöglicht später die Frage, wie die Begegnung mit den beiden KI-Antworten auf menschliches Urteilen zurückwirkt.
Damit wird die Versuchsanordnung präziser als ein einfacher Vergleich von „Mensch gegen KI“. Sie untersucht zwei verschiedene Fragen: Verändert der zusätzliche Prüfrahmen die Qualität einer KI-gestützten Analyse, und verändert die Gegenüberstellung dieser unterschiedlichen Analysen anschließend die menschliche Fähigkeit zur Prüfung und Korrektur der eigenen Position?
Meine Prüfmerkmale eindeutig operationalisieren
