Mein experimentelles Vorgehen präzisieren

Aus Globale-Schwarm-Intelligenz


Das experimentelle Vorgehen ist darauf ausgerichtet, drei klar voneinander getrennte Antwortbedingungen miteinander zu vergleichen und anschließend zu untersuchen, ob sich durch einen zusätzlichen Prüfrahmen die Qualität der Gegenprüfung verändert.

Im Mittelpunkt steht dabei nicht die Frage, welche Antwort sprachlich am überzeugendsten erscheint, sondern ob Voraussetzungen, Abhängigkeiten, Auslassungen, Unsicherheiten und mögliche Korrekturen deutlicher sichtbar werden.

Ausgangspunkt ist eine für alle Bedingungen identische Forschungsfrage. Soweit mit Quellen oder Ausgangsmaterial gearbeitet wird, erhalten Mensch und KI dasselbe Material. Dadurch soll vermieden werden, dass Unterschiede lediglich auf unterschiedlichen Informationsgrundlagen beruhen. Auch das verwendete KI-System, der Antwortumfang und die übrigen technischen Bedingungen sollen zwischen den beiden KI-Durchgängen möglichst konstant bleiben.

In der ersten Versuchsbedingung beantwortet eine Person die Forschungsfrage eigenständig und ohne Unterstützung durch künstliche Intelligenz. Sie erhält weder das Vier-Ebenen-Modell noch die später verwendeten Prüfkriterien. Diese Antwort dokumentiert den menschlichen Ausgangszustand: Welche Annahmen, Begriffe, Gewichtungen, Begründungen und Unsicherheiten bringt die Person selbst in die Fragestellung ein?

In der zweiten Versuchsbedingung erhält ein KI-System dieselbe Forschungsfrage und dasselbe Ausgangsmaterial. Es erhält jedoch keine Informationen über mein Vier-Ebenen-Modell, Tragwirklichkeit oder Wahrheitsfähigkeit und kennt auch die menschliche Antwort nicht. Dadurch entsteht eine reguläre KI-Antwort, die als eigenständige Vergleichsbedingung dient. Sie zeigt, welche Voraussetzungen, Gegenargumente, Unsicherheiten und Zusammenhänge das KI-System bereits ohne meinen zusätzlichen Prüfrahmen berücksichtigt.

In der dritten Versuchsbedingung erhält dasselbe KI-System erneut dieselbe Forschungsfrage und dasselbe Ausgangsmaterial. Zusätzlich wird nun der Prüfrahmen eingeführt. E1 lenkt die Aufmerksamkeit auf physikalisch-materielle Bedingungen, E2 auf organismische Abhängigkeiten und Verletzbarkeiten, E3 auf menschlich hervorgebrachte Begriffe, Rollen, Wertungen und Modelle. E4 verlangt, diese Hervorbringungen wiederum ihren Voraussetzungen, Folgen und möglichen Gegenargumenten auszusetzen. Ergänzend werden Tragwirklichkeit und Wahrheitsfähigkeit als Prüfbegriffe eingeführt.

Entscheidend ist, dass die dritte Antwort nicht die vorherigen Antworten kennt. Sie soll nicht auf ihnen aufbauen, sondern unter möglichst gleichen Bedingungen wie die zweite Antwort entstehen. Dadurch lässt sich genauer untersuchen, welche Unterschiede tatsächlich mit dem zusätzlichen Prüfrahmen zusammenhängen.

Erst nach Abschluss aller drei Bedingungen beginnt die eigentliche Auswertung. Die Antworten werden anhand vorher festgelegter Prüfmerkmale verglichen. Dazu gehören insbesondere die Sichtbarkeit von Voraussetzungen, die Berücksichtigung relevanter Abhängigkeiten, die Erkennung von Auslassungen, die Trennung von Beobachtung, Annahme und Bewertung, die Prüfbarkeit zentraler Aussagen, der Umgang mit Unsicherheit und Nichtwissen, die Berücksichtigung von Systemgrenzen und Zeithorizonten sowie die Korrigierbarkeit der Schlussfolgerung.

Dabei werden Punktbewertung und Begründung voneinander getrennt. Zunächst wird für jedes Merkmal eine standardisierte Bewertung vorgenommen. Anschließend wird diese Bewertung durch konkrete Textstellen oder nachvollziehbare argumentative Merkmale begründet. Dadurch soll vermieden werden, dass ein allgemeiner Eindruck über die Qualität einer Antwort die Auswertung bestimmt.

Ein besonderer Vergleich gilt der zweiten und dritten Bedingung. Hier soll geprüft werden, ob der Vier-Ebenen-Rahmen tatsächlich einen spezifischen zusätzlichen Erkenntniswert erzeugt. Eine längere, komplexere oder stärker an meiner Terminologie orientierte Antwort gilt dabei nicht automatisch als besser. Ein zusätzlicher Erkenntniswert wäre nur dann gegeben, wenn relevante Voraussetzungen, Abhängigkeiten, blinde Stellen oder Korrekturbedingungen sichtbar werden, die in der regulären KI-Antwort fehlen oder weniger klar herausgearbeitet wurden.

Die Versuchsanordnung enthält ausdrücklich auch die Gegenhypothese. Es kann sich zeigen, dass der Prüfrahmen keinen zusätzlichen Erkenntnisgewinn hervorbringt, bereits bekannte Unterscheidungen lediglich anders bezeichnet oder selbst neue Verzerrungen erzeugt. Auch dieses Ergebnis wäre wissenschaftlich relevant, weil damit die Grenzen des eigenen Modells sichtbar würden.

Nach der unabhängigen Bewertung der drei Antworten werden sie der Versuchsperson gemeinsam vorgelegt. Erst jetzt wird untersucht, wie die Gegenüberstellung auf das menschliche Urteil zurückwirkt. Entscheidend ist dabei nicht, ob die Person ihre Meinung verändert, sondern ob sie nachvollziehbar begründen kann, weshalb sie ihre ursprüngliche Position bestätigt, einschränkt oder korrigiert.

Das experimentelle Vorgehen untersucht damit zwei unterschiedliche Fragen. Erstens: Verändert der zusätzliche Prüfrahmen die Qualität einer KI-gestützten Analyse gegenüber einer regulären KI-Antwort? Zweitens: Verbessert die Gegenüberstellung der drei Antwortbedingungen anschließend die Fähigkeit des Menschen, die eigene Position begründet zu prüfen und gegebenenfalls zu korrigieren?

Der Versuch soll daher weder die Überlegenheit des Menschen noch die Überlegenheit der KI noch die Richtigkeit meines Vier-Ebenen-Modells beweisen. Untersucht wird vielmehr, ob ein zusätzlicher Prüf- und Rückkopplungsrahmen die Bedingungen für eine nachvollziehbare und korrigierbare Urteilsbildung verändert.

Ich würde die Bedingungen methodisch noch strenger voneinander trennen: Bedingung 1 misst die menschliche Ausgangsleistung, Bedingung 2 die reguläre KI-Leistung, Bedingung 3 ausschließlich den Zusatznutzen des Prüfrahmens. So wird klarer, was jeweils untersucht wird.

Die drei Versuchsbedingungen

Die Versuchsanordnung besteht aus drei voneinander unabhängigen Bedingungen. Alle drei bearbeiten dieselbe Forschungsfrage auf Grundlage desselben Ausgangsmaterials. Die Bedingungen unterscheiden sich ausschließlich darin, wer die Frage bearbeitet und welcher Prüfrahmen zur Verfügung steht. Erst nach Abschluss aller drei Bedingungen werden die Antworten miteinander verglichen.

Versuchsbedingung 1: Menschliche Ausgangsantwort

Die erste Bedingung erfasst den menschlichen Ausgangszustand. Eine Versuchsperson beantwortet die festgelegte Forschungsfrage eigenständig und ohne Unterstützung durch künstliche Intelligenz. Sie erhält weder das Vier-Ebenen-Modell noch die Begriffe Tragwirklichkeit, Wahrheitsfähigkeit oder andere Bestandteile meines Prüfrahmens.

Diese Bedingung soll dokumentieren, welche Voraussetzungen, Begriffe, Bewertungen, Unsicherheiten und Schlussfolgerungen die Person aus eigener Kenntnis und eigener Urteilsbildung hervorbringt.

Die Antwort wird abgeschlossen und gespeichert, bevor die Versuchsperson eine KI-Antwort sieht.

Untersuchungsgegenstand dieser Bedingung ist ausschließlich die eigenständige menschliche Ausgangsleistung.

Versuchsbedingung 2: Reguläre KI-Antwort

Die zweite Bedingung erfasst die Leistung eines KI-Systems ohne meinen zusätzlichen Prüfrahmen. Dasselbe KI-System erhält dieselbe Forschungsfrage und dasselbe Ausgangsmaterial wie die Versuchsperson.

Es erhält jedoch weder die menschliche Antwort noch Informationen über das Vier-Ebenen-Modell, Tragwirklichkeit oder Wahrheitsfähigkeit.

Damit entsteht eine reguläre KI-Antwort unter möglichst normalen Bearbeitungsbedingungen.

Diese Bedingung dient als Kontrollbedingung für den späteren Vergleich mit Bedingung 3. Sie zeigt, welche Voraussetzungen, Abhängigkeiten, Gegenargumente, Unsicherheiten und Folgen das KI-System bereits ohne meinen Prüfrahmen berücksichtigt.

Untersuchungsgegenstand dieser Bedingung ist die eigenständige Analyseleistung der KI ohne zusätzliche methodische Vorgaben.

Versuchsbedingung 3: KI-Antwort mit Prüfrahmen

Die dritte Bedingung untersucht ausschließlich den möglichen zusätzlichen Effekt meines Prüfrahmens.

Dasselbe KI-System erhält erneut dieselbe Forschungsfrage, dasselbe Ausgangsmaterial und dieselben formalen Vorgaben wie in Bedingung 2. Zusätzlich erhält es nun das Vier-Ebenen-Modell sowie die Begriffe Tragwirklichkeit und Wahrheitsfähigkeit.

E1 richtet die Prüfung auf physikalisch-materielle Bedingungen. E2 richtet sie auf organismische Abhängigkeiten, Stoffwechsel, Körperlichkeit und Verletzbarkeit. E3 richtet sie auf menschlich hervorgebrachte Begriffe, Rollen, Werte, Modelle und gesellschaftliche Setzungen. E4 verlangt, auch diese Hervorbringungen wieder hinsichtlich ihrer Voraussetzungen, Folgen, Grenzen und möglichen Korrekturen zu prüfen.

Die KI erhält weder die menschliche Antwort aus Bedingung 1 noch ihre eigene frühere Antwort aus Bedingung 2. Die dritte Antwort wird unabhängig neu erzeugt.

Dadurch soll möglichst eindeutig feststellbar werden, ob Unterschiede zwischen Bedingung 2 und Bedingung 3 tatsächlich mit dem zusätzlichen Prüfrahmen zusammenhängen.

Untersuchungsgegenstand dieser Bedingung ist der spezifische Zusatznutzen des Vier-Ebenen-Prüfrahmens.

Methodische Konstanthaltung

Für die beiden KI-Bedingungen müssen möglichst alle Bedingungen identisch bleiben. Verwendet werden dasselbe KI-Modell, dieselbe Modellversion, dieselbe Forschungsfrage, dasselbe Ausgangsmaterial, dieselbe gewünschte Textlänge und dieselbe Antwortform.

Der einzige geplante Unterschied zwischen Bedingung 2 und Bedingung 3 ist die Einführung des zusätzlichen Prüfrahmens.

Diese Trennung ist entscheidend. Würde die dritte KI-Antwort beispielsweise mehr Ausgangsmaterial, mehr Bearbeitungszeit oder einen wesentlich größeren Antwortumfang erhalten, könnte nicht mehr eindeutig beurteilt werden, ob ein möglicher Erkenntnisgewinn tatsächlich auf das Vier-Ebenen-Modell zurückzuführen ist.

Unterschiedliche Funktionen der drei Bedingungen

Die drei Bedingungen beantworten damit unterschiedliche Forschungsfragen.

Bedingung 1 fragt: Wie beurteilt ein Mensch das Problem ohne KI-Unterstützung und ohne zusätzlichen Prüfrahmen?

Bedingung 2 fragt: Wie analysiert eine KI dasselbe Problem ohne meinen Prüfrahmen?

Bedingung 3 fragt: Was verändert sich an der KI-Analyse, wenn ausschließlich der zusätzliche Prüfrahmen eingeführt wird?

Der zentrale methodische Vergleich für die Prüfung meines Modells liegt deshalb zunächst zwischen Bedingung 2 und Bedingung 3. Nur dieser Vergleich kann zeigen, ob der Prüfrahmen gegenüber einer regulären KI-Antwort einen spezifischen zusätzlichen Effekt besitzt.

Der Vergleich mit Bedingung 1 erfüllt eine andere Funktion. Er macht sichtbar, worin sich menschliche Ausgangsurteile und KI-Analysen unterscheiden und ermöglicht anschließend zu untersuchen, wie die Gegenüberstellung auf das menschliche Urteil zurückwirkt.

Die Gegenüberstellung als eigener nachgelagerter Schritt

Die Gegenüberstellung der drei Antworten gehört methodisch noch nicht zu den drei Versuchsbedingungen. Sie erfolgt erst danach.

Zunächst werden die drei Antworten unabhängig voneinander erzeugt und anhand derselben Prüfmerkmale bewertet. Erst anschließend erhält die Versuchsperson Einblick in die beiden KI-Antworten.

Danach wird untersucht, ob sie ihre ursprüngliche Position beibehält, differenziert oder verändert und welche Gründe dafür ausschlaggebend sind.

Damit werden zwei Untersuchungen klar getrennt: Zum einen wird die Qualität der drei Antwortbedingungen verglichen. Zum anderen wird anschließend die Wirkung der Gegenüberstellung auf die menschliche Urteilsbildung untersucht.

Kerndefinition

Die Versuchsbedingungen lassen sich damit präzise voneinander abgrenzen:

Bedingung 1 = Mensch ohne KI und ohne Prüfrahmen.

Bedingung 2 = KI ohne Prüfrahmen.

Bedingung 3 = dieselbe KI mit zusätzlichem Prüfrahmen.

Erst danach folgt:

Gegenüberstellung = Prüfung der drei Antworten und Untersuchung ihrer Wirkung auf die menschliche Urteilsbildung.

Damit wird methodisch klar unterschieden zwischen menschlicher Ausgangsleistung, regulärer KI-Leistung, möglichem Zusatznutzen des Prüfrahmens und der späteren Rückkopplung auf den Menschen.

Den Versuchsablauf zeitlich präzisieren