Bewertungsbogen zur vergleichenden Prüfung der drei Versuchsbedingungen.
Zweck
Der Bewertungsbogen dient dem systematischen Vergleich der drei Versuchsbedingungen:
Bedingung 1: eigenständige menschliche Antwort
Bedingung 2: reguläre KI-Antwort ohne zusätzlichen Prüfrahmen
Bedingung 3: KI-Antwort unter Anwendung des Vier-Ebenen-Modells, der Tragwirklichkeit und der Wahrheitsfähigkeit
Bewertet wird nicht, welche Antwort sprachlich am überzeugendsten, längsten oder komplexesten ist. Untersucht wird, in welchem Umfang eine Antwort ihre Voraussetzungen, Abhängigkeiten, Grenzen, Unsicherheiten und Korrekturmöglichkeiten sichtbar und überprüfbar macht.
Bewertungsskala
Für jedes Prüfmerkmal werden 0 bis 4 Punkte vergeben.
0 = nicht vorhanden
1 = lediglich angedeutet
2 = erkennbar, aber unvollständig
3 = klar und relevant ausgearbeitet
4 = differenziert ausgearbeitet und hinsichtlich seiner Folgen für die Schlussfolgerung geprüft
Ein hoher Wert setzt nicht die Zustimmung zum Vier-Ebenen-Modell voraus. Auch eine begründete Kritik oder Widerlegung kann einen hohen Erkenntniswert besitzen.
Bewertungsbogen
| Prüfmerkmal | Bedingung 1 Mensch | Bedingung 2 KI | Bedingung 3 KI + Prüfrahmen | Kurzbegründung |
|---|---|---|---|---|
| 1. Voraussetzungen – Werden die wesentlichen Annahmen der Antwort ausdrücklich sichtbar? | 0–4 | 0–4 | 0–4 | |
| 2. Abhängigkeiten – Werden relevante materielle, organismische und gesellschaftliche Bedingungen und ihre Beziehungen berücksichtigt? | 0–4 | 0–4 | 0–4 | |
| 3. Auslassungen / blinde Stellen – Erkennt die Antwort relevante nicht berücksichtigte Faktoren, Akteure oder Folgen? | 0–4 | 0–4 | 0–4 | |
| 4. Aussagearten – Werden Beobachtung, Annahme, Interpretation und Bewertung voneinander unterschieden? | 0–4 | 0–4 | 0–4 | |
| 5. Prüfbarkeit – Wird erkennbar, woran zentrale Behauptungen geprüft, bestätigt oder widerlegt werden könnten? | 0–4 | 0–4 | 0–4 | |
| 6. Unsicherheit und Nichtwissen – Werden Wissensgrenzen und Unsicherheiten ausdrücklich und differenziert benannt? | 0–4 | 0–4 | 0–4 | |
| 7. Systemgrenze und Zeithorizont – Wird deutlich, für welchen Ausschnitt und Zeitraum die Aussage gilt und ob sich bei veränderten Grenzen die Bewertung ändert? | 0–4 | 0–4 | 0–4 | |
| 8. Ziel und tatsächliche Wirkung – Werden Absicht, Zielerreichung, Nebenfolgen und tatsächliche Konsequenzen unterschieden? | 0–4 | 0–4 | 0–4 | |
| 9. Korrigierbarkeit – Wird angegeben, welche neue Information oder Beobachtung zu einer Veränderung der Schlussfolgerung führen würde? | 0–4 | 0–4 | 0–4 | |
| 10. Teil–Ganzes / Tragfähigkeit – Wird geprüft, ob ein lokaler Erfolg mit Folgen für einen umfassenderen Zusammenhang oder seine eigenen Voraussetzungen verbunden ist? | 0–4 | 0–4 | 0–4 |
Zusätzliche Prüfung des Vier-Ebenen-Modells
Die folgenden beiden Kriterien werden vor allem beim Vergleich zwischen Bedingung 2 und Bedingung 3 verwendet.
| Zusatzkriterium | Bewertung 0–4 | Begründung |
|---|---|---|
| Spezifischer Erkenntnisgewinn: Macht der zusätzliche Prüfrahmen relevante Voraussetzungen, Abhängigkeiten, Folgen oder Auslassungen sichtbar, die in der regulären KI-Antwort fehlen? | ||
| Selbstkorrekturfähigkeit des Modells: Werden Grenzen, Fehlzuordnungen oder Schwächen des Vier-Ebenen-Modells selbst sichtbar und gegebenenfalls Korrekturen vorgeschlagen? |
Ein bloß längerer Text oder die Verwendung der Begriffe E1 bis E4 gilt ausdrücklich nicht als zusätzlicher Erkenntnisgewinn.
Prüfung der Reaktion der Versuchsperson
Nach Abschluss und Bewertung der drei getrennt erzeugten Antworten sieht die Versuchsperson alle drei Ergebnisse und prüft ihre ursprüngliche Position erneut.
Ursprüngliche Position:
....................................................................................................................
Position nach der Gegenüberstellung:
....................................................................................................................
Wurde die ursprüngliche Position verändert?
Nein / teilweise / deutlich
Welche konkreten Gründe führten zur Beibehaltung oder Veränderung?
....................................................................................................................
....................................................................................................................
Die Begründbarkeit dieser Reaktion wird ebenfalls von 0 bis 4 bewertet:
0: unbegründete Übernahme oder Ablehnung
1: allgemeiner Eindruck, beispielsweise „die KI klingt überzeugender“
2: mindestens ein konkreter sachlicher Grund
3: mehrere nachvollziehbare Gründe und differenzierte Neubewertung
4: eigenständige Neubewertung mit neuen Fragen, Gegenargumenten oder Prüfmöglichkeiten
Abschließende Forschungsbewertung
Welche Unterschiede zwischen den drei Bedingungen sind besonders deutlich geworden?
....................................................................................................................
....................................................................................................................
Hat der zusätzliche Prüfrahmen einen erkennbaren Erkenntnisgewinn erzeugt? Wenn ja, worin genau?
....................................................................................................................
....................................................................................................................
Welche Aspekte waren bereits in der regulären KI-Antwort vorhanden?
....................................................................................................................
Wo erzeugte der Vier-Ebenen-Rahmen keinen zusätzlichen Nutzen oder sogar neue Probleme?
....................................................................................................................
....................................................................................................................
Welche Änderungen des Prüfrahmens ergeben sich aus dem Versuch?
....................................................................................................................
....................................................................................................................
Auswertungsprinzip
Die Einzelwerte sollen zunächst nicht zu einer einzigen Gesamtnote zusammengezogen werden. Entscheidend ist das Profil der Antworten. Eine Antwort kann beispielsweise bei der Sichtbarkeit von Voraussetzungen stark sein, gleichzeitig aber Unsicherheiten verdecken oder ihre Systemgrenze nicht reflektieren.
Die zentrale Forschungsfrage lautet deshalb nicht: Welche der drei Antworten gewinnt?
Sie lautet:
Bei welchen Prüfmerkmalen verändert sich die Qualität der Antwort zwischen Mensch, regulärer KI und KI mit zusätzlichem Prüfrahmen, und lässt sich diese Veränderung nachvollziehbar auf den Prüfrahmen zurückführen?
Erkenntnisgewinn liegt in dieser Versuchsanordnung dann vor, wenn relevante Voraussetzungen, Abhängigkeiten, Auslassungen, Unsicherheiten und Folgen präziser erkannt und geprüft werden können und wenn dadurch eine Position nachvollziehbar bestätigt, eingeschränkt, verändert oder verworfen werden kann.
Der Bewertungsbogen misst damit nicht Wahrheit selbst, sondern die beobachtbare Prüf-, Unterscheidungs- und Korrekturfähigkeit, die innerhalb der Plastischen Anthropologie als Wahrheitsfähigkeit untersucht wird.
Füge ein einheitliches Ausfüllfeld hinzuTrenne Bewertung von Begründung
