
KI und Bewerten
Foto von fernandozhiminaicela auf pixarbay
Die Angst vor KI-generierten Arbeiten zeigt, wie sehr unser System auf Produkte (und nicht auf Prozesse) fokussiert ist. Wer bislang „besteht“, weil er gut formulierte Texte abgibt, wird durch KI unterwandert – nicht, weil KI zu mächtig ist, sondern weil wir zu wenig inhaltliche Tiefe, Reflexion und Diskursfähigkeit einfordern. (Weßels et al. 2025: 4)
Die zunehmende Verfügbarkeit von KI-Systemen stellt etablierte Prüfungs- und Bewertungspraktiken grundlegend infrage. Prüfungen dienen im Studium der Leistungsabfrage und müssen daher bewertbare Leistungen hervorbringen. Leistungen werden anhand von Bewertungsmaßstäben eingeschätzt, die sich an den geprüften Fachkompetenzen orientieren. Weiterhin muss die Eigenleistung und nicht eine Fremdleistung die Basis der Benotung für die geprüfte Person sein (s. hierzu DLHN-Stellungnahme 2025, S. 12). Zentral ist also zunächst, dass Prüfungsformat und -aufgaben so gestaltet werden, dass die Nutzung von KI-Systemen die studentische Eigenständigkeit nicht kompromittiert (vgl. ebd., S. 13; konkrete Empfehlungen hierzu finden Sie auf unseren Seiten Prüfungen KI-robuster gestalten sowie KI und Abschlussarbeiten).
Die Bewertung einer studentischen Arbeit unterliegt Ihrem fachlichen Ermessen. Für eine transparente und faire Bewertung empfehlen wir, einen Bewertungshorizont in Form eines Spektrums oder Kontinuums zu nutzen. Auf diese Weise können Sie nachvollziehbar begründen, welche Kriterien zur jeweiligen Bewertung geführt haben.
Neue Bewertungskriterien – wann nötig?
Die Beantwortung dieser Frage hängt in erster Linie davon ab, welche KI-Regeln Sie für die betreffende Prüfung aufstellen (Unterstützung bei der Formulierung von KI-Regeln finden Sie auf unserer Seite zum KI-Zulässigkeitsraster für Prüfungen). Grundsätzlich kann mit Blick auf folgende Szenarien gesagt werden:
- Der KI-Einsatz ist verboten (bspw. in einer Grundlagenklausur, die darauf abzielt, den Erwerb von grundlegendem Fachwissen zu überprüfen).
In diesem Szenario sind keine neuen Bewertungsmaßstäbe nötig. Der Einsatz von KI-Tools wird als Nutzung unerlaubter Hilfsmittel gewertet und führt zu einem Täuschungsverdachtsverfahren. - Der KI-Einsatz ist erlaubt, aber nicht verpflichtend (bspw. in schriftlichen Arbeiten).
In diesem Szenario können die Studierenden selbst entscheiden, inwiefern sie KI-Tools im erlaubten Maße einsetzen. Entscheidend ist, dass „die Prüfungsleistung auch ohne KI-Einsatz bewältigt werden kann“ (DLHN-Stellungnahme 2025, S. 13) und „eine sehr gute Note sowohl mit als auch ohne KI-Einsatz möglich“ sein muss (ebd., S. 13). Für die Bewertung bedeutet dies, dass der Fokus stärker auf gängigen Kriterien guter wissenschaftlicher Praxis und weniger auf quantitativen Aspekten liegen sollte. Schließlich kann der KI-Einsatz dazu führen, dass bspw. mehr Datensätze ausgewertet werden können. Für die Endnote sollte es jedoch unerheblich sein, „ob in einer Arbeit 50 Datensätze ohne KI oder 5.000 mit KI ausgewertet werden, solange die geeigneten Methoden gewählt, korrekt eingesetzt, die richtigen Schlüsse gezogen werden“ (ebd., S. 14). - Der KI-Einsatz ist erlaubt und verpflichtend (bspw. in schriftlichen Arbeiten).
In diesem Fall ist der Einsatz von KI-Tools prüfungsrelevant und die Bewertungskriterien müssen adaptiert werden. Für dieses Szenario schlagen bspw. Weßels et al. (2025: 7) vor, bei der Bewertung stärker prozessbegleitende sowie metakognitive Kompetenzen zu fokussieren:- Transparenz & nachvollziebare Dokumentation des Arbeitsprozesses inkl. des Einsatzes von KI-Tools
- Kritisches Denken: Qualität der wissenschaftlichen Argumentation, kritische Diskussion & Reflexion von Primär-/Sekundärquellen sowie KI-generiertem Output
- Methodenkompetenz: methodische Stringenz; „Fähigkeit, Grenzen und potenzielle Fehler von KI-generierten Inhalten zu erkennen und zu korrigieren“
Das 3-P-Modell als ganzheitlicher Prüfungs- und Bewertungsansatz
Ein konkretes Modell zur Bewertung schriftlicher Arbeiten im Zeitalter generativer KI-Systeme wurde von der KI-Expertin und Hochschulprofessorin Doris Weßels entwickelt und erprobt. Mit dem 3-P-Modell will Weßels auf die „Unzulänglichkeiten einer rein produktorientierten Bewertung“ reagieren, indem sie Prozess, Produkt und Präsentation als gleichwertige Säulen in der Bewertung betrachtet (Weßels et al. 2025: 7). Greifbar wird das 3-P-Modell anhand der nachfolgenden Bewertungskriterien, die Weßels et al. (2025: 8) in ihrem Diskussionspapier „Wissenschaftliche Abschlussarbeiten im KI-Zeitalter“ aufführen:
- Prozess: Bewertung der gesamten wissenschaftlichen und technologischen Arbeitsweise
- Forschungsansatz und wissenschaftliches Vorgehen: Wie wurde die Forschungsfrage entwickelt und präzisiert? Warum wurde eine bestimmte Methode gewählt?
- Korrespondierende Auswahl und digital kompetenter Einsatz von Werkzeugen: Welche KI-Tools wurden für welche Teilschritte (z. B. Ideenfindung, Gliederung, Formulierungshilfe) genutzt? Wie wurden die Ergebnisse der KI kritisch geprüft und weiterverarbeitet?
- Produkt: Bewertung des eingereichten Endprodukts
- Argumentationsstruktur: Ist die Arbeit logisch aufgebaut und der „rote Faden“ erkennbar?
- Inhaltliche Tiefe: Wurde das Thema umfassend und differenziert bearbeitet? Zeigt die Arbeit eine kritische Auseinandersetzung mit dem Forschungsstand?
- Methodische Korrektheit: Wurden die gewählten wissenschaftlichen Methoden korrekt angewendet und die Ergebnisse nachvollziehbar dargestellt?
- Formale und sprachliche Qualität: Entspricht die Arbeit den formalen Anforderungen (Zitation, Gliederung) und ist sie sprachlich präzise und stilistisch angemessen?
- Präsentation: Bewertung der mündlichen Verteidigung der Arbeit in Kolloquium o.ä.
- Souveräne Darstellung: Kann die Verfasserin/der Verfasser die zentralen Thesen, die Methodik und die Ergebnisse der eigenen Arbeit prägnant und verständlich präsentieren?
- Diskursfähigkeit: Wie wird auf kritische Nachfragen, Einwände und weiterführende Fragen reagiert? Zeigt sich hier ein tiefes Verständnis des Themas, das über das im Text Dargestellte hinausgeht?
- Reflexion des eigenen Arbeitsprozesses: Kann die Verfasserin/der Verfasser den eigenen Forschungs- und Schreibprozess (einschließlich des KI-Einsatzes) reflektieren, getroffene Entscheidungen begründen und die Grenzen der eigenen Arbeit benennen?
Die aufgeführten Bewertungskriterien sowie -leitfragen wurden wörtlich aus Weßels et al. (2025: 8) übernommen.
