Prüfen & Bewerten · KI-Weiterbildung für Unternehmen
Anonyme Bewertung: Mit KI-Beispielen Verzerrungen prüfen
Kurz gesagt
Lassen Sie die KI zwei gleichwertige, fiktive Texte erzeugen, die sich nur im Namen der Verfasserin oder des Verfassers unterscheiden, und lassen Sie Ihr Team sie unabhängig bewerten. Weichen die Urteile ab, zeigt das mögliche Verzerrungen. So prüfen Sie Ihre Beurteilungspraxis, ohne echte Lernende zu verwenden.
Das Problem
Frau Keller und ihre Kolleginnen bewerten Aufsätze. Alle sind überzeugt, fair zu urteilen. Doch niemand kann sicher sagen, ob ein Name, ein bekanntes Kind oder ein früherer Eindruck die Note beeinflusst. Beurteilungsfehler passieren Menschen unbewusst: Wer ein Kind als «stark» kennt, liest dessen Text wohlwollender; ein Text von einem Kind, das schon oft aufgefallen ist, wird strenger gelesen.
Solche Effekte nennt man Beurteilungsfehler oder Verzerrungen (englisch Bias). Dazu gehört der Halo-Effekt: Ein positiver Eindruck in einem Bereich färbt auf andere ab. Auch der Namenseffekt gehört dazu, die Beeinflussung durch Namen, die Erwartungen über Herkunft oder Geschlecht wecken können. In der Forschung sind solche Effekte in verschiedenen Zusammenhängen beschrieben; wie stark sie im eigenen Kollegium wirken, weiss man nicht.
Man kann es aber prüfen, ohne echte Lernende zu verwenden: mit fiktiven Beispieltexten. KI kann solche Vergleichstexte erzeugen, die gleich gut sind und sich nur in sachfremden Angaben unterscheiden. Wenn das Team die Texte unabhängig bewertet, werden Unterschiede sichtbar. Das ist eine Übung zur Selbstprüfung, kein wissenschaftlicher Test und kein Urteil über einzelne Personen.
So lösen Sie es mit KI – Schritt für Schritt
- Ziel und Rahmen klären. Das Team vereinbart: Wir prüfen unsere Beurteilungspraxis, nicht einzelne Personen. Alle Ergebnisse bleiben im Team und dienen dem Lernen.
- Eine Aufgabe und Kriterien wählen. Nehmen Sie eine Aufgabe, die alle kennen, mit dem gewohnten Bewertungsraster, etwa einen Kurzaufsatz.
- Zwei gleichwertige Texte erzeugen lassen. Bitten Sie die KI um zwei Texte mit gleichem Inhalt und gleicher Qualität, aber leicht unterschiedlicher Formulierung. Prüfen Sie, ob sie wirklich gleichwertig sind.
- Sachfremde Angaben variieren. Versehen Sie die Texte mit verschiedenen fiktiven Verfasserangaben, zum Beispiel unterschiedlichen Vornamen. Variieren Sie nur eine Angabe pro Durchgang und verwenden Sie keine realen Personen.
- Unabhängig bewerten lassen. Jede Beurteilende bewertet beide Texte mit dem Raster, ohne sich abzusprechen. Idealerweise erhält jede Person nur einen der beiden Texte, damit der Vergleich nicht auffällt.
- Ergebnisse zusammenführen. Sammeln Sie die Bewertungen anonym in einer Tabelle. Vergleichen Sie Durchschnitte und Spannweiten pro Text.
- Abweichungen besprechen. Gibt es Unterschiede, fragen Sie im Team nach den Gründen. Bei wenigen Personen sind die Zahlen nur Anhaltspunkte, keine Beweise.
- Massnahmen ableiten. Vereinbaren Sie, was Sie ändern, zum Beispiel anonymes Korrigieren mit Codes, Bewertung nach Kriterien Frage für Frage, regelmässiger Abgleich mit Ankerbeispielen.
| Verzerrung | Wirkung | Mögliche Gegenmassnahme |
|---|---|---|
| Namenseffekt | Erwartungen aufgrund des Namens | Arbeiten mit Codes korrigieren |
| Halo-Effekt | Gesamteindruck färbt einzelne Urteile | Kriterium für Kriterium bewerten |
| Reihenfolge | Frühere Arbeiten prägen Massstab | Reihenfolge wechseln, Ankerbeispiele |
| Vorwissen über das Kind | Texte werden wohlwollender oder strenger gelesen | Anonym korrigieren |
Vorlage zum Kopieren
Ein Prompt ist der schriftliche Auftrag an die KI. Verwenden Sie nur fiktive Inhalte und keine echten Schülertexte.
Ich möchte mit meinem Team unsere Beurteilungspraxis prüfen. Erstelle zwei fiktive Kurztexte (je etwa 150 Wörter) von Schülerinnen oder Schülern der [Klassenstufe] zur Aufgabe «[Aufgabenstellung]».
Beide Texte sollen inhaltlich und sprachlich gleich gut sein (Qualität: [z. B. durchschnittlich bis gut]), aber unterschiedlich formuliert, damit niemand sie als Kopie erkennt.
Gib zu jedem Text eine kurze Liste mit den Eigenschaften, die ihn auf einem Raster mit den Kriterien [Kriterien] gleichwertig machen.
Nenne keine Verfassernamen.
Weise darauf hin, wenn sich die Texte in einem Kriterium unterscheiden.Ändern Sie Aufgabe und Qualität und ergänzen Sie die Verfasserangaben selbst. Prüfen Sie die Gleichwertigkeit der Texte vor dem Einsatz.
Worauf Sie achten müssen
- Verwenden Sie ausschliesslich fiktive Texte. Echte Schülerarbeiten gehören nicht in öffentliche KI-Dienste; Orientierung bietet der Eidgenössische Datenschutz- und Öffentlichkeitsbeauftragte.
- KI-Texte sind nie vollständig gleichwertig. Unterschiede in der Bewertung können auch von den Texten kommen. Deuten Sie die Ergebnisse vorsichtig.
- Bei kleinen Teams haben Zahlen wenig Aussagekraft. Es geht um Gesprächsanlässe, nicht um Beweise.
- Behandeln Sie das Thema respektvoll. Niemand soll sich vorgeführt fühlen. Machen Sie klar, dass Verzerrungen allen passieren.
- Namen können Stereotype auslösen. Wählen Sie Namen bewusst und besprechen Sie im Team, warum bestimmte Namen gewählt wurden. Vermeiden Sie Klischees in den Texten.
Ein Beispiel aus der Praxis
Ein erfundenes Beispiel aus einem Kollegium in Liestal: Sechs Lehrpersonen wollen ihre Aufsatzbewertung prüfen. Frau Keller lässt mit KI zwei gleichwertige Kurztexte erstellen und liest sie selbst gegen. Das Team erhält zwei Varianten desselben Raster-Aufsatzes, der erste mit dem Vornamen «Mia», der zweite mit «Mehmet». Jede Lehrperson bewertet nur eine Fassung.
Die Durchschnitte unterscheiden sich um einen halben Notenpunkt, bei sechs Personen ein Hinweis, kein Beweis. Im Gespräch sagen zwei, sie hätten bei einem Namen eher «Sprachprobleme» erwartet. Das Team beschliesst, Aufsätze künftig mit Codes zu korrigieren und Kriterien einzeln zu bewerten. Nach einem Semester wiederholen sie die Übung mit anderen Texten.
So hilft Ihnen Alpasana
Wenn Ihr Team lernen möchte, mit KI sorgfältig und verantwortungsbewusst zu arbeiten, bietet absofort KI-Weiterbildung für Unternehmen an. Die Online-Kurse reichen von Grundlagen bis zum Executive-Diplomlehrgang und behandeln Schweizer Praxisbezug, Datenschutz und den verantwortungsbewussten Umgang mit Daten; sie ermöglichen Lernen im eigenen Tempo mit verifizierbaren Abschlüssen und bieten eine Kontaktmöglichkeit für Firmenlösungen und Teambuchungen.
Das Angebot ist nicht auf Schulbeurteilung ausgerichtet. Die Auswertung Ihrer Beurteilungspraxis gestalten Sie im eigenen Team.
Häufige Fragen
Beweist die Übung, dass wir voreingenommen sind?
Nein. Bei kleinen Gruppen zeigt sie nur mögliche Tendenzen. Sie ist ein Anlass, über das eigene Urteilen nachzudenken.
Wie ändere ich meine Praxis konkret?
Anonym korrigieren, nach Kriterien bewerten und mit Beispielen kalibrieren. Mehr dazu bietet der Beitrag zum Bewertungsraster im Team.
Eignet sich das auch für Kinder?
Mit Älteren lässt sich das Thema Vorurteile im Unterricht besprechen; Aufgaben dazu bietet der Beitrag zu KI-Vorurteilen untersuchen.
Wie unterscheide ich Fachwissen von Sprachleistung?
Mit getrennten Kriterien. Hilfen dazu finden Sie im Beitrag zu Fachwissen oder Sprachleistung.
Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. So arbeitet die Redaktion · Fehler entdeckt? Melden Sie es uns.
Quellen
Weiterlesen in der Galaxie
- Bewertungsraster im Team mit KI kalibrierenBewertungsraster im Team kalibrieren: Prüfen Sie mit KI-Fällen, ob Lehrpersonen gleich bewerten, klären Sie Unterschiede und verbessern Sie das Raster.
- Ankerbeispiele für Bewertung mit KI entwickelnAnkerbeispiele für Bewertung mit KI: Nutzen Sie Musterarbeiten oder Übungsfälle, damit Bewertungsstufen verständlicher und vergleichbar werden.
- Fachwissen und Sprachleistung mit KI bewertenFachwissen und Sprachleistung mit KI bewerten: Prüfen Sie Vorschläge am Lernziel, trennen Sie Inhalt und Ausdruck und vermeiden Sie unbegründete Abzüge.
- KI-Vorurteile untersuchen: Testaufgaben für die KlasseBias KI im Unterricht: So lassen Sie Lernende KI-Antworten mit Vergleichsprompts testen, statt über Vorurteile nur zu reden. Mit Ablauf und Prompt-Vorlage.
- QV-Bewertung üben: Fiktive Grenzfälle mit KI vergleichenQV Bewertung Grenzfälle: Mit KI fiktive Leistungen für die Schulung von Prüfungsexperten entwerfen und deren Beurteilung fachlich aufeinander abstimmen.
- Bachelorarbeit: KI-Fragen für eine eigene Diskussion nutzenBachelorarbeit Diskussion KI: Nutzen Sie gezielte Fragen zu Befunden, Alternativen und Grenzen, während Interpretation und Begründung Ihre Arbeit bleiben.