Zum Inhalt springen

Prüfen & Bewerten · KI-Weiterbildung für Unternehmen

Bewertungsraster im Team mit KI kalibrieren

Stand 10.10.2026 · 5 Min. Lesezeit

Kurz gesagt

Ein Raster wirkt erst, wenn alle es gleich auslegen. Im Team bewerten alle dieselben Beispiele unabhängig, vergleichen und klären Abweichungen. KI kann erfundene Übungsfälle liefern, wenn echte Arbeiten nicht verwendet werden dürfen. Die Einigung halten Sie schriftlich fest.

Das Problem

An einer Schule unterrichten drei Lehrpersonen parallel dasselbe Fach. Für die gemeinsame Abschlussarbeit haben sie ein Bewertungsraster entwickelt. Beim Vergleich der Noten zeigt sich: Frau Keller bewertet strenger als ihr Kollege, und die Lernenden merken es. «Bei Frau Keller ist die gleiche Arbeit schlechter», heisst es. Das untergräbt das Vertrauen in die Bewertung und führt zu Beschwerden.

Das Raster selbst ist selten das Problem. Es wird unterschiedlich gelesen: Was heisst «argumentiert nachvollziehbar»? Wie viele Fehler sind «vereinzelt»? Solche Spielräume lassen sich verkleinern, indem das Team das Raster gemeinsam einübt. Dieses Einüben nennt man Kalibrierung. Alle bewerten dieselben Arbeiten unabhängig voneinander, vergleichen ihre Einschätzungen und einigen sich auf eine gemeinsame Auslegung.

Gute Übungsmaterialien sind echte Arbeiten aus früheren Jahren. Doch oft dürfen sie nicht verwendet werden, oder es gibt sie nicht. KI kann erfundene Beispiele entwerfen, an denen das Team üben kann. Wichtig: Die Beispiele sind Hilfsmittel. Entscheidend ist das Gespräch im Team, und die Verantwortung für Noten bleibt bei den Lehrpersonen.

So lösen Sie es mit KI – Schritt für Schritt

  1. Ziel der Sitzung festlegen. Beispiel: «Wir bewerten fünf Beispieltexte unabhängig und vergleichen unsere Einschätzungen.» Planen Sie 60 bis 90 Minuten ein.
  2. Raster bereitlegen. Alle haben dasselbe Raster in der gleichen Fassung. Änderungen während der Sitzung werden notiert.
  3. Übungsfälle entwerfen lassen. Lassen Sie von der KI fünf erfundene Lernendenantworten auf unterschiedlichen Niveaus erstellen, darunter zwei Grenzfälle. Die KI soll keine Bewertung angeben.
  4. Fälle prüfen. Eine Person liest sie fachlich durch und streicht, was unrealistisch oder falsch ist.
  5. Unabhängig bewerten. Jede Person bewertet alle Fälle allein nach dem Raster und notiert Stufe und kurze Begründung. Ohne Austausch.
  6. Vergleichen und klären. Legen Sie die Bewertungen in einer Tabelle nebeneinander. Besprechen Sie nur die Fälle mit Abweichungen: Welches Kriterium wurde unterschiedlich gelesen? Wie einigen wir uns?
  7. Raster und Regeln anpassen. Halten Sie Klärungen in einem Satz fest, am besten mit einem Beispiel. Präzisieren Sie das Raster, wenn Formulierungen unklar waren.
  8. Wiederholen. Eine zweite Runde zeigt, ob sich die Übereinstimmung verbessert hat.
FallPerson APerson BPerson CAbweichungKlärung
1333keine–
2233Kriterium Aufbau«Logischer Aufbau» heisst: erkennbare Reihenfolge
3434Kriterium SpracheFachbegriffe müssen korrekt, nicht zahlreich sein

Vorlage zum Kopieren

Ich bereite eine Kalibrierungssitzung für ein Lehrpersonenteam vor. Fach/Stufe: [Fach, Stufe]. Aufgabe: [Aufgabe].
Bewertungsraster (Kurzfassung): [Kriterien mit Niveaus]
Erstelle:
1. Fünf erfundene Antworten von Lernenden auf diese Aufgabe, auf verschiedenen Niveaus, davon zwei nahe an einer Stufengrenze. Länge etwa [150] Wörter. Gib weder Noten noch Niveaus an.
2. Eine Tabelle für die unabhängige Bewertung (Fall, Kriterium, Niveau, Begründung).
3. Eine Auswertungstabelle, in die das Team die Einschätzungen eintragen und Abweichungen markieren kann.
4. Sechs Fragen für die Besprechung der Abweichungen.
5. Hinweise, an welchen Stellen Raster-Formulierungen häufig unterschiedlich gelesen werden.
Verwende keine Namen und keine echten Schülerantworten. Markiere fachliche Aussagen, die ich prüfen muss, mit «prüfen».

Setzen Sie Fach, Stufe, Aufgabe und Raster ein. Prüfen Sie jeden Fall fachlich, bevor das Team ihn bewertet.

Worauf Sie achten müssen

  • Übungsfälle sind nur Übung. KI-Fälle wirken glatter als echte Arbeiten. Ergänzen Sie sie später durch anonymisierte echte Beispiele mit Einwilligung.
  • Keine Schülerdaten in öffentliche KI-Dienste. Verwenden Sie erfundene Fälle. Orientierung bietet das Educa-Dossier; es gelten die kantonalen Vorgaben.
  • KI bewertet nicht. Auch wenn sie Vorschläge macht, sollten diese nicht in die Besprechung einfliessen. Sonst entsteht ein Anker, der das Team beeinflusst. Hinweise für Teams, die mit KI-Korrektur arbeiten, finden Sie unter KI-Korrektur im Team fortbilden.
  • Unterschiede sind keine Schuld. Es geht nicht darum, wer recht hat, sondern darum, was gelten soll. Eine sachliche Gesprächsführung hilft.
  • Einigung dokumentieren. Ohne schriftliche Festlegung verschwindet das Ergebnis. Das Dokument gehört in die Prüfungsunterlagen.
  • Rechtsrahmen. Bewertung und Noten sind kantonal oder institutionell geregelt. Eine Teamvereinbarung ersetzt die Vorgaben nicht. Besondere Fälle behandeln Sie nach Grenzfälle der Benotung.

Ein Beispiel aus der Praxis

Ein erfundenes Beispiel aus einer Sekundarschule im Kanton Zürich: Drei Lehrpersonen bewerten die Abschlussarbeiten der 9. Klassen mit einem gemeinsamen Raster.

Vorher: In diesem erfundenen Beispiel liegen die Durchschnittsnoten der Klassen deutlich auseinander. Eltern fragen nach.

Nachher: Frau Keller organisiert eine Kalibrierungssitzung. Die KI entwirft fünf erfundene Aufsatzauszüge, zwei davon als Grenzfälle. Das Team bewertet sie allein, dann vergleichen sie. Beim Kriterium «Argumentation» liegen die Einschätzungen weit auseinander. Sie einigen sich, dass zwei begründete Argumente für Niveau 3 genügen. Sie ergänzen das im Raster. Bei der nächsten Runde bewertet das Team zwei echte, anonymisierte Arbeiten und liegt deutlich näher beieinander.

So hilft Ihnen Alpasana

Wenn ein Team KI gemeinsam und regelkonform einsetzen möchte, lohnt sich eine gemeinsame Grundlage. Alpasana bietet mit KI-Weiterbildung für Unternehmen Online-Kurse von Grundlagen bis zum Diplomlehrgang an, mit Datenschutz als Lerninhalt und der Möglichkeit, Teambuchungen und Firmenlösungen anzufragen. Ob das Angebot zu Ihrer Institution passt, klären Sie im Gespräch.

Häufige Fragen

Wie lange dauert eine Kalibrierung?

Eine erste Sitzung braucht meist 60 bis 90 Minuten. Kurze Auffrischungen vor jeder Prüfungsrunde dauern 30 Minuten.

Wie viele Beispiele braucht es?

Fünf bis acht genügen für eine Runde. Wichtig ist eine Mischung aus typischen Fällen und Grenzfällen.

Muss das ganze Team teilnehmen?

Idealerweise ja, alle die mit dem Raster bewerten. Wer fehlt, sollte die Einigungen schriftlich erhalten und mit einem Fall nachüben.

Ersetzt das die Zweitkorrektur?

Nein. Kalibrierung verbessert die Einheitlichkeit, aber Zweitkorrekturen bei Grenzfällen oder wichtigen Prüfungen bleiben sinnvoll, wenn die Prüfungsordnung es verlangt.

Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. So arbeitet die Redaktion · Fehler entdeckt? Melden Sie es uns.

Quellen

Weiterlesen in der Galaxie