Zum Inhalt springen

Prüfen & Bewerten · KI-Weiterbildung für Unternehmen

Warum bewertet KI dieselbe Prüfungsantwort unterschiedlich?

Stand 10.10.2026 · 5 Min. Lesezeit

Kurz gesagt

Vergleichen Sie wiederholte KI-Vorschläge mit identischer Aufgabe, Antwort und Rasterfassung. Prüfen Sie Abweichungen auf der Ebene einzelner Kriterien; ein Mittelwert verschiedener KI-Noten ersetzt keine fachlich begründete Beurteilung.

Kurz gesagt: Vergleichen Sie wiederholte KI-Vorschläge mit identischer Aufgabe, Antwort und Rasterfassung. Prüfen Sie Abweichungen auf der Ebene einzelner Kriterien; ein Mittelwert verschiedener KI-Noten ersetzt keine fachlich begründete Beurteilung.

Das Problem

Frau Keller gibt dieselbe erfundene Prüfungsantwort zweimal in eine KI ein. Einmal erscheint sie überzeugend, beim nächsten Mal werden fehlende Details beanstandet. Eine unverändert wirkende Frage führt also nicht zwingend zu einem identischen Bewertungsvorschlag.

Sprachliche KI-Ausgaben können variieren; ausserdem verändern Gesprächsverlauf, unklare Kriterien oder unbemerkte Eingabeunterschiede die Grundlage. Zuverlässigkeit bedeutet hier, dass vergleichbare Leistungen unter vergleichbaren Bedingungen nachvollziehbar beurteilt werden. Ein einzelner plausibler Vorschlag zeigt diese Zuverlässigkeit noch nicht.

So lösen Sie es mit KI – Schritt für Schritt

  1. Vergleichszweck festlegen. Öffnen Sie ein lokales Dokument und notieren Sie, welche Frage Sie untersuchen: schwankende Textbelege, wechselnde Kriterienauslegung oder unterschiedliche Punkte. Verwenden Sie dafür ausschliesslich selbst erstellte Beispielantworten.
  1. Eingabe einfrieren. Speichern Sie Aufgabe, Beispielantwort, Raster und Arbeitsanweisung als gemeinsame Fassung. Prüfen Sie, ob Fachbegriffe und Qualitätsstufen eindeutig sind; bereits ein fehlender Absatz kann den Vergleich unbrauchbar machen.
  1. Ausgaben getrennt erzeugen. Starten Sie für jeden Vergleich ein neues Gespräch im freigegebenen Werkzeug. Verwenden Sie unveränderte Eingaben und notieren Sie Datum sowie sichtbare Einstellungen, ohne technische Gleichheit zu behaupten, die Sie nicht kontrollieren können.
  1. Unterschiede erfassen. Übertragen Sie pro Kriterium Beleg, Einstufung und Begründung in eine Tabelle. Unterscheiden Sie andere Formulierungen desselben Urteils von tatsächlichen Änderungen der fachlichen Bewertung.
  1. Ursachen eingrenzen. Prüfen Sie jede Abweichung selbst am Beispieltext. Verändern Sie anschliessend nur einen unklaren Teil des Rasters und wiederholen Sie den Vergleich, damit erkennbar bleibt, welche Präzisierung möglicherweise geholfen hat.
  1. Unabhängig abgleichen. Lassen Sie eine Kollegin die erfundenen Beispiele mit demselben Raster beurteilen. Auch menschliche Unterschiede werden besprochen; die KI-Ausgabe ist weder automatisch falsch noch der verbindliche Schiedsentscheid.
  1. Einsatzgrenze ziehen. Legen Sie fest, bei welchen Kriterien KI höchstens Formulierungshilfe bleibt. Wenn ähnliche Leistungen unterschiedlich ausgelegt werden, verbessern Sie den Massstab oder verzichten Sie auf Bewertungsvorschläge für diesen Bereich.

Einfach erklärt

Stellen Sie sich ein Raster vor, das «ausführliche Begründung» verlangt. Eine KI kann darunter mehrere Argumente verstehen, eine andere Ausgabe besonders genaue Belege. Die Antwort hat sich nicht verändert, wohl aber die Auslegung des unklaren Massstabs.

VergleichBedeutung
Andere Wörter, gleicher BelegVor allem sprachliche Variation
Gleicher Beleg, andere StufeKriterienauslegung genauer prüfen
Neue angebliche TextstelleBeleg am Original kontrollieren
Gleiches Urteil in allen VersuchenWiederholbar im Versuch, nicht automatisch richtig

Wiederholbarkeit und Richtigkeit sind verschieden. Ein System kann denselben Fehler zuverlässig wiederholen. Umgekehrt kann eine unterschiedliche Begründung auf eine echte Mehrdeutigkeit der Aufgabe hinweisen, die auch für menschliche Korrigierende geklärt werden muss.

Wie halten Sie den Vergleich praktisch fest?

Nutzen Sie eine einfache lokale Tabelle mit Beleg, eigener Prüfung und offener Frage. Halten Sie auch fest, welche Schlussfolgerung das Material gerade nicht trägt. Diese Begrenzung erleichtert die spätere Besprechung im Kollegium, weil Beobachtung und Interpretation getrennt bleiben.

Für das Kollegium ist eine kleine Vergleichssammlung hilfreicher als eine pauschale Aussage, die KI bewerte gut oder schlecht. Dokumentieren Sie konkrete Grenzen und prüfen Sie nach Änderungen am Ablauf erneut.

Worauf Sie achten müssen

  • Ein kontrollierter Vergleich mit wenigen Beispielen belegt keine allgemeine Verlässlichkeit. Übertragen Sie das Ergebnis nicht ungeprüft auf andere Fächer, Sprachen oder Altersstufen. Prüfen Sie vor allem Grenzfälle, statt nur eindeutige Antworten auszuwählen.
  • Daten begrenzen: Geben Sie keine Personendaten von Lernenden in öffentliche KI-Dienste ein. Für das Erproben genügen selbst erstellte Beispiele; reale Beurteilungen verbleiben in den dafür vorgesehenen schulischen Abläufen.
  • Rahmen beachten: Stimmen Sie den Einsatz auf Alter, Lernvoraussetzungen und verfügbare Unterstützung ab. Kantonale und institutionelle Vorgaben können sich unterscheiden; Ihr Vorgehen muss zu Ihrem konkreten Bildungsauftrag passen.
  • Verantwortung behalten: Prüfen Sie KI-Vorschläge auf erfundene Belege und fachliche Fehler. Besprechen Sie unklare Fälle persönlich, statt eine automatische Ausgabe als abschliessendes Urteil zu behandeln.

Ein Beispiel aus der Praxis

Ein fiktives Beispiel aus einer Thurgauer Sekundarschule: Frau Keller testet eine kurze historische Erklärung. Unterschiedliche KI-Ausgaben stufen dieselbe Quellenbegründung verschieden ein, weil «gut belegt» im Raster nicht genauer beschrieben ist.

Das Fachteam präzisiert, dass eine Aussage mit einer passenden Textstelle verbunden und deren Bedeutung erklärt werden soll. Danach lassen sich die Ausgaben gezielter vergleichen. Die Lehrpersonen nutzen die KI weiterhin zum Prüfen von Formulierungen; die Einstufung der echten Prüfungsantworten begründen sie selbst.

Vertiefen können Sie dies mit KI-Korrektur nennt erfundene Fehler: Was tun? und KI-Musterlösung prüfen, bevor sie zum Korrekturmassstab wird.

So hilft Ihnen Alpasana

Alpasana bietet mit KI-Weiterbildung für Unternehmen eine passende Lernmöglichkeit. Die Online-Weiterbildung behandelt den verantwortungsvollen KI-Einsatz für Arbeitsaufgaben, den Umgang mit Daten und die Prüfung von Ergebnissen. Das Angebot ermöglicht Lernen im eigenen Tempo und verifizierbare Abschlüsse; für Firmenlösungen und Teambuchungen ist eine Kontaktaufnahme vorgesehen.

Die allgemeinen Arbeitsweisen unterstützen das Team dabei, Eingaben nachvollziehbar festzuhalten und abweichende Ergebnisse kritisch zu besprechen. Die fachliche Anpassung und Freigabe im schulischen Rahmen bleiben bei Ihnen und Ihrer Institution.

Häufige Fragen

Soll ich mehrere KI-Noten mitteln?

Ein Mittelwert kann Schwankungen verbergen, ohne ihre Ursache zu klären. Wenn die Ausgaben unterschiedliche Kriterien verwenden, werden nicht einmal vergleichbare Urteile gemittelt. Prüfen Sie Belege und Massstab, bevor Sie über Punktwerte sprechen.

Hilft eine längere KI-Anweisung?

Nur wenn er notwendige Informationen präzisiert. Zusätzliche widersprüchliche Vorgaben können die Beurteilung erschweren. Halten Sie Aufgabe, Kriterien und Ausgabeformat klar und testen Sie gezielte Änderungen einzeln.

Beweist Übereinstimmung mit mir die Qualität?

Sie ist ein Anlass zum genaueren Vergleich, aber kein Beweis. Auch Ihre erste Einschätzung kann überprüfungsbedürftig sein. Nutzen Sie fachlich begründete Referenzen und kollegiale Gespräche, besonders bei mehrdeutigen Antworten.

Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. So arbeitet die Redaktion · Fehler entdeckt? Melden Sie es uns.

Weiterlesen in der Galaxie