Zum Inhalt springen

Prüfen & Bewerten · KI und IT für konkrete Arbeitsaufgaben

Adaptive KI-Tests: Wie bleiben Ergebnisse vergleichbar?

Stand 10.10.2026 · 6 Min. Lesezeit

Kurz gesagt

Ein adaptiver Test wählt die nächste Frage nach den bisherigen Antworten. Vergleichbar bleiben die Ergebnisse nur, wenn die Aufgaben aufwendig kalibriert sind und das Verfahren dokumentiert ist. Für benotete Prüfungen ist das selten gegeben; KI-erzeugte Aufgaben allein genügen nicht.

Das Problem

Anbieter von Lernsoftware werben mit «adaptiven KI-Tests»: Das Programm passe die Fragen automatisch an und ermittle so die Leistung «ganz genau». Frau Keller findet das attraktiv, denn so könnte sie Zeit sparen. Doch sie fragt sich: Wenn zwei Lernende unterschiedliche Fragen erhalten, wie kann ich ihre Ergebnisse vergleichen? Und darf ich so etwas für eine Note verwenden?

Die Frage ist berechtigt. Bei einem gewöhnlichen Test beantworten alle dieselben Aufgaben, und die Zahl der richtigen Antworten ist vergleichbar. Bei einem adaptiven Test gilt das nicht mehr. Ein Kind, das nur leichte Aufgaben erhält, kann viele richtig haben und trotzdem weniger können als ein Kind, das schwierigere Aufgaben nur teilweise löst. Die Prozentzahl allein sagt dann wenig.

Dieser Beitrag erklärt, wie adaptive Tests funktionieren, was für die Vergleichbarkeit nötig ist und wie Sie ein Produkt kritisch prüfen. Er gibt keine Empfehlung für oder gegen ein bestimmtes Produkt.

Einfach erklärt

Ein adaptiver Test passt sich der getesteten Person an. Wer eine Frage richtig beantwortet, erhält als Nächstes eine schwierigere, wer sie falsch beantwortet, eine leichtere. Dadurch braucht der Test oft weniger Fragen, um den Leistungsstand einzuschätzen, und niemand wird mit Aufgaben gelangweilt oder überfordert. In der Fachsprache heisst das Computerized Adaptive Testing (CAT). Das Verfahren stammt aus der Testtheorie und wird seit Langem etwa für Einstufungstests eingesetzt.

Das Ergebnis ist nicht einfach die Zahl der richtigen Antworten. Weil unterschiedliche Personen unterschiedliche Fragen erhalten, lässt sich die Leistung nur vergleichen, wenn alle Aufgaben vorher auf einer gemeinsamen Skala eingestuft wurden. Dafür braucht es einen grossen Aufgabenpool, der an vielen Testpersonen erprobt und statistisch kalibriert wurde. Ein Modell, meist aus der Item-Response-Theorie, schätzt aus den Antworten, wie leistungsstark eine Person ist.

Mit KI gibt es zwei Rollen. Erstens kann eine KI die Auswahl der nächsten Frage steuern oder Rückmeldungen schreiben. Zweitens kann sie Aufgaben erzeugen. Für die Vergleichbarkeit ist die zweite Rolle heikel, denn neu erzeugte Aufgaben sind nicht kalibriert. Ihre Schwierigkeit lässt sich nicht einfach ablesen.

So lösen Sie es mit KI – Schritt für Schritt

So prüfen Sie ein adaptives Werkzeug, bevor Sie es für Bewertungen einsetzen. Die KI hilft dabei, Fragen zu formulieren und Antworten des Anbieters zu ordnen. Die Beurteilung machen Sie.

  1. Zweck klären. Soll das Werkzeug üben, diagnostizieren oder bewerten? Für Übung und Diagnose genügt oft weniger Nachweis als für Noten.
  2. Unterlagen anfordern. Bitten Sie den Anbieter um technische Dokumentation, Angaben zur Kalibrierung und zum Aufgabenpool sowie um die Datenschutzerklärung.
  3. Fragenkatalog erstellen. Lassen Sie die KI Fragen zu Verfahren, Aufgabenpool, Berechnung und Daten formulieren (siehe Vorlage). Verwenden Sie keine vertraulichen Anbieterunterlagen in öffentlichen KI-Diensten.
  4. Antworten einordnen. Sind sie konkret? Gibt es Angaben, wie Aufgaben eingestuft wurden? Wird auf Grenzen hingewiesen? Vage Aussagen sind ein Warnsignal.
  5. Test mit erfundenen Profilen. Lassen Sie das System mit künstlichen Antwortmustern laufen, etwa «immer richtig», «immer falsch» und «zufällig». Beobachten Sie, ob das Ergebnis nachvollziehbar bleibt.
  6. Einsatz begrenzen. Verwenden Sie das Produkt für Übung und Diagnose, nicht für Noten, bis die Vergleichbarkeit geklärt ist.
  7. Mit Schulleitung und Datenschutzstelle absprechen. Klären Sie Zuständigkeit, Verträge und Information der Eltern.
Frage an den AnbieterWarum sie wichtig ist
Wie werden Aufgaben kalibriert?Vergleichbarkeit hängt davon ab
Wie gross ist der Aufgabenpool?Aussagekraft und Sicherheit
Wie wird das Ergebnis berechnet?Nachvollziehbarkeit bei Beschwerden
Wo werden Daten gespeichert?Datenschutz
Welche Grenzen nennt der Anbieter?Ehrlichkeit

Vorlage zum Kopieren

Ich prüfe für meine Schule ein adaptives Testwerkzeug für [Fach, Stufe]. Es soll [üben / diagnostizieren / bewerten].
Erstelle einen Fragenkatalog an den Anbieter zu diesen Bereichen:
1. Verfahren: Wie wird die nächste Frage gewählt? Regelbasiert oder durch ein statistisches Modell?
2. Aufgabenpool: Grösse, Herkunft der Aufgaben, Kalibrierung, Überprüfung neuer Aufgaben (auch KI-erzeugter).
3. Ergebnis: Wie wird die Leistung berechnet? Ist sie zwischen Personen vergleichbar? Welche Genauigkeit wird angegeben?
4. Fairness: Wurden Unterschiede zwischen Gruppen untersucht? Gibt es Barrierefreiheit?
5. Daten: Welche Daten werden gespeichert, wo, wie lange, wer hat Zugriff?
6. Einsatzgrenzen: Wofür ist das Werkzeug ausdrücklich nicht geeignet?
Formuliere die Fragen so, dass konkrete Antworten verlangt werden. Gib keine Bewertung des Produkts ab.

Setzen Sie Fach, Stufe und Zweck ein. Die Antworten des Anbieters prüfen Sie selbst.

Worauf Sie achten müssen

  • Nicht für Noten verwenden, wenn unklar ist, wie gerechnet wird. Eine Note muss nachvollziehbar und anfechtbar sein. Prüfungsrecht und Rechtsmittel regeln Kantone und Institutionen; klären Sie den Einzelfall mit der Schulleitung.
  • Kalibrierung verlangen. Antworten wie «mit KI optimiert» genügen nicht. Fragen Sie nach Methode und Datenbasis.
  • KI-generierte Aufgaben nicht ungeprüft mischen. Neue Aufgaben ohne Erprobung verzerren das Ergebnis. Prüfen Sie Inhalt und Lösbarkeit, siehe Multiple-Choice-Distraktoren.
  • Fairness und Zugang. Geräte, Bedingungen und Hilfen beeinflussen die Vergleichbarkeit, siehe Fairness bei kostenpflichtigen KI-Prüfungen.
  • Datenschutz. Adaptive Systeme speichern Antworten und Leistungsdaten. Orientierung bietet das Educa-Dossier; es gelten die kantonalen Vorgaben.
  • Schwankende KI-Auswertung. Bewertet eine KI Antworten, kann dasselbe Ergebnis unterschiedlich ausfallen, siehe Wenn die KI-Bewertung schwankt.

Ein Beispiel aus der Praxis

Ein erfundenes Beispiel aus einer 8. Klasse in Wil: Frau Keller testet ein digitales Mathematikprogramm mit adaptivem Test.

Vorher: Zwei Schüler erzielen beide «80 Prozent». Der erste hat überwiegend leichte Aufgaben erhalten, der zweite schwierigere. Ein «Leistungsniveau», das der Anbieter ausweist, kann Frau Keller nicht nachvollziehen.

Nachher: Mit der KI erstellt sie einen Fragenkatalog und schickt ihn an den Anbieter. Die Antworten sind teils konkret, teils ausweichend. Ein Test mit erfundenen Profilen zeigt, dass ein «Zufallsprofil» erstaunlich hoch eingestuft wird. Sie entscheidet, das Programm für Übungen und Diagnosegespräche zu nutzen, aber nicht für die Note, und stimmt das mit der Schulleitung ab.

So hilft Ihnen Alpasana

Bevor Sie ein adaptives Werkzeug einführen, lohnt sich ein geübter Blick auf Datenschutz, Qualitätsprüfung und Einsatzregeln. Auf absofort.ch finden Sie Kurse zu konkreten Arbeitsaufgaben, in denen Sie KI an Praxisaufgaben üben und Ergebnisse mit Qualitätsprüfung und Einsatzregeln kontrollieren. Eine Beurteilung eines einzelnen Prüfprodukts leisten sie nicht; dafür braucht es die Unterlagen des Anbieters und die zuständige Stelle.

Häufige Fragen

Sind adaptive Tests genauer als normale Tests?

Bei bestimmten adaptiven Testverfahren kann die Aufgabenauswahl an bisherige Antworten angepasst werden. Ob ein Test damit vergleichbare Ergebnisse erzielt oder weniger Fragen benötigt, hängt unter anderem von Aufgabenpool, Kalibrierung und Modell ab und lässt sich nicht allgemein annehmen.

Kann ich mit KI selbst einen adaptiven Test bauen?

Als Übungsinstrument ja, etwa mit Aufgaben in zwei Schwierigkeitsstufen. Für Noten reicht das nicht, weil die Aufgaben nicht kalibriert sind und der Vergleich zwischen Lernenden unsicher bleibt.

Was ist für Prüfungen besser, ein adaptiver oder ein gewöhnlicher Test?

Für benotete Prüfungen im Unterricht ist ein gleicher Test für alle meist einfacher zu begründen. Adaptive Tests eignen sich eher für Diagnose und Übung. Auch dafür gelten die Vorgaben Ihrer Schule.

Welche Rechte haben Lernende bei einer Beschwerde?

Das richtet sich nach den geltenden kantonalen und institutionellen Regeln. Ob und in welchem Umfang Einsicht oder eine Begründung vorgesehen ist, prüfen Sie im konkreten Fall bei der zuständigen Stelle; dort erfahren Sie auch das Beschwerdeverfahren und allfällige Fristen.

Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. So arbeitet die Redaktion · Fehler entdeckt? Melden Sie es uns.

Quellen

Weiterlesen in der Galaxie