Prüfen & Bewerten · KI und IT für konkrete Arbeitsaufgaben
Adaptive KI-Tests: Wie bleiben Ergebnisse vergleichbar?
Kurz gesagt
Ein adaptiver Test wählt die nächste Frage nach den bisherigen Antworten. Vergleichbar bleiben die Ergebnisse nur, wenn die Aufgaben aufwendig kalibriert sind und das Verfahren dokumentiert ist. Für benotete Prüfungen ist das selten gegeben; KI-erzeugte Aufgaben allein genügen nicht.
Das Problem
Anbieter von Lernsoftware werben mit «adaptiven KI-Tests»: Das Programm passe die Fragen automatisch an und ermittle so die Leistung «ganz genau». Frau Keller findet das attraktiv, denn so könnte sie Zeit sparen. Doch sie fragt sich: Wenn zwei Lernende unterschiedliche Fragen erhalten, wie kann ich ihre Ergebnisse vergleichen? Und darf ich so etwas für eine Note verwenden?
Die Frage ist berechtigt. Bei einem gewöhnlichen Test beantworten alle dieselben Aufgaben, und die Zahl der richtigen Antworten ist vergleichbar. Bei einem adaptiven Test gilt das nicht mehr. Ein Kind, das nur leichte Aufgaben erhält, kann viele richtig haben und trotzdem weniger können als ein Kind, das schwierigere Aufgaben nur teilweise löst. Die Prozentzahl allein sagt dann wenig.
Dieser Beitrag erklärt, wie adaptive Tests funktionieren, was für die Vergleichbarkeit nötig ist und wie Sie ein Produkt kritisch prüfen. Er gibt keine Empfehlung für oder gegen ein bestimmtes Produkt.
Einfach erklärt
Ein adaptiver Test passt sich der getesteten Person an. Wer eine Frage richtig beantwortet, erhält als Nächstes eine schwierigere, wer sie falsch beantwortet, eine leichtere. Dadurch braucht der Test oft weniger Fragen, um den Leistungsstand einzuschätzen, und niemand wird mit Aufgaben gelangweilt oder überfordert. In der Fachsprache heisst das Computerized Adaptive Testing (CAT). Das Verfahren stammt aus der Testtheorie und wird seit Langem etwa für Einstufungstests eingesetzt.
Das Ergebnis ist nicht einfach die Zahl der richtigen Antworten. Weil unterschiedliche Personen unterschiedliche Fragen erhalten, lässt sich die Leistung nur vergleichen, wenn alle Aufgaben vorher auf einer gemeinsamen Skala eingestuft wurden. Dafür braucht es einen grossen Aufgabenpool, der an vielen Testpersonen erprobt und statistisch kalibriert wurde. Ein Modell, meist aus der Item-Response-Theorie, schätzt aus den Antworten, wie leistungsstark eine Person ist.
Mit KI gibt es zwei Rollen. Erstens kann eine KI die Auswahl der nächsten Frage steuern oder Rückmeldungen schreiben. Zweitens kann sie Aufgaben erzeugen. Für die Vergleichbarkeit ist die zweite Rolle heikel, denn neu erzeugte Aufgaben sind nicht kalibriert. Ihre Schwierigkeit lässt sich nicht einfach ablesen.
So lösen Sie es mit KI – Schritt für Schritt
So prüfen Sie ein adaptives Werkzeug, bevor Sie es für Bewertungen einsetzen. Die KI hilft dabei, Fragen zu formulieren und Antworten des Anbieters zu ordnen. Die Beurteilung machen Sie.
- Zweck klären. Soll das Werkzeug üben, diagnostizieren oder bewerten? Für Übung und Diagnose genügt oft weniger Nachweis als für Noten.
- Unterlagen anfordern. Bitten Sie den Anbieter um technische Dokumentation, Angaben zur Kalibrierung und zum Aufgabenpool sowie um die Datenschutzerklärung.
- Fragenkatalog erstellen. Lassen Sie die KI Fragen zu Verfahren, Aufgabenpool, Berechnung und Daten formulieren (siehe Vorlage). Verwenden Sie keine vertraulichen Anbieterunterlagen in öffentlichen KI-Diensten.
- Antworten einordnen. Sind sie konkret? Gibt es Angaben, wie Aufgaben eingestuft wurden? Wird auf Grenzen hingewiesen? Vage Aussagen sind ein Warnsignal.
- Test mit erfundenen Profilen. Lassen Sie das System mit künstlichen Antwortmustern laufen, etwa «immer richtig», «immer falsch» und «zufällig». Beobachten Sie, ob das Ergebnis nachvollziehbar bleibt.
- Einsatz begrenzen. Verwenden Sie das Produkt für Übung und Diagnose, nicht für Noten, bis die Vergleichbarkeit geklärt ist.
- Mit Schulleitung und Datenschutzstelle absprechen. Klären Sie Zuständigkeit, Verträge und Information der Eltern.
| Frage an den Anbieter | Warum sie wichtig ist |
|---|---|
| Wie werden Aufgaben kalibriert? | Vergleichbarkeit hängt davon ab |
| Wie gross ist der Aufgabenpool? | Aussagekraft und Sicherheit |
| Wie wird das Ergebnis berechnet? | Nachvollziehbarkeit bei Beschwerden |
| Wo werden Daten gespeichert? | Datenschutz |
| Welche Grenzen nennt der Anbieter? | Ehrlichkeit |
Vorlage zum Kopieren
Ich prüfe für meine Schule ein adaptives Testwerkzeug für [Fach, Stufe]. Es soll [üben / diagnostizieren / bewerten].
Erstelle einen Fragenkatalog an den Anbieter zu diesen Bereichen:
1. Verfahren: Wie wird die nächste Frage gewählt? Regelbasiert oder durch ein statistisches Modell?
2. Aufgabenpool: Grösse, Herkunft der Aufgaben, Kalibrierung, Überprüfung neuer Aufgaben (auch KI-erzeugter).
3. Ergebnis: Wie wird die Leistung berechnet? Ist sie zwischen Personen vergleichbar? Welche Genauigkeit wird angegeben?
4. Fairness: Wurden Unterschiede zwischen Gruppen untersucht? Gibt es Barrierefreiheit?
5. Daten: Welche Daten werden gespeichert, wo, wie lange, wer hat Zugriff?
6. Einsatzgrenzen: Wofür ist das Werkzeug ausdrücklich nicht geeignet?
Formuliere die Fragen so, dass konkrete Antworten verlangt werden. Gib keine Bewertung des Produkts ab.Setzen Sie Fach, Stufe und Zweck ein. Die Antworten des Anbieters prüfen Sie selbst.
Worauf Sie achten müssen
- Nicht für Noten verwenden, wenn unklar ist, wie gerechnet wird. Eine Note muss nachvollziehbar und anfechtbar sein. Prüfungsrecht und Rechtsmittel regeln Kantone und Institutionen; klären Sie den Einzelfall mit der Schulleitung.
- Kalibrierung verlangen. Antworten wie «mit KI optimiert» genügen nicht. Fragen Sie nach Methode und Datenbasis.
- KI-generierte Aufgaben nicht ungeprüft mischen. Neue Aufgaben ohne Erprobung verzerren das Ergebnis. Prüfen Sie Inhalt und Lösbarkeit, siehe Multiple-Choice-Distraktoren.
- Fairness und Zugang. Geräte, Bedingungen und Hilfen beeinflussen die Vergleichbarkeit, siehe Fairness bei kostenpflichtigen KI-Prüfungen.
- Datenschutz. Adaptive Systeme speichern Antworten und Leistungsdaten. Orientierung bietet das Educa-Dossier; es gelten die kantonalen Vorgaben.
- Schwankende KI-Auswertung. Bewertet eine KI Antworten, kann dasselbe Ergebnis unterschiedlich ausfallen, siehe Wenn die KI-Bewertung schwankt.
Ein Beispiel aus der Praxis
Ein erfundenes Beispiel aus einer 8. Klasse in Wil: Frau Keller testet ein digitales Mathematikprogramm mit adaptivem Test.
Vorher: Zwei Schüler erzielen beide «80 Prozent». Der erste hat überwiegend leichte Aufgaben erhalten, der zweite schwierigere. Ein «Leistungsniveau», das der Anbieter ausweist, kann Frau Keller nicht nachvollziehen.
Nachher: Mit der KI erstellt sie einen Fragenkatalog und schickt ihn an den Anbieter. Die Antworten sind teils konkret, teils ausweichend. Ein Test mit erfundenen Profilen zeigt, dass ein «Zufallsprofil» erstaunlich hoch eingestuft wird. Sie entscheidet, das Programm für Übungen und Diagnosegespräche zu nutzen, aber nicht für die Note, und stimmt das mit der Schulleitung ab.
So hilft Ihnen Alpasana
Bevor Sie ein adaptives Werkzeug einführen, lohnt sich ein geübter Blick auf Datenschutz, Qualitätsprüfung und Einsatzregeln. Auf absofort.ch finden Sie Kurse zu konkreten Arbeitsaufgaben, in denen Sie KI an Praxisaufgaben üben und Ergebnisse mit Qualitätsprüfung und Einsatzregeln kontrollieren. Eine Beurteilung eines einzelnen Prüfprodukts leisten sie nicht; dafür braucht es die Unterlagen des Anbieters und die zuständige Stelle.
Häufige Fragen
Sind adaptive Tests genauer als normale Tests?
Bei bestimmten adaptiven Testverfahren kann die Aufgabenauswahl an bisherige Antworten angepasst werden. Ob ein Test damit vergleichbare Ergebnisse erzielt oder weniger Fragen benötigt, hängt unter anderem von Aufgabenpool, Kalibrierung und Modell ab und lässt sich nicht allgemein annehmen.
Kann ich mit KI selbst einen adaptiven Test bauen?
Als Übungsinstrument ja, etwa mit Aufgaben in zwei Schwierigkeitsstufen. Für Noten reicht das nicht, weil die Aufgaben nicht kalibriert sind und der Vergleich zwischen Lernenden unsicher bleibt.
Was ist für Prüfungen besser, ein adaptiver oder ein gewöhnlicher Test?
Für benotete Prüfungen im Unterricht ist ein gleicher Test für alle meist einfacher zu begründen. Adaptive Tests eignen sich eher für Diagnose und Übung. Auch dafür gelten die Vorgaben Ihrer Schule.
Welche Rechte haben Lernende bei einer Beschwerde?
Das richtet sich nach den geltenden kantonalen und institutionellen Regeln. Ob und in welchem Umfang Einsicht oder eine Begründung vorgesehen ist, prüfen Sie im konkreten Fall bei der zuständigen Stelle; dort erfahren Sie auch das Beschwerdeverfahren und allfällige Fristen.
Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. So arbeitet die Redaktion · Fehler entdeckt? Melden Sie es uns.
Quellen
Weiterlesen in der Galaxie
- Multiple Choice: Plausible falsche Antworten mit KI entwerfenMultiple Choice Distraktoren KI: Entwickeln Sie plausible falsche Antworten, prüfen Sie Denkfehler und entfernen Sie sprachliche Lösungshinweise.
- Nachprüfung: Gleichwertige Aufgaben mit KI entwickelnNachprüfung Aufgaben KI: Neue Fälle entwerfen, Lernziele und Lösungswege vergleichen und Anforderungen mit einer Vorlage nachvollziehbar abstimmen.
- Warum bewertet KI dieselbe Prüfungsantwort unterschiedlich?KI Bewertung unterschiedliche Ergebnisse: Schwankende Vorschläge gezielt vergleichen, Kriterien schärfen und die Grenzen automatischer Urteile verstehen.
- Prüfung mit KI: Nachteile durch Bezahlzugänge vermeidenKI Prüfung Chancengleichheit: Prüfen Sie Zugangsszenarien, vermeiden Sie private Bezahlpflichten und planen Sie verständliche Prüfungsbedingungen.
- Programmierprüfung mit KI: Verständnis und Tests bewertenProgrammierprüfung KI Bewertung: Codeverständnis, Testfälle und Fehleranalyse mit klaren Kriterien prüfen und fachliche Eigenleistung sichtbar machen.
- Kostenlose KI-Plagiat-Scanner: Tools vergleichenKostenlose KI-Plagiat-Scanner vergleichen: Unterscheiden Sie Plagiatsprüfung und KI-Erkennung und testen Sie Angebote mit einem eigenen Dokument.