Zum Inhalt springen

Eigene LLMs & KI-Systeme · KI-Weiterbildung für Unternehmen

Vorlage: KI-Antworten nach festen Kriterien bewerten

Stand 10.10.2026 · 4 Min. Lesezeit

Kurz gesagt

Ein Bewertungsraster legt fest, nach welchen Kriterien jede KI-Antwort beurteilt wird, etwa Richtigkeit, Vollständigkeit, Verständlichkeit und Quellenangabe, und was dabei «gut», «teilweise» oder «ungenügend» heisst. So bewerten alle im Team gleich und Ergebnisse lassen sich vergleichen.

Das Problem

Drei Personen im Team lesen dieselbe KI-Antwort. Die erste sagt: «Super, genau so.» Die zweite: «Viel zu lang.» Die dritte: «Stimmt nicht, da fehlt die Frist.» Alle haben etwas Berechtigtes gesagt, aber sie haben nicht dasselbe bewertet. Eine Entscheidung, ob die KI für den Einsatz taugt, lässt sich so nicht treffen.

Frau Müller koordiniert in ihrer Firma die Einführung eines KI-Assistenten und erlebt genau das. Jede Person hat ein eigenes Gefühl für «gut». Gespräche darüber gehen im Kreis.

Ein Bewertungsraster schafft Abhilfe. Es ist eine kurze Liste von Kriterien mit klaren Stufen. Fachleute sagen auch «Rubrik» dazu. Es sorgt dafür, dass alle dasselbe prüfen, und es macht Ergebnisse über Wochen und zwischen Modellen vergleichbar. Die Fragen dazu liefert der Prüfkatalog.

So lösen Sie es mit KI – Schritt für Schritt

  1. Kriterien wählen. Beginnen Sie mit vier bis fünf. Bewährt haben sich: Richtigkeit, Vollständigkeit, Verständlichkeit, Quellenbezug und Angemessenheit (Ton, Länge).
  1. Stufen beschreiben. Definieren Sie pro Kriterium drei Stufen in Worten. Zum Beispiel bei Richtigkeit: «stimmt», «kleiner Fehler ohne Folgen», «falsch oder irreführend».
  1. Ausschlusskriterien festlegen. Bestimmte Fehler machen eine Antwort unabhängig vom Rest unbrauchbar: erfundene Fakten, falsche Fristen oder Preise, vertrauliche Inhalte.
  1. Gemeinsam eichen. Bewerten Sie zu zweit oder zu dritt je fünf Antworten einzeln, dann vergleichen Sie. Wo Sie abweichen, schärfen Sie die Stufenbeschreibung.
  1. Pro Antwort bewerten. Eine Person bewertet nach dem Raster und notiert bei Abweichung eine Begründung in einem Satz.
  1. Auswerten. Zählen Sie, wie oft jede Stufe vorkommt, getrennt nach Frageart. Achten Sie auf Schwachstellen, nicht nur auf den Durchschnitt.
  1. Stichprobe doppelt prüfen. Lassen Sie ein Zehntel der Antworten von einer zweiten Person bewerten, um zu sehen, ob das Raster verständlich ist.
  1. Raster überarbeiten. Nach den ersten Läufen streichen Sie Kriterien, die nichts unterscheiden, und ergänzen, was gefehlt hat.

Vorlage zum Kopieren

Kriterium2 = gut1 = teilweise0 = ungenügend
RichtigkeitAlle Angaben stimmen mit der QuelleKleiner Fehler ohne FolgenFalsche oder erfundene Angabe
VollständigkeitAlle wichtigen Punkte genanntWichtiger Punkt fehltAntwort verfehlt die Frage
VerständlichkeitKlar, kurz, ohne FachspracheVerständlich, aber umständlichUnklar oder widersprüchlich
QuellenbezugFundstelle genannt und passendFundstelle unklarKeine oder falsche Quelle
AngemessenheitTon und Länge passenEtwas zu lang oder zu knappUnpassender Ton, Zusagen ohne Grundlage

Ausschluss: Eine erfundene Angabe oder Weitergabe vertraulicher Inhalte bedeutet immer «ungenügend», egal wie die übrigen Kriterien ausfallen.

Dieser Prompt hilft, ein Raster auf Ihren Anwendungsfall zuzuschneiden:

Wir bewerten die Antworten eines internen KI-Assistenten für [Abteilung, z. B. Kundendienst eines Handwerksbetriebs]. Typische Fragen: [Beispiele].
Entwirf ein Bewertungsraster mit fünf Kriterien und je drei Stufen (gut, teilweise, ungenügend). Beschreibe jede Stufe in einem Satz so konkret, dass zwei Personen gleich urteilen. Nenne zusätzlich drei Ausschlusskriterien, die eine Antwort unabhängig vom Rest unbrauchbar machen.

Prüfen Sie den Entwurf mit Ihrem Team an echten Antworten und passen Sie ihn an.

Worauf Sie achten müssen

  • Raster nicht überladen. Mehr als fünf Kriterien ermüden und liefern keine besseren Erkenntnisse.
  • Richtigkeit zuerst. Eine gut formulierte falsche Antwort ist gefährlicher als eine holprige richtige. Gewichten Sie Richtigkeit entsprechend, oder machen Sie sie zum Ausschlusskriterium.
  • Bewertende kennen die Quelle. Wer nicht weiss, was stimmt, kann Richtigkeit nicht beurteilen. Eine Fachperson muss mitbewerten, besonders bei Recht, Preisen, Medizin.
  • Eine KI als Bewerterin kann helfen, ersetzt aber nicht die menschliche Prüfung, siehe KI bewertet KI.
  • Datenschutz. Bewertungslisten enthalten oft Antworttexte mit Firmeninformationen. Speichern Sie sie dort, wo auch die Originale liegen dürften.
  • Bewertung ist keine Wissenschaft. Ein Raster macht Urteile vergleichbar, nicht objektiv. Unsicherheiten bleiben.

Ein Beispiel aus der Praxis

Ein Beispiel: Eine Hausverwaltung in Baden prüft einen Assistenten für Mieterfragen. Vorher diskutiert die Runde stundenlang, ob die Antworten «gut genug» sind. Nachher bewertet Frau Müller mit zwei Kolleginnen vierzig Antworten nach einem Raster aus fünf Kriterien. Das Ergebnis: Verständlichkeit und Ton sind meist gut, die Richtigkeit bei Fragen zur Nebenkostenabrechnung ist schwach. Das Team nimmt diese Frageart vorerst aus dem Assistenten heraus und leitet sie an die Sachbearbeitung weiter.

So hilft Ihnen Alpasana

Wer ein Bewertungsraster im Team einführt, lernt zugleich, KI-Ergebnisse kritisch zu prüfen. Die Online-Weiterbildung KI für Unternehmen von absofort behandelt nach Angebotsbeschreibung KI für Verwaltung, Kommunikation, Analyse und Texte sowie den sorgfältigen Umgang mit Ergebnissen und Daten. Für Firmenlösungen und Teambuchungen gibt es eine Kontaktmöglichkeit.

Das Lernen im eigenen Tempo erleichtert es, Mitarbeitende mit unterschiedlichem Vorwissen mitzunehmen.

Häufige Fragen

Soll ich Punkte vergeben oder Worte wie «gut» verwenden?

Beides geht. Punkte (0, 1, 2) lassen sich leichter zählen. Wichtig sind klare Beschreibungen, nicht die Skala.

Wer sollte bewerten?

Menschen, die die richtige Antwort kennen. Ideal sind zwei Personen aus der Fachabteilung, ergänzt durch jemanden, der die Nutzersicht vertritt.

Wie oft muss das Raster überarbeitet werden?

Nach den ersten Läufen und danach bei Änderungen des Einsatzzwecks. Sonst bleibt es stabil, damit Vergleiche über Zeit möglich sind.

Taugt das Raster auch für Quellenprüfungen?

Als Ausgangspunkt ja. Für die Frage, ob eine Quelle die Antwort wirklich belegt, brauchen Sie die genauere Methode unter Quellentreue prüfen.

Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. So arbeitet die Redaktion · Fehler entdeckt? Melden Sie es uns.

Weiterlesen in der Galaxie