Zum Inhalt springen

KI im Unternehmen · KI-Beratung und digitale Transformation

KI-Ergebnisse bewerten: Vorlage für ein Qualitätsraster

Stand 10.10.2026 · 5 Min. Lesezeit

Kurz gesagt

Ein Qualitätsraster ist eine kleine Tabelle mit vier bis sechs Kriterien, etwa Richtigkeit, Vollständigkeit, Verständlichkeit, Ton und Regelkonformität, die mit einer einfachen Skala bewertet werden. So beurteilen mehrere Personen KI-Ergebnisse nach denselben Massstäben statt nach Bauchgefühl.

Das Problem

Im Team entsteht Streit: Die einen finden die KI-Texte «ganz ordentlich», die anderen «unbrauchbar». Beide haben recht, weil sie unterschiedliche Massstäbe anlegen. Die eine achtet auf Rechtschreibung, der andere auf Fakten, die dritte auf den Ton gegenüber Kundschaft.

Ohne gemeinsame Kriterien lassen sich Ergebnisse nicht vergleichen, und niemand kann sagen, ob sich die Qualität durch bessere Anweisungen oder ein neues Werkzeug verbessert hat. Auch Entscheidungen, ob eine Anwendung weitergeführt werden soll, beruhen dann auf Meinungen.

Ein Qualitätsraster löst das Problem. Es ist eine kurze Liste von Kriterien mit einer einfachen Skala, die alle Beteiligten gleich anwenden. Es braucht keine Fachsprache und kein Programm, nur eine Seite Papier oder eine Tabelle.

So lösen Sie es mit KI – Schritt für Schritt

  1. Legen Sie den Zweck fest. Wofür bewerten Sie: Auswahl eines Werkzeugs, Verbesserung von Anweisungen, laufende Kontrolle oder Entscheid über Weiterführung? Der Zweck bestimmt, wie genau das Raster sein muss.
  2. Wählen Sie vier bis sechs Kriterien. Mehr überfordert. Typisch: Richtigkeit (stimmen Fakten und Zahlen?), Vollständigkeit (fehlt Wichtiges?), Verständlichkeit, Ton und Stil, Regelkonformität (Datenschutz, Vorgaben), Brauchbarkeit ohne Korrektur.
  3. Beschreiben Sie die Skala. Zum Beispiel 1 bis 4: 1 unbrauchbar, 2 deutliche Korrektur nötig, 3 kleine Korrektur, 4 direkt verwendbar. Schreiben Sie für jedes Kriterium kurz auf, was eine 1 und eine 4 bedeutet.
  4. Erstellen Sie ein Beispiel-Set. Sammeln Sie fünf bis zehn typische Ergebnisse, gute und schlechte, mit erfundenen oder anonymisierten Daten. Bewerten Sie sie gemeinsam, um das Raster zu eichen.
  5. Lassen Sie zwei Personen unabhängig bewerten. Vergleichen Sie die Ergebnisse. Grosse Abweichungen zeigen, dass ein Kriterium unklar beschrieben ist. Schärfen Sie die Beschreibung nach.
  6. Wenden Sie das Raster regelmässig an. Zum Beispiel zehn Stichproben pro Monat. Notieren Sie die Werte in einer Tabelle und beobachten Sie die Entwicklung. Siehe Qualität langfristig überwachen.
  7. Ziehen Sie Folgerungen. Wo sind die Werte schwach? Bessere Anweisung, bessere Unterlagen, mehr Prüfung oder eine andere Aufgabe? Ändern Sie eine Sache auf einmal, damit Sie die Wirkung erkennen.

Vorlage zum Kopieren

Mit einer KI können Sie ein Raster für Ihre Aufgabe entwerfen. Bewerten Sie damit aber selbst und lassen Sie nicht die KI ihre eigenen Texte bewerten:

Wir bewerten KI-Ergebnisse für die Aufgabe [Aufgabe] in einem Schweizer KMU der Branche [Branche].
Erstelle ein Qualitätsraster mit fünf Kriterien (zum Beispiel Richtigkeit, Vollständigkeit,
Verständlichkeit, Ton, Regelkonformität), jeweils mit einer Skala von 1 bis 4.
Beschreibe zu jedem Kriterium in einem Satz, was 1 und was 4 bedeutet,
und nenne zwei typische Fehler, auf die man achten sollte.
Füge eine Bewertungstabelle mit den Spalten «Fall | K1 | K2 | K3 | K4 | K5 | Bemerkung | Gesamteindruck» bei.
Nenne keine Normen und keine Benchmarks.

Passen Sie Kriterien und Skalenbeschreibungen an Ihre Regeln an und besprechen Sie sie im Team.

Beispiel für ein Raster

Kriterium1 (schwach)4 (sehr gut)
RichtigkeitMehrere falsche AngabenAlle Angaben geprüft und korrekt
VollständigkeitWichtiges fehltAlle nötigen Punkte enthalten
VerständlichkeitSchwer lesbarKlar, kurz, für Zielperson passend
TonUnpassend zur KundschaftFreundlich und sachlich, wie unsere Vorgabe
RegelkonformitätVerstösst gegen interne RegelnEntspricht Datenschutz- und Freigaberegeln

Worauf Sie achten müssen

  • Keine KI als alleinige Prüferin. Eine KI kann ihre eigene Ausgabe falsch bewerten oder Fehler übersehen. Die Bewertung durch Menschen ist massgebend, besonders bei Richtigkeit.
  • Richtigkeit zuerst prüfen. Ein schön formulierter, aber falscher Text ist schlimmer als ein holpriger, aber korrekter. Prüfen Sie Fakten und Zahlen an Originalquellen. Siehe KI-Ergebnisse mit Vier-Augen-Prinzip prüfen.
  • Stichproben statt Dauerkontrolle. Alles zu bewerten, ist nicht machbar. Ziehen Sie Stichproben, bei kritischen Anwendungen mit grösserer Häufigkeit.
  • Raster aktualisieren. Wenn sich Aufgaben oder Regeln ändern, passen Sie das Raster an. Ein veraltetes Raster misst das Falsche.
  • Datenschutz beachten. Verwenden Sie für Beispiele erfundene oder anonymisierte Texte, und beschränken Sie den Zugriff auf die Bewertungen. Die Bewertung gilt der Anwendung, nicht Personen, siehe Fehlerquote messen.

Wie viele Bewertungen brauche ich?

Für einen ersten Eindruck genügen zehn Fälle, für verlässlichere Aussagen mehr, abhängig von der Schwankung der Ergebnisse. Bei kleinen Zahlen sind Aussagen vorsichtig zu formulieren. Hinweise bietet Kleine Stichproben auswerten. Beginnen Sie klein und erweitern Sie, wenn das Raster sich bewährt hat.

Ein Beispiel aus der Praxis

Ein erfundenes Beispiel: In einer Spedition bei Pratteln nutzt das Büro KI für Antworten auf Kundenanfragen. Frau Müller aus der Disposition sagt, die Antworten seien gut, ihr Kollege findet sie zu steif. Der Chef will wissen, ob sich das Werkzeug lohnt.

Vorher stand Meinung gegen Meinung. Nachher erstellen beide ein Raster mit fünf Kriterien und bewerten je zwölf Antworten unabhängig voneinander. Richtigkeit und Vollständigkeit sind gut, beim Ton gibt es Schwächen. Sie ergänzen die Anweisung um einen Beispielton und bewerten einen Monat später erneut. Der Ton verbessert sich.

So hilft Ihnen Alpasana

Alpasana unterstützt bei KI-Beratung und digitaler Transformation: Prozesse aufnehmen, KI-Agenten mit Anwendungsfall, Pilot und Einsatzregeln integrieren und die Umsetzung dokumentieren. Qualitätskriterien und Prüfregeln gehören zu einem sauberen Pilot.

Das Raster für Ihre Aufgaben legen Sie mit Ihrem Team fest. Projekte werden individuell offeriert.

Häufige Fragen

Kann die KI selbst bewerten?

Sie kann Hinweise geben, aber nicht verlässlich beurteilen, ob ihr eigener Text stimmt. Lassen Sie wichtige Ergebnisse von Menschen prüfen.

Wie streng sollen die Kriterien sein?

So, dass sie zur Aufgabe passen. Ein Entwurf für interne Notizen braucht ein weniger strenges Raster als ein Kundenschreiben. Legen Sie fest, ab welcher Bewertung ein Ergebnis freigegeben wird.

Brauche ich für jede Aufgabe ein eigenes Raster?

Ein Grundraster mit angepassten Beschreibungen genügt oft. Passen Sie die Beispiele an die jeweilige Aufgabe an.

Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.

Weiterlesen in der Galaxie