Zum Inhalt springen

KI im Unternehmen · KI-Beratung und digitale Transformation

Wie messen wir die Fehlerquote einer KI-Anwendung?

Stand 10.10.2026 · 5 Min. Lesezeit

Kurz gesagt

Ziehen Sie regelmässig eine Stichprobe von KI-Ergebnissen, prüfen Sie sie anhand fester Kriterien und ordnen Sie Fehler nach Art und Schwere. Die reine Anzahl sagt wenig: Ein falscher Betrag in einer Offerte wiegt schwerer als eine holprige Formulierung.

Das Problem

Ihr Team nutzt KI, um Texte, Zusammenfassungen oder Auswertungen zu erstellen. Meistens passt das Ergebnis, manchmal nicht. Wie oft ist «manchmal»? Und welche Fehler sind harmlos, welche gefährlich? Solange Sie nur das Gefühl haben, dass es meistens klappt, können Sie das weder der Geschäftsleitung noch Kundinnen gegenüber belegen.

Fehler zu zählen reicht auch nicht. Zehn Tippfehler in einem internen Entwurf bedeuten etwas anderes als ein einziger falscher Betrag in einer Rechnung an einen Kunden. Eine brauchbare Messung beantwortet drei Fragen: Wie oft passieren Fehler? Welcher Art sind sie? Wie schwer wiegen sie?

Das lässt sich in einem kleinen Betrieb ohne Statistikkenntnisse machen. Sie brauchen eine Stichprobe, eine Liste von Fehlerarten und etwas Disziplin.

So lösen Sie es mit KI – Schritt für Schritt

  1. Festlegen, was ein Fehler ist. Schreiben Sie auf, was als Fehler zählt: falsche Zahl, falscher Name, erfundene Angabe, falsche Anrede, fehlende Pflichtangabe, unpassender Ton. Ohne klare Definition zählt jede Person anders.
  1. Fehlerarten gruppieren. Bilden Sie wenige Gruppen, etwa Fakten (Zahlen, Namen), Inhalt (fehlt oder überflüssig), Ton und Form, Regelverstoss (verbotene Angaben). Fünf bis sechs Gruppen reichen.
  1. Die Schwere einstufen. Legen Sie drei Stufen fest: leicht (stört kaum, schnell korrigiert), mittel (würde Rückfragen auslösen), schwer (Schaden oder Haftung möglich). Für jede Stufe ein Beispiel aus Ihrem Alltag.
  1. Eine Stichprobe ziehen. Wählen Sie zufällig zehn bis dreissig Ergebnisse pro Woche oder Monat. «Zufällig» heisst: nicht nur die guten oder die auffälligen. Siehe Kleine Stichproben auswerten.
  1. Jedes Ergebnis prüfen und eintragen. Eine Person prüft, eine zweite kontrolliert Stichproben der Prüfung. Tragen Sie in eine Tabelle ein: Datum, Aufgabe, Fehler ja/nein, Art, Schwere. Mehr zu zwei Augen: Vier-Augen-Prüfung.
  1. Auswerten und einordnen. Rechnen Sie: Anteil Ergebnisse mit mindestens einem Fehler, Anteil schwerer Fehler, häufigste Fehlerart. Vergleichen Sie mit den Ausgangswerten von früher, siehe Ausgangswerte erfassen.
  1. Mit KI die Auswertung unterstützen. Öffnen Sie einen erlaubten KI-Assistenten, also ein Programm, dem Sie schriftlich Aufgaben geben. Lassen Sie sich Tabelle und Auswertungshilfe erstellen und Muster in Ihren Fehlerbeschreibungen ordnen. Verwenden Sie nur anonymisierte Beschreibungen. Rechnen Sie wichtige Zahlen selbst nach.
  1. Ursachen angehen. Fragen Sie: Liegt es an der Anweisung, an den Daten, am Modell oder an der Aufgabe? Passen Sie Anweisung oder Prüfschritt an und messen Sie erneut. Fehler, die immer wieder schwer sind, sprechen gegen den Einsatz in dieser Aufgabe.
SchwereBeispielReaktion
LeichtHolpriger SatzBeim nächsten Mal Anweisung verbessern
MittelFalsche Anrede in KundenmailPrüfschritt verstärken
SchwerFalscher Betrag in OfferteSofort korrigieren, Prozess anpassen
KritischVertrauliche Angabe preisgegebenVorfallplan auslösen

Vorlage zum Kopieren

Ich möchte die Fehlerquote unserer KI-Anwendung messen.
Aufgabe der Anwendung: [z. B. Kundenmails beantworten].
Was bei uns als Fehler zählt: [Stichworte, z. B. falsche Zahl, falsche Anrede, erfundene Angabe].
Schweregrade: [leicht / mittel / schwer mit je einem Beispiel].
Geplante Stichprobe: [Anzahl pro Woche oder Monat].
Bitte erstelle mir:
1. eine Erfassungstabelle mit Spalten für Datum, Aufgabe, Fehler ja/nein, Fehlerart, Schwere, Bemerkung,
2. eine Anleitung, wie ich die Auswertung rechne (Anteil mit Fehler, Anteil schwerer Fehler, häufigste Art),
3. fünf Fragen, mit denen ich Ursachen der häufigsten Fehler suche.
Erfinde keine Messwerte und rechne nur mit den Zahlen, die ich später einsetze.

Passen Sie Fehlerarten und Schweregrade an Ihren Betrieb an.

Worauf Sie achten müssen

  • Kleine Stichproben schwanken. Bei zehn Ergebnissen kann ein Fehler mehr oder weniger viel ausmachen. Lesen Sie Zahlen vorsichtig und messen Sie über mehrere Wochen.
  • Prüfer sind nicht fehlerfrei. Auch Menschen übersehen Fehler. Eine zweite Person für Stichproben erhöht die Zuverlässigkeit.
  • Keine Schuldzuweisung. Fehlermessung soll Prozesse verbessern, nicht Personen bewerten. Besprechen Sie Ergebnisse sachlich.
  • Vertraulichkeit. Beschreiben Sie Fehler ohne Kundennamen und ohne echte Daten, wenn Sie diese mit KI auswerten.
  • Grenzen akzeptieren. Bei Aufgaben mit hohem Schadensrisiko, etwa Preise, Verträge, Gesundheitsangaben, bleibt eine menschliche Prüfung auch bei niedriger Fehlerquote nötig. Siehe Ergebnisqualität bewerten.

Ein Beispiel aus der Praxis

Ein erfundenes Beispiel: Ein Reisebüro in Baden lässt Reiseempfehlungen mit KI vorformulieren. Frau Müller prüft pro Woche 15 Texte. Nach einem Monat zeigt die Tabelle: Bei 12 von 60 Texten gab es Fehler, die meisten leicht (Ton). Aber dreimal stimmte eine Öffnungszeit nicht, ein mittlerer Fehler.

Mit dieser Auswertung ändert sie die Anweisung: «Öffnungszeiten nur aus der Quelle übernehmen, sonst weglassen.» Im nächsten Monat sinken die Fehler bei Fakten deutlich. Die Geschäftsleitung bekommt eine Tabelle statt eines Gefühls.

So hilft Ihnen Alpasana

Die KI-Beratung und digitale Transformation von Alpasana umfasst laut Leistungsbeschreibung das Integrieren von KI-Agenten mit Anwendungsfall, Pilot, Einsatzregeln und Skalierung sowie die Dokumentation der Umsetzung. Dazu gehört, Qualität im Pilot messbar zu machen.

Alpasana kann den Aufbau begleiten, die laufende Messung im Alltag liegt bei Ihrem Betrieb.

Häufige Fragen

Welche Fehlerquote ist akzeptabel?

Das hängt von der Aufgabe ab. Bei internen Entwürfen mit Prüfung kann sie höher sein als bei Texten, die ungeprüft an Kunden gehen. Legen Sie die Schwelle vorab fest.

Wie viele Ergebnisse muss ich prüfen?

Für den Anfang genügen zehn bis dreissig pro Woche. Bei kritischen Aufgaben prüfen Sie alles, bis die Qualität stabil ist.

Zählt Nacharbeit auch als Fehler?

Ja, als Hinweis auf Qualität. Erfassen Sie Nacharbeitszeit zusätzlich, siehe Nachbearbeitungszeit erfassen.

Kann KI ihre eigenen Fehler zählen?

Nur eingeschränkt. Sie kann Muster beschreiben, aber nicht verlässlich beurteilen, ob sie selbst richtig lag. Die Prüfung bleibt Menschensache.

Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. So arbeitet die Redaktion · Fehler entdeckt? Melden Sie es uns.

Weiterlesen in der Galaxie