KI im Unternehmen · KI-Beratung und digitale Transformation
Wie messen wir die Fehlerquote einer KI-Anwendung?
Kurz gesagt
Ziehen Sie regelmässig eine Stichprobe von KI-Ergebnissen, prüfen Sie sie anhand fester Kriterien und ordnen Sie Fehler nach Art und Schwere. Die reine Anzahl sagt wenig: Ein falscher Betrag in einer Offerte wiegt schwerer als eine holprige Formulierung.
Das Problem
Ihr Team nutzt KI, um Texte, Zusammenfassungen oder Auswertungen zu erstellen. Meistens passt das Ergebnis, manchmal nicht. Wie oft ist «manchmal»? Und welche Fehler sind harmlos, welche gefährlich? Solange Sie nur das Gefühl haben, dass es meistens klappt, können Sie das weder der Geschäftsleitung noch Kundinnen gegenüber belegen.
Fehler zu zählen reicht auch nicht. Zehn Tippfehler in einem internen Entwurf bedeuten etwas anderes als ein einziger falscher Betrag in einer Rechnung an einen Kunden. Eine brauchbare Messung beantwortet drei Fragen: Wie oft passieren Fehler? Welcher Art sind sie? Wie schwer wiegen sie?
Das lässt sich in einem kleinen Betrieb ohne Statistikkenntnisse machen. Sie brauchen eine Stichprobe, eine Liste von Fehlerarten und etwas Disziplin.
So lösen Sie es mit KI – Schritt für Schritt
- Festlegen, was ein Fehler ist. Schreiben Sie auf, was als Fehler zählt: falsche Zahl, falscher Name, erfundene Angabe, falsche Anrede, fehlende Pflichtangabe, unpassender Ton. Ohne klare Definition zählt jede Person anders.
- Fehlerarten gruppieren. Bilden Sie wenige Gruppen, etwa Fakten (Zahlen, Namen), Inhalt (fehlt oder überflüssig), Ton und Form, Regelverstoss (verbotene Angaben). Fünf bis sechs Gruppen reichen.
- Die Schwere einstufen. Legen Sie drei Stufen fest: leicht (stört kaum, schnell korrigiert), mittel (würde Rückfragen auslösen), schwer (Schaden oder Haftung möglich). Für jede Stufe ein Beispiel aus Ihrem Alltag.
- Eine Stichprobe ziehen. Wählen Sie zufällig zehn bis dreissig Ergebnisse pro Woche oder Monat. «Zufällig» heisst: nicht nur die guten oder die auffälligen. Siehe Kleine Stichproben auswerten.
- Jedes Ergebnis prüfen und eintragen. Eine Person prüft, eine zweite kontrolliert Stichproben der Prüfung. Tragen Sie in eine Tabelle ein: Datum, Aufgabe, Fehler ja/nein, Art, Schwere. Mehr zu zwei Augen: Vier-Augen-Prüfung.
- Auswerten und einordnen. Rechnen Sie: Anteil Ergebnisse mit mindestens einem Fehler, Anteil schwerer Fehler, häufigste Fehlerart. Vergleichen Sie mit den Ausgangswerten von früher, siehe Ausgangswerte erfassen.
- Mit KI die Auswertung unterstützen. Öffnen Sie einen erlaubten KI-Assistenten, also ein Programm, dem Sie schriftlich Aufgaben geben. Lassen Sie sich Tabelle und Auswertungshilfe erstellen und Muster in Ihren Fehlerbeschreibungen ordnen. Verwenden Sie nur anonymisierte Beschreibungen. Rechnen Sie wichtige Zahlen selbst nach.
- Ursachen angehen. Fragen Sie: Liegt es an der Anweisung, an den Daten, am Modell oder an der Aufgabe? Passen Sie Anweisung oder Prüfschritt an und messen Sie erneut. Fehler, die immer wieder schwer sind, sprechen gegen den Einsatz in dieser Aufgabe.
| Schwere | Beispiel | Reaktion |
|---|---|---|
| Leicht | Holpriger Satz | Beim nächsten Mal Anweisung verbessern |
| Mittel | Falsche Anrede in Kundenmail | Prüfschritt verstärken |
| Schwer | Falscher Betrag in Offerte | Sofort korrigieren, Prozess anpassen |
| Kritisch | Vertrauliche Angabe preisgegeben | Vorfallplan auslösen |
Vorlage zum Kopieren
Ich möchte die Fehlerquote unserer KI-Anwendung messen.
Aufgabe der Anwendung: [z. B. Kundenmails beantworten].
Was bei uns als Fehler zählt: [Stichworte, z. B. falsche Zahl, falsche Anrede, erfundene Angabe].
Schweregrade: [leicht / mittel / schwer mit je einem Beispiel].
Geplante Stichprobe: [Anzahl pro Woche oder Monat].
Bitte erstelle mir:
1. eine Erfassungstabelle mit Spalten für Datum, Aufgabe, Fehler ja/nein, Fehlerart, Schwere, Bemerkung,
2. eine Anleitung, wie ich die Auswertung rechne (Anteil mit Fehler, Anteil schwerer Fehler, häufigste Art),
3. fünf Fragen, mit denen ich Ursachen der häufigsten Fehler suche.
Erfinde keine Messwerte und rechne nur mit den Zahlen, die ich später einsetze.Passen Sie Fehlerarten und Schweregrade an Ihren Betrieb an.
Worauf Sie achten müssen
- Kleine Stichproben schwanken. Bei zehn Ergebnissen kann ein Fehler mehr oder weniger viel ausmachen. Lesen Sie Zahlen vorsichtig und messen Sie über mehrere Wochen.
- Prüfer sind nicht fehlerfrei. Auch Menschen übersehen Fehler. Eine zweite Person für Stichproben erhöht die Zuverlässigkeit.
- Keine Schuldzuweisung. Fehlermessung soll Prozesse verbessern, nicht Personen bewerten. Besprechen Sie Ergebnisse sachlich.
- Vertraulichkeit. Beschreiben Sie Fehler ohne Kundennamen und ohne echte Daten, wenn Sie diese mit KI auswerten.
- Grenzen akzeptieren. Bei Aufgaben mit hohem Schadensrisiko, etwa Preise, Verträge, Gesundheitsangaben, bleibt eine menschliche Prüfung auch bei niedriger Fehlerquote nötig. Siehe Ergebnisqualität bewerten.
Ein Beispiel aus der Praxis
Ein erfundenes Beispiel: Ein Reisebüro in Baden lässt Reiseempfehlungen mit KI vorformulieren. Frau Müller prüft pro Woche 15 Texte. Nach einem Monat zeigt die Tabelle: Bei 12 von 60 Texten gab es Fehler, die meisten leicht (Ton). Aber dreimal stimmte eine Öffnungszeit nicht, ein mittlerer Fehler.
Mit dieser Auswertung ändert sie die Anweisung: «Öffnungszeiten nur aus der Quelle übernehmen, sonst weglassen.» Im nächsten Monat sinken die Fehler bei Fakten deutlich. Die Geschäftsleitung bekommt eine Tabelle statt eines Gefühls.
So hilft Ihnen Alpasana
Die KI-Beratung und digitale Transformation von Alpasana umfasst laut Leistungsbeschreibung das Integrieren von KI-Agenten mit Anwendungsfall, Pilot, Einsatzregeln und Skalierung sowie die Dokumentation der Umsetzung. Dazu gehört, Qualität im Pilot messbar zu machen.
Alpasana kann den Aufbau begleiten, die laufende Messung im Alltag liegt bei Ihrem Betrieb.
Häufige Fragen
Welche Fehlerquote ist akzeptabel?
Das hängt von der Aufgabe ab. Bei internen Entwürfen mit Prüfung kann sie höher sein als bei Texten, die ungeprüft an Kunden gehen. Legen Sie die Schwelle vorab fest.
Wie viele Ergebnisse muss ich prüfen?
Für den Anfang genügen zehn bis dreissig pro Woche. Bei kritischen Aufgaben prüfen Sie alles, bis die Qualität stabil ist.
Zählt Nacharbeit auch als Fehler?
Ja, als Hinweis auf Qualität. Erfassen Sie Nacharbeitszeit zusätzlich, siehe Nachbearbeitungszeit erfassen.
Kann KI ihre eigenen Fehler zählen?
Nur eingeschränkt. Sie kann Muster beschreiben, aber nicht verlässlich beurteilen, ob sie selbst richtig lag. Die Prüfung bleibt Menschensache.
Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. So arbeitet die Redaktion · Fehler entdeckt? Melden Sie es uns.
Weiterlesen in der Galaxie
- KI-Ergebnisse bewerten: Vorlage für ein QualitätsrasterKI Qualität bewerten: Mit einem einfachen Qualitätsraster beurteilen Sie KI-Ergebnisse nach einheitlichen Kriterien statt nach Bauchgefühl im Team.
- Wie erkennen wir, wenn eine KI mit der Zeit schlechter wird?KI Qualität überwachen: Schleichende Verschlechterungen Ihrer KI mit festen Testfragen, Stichproben und Verlaufsnotizen früh bemerken und gegensteuern.
- Was müssen wir vor dem KI-Start messen?KI Ausgangswerte messen: Welche Zahlen Sie vor der Einführung erfassen, damit Sie später belegen können, ob KI Zeit, Qualität oder Kosten verbessert hat.
- KI-Ergebnisse im Betrieb prüfen: Checkliste fürs TeamKI Ergebnisse prüfen: Mit Vier-Augen-Prinzip, klaren Freigabekriterien und einer einfachen Checkliste sichern Sie die Qualitätskontrolle von KI-Texten im Team.
- Wirksamkeit von Massnahmen mit KI prüfenWirksamkeitsprüfung von Massnahmen: Prüfen, ob Korrekturen wirklich wirken, und mit KI Daten vergleichen und Berichte entwerfen.
- KI-Governance: Was bedeutet das für ein kleines Unternehmen?KI Governance KMU einfach erklärt: Was der Begriff meint und welche Regeln, Zuständigkeiten und Kontrollen ein kleiner Betrieb wirklich braucht.