KI im Unternehmen · KI-Beratung und digitale Transformation
Wie erkennen wir, wenn eine KI mit der Zeit schlechter wird?
Kurz gesagt
Eine KI kann mit der Zeit schlechter werden, weil sich Daten, Anforderungen, Modelle oder Dokumente ändern. Sie erkennen das mit einem festen Satz Testfragen, regelmässigen Stichproben, einem Verlaufsprotokoll und Rückmeldungen der Nutzenden. Legen Sie Schwellen fest, ab denen Sie eingreifen.
Das Problem
Die KI hat bei der Einführung gut funktioniert. Das Team war zufrieden, die Antworten stimmten. Ein Jahr später häufen sich kleine Ärgernisse: Eine Antwort ist ungenau, ein Dokument wird falsch zugeordnet, der Tonfall klingt anders. Niemand kann genau sagen, seit wann. Und niemand hat es gemeldet, weil jeder dachte, es sei nur ein Einzelfall.
Solche schleichenden Verschlechterungen sind tückisch. Sie kommen nicht mit einem Knall, sondern in kleinen Schritten. Mögliche Ursachen sind vielfältig: Der Anbieter hat das Modell aktualisiert, die Daten haben sich verändert, neue Produkte oder Regeln sind hinzugekommen, Dokumente sind veraltet. Fachleute sprechen von Drift, wenn sich die Wirklichkeit entfernt von dem, womit die KI einst getestet wurde. Mehr dazu im Glossar: Model Drift.
Die gute Nachricht: Sie müssen kein Experte sein, um das zu bemerken. Ein fester Testsatz und etwas Routine genügen. Diese Seite zeigt, wie Sie vorgehen.
So lösen Sie es mit KI – Schritt für Schritt
- Legen Sie fest, was «gut» heisst. Schreiben Sie in drei bis fünf Punkten auf, woran Sie eine gute Antwort erkennen: richtig, vollständig, passender Ton, mit Quelle. Ohne Massstab sehen Sie keine Abweichung.
- Erstellen Sie einen festen Testsatz. Sammeln Sie 15 bis 30 typische Fragen oder Aufgaben aus dem Alltag, mit der bekannten richtigen Antwort. Mischen Sie einfache und schwierige Fälle. Dieser Satz bleibt gleich, damit Sie vergleichen können. Vorlage: Regressionstest für LLM.
- Führen Sie den Test regelmässig durch. Zum Beispiel einmal im Monat und nach jeder Änderung (neues Modell, neue Dokumente, neue Einstellungen). Notieren Sie das Ergebnis mit Datum.
- Ziehen Sie zusätzlich Stichproben aus dem echten Betrieb. Prüfen Sie jede Woche fünf bis zehn echte Antworten von Hand. Ein fester Test zeigt, ob die KI stabil ist, die Stichprobe zeigt, wie sie sich im echten Alltag verhält.
- Führen Sie ein Verlaufsprotokoll. Eine einfache Tabelle: Datum, Anteil richtiger Antworten im Test, auffällige Fälle, Änderungen am System. So sehen Sie Trends und können Ursachen zuordnen.
- Sammeln Sie Rückmeldungen der Nutzenden. Ein einfacher Knopf oder ein Mailverteiler für «Antwort war falsch» genügt. Wertvolle Hinweise kommen oft von denen, die täglich damit arbeiten.
- Legen Sie Schwellen und Zuständigkeiten fest. Zum Beispiel: «Fällt der Anteil richtiger Antworten unter den vereinbarten Wert, prüft die Verantwortliche die Ursache innerhalb einer Woche.» Wer entscheidet, wer informiert den Anbieter?
- Reagieren Sie auf Abweichungen. Ursachen suchen: Modellwechsel, veraltete Dokumente, geänderte Fragen? Dann Dokumente aktualisieren, Einstellungen anpassen oder den Anbieter kontaktieren. Dokumentieren Sie die Massnahme.
Beispiel für ein Verlaufsprotokoll:
| Datum | Test: richtig von | Auffälligkeit | Änderung am System | Massnahme |
|---|---|---|---|---|
| [Datum 1] | [x von y] | – | – | – |
| [Datum 2] | [x von y] | [z. B. Preise veraltet] | [z. B. neue Preisliste hochgeladen] | [Dokument ersetzt] |
| [Datum 3] | [x von y] | [z. B. anderer Tonfall] | [z. B. Anbieter-Update] | [Anbieter angefragt] |
Vorlage zum Kopieren
Mit diesem Prompt lassen Sie sich helfen, einen Testsatz zu entwerfen. Verwenden Sie keine echten Kundendaten:
Wir betreiben eine KI für [Aufgabe, z. B. Beantwortung von Fragen zu Preisen und Lieferzeiten]. Ich möchte einen festen Testsatz für die monatliche Qualitätsprüfung erstellen.
Erstelle [Anzahl] Testfragen in unterschiedlichen Schwierigkeitsgraden (einfach, mittel, schwierig, mit Sonderfällen und Fragen, die sie ablehnen oder weiterleiten soll). Gib pro Frage ein Feld für die richtige Antwort, die ich selbst ausfülle, und eine Bewertungsskala (richtig, teilweise richtig, falsch).
Schlage zusätzlich vor, wie ich das Ergebnis in einem Verlaufsprotokoll festhalte. Erfinde keine konkreten Fakten über unsere Firma.Ersetzen Sie die Aufgabe. Füllen Sie die richtigen Antworten selbst aus. Die KI kennt Ihre Fakten nicht.
Worauf Sie achten müssen
- Ein Testsatz altert: Wenn sich Ihr Geschäft ändert, muss auch der Testsatz mitwachsen. Ergänzen Sie neue Fälle, behalten Sie aber einen festen Kern für den Vergleich.
- Anbieter ändern Modelle: Auch ohne eigene Änderung kann sich das Verhalten verschieben, wenn der Anbieter ein Modell aktualisiert. Fragen Sie nach Änderungsmitteilungen und testen Sie danach.
- Zufall bei KI-Antworten: Dieselbe Frage kann unterschiedliche Antworten liefern. Wiederholen Sie wichtige Tests mehrmals, bevor Sie Schlüsse ziehen.
- Datenschutz bei Stichproben: Echte Gespräche können Personendaten enthalten. Prüfen Sie nur, was Sie dürfen, und speichern Sie Auszüge geschützt.
- Keine erfundenen Zielwerte: Welche Fehlerquote akzeptabel ist, hängt vom Einsatz ab. Legen Sie Schwellen gemeinsam mit der Leitung fest und begründen Sie sie.
Ein Beispiel aus der Praxis
Ein Beispiel: Eine Gartenbau-Firma in Muri betreibt einen KI-Assistenten, der Kundenanfragen vorbeantwortet. Ein Jahr nach dem Start fällt der Büroleiterin auf, dass sich Rückfragen häufen. Sie führt den Testsatz von 20 Fragen durch, den sie bei der Einführung erstellt hat, und stellt fest, dass bei Fragen zu Pflegeverträgen nur noch die Hälfte stimmt.
Vorher gab es keinen Massstab. Nachher findet sie die Ursache: Die Preisliste in der Wissenssammlung war veraltet, und der Anbieter hatte ein Modell ersetzt. Sie ersetzt das Dokument, passt den Auftrag an und wiederholt den Test. Im Protokoll steht nun jede Änderung mit Datum.
So hilft Ihnen Alpasana
Bei der Integration von KI-Agenten begleitet die KI-Beratung von Alpasana von der Klärung des Anwendungsfalls über Pilot und Einsatzregeln bis zur Skalierung. Dazu gehört auch, Abläufe zu dokumentieren und Verantwortlichkeiten festzuhalten.
Ein laufendes Qualitätsmonitoring Ihrer KI ist nicht als Standardleistung belegt; es wird in der Beratung individuell geklärt.
Häufige Fragen
Wie oft sollte ich den Testsatz durchführen?
Mindestens monatlich und nach jeder Änderung am System oder nach einer Anbieter-Mitteilung. Bei kritischen Anwendungen häufiger.
Muss ich das selbst machen oder kann es die KI?
Die KI kann Testfälle vorschlagen und Antworten vergleichen, aber die Bewertung, was richtig ist, sollte eine Person mit Fachwissen vornehmen. Ein reines KI-gegen-KI-Urteil kann Fehler übersehen.
Was, wenn der Anbieter nichts ändert, aber die Qualität sinkt?
Dann liegt die Ursache oft in Ihren Daten oder in veränderten Fragen. Prüfen Sie Dokumente auf Aktualität, neue Produkte, neue Regeln und passen Sie Wissen und Auftrag an.
Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.
Weiterlesen in der Galaxie
- KI-Ergebnisse bewerten: Vorlage für ein QualitätsrasterKI Qualität bewerten: Mit einem einfachen Qualitätsraster beurteilen Sie KI-Ergebnisse nach einheitlichen Kriterien statt nach Bauchgefühl im Team.
- KI-Kennzahlen auswählen: Vorlage für ein übersichtliches SetKI KPI Vorlage: Wählen Sie wenige aussagekräftige Kennzahlen für Ihre KI-Anwendung statt einer langen Liste, mit Definition, Messweise und Ausgangswert.
- Welche KI-Kosten bleiben nach der Einführung?KI laufende Kosten: Checkliste der Kosten, die nach dem Start dauerhaft bleiben, von Lizenzen über Prüfung bis Pflege, damit Ihr Jahresbudget stimmt.