Eigene LLMs & KI-Systeme · KI-Beratung und digitale Transformation
Warum verschlechtert sich unsere KI mit der Zeit?
Kurz gesagt
Auch ohne Modellwechsel kann eine KI schlechter werden: Dokumente veralten, Fragen ändern sich, Einstellungen oder Programme wurden angepasst. Prüfen Sie regelmässig dieselben Testfragen und vergleichen Sie die Ergebnisse. So erkennen Sie die Veränderung, bevor das Team das Vertrauen verliert.
Das Problem
Im Frühling war das Team begeistert: Die interne KI beantwortete Fragen zu Abläufen treffend und zuverlässig. Im Herbst häufen sich die Klagen. Antworten sind ungenau, verweisen auf alte Regeln oder gehen an der Frage vorbei. Dabei hat niemand das Modell gewechselt.
Dieses schleichende Nachlassen nennt man Drift, wörtlich «Abdriften». Gemeint ist: Die Qualität verändert sich langsam, ohne dass ein einzelner Fehler auffällt. Gerade weil es schleichend geschieht, bemerkt man es oft erst, wenn das Vertrauen schon weg ist.
Frau Müller fragt sich: «Hat die KI etwas verlernt?» Meistens nicht. Ein einmal installiertes Modell verändert sich nicht von selbst. Verändert hat sich fast immer das Umfeld.
So lösen Sie es mit KI – Schritt für Schritt
- Klären Sie, was sich geändert hat. Fragen Sie die IT: Gab es Updates am Programm, neue Einstellungen, ein anderes Modell oder neu eingespielte Dokumente? Notieren Sie Datum und Änderung. Oft findet sich hier schon die Ursache, siehe Updates im Betrieb.
- Prüfen Sie die Wissensquellen. Antwortet die KI aus Firmendokumenten, kann sie nur so aktuell sein wie diese. Sind Richtlinien neu und die Ablage alt, liefert sie Überholtes. Lesen Sie dazu Alte Dokumente aussortieren.
- Vergleichen Sie mit Ihren Testfragen. Lassen Sie dieselben 20 bis 30 Fragen von damals nochmals beantworten und bewerten Sie diese mit demselben Raster. Das ist der wichtigste Schritt, siehe Testfragen sammeln.
- Bewerten Sie nach festen Kriterien. Richtig, teilweise richtig, falsch, veraltet. Ein Bewertungsraster macht Eindrücke vergleichbar: Antworten bewerten.
- Schauen Sie auf neue Fragen. Haben sich Themen verschoben, etwa wegen eines neuen Produkts oder einer Gesetzesänderung? Fragen, die es beim Start nicht gab, sind oft schlecht abgedeckt.
- Sammeln Sie Rückmeldungen. Daumen hoch oder runter und ein kurzes Freitextfeld zeigen, wo es hakt. Mehr in Nutzerfeedback auswerten.
- Beheben Sie die Ursache, nicht das Symptom. Dokumente aktualisieren, Anweisungen überarbeiten, Einstellungen zurücksetzen oder Modell wechseln. Ändern Sie immer nur eines und testen Sie danach neu.
- Legen Sie einen festen Rhythmus fest. Zum Beispiel eine Kurzprüfung pro Quartal und eine zusätzliche nach jeder Änderung.
Vorlage zum Kopieren
Mit diesem Auftrag werten Sie Ihre Vergleichsergebnisse strukturiert aus. Fügen Sie nur anonymisierte oder erfundene Beispiele ein.
Unsere interne KI liefert zunehmend unpassende Antworten. Hilf mir, die Ursache einzugrenzen.
Unsere Beobachtungen:
- Seit wann: [Datum oder Zeitraum]
- Typische Fehler: [z. B. veraltete Auskunft, ausweichende Antworten, falsche Sprache]
- Bekannte Änderungen seither: [Update, neue Dokumente, neue Einstellungen]
- Ergebnis der letzten Testrunde im Vergleich zur ersten: [Beschreibung]
Aufgabe:
1. Liste mögliche Ursachen auf, nach Wahrscheinlichkeit geordnet (Dokumente, Einstellungen, Fragen, Programm).
2. Schlage zu jeder Ursache einen einfachen Prüfschritt vor.
3. Sage klar, was du aus meinen Angaben nicht beurteilen kannst.
4. Entwirf einen Quartalsplan zur Qualitätsprüfung mit höchstens fünf Punkten.
Erfinde keine Zahlen.Ersetzen Sie die Klammern mit Ihren Beobachtungen. Die vorgeschlagenen Prüfschritte setzt dann Ihre IT-Person um.
| Mögliche Ursache | Woran Sie es erkennen | Erster Schritt |
|---|---|---|
| Veraltete Dokumente | Antworten nennen alte Regeln | Quellen aktualisieren |
| Neue Fragen | Themen, die es früher nicht gab | Wissen ergänzen |
| Geänderte Einstellungen | Plötzlicher Sprung nach einem Update | Änderung zurücknehmen und testen |
| Neues Modell | Anderer Stil oder andere Länge | Mit Testfragen vergleichen |
Worauf Sie achten müssen
- Nicht vorschnell das Modell beschuldigen: In der Praxis liegt die Ursache häufiger bei den Dokumenten oder bei Einstellungen.
- Eindrücke sind keine Messung: «Früher war es besser» ist ein Hinweis, aber kein Beleg. Nur der Vergleich mit gleichen Fragen zählt.
- Dienste von Anbietern können sich ändern: Bei einer externen KI aus der Cloud kann der Anbieter Modelle ohne Ihr Zutun anpassen. Das zeigt sich nur im Vergleich.
- Datenschutz: Testfragen und Antworten gehören ohne Personendaten in die Auswertung.
- Dokumentation: Notieren Sie jede Änderung am System mit Datum. Ohne Änderungsprotokoll bleibt die Ursachensuche Raten.
- Grenzen: KI-Antworten können auch im besten Zustand Fehler enthalten. Wichtige Auskünfte prüft weiterhin ein Mensch.
Ein Beispiel aus der Praxis
Ein Beispiel: Eine Gemeindeverwaltung im Aargau nutzt eine interne KI für Fragen zum Personalreglement. Nach einem halben Jahr melden Mitarbeitende, die Auskünfte zu Ferienregeln seien «komisch».
Vorher gab es nur das Bauchgefühl. Nachher stellt die Verantwortliche die 25 Testfragen vom Start erneut. Bei drei Ferienfragen nennt die KI die alte Regel. Die Ursache war schnell gefunden: Die überarbeitete Fassung des Reglements lag in der Ablage, die alte Version aber ebenfalls. Nach dem Entfernen der alten Fassung und einem erneuten Einlesen stimmten die Antworten wieder. Neu prüft die Gemeinde die Testfragen jedes Quartal.
So hilft Ihnen Alpasana
Wer eine KI dauerhaft im Betrieb halten will, braucht klare Zuständigkeiten, Prüfrhythmen und Einsatzregeln. Die KI-Beratung und digitale Transformation von Alpasana hilft, Prozesse aufzunehmen, Vorhaben zu priorisieren und einen Umsetzungsplan zu erstellen.
Beim Einsatz von KI-Agenten wird dort ausdrücklich vom Anwendungsfall über den Pilot bis zu Einsatzregeln und Skalierung begleitet. Projekte werden individuell offeriert.
Häufige Fragen
Kann ein Modell von allein schlechter werden?
Ein lokal installiertes Modell ändert sich nicht. Bei Diensten aus der Cloud kann der Anbieter Anpassungen vornehmen. Ob sich Ihre Ergebnisse tatsächlich verändert haben, zeigt nur der Vergleich mit Testfragen.
Wie viele Testfragen brauche ich?
Für den Anfang genügen 20 bis 30 typische Fragen. Wichtig ist, dass sie den Alltag abbilden und dass Sie sie nicht laufend ändern.
Wer soll die Prüfung durchführen?
Eine fachlich versierte Person aus dem Team, nicht nur die IT. Nur Fachpersonen sehen, ob eine Antwort inhaltlich stimmt.
Hilft ein neueres Modell automatisch?
Nicht unbedingt. Ein anderes Modell kann in einem Bereich besser und in einem anderen schlechter sein. Prüfen Sie es vor dem Wechsel mit Ihren Testfragen.
Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. So arbeitet die Redaktion · Fehler entdeckt? Melden Sie es uns.
Weiterlesen in der Galaxie
- Vorlage: Testfragen für unsere interne KI sammelnLLM Testfragen Vorlage: So halten Sie typische Alltagsfragen mit Sollantworten fest und bauen daraus einen Prüfkatalog für Ihre interne KI.
- Vorlage: KI-Antworten nach festen Kriterien bewertenKI Antworten Bewertungsraster als Vorlage: Richtigkeit, Verständlichkeit und Vollständigkeit einheitlich beurteilen, damit das Team gleich bewertet.
- Wie aktualisiert man ein eigenes LLM im laufenden Betrieb?LLM-Updates im laufenden Betrieb: So übernehmen Sie neue Modelle und Software, ohne Ihren Chatbot zu beschädigen. Mit Testumgebung, Checkliste, Vorlage.
- Wie sammeln wir hilfreiches Feedback zu KI-Antworten?KI Nutzerfeedback sammeln: So erhalten Sie von Ihrem Team brauchbare Rückmeldungen zu KI-Antworten und machen daraus konkrete, kleine Verbesserungen im Betrieb.
- Welche alten Dokumente gehören nicht in den Chatbot?Chatbot veraltete Dokumente: Checkliste, wie Sie Gültigkeit prüfen und alte Anweisungen aussortieren, bevor der Chatbot sie als aktuell ausgibt.
- Lohnt sich ein Chatbot für ein kleines Unternehmen?Chatbot für kleine Unternehmen: Wann sich ein Chatbot für KMU lohnt, wann nicht, und wie Sie Nutzen und Aufwand ehrlich einschätzen, bevor Sie investieren.