KI im Unternehmen · KI-Beratung und digitale Transformation
KI nach einem Anbieter-Update erneut prüfen: Checkliste
Kurz gesagt
Nach einem Update antwortet die KI manchmal anders, auch wenn Sie nichts geändert haben. Prüfen Sie dann eine feste Reihe von Testfällen, vergleichen Sie die Ergebnisse mit früher und geben Sie die Anwendung erst wieder frei, wenn die wichtigsten Fälle bestehen.
Das Problem
Ihre KI-Anwendung hat monatelang zuverlässig Zusammenfassungen, Kundenantworten oder Auswertungen geliefert. Plötzlich klingen die Texte anders, die Antworten sind länger oder kürzer, oder ein gewohntes Format stimmt nicht mehr. Sie haben nichts geändert, aber der Anbieter hat im Hintergrund ein Update eingespielt.
Das ist keine Seltenheit. Anbieter von KI-Diensten verbessern ihre Modelle, also die Programme, die den Text erzeugen, laufend und ersetzen ältere Versionen. Für das einzelne Unternehmen kann das bedeuten, dass bewährte Anweisungen plötzlich andere Ergebnisse liefern.
Ohne festen Ablauf merken Sie die Veränderung oft erst, wenn ein Kunde sich über einen merkwürdigen Text wundert. Mit einer kurzen Checkliste prüfen Sie nach jedem Update in einer Stunde, ob alles noch passt.
So lösen Sie es mit KI – Schritt für Schritt
- Das Update zur Kenntnis nehmen. Notieren Sie, wann Sie eine Änderung bemerkt haben oder wann der Anbieter sie angekündigt hat. Prüfen Sie Mitteilungen des Anbieters und den Bereich «Neuigkeiten» in Ihrem Konto. Halten Sie fest, welche Anwendung betroffen sein könnte.
- Die Anwendung vorübergehend vorsichtig nutzen. Bis die Prüfung abgeschlossen ist, lassen Sie keine Ergebnisse automatisch an Kundschaft gehen. Jede Ausgabe wird von einer Person gelesen, bevor sie weitergeht.
- Die Testfälle bereitstellen. Nehmen Sie eine feste Reihe von Aufgaben, die Sie schon früher geprüft haben: etwa zehn typische Fälle und zwei bis drei schwierige. Verwenden Sie erfundene oder anonymisierte Daten. Siehe Testfälle für KI-Anwendungen.
- Alle Fälle durchlaufen lassen. Geben Sie jeden Testfall genauso ein wie früher und speichern Sie die Antworten. Verändern Sie dabei nichts an den Anweisungen, sonst wissen Sie nicht, ob Update oder Änderung die Ursache ist.
- Mit den früheren Ergebnissen vergleichen. Legen Sie alte und neue Antworten nebeneinander. Prüfen Sie Inhalt, Ton, Format, Länge und ob die Regeln eingehalten werden, zum Beispiel «keine Preise nennen» oder «immer mit Sie ansprechen».
- Abweichungen bewerten. Unterscheiden Sie: besser, gleichwertig, schlechter, unbrauchbar. Gewichten Sie nach Folgen: Ein anderer Ton ist weniger schlimm als eine falsche Zahl. Mehr Hilfe bei Ergebnisqualität bewerten.
- KI als Vergleichshilfe nutzen. Öffnen Sie einen erlaubten KI-Assistenten, also ein Programm, dem Sie schriftlich Aufgaben geben, und lassen Sie sich die Unterschiede zwischen alter und neuer Antwort in einer Tabelle auflisten. Nur anonymisierte Testtexte verwenden. Das Urteil, ob eine Abweichung akzeptabel ist, treffen Sie selbst.
- Entscheiden und festhalten. Drei Möglichkeiten: Anwendung weiter nutzen, Anweisungen anpassen und neu testen, oder vorübergehend auf einen früheren Stand oder ein Ersatzverfahren zurückgehen. Notieren Sie das Ergebnis mit Datum und Verantwortlichem, siehe KI-Entscheidungen dokumentieren.
| Prüfpunkt | Frage | Beispiel |
|---|---|---|
| Inhalt | Stimmen Fakten und Zahlen? | Betrag im Mail korrekt |
| Format | Entspricht die Ausgabe der Vorgabe? | Liste statt Fliesstext |
| Ton | Passt die Sprache zu uns? | «Sie» statt «du» |
| Regeln | Werden Verbote eingehalten? | Keine Preisauskunft |
| Zuverlässigkeit | Gleiches Ergebnis bei Wiederholung? | Zweimal prüfen |
Vorlage zum Kopieren
Unser KI-Anbieter hat ein Update eingespielt. Ich möchte alte und neue Ergebnisse vergleichen.
Aufgabe der Anwendung: [z. B. Kundenmails zusammenfassen].
Testfall: [anonymisierter Beispieltext].
Frühere Antwort: [alte Antwort].
Neue Antwort: [neue Antwort].
Unsere Regeln: [z. B. Anrede Sie, keine Preise, höchstens 100 Wörter].
Bitte vergleiche in einer Tabelle: Inhalt, Format, Ton, Einhaltung der Regeln, Länge.
Nenne Unterschiede sachlich und bewerte nicht, ob die Anwendung freigegeben werden soll.
Erfinde keine Informationen, die in den Texten nicht stehen.Setzen Sie die Platzhalter ein und fügen Sie nur anonymisierte oder erfundene Texte ein.
Worauf Sie achten müssen
- Datenschutz bei den Testfällen. Verwenden Sie keine echten Kundendaten für Tests in Diensten, die Sie dafür nicht freigegeben haben. Erfundene Beispiele genügen meist.
- Zufall ist normal. KI liefert auch ohne Update nicht jedes Mal denselben Text. Beurteilen Sie deshalb mehrere Läufe, nicht einen einzelnen.
- Stille Änderungen. Manche Anbieter ändern Modelle ohne grosse Ankündigung. Prüfen Sie regelmässig, nicht nur nach Meldungen. Hilfreich ist KI-Qualität langfristig überwachen.
- Verträge und Zusagen. Wenn bestimmte Leistungen vereinbart sind, kann eine Verschlechterung ein Anlass für Rückfragen beim Anbieter sein. Rechtliche Folgen beurteilt eine Fachperson im Einzelfall.
- Ersatzlösung bereithalten. Wenn die Anwendung ausfällt oder unbrauchbar wird, brauchen Sie ein bewährtes Vorgehen, siehe Ersatzverfahren bei KI-Ausfall.
Ein Beispiel aus der Praxis
Ein erfundenes Beispiel: Frau Müller leitet das Sekretariat einer Zahnarztpraxis in Aarau. Die Praxis nutzt eine KI, um Terminbestätigungen vorzuformulieren. Nach einem Update werden die Texte plötzlich länger und enthalten eine Entschuldigung, die nicht vereinbart ist.
Sie führt die zwölf bekannten Testfälle durch. Zehn sind gleichwertig, bei zwei weicht die Anrede ab. Sie ergänzt in der Anweisung «Immer kurz, immer ohne Entschuldigung, Anrede Sie» und wiederholt den Test. Danach stimmen alle Fälle. Im Protokoll steht: Update bemerkt am Montag, Nachtest am Dienstag, Anweisung angepasst, wieder freigegeben.
So hilft Ihnen Alpasana
Die KI-Beratung und digitale Transformation von Alpasana umfasst laut Leistungsbeschreibung die Einführung von KI-Agenten mit Anwendungsfall, Pilot und Einsatzregeln sowie die Dokumentation der Umsetzung. Dazu passt ein fester Ablauf für Tests und Freigaben nach Änderungen.
Alpasana kann Sie bei der Planung unterstützen. Die laufende Prüfung nach Updates bleibt aber Aufgabe Ihres Betriebs.
Häufige Fragen
Wie oft ändern sich KI-Modelle?
Das ist je nach Anbieter verschieden und nicht verlässlich vorhersehbar. Planen Sie deshalb feste Prüfzeitpunkte, etwa einmal pro Quartal, zusätzlich zu Prüfungen bei erkennbaren Änderungen.
Kann ich eine bestimmte Modellversion festhalten?
Manche Anbieter erlauben das, andere nicht. Fragen Sie beim Anbieter nach und halten Sie die Antwort fest. Hinweise bietet Modellversion festhalten.
Wie viele Testfälle brauche ich?
Für ein kleines Büro genügen zehn bis fünfzehn gut gewählte Fälle. Wichtig ist, dass sie typisch und schwierig zugleich sind.
Was tue ich, wenn die Qualität dauerhaft schlechter bleibt?
Passen Sie Anweisungen an, prüfen Sie Alternativen und sprechen Sie mit dem Anbieter. Ein Wechsel will gut vorbereitet sein, siehe Abhängigkeit vom Anbieter vermeiden.
Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.
Weiterlesen in der Galaxie
- KI testen: Vorlage für typische Fälle und GrenzfälleKI Testfälle Vorlage: Eine Vorlage mit Testszenarien, erwarteten Ergebnissen und Fehlerfällen, um die Zuverlässigkeit einer KI im Arbeitsalltag zu prüfen.
- KI-Ergebnisse bewerten: Vorlage für ein QualitätsrasterKI Qualität bewerten: Mit einem einfachen Qualitätsraster beurteilen Sie KI-Ergebnisse nach einheitlichen Kriterien statt nach Bauchgefühl im Team.
- Wie erkennen wir, wenn eine KI mit der Zeit schlechter wird?KI Qualität überwachen: Schleichende Verschlechterungen Ihrer KI mit festen Testfragen, Stichproben und Verlaufsnotizen früh bemerken und gegensteuern.
- Was tun, wenn die KI im Arbeitsalltag ausfällt?KI Ausfall Notfallplan: So bleibt Ihr Betrieb handlungsfähig, wenn das KI-Werkzeug nicht verfügbar ist. Ersatzverfahren und klare Zuständigkeiten.
- Neues KI-Modell einsetzen: Sicherheitsverhalten vergleichenKI Modellwechsel Sicherheit: Vergleichen Sie Sicherheitsverhalten und Qualität von altem und neuem KI-Modell mit festen Testfällen, vor der Freigabe.