Zum Inhalt springen

KI im Unternehmen · KI-Beratung und digitale Transformation

KI-Testprotokoll: Ergebnisse nachvollziehbar festhalten

Stand 10.10.2026 · 5 Min. Lesezeit

Kurz gesagt

Ein Testprotokoll hält pro Durchlauf fest, was getestet wurde, mit welchen Einstellungen, was herauskam und wie es bewertet wurde. Wenn alle Testenden dasselbe Raster verwenden, werden Ergebnisse vergleichbar und es entstehen keine widersprüchlichen Erzählungen. Die Vorlage unten lässt sich direkt in einer Tabelle einsetzen.

Das Problem

Im Pilot testen fünf Personen die KI. In der Besprechung erzählt Frau A: «Es hat super geklappt.» Herr B sagt: «Bei mir war es katastrophal.» Frau C erinnert sich nicht mehr genau, welche Anfrage das war. Niemand weiss, mit welchen Einstellungen getestet wurde, welche Version lief oder ob dieselbe Aufgabe verwendet wurde.

Ohne Aufzeichnungen bleibt der Pilot eine Sammlung von Eindrücken. Das macht es schwer, Fehler zu beheben, Fortschritt zu belegen und am Ende eine begründete Entscheidung zu treffen. Auch bei Rückfragen der Geschäftsleitung oder bei einem Zwischenfall lässt sich nicht nachvollziehen, was geschehen ist.

Ein einfaches, einheitliches Testprotokoll löst das. Es kostet pro Durchlauf eine Minute und macht aus Erzählungen vergleichbare Daten.

Was gehört ins Protokoll?

FeldInhaltWarum wichtig
Datum und ZeitWann wurde getestet?Zuordnung zu Versionen und Änderungen
TestpersonWer hat getestet?Rückfragen, Vergleich zwischen Personen
TestfallNummer und Kurzbeschreibung der AufgabeVergleichbarkeit, siehe Testfälle
Werkzeug und VersionName, Modell oder Version, wichtige EinstellungenErgebnisse hängen davon ab
EingabeAuftrag und Ausgangsmaterial (anonymisiert oder Verweis)Nachvollziehbarkeit
ErgebnisKurzfassung oder Ablage der AusgabePrüfung und Wiederholung
Bewertungbestanden / mit Korrektur / nicht bestandenAuswertung
Fehlerartfalsch, erfunden, unvollständig, Ton, Format, SicherheitFehleranalyse
AufwandZeit für Prüfung und KorrekturNutzenrechnung
BemerkungAuffälligkeiten, IdeenVerbesserungen

So lösen Sie es mit KI – Schritt für Schritt

  1. Entscheiden Sie das Format. Eine gemeinsame Tabelle (Excel oder Online-Tabelle) genügt. Ein Blatt pro Pilot, eine Zeile pro Durchlauf.
  2. Legen Sie die Felder fest. Übernehmen Sie die Tabelle oben und streichen Sie, was Sie nicht brauchen. Weniger ist besser, wenn alle ausfüllen sollen.
  3. Definieren Sie Auswahllisten. Bewertung und Fehlerart mit festen Auswahlwerten, damit alle gleich benennen.
  4. Erklären Sie es dem Testteam. Zehn Minuten Einführung mit einem Beispiel. Zeigen Sie, wie eine gute Zeile aussieht.
  5. Verwenden Sie Testfall-Nummern. Jeder Durchlauf bezieht sich auf einen Testfall. So lassen sich dieselben Fälle über Zeit und Personen vergleichen.
  6. Protokollieren Sie sofort. Nicht am Freitag aus dem Gedächtnis. Eine Zeile direkt nach dem Durchlauf.
  7. Schützen Sie die Daten. Keine echten Personendaten ins Protokoll. Verweisen Sie auf anonymisierte Testfälle.
  8. Werten Sie wöchentlich aus. Zählen Sie Bewertungen und Fehlerarten, schauen Sie Auffälligkeiten an und leiten Sie Fehler an die Fehlerliste weiter, siehe Fehler im KI-Pilot bearbeiten.
  9. Bewahren Sie das Protokoll auf. Es ist Grundlage des Abschlussberichts, siehe Abschlussbericht.

Vorlage zum Kopieren

Mit diesem Auftrag lassen Sie ein Protokoll-Raster für Ihre Tabelle erstellen:

Erstelle eine Vorlage für ein Testprotokoll für einen KI-Pilot in [Betrieb, Branche, Schweiz]. Aufgabe der KI: [z. B. Kundenmails kategorisieren].
Format: Tabelle mit den Spalten: Datum | Testperson | Testfall-Nr. | Werkzeug/Version/Einstellung | Eingabe (Kurzbeschreibung oder Verweis) | Ergebnis (Kurzfassung) | Bewertung | Fehlerart | Aufwand Prüfung/Korrektur in Minuten | Bemerkung.
Definiere für «Bewertung» und «Fehlerart» feste Auswahlwerte mit je einer Erklärung in einem Satz (z. B. Bewertung: bestanden / mit Korrektur / nicht bestanden; Fehlerart: falsch / erfunden / unvollständig / Ton / Format / Sicherheit).
Füge drei ausgefüllte Beispielzeilen mit erfundenen Daten und eine kurze Anleitung zum Ausfüllen hinzu (höchstens 120 Wörter, einfache Sprache).

Kopieren Sie die Spalten in Ihre Tabelle und lassen Sie das Team ein Probeprotokoll ausfüllen, bevor der Pilot beginnt.

So kann eine ausgefüllte Zeile aussehen

DatumTestpersonTestfallVersionBewertungFehlerartAufwandBemerkung
14.10.Frau Keller12 (Anfrage ohne Angaben)Version 1, Auftrag v2mit Korrekturunvollständig4 Min.KI fragt nicht nach, ergänzt selbst Datum
14.10.Herr Berisha12Version 1, Auftrag v2nicht bestandenerfunden6 Min.erfindet eine Bestellnummer

Die Beispiele sind erfunden. Gleiche Testfälle durch verschiedene Personen zeigen, ob ein Fehler zufällig oder systematisch ist.

Worauf Sie achten müssen

  • Zu viele Felder: Wer ein ausgedehntes Formular ausfüllen muss, tut es nicht. Beschränken Sie sich auf das Nötige.
  • Subjektive Bewertung: «Gut» heisst für alle etwas anderes. Legen Sie Kriterien fest, siehe Abnahmekriterien.
  • Vertrauliche Inhalte: Keine echten Namen, Adressen oder Geschäftsgeheimnisse ins Protokoll. Verweisen Sie auf Testfall-Nummern.
  • Versionen vergessen: Ändert sich das Werkzeug zwischendurch, ohne dass es notiert wird, sind Vergleiche wertlos.
  • Lücken bei Misserfolgen: Menschen protokollieren gern Erfolge. Betonen Sie, dass Fehler ausdrücklich erwünscht sind.
  • Aufbewahrung: Legen Sie fest, wie lange das Protokoll aufbewahrt und wer Zugriff hat.

Ein Beispiel aus der Praxis

Ein Beispiel: Eine Gemeinde im Kanton Solothurn testet mit vier Mitarbeitenden eine KI, die Bürgeranfragen vorsortiert.

Vorher: Nach drei Wochen berichten alle nur mündlich. Die Gemeindeschreiberin kann nicht sagen, ob die Fehler eher bei Steuerfragen oder Baugesuchen auftreten, und auch nicht, ob sie seit dem Update weniger geworden sind.

Nachher: Das Team führt eine gemeinsame Tabelle mit Testfall-Nummer, Bewertung, Fehlerart und Prüfzeit. Nach drei Wochen zeigt sich: Bei Baugesuchen liegen 70 Prozent der Entwürfe falsch, bei allgemeinen Fragen nur 10 Prozent. Die Gemeinde schliesst Baugesuche aus dem Pilot aus und dokumentiert die Gründe für die Geschäftsleitung.

So hilft Ihnen Alpasana

Dokumentierte Tests sind Grundlage jeder Entscheidung. Die KI-Beratung und digitale Transformation von Alpasana unterstützt dabei, Prozesse aufzunehmen, KI-Potenziale zu analysieren, Vorhaben zu priorisieren und einen Umsetzungsplan zu erstellen, und sie dokumentiert die Umsetzung. Zur Integration von KI-Agenten gehören Anwendungsfall, Pilot, Einsatzregeln und Skalierung. Projekte werden individuell offeriert.

Häufige Fragen

Wer soll das Protokoll führen?

Alle Testenden für ihre eigenen Durchläufe, in derselben Tabelle. Eine Person aus dem Pilotteam kontrolliert Vollständigkeit und wertet aus.

Reicht eine Notiz im Chat-Verlauf der KI?

Nein. Chatverläufe sind nicht vergleichbar und gehören dem Anbieter. Ein eigenes Protokoll in Ihrem Ablagesystem ist verlässlicher.

Wie viel Zeit kostet das?

Rund eine Minute pro Durchlauf, wenn das Raster einfach ist. Der Aufwand lohnt sich, weil er später Diskussionen und Fehlentscheidungen erspart.

Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.

Weiterlesen in der Galaxie