Zum Inhalt springen

Eigene LLMs & KI-Systeme · KI-Beratung und digitale Transformation

Wie prüfen wir, ob unser eigenes KI-Modell gut genug ist?

Stand 10.10.2026 · 5 Min. Lesezeit

Kurz gesagt

Sie prüfen ein KI-Modell, wie Sie eine neue Mitarbeiterin prüfen würden: mit realistischen Aufgaben, bekannten richtigen Antworten und einem festen Bewertungsraster. Sammeln Sie 30 bis 50 echte Testfragen, lassen Sie die Antworten von Fachpersonen bewerten und wiederholen Sie den Test nach jeder Änderung.

Das Problem

Ein Treuhandbüro in Winterthur hat eine KI eingerichtet, die Fragen zu internen Merkblättern beantwortet. Beim Ausprobieren wirkt sie gut: Sie antwortet flüssig und selbstsicher. Der Geschäftsleiter fragt Frau Müller: «Können wir sie Kundschaft zeigen? Ist sie gut genug?»

Frau Müller merkt, dass ihr Eindruck nach drei Fragen nicht reicht. KI-Antworten klingen fast immer überzeugend, auch wenn sie falsch sind. Ob ein Modell für Ihre Arbeit taugt, entscheidet nicht der erste Eindruck, sondern ein systematischer Test mit Ihren Aufgaben.

Den Fachbegriff dafür hören Sie oft: «Evaluation». Gemeint ist einfach eine geordnete Prüfung. Sie brauchen dafür keine Programmierkenntnisse, nur eine Tabelle und etwas Disziplin.

So lösen Sie es mit KI – Schritt für Schritt

Stellen Sie sich eine Lernende im Büro vor. Bevor sie allein Kunden bedient, geben Sie ihr zehn typische Aufgaben und schauen, was sie richtig und falsch macht. Genauso testen Sie eine KI. Die Schritte:

  1. Testfragen: 30 bis 50 Aufgaben aus Ihrem Alltag, von einfach bis schwierig. Dazu gehören auch Fragen, die die KI nicht beantworten darf, etwa nach Dingen, die nicht in Ihren Unterlagen stehen.
  1. Richtige Antworten: Zu jeder Frage notieren Sie, was richtig wäre oder worauf es ankommt. Das tut eine Fachperson, nicht die KI.
  1. Bewertungsraster: Eine feste Skala, zum Beispiel «richtig», «teilweise richtig», «falsch», «erfunden». Zusätzlich Punkte für Ton und Verständlichkeit. Siehe Bewertungsraster für KI-Antworten.
  1. Blinde Bewertung: Die Bewertenden sehen nicht, welches Modell oder welche Einstellung eine Antwort erzeugt hat. So bleibt die Beurteilung fair.
  1. Wiederholung: Nach jeder Änderung (neues Modell, neue Unterlagen, geänderte Anweisung) läuft derselbe Test erneut. So sehen Sie, ob es besser oder schlechter wurde. Vertiefung: Regressionstest.
  1. Erfolgsmassstab festlegen. Entscheiden Sie vor dem Test, was «gut genug» heisst, zum Beispiel «mindestens 90 Prozent richtig, keine erfundenen Rechtsauskünfte». Sonst wird das Ergebnis nachträglich schöngeredet.
  1. Entscheiden und festhalten. Notieren Sie das Ergebnis, die Fehlerarten und Ihre Entscheidung: einsetzen, nachbessern oder verwerfen. Das Protokoll hilft beim nächsten Test.

Eine Faustregel für die Auswertung: Zählen Sie nicht nur den Durchschnitt, sondern auch die schlimmsten Fehler. Eine KI, die in 95 von 100 Fällen stimmt, aber in fünf Fällen gefährliche Auskünfte erfindet, kann trotzdem untauglich sein.

Noch ein Wort zum Zufall: Dieselbe Frage kann bei einer KI an zwei Tagen unterschiedlich beantwortet werden. Stellen Sie deshalb wichtige Fragen zwei- bis dreimal. Fällt eine Antwort einmal richtig und einmal falsch aus, ist das Modell für diese Aufgabe nicht verlässlich genug, auch wenn der Durchschnitt gut aussieht.

Vorlage zum Kopieren

Mit diesem Prompt lassen Sie sich Testfragen vorschlagen. Prüfen Sie jede Frage und die richtige Antwort selbst.

Wir testen eine KI, die Fragen zu [Themengebiet, z. B. interne Merkblätter zur Mehrwertsteuer]
in einem [Branche]-Betrieb in der Schweiz beantwortet.
Erstelle 30 Testfragen: 15 einfache Fragen mit eindeutiger Antwort, 8 Fragen, die mehrere
Unterlagen verbinden, 4 Fragen, deren Antwort NICHT in den Unterlagen steht (die KI muss «weiss ich nicht»
sagen), 3 Fragen mit einer falschen Annahme. Gib eine Tabelle mit den Spalten:
Nr., Frage, Art, worauf bei der Bewertung zu achten ist.
Schreibe in Schweizer Rechtschreibung und erfinde keine Gesetzesangaben.

Setzen Sie Themengebiet und Branche ein und lassen Sie die Fragen von einer Fachperson aus Ihrem Team prüfen und ergänzen. Mehr Vorlagen: Testfragen-Vorlage.

Worauf Sie achten müssen

  • Der erste Eindruck täuscht: Flüssige Sprache ist kein Beleg für Richtigkeit.
  • Echte Fragen verwenden: Testen Sie mit Fragen aus Ihrem Alltag, nicht mit Rätseln, die sich ein Aussenstehender ausdenkt.
  • Keine vertraulichen Daten in Tests mit fremden Diensten: Wenn Sie Tests mit einem Cloud-Dienst machen, verwenden Sie anonymisierte oder erfundene Beispiele.
  • KI bewertet KI nur bedingt: Automatische Bewertung durch ein Modell spart Zeit, ersetzt aber die Stichprobe durch Menschen nicht. Siehe Grenzen der automatischen Bewertung.
  • Test altert: Ändern sich Ihre Unterlagen, muss der Test angepasst werden.
  • Kleine Stichprobe: 40 Fragen zeigen Tendenzen, keine Garantie. Bleiben Sie bei heiklen Themen auch nach bestandenem Test vorsichtig und lassen Sie Fachpersonen mitlesen.
Ergebnis pro AntwortBedeutungReaktion
RichtigInhalt stimmt, Quelle passtBehalten
Teilweise richtigWichtiges fehltUnterlagen oder Anweisung verbessern
FalschInhalt stimmt nichtUrsache suchen
ErfundenAngabe ohne QuelleKritisch, Regeln verschärfen
Korrekt abgelehnt«Weiss ich nicht» bei fehlender InfoErwünscht

Ein Beispiel aus der Praxis

Ein Beispiel: Das Treuhandbüro in Winterthur sammelt 40 Testfragen und lässt zwei Treuhänderinnen die Antworten bewerten, ohne zu wissen, mit welcher Einstellung sie entstanden sind. Von 40 Antworten sind 31 richtig, 6 teilweise richtig, 2 falsch und 1 erfunden.

Die erfundene Antwort betrifft eine Frist. Das Büro entscheidet, dass die KI zu Fristen künftig nur auf das Merkblatt verweisen darf, und wiederholt den Test. Danach liegt die Zahl erfundener Antworten bei null. Für den Einsatz bei Kundschaft reicht dem Büro das noch nicht: Die KI bleibt zunächst intern.

So hilft Ihnen Alpasana

Wenn Sie nicht wissen, wie ein Test für Ihre Aufgaben aussehen soll, hilft eine fachliche Begleitung. Die KI-Beratung und digitale Transformation von Alpasana umfasst die Integration von KI-Agenten mit Anwendungsfall, Pilot, Einsatzregeln und Skalierung sowie Prozessaufnahme und Priorisierung. So legen Sie fest, was «gut genug» für Ihren Betrieb heisst, bevor Sie live gehen.

Projekte werden individuell offeriert.

Häufige Fragen

Wie viele Testfragen sind genug?

Für den Anfang sind 30 bis 50 sinnvoll. Wichtiger als die Zahl ist die Mischung aus einfachen, schwierigen und absichtlich unlösbaren Fragen.

Kann ich die KI selbst bewerten lassen?

Teilweise, als Vorsortierung. Verlassen Sie sich aber nicht allein darauf, sondern prüfen Sie Stichproben selbst. Ein Modell kann Fehler anderer Modelle übersehen.

Wie oft muss ich testen?

Nach jeder wichtigen Änderung: anderes Modell, neue Unterlagen, geänderte Regeln. Dazu kommt eine regelmässige Stichprobe, zum Beispiel monatlich.

Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.

Weiterlesen in der Galaxie