Zum Inhalt springen

Grundlagen · KI-Weiterbildung für Unternehmen

Warum werden Trainingsdaten und Testdaten getrennt?

Stand 10.10.2026 · 5 Min. Lesezeit

Kurz gesagt

Eine KI muss an Beispielen geprüft werden, die sie beim Lernen nie gesehen hat. Sonst könnte sie die Antworten auswendig gelernt haben und trotzdem bei neuen Fällen versagen. Deshalb teilt man Daten in Trainings-, oft auch Validierungs- und Testdaten auf. Dasselbe Prinzip gilt, wenn Sie eine KI in Ihrem Betrieb prüfen.

Das Problem

Ein Anbieter zeigt Ihnen eine KI, die Rechnungen mit 98 Prozent Trefferquote sortiert. Sie sind beeindruckt, aber nach dem Kauf liegt die KI bei Ihren eigenen Rechnungen deutlich häufiger daneben. Wie kann das sein?

Eine mögliche Ursache: Die Anbieter haben die KI mit denselben Beispielen geprüft, mit denen sie sie vorher trainiert haben. Das ist, als würde eine Lehrperson dieselben Aufgaben im Unterricht üben und in der Prüfung stellen. Die Note sagt dann wenig darüber aus, ob jemand den Stoff wirklich verstanden hat.

Wer das Prinzip kennt, kann Versprechen besser einordnen und eigene Tests so aufbauen, dass sie wirklich etwas aussagen.

So lösen Sie es mit KI – Schritt für Schritt

So prüfen Sie eine KI-Anwendung in Ihrem Betrieb fair:

  1. Aufgabe festlegen: Schreiben Sie genau auf, was die KI leisten soll, zum Beispiel «Eingangsrechnungen nach Kostenstelle vorsortieren».
  2. Beispiele sammeln: Stellen Sie 30 bis 50 echte, aber anonymisierte Fälle zusammen. Je abwechslungsreicher, desto besser: einfache, schwierige und ungewöhnliche.
  3. Richtige Lösung notieren: Halten Sie für jeden Fall fest, was die korrekte Antwort ist. Das entscheidet eine fachkundige Person aus Ihrem Betrieb, nicht die KI.
  4. Beispiele trennen: Wenn Sie einer KI Beispiele zum Lernen oder als Muster geben, behalten Sie einen Teil zurück, den die KI vorher nie sieht. Das ist Ihr Testset.
  5. Testen ohne Vorwarnung: Lassen Sie die KI die zurückgehaltenen Fälle bearbeiten und vergleichen Sie mit Ihren Lösungen.
  6. Fehler auswerten: Notieren Sie, wo und warum sie danebenliegt. Gibt es ein Muster, etwa bei einem Lieferanten oder einer Schreibweise?
  7. Verbessern und neu testen: Passen Sie Anweisung oder Beispiele an. Prüfen Sie danach mit einem frischen Testset, damit Sie nicht unbewusst auf die alten Fälle hin optimieren.
  8. Im Betrieb beobachten: Prüfen Sie auch nach dem Start regelmässig Stichproben. Mehr dazu in Warum wird ein KI-Modell mit der Zeit unpassend?.

Die drei Datenarten im Überblick

DatenartWofürAlltagsbild
TrainingsdatenDas Modell lernt daran MusterÜbungsaufgaben im Unterricht
ValidierungsdatenZwischenkontrolle, um Einstellungen zu wählenProbeprüfung
TestdatenEndgültige, unabhängige PrüfungEchte Prüfung mit neuen Aufgaben

Wenn ein Modell Trainingsdaten fast perfekt, neue Daten aber schlecht bearbeitet, spricht man von Überanpassung, siehe Was bedeutet Overfitting bei KI?.

Vorlage zum Kopieren

Mit diesem Auftrag lassen Sie sich Testfälle für Ihre Aufgabe anregen. Verwenden Sie nur erfundene Daten.

Wir möchten prüfen, ob eine KI folgende Aufgabe zuverlässig löst: [Aufgabe, z. B. Kundenanfragen nach Dringlichkeit einordnen].
Erstelle 15 erfundene Beispielfälle in einer Tabelle mit den Spalten: Nummer, Beispieltext, erwartete richtige Einordnung, Schwierigkeit (einfach, mittel, schwierig).
Mische typische Fälle mit fünf Sonderfällen (zum Beispiel unklare Formulierungen, fehlende Angaben, zwei Anliegen in einer Nachricht).
Verwende ausschliesslich frei erfundene Namen und Daten.

Ergänzen Sie danach eigene, echte und anonymisierte Fälle, und halten Sie die Auswahl der Testfälle vor der KI zurück.

Worauf Sie achten müssen

  • Datenschutz: Verwenden Sie für Tests anonymisierte oder erfundene Daten, solange nicht geklärt ist, welche Programme echte Daten verarbeiten dürfen.
  • Testen mit denselben Fällen: Wer ständig dieselben Beispiele nutzt, optimiert unbewusst darauf. Erneuern Sie das Testset gelegentlich.
  • Repräsentativität: Das Testset muss Ihren Alltag abbilden, nicht nur Musterfälle.
  • Herstellerangaben prüfen: Fragen Sie Anbieter, mit welchen Daten sie getestet haben und ob diese vom Training getrennt waren.
  • Keine Garantie: Auch ein guter Test sagt nur etwas über die geprüften Fälle aus, nicht über alle künftigen.

Warum ein guter Test Geduld braucht

Viele Betriebe testen eine KI an drei, vier Fällen und sind begeistert oder enttäuscht. Aussagekräftig wird ein Test erst, wenn er mehrere Fälle umfasst und auch schwierige darunter sind. Planen Sie dafür einen halben Tag ein und teilen Sie die Arbeit: Eine Person sammelt Fälle, eine zweite notiert die richtigen Lösungen, und eine dritte bewertet die Antworten, ohne die Lösungen vorher zu kennen. Dieser kleine Aufwand verhindert Fehlkäufe, die später viel mehr kosten.

Ein Beispiel aus der Praxis

Ein Beispiel: Eine Gemeinde im Freiamt möchte Bürgeranfragen mit KI vorsortieren. Vorher zeigt ihr ein Anbieter hohe Trefferquoten, ohne zu sagen, mit welchen Daten geprüft wurde.

Nachher sammelt die Gemeindeschreiberin 40 anonymisierte Anfragen aus dem Vorjahr, notiert die richtige Zuständigkeit und lässt die Software diese bearbeiten. Das Ergebnis ist schlechter als im Verkaufsgespräch, besonders bei Sammelanfragen. Die Gemeinde verhandelt Nachbesserungen und startet nur mit den Standardfällen.

So hilft Ihnen Alpasana

Wenn Ihr Team lernen soll, KI-Ergebnisse systematisch zu prüfen, bietet absofort KI-Weiterbildung für Unternehmen an. Beschrieben sind Online-Weiterbildung von Grundlagen bis zum Executive-Diplomlehrgang, KI für Verwaltung, Kommunikation, Analyse, Texte und Entscheidungsgrundlagen sowie verantwortungsbewusster Umgang mit Unternehmensdaten.

Eine konkrete Testanleitung für Ihre Anwendung bekommen Sie dadurch nicht, aber die Grundlagen für ein sicheres Urteil.

Häufige Fragen

Wie viele Testfälle brauche ich?

Für einen ersten Eindruck genügen oft 30 bis 50 abwechslungsreiche Fälle. Je wichtiger die Aufgabe, desto mehr sollten es sein. Es ist ein Richtwert, keine feste Regel.

Was ist der Unterschied zwischen Validierungs- und Testdaten?

Validierungsdaten dienen während der Entwicklung, um Einstellungen zu vergleichen. Testdaten werden erst am Ende für die unabhängige Endprüfung genutzt und dürfen vorher nicht verwendet worden sein.

Muss ich das als Anwenderin selbst machen?

Wenn Sie nur ein fertiges Programm nutzen, nicht im technischen Sinn. Ein eigener, einfacher Test mit Ihren Fällen ist aber auch für Anwenderinnen sinnvoll, bevor sie sich auf ein Programm verlassen.

Reicht ein guter Test, damit die KI im Alltag zuverlässig ist?

Nein. Mit der Zeit ändern sich Daten und Gewohnheiten. Prüfen Sie deshalb weiterhin Stichproben und halten Sie fest, wer bei Fehlern zuständig ist.

Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.

Weiterlesen in der Galaxie