Zum Inhalt springen

Eigene LLMs & KI-Systeme · KI-Beratung und digitale Transformation

Warum müssen Trainingsdaten und Testdaten getrennt bleiben?

Stand 10.10.2026 · 5 Min. Lesezeit

Kurz gesagt

Wer ein Modell an denselben Beispielen prüft, mit denen es trainiert wurde, misst nur, ob es auswendig gelernt hat. Legen Sie deshalb vor dem Training einen Teil der Beispiele beiseite und prüfen Sie das Modell ausschliesslich damit. Nur so zeigt sich, ob es auch bei neuen Fällen funktioniert.

Das Problem

Ihre IT hat ein Sprachmodell mit Ihren Beispielen angepasst und meldet: «Das Modell beantwortet fast alle Testfälle richtig.» Das klingt hervorragend. Im Alltag liefert es dann aber merkwürdige Antworten, sobald eine Kundin etwas leicht anderes fragt.

Häufig liegt das an einem einfachen Fehler: Die Testfälle waren schon im Training enthalten. Das Modell kennt sie also, so wie eine Schülerin, die ein Prüfungsblatt vorher auswendig gelernt hat. Die gute Note sagt dann nichts darüber, ob sie den Stoff verstanden hat.

Sie müssen die Technik nicht im Detail verstehen. Wichtig ist, dass Sie als Auftraggeberin die richtige Frage stellen können: «Mit welchen Beispielen wurde geprüft, und waren diese vom Training getrennt?»

Einfach erklärt

Beim Fine-Tuning teilt man die gesammelten Beispiele in Gruppen:

  • Trainingsdaten: Daraus lernt das Modell. Das ist die grosse Mehrheit der Beispiele.
  • Testdaten: Das Modell sieht sie nie beim Lernen. Sie dienen nur der Abschlussprüfung.
  • Oft zusätzlich Prüfdaten (auch Validierungsdaten genannt): Damit überwacht die IT während des Trainings den Fortschritt.

Das Auswendiglernen heisst Overfitting (Überanpassung): Das Modell passt sich so stark an die Trainingsbeispiele an, dass es neue Fälle schlechter behandelt. Siehe Overfitting beim Fine-Tuning.

Ein Datenleck entsteht, wenn Testbeispiele doch ins Training gelangen. Das passiert schnell durch Dubletten, leicht veränderte Kopien oder verschiedene Mails zum selben Fall. Dann sieht die Prüfung besser aus, als das Modell wirklich ist.

DatengruppeZweckWer darf sie sehen?
TrainingDas Modell lernt darausDas Modell, beim Training
Prüfdaten (Validierung)Fortschritt während des TrainingsDie IT, beim Einstellen
TestdatenAbschlussprüfungNie das Training

So lösen Sie es mit KI – Schritt für Schritt

  1. Sammeln Sie zuerst alle Beispiele und bereinigen Sie sie. Siehe Vorlage für Trainingsbeispiele.
  1. Entfernen Sie Dubletten und fast gleiche Einträge. Siehe Dubletten entfernen. Sonst steckt derselbe Fall in beiden Gruppen.
  1. Legen Sie die Testmenge fest, bevor das Training beginnt. Eine übliche Richtung ist ein kleiner Teil der Beispiele, etwa ein Zehntel bis ein Fünftel. Bei sehr kleinen Sammlungen genügen auch zwanzig bis dreissig gute Testfälle. Es gibt keine feste Regel.
  1. Wählen Sie die Testfälle bewusst und zufällig. Sie sollen die Bandbreite der Aufgaben abbilden: einfache und schwierige Fälle, alle Themen. Mischen Sie, statt nur die letzten Zeilen der Tabelle zu nehmen.
  1. Gleiche Fälle zusammenhalten. Gehören mehrere Mails zum selben Kunden oder Vorgang, bleiben sie alle in derselben Gruppe.
  1. Speichern Sie die Testdaten getrennt. In einer eigenen Datei, die das Trainingswerkzeug nicht einliest. Notieren Sie, wer sie verwaltet.
  1. Schreiben Sie vorab auf, woran Sie Erfolg messen. Zum Beispiel: «Mindestens 8 von 10 Antworten sind ohne Änderung versendbar.»
  1. Prüfen Sie das Modell mit den Testdaten und vergleichen Sie mit dem Ausgangsmodell. Beurteilen Sie die Antworten von Hand.
  1. Ändern Sie die Testdaten nicht nach. Wer die Prüfung dem Modell anpasst, verfälscht das Ergebnis. Neue Fälle sammeln Sie als neue Testgruppe.

Vorlage zum Kopieren

Dieser Auftrag hilft Ihnen, den Plan für die Prüfung festzuhalten. Verwenden Sie nur Beschreibungen, keine echten Kundendaten:

Du hilfst mir, einen einfachen Prüfplan für ein angepasstes Sprachmodell zu erstellen. Du erfindest keine Messwerte und keine Studien.

Ziel des Modells: [z. B. Antwortentwürfe für Terminanfragen]
Anzahl gesammelter Beispiele: [z. B. 150]
Themen der Beispiele: [z. B. Terminverschiebung, Preis, Reklamation]

Erstelle:
1. Einen Vorschlag, wie ich die Beispiele in Training, Prüfdaten und Test aufteile, und wie ich sicherstelle, dass alle Themen in jeder Gruppe vorkommen.
2. Eine Checkliste, mit der ich Datenlecks zwischen den Gruppen erkenne.
3. Eine Bewertungstabelle mit Spalten: Testfall, Antwort des Modells, versendbar ja/nein, Fehlerart.
4. Drei Kriterien, wann ich das Ergebnis als Erfolg und wann als ungenügend bezeichne.

Passen Sie Ziel, Menge und Themen an. Besprechen Sie die Aufteilung mit Ihrer IT.

Worauf Sie achten müssen

  • Dubletten und Fast-Kopien: Ähnliche Beispiele in beiden Gruppen täuschen gute Ergebnisse vor.
  • Zu wenige Testfälle: Mit fünf Testfällen sagt ein Ergebnis wenig. Ein einzelner Ausreisser verändert das Bild stark.
  • Nachträgliches Anpassen: Wer ständig Trainingsdaten ändert, bis der Test besser aussieht, trainiert indirekt auf den Test.
  • Menschliche Beurteilung: Zahlen allein genügen nicht. Lesen Sie die Antworten selbst.
  • Datenschutz: Auch Testdaten enthalten Texte aus dem Betrieb und gehören bereinigt. Siehe Personendaten entfernen.
  • Grenzen der Prüfung: Auch ein gutes Testergebnis garantiert nicht, dass das Modell im Alltag nie Fehler macht. Behalten Sie eine menschliche Freigabe bei.

Ein Beispiel aus der Praxis

Ein Beispiel: Eine Privatschule in Zug lässt ein Modell Antworten für das Sekretariat vorbereiten. Es gibt 200 Beispiele zu Stundenplänen, Absenzen und Elternfragen.

Vorher: Die IT trainiert mit allen 200 Beispielen und prüft mit 20 davon. Das Ergebnis lautet «19 von 20 richtig», doch im Betrieb sind die Entwürfe oft unbrauchbar. Nachher: Die Sekretariatsleiterin legt 30 Beispiele aus allen Themen vorab beiseite, trainiert wird mit 170. Im Test mit den 30 unbekannten Fällen sind noch 19 von 30 Antworten brauchbar. Das Ergebnis ist ehrlicher, und die Schule weiss, bei welchen Themen weitere Beispiele nötig sind.

So hilft Ihnen Alpasana

Wenn Sie ein Fine-Tuning-Vorhaben ordentlich aufsetzen möchten, von der Zielklärung über den Pilot bis zu Einsatzregeln, begleitet Sie die KI-Beratung und digitale Transformation der Alpasana GmbH. Laut Leistungsbeschreibung gehören dazu das Analysieren von KI-Potenzialen, Pilot, Einsatzregeln und Skalierung. Der Umfang wird individuell offeriert.

Häufige Fragen

Wie gross sollte die Testmenge sein?

Eine feste Zahl gibt es nicht. Als Richtung gilt ein kleiner Anteil der Beispiele, solange die Testfälle alle Themen abdecken. Bei kleinen Sammlungen lieber wenige, sehr sorgfältige Testfälle als gar keine.

Reicht ein Test mit denselben Beispielen, wenn die Daten knapp sind?

Nein. Dann messen Sie nur das Auswendiglernen. Besser ist es, weniger Trainingsbeispiele zu nehmen und dafür einen sauberen Test zu behalten.

Darf ich die Testfälle nach dem ersten Durchlauf ins Training nehmen?

Für ein späteres, endgültiges Modell kann das sinnvoll sein. Dann brauchen Sie aber neue, unabhängige Testfälle für die nächste Prüfung.

Gilt das auch, wenn ich nur Anweisungen und keine Trainingsdaten verwende?

Der Grundgedanke gilt auch dort: Prüfen Sie Ihre Anweisung an Fällen, die Sie beim Formulieren nicht verwendet haben. Dann sehen Sie, ob sie allgemein funktioniert.

Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.

Weiterlesen in der Galaxie