Zum Inhalt springen

Eigene LLMs & KI-Systeme · KI-Beratung und digitale Transformation

Was tun, wenn die KI Trainingsbeispiele nur auswendig lernt?

Stand 10.10.2026 · 4 Min. Lesezeit

Kurz gesagt

Wenn eine KI nur die Trainingsbeispiele beherrscht und bei neuen Formulierungen scheitert, hat sie «überangepasst» (Overfitting). Prüfen Sie mit getrennten Testdaten, bauen Sie vielfältigere Beispiele auf, trainieren Sie kürzer oder sanfter und messen Sie nach jeder Änderung erneut.

Das Problem

Sie haben ein Sprachmodell mit eigenen Beispielen trainiert. Bei den bekannten Beispielen antwortet es perfekt. Doch sobald ein Kollege dieselbe Frage anders formuliert, kommt eine unpassende oder falsche Antwort. Das Modell wirkt, als hätte es die Beispiele auswendig gelernt, ohne das Prinzip zu verstehen.

Dieses Phänomen heisst «Overfitting» (Überanpassung). Es ist vergleichbar mit einem Schüler, der Prüfungsfragen auswendig lernt, aber bei einer leicht veränderten Aufgabe scheitert. Das Modell passt sich zu stark an die konkreten Trainingsbeispiele an und kann das Gelernte nicht auf Neues übertragen.

Das Problem ist häufig und lässt sich oft mildern. Entscheidend ist, dass Sie es überhaupt bemerken, und das gelingt nur mit Testbeispielen, die das Modell nie gesehen hat. Eine KI kann Ihnen helfen, Testfragen zu variieren und Ursachen zu sammeln.

So lösen Sie es mit KI – Schritt für Schritt

  1. Problem bestätigen: Stellen Sie 30 neue Fragen, die inhaltlich zu Ihren Trainingsbeispielen passen, aber anders formuliert sind. Vergleichen Sie die Qualität mit den Trainingsbeispielen.
  2. Testdaten trennen: Prüfen Sie, ob Ihre Testbeispiele im Training vorkamen. Wenn ja, wirkt das Ergebnis besser, als es ist. Halten Sie einen Teil der Daten strikt zurück.
  3. Daten auf Dubletten prüfen: Gleiche oder fast gleiche Beispiele verstärken das Auswendiglernen. Entfernen Sie Wiederholungen.
  4. Vielfalt erhöhen: Ergänzen Sie unterschiedliche Formulierungen, Längen und Fälle. Die KI kann Varianten vorschlagen, die Sie prüfen und korrigieren.
  5. Training verkürzen oder sanfter einstellen: Weniger Durchgänge (Epochen) oder eine kleinere Lernrate können helfen. Beobachten Sie dabei den Verlauf der Fehlerwerte.
  6. Kleinere Anpassung wählen: Methoden wie LoRA verändern weniger am Modell und neigen weniger zum Überanpassen, wenn sie mit passenden Einstellungen verwendet werden.
  7. Erneut messen: Wiederholen Sie die Testfragen nach jeder Änderung. Ändern Sie immer nur eine Sache.
  8. Alternativen prüfen: Wenn das Ziel Fakten sind, ist eine Dokumentensuche besser als Training. Siehe Fine-Tuning und RAG: Unterschied.

Vorlage zum Kopieren

Du hilfst mir, Overfitting bei einem Fine-Tuning zu untersuchen. Deutsch (Schweiz), einfache Sprache.
Ziel des Trainings: [z. B. Antworten im Hausstil]
Daten: [Anzahl Beispiele, Art, ob Dubletten möglich]
Beobachtung: [Modell beantwortet bekannte Beispiele gut, neue Formulierungen schlecht – kurze Schilderung]
Trainingseinstellungen (soweit bekannt): [Epochen, Lernrate, Methode]
Aufgabe: 1. Nenne sieben mögliche Ursachen für Overfitting in meinem Fall. 2. Erstelle eine Liste mit zehn Testfragen-Varianten zu dieser Beispielfrage: [Beispielfrage]. 3. Schlage eine Reihenfolge von Gegenmassnahmen vor, mit der jeweils nur eine Sache geändert wird. 4. Nenne, woran ich erkenne, dass sich die Lage verbessert hat.
Erfinde keine Messwerte und keine Einstellungen. Markiere Vermutungen als Vermutungen.

Ergänzen Sie Ihre Beobachtung und Einstellungen. Die Testfragen lassen Sie von einer Fachperson prüfen, bevor Sie sie verwenden.

Worauf Sie achten müssen

  • Nur eine Änderung gleichzeitig: Wer mehrere Einstellungen auf einmal ändert, weiss nicht, was gewirkt hat.
  • Testdaten sind heilig: Verwenden Sie dieselben Testdaten nicht zum Verbessern des Trainings, sonst überanpassen Sie auch an diese.
  • KI-generierte Varianten prüfen: Von der KI erzeugte Beispiele können Fehler enthalten oder selbst wiederholend sein. Prüfen Sie sie sorgfältig.
  • Datenschutz: Trainings- und Testdaten können Personendaten enthalten. Anonymisieren Sie vor der Weitergabe an Werkzeuge.
  • Das Gegenteil existiert: Zu schwach angepasste Modelle («Underfitting») lernen zu wenig. Beobachten Sie beide Richtungen.
  • Erwartungen anpassen: Ein kleines Modell mit wenigen Beispielen kann nicht jede Formulierung abdecken. Legen Sie fest, was «gut genug» heisst.

Ein Beispiel aus der Praxis

Ein Beispiel: Eine Versicherungsagentur in St. Gallen trainiert ein lokales Modell auf 200 Beispiele, wie Kundenanfragen zu Schadenmeldungen freundlich beantwortet werden. Im Test glänzt das Modell bei den Trainingsfragen.

Vorher: Die Agenturleiterin ist begeistert und will den Einsatz freigeben.

Nachher: Eine Kollegin stellt zehn Fragen mit anderen Worten, und das Modell antwortet fehlerhaft oder wiederholt Floskeln. Die Prüfung zeigt: 40 Beispiele waren fast identisch. Das Team entfernt Dubletten, ergänzt 60 vielfältigere Beispiele und reduziert die Zahl der Durchgänge. Beim erneuten Test mit neuen Fragen sind die Antworten brauchbar, bei seltenen Fällen leitet das Modell an eine Mitarbeiterin weiter.

BeobachtungMögliche UrsacheGegenmassnahme
Trainingsfragen perfekt, neue schlechtzu wenig VielfaltBeispiele ergänzen
Viele fast gleiche BeispieleDublettenbereinigen
Sehr lange Trainingszeitzu viele Durchgängeverkürzen
Testfragen im TrainingDatenleckstrikt trennen

Das Beispiel zeigt: Overfitting ist kein Weltuntergang, aber ohne Testfragen bleibt es unsichtbar.

So hilft Ihnen Alpasana

Wenn Sie ein Trainingsprojekt sauber aufsetzen und seinen Nutzen prüfen möchten, unterstützt die KI-Beratung und digitale Transformation von Alpasana: KI-Potenziale analysieren, Vorhaben priorisieren, Umsetzung planen und bei KI-Agenten Pilot und Einsatzregeln festlegen.

Projekte werden individuell offeriert. Hilfreich zum Weiterlesen: Testdaten beim Fine-Tuning trennen.

Häufige Fragen

Woran erkenne ich Overfitting ohne Fachwissen?

Das Modell antwortet bei bekannten Beispielen sehr gut, bei neuen oder leicht veränderten Fragen deutlich schlechter. Dieser Vergleich genügt als erstes Zeichen.

Hilft mehr Training?

Meist nicht, es kann das Problem verschärfen. Oft helfen vielfältigere Daten und weniger Durchgänge. Mehr zu Durchgängen in Fine-Tuning: Epochen.

Wie viele Beispiele sind genug?

Das hängt vom Ziel. Für Stil und Format reichen oft einige hundert gute und vielfältige Beispiele. Qualität und Vielfalt zählen mehr als Menge.

Soll ich die Fehlerwerte im Verlauf beobachten?

Ja, falls Ihre Software sie anzeigt. Wenn der Fehlerwert bei Trainingsdaten sinkt, bei Testdaten aber steigt, ist das ein typisches Zeichen. Eine Einführung bietet Fine-Tuning-Loss verstehen.

Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.

Weiterlesen in der Galaxie