Eigene LLMs & KI-Systeme · ready4future ICT
Fine-Tuning JSONL: Trainingsdaten vorbereiten
Kurz gesagt
JSONL ist eine Textdatei, in der jede Zeile ein vollständiges Trainingsbeispiel enthält, meist als Gespräch aus Eingabe und Antwort. Viele Trainingswerkzeuge verlangen genau dieses Format und lehnen Dateien mit kleinen Formatfehlern ab. Mit einer Prüfliste und einem kurzen Prüfskript Ihrer IT finden Sie die Fehler vor dem Training.
Das Problem
Ihre Beispiele sind gesammelt und geprüft, vielleicht in einer Excel-Tabelle. Doch das Trainingswerkzeug meldet beim Einlesen einen Fehler, oft nur mit einer Zeilennummer und einem kryptischen Hinweis. Die IT nennt das Stichwort «JSONL», und niemand im Team weiss genau, was das heisst.
Das ist ein häufiger Stolperstein. Die Datei sieht für das Auge richtig aus, aber ein einzelnes fehlendes Anführungszeichen genügt, und das ganze Training startet nicht. Schlimmer: Manche Fehler werden nicht gemeldet, sondern führen still zu einem schlechteren Modell.
Mit etwas Hintergrundwissen können Sie als Fachperson mit Ihrer IT auf Augenhöhe klären, wer was prüft. Die Beispiele selbst sammeln Sie mit der Vorlage für Trainingsbeispiele.
Einfach erklärt
JSONL steht für «JSON Lines». Es ist eine reine Textdatei, in der jede Zeile genau ein Trainingsbeispiel enthält. JSON ist eine Schreibweise für Daten mit Namen und Werten in geschweiften Klammern, die Programme leicht lesen können.
Ein Beispiel für eine einzige Zeile im verbreiteten Chat-Format:
{"messages": [{"role": "system", "content": "Du bist freundlich und knapp."}, {"role": "user", "content": "Kann ich den Termin verschieben?"}, {"role": "assistant", "content": "Gern. Welcher Tag passt Ihnen besser?"}]}Die Rollen bedeuten: system ist die allgemeine Anweisung, user die Eingabe der Person, assistant die gewünschte Antwort des Modells. Jede Zeile ist ein abgeschlossenes Beispiel, und zwischen den Zeilen steht kein Komma.
Wichtig: Es gibt nicht «das eine» Format. Manche Werkzeuge erwarten das Chat-Format, andere Felder wie «prompt» und «completion», wieder andere ein Anweisungsformat. Massgebend ist immer die Dokumentation des Werkzeugs, das Ihre IT verwendet.
So lösen Sie es mit KI – Schritt für Schritt
- Fragen Sie die IT nach dem erwarteten Format. Notieren Sie, welches Werkzeug das Training macht und welche Felder es verlangt. Bitten Sie um ein Musterbeispiel aus dessen Dokumentation.
- Prüfen Sie Ihre Tabelle. Jede Zeile muss eine Eingabe und eine Antwort haben. Leere Zellen und Platzhalter wie «tbd» streichen Sie.
- Lassen Sie die Tabelle umwandeln. Ihre IT oder ein kleines Skript erzeugt aus jeder Zeile eine JSONL-Zeile. Ein KI-Assistent kann dafür ein Skript vorschlagen, das die IT prüft und ausführt.
- Speichern Sie als UTF-8-Textdatei. Umlaute wie ä, ö und ü müssen erhalten bleiben. Öffnen Sie die Datei nicht und speichern Sie sie nicht in Word, denn Word verändert Anführungszeichen und Zeilenumbrüche.
- Prüfen Sie jede Zeile maschinell. Ihre IT lässt ein Prüfskript laufen, das jede Zeile einzeln als JSON einliest und fehlerhafte Zeilen mit Nummer nennt.
- Prüfen Sie stichprobenartig von Hand. Lesen Sie zehn zufällige Zeilen. Stimmen Rollen, Inhalt und Sprache?
- Trennen Sie Trainings- und Testdatei. Eine Datei für das Training, eine für die Prüfung, siehe Trainings- und Testdaten trennen.
- Entfernen Sie Dubletten. Doppelte Zeilen verzerren das Ergebnis, siehe Dubletten entfernen.
- Starten Sie mit einem kleinen Probelauf. Zuerst mit wenigen Zeilen, damit Formatfehler sofort auffallen.
Vorlage zum Kopieren
Mit diesem Auftrag bitten Sie einen KI-Assistenten, ein Prüfskript für Ihre IT zu entwerfen. Verwenden Sie nur Musterdaten, keine echten Kundendaten:
Schreibe ein kurzes, gut kommentiertes Python-Skript, das eine JSONL-Trainingsdatei prüft. Erkläre jeden Schritt in einfachem Deutsch, damit meine IT-Kollegin es nachvollziehen kann.
Erwartetes Format pro Zeile: [z. B. Chat-Format mit "messages", Rollen system/user/assistant]
Dateiname: [z. B. training.jsonl]
Das Skript soll:
1. Jede Zeile einzeln als JSON einlesen und fehlerhafte Zeilen mit Zeilennummer melden.
2. Prüfen, dass alle Pflichtfelder vorhanden und nicht leer sind.
3. Leere Zeilen und doppelte Zeilen melden.
4. Die Anzahl gültiger Beispiele ausgeben.
Das Skript soll die Datei nur lesen und nichts verändern.Passen Sie das Format an Ihr Werkzeug an. Lassen Sie das Skript von Ihrer IT prüfen und zuerst mit Musterdaten testen.
Worauf Sie achten müssen
- Datenschutz: Auch in einer JSONL-Datei stehen Texte im Klartext. Personendaten gehören vorher entfernt, siehe Personendaten entfernen.
- Typische Formatfehler: fehlende oder doppelte Anführungszeichen im Text, Zeilenumbrüche mitten in einem Beispiel, Komma am Zeilenende, leere Zeilen und ein unsichtbares Sonderzeichen am Dateianfang.
- Zeichensatz: Speichern Sie in UTF-8, sonst werden aus Umlauten falsche Zeichen.
- Format des Werkzeugs: Ein Format, das bei einem Werkzeug funktioniert, kann bei einem anderen scheitern.
- Stille Fehler: Ein falsch gesetzter Rollenname wird nicht immer gemeldet, kann aber das Ergebnis verschlechtern.
- KI-Skripte prüfen: Ein von KI geschriebenes Skript kann Fehler enthalten. Lassen Sie es vor dem Einsatz testen.
| Fehler | Typische Folge | Lösung |
|---|---|---|
| Zeilenumbruch im Text | Beispiel wird zerrissen | Umbruch als \n schreiben |
| Anführungszeichen im Text | Zeile ungültig | Mit Rückwärtsschrägstrich maskieren |
| Komma am Zeilenende | Fehler beim Einlesen | Kein Komma zwischen Zeilen |
| Falsche Zeichenkodierung | Umlaute zerstört | Als UTF-8 speichern |
| Leere Zeile | Abbruch oder Warnung | Leere Zeilen entfernen |
Ein Beispiel aus der Praxis
Ein Beispiel: Ein Treuhandbüro in Winterthur hat 120 Mustermails in Excel gesammelt. Der Informatiker wandelt sie mit einem Skript um und startet das Training, doch das Werkzeug bricht bei Zeile 37 ab.
Vorher: Niemand weiss, was in Zeile 37 steht, und die Datei wird in einem Texteditor von Hand durchsucht. Nachher: Mit einem Prüfskript werden drei Zeilen gefunden, in denen ein Anführungszeichen im Mailtext die Zeile bricht. Zwei weitere Zeilen enthalten Zeilenumbrüche. Nach der Korrektur läuft der Probelauf mit zwanzig Beispielen durch, danach folgt die ganze Datei.
So hilft Ihnen Alpasana
Wenn Ihr Team Trainingsdaten, Skripte oder Datenaufbereitung nicht selbst umsetzen kann, kann die ready4future ICT helfen. Laut Leistungsbeschreibung setzen begleitete Informatiklernende Skripte, Automatisierungen und Datenaufbereitung um, mit fachlicher Begleitung, Vier-Augen-Prüfung und Dokumentation; Testdaten oder anonymisierte Daten sind dabei der Standard.
Häufige Fragen
Kann ich JSONL in Excel oder Word erstellen?
Nicht zuverlässig. Excel und Word verändern Anführungszeichen und Zeilenumbrüche. Besser eignen sich ein Skript oder ein einfacher Texteditor, der Ihre IT einrichtet.
Was ist der Unterschied zwischen JSON und JSONL?
JSON ist ein einzelnes Datenobjekt, oft mit vielen Einträgen verschachtelt. Bei JSONL steht pro Zeile ein eigenes, unabhängiges Objekt. Das ist für grosse Datenmengen praktischer, weil man Zeile für Zeile lesen kann.
Wie viele Zeilen darf die Datei haben?
Das legt das Trainingswerkzeug fest. Manche Dienste haben Grenzen für Dateigrösse und Zeilenzahl. Prüfen Sie die Dokumentation des Werkzeugs.
Muss jedes Beispiel eine system-Zeile haben?
Nicht zwingend. Das hängt vom Werkzeug und vom Ziel ab. Wenn Sie später im Betrieb eine feste Anweisung verwenden, sollte sie im Training in gleicher Form vorkommen.
Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.
Weiterlesen in der Galaxie
- Vorlage: Trainingsbeispiele für ein Sprachmodell sammelnFine-Tuning Datensatz Vorlage: So sammeln Sie Beispiele aus Eingabe und Wunschantwort in einer Tabelle, bevor Ihre IT mit dem Training eines Modells beginnt.
- Warum müssen Trainingsdaten und Testdaten getrennt bleiben?Fine-Tuning Train Test Split einfach erklärt: Warum Testbeispiele nie ins Training gehören und wie Sie sie beiseitelegen, um echte Verbesserungen zu erkennen.
- Wie entferne ich Personendaten aus Trainingsbeispielen?Fine-Tuning Daten anonymisieren: Wie Sie Kundennamen und persönliche Angaben aus Trainingsbeispielen entfernen, Platzhalter setzen und das Ergebnis prüfen.
- Fine-Tuning lokal vorbereiten: Welche Schritte sind nötig?Fine-Tuning lokal vorbereiten: Checkliste mit Zielklärung, Daten, Hardware, Basismodell, Testset und Abnahme, bevor Sie ein lokales Training starten.
- Wie trainiert man ein Modell auf den eigenen deutschen Stil?Fine-Tuning deutscher Schreibstil: So bereiten Sie Beispieltexte in Schweizer Schreibweise vor, trainieren ein Modell auf Ihren Ton und prüfen es.