Eigene LLMs & KI-Systeme · KI-Beratung und digitale Transformation
Wie entferne ich Personendaten aus Trainingsbeispielen?
Kurz gesagt
Ersetzen Sie Namen, Adressen, Nummern und weitere Angaben, die auf Personen führen, durch einheitliche Platzhalter, und prüfen Sie das Ergebnis von Hand. Ein Modell kann Trainingstexte teilweise wiedergeben, deshalb gehören Personendaten nicht ins Training. Eine rein maschinelle Bereinigung findet nie alles.
Das Problem
Ihre Trainingsbeispiele stammen aus dem Alltag: Mails, Offerten, Gesprächsnotizen. Darin stehen Kundennamen, Adressen, Telefonnummern, manchmal Angaben zu Gesundheit oder Finanzen. Für das Training eines Sprachmodells sind diese Angaben unnötig, aber riskant.
Der Grund: Ein Modell, das mit Texten angepasst wurde («Fine-Tuning»), kann Teile davon später wiedergeben. Das passiert nicht immer, aber es ist möglich. Eine Kundenadresse, die einmal im Training war, kann unter Umständen in einer Antwort an eine fremde Person auftauchen.
Hinzu kommt der Datenschutz. Personendaten dürfen in der Schweiz nur zu dem Zweck bearbeitet werden, der bei der Erhebung erkennbar war. Ob das Training dazu passt, ist im Einzelfall zu prüfen. Die einfachste Lösung ist, die Personendaten gar nicht erst ins Training zu geben. Die Rechtsfragen behandelt Welche Daten dürfen in unseren Trainingsdatensatz?.
So lösen Sie es mit KI – Schritt für Schritt
- Legen Sie fest, was als Personendaten gilt. Das sind alle Angaben, die sich auf eine bestimmte oder bestimmbare Person beziehen: Name, Adresse, Telefonnummer, E-Mail, AHV-Nummer, Kundennummer, Kontonummer, Geburtsdatum, Fotos. Auch Kombinationen wie «die Hausärztin in Wil mit den zwei Praxen» können eine Person erkennbar machen.
- Erstellen Sie eine Platzhalterliste. Zum Beispiel [Name], [Strasse], [Ort], [Telefon], [E-Mail], [Kundennummer], [Firma]. Verwenden Sie in allen Beispielen dieselben Platzhalter.
- Ersetzen Sie die Angaben. Gehen Sie Beispiel für Beispiel durch. Bei kleinen Mengen geht das von Hand mit «Suchen und Ersetzen» in Excel. Bei grossen Mengen hilft ein Skript Ihrer IT.
- Bleiben Sie beim Zusammenhang. Ist im Text zweimal von derselben Person die Rede, verwenden Sie [Person A] und [Person B], damit die Sätze verständlich bleiben.
- Prüfen Sie versteckte Stellen. Schauen Sie in Betreffzeilen, Signaturen, Dateinamen, Metadaten und Zitaten. Dort bleiben Angaben oft stehen.
- Lassen Sie eine zweite Person stichprobenartig prüfen. Sie liest zwanzig zufällige Beispiele und sucht Namen, Zahlen und Ortsangaben.
- Dokumentieren Sie die Bereinigung. Notieren Sie, wer wann welche Regeln angewendet hat. Das hilft bei späteren Fragen.
- Löschen Sie die unbereinigte Fassung nach Ablauf des Bedarfs oder bewahren Sie sie getrennt und geschützt auf.
Vorlage zum Kopieren
Wichtig: Verwenden Sie diesen Auftrag nur in einer Umgebung, in der Sie die Daten ohnehin bearbeiten dürfen, zum Beispiel mit einem lokalen Modell oder einem Dienst mit geprüftem Vertrag. Mit öffentlichen Chat-Diensten gehören echte Kundendaten nicht in den Auftrag, sondern nur Mustertexte.
Du hilfst mir, Personendaten in Texten durch Platzhalter zu ersetzen. Du veränderst sonst nichts am Text und erfindest nichts.
Regeln:
- Namen von Personen: [Person A], [Person B] (gleiche Person = gleicher Platzhalter)
- Adressen: [Adresse]
- Telefonnummern: [Telefon]
- E-Mail-Adressen: [E-Mail]
- Kunden-, Auftrags-, Konto- und AHV-Nummern: [Nummer]
- Weitere Regeln: [z. B. Firmennamen bleiben stehen / werden zu [Firma]]
Text:
[Text hier einfügen]
Gib den bereinigten Text aus. Liste danach alle Stellen auf, bei denen du unsicher warst, ob es Personendaten sind.Passen Sie die Regeln an Ihren Betrieb an. Prüfen Sie das Ergebnis immer selbst, denn die KI übersieht Angaben.
Worauf Sie achten müssen
- Keine vollständige Sicherheit: Weder Mensch noch Programm finden alle Angaben. Kontrollieren Sie stichprobenartig und gründlich.
- Indirekte Hinweise: Seltene Berufe, Orte, Daten oder Ereignisse können Personen erkennbar machen, auch ohne Namen.
- Besonders schützenswerte Angaben: Gesundheit, Religion, Politik, Strafverfahren oder soziale Hilfe verlangen strengere Regeln. Solche Texte gehören in der Regel nicht in ein Trainingsprojekt.
- Berufsgeheimnisse: Anwaltskanzleien, Arztpraxen, Treuhänder und andere Berufsgruppen haben Geheimhaltungspflichten. Diese gelten unabhängig von Namen im Text.
- Bereinigung über KI-Dienste: Wer echte Texte an einen öffentlichen Dienst schickt, um sie zu bereinigen, gibt die Daten bereits aus der Hand. Siehe Daten vor der KI anonymisieren.
- Rechtliche Grundlage: Die Schweizer Datenschutzregeln stehen im Datenschutzgesetz (DSG). Lassen Sie den Einzelfall von einer Fachperson prüfen.
| Angabe im Original | Ersatz im Trainingsbeispiel |
|---|---|
| Frau Anna Keller, Rosenweg 4, 4600 Olten | [Person A], [Adresse] |
| 062 123 45 67 | [Telefon] |
| anna.keller@beispiel.ch | [E-Mail] |
| Auftrag 2026-0815 | [Nummer] |
| Mein Mann Peter ist erkrankt | Löschen oder umformulieren |
Ein Beispiel aus der Praxis
Ein Beispiel: Ein Sanitärbetrieb in Aarau will aus alten Kundenmails Beispiele für Terminantworten gewinnen. Die Mails enthalten Namen, Adressen, Telefonnummern und gelegentlich private Hinweise wie «Meine Mutter ist krank, kommen Sie bitte nach 14 Uhr».
Vorher: Die Mails wurden unbereinigt in einer Tabelle gesammelt. Nachher: Die Sachbearbeiterin ersetzt Namen und Adressen nach einer Platzhalterliste, streicht alle Mails mit Gesundheitsangaben und lässt eine Kollegin zwanzig Beispiele gegenlesen. Zwei übersehene Telefonnummern in Signaturen werden gefunden. Erst danach übergibt sie die Datei an die IT.
So hilft Ihnen Alpasana
Wenn Sie klären möchten, welche Daten für ein KI-Vorhaben geeignet sind und wie Sie die Datenvorbereitung sauber organisieren, begleitet Sie die KI-Beratung und digitale Transformation der Alpasana GmbH. Nach Leistungsbeschreibung gehören dazu das Analysieren von KI-Potenzialen sowie bei KI-Vorhaben Pilot und Einsatzregeln. Rechtsberatung ist darin nicht enthalten.
Häufige Fragen
Reicht es, nur die Namen zu ersetzen?
Meist nicht. Auch Adressen, Nummern, Ortsangaben und besondere Umstände können Personen erkennbar machen. Prüfen Sie den ganzen Text, nicht nur die Namen.
Kann ein Programm das automatisch erledigen?
Es kann viel erleichtern, besonders bei Namen und Nummern mit festem Muster. Vollständig und fehlerfrei sind solche Programme nicht. Eine menschliche Stichprobe bleibt nötig.
Muss ich die Personen informieren, wenn ich ihre Mails als Beispiel verwende?
Das hängt davon ab, ob die Verwendung mit dem ursprünglichen Zweck vereinbar ist und ob Personendaten im Training bleiben. Wenn Sie sie vollständig entfernen, entfällt das Problem weitgehend. Klären Sie Zweifelsfälle mit Ihrer Datenschutzberatung.
Gelten die Regeln auch für interne Texte von Mitarbeitenden?
Ja. Auch Angaben zu Mitarbeitenden sind Personendaten. Verwenden Sie sie nicht ohne Klärung in Trainingsdaten.
Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.
Quellen
Weiterlesen in der Galaxie
- Welche Daten dürfen in unseren Trainingsdatensatz?Fine-Tuning Daten Rechte: Eine Checkliste, mit der Sie Herkunft, Einwilligungen und Nutzungsrechte Ihrer Texte klären, bevor ein Modell damit angepasst wird.
- Vorlage: Trainingsbeispiele für ein Sprachmodell sammelnFine-Tuning Datensatz Vorlage: So sammeln Sie Beispiele aus Eingabe und Wunschantwort in einer Tabelle, bevor Ihre IT mit dem Training eines Modells beginnt.
- Was ist JSONL und wie bereite ich Trainingsdaten damit vor?Fine-Tuning JSONL einfach erklärt: Wie eine Trainingsdatei mit einer Zeile pro Beispiel aufgebaut ist, welche Fehler häufig vorkommen und wie Sie sie vorab prüfen.
- Anonymisieren oder pseudonymisieren: Was schützt bei KI?Anonymisierung und Pseudonymisierung im Vergleich: Warum Namen durch Nummern zu ersetzen nicht reicht und welches Restrisiko bei KI-Aufgaben bleibt.
- Wie anonymisiere ich Texte vor der KI-Nutzung?Daten für KI anonymisieren: Entfernen Sie Namen und indirekte Hinweise, prüfen Sie Text und Anhänge und erstellen Sie eine brauchbare Arbeitsfassung.