Recht & Ethik · KI für Developer mit Claude und Codex
Sind künstlich erzeugte Testdaten wirklich anonym?
Kurz gesagt
Künstlich erzeugte Daten sind nicht automatisch anonym. Wenn sie aus echten Daten abgeleitet wurden, können Einzelpersonen wiedererkennbar sein, etwa durch seltene Merkmale oder Kombinationen. Ob sie als anonym gelten, hängt davon ab, ob eine Person mit vernünftigem Aufwand bestimmbar bleibt. Prüfen Sie das vor der Verwendung.
Das Problem
Sie entwickeln eine Anwendung, testen ein KI-System oder möchten einem Lieferanten Beispieldaten geben. Echte Kundendaten sollen dafür nicht verwendet werden. Also lassen Sie eine KI «künstliche» Daten erzeugen: Namen, Adressen, Rechnungen, Gesprächsprotokolle. Das klingt nach der perfekten Lösung, denn «die Personen gibt es ja gar nicht».
Das stimmt nur, wenn die Daten wirklich frei erfunden sind. Entstehen sie aus echten Datensätzen, etwa weil die KI aus Ihrer Kundendatenbank «lernt» und ähnliche Datensätze nachbildet, können Merkmale echter Personen durchscheinen. Im schlimmsten Fall sind Einzelne erkennbar.
Die Frage lautet also nicht «ist es künstlich?», sondern «kann daraus eine reale Person bestimmt oder mit vernünftigem Aufwand wiedererkannt werden?».
Welche Arten künstlicher Daten gibt es?
Synthetische Daten sind künstlich erzeugte Daten, die echten ähneln (siehe Synthetische Daten). Sie unterscheiden sich stark in ihrer Herkunft:
| Herkunft | Risiko für Personenbezug | Beispiel |
|---|---|---|
| Frei erfunden, ohne Vorlage echter Daten | gering | Namen und Adressen aus einer Zufallsliste |
| Nach einem Muster erzeugt, das nur die Struktur beschreibt | gering bis mittel | «20 Kunden, zufällige Beträge, gültiges Datumsformat» |
| Aus echten Daten abgeleitet, mit Statistik nachgebildet | mittel | Verteilungen der echten Daten übernommen |
| Von einer KI nachgebildet, die mit echten Daten trainiert wurde | mittel bis hoch | KI kann Einzelfälle fast identisch wiedergeben |
| Echte Daten mit ersetzten Namen | hoch | Das ist Pseudonymisierung, nicht Anonymisierung |
Der Unterschied zwischen Anonymisierung und Pseudonymisierung erklärt Anonymisierung und Pseudonymisierung.
So lösen Sie es mit KI – Schritt für Schritt
- Bestimmen Sie den Zweck. Wofür brauchen Sie die Testdaten: Funktionstest, Schulung, Weitergabe an Dritte? Je weiter die Daten das Haus verlassen, desto höher die Anforderungen.
- Klären Sie, ob Sie echte Daten brauchen. Oft genügen frei erfundene Datensätze, die nur dem Format entsprechen. Das ist die sicherste Variante.
- Erzeugen Sie die Daten ohne Vorlage echter Daten. Beschreiben Sie nur Struktur und Regeln (Felder, Wertebereiche), nicht echte Beispiele aus Ihrer Datenbank. Vorlage unten.
- Wenn echte Daten als Grundlage dienen: dokumentieren Sie es. Notieren Sie, welche Daten verwendet wurden, mit welchem Werkzeug und auf welcher Rechtsgrundlage. Dann gelten die Datenschutzregeln für diese Verarbeitung.
- Prüfen Sie auf Wiedererkennung. Suchen Sie nach Datensätzen, die echten fast gleichen: seltene Namen, ungewöhnliche Kombinationen (Beruf, Wohnort, Alter), identische Freitexte. Vergleichen Sie Stichproben.
- Prüfen Sie seltene Merkmale. Eine 98-jährige Hebamme in einem Dorf ist auch ohne Namen erkennbar. Ändern Sie solche Ausreisser oder entfernen Sie sie.
- Entscheiden Sie, wie die Daten gelten. Sind sie anonym, pseudonym oder noch personenbezogen? Im Zweifel behandeln Sie sie wie Personendaten, siehe Daten anonymisieren.
- Begrenzen Sie die Weitergabe. Auch künstliche Daten gehören nicht unkontrolliert ins Netz. Legen Sie fest, wer sie nutzen darf und wann sie gelöscht werden.
Vorlage zum Kopieren
Mit diesem Auftrag erzeugen Sie frei erfundene Testdaten, ohne echte Daten zu verwenden:
Erzeuge [Anzahl, z. B. 30] frei erfundene Testdatensätze für [Zweck, z. B. Test einer Rechnungssoftware eines Schweizer Betriebs].
Felder: [z. B. Vorname, Nachname, Strasse und Nr., PLZ, Ort, Geburtsdatum, E-Mail, Rechnungsbetrag in CHF].
Regeln:
- Alle Angaben sind rein erfunden und dürfen nicht echten Personen oder Firmen entsprechen.
- Verwende gängige, nicht seltene Namen. Die E-Mail-Adressen enden auf «@beispiel.test».
- PLZ und Ort müssen zueinander passen, Strassen dürfen erfunden sein.
- Beträge zwischen [von] und [bis] CHF, Geburtsjahre zwischen [von] und [bis].
- Gib die Daten als Tabelle aus.
Erwähne am Ende, welche Datenfelder trotz erfundener Werte sensibel wären, wenn sie echten Personen entsprächen.Verwenden Sie in der Anfrage keine echten Beispieldatensätze. Prüfen Sie die Ausgabe auf Zufallstreffer mit echten Personen.
Worauf Sie achten müssen
- Zufallstreffer: Auch frei erfundene Namen und Adressen können zufällig real existieren. Mit Testdomänen wie «.test» und neutralen Mustern verringern Sie das Risiko.
- Gelerntes aus echten Daten: Wenn die KI mit Ihren Kundendaten trainiert oder gefüttert wurde, können Einzelheiten wieder auftauchen. Dann gelten die Datenschutzregeln für das Training, siehe Training mit eigenen Daten.
- Keine Garantie durch «Anonym»-Label: Ein Werkzeug, das «anonyme Daten» verspricht, entbindet Sie nicht von der eigenen Prüfung.
- Verknüpfung: Mehrere Datensätze zusammen können eine Person erkennbar machen, auch wenn jeder einzeln harmlos wirkt.
- Rechtliche Einordnung: Ob Daten im konkreten Fall anonym sind, ist eine Rechtsfrage. Ziehen Sie bei Unsicherheit eine Datenschutzfachperson bei; Hinweise gibt der EDÖB.
Ein Beispiel aus der Praxis
Ein Beispiel: Ein Softwarehaus in Zürich entwickelt eine Branchenlösung für Arztpraxen und braucht Testdaten für Patientenlisten.
Vorher: Ein Entwickler lässt eine KI «ähnliche Patientendaten» erzeugen und füttert sie mit zehn Zeilen aus der Demodatenbank eines Kunden. Die Ergebnisse enthalten Diagnosen und einen seltenen Nachnamen, der in der Gemeinde bekannt ist.
Nachher: Das Team verzichtet auf echte Beispielzeilen. Es beschreibt nur die Felder und Regeln, erzeugt erfundene Datensätze und prüft stichprobenweise auf seltene Namen und Kombinationen. Diagnosen werden aus einer erfundenen Liste verwendet. Die Datensätze erhalten ein Label «synthetisch», und die Datenschutzverantwortliche dokumentiert das Vorgehen.
So hilft Ihnen Alpasana
Wer KI in der Softwareentwicklung einsetzt, braucht klare Datenschutzgrenzen. Der Kurs KI für Developer mit Claude und Codex von absofort behandelt laut Beschreibung LLM-Grundlagen mit Datenschutz, Codegenerierung, Debugging und Review und liefert ein Entwickler-Playbook mit Prompts, Review-Regeln, Tests und Datenschutzgrenzen.
Für betreute Umsetzungen mit Testdaten bietet ready4future ICT Informatiklernende an, die standardmässig mit Testdaten sowie anonymisierten oder synthetischen Daten arbeiten.
Häufige Fragen
Darf ich synthetische Daten ohne Einwilligung verwenden?
Wenn sie wirklich keine Personendaten enthalten, gilt das Datenschutzrecht nicht. Wenn sie aus echten Daten stammen und Personen erkennbar sein könnten, braucht es eine Rechtsgrundlage, wie bei den echten Daten.
Kann ich Testdaten aus der Produktion einfach «verfremden»?
Das reine Ersetzen von Namen reicht oft nicht, weil andere Merkmale Personen verraten können. Das ist eine Pseudonymisierung. Prüfen Sie, ob wirklich alle Hinweise entfernt sind, oder verwenden Sie frei erfundene Daten.
Wie viele künstliche Daten brauche ich?
Für Funktionstests genügen meist wenige Dutzend Datensätze mit vielfältigen Fällen. Mehr Daten erhöhen den Aufwand der Prüfung, ohne unbedingt bessere Tests zu liefern.
Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. So arbeitet die Redaktion · Fehler entdeckt? Melden Sie es uns.
Hinweis: Dieser Beitrag gibt einen allgemeinen Überblick und ersetzt keine Rechtsberatung im Einzelfall. Massgeblich sind die geltenden Gesetzestexte.
Quellen
Weiterlesen in der Galaxie
- Wie anonymisiere ich Dokumente vor der KI-Nutzung?Daten anonymisieren KI: Entfernen Sie Namen, indirekte Hinweise und Metadaten aus Dokumenten und prüfen Sie die bereinigte Fassung vor dem Hochladen.
- Anonymisierung und Pseudonymisierung: Unterschied bei KIAnonymisierung und Pseudonymisierung unterscheiden: Prüfen Sie, ob Platzhalter Personendaten nur pseudonymisieren und welches Restrisiko bleibt.
- Wie gebe ich einer KI nur die wirklich nötigen Daten?Datenminimierung bei KI: Aufgaben mit Platzhaltern und nur nötigen Angaben formulieren, damit keine unnötigen Personendaten preisgegeben werden.
- Reicht das Löschen eines KI-Chats für den Datenschutz?KI-Chat löschen und Datenschutz: Was das Löschen eines Chatverlaufs bewirkt, warum Daten in Backups bleiben können und was Sie zusätzlich tun sollten.
- Reicht KI-Verpixelung, um Personen unkenntlich zu machen?Gesichter verpixeln KI Datenschutz: Warum Pixel oft nicht genügen und wie Sie Personen auf Fotos sicher unkenntlich machen, bevor Sie veröffentlichen.
- Was zählt rechtlich als KI-System?KI-System nach dem EU AI Act einfach erklärt: Welche Merkmale die Definition nennt, was nicht darunterfällt und warum die Einordnung wichtig ist.