Zum Inhalt springen

Grundlagen · Begriff · absofort: KI-Weiterbildung mit verifizierbarem Lernnachweis

Was sind synthetische Daten?

Stand 10.10.2026 · 2 Min. Lesezeit

Kurz gesagt

Synthetische Daten sind künstlich erzeugte Daten, die echten Daten ähneln, aber nicht von echten Personen oder Vorgängen stammen. Man nutzt sie, um KI zu trainieren oder zu testen, wenn echte Daten fehlen oder geschützt sind. Sie ersetzen echte Daten nicht vollständig, denn Lücken und Fehler der Vorlage können mitgenommen werden.

Definition

Synthetische Daten sind Daten, die künstlich erzeugt wurden, statt aus der Wirklichkeit gesammelt zu werden. Sie sehen echten Daten ähnlich und haben ähnliche Eigenschaften, gehören aber keiner realen Person und beschreiben keinen realen Vorgang. Erzeugt werden sie durch Regeln, Simulationen oder durch eine KI.

Beispiele sind erfundene Kundenlisten mit realistischen Namen, Rechnungen mit zufälligen Beträgen oder Fotos, die ein Computer gezeichnet hat.

Einfach erklärt

Stellen Sie sich eine Pilotenschule vor. Wer das Landen üben will, muss nicht mit einem echten Flugzeug riskante Notlandungen wagen. Im Simulator werden Situationen künstlich nachgestellt, auch seltene. Synthetische Daten sind so etwas wie der Simulator für KI: Man erzeugt Beispiele, an denen sie üben oder geprüft werden kann.

Das hilft vor allem in drei Fällen: Echte Daten sind geschützt, etwa Patientenakten. Echte Daten gibt es zu wenige, zum Beispiel bei seltenen Ereignissen. Oder man möchte eine Software testen, ohne echte Kundendaten zu verwenden. Siehe Wie übe ich mit KI, ohne echte Kundendaten zu verwenden?.

Beispiel

Ein Beispiel: Ein Treuhandbüro in Aarau möchte eine KI testen, die Belege vorsortiert. Echte Kundenbelege darf es noch nicht hochladen. Es erzeugt deshalb 50 erfundene Belege mit typischen Positionen, Datumsformaten und einigen Fehlern wie fehlender Mehrwertsteuer. Mit diesen Testbelegen prüft es das Programm. Für den Echtbetrieb prüft es später zusätzlich Stichproben mit echten, freigegebenen Belegen.

Nicht verwechseln

Synthetische Daten sind nicht automatisch anonym oder fehlerfrei. Wer sie aus echten Daten ableitet, muss prüfen, ob sich Einzelne darin wiedererkennen lassen. Wer eine KI mit KI-erzeugten Daten trainiert, riskiert zudem Qualitätsverluste, siehe Was passiert, wenn KI mit KI-Inhalten trainiert wird?. Auch ersetzen sie nicht gute echte Trainingsdaten und die Prüfung am echten Alltag.

So hilft Ihnen Alpasana

Wer KI-Grundlagen strukturiert lernen möchte, findet bei absofort die KI-Weiterbildung mit verifizierbarem Lernnachweis. Die Online-Lernplattform bietet Praxisaufgaben, Modul-Quizze, einen KI-Lerncoach und Foundation-Angebote ohne Vorkenntnisse.

Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. So arbeitet die Redaktion · Fehler entdeckt? Melden Sie es uns.

Weiterlesen in der Galaxie