Zum Inhalt springen

Sternenstaub – Glossar · Begriff · KI und IT für konkrete Arbeitsaufgaben

Text-to-Speech

Stand 10.10.2026 · 2 Min. Lesezeit

Kurz gesagt

Text-to-Speech (Sprachausgabe) wandelt geschriebenen Text in gesprochene Sprache um, mit einer künstlichen Stimme. Moderne Stimmen klingen oft natürlich, stolpern aber bei Namen, Zahlen und Abkürzungen. Hören Sie das Ergebnis immer an und kennzeichnen Sie KI-Stimmen, wenn sie wie echte Menschen wirken.

Definition

Text-to-Speech (TTS, auf Deutsch Sprachsynthese oder Sprachausgabe) bezeichnet Verfahren, die geschriebenen Text in hörbare Sprache umwandeln. Frühere Systeme setzten aufgenommene Lautstücke zusammen und klangen roboterhaft. Heutige KI-Stimmen berechnen die Sprache neu und können Betonung, Pausen und Stimmung nachahmen.

Man findet sie in Vorlesefunktionen, Navigationsgeräten, Sprachassistenten, Hörbüchern und Videos.

Einfach erklärt

Stellen Sie sich eine Sprecherin vor, die jeden Text vom Blatt liest. Sie hat viele Stimmen gelernt und kann Sätze natürlich betonen. Wenn aber ein Eigenname oder eine Abkürzung vorkommt, die sie nicht kennt, liest sie diesen falsch aus. Darum lohnt sich ein kurzer Probelauf.

Nützlich fürBeispiel
BarrierefreiheitWebtext vorlesen
Schulung und InformationAnleitung als Ton
VideoSprechertext ohne Aufnahme
Unterwegs hörenArtikel als Audio

Beispiel

Ein Beispiel: Ein Verein in Interlaken möchte die Einladung zur Hauptversammlung auch als Audio anbieten, für Mitglieder mit Sehschwäche. Die Sekretärin schreibt «Dienstag, 14. Oktober» aus, weil «14.10.» falsch gelesen wird, wählt eine deutsche Stimme und hört alles einmal an. Auf der Website steht «Mit KI-Stimme vorgelesen».

Datenschutz, Rechte und Kennzeichnung

Der Text wird bei vielen Diensten zum Anbieter übertragen. Vertrauliches gehört nicht hinein. Ob Sie Aufnahmen geschäftlich nutzen dürfen, regeln die Bedingungen. Die Stimme einer echten Person nachzubilden braucht deren Einwilligung, siehe Stimmenklonen. Praxis: Text mit KI vorlesen lassen.

Ein Praxistipp zur Stimmwahl: Hören Sie dieselbe Textstelle mit zwei oder drei Stimmen an und lassen Sie eine zweite Person urteilen. Achten Sie auf Tempo, Betonung am Satzende und die Aussprache Ihres Firmennamens. Eine ruhige, klare Stimme ist für Informationen meist besser als eine besonders ausdrucksstarke.

Nicht verwechseln

Text-to-Speech macht aus Text Ton, Spracherkennung macht aus Ton Text. Beide werden oft zusammen verwendet, etwa in Sprachassistenten.

So hilft Ihnen Alpasana

Die KI-Kurse für konkrete Arbeitsaufgaben von absofort nennen laut Angebotsbeschreibung Podcast- und Voiceover-Vorbereitung, mit Praxisaufgaben und KI-Lerncoach. So lernen Sie, Sprechertexte vorzubereiten und Ergebnisse zu prüfen.

Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.

Weiterlesen in der Galaxie