Sternenstaub – Glossar · Begriff · KI und IT für konkrete Arbeitsaufgaben
Spracherkennung
Kurz gesagt
Spracherkennung wandelt gesprochene Sprache automatisch in geschriebenen Text um. Sie steckt in Diktierfunktionen, Untertiteln und Transkriptionsdiensten. Gut klappt sie bei klarer Sprache und ruhiger Umgebung, schlechter bei Dialekt, Lärm, Fachwörtern und mehreren Sprechenden.
Definition
Spracherkennung (englisch «Speech-to-Text» oder «Automatic Speech Recognition») ist die Technik, die gesprochene Wörter in Text verwandelt. Ein KI-Modell hört die Tonaufnahme, zerlegt sie in kleine Lautstücke und berechnet, welche Wörter und Sätze am besten dazu passen.
Moderne Systeme erkennen auch Satzzeichen, mehrere Sprachen und teilweise unterschiedliche Sprechende. Wichtig: Sie «verstehen» den Inhalt nicht, sie schreiben mit.
Einfach erklärt
Stellen Sie sich eine Schreibkraft vor, die sehr schnell mitschreibt und dabei oft richtig rät, was gemeint ist. Bei klarer Aussprache gelingt das sehr gut. Bei Lärm, Dialekt oder unbekannten Namen rät sie öfter falsch. Wer das weiss, kann den Text rasch durchsehen und korrigieren.
| Gute Bedingungen | Schwierige Bedingungen |
|---|---|
| ruhiger Raum | Lärm, Echo, Musik |
| Hochdeutsch, deutliche Aussprache | Dialekt, starker Akzent |
| ein Sprecher | mehrere, die sich überlappen |
| bekannte Wörter | Fachwörter, Eigennamen |
Beispiel
Ein Beispiel: Eine Pflegedienstleiterin in Brugg diktiert ihre Notizen nach dem Rapport in die Diktierfunktion ihres Handys, statt sie am Abend zu tippen. Die Namen der Medikamente werden teils falsch geschrieben. Sie legt deshalb eine kleine Wörterliste an und prüft den Text vor dem Speichern. Patientendaten gibt sie nur in Systeme ein, für die der Betrieb dies freigegeben hat.
Datenschutz und Aufzeichnung
Viele Dienste verarbeiten die Aufnahme auf fremden Servern. Bei Gesprächen mit Personendaten oder vertraulichen Inhalten müssen Sie prüfen, ob das erlaubt ist, und alle Beteiligten informieren. Mehr: Spracherkennung einfach erklärt.
Nicht verwechseln
Spracherkennung ist die Umwandlung von Sprache in Text. Das Gegenteil, Text in Stimme, heisst Text-to-Speech. Auch ein Sprachassistent, der Befehle ausführt, ist mehr als reine Spracherkennung. Wer Aufnahmen auswerten will, liest Audio mit KI in Text umwandeln.
So hilft Ihnen Alpasana
Die KI-Kurse für konkrete Arbeitsaufgaben von absofort behandeln laut Angebotsbeschreibung Bürokommunikation mit E-Mails und Meetings sowie Podcast- und Voiceover-Vorbereitung, mit Praxisaufgaben und KI-Lerncoach. So lernen Sie, Aufnahmen sinnvoll und sicher in Text zu überführen.
Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.
Weiterlesen in der Galaxie
- Wie wandelt KI gesprochene Sprache in Text um?Spracherkennung einfach erklärt: wie KI aus gesprochenen Worten Text macht, wo Diktieren und Transkription im Büro helfen und warum Dialekt schwierig ist.
- Audio mit KI in Text umwandeln und Fehler korrigierenAudio transkribieren mit KI: So wird eine Aufnahme zum Text mit Sprecherkennung, und so korrigieren Sie Fehler bei Namen, Zahlen und Fachwörtern.
- Was ist der Unterschied zwischen Transkript und Protokoll?Transkript oder Protokoll: Das Transkript hält Gesprochenes wörtlich fest, das Protokoll fasst Ergebnisse zusammen. So wählen Sie die passende Form.
- Text-to-SpeechWas ist Text-to-Speech? Einfach erklärt: Wie ein Text in eine künstliche gesprochene Stimme umgewandelt wird, wo sie hilft und worauf Sie achten sollten.
- Welche KI schreibt deutsche Aufnahmen zuverlässig ab?KI Transkription Deutsch: Welche Spracherkennung Aufnahmen mit wenig Nacharbeit abschreibt, wie Sie Modelle mit eigener Aufnahme vergleichen und prüfen.