Modell-Atlas · KI und IT für konkrete Arbeitsaufgaben
Welche KI kann mehrere Sprecher unterscheiden?
Kurz gesagt
Viele Transkriptionsdienste können Sprechende trennen und als «Sprecher 1», «Sprecher 2» kennzeichnen. Die Zuordnung klappt bei klaren Aufnahmen mit wenigen, deutlich verschiedenen Stimmen gut, bei Überschneidungen und ähnlichen Stimmen schlecht. Testen Sie mit einem Ausschnitt Ihrer eigenen Aufnahme und prüfen Sie die Zuordnung von Hand.
Das Problem
Sie haben die Aufnahme einer Sitzung, eines Interviews oder einer Gesprächsrunde und brauchen ein Protokoll, in dem steht, wer was gesagt hat. Ein Transkript ohne Sprecherangaben ist ein langer Textblock ohne Zuordnung. Wer hat die Frist vorgeschlagen? Wer hat widersprochen? Das lässt sich daraus nur mit Mühe erkennen.
Die Technik dahinter heisst Sprechererkennung (Fachwort: Diarisation). Die KI schneidet die Aufnahme nach Stimmen auf und gibt jeder Stimme ein Label. Sie erkennt dabei nicht, wer jemand ist, sondern nur, dass eine Stimme anders klingt als die andere.
Die Qualität schwankt stark. Sie hängt von der Aufnahme ab, nicht nur vom Werkzeug. Welche KI bei Ihnen am besten funktioniert, sagt Ihnen keine Rangliste, sondern ein kurzer Test (Stand Oktober 2026).
So lösen Sie es mit KI – Schritt für Schritt
- Aufnahmesituation beschreiben: Wie viele Personen sprechen? Im selben Raum oder per Videokonferenz? Mit einem Mikrofon oder mehreren? Reden sie durcheinander?
- Einwilligung sicherstellen: Alle Beteiligten müssen wissen, dass aufgenommen und ausgewertet wird. Siehe Gespräch aufnehmen: Einwilligung.
- Testausschnitt wählen: Nehmen Sie fünf Minuten Ihrer Aufnahme, in denen mehrere Personen sprechen, am besten mit einer Stelle, an der sie sich ins Wort fallen.
- Zwei bis drei Werkzeuge wählen: Prüfen Sie, ob Sprechererkennung enthalten ist und ob Sie die Zahl der Sprechenden vorgeben können. Vergleich: Transkriptionswerkzeuge vergleichen.
- Gleiche Einstellungen verwenden: Sprache Deutsch, Sprecheranzahl falls einstellbar.
- Zuordnung prüfen: Hören Sie das Ergebnis mit und markieren Sie falsch zugeordnete Sätze.
- Fehler zählen: Wie viele Wechsel wurden richtig erkannt? Wie viele Sätze falsch zugeordnet? Verwenden Sie die Tabelle.
- Namen zuweisen: Ersetzen Sie die Labels («Sprecher 1») durch Namen, aber nur, wenn die Zuordnung zuverlässig ist.
- Bei Bedarf Aufnahme verbessern: Ein Mikrofon pro Person oder getrennte Spuren bei Videokonferenzen verbessern die Zuordnung deutlich.
Ein paar Regeln vor der Aufnahme erleichtern die Arbeit erheblich. Bitten Sie die Teilnehmenden, nacheinander zu sprechen und zu Beginn kurz ihren Namen zu nennen. Das hilft später beim Zuweisen der Labels. Stellen Sie das Mikrofon möglichst in die Mitte und weg von Lüftern oder Papierrascheln. Bei Videokonferenzen prüfen Sie, ob die Software getrennte Tonspuren pro Person speichern kann. Dann ist die Zuordnung technisch fast gelöst.
Planen Sie ausserdem Zeit für die Nachbearbeitung ein. Selbst gute Werkzeuge machen Fehler, und die Korrektur der Sprecherlabels dauert bei einer Stunde Aufnahme oft länger, als man denkt. Rechnen Sie das in Ihren Zeitplan ein, sonst enttäuscht das Ergebnis.
Vorlage zum Kopieren
Sprecher-Test
Aufnahme: [Titel, Datum] Ausschnitt: [Minute von – bis] Anzahl Sprechende: [ ]
Aufnahmeart: [ein Raummikrofon / Videokonferenz / getrennte Spuren]
Werkzeug A: Sprecher erkannt [ ] von [ ] | Zuordnungsfehler [ ] | Überlappungen richtig? [ja/teilweise/nein]
Werkzeug B: Sprecher erkannt [ ] von [ ] | Zuordnungsfehler [ ] | Überlappungen richtig? [ja/teilweise/nein]
Sprecherzahl einstellbar? [A: ja/nein, B: ja/nein]
Nacharbeit geschätzt (Minuten pro Aufnahmestunde): [ ]
Entscheid: [ ]Wiederholen Sie den Test mit einem zweiten Ausschnitt, damit nicht ein Zufallstreffer entscheidet.
Worauf Sie achten müssen
- Zuschreibung hat Gewicht: Eine falsch zugeordnete Aussage in einem Protokoll kann Folgen haben. Kontrollieren Sie wichtige Aussagen anhand der Aufnahme.
- Überschneidungen: Wenn zwei gleichzeitig sprechen, geht meist eine Aussage verloren oder wird zugeordnet, wie es das Modell «errät».
- Ähnliche Stimmen: Zwei Personen ähnlichen Alters und gleicher Tonlage werden eher verwechselt.
- Telefon und Videokonferenz: Komprimierte Stimmen und Aussetzer verschlechtern die Erkennung.
- Datenschutz: Aufnahmen enthalten Personendaten. Prüfen Sie Speicherort und Löschung, siehe Vertrauliche Aufnahmen transkribieren.
- Stimmprofile: Dienste, die Stimmen dauerhaft einer Person zuordnen, verarbeiten besonders heikle Daten. Prüfen Sie das mit Fachpersonen.
| Aufnahme | Erwartbare Qualität | Tipp |
|---|---|---|
| Zwei Personen, ruhig, gutes Mikrofon | gut | Sprecheranzahl angeben |
| Vier bis sechs Personen im Raum | mittel | ein Rundmikrofon in der Mitte |
| Durcheinanderreden | schlecht | Gesprächsdisziplin vor der Aufnahme |
| Videokonferenz mit getrennten Spuren | gut | Aufzeichnung pro Teilnehmer nutzen |
| Telefonat | mittel | beide Seiten separat aufnehmen |
Ein Beispiel aus der Praxis
Ein Beispiel: Die Aktuarin eines Stiftungsrats in Basel will die Sitzungen künftig mit KI protokollieren. Sechs Personen sitzen an einem Tisch.
Vorher: Das Rohtranskript ist ein einziger Textblock, in dem Beschlüsse und Zuständigkeiten nicht zuzuordnen sind.
Nachher: Sie testet zwei Werkzeuge mit einem fünfminütigen Ausschnitt. Beide verwechseln zwei Männerstimmen. Mit einem Rundmikrofon in der Tischmitte und einer kurzen Bitte «bitte nacheinander sprechen» sinkt die Zahl der Fehler spürbar. Namen weist sie von Hand zu und prüft jeden Beschluss anhand der Aufnahme. Den Teilnehmenden hat sie die Aufnahme vorher schriftlich mitgeteilt.
So hilft Ihnen Alpasana
Wer Sitzungen und Gespräche sicher auswerten möchte, übt das am besten an einem eigenen Beispiel. Die KI-Kurse für konkrete Arbeitsaufgaben von absofort behandeln Bürokommunikation und Meetings mit Praxisaufgaben und KI-Lerncoach.
Häufige Fragen
Kann die KI erkennen, wie die Person heisst?
Nein. Sie unterscheidet nur Stimmen und nummeriert sie. Namen müssen Sie selbst zuordnen.
Wie viele Sprechende sind möglich?
Das hängt vom Werkzeug ab. Je mehr Personen, desto höher die Fehlerquote. Vier bis fünf Personen sind oft schon anspruchsvoll.
Was hilft am meisten für bessere Ergebnisse?
Eine gute Aufnahme: ein Mikrofon nahe bei jeder Person oder getrennte Spuren, wenig Hall, ein Gespräch ohne Durcheinanderreden. Das bringt mehr als der Werkzeugwechsel.
Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.
Weiterlesen in der Galaxie
- Wie trenne ich verschiedene Sprecher im Transkript?Transkription Sprecher erkennen: So verbessern Sie die Zuordnung, wer was gesagt hat, durch gute Aufnahme, Vorstellungsrunde und gezielte Nachbearbeitung der Namen.
- Welche KI schreibt deutsche Aufnahmen zuverlässig ab?KI Transkription Deutsch: Welche Spracherkennung Aufnahmen mit wenig Nacharbeit abschreibt, wie Sie Modelle mit eigener Aufnahme vergleichen und prüfen.
- Welche KI versteht Sprache trotz Hintergrundgeräuschen?Spracherkennung bei Lärm: Wie robust KI-Transkription gegen Hintergrundgeräusche ist, wie Sie Dienste testen und was die Qualität verbessert.
- Audio mit KI in Text umwandeln und Fehler korrigierenAudio transkribieren mit KI: So wird eine Aufnahme zum Text mit Sprecherkennung, und so korrigieren Sie Fehler bei Namen, Zahlen und Fachwörtern.