Zum Inhalt springen

Modell-Atlas · KI und IT für konkrete Arbeitsaufgaben

Welche KI kann mehrere Sprecher unterscheiden?

Stand 10.10.2026 · 4 Min. Lesezeit

Kurz gesagt

Viele Transkriptionsdienste können Sprechende trennen und als «Sprecher 1», «Sprecher 2» kennzeichnen. Die Zuordnung klappt bei klaren Aufnahmen mit wenigen, deutlich verschiedenen Stimmen gut, bei Überschneidungen und ähnlichen Stimmen schlecht. Testen Sie mit einem Ausschnitt Ihrer eigenen Aufnahme und prüfen Sie die Zuordnung von Hand.

Das Problem

Sie haben die Aufnahme einer Sitzung, eines Interviews oder einer Gesprächsrunde und brauchen ein Protokoll, in dem steht, wer was gesagt hat. Ein Transkript ohne Sprecherangaben ist ein langer Textblock ohne Zuordnung. Wer hat die Frist vorgeschlagen? Wer hat widersprochen? Das lässt sich daraus nur mit Mühe erkennen.

Die Technik dahinter heisst Sprechererkennung (Fachwort: Diarisation). Die KI schneidet die Aufnahme nach Stimmen auf und gibt jeder Stimme ein Label. Sie erkennt dabei nicht, wer jemand ist, sondern nur, dass eine Stimme anders klingt als die andere.

Die Qualität schwankt stark. Sie hängt von der Aufnahme ab, nicht nur vom Werkzeug. Welche KI bei Ihnen am besten funktioniert, sagt Ihnen keine Rangliste, sondern ein kurzer Test (Stand Oktober 2026).

So lösen Sie es mit KI – Schritt für Schritt

  1. Aufnahmesituation beschreiben: Wie viele Personen sprechen? Im selben Raum oder per Videokonferenz? Mit einem Mikrofon oder mehreren? Reden sie durcheinander?
  2. Einwilligung sicherstellen: Alle Beteiligten müssen wissen, dass aufgenommen und ausgewertet wird. Siehe Gespräch aufnehmen: Einwilligung.
  3. Testausschnitt wählen: Nehmen Sie fünf Minuten Ihrer Aufnahme, in denen mehrere Personen sprechen, am besten mit einer Stelle, an der sie sich ins Wort fallen.
  4. Zwei bis drei Werkzeuge wählen: Prüfen Sie, ob Sprechererkennung enthalten ist und ob Sie die Zahl der Sprechenden vorgeben können. Vergleich: Transkriptionswerkzeuge vergleichen.
  5. Gleiche Einstellungen verwenden: Sprache Deutsch, Sprecheranzahl falls einstellbar.
  6. Zuordnung prüfen: Hören Sie das Ergebnis mit und markieren Sie falsch zugeordnete Sätze.
  7. Fehler zählen: Wie viele Wechsel wurden richtig erkannt? Wie viele Sätze falsch zugeordnet? Verwenden Sie die Tabelle.
  8. Namen zuweisen: Ersetzen Sie die Labels («Sprecher 1») durch Namen, aber nur, wenn die Zuordnung zuverlässig ist.
  9. Bei Bedarf Aufnahme verbessern: Ein Mikrofon pro Person oder getrennte Spuren bei Videokonferenzen verbessern die Zuordnung deutlich.

Ein paar Regeln vor der Aufnahme erleichtern die Arbeit erheblich. Bitten Sie die Teilnehmenden, nacheinander zu sprechen und zu Beginn kurz ihren Namen zu nennen. Das hilft später beim Zuweisen der Labels. Stellen Sie das Mikrofon möglichst in die Mitte und weg von Lüftern oder Papierrascheln. Bei Videokonferenzen prüfen Sie, ob die Software getrennte Tonspuren pro Person speichern kann. Dann ist die Zuordnung technisch fast gelöst.

Planen Sie ausserdem Zeit für die Nachbearbeitung ein. Selbst gute Werkzeuge machen Fehler, und die Korrektur der Sprecherlabels dauert bei einer Stunde Aufnahme oft länger, als man denkt. Rechnen Sie das in Ihren Zeitplan ein, sonst enttäuscht das Ergebnis.

Vorlage zum Kopieren

Sprecher-Test
Aufnahme: [Titel, Datum]   Ausschnitt: [Minute von – bis]   Anzahl Sprechende: [ ]
Aufnahmeart: [ein Raummikrofon / Videokonferenz / getrennte Spuren]
Werkzeug A: Sprecher erkannt [ ] von [ ] | Zuordnungsfehler [ ] | Überlappungen richtig? [ja/teilweise/nein]
Werkzeug B: Sprecher erkannt [ ] von [ ] | Zuordnungsfehler [ ] | Überlappungen richtig? [ja/teilweise/nein]
Sprecherzahl einstellbar? [A: ja/nein, B: ja/nein]
Nacharbeit geschätzt (Minuten pro Aufnahmestunde): [ ]
Entscheid: [ ]

Wiederholen Sie den Test mit einem zweiten Ausschnitt, damit nicht ein Zufallstreffer entscheidet.

Worauf Sie achten müssen

  • Zuschreibung hat Gewicht: Eine falsch zugeordnete Aussage in einem Protokoll kann Folgen haben. Kontrollieren Sie wichtige Aussagen anhand der Aufnahme.
  • Überschneidungen: Wenn zwei gleichzeitig sprechen, geht meist eine Aussage verloren oder wird zugeordnet, wie es das Modell «errät».
  • Ähnliche Stimmen: Zwei Personen ähnlichen Alters und gleicher Tonlage werden eher verwechselt.
  • Telefon und Videokonferenz: Komprimierte Stimmen und Aussetzer verschlechtern die Erkennung.
  • Datenschutz: Aufnahmen enthalten Personendaten. Prüfen Sie Speicherort und Löschung, siehe Vertrauliche Aufnahmen transkribieren.
  • Stimmprofile: Dienste, die Stimmen dauerhaft einer Person zuordnen, verarbeiten besonders heikle Daten. Prüfen Sie das mit Fachpersonen.
AufnahmeErwartbare QualitätTipp
Zwei Personen, ruhig, gutes MikrofongutSprecheranzahl angeben
Vier bis sechs Personen im Raummittelein Rundmikrofon in der Mitte
DurcheinanderredenschlechtGesprächsdisziplin vor der Aufnahme
Videokonferenz mit getrennten SpurengutAufzeichnung pro Teilnehmer nutzen
Telefonatmittelbeide Seiten separat aufnehmen

Ein Beispiel aus der Praxis

Ein Beispiel: Die Aktuarin eines Stiftungsrats in Basel will die Sitzungen künftig mit KI protokollieren. Sechs Personen sitzen an einem Tisch.

Vorher: Das Rohtranskript ist ein einziger Textblock, in dem Beschlüsse und Zuständigkeiten nicht zuzuordnen sind.

Nachher: Sie testet zwei Werkzeuge mit einem fünfminütigen Ausschnitt. Beide verwechseln zwei Männerstimmen. Mit einem Rundmikrofon in der Tischmitte und einer kurzen Bitte «bitte nacheinander sprechen» sinkt die Zahl der Fehler spürbar. Namen weist sie von Hand zu und prüft jeden Beschluss anhand der Aufnahme. Den Teilnehmenden hat sie die Aufnahme vorher schriftlich mitgeteilt.

So hilft Ihnen Alpasana

Wer Sitzungen und Gespräche sicher auswerten möchte, übt das am besten an einem eigenen Beispiel. Die KI-Kurse für konkrete Arbeitsaufgaben von absofort behandeln Bürokommunikation und Meetings mit Praxisaufgaben und KI-Lerncoach.

Häufige Fragen

Kann die KI erkennen, wie die Person heisst?

Nein. Sie unterscheidet nur Stimmen und nummeriert sie. Namen müssen Sie selbst zuordnen.

Wie viele Sprechende sind möglich?

Das hängt vom Werkzeug ab. Je mehr Personen, desto höher die Fehlerquote. Vier bis fünf Personen sind oft schon anspruchsvoll.

Was hilft am meisten für bessere Ergebnisse?

Eine gute Aufnahme: ein Mikrofon nahe bei jeder Person oder getrennte Spuren, wenig Hall, ein Gespräch ohne Durcheinanderreden. Das bringt mehr als der Werkzeugwechsel.

Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.

Weiterlesen in der Galaxie