Eigene LLMs & KI-Systeme · KI und IT für konkrete Arbeitsaufgaben
Wie misst die KI, ob zwei Texte ähnlich sind?
Kurz gesagt
Die KI wandelt jeden Text in eine Zahlenfolge um und misst dann, wie nah sich zwei Folgen sind, meist über den Winkel zwischen ihnen (Kosinus-Ähnlichkeit). Je näher, desto ähnlicher die Bedeutung. Der Wert zeigt Nähe, nicht Wahrheit: Ein hoher Wert bedeutet nur, dass die Texte vom selben Thema handeln.
Das Problem
Ihre KI-Suche liefert Treffer, und neben jedem steht ein Wert, zum Beispiel 0,82 oder 0,67. Was bedeutet das? Ist 0,82 «gut»? Warum steht ein Abschnitt, der offensichtlich nicht passt, trotzdem weit oben? Und wieso findet die KI zwei Sätze «ähnlich», die für Menschen das Gegenteil sagen?
Hinter solchen Zahlen steckt eine einfache Idee, die man auch ohne Mathematik verstehen kann. Wer sie kennt, interpretiert Suchergebnisse besser, erkennt Grenzen und stellt Schwellenwerte vernünftig ein. Das hilft, wenn Sie einen Chatbot oder eine Dokumentensuche aufbauen und beurteilen müssen, warum bestimmte Treffer erscheinen.
Eine KI (ein Programm, das Texte versteht und schreibt) kann Ihnen die Begriffe mit Beispielen erklären. Die Bewertung konkreter Suchergebnisse bleibt Ihre Aufgabe.
Einfach erklärt
Stellen Sie sich eine Landkarte vor, auf der jeder Text einen Punkt hat. Texte, die vom Gleichen handeln, liegen nahe beieinander, etwa «Kündigungsfrist» und «Ende des Arbeitsverhältnisses». Texte über andere Themen liegen weit entfernt. Das Embedding ist die Koordinate dieses Punktes, nur dass die Karte nicht zwei, sondern Hunderte von Richtungen hat.
Um die Nähe zu messen, gibt es mehrere Verfahren. Am häufigsten ist die Kosinus-Ähnlichkeit: Sie vergleicht die Richtung, in die zwei Zahlenfolgen zeigen. Zeigen sie fast in dieselbe Richtung, ist der Wert nahe 1. Weitere Masse sind das Skalarprodukt und der Abstand zwischen den Punkten. Bei normierten Zahlenfolgen führen Kosinus und Skalarprodukt zum selben Ergebnis.
| Mass | Anschaulich | Typische Verwendung |
|---|---|---|
| Kosinus-Ähnlichkeit | gleiche Richtung | Standard bei Textsuche |
| Skalarprodukt | Richtung und Länge | wenn Zahlen normiert sind |
| Euklidischer Abstand | Entfernung der Punkte | seltener bei Text |
So lösen Sie es mit KI – Schritt für Schritt
- Grundidee klären: Jeder Text wird zu einer Zahlenfolge. Die Ähnlichkeit ist ein Mass dafür, wie nah zwei Folgen beieinander liegen.
- Modell festhalten: Werte gelten nur innerhalb eines Modells. Ein Wert von 0,8 bei Modell A ist nicht mit 0,8 bei Modell B vergleichbar.
- Beispiele ansehen: Lassen Sie für einige Fragen die ersten zehn Treffer mit ihren Werten ausgeben. Lesen Sie die Abschnitte und notieren Sie, welche passen.
- Muster erkennen: Ab welchem Wert werden die Treffer unbrauchbar? Das ist je Modell und Textart verschieden.
- Schwellenwert festlegen: Legen Sie eine Grenze fest, unterhalb derer Treffer nicht angezeigt werden, und testen Sie diese mit Fragen ohne Antwort. Siehe Vektorsuche: Schwellenwert.
- Grenzen kennen: Ähnlichkeit erfasst Thema und Wortschatz, aber nicht Verneinungen, Zahlen oder feine Unterschiede.
- Ergebnisse prüfen: Lassen Sie wichtige Antworten von einer Fachperson gegen die Quelle prüfen.
Ein Beispiel aus der Praxis
Ein Beispiel: Ein Reisebüro in Lugano durchsucht seine Reisebedingungen. Die Frage «Kann ich meine Buchung stornieren?» liefert zwei Treffer mit ähnlich hohen Werten: einen Abschnitt über Stornierungsfristen und einen über Annullierungen durch den Veranstalter. Beide handeln vom selben Thema, beantworten aber nicht dasselbe. Die Sachbearbeiterin sieht: Der Wert sagt, dass beide passen könnten, nicht, welcher richtig ist.
Ebenso ähnlich bewertet die Suche «Das Hotel ist gratis stornierbar» und «Das Hotel ist nicht gratis stornierbar», weil sie fast gleiche Wörter und dasselbe Thema enthalten. Die Verneinung geht im Zahlenwert fast verloren.
Vorher: Die Sachbearbeiterin vertraute der Reihenfolge der Treffer und gab dem Kunden die erste Antwort weiter. Nachher: Sie liest bei jeder Auskunft den Originalabschnitt und fragt bei Fristen und Preisen zusätzlich nach dem genauen Wortlaut. Das kostet eine Minute mehr, verhindert aber falsche Zusagen. Das Beispiel ist erfunden und zeigt nur das Prinzip.
Worauf Sie achten müssen
- Nähe ist nicht Richtigkeit: Ein hoher Wert bedeutet gleiches Thema, nicht richtige Antwort. Prüfen Sie Aussagen am Originaltext.
- Verneinungen und Zahlen: Embeddings erfassen sie schlecht. Bei Preisen, Fristen und Mengen helfen Stichwortsuche und genaue Prüfung.
- Keine festen Schwellenwerte: Es gibt keine allgemeingültige Grenze wie «ab 0,7 ist es gut». Sie hängt von Modell und Texten ab.
- Modell nicht mischen: Werte und Zahlenfolgen verschiedener Modelle sind nicht vergleichbar.
- Datenschutz: Auch die Zahlenfolgen stammen aus Ihren Texten und sind entsprechend zu schützen.
So hilft Ihnen Alpasana
Wenn Sie KI-Suche und lokale Modelle praktisch kennenlernen möchten, bietet absofort mit KI und IT für konkrete Arbeitsaufgaben Kurse an, laut Beschreibung unter anderem zu No-Code-Automatisierung, KI-Agenten und lokaler KI mit Ollama und Open-Source-Modellen. Praxisaufgaben und ein KI-Lerncoach unterstützen das Üben.
Ob die Bewertung von Suchtreffern im gewählten Kurs vertieft wird, sehen Sie im Kursangebot.
Häufige Fragen
Was ist ein guter Ähnlichkeitswert?
Das hängt vom Modell und von Ihren Texten. Betrachten Sie echte Beispiele und legen Sie die Grenze nach eigener Beobachtung fest.
Warum findet die KI Texte ähnlich, die sich widersprechen?
Weil die Bedeutungskarte Themen abbildet, nicht Wahrheit. Gegensätze haben oft viele gleiche Wörter und liegen daher nahe beieinander.
Ist Kosinus-Ähnlichkeit das einzige Mass?
Nein, aber das gebräuchlichste. Die Wahl richtet sich oft nach dem Modell und der Vektordatenbank. Mehr zur Vektorsuche in Vektorsuche: Genauigkeit und Tempo.
Kann ich die Ähnlichkeit zweier Texte selbst testen?
Ja, mit einem lokalen Embedding-Modell. Eine Anleitung bietet Embeddings lokal erstellen.
Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.
Weiterlesen in der Galaxie
- EmbeddingWas sind Embeddings? Einfach erklärt: Wie KI Wörter und Dokumente als Zahlenlisten darstellt, um Bedeutungen zu vergleichen, und wofür das nützlich ist.
- Was sind Embeddings und wofür braucht unser Chatbot sie?Embeddings einfach erklärt: Wie Zahlenreihen die Bedeutung von Texten abbilden, damit ein Chatbot ähnliche Inhalte findet, auch bei anderen Wörtern.
- Semantische Suche oder Stichwortsuche für unsere Dokumente?Semantische Suche oder Stichwortsuche: Welche Suche bei Ihren Dokumenten und unterschiedlichen Formulierungen bessere Treffer liefert, mit Praxistest.