Zum Inhalt springen

Eigene LLMs & KI-Systeme · KI und IT für konkrete Arbeitsaufgaben

Wie erstellt Ollama Embeddings für eine Suchfunktion?

Stand 10.10.2026 · 5 Min. Lesezeit

Kurz gesagt

Ollama kann neben Chat-Modellen auch Embedding-Modelle betreiben. Sie laden ein solches Modell herunter und senden Texte an die Schnittstelle des lokalen Dienstes, der für jeden Text eine Zahlenfolge zurückgibt. Diese Folgen speichern Sie für die Suche. Chat- und Embedding-Modell sind getrennte Modelle.

Das Problem

Sie haben Ollama installiert, ein Programm, das Sprachmodelle auf dem eigenen Rechner betreibt. Der Chat läuft gut. Nun möchten Sie eine Suche über Ihre Dokumente bauen, die den Sinn von Fragen versteht, und stossen auf den Begriff «Embeddings». Brauchen Sie dafür ein neues Programm?

Die gute Nachricht: Nein. Ollama kann auch Embedding-Modelle betreiben. Das sind spezielle, meist kleinere Modelle, die Text nicht beantworten, sondern in eine Zahlenfolge verwandeln. Texte mit ähnlicher Bedeutung erhalten ähnliche Zahlenfolgen, und darauf baut die Suche auf.

Die Umsetzung ist technisch, aber überschaubar. Wenn Sie Ollama schon nutzen, ist der Schritt klein. Eine KI hilft beim Planen. Das Einrichten und Testen brauchen jedoch jemanden mit technischem Grundverständnis.

So lösen Sie es mit KI – Schritt für Schritt

  1. Voraussetzung prüfen: Ollama läuft auf dem Rechner und ist erreichbar. Der Dienst lauscht standardmässig nur lokal auf dem Rechner, was für den Anfang richtig ist.
  2. Embedding-Modell auswählen: Schauen Sie in der Modellbibliothek von Ollama, welche Embedding-Modelle angeboten werden, und prüfen Sie Sprache, Grösse und Lizenz. Beispiele, die dort geführt werden, sind nomic-embed-text, mxbai-embed-large und bge-m3. Prüfen Sie den aktuellen Stand und ob das Modell Deutsch gut unterstützt.
  3. Modell herunterladen: Laden Sie es mit dem Befehl ollama pull und dem Modellnamen herunter.
  4. Ersten Text testen: Senden Sie einen Satz an die Schnittstelle und prüfen Sie, dass eine Zahlenfolge zurückkommt.
  5. Mehrere Texte verarbeiten: Die Schnittstelle nimmt auch eine Liste von Texten entgegen. Verarbeiten Sie Abschnitte in kleinen Gruppen, damit nichts überlastet wird.
  6. Ergebnisse speichern: Speichern Sie jede Zahlenfolge zusammen mit dem Originaltext, Dateiname und Position, zum Beispiel in einer Vektordatenbank.
  7. Fragen genauso behandeln: Erstellen Sie auch für Suchfragen ein Embedding mit demselben Modell und vergleichen Sie es mit den gespeicherten.
  8. Modell und Einstellungen notieren: Halten Sie Modellname, Version und Datum fest. Bei einem Wechsel müssen alle Embeddings neu berechnet werden.

Ein einfacher Test mit der Schnittstelle von Ollama sieht so aus (Technikkenntnisse nötig):

curl http://localhost:11434/api/embed -d '{"model": "[Modellname]", "input": ["Wie lange ist die Kündigungsfrist?"]}'

Vorlage zum Kopieren

Du hilfst mir, mit Ollama Embeddings für eine Dokumentensuche zu erstellen. Deutsch (Schweiz), Schritt für Schritt, einfache Sprache.
Mein System: [Betriebssystem, Arbeitsspeicher, Grafikkarte falls vorhanden], Ollama läuft bereits: [ja/nein]
Meine Texte: [Art, Sprache, ungefähre Menge]
Aufgabe: 1. Erkläre, was ein Embedding-Modell von einem Chat-Modell unterscheidet. 2. Nenne die Schritte vom Herunterladen eines Embedding-Modells bis zum ersten gespeicherten Ergebnis. 3. Nenne fünf Fehler, die Anfänger häufig machen (z. B. verschiedene Modelle für Fragen und Texte). 4. Schlage einen Test mit zehn Fragen vor.
Erfinde keine Befehle, Modellnamen oder Versionsangaben. Wenn du unsicher bist, schreibe «in der Ollama-Dokumentation prüfen».

Setzen Sie Ihre Angaben ein. Befehle und Modellnamen prüfen Sie in der offiziellen Ollama-Dokumentation, bevor Sie sie ausführen.

Worauf Sie achten müssen

  • Gleiches Modell für alles: Texte und Fragen müssen mit demselben Embedding-Modell erstellt werden. Mischen führt zu unbrauchbaren Treffern.
  • Nicht ins Netz öffnen: Machen Sie den Dienst nicht ungeschützt im Netzwerk oder Internet verfügbar. Er hat standardmässig keine Anmeldung.
  • Deutsch testen: Manche Embedding-Modelle sind auf Englisch ausgelegt. Prüfen Sie mit Fachbegriffen und Schweizer Ausdrücken, ob die Suche taugt.
  • Datenschutz: Auch lokal gespeicherte Embeddings stammen aus Ihren Texten und sind schützenswert. Siehe Embeddings und Datenschutz.
  • Lizenz: Prüfen Sie, ob Sie das Modell geschäftlich nutzen dürfen.
  • Versionen ändern sich: Befehle und Modellangebote entwickeln sich weiter. Halten Sie sich an die aktuelle Dokumentation.

Ein Beispiel aus der Praxis

Ein Beispiel: Ein Installationsbetrieb in Aarau mit 15 Mitarbeitenden hat Ollama für Textentwürfe eingerichtet. Der technische Leiter möchte nun die Montageanleitungen und Sicherheitsvorschriften durchsuchbar machen, ohne Daten in die Cloud zu senden.

Vorher: Die Mitarbeitenden suchen in Ordnern und fragen oft den Chef.

Nachher: Er lädt ein Embedding-Modell herunter, teilt die Anleitungen in Abschnitte und erzeugt die Zahlenfolgen in kleinen Gruppen. Er speichert sie mit Dateiname und Seitenzahl. Bei 20 Testfragen findet die Suche die meisten Stellen, ausser bei Abkürzungen der Fachsprache. Er ergänzt eine Liste mit Begriffen und testet erneut.

SchrittWerkzeug
Modell ladenOllama
Texte umwandelnSchnittstelle von Ollama
SpeichernDatei oder Vektordatenbank
Fragen vergleichengleiches Modell

Der Betrieb hat damit eine erste lokale Suche, die er schrittweise verbessern kann.

So hilft Ihnen Alpasana

Wenn Sie lokale KI mit Ollama kennenlernen oder in Abläufe einbinden möchten, bietet absofort mit KI und IT für konkrete Arbeitsaufgaben Kurse zu No-Code-Automatisierung, KI-Agenten und lokaler KI mit Ollama und Open-Source-Modellen. Praxisaufgaben, ein KI-Lerncoach und ein verifizierbarer Abschluss gehören dazu.

Ob die Themen Embeddings und Suche im gewählten Kurs vertieft werden, sehen Sie im Kursangebot. Einen Einstieg in Ollama bietet Ollama: lokaler Einstieg.

Häufige Fragen

Kann ich mein Chat-Modell auch für Embeddings verwenden?

Technisch lassen sich aus manchen Chat-Modellen Zahlenfolgen gewinnen, aber spezielle Embedding-Modelle sind für die Suche gedacht und meist besser und schneller.

Wie viele Texte kann ich auf einmal senden?

Das hängt von Modell, Arbeitsspeicher und Textlänge ab. Beginnen Sie mit kleinen Gruppen und steigern Sie vorsichtig. Hinweise zum Ablauf gibt Embeddings in Stapeln verarbeiten.

Wo speichere ich die Ergebnisse?

Für kleine Mengen genügt eine Datei, für grössere Bestände eine Vektordatenbank. Siehe Vektordatenbank oder Volltextsuche.

Brauche ich das Internet dafür?

Nur zum Herunterladen des Modells. Danach läuft die Verarbeitung lokal. Mehr dazu in Ollama ohne Internet nutzen.

Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.

Weiterlesen in der Galaxie