Zum Inhalt springen

Eigene LLMs & KI-Systeme · KI und IT für konkrete Arbeitsaufgaben

Ollama ist langsam: Wie finde ich die Ursache?

Stand 10.10.2026 · 5 Min. Lesezeit

Kurz gesagt

Meist ist das Modell zu gross für Ihren Computer oder läuft nur auf dem Prozessor. Prüfen Sie mit «ollama ps», wo das Modell läuft, schliessen Sie andere Programme und probieren Sie ein kleineres Modell. Die erste Antwort nach einer Pause dauert oft länger, weil das Modell erst geladen wird.

Das Problem

Sie stellen Ihrer lokalen KI eine Frage und warten. Und warten. Wort für Wort tröpfelt die Antwort auf den Bildschirm, oder zuerst passiert minutenlang nichts. Im Alltag ist das kaum brauchbar. Wer schnell einen Briefentwurf will, tippt ihn dann lieber selbst.

Dass lokale KI langsam ist, hat selten nur eine Ursache. Meist treffen mehrere Dinge zusammen: ein Modell, das für den Computer zu gross ist, fehlende Beschleunigung durch die Grafikkarte, zu wenig freier Arbeitsspeicher, viele offene Programme oder ein langer Gesprächsverlauf. Ein Sprachmodell erzeugt Text Stück für Stück und braucht dafür Rechenleistung und Speicher.

Die gute Nachricht: Mit systematischem Vorgehen finden Sie die Ursache oft in einer Viertelstunde. Wichtig ist, nur eine Sache auf einmal zu ändern. Die Hinweise beziehen sich auf Oktober 2026 und können sich mit neuen Versionen verändern.

So lösen Sie es mit KI – Schritt für Schritt

  1. Beschreiben, was «langsam» heisst. Dauert schon der Start lang oder die Antwort selbst? Kommt die erste Antwort nach einer Pause spät, danach aber normal? Das letzte ist üblich: Nach einigen Minuten Inaktivität gibt Ollama den Speicher frei und muss das Modell erneut laden.
  1. Läuft das Modell auf GPU oder CPU? Geben Sie während der Nutzung in einem zweiten Fenster «ollama ps» ein. In der Spalte «Processor» steht, wo gerechnet wird. 100 % CPU ist deutlich langsamer. Siehe GPU wird nicht erkannt.
  1. Modellgrösse prüfen. Vergleichen Sie die Dateigrösse des Modells mit Ihrem freien Arbeitsspeicher. Ist sie fast so gross, bleibt kaum Spielraum. Probieren Sie ein kleineres Modell. Hilfe: Modellgrösse und Hardware.
  1. Auslastung beobachten. Öffnen Sie den Task-Manager (Windows) oder die Aktivitätsanzeige (Mac). Sind Arbeitsspeicher oder Prozessor ständig am Anschlag? Schliessen Sie grosse Programme wie Browser mit vielen Tabs oder Videokonferenzen.
  1. Gesprächsverlauf kürzen. Je länger ein Gespräch, desto mehr muss das Modell mitverarbeiten. Starten Sie ein neues Gespräch, wenn der Verlauf lang wird. Siehe Kontextfenster einfach erklärt.
  1. Stromsparmodus und Wärme prüfen. Laptops drosseln bei Akkubetrieb oder Hitze. Schliessen Sie das Netzteil an und wählen Sie den Leistungsmodus. Prüfen Sie, ob der Lüfter frei atmen kann.
  1. Eingabe vereinfachen. Lange Dokumente im Prompt verlangsamen die Antwort stark. Teilen Sie den Text in kleinere Abschnitte auf.
  1. Erwartungen anpassen. Bleibt es nach allen Schritten langsam, ist der Computer für dieses Modell zu schwach. Das ist keine Störung. Wählen Sie kleinere Modelle oder prüfen Sie, ob ein Cloud-Dienst für diese Aufgabe besser passt, wenn Datenschutz es erlaubt. Siehe Lokal oder Cloud.

Vorlage zum Kopieren

Mit diesem Prompt lassen Sie eine KI die Messwerte einordnen. Entfernen Sie persönliche Angaben:

Du bist ein IT-Helfer für Nicht-Techniker. Meine lokale KI (Ollama) antwortet langsam. Du erfindest keine Messwerte und keine Befehle. Wo du unsicher bist, sagst du es.

Computer: [z. B. Laptop mit 16 GB RAM, ohne eigene Grafikkarte, Windows 11]
Modell: [Name und Dateigrösse in GB]
Ergebnis «ollama ps» (Spalte Processor): [z. B. 100 % CPU]
Beobachtung: [z. B. erste Antwort dauert 30 Sekunden, danach etwa ein Wort pro Sekunde]
Andere offene Programme: [z. B. Browser mit 20 Tabs, Teams]

Bitte:
1. Nenne die drei wahrscheinlichsten Gründe in einfacher Sprache.
2. Gib zu jedem Grund einen ungefährlichen Prüfschritt.
3. Sage, bei welcher Beobachtung ein kleineres Modell oder andere Hardware nötig wäre.
Antworte auf Deutsch (Schweiz), Sie-Form.

Passen Sie die Angaben an Ihren Fall an und führen Sie nur Schritte aus, die Sie verstehen.

BeobachtungMögliche UrsacheMassnahme
Erste Antwort langsam, danach schnellerModell wird neu geladenNormal, nach Pause
Dauerhaft ein Wort pro SekundeLäuft auf CPU, Modell grossKleineres Modell, GPU prüfen
Computer ruckelt insgesamtZu wenig freier SpeicherProgramme schliessen
Wird mit der Zeit langsamerLanger GesprächsverlaufNeues Gespräch
Laptop heiss und lautÜberhitzung, DrosselungNetzteil, Kühlung

Worauf Sie achten müssen

  • Nur eine Änderung auf einmal. Sonst wissen Sie nicht, was geholfen hat. Notieren Sie, was Sie geändert haben.
  • Messwerte sind keine Qualitätsurteile. Ein schnelles Modell ist nicht automatisch besser. Kleine Modelle erfinden häufiger Inhalte. Siehe KI-Halluzinationen.
  • Keine riskanten Eingriffe. Systemeinstellungen oder Übertaktung sind für Laien nicht geeignet.
  • Firmencomputer. Änderungen an Treibern und Stromsparmodi stimmen Sie mit der IT ab.
  • Vertrauliche Daten. Zum Testen der Geschwindigkeit eignen sich erfundene Texte. Verwenden Sie keine echten Dokumente.
  • Hardwarekauf nicht überstürzen. Lesen Sie zuerst Hardware für lokale KI, bevor Sie Geld ausgeben.

Ein Beispiel aus der Praxis

Ein Beispiel: Ein Immobilienbüro in Wettingen testet lokale KI auf einem Laptop mit 16 GB Arbeitsspeicher. Die Assistentin klagt, dass das Modell fünf Minuten für einen kurzen Brief braucht. «ollama ps» zeigt 100 % CPU, die Dateigrösse des Modells liegt bei etwa drei Vierteln des Arbeitsspeichers. Dazu laufen Browser und Videokonferenz.

Sie schliesst andere Programme und wählt ein kleineres Modell. Die Antwort kommt nun in einer halben Minute. Für längere Dokumente ist der Laptop trotzdem zu schwach; dafür verzichtet das Büro bewusst auf lokale KI. So spart die Assistentin Zeit, ohne den Rechner zu überlasten.

So hilft Ihnen Alpasana

Wenn Sie lokale KI im Alltag nutzbar machen möchten, behandelt der Kurs KI und IT für konkrete Arbeitsaufgaben bei absofort unter anderem lokale KI mit Ollama und Open-Source-Modellen. Zum Aufbau gehören Praxisaufgaben, der KI-Lerncoach und ein verifizierbarer Abschluss.

Eine Leistungsmessung Ihres Computers ist nicht Teil des Kurses. Dafür wenden Sie sich an Ihre IT.

Häufige Fragen

Warum ist die erste Antwort langsamer?

Nach einer Pause wird das Modell aus dem Arbeitsspeicher entfernt und muss neu geladen werden. Bei weiteren Fragen in kurzer Folge ist es bereits geladen und antwortet schneller.

Hilft mehr Arbeitsspeicher?

Oft ja, wenn das Modell sonst nicht ganz hineinpasst. Vorher prüfen Sie aber, ob ein kleineres Modell die Aufgabe auch erfüllt.

Was bringt eine Grafikkarte?

Eine passende Grafikkarte kann die Antworten stark beschleunigen, wenn das Modell in ihren Speicher passt. Die Unterstützung durch Ollama ist nicht für jede Karte gegeben, siehe die Dokumentation.

Ist das Problem je nach Modell verschieden?

Ja. Grössere Modelle sind langsamer. Auch die Verkleinerungsstufe (Quantisierung) beeinflusst Tempo und Qualität. Siehe Quantisierung erklärt.

Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.

Quellen

Weiterlesen in der Galaxie