Eigene LLMs & KI-Systeme · KI und IT für konkrete Arbeitsaufgaben
Ollama meldet zu wenig Speicher: Was kann ich ändern?
Kurz gesagt
Die Meldung bedeutet, dass das Modell samt Gesprächsverlauf nicht in den verfügbaren Speicher passt. Wählen Sie ein kleineres Modell oder eine stärker verkleinerte Variante, kürzen Sie den Kontext, schliessen Sie andere Programme und starten Sie ein neues Gespräch. Mehr Arbeitsspeicher ist erst der letzte Schritt.
Das Problem
Sie geben eine Frage ein, und statt einer Antwort kommt eine Fehlermeldung, die sinngemäss besagt: Nicht genug Speicher. Vielleicht bricht das Programm ab oder stürzt ganz. Manchmal passiert es gleich beim Start des Modells, manchmal erst bei einem langen Text.
Der Grund: Ein Sprachmodell muss beim Arbeiten vollständig im Speicher liegen, entweder im Arbeitsspeicher (RAM) des Computers oder im Speicher der Grafikkarte (VRAM). Dazu kommt Platz für das Gespräch selbst, den man «Kontext» nennt: Je länger der Verlauf und je mehr Text Sie eingeben, desto mehr Speicher braucht das Modell zusätzlich. Reicht der Platz nicht, bricht die Arbeit ab.
Das Problem ist meist lösbar, ohne neue Hardware zu kaufen. Oft genügt ein kleineres Modell oder ein kürzerer Verlauf. Die Hinweise gelten für den Stand Oktober 2026; die Fehlermeldungen können je nach Version anders lauten.
So lösen Sie es mit KI – Schritt für Schritt
- Meldung festhalten. Notieren Sie den genauen Wortlaut. Er sagt oft, wie viel Speicher das Modell benötigt und wie viel verfügbar ist.
- Freien Speicher prüfen. Öffnen Sie Task-Manager (Windows) oder Aktivitätsanzeige (Mac) und sehen Sie, wie viel Arbeitsspeicher frei ist. Schliessen Sie andere grosse Programme, vor allem Browser mit vielen Tabs.
- Modellgrösse mit Speicher vergleichen. Die Datei des Modells sollte deutlich kleiner sein als der verfügbare Speicher, mit Reserve für den Kontext. Siehe Modellgrösse und Hardware.
- Kleineres Modell wählen. Wechseln Sie zu einem Modell mit weniger Parametern. Wie Sie wechseln: Modell wechseln.
- Stärker verkleinerte Variante probieren. Viele Modelle gibt es in mehreren Stufen der Verkleinerung (Quantisierung). Niedrigere Stufen brauchen weniger Platz, verlieren aber etwas Qualität. Siehe Quantisierung erklärt.
- Kontext verkürzen. Starten Sie ein neues Gespräch, geben Sie kürzere Texte ein und verarbeiten Sie lange Dokumente abschnittsweise. Die voreingestellte Kontextlänge lässt sich in Ollama einstellen; wie, steht in der Dokumentation. Siehe Kontextfenster einfach erklärt.
- Computer neu starten. Ein Neustart gibt Speicher frei, den andere Programme blockiert haben.
- Erst dann Hardware erwägen. Reicht auch dann der Speicher nicht für Ihre Aufgabe, lesen Sie Hardware für lokale KI, bevor Sie aufrüsten.
Vorlage zum Kopieren
Mit diesem Prompt lassen Sie die Meldung einordnen. Entfernen Sie persönliche Angaben:
Du bist ein IT-Helfer für Nicht-Techniker. Mein lokales KI-Modell in Ollama bricht mit einer Speicherfehlermeldung ab. Du erfindest keine Befehle und keine Zahlen. Wenn du etwas nicht sicher weisst, sagst du es.
Computer: [z. B. Laptop, 16 GB Arbeitsspeicher, keine eigene Grafikkarte]
Modell: [Name, Dateigrösse in GB]
Fehlermeldung (wörtlich): [Meldung einfügen]
Wann tritt es auf: [z. B. sofort beim Start / bei langen Texten / nach vielen Fragen]
Andere laufende Programme: [z. B. Browser mit 15 Tabs, Teams]
Bitte:
1. Erkläre in einfacher Sprache, was die Meldung bedeutet.
2. Nenne drei Massnahmen in der Reihenfolge von einfach zu aufwendig.
3. Sage, bei welcher Konstellation mein Computer für dieses Modell wohl zu schwach ist.
Antworte auf Deutsch (Schweiz), Sie-Form.Ersetzen Sie die Klammern durch Ihre Angaben. Prüfen Sie vorgeschlagene Befehle in der offiziellen Dokumentation.
| Wann tritt der Fehler auf? | Wahrscheinliche Ursache | Massnahme |
|---|---|---|
| Sofort beim Laden | Modell zu gross | Kleineres Modell |
| Bei langen Eingaben | Kontext braucht zu viel Speicher | Texte kürzen, neues Gespräch |
| Nach längerer Nutzung | Speicher von anderen Programmen belegt | Programme schliessen, Neustart |
| Nur mit bestimmtem Modell | Zu wenig Grafikspeicher | Kleinere Stufe |
Worauf Sie achten müssen
- Qualität sinkt mit Verkleinerung. Stark verkleinerte Modelle machen mehr Fehler. Prüfen Sie wichtige Ergebnisse, siehe KI-Halluzinationen.
- Nicht zu knapp wählen. Ein Modell, das gerade so passt, läuft instabil. Planen Sie Reserve ein.
- Auslagerung bremst. Wenn der Computer Speicher auf die Festplatte auslagert, wird alles sehr langsam. Siehe Ollama ist langsam.
- Keine Eingriffe ins System. Virtuellen Speicher oder Systemdateien sollten Laien nicht ohne Anleitung ändern.
- Vertrauliche Daten. Zum Testen mit langen Texten eignen sich erfundene Inhalte.
- Firmencomputer. Hardware-Erweiterungen stimmen Sie mit der IT ab.
Ein Beispiel aus der Praxis
Ein Beispiel: Frau V., Verwaltungsangestellte in einer Gemeinde im Fricktal, möchte mit einer lokalen KI ein längeres Protokoll zusammenfassen. Der Laptop hat 16 GB Arbeitsspeicher. Beim Einfügen des ganzen Protokolls meldet Ollama einen Speicherfehler.
Sie schliesst Browser und Videokonferenz, wählt ein kleineres Modell und teilt das Protokoll in drei Abschnitte. Jetzt klappt es, die Zusammenfassungen fügt sie selbst zusammen und prüft sie gegen das Original. Für das ganze Protokoll in einem Zug würde sie mehr Speicher brauchen; das lohnt sich für die seltene Aufgabe nicht.
So hilft Ihnen Alpasana
Wer lokale KI strukturiert kennenlernen möchte, findet im Kurs KI und IT für konkrete Arbeitsaufgaben bei absofort unter anderem lokale KI mit Ollama und Open-Source-Modellen. Praxisaufgaben, der KI-Lerncoach und ein verifizierbarer Abschluss gehören zum Kursaufbau.
Die konkrete Hardwareberatung für Ihr Gerät übernimmt Ihre IT oder ein Fachhändler.
Häufige Fragen
Was ist der Unterschied zwischen RAM und VRAM?
RAM ist der Arbeitsspeicher des Computers, VRAM der Speicher der Grafikkarte. Modelle auf der Grafikkarte brauchen VRAM, Modelle auf dem Prozessor brauchen RAM. Bei Apple-Macs teilen sich beide denselben Speicher.
Hilft es, den Computer neu zu starten?
Oft ja, weil dabei Speicher frei wird, den andere Programme belegt haben. Es ersetzt aber nicht die Wahl eines passenden Modells.
Kann ich die Kontextlänge selbst ändern?
Ja, Ollama bietet dafür Einstellungen. Wie das in Ihrer Version funktioniert, steht in der Dokumentation. Eine kürzere Länge spart Speicher, das Modell «vergisst» dann aber früher.
Wie viel Arbeitsspeicher brauche ich?
Das hängt vom Modell ab. Grob gilt: Die Modelldatei plus Reserve für Kontext und Betriebssystem. Siehe Hardware auswählen.
Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.
Quellen
Weiterlesen in der Galaxie
- Ollama ist langsam: Wie finde ich die Ursache?Ollama langsam: So diagnostizieren Sie, warum Ihre lokale KI zäh antwortet, und prüfen Modellgrösse, Auslastung, Grafikkarte und Einstellungen Schritt für Schritt.
- Welche Modellgrösse passt zu unserem lokalen Chatbot?Modellgrösse für lokale KI wählen: Wann ein kleines Modell genügt und wann ein grösseres nötig ist. Mit Faustregeln, Testplan, Tabelle und Praxisbeispiel.
- Wie viel Grafikspeicher braucht mein KI-Modell?LLM VRAM Bedarf einschätzen: So rechnen Sie vor dem Kauf einer Grafikkarte, wie viel Grafikspeicher ein Sprachmodell mit Kontext wirklich benötigt.
- Was bedeutet Quantisierung bei einem lokalen LLM?LLM Quantisierung einfach erklärt: Warum dasselbe Sprachmodell in verschieden grossen Dateien angeboten wird und was das für Speicherbedarf und Qualität heisst.
- Wie wechsle ich in Ollama zwischen Modellen?Ollama Modell wechseln: So probieren Sie mehrere lokale Modelle für verschiedene Aufgaben aus und vergleichen die Ergebnisse mit einem einfachen Raster.