Eigene LLMs & KI-Systeme · KI und IT für konkrete Arbeitsaufgaben
Warum brauchen lange KI-Gespräche mehr Speicher?
Kurz gesagt
Je länger Gespräch und Texte sind, desto mehr muss die KI zwischenspeichern. Dieser Zusatzbedarf wächst mit der Kontextlänge, also der Textmenge, die sie auf einmal berücksichtigt. Passt er nicht in den Speicher, wird die KI langsam oder bricht ab. Helfen können eine kürzere Kontextlänge, ein kleineres Modell oder mehr Speicher.
Das Problem
Frau Müller probiert eine lokale KI aus. Kurze Fragen beantwortet sie zügig. Dann lädt sie ein langes Protokoll hinein und bittet um eine Zusammenfassung. Der Computer wird langsam, die Antwort kommt nach Minuten, oder das Programm meldet einen Speicherfehler.
Das Modell hat sich nicht verändert, und trotzdem scheitert es. Der Grund ist das Kontextfenster, die Textmenge, die die KI auf einmal berücksichtigt, siehe Kontextfenster einfach erklärt. Je grösser diese Menge, desto mehr Arbeitsspeicher braucht die KI neben dem Modell selbst.
Wer das weiss, kann gezielt vorgehen: Er stellt die Länge passend ein, kürzt Eingaben oder plant bei der Anschaffung mehr Speicher ein.
So lösen Sie es mit KI – Schritt für Schritt
- Verstehen Sie den Zusatzbedarf. Neben dem Modell selbst legt die KI für jedes bereits gelesene Textstück Zwischenergebnisse ab. Diesen Zwischenspeicher nennen Fachleute KV-Cache. Er wächst mit der Textlänge.
- Erkennen Sie die Anzeichen. Typisch sind: Kurze Fragen klappen, lange Texte nicht; die Antwort wird mit jeder Runde langsamer; es erscheinen Speicherfehler; oder die KI «vergisst» den Anfang. Siehe Speicherfehler bei Ollama.
- Prüfen Sie die eingestellte Kontextlänge. Programme wie Ollama oder LM Studio haben eine Einstellung dafür. Ein grösserer Wert erlaubt mehr Text, braucht aber mehr Speicher. Die Standardwerte sind oft bewusst klein gewählt.
- Passen Sie den Wert an. Erhöhen Sie ihn schrittweise und beobachten Sie den Speicherverbrauch. Hören Sie auf, bevor der Rechner anfängt, Daten auszulagern, denn dann wird es sehr langsam.
- Kürzen Sie Eingaben. Fassen Sie lange Dokumente abschnittsweise zusammen und fügen Sie nur die relevanten Teile ein. Siehe Kontext automatisch kürzen.
- Starten Sie neue Gespräche. Ein langer Chat füllt den Kontext. Beginnen Sie bei einem neuen Thema ein neues Gespräch.
- Wählen Sie bei Bedarf ein kleineres Modell oder eine stärkere Komprimierung. Das schafft Platz für längeren Kontext. Siehe Arbeitsspeicher berechnen.
- Planen Sie bei der Anschaffung ein. Wer regelmässig lange Dokumente verarbeiten will, braucht mehr Speicher, als die Modellgrösse allein vermuten lässt.
Vorlage zum Kopieren
Mit diesem Auftrag lassen Sie sich helfen, den Engpass einzugrenzen. Setzen Sie Ihre Angaben ein.
Meine lokale KI wird bei langen Texten langsam oder bricht ab.
Programm: [Ollama / LM Studio / anderes]
Computer: [Arbeitsspeicher in GB, Grafikkarte und Grafikspeicher falls vorhanden]
Modell und Variante: [Name, z. B. Q4]
Eingestellte Kontextlänge: [Zahl oder «weiss ich nicht»]
Was ich tue: [z. B. 20-seitiges Protokoll zusammenfassen]
Was passiert: [Fehlermeldung oder Beschreibung]
Aufgabe:
1. Erkläre in einfachen Worten, warum lange Texte mehr Speicher brauchen.
2. Nenne die drei wahrscheinlichsten Ursachen in meinem Fall und kennzeichne sie als Vermutung.
3. Schlage Schritte vor, die ich nacheinander ausprobieren kann (kleinste Änderung zuerst).
4. Erfinde keine Menüpunkte oder Einstellungen. Wenn du die Bezeichnung in meinem Programm nicht sicher kennst, sage es.Setzen Sie die Vorschläge einzeln um und testen Sie nach jedem Schritt, damit Sie wissen, was geholfen hat.
| Massnahme | Wirkung | Nebenwirkung |
|---|---|---|
| Kürzerer Kontext | Weniger Speicher | Weniger Text auf einmal |
| Text vorab kürzen | Weniger Speicher | Informationen können fehlen |
| Kleineres Modell | Mehr Platz | Weniger Fähigkeiten |
| Mehr Speicher | Löst das Problem | Kosten |
Worauf Sie achten müssen
- Keine festen Zahlen: Der tatsächliche Bedarf hängt vom Modell und vom Programm ab. Messen Sie bei Ihnen, statt Tabellen aus dem Internet zu vertrauen.
- Lange Kontexte sind nicht automatisch gut: Auch wenn ein Modell viel Text aufnehmen kann, nimmt die Aufmerksamkeit für Einzelheiten in der Mitte langer Texte oft ab. Prüfen Sie Ergebnisse.
- Datenschutz: Lange Dokumente enthalten oft vertrauliche Inhalte. Lokal heisst nicht automatisch sicher, prüfen Sie Zugriff und Speicherung der Verläufe.
- Auslagerung bremst: Wenn der Rechner Daten auf die Festplatte auslagert, wird alles sehr langsam. Dann besser kürzen.
- Mehrere Nutzer: Jede gleichzeitige Unterhaltung braucht eigenen Zwischenspeicher, siehe Gleichzeitige Nutzer.
Ein Beispiel aus der Praxis
Ein Beispiel: Eine Anwaltskanzlei in Basel testet eine lokale KI auf einem Arbeitsplatzrechner mit 32 Gigabyte Arbeitsspeicher. Kurze Fragen laufen gut. Eine Zusammenfassung eines langen Schriftstücks bricht jedoch ab.
Vorher glaubt das Team, das Modell sei zu schwach. Nachher stellt die IT fest, dass bei grosser Kontextlänge der Speicher nicht reicht. Sie reduziert den Wert leicht, teilt das Dokument in drei Abschnitte, fasst jeden einzeln zusammen und lässt aus den Teilzusammenfassungen ein Gesamtergebnis erstellen. Die Antwortzeit sinkt, und eine Person prüft die Resultate. Für künftige Anschaffungen notiert das Team, dass Kontextlänge mitgeplant werden muss.
So hilft Ihnen Alpasana
Bei lokaler KI hängen Modell, Speicher und Einstellungen zusammen. Die Kurse von absofort zu KI und IT für konkrete Arbeitsaufgaben behandeln lokale KI mit Ollama und Open-Source-Modellen und üben anhand von Praxisaufgaben den verantwortungsvollen Einsatz.
So lernen Sie, solche Zusammenhänge selbst einzuordnen und passende Einstellungen zu finden.
Häufige Fragen
Wie viel Kontext brauche ich?
Für kurze Fragen wenig, für ganze Dokumente mehr. Beginnen Sie mit dem Standard und erhöhen Sie nur, wenn Ihre Aufgaben es verlangen.
Warum wird die KI im langen Gespräch langsamer?
Mit jeder Runde wächst der Verlauf, den sie verarbeiten muss. Starten Sie bei Themenwechsel ein neues Gespräch.
Hilft eine Grafikkarte?
Sie kann die Verarbeitung deutlich beschleunigen, wenn Modell und Zwischenspeicher in ihren Speicher passen. Siehe Grafikspeicher-Bedarf.
Kann ich den Bedarf vorab berechnen?
Grob ja, genau nein. Der Bedarf hängt von Modellbauart und Programm ab. Ein Test mit Ihrem Modell ist verlässlicher als jede Formel.
Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.
Weiterlesen in der Galaxie
- Was bedeutet das Kontextfenster für unseren Dokumenten-Chatbot?Kontextfenster Chatbot einfach erklärt: Warum ein KI-Chatbot nicht alle Firmenunterlagen gleichzeitig lesen kann und was das für Ihren Dokumenten-Chatbot heisst.
- Wie viel Arbeitsspeicher braucht ein lokales LLM?LLM RAM Bedarf selbst berechnen: Mit einer einfachen Faustregel schätzen Sie, ob der Arbeitsspeicher Ihres Rechners für ein lokales Sprachmodell reicht.
- Wie viel Grafikspeicher braucht mein KI-Modell?LLM VRAM Bedarf einschätzen: So rechnen Sie vor dem Kauf einer Grafikkarte, wie viel Grafikspeicher ein Sprachmodell mit Kontext wirklich benötigt.
- Ollama meldet zu wenig Speicher: Was kann ich ändern?Ollama out of memory: Was Speicherfehler bedeuten und wie Sie mit kleinerem Modell, kürzerem Kontext und freiem Arbeitsspeicher das Problem beheben.