Eigene LLMs & KI-Systeme · KI und IT für konkrete Arbeitsaufgaben
Warum bricht meine lokale KI mitten im Satz ab?
Kurz gesagt
Meist ist ein Ausgabelimit zu knapp eingestellt, oder das Kontextfenster ist voll. Erhöhen Sie das Limit, kürzen Sie den Chat oder beginnen Sie einen neuen, und bitten Sie die KI, kürzer zu antworten. Selten sind eine Stoppsequenz oder ein Programmfehler die Ursache.
Das Problem
Sie bitten Ihre lokale KI, ein Merkblatt zu verfassen. Die Antwort beginnt gut, erklärt zwei Punkte und hört dann auf, mitten im Satz: «Als dritten Punkt sollten Sie beachten, dass die Rechnung inner». Kein Punkt, keine Schlussbemerkung. Sie wissen nicht, ob die KI fertig ist oder abgestürzt.
Das ist ärgerlich, denn die Antworten sind gerade dort unbrauchbar, wo sie wichtig würden. Wer solche Texte unbemerkt weitergibt, riskiert peinliche Fehler. Die gute Nachricht: Es gibt wenige typische Ursachen, und sie lassen sich leicht prüfen.
Die häufigsten sind zwei Grenzen: Erstens kann die Antwortlänge begrenzt sein, mit einem Ausgabelimit. Ist es erreicht, endet die Antwort sofort, ohne Rücksicht auf den Satz. Zweitens kann das Kontextfenster voll sein, also der Platz, den das Modell für Frage, Verlauf und Antwort insgesamt hat. Diese Anleitung zeigt, wie Sie vorgehen.
So lösen Sie es mit KI – Schritt für Schritt
- Beobachten, wann es passiert. Bricht die Antwort immer bei ungefähr gleicher Länge ab? Dann ist es sehr wahrscheinlich ein Ausgabelimit. Passiert es nur in langen Chats, ist es wahrscheinlich das Kontextfenster.
- Ausgabelimit prüfen. In Ollama heisst die Einstellung
num_predict, in anderen Programmen oft «Max Tokens» oder «Response Length». Ein Token ist ein Wortbaustein, ein Wort besteht oft aus mehreren. Prüfen Sie, ob ein niedriger Wert eingestellt ist, und erhöhen Sie ihn deutlich. Siehe Antwortlänge begrenzen.
- Kontextfenster prüfen. Je länger der Chat, desto weniger Platz bleibt für die Antwort. Beginnen Sie einen neuen Chat und stellen Sie dieselbe Aufgabe. Wird die Antwort jetzt vollständig, war das Fenster voll. Siehe Wann ein neuer Chat sinnvoll ist.
- Kontextlänge erhöhen, falls möglich. Manche Programme erlauben ein grösseres Fenster, was mehr Arbeitsspeicher braucht. In Ollama heisst der Parameter
num_ctx. Prüfen Sie, ob Ihr Rechner das schafft. Siehe Kontextlänge und Speicher.
- Aufgabe kürzer machen. Bitten Sie um kürzere Antworten oder teilen Sie die Aufgabe in Teile: erst Gliederung, dann jeden Abschnitt einzeln.
- Weiterschreiben lassen. Geben Sie im selben Chat den Auftrag «Schreibe ab dem letzten Satz weiter». Das ist eine Notlösung. Prüfen Sie die Übergänge, denn manchmal gehen Teile verloren oder verdoppeln sich.
- Stoppsequenzen und besondere Zeichen prüfen. Manche Programme erlauben «Stop»-Zeichenfolgen, bei denen die Ausgabe sofort endet. Prüfen Sie, ob eine solche eingetragen ist und ob sie im Text vorkommen kann, etwa ein Zeichen, das auch im normalen Text auftaucht.
- Anderes Modell oder Programm testen. Tritt es bei einem anderen Modell nicht auf, liegt es am Modell oder dessen Voreinstellung. Notieren Sie, was funktioniert.
Vorlage zum Kopieren
Mit diesem Auftrag lassen Sie sich helfen, die Ursache einzugrenzen. Verwenden Sie keine vertraulichen Texte.
Meine lokale KI bricht Antworten mitten im Satz ab. Hilf mir, die Ursache einzugrenzen.
Programm: [Ollama / LM Studio / Oberfläche]
Modell: [Name]
Wann es passiert: [z. B. immer bei ca. 200 Wörtern / nur in langen Chats / zufällig]
Eingestellte Werte, soweit bekannt: [z. B. Ausgabelimit, Kontextlänge]
Länge des bisherigen Chats: [kurz / mittel / sehr lang]
Aufgabe:
1. Erkläre den Unterschied zwischen Ausgabelimit und Kontextfenster in einfachen Worten.
2. Nenne nach Wahrscheinlichkeit geordnet die Ursachen für mein Muster.
3. Gib zu jeder Ursache einen einfachen Test.
4. Schlage eine Reihenfolge der Tests vor.
Nenne keine Parameterwerte als «richtig», die du nicht aus der Dokumentation kennst. Schreibe stattdessen «in der Dokumentation prüfen».Notieren Sie zu jedem Test das Ergebnis. Nach zwei bis drei Tests ist die Ursache meist klar.
| Muster | Wahrscheinliche Ursache | Lösung |
|---|---|---|
| Immer etwa gleiche Länge | Ausgabelimit zu niedrig | Limit erhöhen |
| Nur in langen Chats | Kontextfenster voll | Neuer Chat |
| Nur bei langen Aufgaben | Zu wenig Platz für Antwort | Aufgabe teilen |
| Bei bestimmtem Wort oder Zeichen | Stoppsequenz | Einstellung prüfen |
| Zufällig, mit Fehlermeldung | Speicher oder Programmfehler | Protokoll prüfen |
Worauf Sie achten müssen
- Unbemerkt weitergegeben: Abgeschnittene Texte lesen sich flüssig, bis sie enden. Lesen Sie immer bis zum Schluss, bevor Sie Texte verwenden.
- Nicht blind das Limit hochsetzen: Ein sehr hohes Limit kann Antworten unnötig verlängern und Rechenzeit verbrauchen. Wählen Sie es grosszügig, aber nicht unendlich.
- Speicherbedarf: Ein grösseres Kontextfenster verbraucht mehr Arbeitsspeicher. Auf schwachen Rechnern kann das zu Fehlern führen. Siehe Ollama: Speicherfehler.
- Verlust früherer Angaben: Ist das Fenster voll, verliert die KI den Anfang des Chats. Wichtige Regeln stehen deshalb im Systemprompt. Siehe Feste Arbeitsregeln.
- Abbruch von Hand: Haben Sie die Antwort selbst abgebrochen, ist das kein Fehler. Siehe Anfragen abbrechen.
Ein Beispiel aus der Praxis
Ein Beispiel: Eine Kommunikationsverantwortliche eines Vereins in Frauenfeld nutzt eine lokale KI für Newsletter. Die Entwürfe enden regelmässig nach rund 250 Wörtern mitten im Satz. Sie hat die KI zuvor auf «kurze Antworten» eingestellt und erinnert sich, einen Wert gesetzt zu haben.
Vorher bittet sie die KI jedes Mal, «bitte weiterschreiben», und klebt die Teile zusammen. Nachher prüft sie die Einstellungen und findet ein Ausgabelimit, das sie einmal sehr knapp gesetzt hat. Sie erhöht es auf das Doppelte der gewünschten Länge und formuliert die gewünschte Länge zusätzlich im Auftrag («höchstens 300 Wörter»). Die Newsletter-Entwürfe sind nun vollständig. Bei einem langen Chat mit vielen Änderungswünschen bricht eine Antwort dennoch ab: Sie beginnt einen neuen Chat, und auch das klappt.
So hilft Ihnen Alpasana
Wie Sie Aufträge an die KI klar und mit passendem Ausgabeformat formulieren und Ergebnisse prüfen, lernen Sie in der Kursauswahl KI und IT für konkrete Arbeitsaufgaben von absofort. Sie umfasst lokale KI mit Ollama und Open-Source-Modellen, Claude mit Projektstruktur, Prompt-Bibliothek und Qualitätsprüfung sowie betriebliche KI-Richtlinien, jeweils mit KI-Lerncoach, Praxisaufgaben und verifizierbarem Abschluss.
Einstellungen einzelner Programme erklärt der Kurs nicht im Detail.
Häufige Fragen
Merkt die KI, dass sie abgeschnitten wurde?
Nein. Das Modell erfährt nichts von der Grenze. Es schreibt, bis das Programm es stoppt. Darum endet die Antwort oft mitten im Satz.
Ist das ein Zeichen für ein schlechtes Modell?
Nicht unbedingt. Es hängt meist von Einstellungen ab. Prüfen Sie zuerst Ausgabelimit und Chatlänge, bevor Sie das Modell wechseln.
Kann ich die KI bitten, in Etappen zu schreiben?
Ja. Bitten Sie um eine Gliederung und dann um jeden Abschnitt einzeln. Das entlastet das Kontextfenster und erleichtert die Prüfung.
Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. So arbeitet die Redaktion · Fehler entdeckt? Melden Sie es uns.
Quellen
Weiterlesen in der Galaxie
- Wie begrenze ich die Antwortlänge meiner lokalen KI?Lokale KI Antwortlänge: So erhalten Sie kurze Antworten durch klare Vorgaben und das Ausgabelimit in Ollama, ohne dass Sätze abgeschnitten werden.
- Warum brauchen lange KI-Gespräche mehr Speicher?LLM Kontextlänge Speicher: Warum eine lokale KI bei langen Gesprächen und Texten mehr Arbeitsspeicher braucht, und was Sie tun können, wenn sie dabei scheitert.
- Wann sollte ich bei lokaler KI einen neuen Chat beginnen?Lokale KI Chat zurücksetzen: Warum alte Gespräche neue Aufgaben verfälschen, woran Sie es erkennen und wann ein neuer Chat sinnvoll ist.
- Meine lokale KI wiederholt sich: Wie verhindere ich das?LLM wiederholt sich: Anleitung gegen Textschleifen bei lokaler KI mit Temperatur, Wiederholungsstrafe, Kontextfenster und klareren Aufträgen.
- Open Weight und Open Source: Was ist der Unterschied?Open Weight vs Open Source: Was bei einem herunterladbaren KI-Modell wirklich offen ist, welche Rolle Quellcode, Trainingsdaten und Lizenz spielen.
- Chatbot ohne Anmeldung: Was gilt für Ihre Website?Chatbot ohne Anmeldung: Erfahren Sie, worauf Ihre Website bei Datenschutz, Missbrauchsschutz, Kosten und der Übergabe an Mitarbeitende achten sollte.