Zum Inhalt springen

Eigene LLMs & KI-Systeme · Prompt Engineering

Wie begrenze ich die Antwortlänge meiner lokalen KI?

Stand 10.10.2026 · 5 Min. Lesezeit

Kurz gesagt

Am besten steuern Sie die Länge im Auftrag selbst, etwa mit «höchstens 100 Wörter». Zusätzlich kann ein Ausgabelimit (in Ollama num_predict) eine harte Obergrenze setzen, schneidet aber mitten im Satz ab. Kombinieren Sie beides vorsichtig und testen Sie mit Ihren Aufgaben.

Das Problem

Sie bitten Ihre lokale KI um eine kurze Mitteilung an Ihre Kundschaft und erhalten eine halbe Seite: Einleitung, drei Absätze, eine Zusammenfassung, ein Schlusswort und eine Floskel zum Abschied. Sie müssen kürzen, löschen und umformulieren. Das Ergebnis dauert länger als hätten Sie es selbst geschrieben.

Viele Modelle neigen zu ausführlichen Antworten. Sie wurden darauf trainiert, hilfreich und vollständig zu wirken. Bei lokalen Modellen kommt hinzu, dass längere Antworten mehr Rechenzeit brauchen: Der Rechner arbeitet länger, und Sie warten länger.

Es gibt zwei Wege, die Länge zu steuern: durch Anweisungen im Auftrag und durch eine technische Obergrenze. Beide haben Vor- und Nachteile. Diese Anleitung zeigt, wie Sie sie kombinieren, damit Sie kurze, brauchbare Antworten erhalten, ohne dass Sätze mitten im Wort enden.

So lösen Sie es mit KI – Schritt für Schritt

  1. Wunschlänge bestimmen. Wie lang soll die Antwort sein: ein Satz, drei Sätze, 100 Wörter, eine halbe Seite? Schreiben Sie eine Zahl auf. «Kurz» ist für ein Modell zu ungenau.
  1. Länge im Auftrag nennen. Fügen Sie dem Auftrag eine konkrete Vorgabe hinzu: «Antworte in höchstens 80 Wörtern.» oder «Antworte in drei Sätzen.» Das ist der wirksamste und freundlichste Weg, weil das Modell den Text gleich passend plant.
  1. Form festlegen. Verbieten Sie Füllwerk ausdrücklich: «Keine Einleitung, keine Zusammenfassung, keine Abschlussfloskel.» Verlangen Sie bei Bedarf «nur den Text, ohne Erklärung».
  1. Regel dauerhaft festlegen. Wenn Sie fast immer kurze Antworten möchten, legen Sie die Regel in den Systemprompt. Siehe Feste Arbeitsregeln für die lokale KI.
  1. Technische Obergrenze prüfen. Ollama kennt einen Parameter num_predict, der die Zahl der erzeugten Tokens begrenzt. Ein Token ist ein Wortbaustein; ein deutsches Wort besteht oft aus mehreren Tokens. Im Chat setzen Sie ihn mit /set parameter num_predict [Zahl], dauerhaft in einer Modelfile mit PARAMETER num_predict [Zahl]. Andere Programme haben ein ähnliches Feld, oft «Max Tokens» oder «Response Length».
  1. Grosszügig wählen. Setzen Sie die Obergrenze deutlich über Ihre Wunschlänge, etwa das Doppelte. Sie dient als Notbremse, nicht als Steuerung. Eine zu knappe Grenze schneidet Antworten ab. Dazu mehr unter Antwort bricht mitten im Satz ab.
  1. Mit Beispielen testen. Stellen Sie fünf typische Aufgaben und zählen Sie die Wörter der Antworten. Halten sich die Antworten an die Länge? Wenn nicht, schärfen Sie die Vorgabe nach, zum Beispiel mit «genau drei Sätze».
  1. Ergebnis festhalten. Notieren Sie die Vorgabe und den Wert, die für Ihre Aufgaben funktionieren, und speichern Sie sie in Ihrer Vorlage.

Vorlage zum Kopieren

Mit diesem Auftrag lassen Sie sich Formulierungen für verschiedene Längenvorgaben entwerfen. Setzen Sie Ihre eigenen Aufgaben ein.

Ich möchte, dass meine lokale KI kürzere Antworten gibt. Erstelle Formulierungen, die ich in meinen Aufträgen oder im Systemprompt verwenden kann.

Typische Aufgaben: [z. B. E-Mail-Entwürfe, Zusammenfassungen, kurze Erklärungen]
Gewünschte Länge pro Aufgabe: [z. B. E-Mail: 80 Wörter, Zusammenfassung: 5 Sätze, Erklärung: 3 Sätze]

Erstelle:
1. Pro Aufgabe einen kurzen Zusatz für den Auftrag, der die Länge und das Format genau festlegt (keine Einleitung, keine Zusammenfassung, nur den Text).
2. Einen Satz für den Systemprompt, der die Standardlänge festlegt.
3. Drei Hinweise, woran ich erkenne, dass die Länge nicht eingehalten wird, und wie ich nachschärfe.
Verwende Zahlen statt Wörter wie «kurz». Gib keine technischen Parameterwerte an, die du nicht sicher kennst.

Die Zusätze fügen Sie Ihren Aufträgen an. Für harte Grenzen prüfen Sie die Einstellung in Ihrem Programm separat.

WegVorteilNachteil
Vorgabe im AuftragText passt zur LängeModell hält sich nicht immer daran
SystempromptGilt für alle AufgabenKleinere Modelle vergessen es
Ausgabelimit (num_predict)Harte ObergrenzeSchneidet mitten im Satz ab
Nachträglich kürzen lassenEinfachZweiter Durchgang

Worauf Sie achten müssen

  • Zählen ist schwierig: Modelle zählen Wörter nicht zuverlässig. Eine Vorgabe von 80 Wörtern ergibt oft 60 oder 110. Satz- oder Absatzvorgaben («drei Sätze») werden meist besser eingehalten.
  • Abgeschnittene Antworten: Ein zu kleines Ausgabelimit beendet die Antwort mitten im Satz. Das Modell «weiss» davon nichts. Prüfen Sie Texte vor der Weitergabe.
  • Qualität leidet bei extremer Kürze: Ein einzelner Satz kann Wichtiges auslassen. Legen Sie die Länge nach Aufgabe fest, nicht pauschal.
  • Kontextfenster: Neben der Antwortlänge gibt es eine zweite Grenze: wie viel das Modell insgesamt «im Kopf behalten» kann. Siehe Kontextlänge und Speicher.
  • Rechenzeit: Kürzere Antworten sind auch schneller. Das hilft vor allem auf schwächeren Rechnern.

Ein Beispiel aus der Praxis

Ein Beispiel: Ein Elektroinstallateur in Lenzburg nutzt eine lokale KI für Kurzantworten an Kundinnen: Termin bestätigen, Offerte nachfassen, Rückfrage zu Materialien. Die Antworten der KI sind stets drei Absätze lang, mit Einleitung und Floskeln.

Vorher löscht er die Hälfte. Nachher fügt er dem Systemprompt hinzu: «Antworte in höchstens 60 Wörtern, ohne Einleitung und ohne Abschlussfloskel.» Zusätzlich setzt er das Ausgabelimit grosszügig auf ein Vielfaches der gewünschten Länge. Beim Test zählt er drei Antworten: 55, 70 und 48 Wörter. Eine Antwort bricht dennoch ab, weil das Limit bei einem anderen Modell zu knapp war. Er erhöht den Wert. Danach passt es, und er braucht für die Mails nur noch eine Minute.

So hilft Ihnen Alpasana

Wie Sie Aufgabe, Rolle, Kontext, Ziel und Ausgabeformat klar festlegen und Prompts überarbeiten, lernen Sie im Kurs Prompt Engineering von absofort. Dazu gehören Beispiele zur Steuerung von Inhalt und Format sowie das Prüfen der Ergebnisse. Der Kurs ist online, ohne Programmierkenntnisse, mit Zertifikat.

Einstellungen einzelner Programme erklärt der Kurs nicht. Dafür gilt die Dokumentation der jeweiligen Software.

Häufige Fragen

Was ist ein Token?

Ein Baustein, in den ein Modell Text zerlegt. Ein kurzes Wort ist oft ein Token, ein langes deutsches Wort mehrere. Die Zahl der Tokens bestimmt, wie lang eine Antwort werden darf und wie viel das Modell im Gedächtnis behält.

Warum antwortet die KI trotz Vorgabe zu lang?

Kleinere Modelle befolgen Vorgaben schlechter. Versuchen Sie klarere Formulierungen («genau zwei Sätze»), setzen Sie die Regel an das Ende des Auftrags oder probieren Sie ein anderes Modell.

Gibt es einen Regler für «kurz» und «lang»?

Nicht als einzelnen Schalter. Die Länge hängt vom Auftrag, vom Modell und vom Ausgabelimit ab. Kombinieren Sie klare Vorgaben mit einer vernünftigen Obergrenze.

Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.

Quellen

Weiterlesen in der Galaxie