Zum Inhalt springen

Grundlagen · Prompt Engineering

Wie entsteht eine Antwort eines Sprachmodells? Vom Text zum nächsten Token

Stand 10.10.2026 · 6 Min. Lesezeit

Kurz gesagt

Ein Sprachmodell zerlegt Ihre Eingabe in Tokens, verarbeitet sie in vielen Schichten eines neuronalen Netzes und berechnet daraus, welches Token als Nächstes am wahrscheinlichsten folgt. Dieses Token wird angehängt und der Vorgang wiederholt sich, bis die Antwort fertig ist. Das Modell «schlägt nicht nach», sondern setzt Muster fort, die es im Training gelernt hat.

Das Problem

Sie stellen einer KI eine Frage, und nach wenigen Sekunden erscheint eine flüssige, selbstsichere Antwort. Mal ist sie genau richtig, mal enthält sie einen Fehler, den man erst beim zweiten Hinsehen bemerkt. Wer nicht weiss, wie so eine Antwort zustande kommt, kann das kaum einordnen.

Das ist lästig und riskant: Entweder vertrauen Sie der KI zu stark, oder Sie misstrauen ihr so sehr, dass Sie sie gar nicht nutzen. Beides kostet Zeit. Ein grundlegendes Verständnis des Ablaufs hilft, bessere Aufträge zu formulieren und Antworten gezielter zu prüfen.

Die gute Nachricht: Der Ablauf lässt sich in vier Schritten erklären, ganz ohne Mathematik.

So lösen Sie es mit KI – Schritt für Schritt

Mit diesem Wissen steuern Sie Antworten gezielter. So gehen Sie vor:

  1. Öffnen Sie Ihr KI-Programm und starten Sie für ein neues Thema einen neuen Chat, damit nichts Unpassendes im Kontext steht.
  2. Schreiben Sie zuerst auf, was Sie wollen: Ziel, Zielgruppe und gewünschtes Format (etwa «fünf Stichpunkte»).
  3. Geben Sie alle nötigen Angaben in den Chat selbst. Das Modell sieht nur, was im Kontextfenster steht.
  4. Nennen Sie, worauf es Ihnen ankommt, zum Beispiel «Kündigungsfristen und Haftung». Sonst wählt das Modell, was ihm wahrscheinlich wichtig erscheint.
  5. Schicken Sie den Auftrag ab und lesen Sie die Antwort in Ruhe.
  6. Prüfen Sie Zahlen, Namen, Daten und Zitate am Original. Die Antwort ist die wahrscheinlichste Fortsetzung, nicht die geprüfte Wahrheit.
  7. Ist das Ergebnis nicht passend, präzisieren Sie den Auftrag, statt nur «nochmals» zu schreiben.
  8. Bei langen Gesprächen wiederholen Sie wichtige Vorgaben, weil frühe Teile aus dem Kontext fallen können.

Einfach erklärt: Der Weg vom Text zur Antwort

Ein grosses Sprachmodell (englisch Large Language Model, kurz LLM) ist kein Lexikon und keine Suchmaschine. Es ist ein statistisches Modell, das gelernt hat, wie Text weitergeht. Jede Antwort entsteht Stück für Stück: Das Modell sagt immer nur das nächste Textstück voraus, hängt es an und rechnet erneut.

Schritt 1: Der Text wird in Tokens zerlegt

Bevor das Modell rechnen kann, zerlegt ein sogenannter Tokenizer Ihren Text in Tokens. Ein Token ist oft ein Wortteil, manchmal ein ganzes Wort oder ein Satzzeichen. «Sternwart» kann zum Beispiel aus zwei oder drei Tokens bestehen. Jedes Token erhält eine Nummer, und jede Nummer wird in eine Zahlenreihe übersetzt, ein sogenanntes Embedding. Das ist die Form, in der das Modell Bedeutung «versteht».

Schritt 2: Das neuronale Netz verarbeitet den Kontext

Die Zahlenreihen durchlaufen viele Schichten eines Transformer-Netzes (so heisst die heute übliche Bauart, die 2017 in der Forschungsarbeit «Attention Is All You Need» vorgestellt wurde). Der zentrale Mechanismus heisst Attention (Aufmerksamkeit): Jedes Token «schaut» auf die vorherigen Tokens und gewichtet, welche für seine Bedeutung wichtig sind. So erkennt das Modell, dass sich «sie» in einem Satz auf eine bestimmte Person bezieht oder dass «Bank» im Finanzkontext etwas anderes meint als im Park.

Alles, was das Modell gleichzeitig berücksichtigen kann – Ihre Frage, frühere Nachrichten, eingefügte Dokumente –, bildet das Kontextfenster. Was ausserhalb liegt, existiert für das Modell in diesem Moment nicht. Details finden Sie unter Das Kontextfenster einfach erklärt.

Schritt 3: Wahrscheinlichkeiten für das nächste Token

Am Ende der Schichten steht eine Liste mit Wahrscheinlichkeiten für jedes mögliche nächste Token. Für den Satzanfang «Die Hauptstadt der Schweiz ist» liegt «Bern» weit vorne. Ein Parameter namens Temperatur steuert, wie streng das Modell das wahrscheinlichste Token wählt:

TemperaturVerhaltenGeeignet für
niedrig (z. B. 0–0.3)wählt fast immer das wahrscheinlichste Token, Antworten sind stabilerFakten, Datenextraktion, Code
mittel (z. B. 0.5–0.8)etwas Abwechslung, natürlicher StilTexte, E-Mails, Zusammenfassungen
hoch (z. B. über 1)überraschender, aber fehleranfälligerBrainstorming, kreative Ideen

In normalen Chat-Programmen stellt der Anbieter die Temperatur fest ein. Sie können sie meist nur über Programmierschnittstellen selbst wählen.

Schritt 4: Anhängen und wiederholen

Das gewählte Token wird an den Text angehängt, und das Modell rechnet von vorne – jetzt mit einem Token mehr im Kontext. Diese Schleife läuft, bis ein Ende-Token erreicht ist oder die maximale Länge. Darum erscheinen Antworten in Chat-Programmen oft Wort für Wort: Sie sehen der Schleife beim Arbeiten zu. Diesen Vorgang nennt man Inferenz; er ist vom Training zu unterscheiden, wie Training und Nutzung einer KI zeigt.

Vorlage zum Kopieren

Du bist [Rolle, z. B. Assistenz der Geschäftsleitung in einem Schweizer KMU].
Aufgabe: Fasse den folgenden Text in [Anzahl] Punkten zusammen.
Zielgruppe: [z. B. Geschäftsleitung, keine Fachkenntnisse].
Achte besonders auf: [z. B. Fristen, Kosten, Haftung].
Format: [z. B. nummerierte Liste, je höchstens zwei Sätze].
Wenn eine Angabe im Text fehlt, schreibe «nicht angegeben» und erfinde nichts.
Text: [Text hier einfügen]

Ersetzen Sie die Platzhalter in eckigen Klammern durch Ihre Angaben; je genauer Sie Ziel und Format nennen, desto weniger muss das Modell raten. Wie Sie solche Aufträge aufbauen, zeigt Prompt: Aufbau mit Vorlage.

Worauf Sie achten müssen

  • Plausibel heisst nicht richtig: Das Modell erzeugt die wahrscheinlichste Fortsetzung. Fakten, Zahlen und Zitate gehören überprüft, siehe Halluzinationen bei KI.
  • Gleiche Frage, andere Antwort: Weil bei der Auswahl Zufall mitspielt, kann dieselbe Frage unterschiedliche Antworten liefern. Für wiederholbare Ergebnisse helfen feste Vorlagen.
  • Aktuelles Wissen fehlt: Das Modell kennt nur seine Trainingsdaten. Für aktuelle oder interne Informationen braucht es Werkzeuge wie Websuche oder eine Anbindung an Dokumente (RAG, also Antworten auf Basis eigener Unterlagen).
  • Datenschutz: Geben Sie keine vertraulichen Personen- oder Kundendaten ein, wenn Ihr Betrieb den Dienst nicht freigegeben hat. Prüfen Sie die Regeln Ihres Anbieters und Ihres Betriebs.
  • Kein Bewusstsein, kein Prüfen: Das Modell erkennt Muster. Ob etwas stimmt, entscheiden letztlich Sie.

Ein Beispiel aus der Praxis

Ein Beispiel: Eine Sachbearbeiterin in einer Aargauer Gemeinde lässt sich einen Mietvertrag zusammenfassen. Vorher schreibt sie nur «Fasse zusammen» und erhält einen Text, in dem die Kündigungsfrist fehlt. Sie versteht: Das Modell hat gewählt, was ihm wahrscheinlich wichtig erschien.

Nachher nennt sie Zielgruppe, Format und Schwerpunkte (Fristen, Kosten, Haftung). Die Zusammenfassung enthält nun alle drei Punkte. Die Fristen vergleicht sie trotzdem mit dem Originalvertrag, bevor sie die Zusammenfassung weitergibt.

So hilft Ihnen Alpasana

Wenn Sie lernen möchten, wie Sie einer KI Aufgabe, Rolle, Kontext und Ausgabeformat so mitgeben, dass die Antworten zu Ihrer Arbeit passen, hilft der Online-Kurs Prompt Engineering. Sie bearbeiten komplexe Aufgaben schrittweise, überarbeiten Prompts und prüfen die Ergebnisse. Programmierkenntnisse brauchen Sie dafür nicht, am Ende steht ein Zertifikat.

Häufige Fragen

Versteht ein Sprachmodell, was es schreibt?

Es bildet sehr reichhaltige statistische Zusammenhänge zwischen Begriffen ab und kann damit erstaunlich sinnvoll antworten. Ein Bewusstsein oder ein eigenes Prüfen der Wahrheit hat es nicht. Darum bleibt die menschliche Kontrolle wichtig.

Warum vergisst das Modell manchmal frühere Teile des Gesprächs?

Wenn ein Gespräch länger wird als das Kontextfenster, fallen frühere Teile heraus oder werden zusammengefasst. Wichtige Vorgaben sollten Sie deshalb bei langen Gesprächen erneut nennen.

Rechnet das Modell bei jeder Antwort neu?

Ja. Die gelernten Werte (Parameter) bleiben gleich, aber für jedes neue Token wird der gesamte Kontext erneut verarbeitet. Das ist die Inferenz.

Lernt das Modell aus meinem Gespräch?

Während der Antwort verändert sich das Modell nicht; es nutzt nur den Kontext Ihres Chats. Ob ein Anbieter Eingaben später fürs Training verwendet, regeln seine Datenschutzeinstellungen. Prüfen Sie diese, bevor Sie sensible Inhalte eingeben.

Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.

Quellen

Weiterlesen in der Galaxie