Grundlagen · Prompt Engineering
Wie entsteht eine Antwort eines Sprachmodells? Vom Text zum nächsten Token
Kurz gesagt
Ein Sprachmodell zerlegt Ihre Eingabe in Tokens, verarbeitet sie in vielen Schichten eines neuronalen Netzes und berechnet daraus, welches Token als Nächstes am wahrscheinlichsten folgt. Dieses Token wird angehängt und der Vorgang wiederholt sich, bis die Antwort fertig ist. Das Modell «schlägt nicht nach», sondern setzt Muster fort, die es im Training gelernt hat.
Das Problem
Sie stellen einer KI eine Frage, und nach wenigen Sekunden erscheint eine flüssige, selbstsichere Antwort. Mal ist sie genau richtig, mal enthält sie einen Fehler, den man erst beim zweiten Hinsehen bemerkt. Wer nicht weiss, wie so eine Antwort zustande kommt, kann das kaum einordnen.
Das ist lästig und riskant: Entweder vertrauen Sie der KI zu stark, oder Sie misstrauen ihr so sehr, dass Sie sie gar nicht nutzen. Beides kostet Zeit. Ein grundlegendes Verständnis des Ablaufs hilft, bessere Aufträge zu formulieren und Antworten gezielter zu prüfen.
Die gute Nachricht: Der Ablauf lässt sich in vier Schritten erklären, ganz ohne Mathematik.
So lösen Sie es mit KI – Schritt für Schritt
Mit diesem Wissen steuern Sie Antworten gezielter. So gehen Sie vor:
- Öffnen Sie Ihr KI-Programm und starten Sie für ein neues Thema einen neuen Chat, damit nichts Unpassendes im Kontext steht.
- Schreiben Sie zuerst auf, was Sie wollen: Ziel, Zielgruppe und gewünschtes Format (etwa «fünf Stichpunkte»).
- Geben Sie alle nötigen Angaben in den Chat selbst. Das Modell sieht nur, was im Kontextfenster steht.
- Nennen Sie, worauf es Ihnen ankommt, zum Beispiel «Kündigungsfristen und Haftung». Sonst wählt das Modell, was ihm wahrscheinlich wichtig erscheint.
- Schicken Sie den Auftrag ab und lesen Sie die Antwort in Ruhe.
- Prüfen Sie Zahlen, Namen, Daten und Zitate am Original. Die Antwort ist die wahrscheinlichste Fortsetzung, nicht die geprüfte Wahrheit.
- Ist das Ergebnis nicht passend, präzisieren Sie den Auftrag, statt nur «nochmals» zu schreiben.
- Bei langen Gesprächen wiederholen Sie wichtige Vorgaben, weil frühe Teile aus dem Kontext fallen können.
Einfach erklärt: Der Weg vom Text zur Antwort
Ein grosses Sprachmodell (englisch Large Language Model, kurz LLM) ist kein Lexikon und keine Suchmaschine. Es ist ein statistisches Modell, das gelernt hat, wie Text weitergeht. Jede Antwort entsteht Stück für Stück: Das Modell sagt immer nur das nächste Textstück voraus, hängt es an und rechnet erneut.
Schritt 1: Der Text wird in Tokens zerlegt
Bevor das Modell rechnen kann, zerlegt ein sogenannter Tokenizer Ihren Text in Tokens. Ein Token ist oft ein Wortteil, manchmal ein ganzes Wort oder ein Satzzeichen. «Sternwart» kann zum Beispiel aus zwei oder drei Tokens bestehen. Jedes Token erhält eine Nummer, und jede Nummer wird in eine Zahlenreihe übersetzt, ein sogenanntes Embedding. Das ist die Form, in der das Modell Bedeutung «versteht».
Schritt 2: Das neuronale Netz verarbeitet den Kontext
Die Zahlenreihen durchlaufen viele Schichten eines Transformer-Netzes (so heisst die heute übliche Bauart, die 2017 in der Forschungsarbeit «Attention Is All You Need» vorgestellt wurde). Der zentrale Mechanismus heisst Attention (Aufmerksamkeit): Jedes Token «schaut» auf die vorherigen Tokens und gewichtet, welche für seine Bedeutung wichtig sind. So erkennt das Modell, dass sich «sie» in einem Satz auf eine bestimmte Person bezieht oder dass «Bank» im Finanzkontext etwas anderes meint als im Park.
Alles, was das Modell gleichzeitig berücksichtigen kann – Ihre Frage, frühere Nachrichten, eingefügte Dokumente –, bildet das Kontextfenster. Was ausserhalb liegt, existiert für das Modell in diesem Moment nicht. Details finden Sie unter Das Kontextfenster einfach erklärt.
Schritt 3: Wahrscheinlichkeiten für das nächste Token
Am Ende der Schichten steht eine Liste mit Wahrscheinlichkeiten für jedes mögliche nächste Token. Für den Satzanfang «Die Hauptstadt der Schweiz ist» liegt «Bern» weit vorne. Ein Parameter namens Temperatur steuert, wie streng das Modell das wahrscheinlichste Token wählt:
| Temperatur | Verhalten | Geeignet für |
|---|---|---|
| niedrig (z. B. 0–0.3) | wählt fast immer das wahrscheinlichste Token, Antworten sind stabiler | Fakten, Datenextraktion, Code |
| mittel (z. B. 0.5–0.8) | etwas Abwechslung, natürlicher Stil | Texte, E-Mails, Zusammenfassungen |
| hoch (z. B. über 1) | überraschender, aber fehleranfälliger | Brainstorming, kreative Ideen |
In normalen Chat-Programmen stellt der Anbieter die Temperatur fest ein. Sie können sie meist nur über Programmierschnittstellen selbst wählen.
Schritt 4: Anhängen und wiederholen
Das gewählte Token wird an den Text angehängt, und das Modell rechnet von vorne – jetzt mit einem Token mehr im Kontext. Diese Schleife läuft, bis ein Ende-Token erreicht ist oder die maximale Länge. Darum erscheinen Antworten in Chat-Programmen oft Wort für Wort: Sie sehen der Schleife beim Arbeiten zu. Diesen Vorgang nennt man Inferenz; er ist vom Training zu unterscheiden, wie Training und Nutzung einer KI zeigt.
Vorlage zum Kopieren
Du bist [Rolle, z. B. Assistenz der Geschäftsleitung in einem Schweizer KMU].
Aufgabe: Fasse den folgenden Text in [Anzahl] Punkten zusammen.
Zielgruppe: [z. B. Geschäftsleitung, keine Fachkenntnisse].
Achte besonders auf: [z. B. Fristen, Kosten, Haftung].
Format: [z. B. nummerierte Liste, je höchstens zwei Sätze].
Wenn eine Angabe im Text fehlt, schreibe «nicht angegeben» und erfinde nichts.
Text: [Text hier einfügen]Ersetzen Sie die Platzhalter in eckigen Klammern durch Ihre Angaben; je genauer Sie Ziel und Format nennen, desto weniger muss das Modell raten. Wie Sie solche Aufträge aufbauen, zeigt Prompt: Aufbau mit Vorlage.
Worauf Sie achten müssen
- Plausibel heisst nicht richtig: Das Modell erzeugt die wahrscheinlichste Fortsetzung. Fakten, Zahlen und Zitate gehören überprüft, siehe Halluzinationen bei KI.
- Gleiche Frage, andere Antwort: Weil bei der Auswahl Zufall mitspielt, kann dieselbe Frage unterschiedliche Antworten liefern. Für wiederholbare Ergebnisse helfen feste Vorlagen.
- Aktuelles Wissen fehlt: Das Modell kennt nur seine Trainingsdaten. Für aktuelle oder interne Informationen braucht es Werkzeuge wie Websuche oder eine Anbindung an Dokumente (RAG, also Antworten auf Basis eigener Unterlagen).
- Datenschutz: Geben Sie keine vertraulichen Personen- oder Kundendaten ein, wenn Ihr Betrieb den Dienst nicht freigegeben hat. Prüfen Sie die Regeln Ihres Anbieters und Ihres Betriebs.
- Kein Bewusstsein, kein Prüfen: Das Modell erkennt Muster. Ob etwas stimmt, entscheiden letztlich Sie.
Ein Beispiel aus der Praxis
Ein Beispiel: Eine Sachbearbeiterin in einer Aargauer Gemeinde lässt sich einen Mietvertrag zusammenfassen. Vorher schreibt sie nur «Fasse zusammen» und erhält einen Text, in dem die Kündigungsfrist fehlt. Sie versteht: Das Modell hat gewählt, was ihm wahrscheinlich wichtig erschien.
Nachher nennt sie Zielgruppe, Format und Schwerpunkte (Fristen, Kosten, Haftung). Die Zusammenfassung enthält nun alle drei Punkte. Die Fristen vergleicht sie trotzdem mit dem Originalvertrag, bevor sie die Zusammenfassung weitergibt.
So hilft Ihnen Alpasana
Wenn Sie lernen möchten, wie Sie einer KI Aufgabe, Rolle, Kontext und Ausgabeformat so mitgeben, dass die Antworten zu Ihrer Arbeit passen, hilft der Online-Kurs Prompt Engineering. Sie bearbeiten komplexe Aufgaben schrittweise, überarbeiten Prompts und prüfen die Ergebnisse. Programmierkenntnisse brauchen Sie dafür nicht, am Ende steht ein Zertifikat.
Häufige Fragen
Versteht ein Sprachmodell, was es schreibt?
Es bildet sehr reichhaltige statistische Zusammenhänge zwischen Begriffen ab und kann damit erstaunlich sinnvoll antworten. Ein Bewusstsein oder ein eigenes Prüfen der Wahrheit hat es nicht. Darum bleibt die menschliche Kontrolle wichtig.
Warum vergisst das Modell manchmal frühere Teile des Gesprächs?
Wenn ein Gespräch länger wird als das Kontextfenster, fallen frühere Teile heraus oder werden zusammengefasst. Wichtige Vorgaben sollten Sie deshalb bei langen Gesprächen erneut nennen.
Rechnet das Modell bei jeder Antwort neu?
Ja. Die gelernten Werte (Parameter) bleiben gleich, aber für jedes neue Token wird der gesamte Kontext erneut verarbeitet. Das ist die Inferenz.
Lernt das Modell aus meinem Gespräch?
Während der Antwort verändert sich das Modell nicht; es nutzt nur den Kontext Ihres Chats. Ob ein Anbieter Eingaben später fürs Training verwendet, regeln seine Datenschutzeinstellungen. Prüfen Sie diese, bevor Sie sensible Inhalte eingeben.
Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.
Quellen
Weiterlesen in der Galaxie
- TokenWas ist ein Token bei KI-Sprachmodellen? Definition, Beispiel und warum Tokens Kosten, Länge und Qualität von KI-Antworten beeinflussen, einfach erklärt.
- Was unterscheidet Training und Nutzung einer KI?Training Inferenz Unterschied: Warum eine KI beim Antworten nicht neu trainiert wird und was die Trennung von Lernen und Nutzung für Ihre Daten heisst.
- Was sind Halluzinationen bei KI?KI Halluzinationen einfach erklärt: warum KI-Chats überzeugend falsche Fakten, Quellen und Zahlen erfinden, wie Sie das erkennen und das Risiko senken.
- Was ist das Kontextfenster einer KI?Kontextfenster einfach erklärt: wie viel Text eine KI auf einmal berücksichtigen kann, warum lange Chats und Dokumente an Grenzen stossen und was hilft.
- Was bedeutet die Temperatur bei KI-Antworten?KI Temperatur einfach erklärt: Was eine Temperatureinstellung an der Antwort verändert, wann niedrige oder hohe Werte sinnvoll sind und wo Sie sie finden.