Prompt-Akademie · Prompt Engineering
Wie vergleiche ich zwei Prompt-Versionen fair?
Kurz gesagt
Ändern Sie pro Vergleich nur eine Sache, geben Sie beiden Fassungen dieselben Testfälle und bewerten Sie nach vorher festgelegten Kriterien. Wiederholen Sie jeden Fall mehrmals, weil KI-Antworten schwanken, und lassen Sie wenn möglich eine zweite Person ohne Kenntnis der Fassung beurteilen.
Das Problem
Sie haben Ihren Prompt überarbeitet, zum Beispiel für die Zusammenfassung von Sitzungsnotizen. Die neue Fassung ist länger, enthält ein Beispiel und eine Längenvorgabe. Beim ersten Versuch sieht das Ergebnis gut aus. Aber ist es wirklich besser als vorher, oder hatten Sie zufällig Glück?
Das lässt sich ohne System kaum sagen. KI-Antworten schwanken von Mal zu Mal, und unser Eindruck wird von Tagesform, Erwartung und dem zuletzt gesehenen Ergebnis beeinflusst. Wer nur einmal vergleicht, wählt womöglich die schlechtere Fassung.
Mit einem kleinen, geordneten Vergleich entscheiden Sie auf einer verlässlicheren Grundlage. Es braucht keine Statistik, aber Disziplin bei drei Punkten: gleiche Aufgaben, feste Kriterien, mehrere Durchläufe.
So lösen Sie es mit KI – Schritt für Schritt
- Fassungen benennen: Speichern Sie die bisherige Fassung als «A» und die neue als «B» in einem Dokument. Notieren Sie, was Sie geändert haben.
- Nur eine Änderung pro Vergleich: Haben Sie fünf Dinge gleichzeitig geändert, wissen Sie nachher nicht, welches geholfen hat. Teilen Sie die Änderungen auf und vergleichen Sie Schritt für Schritt.
- Testfälle wählen: Wählen Sie fünf bis acht typische Aufgaben, darunter eine schwierige. Verwenden Sie erfundene oder anonymisierte Inhalte. Siehe Wie teste ich einen Prompt vor dem regelmässigen Einsatz?.
- Kriterien festlegen: Entscheiden Sie vor dem Test, woran Sie ein gutes Ergebnis erkennen: Richtigkeit, Vollständigkeit, Verständlichkeit, Länge, Ton, Nacharbeit. Siehe Woran erkenne ich einen guten Prompt und ein gutes Ergebnis?.
- Beide Fassungen laufen lassen: Geben Sie jeder Fassung dieselben Testfälle, jeweils in einem neuen Chat. Wiederholen Sie jeden Fall zwei- bis dreimal.
- Ergebnisse mischen und bewerten: Legen Sie die Antworten ohne Angabe der Fassung nebeneinander, am besten von einer zweiten Person bewertet. So spielt die Vorliebe für «die neue Version» keine Rolle.
- Punkte zählen und Muster suchen: Tragen Sie die Bewertungen in eine Tabelle ein. Schauen Sie, wo B klar besser ist, wo gleichauf und wo schlechter.
- Entscheiden und festhalten: Wählen Sie die bessere Fassung, schreiben Sie die Gründe auf und speichern Sie die verworfene Fassung als Archiv. Wann Sie aufhören können, zeigt Wann ist mein Prompt gut genug für den Alltag?.
Vorlage zum Kopieren
Ich vergleiche zwei Fassungen eines Prompts für die Aufgabe: [Aufgabe, z. B. Sitzungsnotizen zusammenfassen].
Erstelle mir:
1. 6 Testfälle mit erfundenen Beispielen (davon 1 schwierig, z. B. widersprüchliche Angaben),
2. eine Bewertungstabelle mit den Spalten Testfall, Fassung A, Fassung B, jeweils mit Richtigkeit,
Vollständigkeit, Verständlichkeit (je 1–5) und «Nacharbeit nötig (ja/nein)»,
3. eine kurze Anleitung, wie ich jeden Fall mehrmals durchführe und Zufallsschwankungen berücksichtige.
Verwende einfache Sprache und erfinde keine Ergebnisse.Ersetzen Sie die Aufgabe. Die Tabelle füllen Sie selbst aus, die KI soll nicht bewerten, welche Fassung besser ist.
So sieht ein einfacher Vergleich aus
| Testfall | Fassung A (Punkte) | Fassung B (Punkte) | Bemerkung |
|---|---|---|---|
| 1: Kurzes Protokoll | 3 / 4 / 4 | 4 / 4 / 5 | B knapper und genauer |
| 2: Langes Protokoll | 3 / 3 / 3 | 4 / 3 / 4 | B lässt einen Beschluss aus |
| 3: Widersprüchliche Angaben | 2 / 2 / 3 | 2 / 3 / 3 | beide schwach |
| 4: Notizen mit Zahlen | 4 / 3 / 4 | 3 / 3 / 4 | A genauer bei Zahlen |
Die Spalten zeigen Richtigkeit, Vollständigkeit und Verständlichkeit. Das Beispiel ist erfunden. Im Beispiel gewinnt B bei Lesbarkeit, aber A bei Zahlen. Dann entscheiden Sie, was Ihnen wichtiger ist, oder ändern B so, dass es auch Zahlen genau behandelt. Weitere Hinweise zum Eingrenzen liefert Wie finde ich heraus, welcher Teil meines Prompts nicht hilft?.
Worauf Sie achten müssen
- Datenschutz: Verwenden Sie für Tests erfundene Inhalte. Echte Protokolle und Kundendaten gehören nicht in Programme, die Ihr Betrieb nicht freigegeben hat.
- Zufallsschwankungen: Dieselbe Eingabe kann unterschiedliche Antworten liefern. Siehe Warum antwortet KI auf dieselbe Frage unterschiedlich?.
- Voreingenommenheit: Wir halten die neue Fassung gern für besser. Bewerten Sie, wenn möglich, ohne zu wissen, was von welcher Fassung stammt.
- Gleiche Bedingungen: Nutzen Sie dasselbe Modell, dieselbe Einstellung und denselben Zugang für beide Fassungen.
- Zu kleine Stichprobe: Mit drei Testfällen sehen Sie nur Tendenzen. Prüfen Sie bei wichtigen Prompts mehr Fälle.
- Kein Ersatz für Fachwissen: Ob ein Inhalt stimmt, entscheiden Fachpersonen, nicht die KI.
Ein Beispiel aus der Praxis
Ein Beispiel: Frau Frei, Teamassistentin in einer Gemeinde bei Aarau, hat ihren Prompt für Sitzungsprotokolle um ein Beispiel ergänzt. Vorher liest sie die neue Zusammenfassung zweimal, findet sie «irgendwie besser» und stellt das ganze Team darauf um.
Nachher testet sie beide Fassungen an sechs erfundenen Protokollen, jeweils dreimal. Ein Kollege bewertet die Ergebnisse, ohne die Fassung zu kennen. Das Resultat: Die neue Fassung ist verständlicher, lässt aber bei langen Protokollen öfter einen Beschluss aus. Frau Frei ergänzt eine Zeile («Liste alle Beschlüsse vollständig auf») und prüft noch einmal. Erst dann verteilt sie die neue Fassung.
So hilft Ihnen Alpasana
Wie man Prompts überarbeitet, prüft und für wiederkehrende Aufgaben ein getestetes Prompt-Set erarbeitet, lernen Sie im Kurs Prompt Engineering von absofort. Beschrieben sind ausserdem das schrittweise Bearbeiten komplexer Aufgaben und der Umgang mit Datenschutz. Der Kurs läuft online mit Zertifikat und braucht keine Programmierkenntnisse.
Häufige Fragen
Wie viele Durchläufe pro Testfall sind sinnvoll?
Zwei bis drei genügen meist, um Schwankungen zu erkennen. Bei sehr wichtigen Prompts können es mehr sein.
Kann die KI die Fassungen selbst bewerten?
Sie kann Hinweise geben, aber sie bewertet nicht verlässlich und bevorzugt manchmal die eigene Ausdrucksweise. Eine menschliche Bewertung bleibt nötig.
Was, wenn beide Fassungen gleich gut sind?
Dann bleiben Sie bei der einfacheren, kürzeren Fassung. Sie ist leichter zu pflegen und weniger fehleranfällig.
Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.
Weiterlesen in der Galaxie
- Woran erkenne ich einen guten Prompt und ein gutes Ergebnis?Gute Prompts und Ergebnisse erkennen: Mit einer Checkliste aus acht Kriterien bewerten Sie Aufträge an die KI und deren Antworten statt nach Bauchgefühl.
- Wie teste ich einen Prompt vor dem regelmässigen Einsatz?Prompt testen: So prüfen Sie mit wenigen Testfällen, ob ein Prompt im Alltag trägt, auch bei Grenzfällen, und wann er gut genug für den Einsatz ist.
- Wie finde ich heraus, welcher Teil meines Prompts nicht hilft?Prompt Fehler analysieren: So finden Sie systematisch heraus, welcher Teil Ihres Prompts schlechte Antworten verursacht, statt alles auf einmal zu ändern.
- Wie behalte ich bei geänderten Prompt-Vorlagen den Überblick?Prompt Versionierung: So behalten Sie den Überblick, wenn mehrere Fassungen einer Vorlage kursieren, mit Versionsnummern, Änderungsprotokoll und Archiv.
- Dokumentversionen vergleichen: Änderungen mit KI erklärenDokumentversionen vergleichen: Änderungen zwischen alter und neuer Fassung mit KI aufspüren und erklären, mit Vorlage, Schritten und Prüfhinweisen.