Modell-Atlas · Prompt Engineering
KI-Modelle selbst vergleichen: Vorlage für einen fairen Test
Kurz gesagt
Für einen fairen Vergleich geben Sie allen Modellen dieselben Aufgaben mit denselben Eingaben, bewerten die Ergebnisse nach festen Kriterien und wiederholen den Test mehrfach. Notieren Sie Modell, Version, Datum und Einstellungen. So erkennen Sie, welches Modell zu Ihren Aufgaben passt, statt sich auf Ranglisten und Werbung zu verlassen.
Das Problem
Sie möchten wissen, welche KI für Ihre Aufgaben die beste ist. Im Internet finden Sie Ranglisten, Testberichte und Meinungen, die einander widersprechen. Also probieren Sie selbst: Eine Frage hier, eine Frage dort. Am Ende haben Sie einen Eindruck, aber keine belastbare Entscheidung.
Das Problem liegt im Vorgehen. Wenn jedes Modell andere Fragen bekommt, die Fragen anders formuliert sind oder Sie nur einen einzigen Durchlauf anschauen, lässt sich nichts vergleichen. KI-Antworten schwanken ausserdem von Mal zu Mal, so dass ein Einzelversuch täuschen kann.
Mit einer einfachen Testvorlage gehen Sie systematisch vor. Der Aufwand beträgt einige Stunden, danach haben Sie eine Grundlage, die Sie auch später wieder nutzen können.
So lösen Sie es mit KI – Schritt für Schritt
- Ziel festlegen: Entscheiden Sie, wofür Sie das Modell brauchen, zum Beispiel Kundenmails beantworten, Protokolle zusammenfassen oder Texte übersetzen.
- Kandidaten wählen: Wählen Sie zwei bis vier Modelle oder Dienste, die infrage kommen. Notieren Sie genaue Bezeichnung, Zugang (kostenlos oder bezahlt) und Datum des Tests.
- Testaufgaben sammeln: Wählen Sie pro Aufgabenart drei bis fünf typische Beispiele. Verwenden Sie erfundene oder anonymisierte Inhalte. Nehmen Sie auch eine schwierige Aufgabe dazu.
- Bewertungskriterien festlegen: Legen Sie vor dem Test fest, woran Sie ein gutes Ergebnis erkennen: Richtigkeit, Vollständigkeit, Verständlichkeit, Schweizer Schreibweise, Nacharbeit.
- Gleiche Eingaben verwenden: Geben Sie jedem Modell wörtlich dieselbe Eingabe. Starten Sie für jede Aufgabe einen neuen Chat, damit frühere Antworten nichts beeinflussen.
- Mehrfach testen: Wiederholen Sie jede Aufgabe zwei- bis dreimal. Notieren Sie, wie stark die Ergebnisse schwanken.
- Bewerten, möglichst ohne Namen: Lassen Sie, wenn möglich, eine zweite Person bewerten, ohne zu wissen, welches Modell was geschrieben hat. Das verhindert Vorlieben.
- Ergebnisse auswerten und festhalten: Zählen Sie Punkte, schauen Sie auf Nacharbeit und Tempo und halten Sie Ihre Entscheidung samt Begründung fest. Planen Sie einen erneuten Test nach einigen Monaten ein.
Vorlage zum Kopieren
Erstelle mir einen Testplan, um [Anzahl] KI-Modelle für folgende Aufgaben zu vergleichen:
[Aufgabenarten, z. B. Kundenmails beantworten, Protokolle zusammenfassen].
Betrieb: [Branche], Sprache: Deutsch (Schweiz), Anrede «Sie».
Liefere: 1. je Aufgabenart 4 Testaufgaben mit erfundenen Beispieldaten, darunter eine schwierige,
2. eine Bewertungstabelle mit den Kriterien Richtigkeit, Vollständigkeit, Verständlichkeit,
Schweizer Schreibweise, Nacharbeit (je 1–5), 3. eine Zeile für Modell, Version, Datum, Einstellungen,
4. Hinweise, wie ich Zufallsschwankungen berücksichtige.
Erfinde keine Modellnamen und keine Testergebnisse.Ersetzen Sie die Angaben in den Klammern. Die Testaufgaben passen Sie an Ihre eigenen Arbeitsfälle an.
Beispiel einer Bewertungstabelle
| Aufgabe | Modell | Richtigkeit (1–5) | Vollständigkeit (1–5) | Sprache (1–5) | Nacharbeit (ja/nein) | Bemerkung |
|---|---|---|---|---|---|---|
| Kundenmail beantworten | A | |||||
| Kundenmail beantworten | B | |||||
| Protokoll zusammenfassen | A | |||||
| Protokoll zusammenfassen | B |
Tragen Sie zusätzlich ein, wann der Test stattfand und welche Version beziehungsweise welcher Tarif genutzt wurde. Das erleichtert spätere Vergleiche. Eine Hilfe zur Auswahl nach Aufgaben bietet Welches KI-Modell passt zu meiner Aufgabe?. Wie Sie Ihre eigenen Prompts testen, lesen Sie unter Wie teste ich einen Prompt vor dem regelmässigen Einsatz?.
Wie lesen Sie die Ergebnisse?
Zählen Sie nach dem Test nicht nur die Punkte, sondern schauen Sie auf die Muster dahinter.
- Bestes Modell pro Aufgabe: Oft schneidet ein Modell bei Mails gut ab und ein anderes bei Zusammenfassungen. Dann lohnt sich vielleicht eine Aufteilung.
- Schwankung: Wenn ein Modell bei derselben Aufgabe einmal sehr gut und einmal schwach ist, ist es weniger verlässlich als eines mit gleichmässigen mittleren Werten.
- Nacharbeit: Ein Modell mit etwas weniger glänzenden, aber sauberen Texten kann im Alltag mehr Zeit sparen.
- Ausreisser: Fehler bei Zahlen, Namen oder Fristen wiegen schwerer als Stilfragen. Gewichten Sie sie stärker.
- Gesamtbild: Nehmen Sie Preis, Datenschutz und Bedienung dazu, bevor Sie entscheiden.
Halten Sie am Ende in drei Sätzen fest, welche Entscheidung Sie getroffen haben und wann Sie sie überprüfen.
Worauf Sie achten müssen
- Datenschutz: Verwenden Sie nur erfundene oder anonymisierte Inhalte und nur Dienste, die Ihr Betrieb für Tests zulässt.
- Gerechtigkeit des Tests: Prüfen Sie, dass alle Modelle denselben Zugang (gratis oder bezahlt) und dieselben Einstellungen haben. Sonst vergleichen Sie Äpfel mit Birnen.
- Schwankungen: Ein einzelner Durchlauf kann Zufall sein. Wiederholen Sie wichtige Aufgaben.
- Vorlieben: Menschen bevorzugen oft längere oder freundlichere Antworten. Achten Sie auf Richtigkeit, nicht auf Stil allein.
- Momentaufnahme: Modelle werden aktualisiert. Halten Sie Datum und Version fest und wiederholen Sie den Test nach einer Weile.
- Kosten beachten: Berücksichtigen Sie nicht nur die Qualität, sondern auch Preis, Limits und Datenschutzbedingungen.
Ein Beispiel aus der Praxis
Ein Beispiel: Eine Gemeindeverwaltung im Kanton Thurgau möchte eine KI für Entwürfe von Bürgerbriefen auswählen. Vorher entscheidet sie nach einer Zeitungsmeldung über das «beste Modell».
Nachher stellt die Sachbearbeiterin zehn erfundene Anfragen zusammen und gibt sie drei Modellen nacheinander ein, jede dreimal. Ein Kollege bewertet die Antworten ohne Modellnamen. Zwei Modelle schneiden ähnlich ab, eines schreibt öfter das scharfe S der deutschen Schreibweise und verlangt mehr Nacharbeit. Die Verwaltung entscheidet nach Qualität, Datenschutzbedingungen und Preis und hält das Testdatum fest.
So hilft Ihnen Alpasana
Wie Sie Aufgaben so formulieren, dass Vergleiche fair und die Ergebnisse brauchbar werden, lernen Sie im Kurs Prompt Engineering von absofort. Beschrieben sind unter anderem Aufgabe, Rolle, Kontext, Ziel und Ausgabeformat festlegen, Prompts überarbeiten, Ergebnisse prüfen und ein getestetes Prompt-Set für einen wiederkehrenden Prozess. Der Kurs läuft online mit Zertifikat.
Häufige Fragen
Wie viele Testaufgaben sind genug?
Für einen ersten Vergleich genügen zehn bis zwanzig gut gewählte Aufgaben. Wichtiger als die Menge ist, dass sie Ihren Alltag abbilden.
Muss ich bezahlte Versionen testen?
Testen Sie die Version, die Sie später nutzen möchten. Gratisversionen können sich in Qualität und Limits von bezahlten unterscheiden.
Kann die KI die Ergebnisse selbst bewerten?
Sie kann helfen, aber sie bewertet nicht immer zuverlässig und bevorzugt manchmal die eigene Art zu schreiben. Eine menschliche Bewertung bleibt wichtig.
Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.
Weiterlesen in der Galaxie
- Was sagen KI-Ranglisten über meine Büroaufgaben aus?KI Rangliste verstehen: Was Benchmarks und Ranglisten messen, warum sie Ihre Büroaufgaben oft nicht abbilden und wie Sie sie als Orientierung nutzen.
- Welches KI-Modell passt zu meiner Aufgabe?Welches KI-Modell passt? Mit dieser Checkliste ordnen Sie Ihre Aufgabe nach Art, Aktualität, Vertraulichkeit und Umfang ein und finden die Modellart.
- Wie teste ich einen Prompt vor dem regelmässigen Einsatz?Prompt testen: So prüfen Sie mit wenigen Testfällen, ob ein Prompt im Alltag trägt, auch bei Grenzfällen, und wann er gut genug für den Einsatz ist.
- Welche KI kaufen? Entscheidungsvorlage für die GeschäftsleitungKI Auswahl Entscheidungsvorlage: Vorlage für die Geschäftsleitung mit Anforderungen, Anbietervergleich, Kostenrahmen und Freigabe, kurz und nachvollziehbar.
- KI testen: Vorlage für typische Fälle und GrenzfälleKI Testfälle Vorlage: Eine Vorlage mit Testszenarien, erwarteten Ergebnissen und Fehlerfällen, um die Zuverlässigkeit einer KI im Arbeitsalltag zu prüfen.