Zum Inhalt springen

Modell-Atlas · KI-Weiterbildung für Unternehmen

KI-Antworten ohne Markennamen bewerten: So geht ein Blindtest

Stand 10.10.2026 · 5 Min. Lesezeit

Kurz gesagt

Beim Blindtest lassen Sie mehrere KI-Modelle dieselbe Aufgabe lösen, entfernen die Namen, mischen die Reihenfolge und bewerten die Antworten nach festen Kriterien. Erst danach wird aufgedeckt, welches Modell welche Antwort lieferte. So beeinflussen Marke und Erwartung Ihr Urteil weniger.

Das Problem

Im Team gibt es Fans verschiedener KI-Angebote. Die einen schwören auf das bekannteste, die anderen auf ein neues. Bei Vergleichen lesen alle die Antworten durch die Brille ihrer Vorliebe: Was vom Lieblingsmodell kommt, wirkt klüger, und die Fehler des anderen fallen mehr auf. Der Entscheid wird dann zur Glaubensfrage.

Das ist menschlich. Wir lassen uns von Namen, Logos und Erwartungen beeinflussen, auch wenn wir meinen, objektiv zu urteilen. Für eine Investition in Abos oder Software ist das ungünstig.

Ein Blindtest schafft Abhilfe: Sie bewerten Antworten, ohne zu wissen, von welchem Modell sie stammen. Das ist einfach und liefert aussagekräftigere Ergebnisse. Diese Seite zeigt, wie es geht.

So lösen Sie es mit KI – Schritt für Schritt

  1. Ziel und Aufgaben festlegen. Wählen Sie fünf bis zehn typische Aufgaben aus Ihrem Alltag und beschreiben Sie, was gut heisst. Siehe Eigene Testaufgaben.
  1. Modelle auswählen. Bestimmen Sie zwei bis vier Modelle oder Einstellungen, die verglichen werden sollen.
  1. Aufträge identisch stellen. Geben Sie jedem Modell denselben Wortlaut und dieselben Unterlagen. Anonymisieren Sie die Daten.
  1. Antworten speichern. Kopieren Sie jede Antwort in ein eigenes Dokument oder eine Tabellenzeile. Entfernen Sie Hinweise auf das Modell, etwa Standardsätze wie «Als KI-Assistent von …».
  1. Anonym beschriften. Vergeben Sie neutrale Namen wie «Antwort A, B, C» und mischen Sie die Reihenfolge zufällig. Eine Mitarbeiterin, die später nicht bewertet, führt eine Zuordnungsliste.
  1. Kriterien bestimmen. Legen Sie vorab fest: Richtigkeit, Vollständigkeit, Verständlichkeit, Ton, Format, Brauchbarkeit ohne Nacharbeit. Bewerten Sie jedes Kriterium zum Beispiel mit 1 bis 5 Punkten.
  1. Mehrere Personen bewerten lassen. Zwei bis fünf Personen bewerten unabhängig voneinander, ohne sich abzusprechen.
  1. Auswerten, dann aufdecken. Berechnen Sie Durchschnitte, schauen Sie auf Unterschiede zwischen den Bewertern und decken Sie erst dann auf, welches Modell welche Antwort lieferte.
  1. Entscheid begründen. Halten Sie Ergebnis und Kriterien fest, damit die Leitung nachvollziehen kann, warum ein Modell gewählt wurde. Weiterführend: Nutzwertanalyse.

Vorlage zum Kopieren

Mit diesem Bewertungsbogen bewerten Ihre Testpersonen jede Antwort. Sie können ihn als Tabelle anlegen:

Bewertungsbogen Blindtest
Aufgabe: [Nr. / Kurzbeschreibung]
Antwort: [A / B / C]   Bewerter/in: [Name oder Kürzel]
Richtigkeit (1–5): [ ]  Bemerkung: [ ]
Vollständigkeit (1–5): [ ]
Verständlichkeit (1–5): [ ]
Ton und Stil (1–5): [ ]
Format wie verlangt (1–5): [ ]
Nacharbeit nötig (keine / wenig / viel): [ ]
Gesamteindruck (1–5): [ ]
Fehler, die auffielen: [ ]

Passen Sie die Kriterien an Ihre Aufgabe an und fügen Sie bei Bedarf eigene hinzu, zum Beispiel «Schweizer Schreibweise eingehalten».

Worauf Sie achten müssen

  • Verräterische Hinweise: Manche Modelle haben typische Formulierungen oder Formatierungen, an denen man sie erkennt. Vereinheitlichen Sie das Layout.
  • Länge und Gefälligkeit: Längere, schöner formatierte Antworten wirken oft besser, auch wenn sie nicht richtiger sind. Achten Sie bei der Bewertung auf Inhalt.
  • Reihenfolge-Effekt: Die erste Antwort wird manchmal bevorzugt. Mischen Sie die Reihenfolge.
  • Fakten prüfen: Gefällt eine Antwort, kann sie trotzdem falsch sein. Kontrollieren Sie Zahlen und Aussagen.
  • Datenschutz: Testen Sie mit anonymisierten Beispielen. Geben Sie keine Personendaten oder vertraulichen Unterlagen ein.
  • KI als Bewerterin: Man kann auch eine KI Antworten bewerten lassen, sie hat aber eigene Vorlieben und ist nur begrenzt verlässlich. Siehe Automatische Bewertung: Grenzen.
  • Kleine Stichprobe: Wenige Aufgaben und Bewerter liefern nur Tendenzen.

Ein Beispiel aus der Praxis

Ein Beispiel: Ein Architekturbüro in Chur will mit KI Bauherrenmails und Projektzusammenfassungen schreiben und überlegt, welches Modell es abonnieren soll. Der Büroleiter bevorzugt ein bekanntes Modell, die Assistentin ein neues.

Vorher: Beide diskutieren ohne Ergebnis. Nachher: Die Assistentin lässt drei Modelle dieselben vier Aufgaben lösen und speichert die Antworten anonym als A, B und C. Drei Mitarbeitende bewerten sie mit dem Bogen. Zuletzt zeigt sich: Die meisten Punkte erhält die Antwort, die vom neuen Modell stammt, besonders beim Ton. Der Büroleiter ist überrascht, aber überzeugt, weil er sein Urteil ohne Namen gefällt hat. Das Büro entscheidet sich für dieses Modell und lässt alle Texte vor dem Versand prüfen.

Der Blindtest lässt sich auch für Prompts verwenden. Wenn Sie zwei Formulierungen eines Auftrags vergleichen möchten, lassen Sie beide Ergebnisse anonym bewerten. So erkennen Sie, welche Anweisung bessere Texte liefert, und können eine bewährte Fassung in Ihre Prompt-Sammlung übernehmen. Dokumentieren Sie dabei jeweils Datum, Modell und Einstellungen, damit der Test später wiederholbar bleibt.

Zum Schluss ein Hinweis zur Teamkultur: Besprechen Sie das Ergebnis offen, auch wenn es überrascht. Ein Blindtest funktioniert nur, wenn alle bereit sind, ihre Vorlieben zu überprüfen.

So hilft Ihnen Alpasana

Damit Ihr Team KI-Ergebnisse systematisch und neutral beurteilen kann, hilft Wissen im Umgang mit Ergebnissen und Daten. Die KI-Weiterbildung für Unternehmen von absofort umfasst laut Beschreibung Online-Weiterbildung von Grundlagen bis zum Executive-Diplomlehrgang, mit Datenschutz als Lerninhalt und dem verantwortungsbewussten Umgang mit Unternehmensdaten. Für Firmenlösungen und Teambuchungen gibt es eine Kontaktmöglichkeit.

Häufige Fragen

Wie viele Aufgaben und Bewerter brauche ich?

Für einen ersten Eindruck genügen fünf bis zehn Aufgaben und zwei bis drei Bewerter. Je wichtiger der Entscheid, desto mehr, damit Zufall und Vorlieben einzelner weniger ins Gewicht fallen.

Kann ein Blindtest auch mit nur einem Modell nützlich sein?

Ja, etwa um zwei Prompts oder Einstellungen zu vergleichen. Das Prinzip bleibt gleich: Antworten anonymisieren und nach festen Kriterien bewerten.

Was, wenn die Bewerter sehr unterschiedlich urteilen?

Das ist ein Hinweis, dass Kriterien unklar sind oder Geschmack mitspielt. Besprechen Sie die Unterschiede, schärfen Sie die Kriterien und wiederholen Sie die Bewertung.

Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.

Weiterlesen in der Galaxie