Zum Inhalt springen

Eigene LLMs & KI-Systeme · KI-Beratung und digitale Transformation

Wie vergleichen wir KI-Modelle mit unseren eigenen Aufgaben?

Stand 10.10.2026 · 5 Min. Lesezeit

Kurz gesagt

Allgemeine Ranglisten sagen wenig darüber, wie gut ein Modell Ihre Aufgaben löst. Vergleichen Sie deshalb 2 bis 4 Modelle mit denselben 20 bis 30 echten Aufgaben aus Ihrem Alltag, lassen Sie die Antworten blind von Fachpersonen bewerten und wählen Sie das Modell mit dem besten Verhältnis aus Qualität, Kosten und Datenschutz.

Das Problem

Ein Ingenieurbüro in Bern möchte ein KI-Modell für Berichte, Zusammenfassungen und die Beantwortung technischer Fragen einsetzen. Im Internet finden sich Ranglisten, Testergebnisse und Empfehlungen, die sich widersprechen. Frau Müller, die das Projekt koordiniert, fragt sich, welchem Ergebnis sie trauen soll.

Das Problem: Allgemeine Ranglisten messen allgemeine Fähigkeiten, etwa Wissensfragen oder Rechenaufgaben auf Englisch. Ihr Alltag besteht aus Schweizer Fachsprache, Ihren Dokumenten und Ihren Qualitätsanforderungen. Ein Modell, das in einer Rangliste glänzt, kann bei Ihren Aufgaben mittelmässig sein, und ein kleineres, günstigeres Modell kann genügen.

Die einzige verlässliche Methode ist ein eigener, kleiner Praxistest. Er dauert wenige Stunden und spart oft viel Geld.

So lösen Sie es mit KI – Schritt für Schritt

  1. Aufgaben auswählen. Wählen Sie 20 bis 30 typische Aufgaben, zum Beispiel: «Fasse diesen Bericht in fünf Sätzen zusammen», «Beantworte diese Kundenfrage anhand dieses Merkblatts», «Formuliere diese Notiz zu einer E-Mail um». Verwenden Sie anonymisierte Beispiele.
  1. Kandidaten bestimmen. Wählen Sie zwei bis vier Modelle, zum Beispiel ein Cloud-Modell, ein kleineres Cloud-Modell und ein lokales Modell. Welche genau, hängt von Datenschutz, Budget und Technik ab. Hinweise: Lokal oder Cloud.
  1. Gleiche Bedingungen schaffen. Alle Modelle erhalten dieselben Aufgaben, dieselbe Anweisung und dieselben Unterlagen. Ändern Sie nur das Modell, nichts anderes.
  1. Antworten einsammeln. Speichern Sie die Antworten in einer Tabelle: eine Zeile pro Aufgabe, eine Spalte pro Modell.
  1. Namen verdecken. Mischen Sie die Reihenfolge und ersetzen Sie Modellnamen durch Buchstaben (A, B, C). Eine Person ausserhalb der Bewertung kann das vorbereiten.
  1. Blind bewerten. Zwei Fachpersonen bewerten die Antworten nach einem gemeinsamen Raster: Richtigkeit, Vollständigkeit, Verständlichkeit, Sprache. Siehe Bewertungsraster.
  1. Zusätzliche Kriterien erfassen. Notieren Sie Antwortzeit, Kosten pro Aufgabe (falls bekannt), Datenschutzbedingungen und Aufwand für Betrieb. Qualität allein entscheidet nicht.
  1. Entscheiden und dokumentieren. Wählen Sie das Modell mit dem besten Gesamtbild und halten Sie fest, warum. Planen Sie, den Test in einigen Monaten zu wiederholen, weil sich Modelle schnell ändern.

Vorlage zum Kopieren

Mit diesem Prompt bereiten Sie eine Bewertungstabelle für den Blindtest vor. Fügen Sie nur anonymisierte Aufgaben ein.

Erstelle eine Bewertungstabelle für einen Blindvergleich von [Anzahl] KI-Modellen (A, B, C)
bei [Anzahl] Aufgaben aus dem Bereich [Aufgabenbereich, z. B. technische Berichte].
Spalten: Aufgabe Nr., Modell, Richtigkeit (1-5), Vollständigkeit (1-5), Verständlichkeit (1-5),
Schweizer Sprache und Fachbegriffe (1-5), Bemerkung. Ergänze unten eine Zeile für den
Durchschnitt pro Modell und eine kurze Anleitung (fünf Sätze), wie zwei Personen unabhängig
bewerten und Abweichungen besprechen. Verwende Schweizer Rechtschreibung.

Passen Sie Anzahl, Aufgabenbereich und Kriterien an, und ergänzen Sie bei Bedarf die Spalten Kosten und Antwortzeit.

Ein häufiger Fehler beim Vergleich: Man gibt dem einen Modell eine ausführlichere Anweisung als dem anderen und wundert sich über Unterschiede. Schreiben Sie die Anweisung einmal, kopieren Sie sie wörtlich und ändern Sie nichts. Prüfen Sie ausserdem, ob die Länge der Antworten vergleichbar ist: Längere Antworten wirken oft besser, auch wenn sie nicht genauer sind. Bitten Sie die Bewertenden, auf Inhalt statt auf Umfang zu achten.

Worauf Sie achten müssen

  • Stichprobe klein, Urteil vorsichtig: Mit 20 bis 30 Aufgaben erkennen Sie grosse Unterschiede, keine kleinen. Seien Sie zurückhaltend bei knappen Ergebnissen.
  • Datenschutz beim Testen: Vertrauliche Dokumente gehören nicht zu fremden Cloud-Modellen. Verwenden Sie Beispiele ohne Personen- und Geschäftsgeheimnisse.
  • Ehrliche Bewertung: Wer ein Modell bevorzugt, bewertet leicht freundlicher. Deshalb: blind bewerten, zwei Personen.
  • Zufall: Ein Modell kann bei derselben Aufgabe unterschiedlich antworten. Wiederholen Sie wichtige Aufgaben zweimal.
  • Lizenz und Betrieb: Das beste Modell nützt nichts, wenn Lizenz, Kosten oder Betrieb nicht passen. Siehe Lizenz und kommerzielle Nutzung.
  • Momentaufnahme: Anbieter ändern ihre Modelle. Das Ergebnis gilt für den Teststand, nicht für immer.
KriteriumWie messen?Gewicht (Beispiel)
Qualität der AntwortenBlindbewertungHoch
Deutsch und FachspracheMuttersprachliche PrüfungHoch
DatenschutzVertrag, StandortHoch
KostenPreis pro Aufgabe oder MonatMittel
TempoAntwortzeit messenMittel
BetriebsaufwandSchätzungMittel

Ein Beispiel aus der Praxis

Ein Beispiel: Das Ingenieurbüro in Bern wählt 24 Aufgaben aus vergangenen Projekten, anonymisiert. Drei Modelle, A, B und C, beantworten sie. Zwei Ingenieure bewerten blind. Modell A ist bei technischen Zusammenfassungen am besten, Modell C bei freundlichen Kundenmails, Modell B ist am günstigsten und bei einfachen Aufgaben ähnlich gut.

Vorher: Das Büro wollte aufgrund einer Rangliste das teuerste Modell einsetzen. Nachher: Es setzt Modell B für Standardaufgaben und Modell A für anspruchsvolle Berichte ein. Das spart Kosten, und die Wahl ist begründet und dokumentiert. In sechs Monaten wird der Test mit denselben Aufgaben wiederholt.

So hilft Ihnen Alpasana

Wenn Sie Hilfe bei der Auswahl brauchen, hilft eine strukturierte Begleitung. Die KI-Beratung und digitale Transformation von Alpasana umfasst KI-Potenzialanalysen, die Priorisierung von Vorhaben und einen Umsetzungsplan sowie die Integration von KI-Agenten mit Anwendungsfall, Pilot und Einsatzregeln.

Projekte werden individuell offeriert; die Modellwahl ist ein typischer Teil der Klärung vor einem Pilot.

Häufige Fragen

Kann ich Ranglisten ganz ignorieren?

Nein, sie sind ein guter Startpunkt, um Kandidaten auszuwählen. Entscheiden sollten Sie aber mit Ihrem eigenen Test.

Wie lange dauert ein solcher Vergleich?

Für 20 bis 30 Aufgaben und drei Modelle rechnen Sie mit einigen Stunden Vorbereitung und etwa einem halben Tag Bewertung. Der Aufwand ist klein gegenüber den Folgen einer Fehlentscheidung.

Soll ich auch kleine lokale Modelle testen?

Ja, besonders bei Datenschutzbedenken. Oft genügt ein kleineres Modell für einfache Aufgaben. Mehr: Modellgrösse und Parameter.

Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. So arbeitet die Redaktion · Fehler entdeckt? Melden Sie es uns.

Weiterlesen in der Galaxie