Zum Inhalt springen

Eigene LLMs & KI-Systeme · KI-Beratung und digitale Transformation

Sprachmodelle mit eigenen Büroaufgaben vergleichen

Stand 10.10.2026 · 4 Min. Lesezeit

Kurz gesagt

Stellen Sie zehn bis zwanzig typische Aufgaben aus Ihrem Büro zusammen, lassen Sie jedes Modell dieselben Aufgaben lösen und bewerten Sie die Ergebnisse nach festen Kriterien. Rangislisten im Internet messen andere Dinge als Ihr Alltag. Der eigene Test zeigt, welches Modell für Sie genügt.

Das Problem

Es gibt viele Sprachmodelle, grosse und kleine, offene und kommerzielle. Jede Woche erscheinen neue, begleitet von Ranglisten und Testwerten. Für Sie als Büro ist das wenig hilfreich: Die Ranglisten messen Mathematikaufgaben, Programmierung oder Allgemeinwissen. Ihre Aufgaben sind anders: Kundenmails beantworten, Protokolle zusammenfassen, Offerten vorbereiten, Dokumente nach Informationen durchsuchen.

Ein Modell, das auf einer Rangliste weit oben steht, kann bei Ihren Aufgaben mittelmässig sein, und ein kleineres, günstigeres Modell kann genügen. Das wissen Sie erst, wenn Sie es ausprobieren. Der Test muss weder kompliziert noch teuer sein, aber er sollte systematisch ablaufen.

Ein eigener Vergleich lohnt sich besonders vor einer Anschaffung, bei einem Anbieterwechsel oder wenn ein neues Modell erscheint und Sie wissen möchten, ob sich ein Wechsel lohnt.

So lösen Sie es mit KI – Schritt für Schritt

  1. Aufgabenliste erstellen. Schreiben Sie auf, welche Aufgaben das Modell übernehmen soll. Gruppieren Sie sie: Schreiben, Zusammenfassen, Informationen finden, Umformulieren, Tabellen auswerten.
  1. Testfälle sammeln. Pro Aufgabe zwei bis drei echte, anonymisierte Beispiele. Entfernen Sie Namen, Adressen und vertrauliche Details.
  1. Erwartetes Ergebnis beschreiben. Notieren Sie, wie eine gute Antwort aussieht, und, wenn möglich, die richtige Lösung (zum Beispiel ein korrektes Datum aus einem Dokument).
  1. Modelle auswählen. Zwei bis vier Kandidaten: ein grosses Cloud-Modell, ein kleineres, ein lokales. Notieren Sie Name und Version (Modellversion festhalten).
  1. Gleiche Bedingungen. Derselbe Text, dieselben Einstellungen, keine nachträglichen Hilfen. Ein neuer Chat pro Aufgabe.
  1. Bewerten. Nutzen Sie ein Raster mit wenigen Kriterien (Bewertungsraster für KI-Antworten). Idealerweise bewerten zwei Personen unabhängig.
  1. Auswerten. Zählen Sie nicht nur Durchschnitte, sondern auch schwere Fehler: erfundene Fakten, fehlende Angaben, unpassender Ton.
  1. Kosten und Geschwindigkeit ergänzen. Zeit pro Antwort und Preis bzw. Hardwarebedarf gehören in die Entscheidung.

Vorlage zum Kopieren

Ich möchte [Anzahl] Sprachmodelle mit meinen Büroaufgaben vergleichen. Mein Betrieb: [Branche], [Anzahl] Mitarbeitende, Schweiz. Typische Aufgaben: [Liste: zum Beispiel Kundenmails beantworten, Sitzungsprotokolle zusammenfassen, Angaben in Dokumenten finden].

Erstelle:
1. Ein Testset mit 12 Aufgaben (je Aufgabenart zwei bis drei), jeweils mit: Aufgabentext (mit Platzhaltern für anonymisierte Beispieltexte), erwartetem Ergebnis und typischen Fehlern, auf die ich achten soll.
2. Ein Bewertungsblatt (Tabelle) mit den Kriterien: Richtigkeit, Vollständigkeit, Sprache und Ton, Schweizer Schreibweise, Quellentreue, Zeitaufwand für Korrektur.
3. Eine Anleitung in sechs Schritten, wie ich die Tests bei allen Modellen identisch durchführe.
Verwende keine echten Namen und erfinde keine Ergebnisse oder Ranglisten.

Ersetzen Sie die Platzhalter durch Ihre Aufgaben. Die Bewertung der Antworten übernehmen Menschen.

AufgabeModell AModell BModell C
Kundenmail beantworten[Note][Note][Note]
Protokoll zusammenfassen[Note][Note][Note]
Angabe im Dokument finden[Note][Note][Note]
Schwere Fehler (Anzahl)[Zahl][Zahl][Zahl]
Zeit pro Antwort[Sekunden][Sekunden][Sekunden]

Worauf Sie achten müssen

  • Kleine Stichprobe. Zehn Aufgaben sind ein Anfang, kein Beweis. Erweitern Sie den Test, wenn die Entscheidung viel kostet.
  • Fairness. Wenn Sie ein Modell besser kennen, formulieren Sie die Anweisung unbewusst besser. Verwenden Sie gleiche Texte.
  • Schwankung. Dieselbe Aufgabe kann unterschiedliche Antworten liefern. Wiederholen Sie wichtige Tests.
  • Vertrauliche Daten. Verwenden Sie in Cloud-Tests nur anonymisierte oder erfundene Beispiele.
  • Versionen ändern sich. Ein Test gilt für die geprüfte Version. Bei Updates wiederholen Sie ihn (Regressionstest für Sprachmodelle).
  • Bewertung durch KI. Lassen Sie Antworten nicht allein von einem anderen Modell bewerten. Menschen müssen mindestens stichprobenartig mitprüfen.

Ein Beispiel aus der Praxis

Ein Beispiel: Ein Vermessungsbüro in Frauenfeld überlegt, ein lokales Modell einzusetzen, damit keine Projektdaten ausser Haus gehen. Die Assistentin der Geschäftsleitung stellt zwölf Aufgaben zusammen: Protokolle zusammenfassen, Offerten-Entwürfe, Kundenmails zu Terminverschiebungen und Fragen zu einem Vertragsdokument.

Sie lässt ein Cloud-Modell und zwei lokale Modelle antworten und bewertet nach dem Raster. Das grosse Modell ist bei allen Aufgaben vorne, das mittlere lokale Modell reicht für Protokolle und Mails, bei Fragen zum Vertrag macht es zu viele Fehler.

Vorher gab es die Wahl «Cloud oder lokal» als Grundsatzfrage, nachher gibt es eine Aufteilung nach Aufgaben: lokal für interne Zusammenfassungen, bei Vertragsfragen weiterhin menschliche Prüfung.

So hilft Ihnen Alpasana

Bei der Frage, welche Modelle und Werkzeuge zu Ihren Abläufen passen, unterstützt Sie die KI-Beratung und digitale Transformation von Alpasana. Beschrieben sind das Aufnehmen von Prozessen, die Analyse von KI-Potenzialen, die Priorisierung von Vorhaben und ein Umsetzungsplan; bei KI-Agenten gehören Anwendungsfall, Pilot und Einsatzregeln dazu.

Welche Leistungen sinnvoll sind, wird gemeinsam geklärt, Projekte werden individuell offeriert.

Häufige Fragen

Wie lange dauert so ein Test?

Für zwölf Aufgaben und drei Modelle rechnen Sie mit einigen Stunden, vor allem für das Bewerten. Planen Sie die Zeit ein, sie lohnt sich.

Brauche ich dafür Programmierkenntnisse?

Nein. Sie können die Aufgaben von Hand in die Chat-Oberflächen eingeben. Für grosse Tests gibt es Werkzeuge, aber der Einstieg geht ohne.

Kann ich die Testfälle wiederverwenden?

Ja, genau dafür sind sie da. Heben Sie das Testset auf und wiederholen Sie es bei neuen Modellen (Testfragen-Vorlage für Sprachmodelle).

Was, wenn kein Modell überzeugt?

Dann klären Sie, ob die Aufgabe geeignet ist, ob die Anweisungen verbessert werden können oder ob ein Mensch die Arbeit besser macht.

Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. So arbeitet die Redaktion · Fehler entdeckt? Melden Sie es uns.

Weiterlesen in der Galaxie