Eigene LLMs & KI-Systeme · KI-Beratung und digitale Transformation
Sprachmodelle mit eigenen Büroaufgaben vergleichen
Kurz gesagt
Stellen Sie zehn bis zwanzig typische Aufgaben aus Ihrem Büro zusammen, lassen Sie jedes Modell dieselben Aufgaben lösen und bewerten Sie die Ergebnisse nach festen Kriterien. Rangislisten im Internet messen andere Dinge als Ihr Alltag. Der eigene Test zeigt, welches Modell für Sie genügt.
Das Problem
Es gibt viele Sprachmodelle, grosse und kleine, offene und kommerzielle. Jede Woche erscheinen neue, begleitet von Ranglisten und Testwerten. Für Sie als Büro ist das wenig hilfreich: Die Ranglisten messen Mathematikaufgaben, Programmierung oder Allgemeinwissen. Ihre Aufgaben sind anders: Kundenmails beantworten, Protokolle zusammenfassen, Offerten vorbereiten, Dokumente nach Informationen durchsuchen.
Ein Modell, das auf einer Rangliste weit oben steht, kann bei Ihren Aufgaben mittelmässig sein, und ein kleineres, günstigeres Modell kann genügen. Das wissen Sie erst, wenn Sie es ausprobieren. Der Test muss weder kompliziert noch teuer sein, aber er sollte systematisch ablaufen.
Ein eigener Vergleich lohnt sich besonders vor einer Anschaffung, bei einem Anbieterwechsel oder wenn ein neues Modell erscheint und Sie wissen möchten, ob sich ein Wechsel lohnt.
So lösen Sie es mit KI – Schritt für Schritt
- Aufgabenliste erstellen. Schreiben Sie auf, welche Aufgaben das Modell übernehmen soll. Gruppieren Sie sie: Schreiben, Zusammenfassen, Informationen finden, Umformulieren, Tabellen auswerten.
- Testfälle sammeln. Pro Aufgabe zwei bis drei echte, anonymisierte Beispiele. Entfernen Sie Namen, Adressen und vertrauliche Details.
- Erwartetes Ergebnis beschreiben. Notieren Sie, wie eine gute Antwort aussieht, und, wenn möglich, die richtige Lösung (zum Beispiel ein korrektes Datum aus einem Dokument).
- Modelle auswählen. Zwei bis vier Kandidaten: ein grosses Cloud-Modell, ein kleineres, ein lokales. Notieren Sie Name und Version (Modellversion festhalten).
- Gleiche Bedingungen. Derselbe Text, dieselben Einstellungen, keine nachträglichen Hilfen. Ein neuer Chat pro Aufgabe.
- Bewerten. Nutzen Sie ein Raster mit wenigen Kriterien (Bewertungsraster für KI-Antworten). Idealerweise bewerten zwei Personen unabhängig.
- Auswerten. Zählen Sie nicht nur Durchschnitte, sondern auch schwere Fehler: erfundene Fakten, fehlende Angaben, unpassender Ton.
- Kosten und Geschwindigkeit ergänzen. Zeit pro Antwort und Preis bzw. Hardwarebedarf gehören in die Entscheidung.
Vorlage zum Kopieren
Ich möchte [Anzahl] Sprachmodelle mit meinen Büroaufgaben vergleichen. Mein Betrieb: [Branche], [Anzahl] Mitarbeitende, Schweiz. Typische Aufgaben: [Liste: zum Beispiel Kundenmails beantworten, Sitzungsprotokolle zusammenfassen, Angaben in Dokumenten finden].
Erstelle:
1. Ein Testset mit 12 Aufgaben (je Aufgabenart zwei bis drei), jeweils mit: Aufgabentext (mit Platzhaltern für anonymisierte Beispieltexte), erwartetem Ergebnis und typischen Fehlern, auf die ich achten soll.
2. Ein Bewertungsblatt (Tabelle) mit den Kriterien: Richtigkeit, Vollständigkeit, Sprache und Ton, Schweizer Schreibweise, Quellentreue, Zeitaufwand für Korrektur.
3. Eine Anleitung in sechs Schritten, wie ich die Tests bei allen Modellen identisch durchführe.
Verwende keine echten Namen und erfinde keine Ergebnisse oder Ranglisten.Ersetzen Sie die Platzhalter durch Ihre Aufgaben. Die Bewertung der Antworten übernehmen Menschen.
| Aufgabe | Modell A | Modell B | Modell C |
|---|---|---|---|
| Kundenmail beantworten | [Note] | [Note] | [Note] |
| Protokoll zusammenfassen | [Note] | [Note] | [Note] |
| Angabe im Dokument finden | [Note] | [Note] | [Note] |
| Schwere Fehler (Anzahl) | [Zahl] | [Zahl] | [Zahl] |
| Zeit pro Antwort | [Sekunden] | [Sekunden] | [Sekunden] |
Worauf Sie achten müssen
- Kleine Stichprobe. Zehn Aufgaben sind ein Anfang, kein Beweis. Erweitern Sie den Test, wenn die Entscheidung viel kostet.
- Fairness. Wenn Sie ein Modell besser kennen, formulieren Sie die Anweisung unbewusst besser. Verwenden Sie gleiche Texte.
- Schwankung. Dieselbe Aufgabe kann unterschiedliche Antworten liefern. Wiederholen Sie wichtige Tests.
- Vertrauliche Daten. Verwenden Sie in Cloud-Tests nur anonymisierte oder erfundene Beispiele.
- Versionen ändern sich. Ein Test gilt für die geprüfte Version. Bei Updates wiederholen Sie ihn (Regressionstest für Sprachmodelle).
- Bewertung durch KI. Lassen Sie Antworten nicht allein von einem anderen Modell bewerten. Menschen müssen mindestens stichprobenartig mitprüfen.
Ein Beispiel aus der Praxis
Ein Beispiel: Ein Vermessungsbüro in Frauenfeld überlegt, ein lokales Modell einzusetzen, damit keine Projektdaten ausser Haus gehen. Die Assistentin der Geschäftsleitung stellt zwölf Aufgaben zusammen: Protokolle zusammenfassen, Offerten-Entwürfe, Kundenmails zu Terminverschiebungen und Fragen zu einem Vertragsdokument.
Sie lässt ein Cloud-Modell und zwei lokale Modelle antworten und bewertet nach dem Raster. Das grosse Modell ist bei allen Aufgaben vorne, das mittlere lokale Modell reicht für Protokolle und Mails, bei Fragen zum Vertrag macht es zu viele Fehler.
Vorher gab es die Wahl «Cloud oder lokal» als Grundsatzfrage, nachher gibt es eine Aufteilung nach Aufgaben: lokal für interne Zusammenfassungen, bei Vertragsfragen weiterhin menschliche Prüfung.
So hilft Ihnen Alpasana
Bei der Frage, welche Modelle und Werkzeuge zu Ihren Abläufen passen, unterstützt Sie die KI-Beratung und digitale Transformation von Alpasana. Beschrieben sind das Aufnehmen von Prozessen, die Analyse von KI-Potenzialen, die Priorisierung von Vorhaben und ein Umsetzungsplan; bei KI-Agenten gehören Anwendungsfall, Pilot und Einsatzregeln dazu.
Welche Leistungen sinnvoll sind, wird gemeinsam geklärt, Projekte werden individuell offeriert.
Häufige Fragen
Wie lange dauert so ein Test?
Für zwölf Aufgaben und drei Modelle rechnen Sie mit einigen Stunden, vor allem für das Bewerten. Planen Sie die Zeit ein, sie lohnt sich.
Brauche ich dafür Programmierkenntnisse?
Nein. Sie können die Aufgaben von Hand in die Chat-Oberflächen eingeben. Für grosse Tests gibt es Werkzeuge, aber der Einstieg geht ohne.
Kann ich die Testfälle wiederverwenden?
Ja, genau dafür sind sie da. Heben Sie das Testset auf und wiederholen Sie es bei neuen Modellen (Testfragen-Vorlage für Sprachmodelle).
Was, wenn kein Modell überzeugt?
Dann klären Sie, ob die Aufgabe geeignet ist, ob die Anweisungen verbessert werden können oder ob ein Mensch die Arbeit besser macht.
Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. So arbeitet die Redaktion · Fehler entdeckt? Melden Sie es uns.
Weiterlesen in der Galaxie
- Vorlage: Testfragen für unsere interne KI sammelnLLM Testfragen Vorlage: So halten Sie typische Alltagsfragen mit Sollantworten fest und bauen daraus einen Prüfkatalog für Ihre interne KI.
- Vorlage: KI-Antworten nach festen Kriterien bewertenKI Antworten Bewertungsraster als Vorlage: Richtigkeit, Verständlichkeit und Vollständigkeit einheitlich beurteilen, damit das Team gleich bewertet.
- Wie vergleichen wir KI-Modelle mit unseren eigenen Aufgaben?LLM Modelle testen: So vergleichen Sie KI-Modelle anhand Ihrer eigenen Arbeitsaufgaben mit Blindbewertung, statt sich auf allgemeine Ranglisten zu verlassen.
- Wie testet man die Deutschqualität eines Sprachmodells?Deutschqualität eines Sprachmodells testen: Eine Checkliste mit Testaufgaben zu Rechtschreibung, Schweizer Schreibweise, Fachbegriffen und Ton für Ihr Büro.
- Wie prüfen wir, ob unser eigenes KI-Modell gut genug ist?LLM Evaluation einfach erklärt: So prüfen Sie mit Testfragen, Bewertungsraster und Blindtest, ob Ihr KI-Modell für Ihre Aufgaben gut genug ist.
- Was braucht ein Chatbot für mehrere Sprachen?Mehrsprachiger Chatbot: Checkliste für Deutsch, Französisch und Italienisch mit Hinweisen zu Quellen, Fachbegriffen, Tests und Qualitätskontrolle im KMU.