KI im Unternehmen · KI-Beratung und digitale Transformation
KI-Pilot mit bisheriger Arbeitsweise fair vergleichen
Kurz gesagt
Ein fairer Vergleich verwendet dieselben Aufgaben, vergleichbare Personen, gleiche Qualitätsmassstäbe und misst die gesamte Zeit inklusive Prüfung und Korrektur der KI-Ergebnisse. Messen Sie die bisherige Arbeitsweise vor dem Pilot als Ausgangswert und vermeiden Sie Verzerrungen durch Lerneffekt, Auswahl der Aufgaben und Begeisterung.
Das Problem
Nach dem Pilot heisst es: «Mit der KI waren wir doppelt so schnell.» Doch war das wirklich so? Vielleicht hat die erfahrene Mitarbeiterin die leichten Aufgaben mit KI gelöst und die schwierigen von Hand. Vielleicht wurden die KI-Texte nicht gründlich geprüft. Vielleicht lag die Zeit der Handarbeit vor einem halben Jahr, als das Team noch unter Druck stand. Wer so vergleicht, vergleicht Äpfel mit Birnen.
Ein fairer Vergleich ist anspruchsvoller, als es zunächst scheint. Er soll zeigen, ob die KI tatsächlich Zeit spart, Qualität hält oder verbessert und den Aufwand lohnt. Ungenaue Vergleiche führen zu falschen Entscheidungen in beide Richtungen: Begeisterung ohne Grundlage oder unberechtigte Skepsis.
Hier lernen Sie, wie Sie mit einfachen Mitteln einen belastbaren Vergleich aufbauen.
Welche Verzerrungen drohen?
| Verzerrung | Wie sie entsteht | Gegenmassnahme |
|---|---|---|
| Auswahl der Aufgaben | KI bekommt leichte Aufgaben, Menschen die schweren | Dieselben Aufgaben für beide Varianten |
| Unterschiedliche Personen | Eine erfahrene Person mit KI gegen eine Neue von Hand | Vergleichbare Personen, oder dieselben Personen mit beiden Varianten |
| Lerneffekt | Wer eine Aufgabe zum zweiten Mal löst, ist schneller | Reihenfolge wechseln, mehrere Durchgänge |
| Unvollständige Zeitmessung | Prüfen und Korrigieren der KI-Ergebnisse wird nicht gezählt | Gesamtzeit von Start bis fertigem, geprüftem Ergebnis |
| Verschiedene Qualitätsmassstäbe | Handarbeit wird streng, KI-Ergebnis grosszügig beurteilt | Gleiche Kriterien, möglichst blinde Bewertung |
| Begeisterungseffekt | Neues Werkzeug wirkt positiv, Testende wollen Erfolg sehen | Objektive Messung, Fehler erfassen |
| Veraltete Ausgangswerte | Handzeiten stammen aus einer anderen Zeit | Ausgangswerte kurz vor dem Pilot, siehe Ausgangswerte erfassen |
So lösen Sie es mit KI – Schritt für Schritt
- Definieren Sie die Vergleichsfrage. Zum Beispiel: «Brauchen wir mit KI weniger Zeit pro Offerte bei gleicher Qualität?» Messen Sie Zeit, Qualität und Fehler getrennt.
- Wählen Sie die Vergleichsaufgaben. Eine repräsentative Auswahl aus dem Alltag, einfache und schwierige, 20 bis 40 Stück. Sie gelten für beide Varianten.
- Bestimmen Sie die Personen. Idealerweise bearbeiten dieselben Personen beide Varianten, mit vertauschter Reihenfolge. Sonst bilden Sie zwei vergleichbare Gruppen.
- Legen Sie die Messung fest. Gemessen wird die Gesamtzeit bis zum fertigen, geprüften Ergebnis. Bei KI gehören Eingabe, Prüfung und Korrektur dazu, siehe Nachbearbeitungszeit erfassen.
- Legen Sie Qualitätskriterien fest. Richtigkeit, Vollständigkeit, Ton, Format. Lassen Sie Ergebnisse möglichst blind bewerten, ohne zu wissen, ob KI oder Mensch.
- Erfassen Sie die Handarbeits-Werte. Vor dem Pilot oder parallel. Messen Sie über mehrere Tage, nicht nur einen guten Moment.
- Führen Sie den Vergleich durch. Mit Zeiterfassung (Stoppuhr, Zeitstempel) und Bewertungsbogen. Lassen Sie die Reihenfolge abwechseln.
- Werten Sie nüchtern aus. Durchschnitt, Streuung, Ausreisser. Zeigen Sie auch Fälle, in denen die KI schlechter war. Bei kleinen Stichproben seien Sie vorsichtig, siehe Kleine Stichproben auswerten.
- Rechnen Sie den Nutzen ehrlich. Gesparte Zeit mal Kosten minus Aufwand und Lizenzen, siehe Zeitersparnis in Geld umrechnen.
Vorlage zum Kopieren
Mit diesem Auftrag bereiten Sie das Design Ihres Vergleichs vor:
Wir möchten in [Betrieb, Branche, Schweiz] vergleichen, ob [Aufgabe, z. B. das Erstellen von Offertentwürfen] mit KI-Unterstützung besser gelingt als mit der bisherigen Arbeitsweise.
Beteiligte: [Anzahl Personen, Erfahrung]. Verfügbare Zeit für den Vergleich: [z. B. 2 Wochen].
Entwirf ein Testdesign mit:
1. Der Vergleichsfrage (präzise).
2. Der Auswahl von [20] Vergleichsaufgaben und wie wir sie fair zuteilen (Reihenfolge, Personen).
3. Den Messgrössen (Gesamtzeit inkl. Prüfung, Qualität nach Kriterien, Fehler).
4. Einem Bewertungsbogen für die Qualität (5 Kriterien, Skala mit Erklärung).
5. Typischen Verzerrungen in unserem Fall und wie wir sie vermeiden.
Schreibe in einfacher Sprache. Erfinde keine Studien oder Richtwerte und kennzeichne Annahmen.Besprechen Sie das Design mit den Beteiligten, bevor der Vergleich startet, damit alle die Spielregeln kennen.
Worauf Sie achten müssen
- Qualität nicht vergessen: Eine schnellere, aber schlechtere Lösung ist kein Gewinn. Messen Sie beides.
- Lerneffekt: Beim zweiten Durchgang sind Menschen schneller. Wechseln Sie die Reihenfolge oder verwenden Sie verschiedene, vergleichbare Aufgaben.
- Stichprobe: Bei wenigen Aufgaben können Zufall und Einzelfälle das Bild verzerren. Nennen Sie Unsicherheit offen.
- Datenschutz: Auch Vergleichsaufgaben brauchen unbedenkliche Daten, siehe Testdaten auswählen.
- Personen nicht blossstellen: Der Vergleich gilt der Arbeitsweise, nicht der Leistung einzelner Menschen. Siehe Leistungskontrolle vermeiden.
- Weitere Wirkungen: Nicht alles lässt sich messen, etwa Entlastung oder Zufriedenheit. Ergänzen Sie qualitative Rückmeldungen, siehe Qualitativen Nutzen bewerten.
Ein Beispiel aus der Praxis
Ein Beispiel: Ein Ingenieurbüro in Aarau prüft, ob eine KI das Erstellen von Sitzungsprotokollen beschleunigt.
Vorher: Die Projektleiterin protokolliert zwei Sitzungen mit KI und stellt fest, es gehe «viel schneller». Sie vergleicht mit ihrer Erinnerung an frühere Protokolle, die sie nie gemessen hat. Dass sie die KI-Texte nur überflogen hat, bleibt unerwähnt.
Nachher: Das Büro nimmt zehn Sitzungsaufnahmen, erstellt jede einmal von Hand und einmal mit KI, mit vertauschter Reihenfolge und zwei Bearbeiterinnen. Gemessen wird die Zeit bis zum fertigen, geprüften Protokoll. Eine dritte Person bewertet die Protokolle blind nach Vollständigkeit und Richtigkeit. Ergebnis: Mit KI spart das Team im Schnitt gut ein Drittel der Zeit, dafür kommen bei zwei von zehn Protokollen falsche Zuordnungen vor, die ein Prüfschritt abfangen muss.
So hilft Ihnen Alpasana
Ein fairer Vergleich gehört in jede Pilotplanung. Die KI-Beratung und digitale Transformation von Alpasana unterstützt dabei, Prozesse aufzunehmen, KI-Potenziale zu analysieren, Vorhaben zu priorisieren und einen Umsetzungsplan zu erstellen. Zur Integration von KI-Agenten gehören Anwendungsfall, Pilot, Einsatzregeln und Skalierung. Projekte werden individuell offeriert.
Häufige Fragen
Brauche ich dafür eine Kontrollgruppe?
Sie brauchen einen fairen Vergleichsmassstab. Das kann eine Kontrollgruppe sein, die weiter von Hand arbeitet, oder dieselbe Gruppe mit beiden Varianten. Entscheidend sind gleiche Aufgaben und Kriterien.
Wie viele Aufgaben muss ich vergleichen?
Für einen Pilot oft 20 bis 40. Mit weniger bleiben die Aussagen unsicher, mit mehr steigt der Aufwand. Wichtig ist die Vielfalt der Aufgaben.
Was, wenn die Handarbeit nie gemessen wurde?
Messen Sie sie jetzt kurz, an einigen Tagen mit einer einfachen Zeiterfassung. Eine grobe, ehrliche Messung ist besser als eine Schätzung aus der Erinnerung.
Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.
Weiterlesen in der Galaxie
- Was müssen wir vor dem KI-Start messen?KI Ausgangswerte messen: Welche Zahlen Sie vor der Einführung erfassen, damit Sie später belegen können, ob KI Zeit, Qualität oder Kosten verbessert hat.
- Wie messen wir die tatsächliche Zeitersparnis durch KI?KI Zeitersparnis messen: Vergleichen Sie ganze Arbeitsabläufe inklusive Vorbereitung, Kontrolle und Korrekturen, um die Entlastung im KMU zu beurteilen.
- KI spart Zeit, macht aber Nacharbeit: Wie rechnen wir das?KI Nachbearbeitungszeit messen: So erfassen Sie die Zeit für Prüfen und Korrigieren und rechnen die echte Zeitersparnis Ihrer KI-Anwendung realistisch aus.
- Warum KI-Kennzahlen täuschen können: typische MessfehlerKI Erfolgsmessung Fehler: Diese typischen Messfehler verzerren den Nutzen von KI-Projekten. Mit Checkliste, damit Sie sich keinen Erfolg schönrechnen.
- Was muss ein KI-Pilot können, damit wir ihn freigeben?KI Abnahmekriterien: Wie Sie vor dem Pilot festlegen, woran Sie einen bestandenen Test erkennen, mit Erfolgskriterien, Mindestqualität und Freigabe-Checkliste.