Zum Inhalt springen

Modell-Atlas · KI und IT für konkrete Arbeitsaufgaben

Wie teste ich Reasoning-Modelle mit Zahlenaufgaben?

Stand 10.10.2026 · 5 Min. Lesezeit

Kurz gesagt

Stellen Sie fünf bis zehn echte Zahlenaufgaben aus Ihrem Alltag zusammen, deren richtiges Ergebnis Sie kennen, und lassen Sie sie von verschiedenen Modellen und Einstellungen lösen. Vergleichen Sie Ergebnis und Rechenweg mit Ihrer Lösung. So sehen Sie, ob ein Denkmodell Ihre Aufgaben tatsächlich besser löst.

Das Problem

Sie haben gehört, dass «Denkmodelle» besser rechnen können als normale Sprachmodelle. Nun möchten Sie wissen, ob das auch für Ihre Aufgaben gilt: Mehrwertsteuer in Offerten, Lohnabrechnungen, Lagerbestände, Wegzeiten, Rabattstaffeln. Werbeaussagen und Ranglisten helfen dabei wenig, denn sie beruhen auf Aufgaben, die mit Ihrer Arbeit nichts zu tun haben.

Zugleich ist Rechnen für Sprachmodelle eine bekannte Schwäche. Sie erzeugen Zahlen als Text, statt wirklich zu rechnen, und können sich bei längeren Rechnungen verheddern. Denkmodelle verbessern das oft, ohne es zu garantieren.

Der zuverlässigste Weg ist ein eigener kleiner Test mit Aufgaben, deren Lösung Sie kennen. Diese Seite zeigt Schritt für Schritt, wie Sie ihn aufbauen.

So lösen Sie es mit KI – Schritt für Schritt

  1. Aufgaben sammeln. Wählen Sie fünf bis zehn Zahlenaufgaben aus Ihrem Alltag: kurze und längere, einfache und knifflige, solche mit Prozenten, Dreisatz, Zeit- und Datumsrechnung sowie Textaufgaben.
  1. Richtige Lösungen vorbereiten. Lösen Sie jede Aufgabe selbst mit Taschenrechner oder Excel und notieren Sie das Ergebnis und die Zwischenschritte. Diese Lösungen sind Ihr Massstab.
  1. Aufgaben anonymisieren. Ersetzen Sie Namen und vertrauliche Zahlen durch Beispielwerte, die dieselbe Rechenart verlangen.
  1. Modelle und Einstellungen wählen. Testen Sie ein normales Modell und ein Denkmodell mit tiefer und höherer Stufe. Siehe Denkzeit einstellen.
  1. Gleiche Fragen stellen. Nutzen Sie bei allen denselben Wortlaut. Verlangen Sie den Rechenweg und das Endergebnis getrennt.
  1. Ergebnisse vergleichen. Tragen Sie in eine Tabelle ein: Aufgabe, richtige Lösung, Antwort Modell A, B, C, richtig/falsch, Dauer.
  1. Rechenwege prüfen. Auch richtige Ergebnisse können auf falschem Weg entstanden sein. Prüfen Sie wenigstens bei falschen Antworten, wo der Fehler lag.
  1. Wiederholen. Stellen Sie dieselbe Aufgabe nochmals, denn Antworten können abweichen. Zeigt sich Streuung, ist das Modell weniger verlässlich.
  1. Entscheiden. Wählen Sie nach Genauigkeit, Tempo und Kosten. Und beachten Sie: Auch das beste Ergebnis verlangt in Ihrer Praxis eine Kontrolle.

Vorlage zum Kopieren

Mit diesem Prompt lassen Sie die KI Zahlenaufgaben so lösen, dass Sie sie leicht kontrollieren können:

Löse die folgende Aufgabe.
Aufgabe: [Aufgabentext mit allen Zahlen]
Vorgehen: 1. Liste alle gegebenen Zahlen und Einheiten auf.
2. Rechne Schritt für Schritt und zeige jede Zwischenrechnung.
3. Gib das Endergebnis in einer eigenen Zeile mit Einheit an, gerundet auf [Stellen].
4. Mache eine Gegenprobe auf einem anderen Weg und nenne, ob sie übereinstimmt.
Erfinde keine Zahlen. Wenn Angaben fehlen, frage nach.

Ersetzen Sie die Platzhalter durch Ihre Aufgabe und vergleichen Sie das Endergebnis mit Ihrer eigenen Lösung.

Worauf Sie achten müssen

  • Kleine Stichprobe: Zehn Aufgaben zeigen eine Tendenz, keine Gewissheit. Wiederholen Sie bei wichtigen Entscheiden den Test mit mehr Aufgaben.
  • Streuung: Dieselbe Aufgabe kann verschiedene Ergebnisse liefern. Testen Sie mehrmals.
  • Richtiges Ergebnis, falscher Weg: Prüfen Sie nicht nur das Endergebnis.
  • Rechner einbinden: Manche Werkzeuge nutzen im Hintergrund einen Rechner oder Programmcode. Das verbessert die Genauigkeit. Siehe KI mit Rechner oder reines Sprachmodell.
  • Datenschutz: Verwenden Sie anonymisierte Beispielwerte, keine echten Kunden- oder Lohndaten.
  • Aktualität: Modelle ändern sich. Wiederholen Sie den Test nach grösseren Updates.
  • Kosten und Tempo: Ein Denkmodell kann genauer, aber langsamer und teurer sein. Siehe Reasoning-Kosten.

Ein Beispiel aus der Praxis

Ein Beispiel: Die Inhaberin einer Schreinerei im Kanton Solothurn möchte Offerten mit Materialzuschlägen, Rabatten und Mehrwertsteuer teilweise von KI berechnen lassen. Sie stellt sieben typische Rechnungen zusammen, deren Ergebnisse sie mit Excel kennt.

Vorher: Sie weiss nicht, welchem Modell sie trauen kann. Nachher: Sie testet ein normales und ein Denkmodell. Das normale Modell liegt bei zwei Aufgaben mit mehreren Rabattstufen falsch. Das Denkmodell löst alle sieben, braucht aber länger. Sie entscheidet, Offertberechnungen weiterhin in Excel zu machen und die KI nur zum Formulieren der Begleittexte und zur Kontrolle der Plausibilität zu nutzen. Der Test kostete einen Nachmittag und gab ihr Klarheit.

AufgabeRichtigModell AModell B (Denken)
Rabattstaffel 3 StufenCHF [Betrag]falschrichtig
MWST-BerechnungCHF [Betrag]richtigrichtig
Arbeitszeit mit Pausen[Zeit]richtigrichtig

Bewahren Sie Ihre Testaufgaben samt richtigen Lösungen auf. Sie bilden einen kleinen Prüfstand, den Sie bei jedem neuen Modell, jedem grösseren Update und jedem Anbieterwechsel wieder einsetzen können. Mit der Zeit ergänzen Sie ihn um Aufgaben, bei denen ein Modell bereits einmal versagt hat. Diese Fälle sind besonders aufschlussreich, weil sie genau Ihre Schwachstellen abbilden.

Notieren Sie sich zu jedem Test das Datum, das Modell und die Einstellung. So sehen Sie später, ob sich Qualität, Tempo und Kosten verbessert oder verschlechtert haben, und können Entscheidungen gegenüber der Leitung belegen.

Wichtig ist auch die Dokumentation: Wer später gefragt wird, warum ein bestimmtes Modell für Berechnungen eingesetzt oder ausgeschlossen wurde, kann mit der Testtabelle sachlich antworten.

So hilft Ihnen Alpasana

Wer KI und Zahlen im Berufsalltag sicher einsetzen möchte, findet bei absofort die Kurse KI und IT für konkrete Arbeitsaufgaben. Laut Beschreibung gehören dazu die Vorbereitung von Buchhaltungsunterlagen, Excel, Datenverständnis und Dashboards sowie Qualitätsprüfung und KI-Lerncoach. So üben Sie, Ergebnisse nachvollziehbar zu kontrollieren.

Häufige Fragen

Rechnen Denkmodelle immer richtig?

Nein. Sie machen oft weniger Fehler, aber sie können sich dennoch verrechnen. Eine Kontrolle bleibt nötig, bei wichtigen Zahlen mit Taschenrechner oder Tabellenkalkulation.

Soll ich Zahlenaufgaben lieber gleich in Excel lösen?

Für verbindliche Berechnungen ja, denn Excel rechnet exakt und nachvollziehbar. Die KI eignet sich eher zum Erklären, Formulieren, Formelnschreiben und Plausibilisieren.

Wie viele Testaufgaben brauche ich?

Für einen ersten Eindruck genügen fünf bis zehn. Wählen Sie unterschiedliche Rechenarten und mindestens eine knifflige Aufgabe, bei der Sie die Lösung gut kennen.

Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.

Quellen

Weiterlesen in der Galaxie