Zum Inhalt springen

Eigene LLMs & KI-Systeme · KI-Beratung und digitale Transformation

Wie viele Mitarbeitende können eine lokale KI nutzen?

Stand 10.10.2026 · 5 Min. Lesezeit

Kurz gesagt

Entscheidend ist nicht die Zahl der Mitarbeitenden, sondern wie viele Anfragen gleichzeitig laufen. Jede gleichzeitige Anfrage braucht zusätzlichen Speicher und teilt sich die Rechenleistung. Ein einzelner Rechner mit einer Grafikkarte reicht oft für ein kleines Team, wenn die Nutzung verteilt und die Wartezeit akzeptabel ist.

Das Problem

Im Büro mit 40 Mitarbeitenden soll ein gemeinsamer KI-Rechner Fragen und Textentwürfe bearbeiten. Frau Müller fragt die IT: «Reicht ein Rechner für alle?» Die Antwort lautet «Kommt darauf an», und das ist unbefriedigend.

Die Zahl 40 ist allerdings nicht die entscheidende. Nicht alle sind gleichzeitig am Fragen. Wichtiger ist, wie viele Anfragen in einem bestimmten Moment tatsächlich laufen und wie lange eine Antwort dauert. Bei gleichzeitigen Anfragen teilen sich die Nutzenden Rechenleistung und Speicher. Die Antworten werden dann langsamer, oder Anfragen warten in einer Schlange.

Mit einer kurzen Bedarfsabschätzung und einem Test lässt sich das gut beurteilen, bevor Sie Geld ausgeben.

So lösen Sie es mit KI – Schritt für Schritt

  1. Schätzen Sie die Nutzung. Wie viele Personen werden die KI regelmässig nutzen, wie oft pro Stunde stellt eine Person eine Anfrage, und wie lange dauert eine Antwort? Ein Fragekatalog hilft, siehe unten.
  2. Rechnen Sie mit Gleichzeitigkeit. Wenn 20 Personen je fünf Anfragen pro Stunde stellen und jede Antwort etwa 20 Sekunden braucht, sind das 100 Anfragen mit 2000 Sekunden Rechenzeit pro Stunde. Auf eine Stunde mit 3600 Sekunden verteilt, wäre der Rechner im Mittel gut halb belegt. Das ist nur ein Rechenbeispiel mit angenommenen Zahlen. Spitzen, etwa am Morgen, fallen höher aus.
  3. Verstehen Sie, was passiert. Mehrere Anfragen gleichzeitig werden entweder nacheinander bearbeitet, was Wartezeit erzeugt, oder parallel, was jede einzelne langsamer macht und mehr Speicher braucht. Siehe Warteschlange und Stapelverarbeitung.
  4. Prüfen Sie den Speicher. Jede parallele Anfrage belegt zusätzlichen Zwischenspeicher, siehe Gesprächslänge und Speicher. Viele parallele Anfragen mit langem Text sprengen schnell den Speicher.
  5. Legen Sie die Obergrenze fest. Programme wie Ollama erlauben, die Zahl paralleler Anfragen zu begrenzen. Die Einstellung nimmt Ihre IT vor.
  6. Messen Sie mit mehreren Testern. Lassen Sie fünf Personen gleichzeitig Aufgaben stellen und messen Sie die Wartezeit. Siehe Lasttest vorbereiten.
  7. Definieren Sie eine zumutbare Wartezeit. Zum Beispiel «erste Wörter innerhalb weniger Sekunden, ganze Antwort innerhalb einer Minute». Das ist Ihre Messlatte.
  8. Planen Sie Wachstum ein. Wenn die Nutzung steigt, braucht es mehr Leistung, ein kleineres Modell oder mehrere Rechner.

Vorlage zum Kopieren

Ich möchte abschätzen, wie viele Personen eine lokale KI gleichzeitig nutzen können.

Betrieb: [Branche, Ort, Anzahl Mitarbeitende]
Geplante Nutzer: [Anzahl, die die KI regelmässig verwenden]
Geschätzte Anfragen pro Person und Stunde: [Zahl]
Typische Antwortlänge und Dauer: [z. B. 200 Wörter, etwa 20 Sekunden]
Stosszeiten: [z. B. 8 bis 9 Uhr, nach Sitzungen]
Gerät: [Prozessor, Arbeitsspeicher, Grafikkarte/Grafikspeicher]
Modell: [Name, Variante]

Aufgabe:
1. Erstelle eine Beispielrechnung für die durchschnittliche und die Spitzenbelastung und zeige deine Annahmen.
2. Erkläre, was bei gleichzeitigen Anfragen mit Wartezeit und Speicher passiert.
3. Nenne drei Massnahmen, wenn die Belastung zu hoch ist (z. B. Obergrenze, kleineres Modell, zweites Gerät).
4. Mach klar, dass die Rechnung nur eine Schätzung ist und ein Test mit meinem Gerät nötig bleibt. Erfinde keine Leistungswerte.

Die Rechnung dient der Grobplanung. Das Ergebnis ersetzt nicht den Test mit mehreren gleichzeitigen Personen.

SzenarioGleichzeitige AnfragenWirkung
Wenige Nutzer, verteilte Fragenselten mehr als eineMeist problemlos
Team mit StosszeitenmehrereWartezeiten möglich
Automatische Verarbeitung im HintergrunddauerhaftKonkurriert mit Menschen
Öffentlicher Chatbotschwer vorhersehbarNutzungsgrenzen nötig

Worauf Sie achten müssen

  • Schätzungen sind unsicher: Die tatsächliche Nutzung ist oft anders als geplant. Starten Sie mit einer kleinen Gruppe und messen Sie.
  • Langer Kontext: Wer ganze Dokumente einfügt, belastet das System mehr als Kurzfragen. Planen Sie mit Ihren echten Aufgaben.
  • Hintergrundaufgaben: Automatische Zusammenfassungen oder Importe können das System über Stunden blockieren. Trennen Sie sie von der interaktiven Nutzung.
  • Zugriffsschutz: Ein gemeinsamer Rechner braucht Anmeldung und Rechte, siehe Firmenlogin.
  • Ausfall: Fällt der einzige Rechner aus, steht die KI für alle still. Planen Sie einen Ersatzweg.
  • Fairness: Ohne Regeln kann eine Person das System blockieren. Eine Obergrenze pro Person kann helfen.

Ein Beispiel aus der Praxis

Ein Beispiel: Ein Versicherungsbroker in Zug mit 25 Mitarbeitenden möchte einen gemeinsamen lokalen KI-Rechner für Textentwürfe und Zusammenfassungen einrichten.

Vorher plant die Geschäftsleitung für «alle 25» gleichzeitig. Nachher fragt die IT in einer Umfrage nach der tatsächlichen Nutzung: etwa zehn Personen, jede stellt wenige Anfragen pro Stunde. Der Test mit fünf gleichzeitigen Testern zeigt, dass die Antworten bei fünf parallelen Anfragen noch zumutbar bleiben, bei zehn aber deutlich länger dauern. Die IT begrenzt die parallelen Anfragen, legt Stosszeiten fest und plant, bei steigender Nutzung ein kleineres Modell oder ein zweites Gerät zu prüfen.

So hilft Ihnen Alpasana

Die Frage nach der Zahl der Nutzenden ist eigentlich eine Frage nach dem Einsatzzweck. Die KI-Beratung und digitale Transformation von Alpasana unterstützt dabei, KI-Potenziale zu analysieren, Vorhaben zu priorisieren und einen Umsetzungsplan zu erstellen, der auf realistischen Annahmen beruht.

So dimensionieren Sie die Technik passend und vermeiden Überraschungen. Projekte werden individuell offeriert.

Häufige Fragen

Reicht ein Rechner für 50 Personen?

Das hängt von der Nutzung, nicht von der Zahl. Wenn selten gleichzeitig gefragt wird, ja. Bei vielen gleichzeitigen langen Aufgaben nein.

Wie viele Anfragen kann Ollama parallel bearbeiten?

Es lässt sich einstellen, aber die sinnvolle Zahl hängt von Speicher und Leistung ab. Testen Sie mit Ihrem Modell.

Soll ich lieber zwei kleine Rechner nehmen?

Das kann sinnvoll sein, wenn Ausfallsicherheit oder Trennung von Aufgaben wichtig ist. Es erhöht aber Aufwand und Kosten.

Wann lohnt sich die Cloud?

Wenn die Nutzung stark schwankt oder die Datenlage es erlaubt. Siehe Lokal oder Cloud und Kosten im Vergleich.

Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.

Weiterlesen in der Galaxie