# Das Modell im Institut betreiben (https://docs.akollo.com/de/ai/on-prem)



<Callout title="Geplant">
  Dieser Bereich ist geplant. Er wird hier beschrieben, damit Sie sich vorbereiten können; er ist noch nicht Teil der aktuellen Version.
</Callout>

## Überblick [#überblick]

Das Modell läuft auf den eigenen Maschinen des Instituts. Fragen werden nicht an ein Modell außerhalb des Instituts
gesendet. Der Inferenzserver hat keinen Weg nach außen und verlangt keinen API-Schlüssel.

<Mermaid
  title="Datenweg innerhalb des Instituts"
  chart="`flowchart LR
A[Mitarbeitende stellen eine Frage] --> B[Akollo-Anwendung]
B --> C[Inferenzserver]
C --> B
C --x|Kein Weg nach außen| D[Modell außerhalb des Instituts]`"
/>

Da der Inferenzserver keinen Weg nach außen hat, erreicht keine Frage ein Modell außerhalb des Instituts.

## Bereitstellungsprofile [#bereitstellungsprofile]

Die Installation bietet zwei Profile.

| Profil              | Reservierter Arbeitsspeicher | Reservierte Prozessoren und Karten |
| ------------------- | ---------------------------- | ---------------------------------- |
| Grafikkarten-Profil | 32 GiB                       | Eine NVIDIA-Grafikkarte            |
| Prozessor-Profil    | 16 GiB                       | 4 Prozessoren                      |

<Callout type="info" title="Hinweis">
  Diese Werte beschreiben, was die Installation reserviert. Sie sind keine Aussage darüber, wie viele Personen der
  Server bedienen kann.
</Callout>

## Installation planen [#installation-planen]

<Steps>
  <Step>
    ### Last abschätzen [#last-abschätzen]

    Lesen Sie die Lastschätzung am Anfang von **Wie viele Personen**. Sie beruht auf Modellgrößen und Token-Raten und
    ist kein gemessener Benchmark.
  </Step>

  <Step>
    ### Größe wählen [#größe-wählen]

    Wählen Sie in **Wie viele Personen** die Zeile, die zu Ihrer Personenzahl passt: Pilot mit bis zu etwa 300 Personen,
    1.000 Personen oder 5.000 Personen.
  </Step>

  <Step>
    ### Gesamte Installation dimensionieren [#gesamte-installation-dimensionieren]

    Dimensionieren Sie mit **Die gesamte Installation** Webanwendung, Hintergrundaufgaben, Datenbank, Sicherungen,
    sicheren Zugang, Überwachung und Modellmaschine.
  </Step>

  <Step>
    ### Modellspeicher prüfen und Karte wählen [#modellspeicher-prüfen-und-karte-wählen]

    Wählen Sie mit **Speicherbedarf je Modell** und **Welche Grafikkarte** die Hardware für die geplanten Modelle.
  </Step>

  <Step>
    ### Den Aufwand klein halten [#den-aufwand-klein-halten]

    Setzen Sie die Maßnahmen aus **Den Aufwand klein halten** um, damit weniger Fragen das große Modell erreichen.
  </Step>
</Steps>

## Wie viele Personen [#wie-viele-personen]

Die folgenden Tabellen sind Schätzungen auf Basis von Modellgrößen und Token-Raten, kein gemessener Benchmark. Bei
gleicher Nutzung erzeugen 1.000 Personen auf dem großen Modell pro Monat etwa 560 Millionen Eingabe- und 50 Millionen
Ausgabe-Tokens. Über die Arbeitszeit verteilt sind das im Mittel rund 1.000 Eingabe- und 80 Ausgabe-Tokens pro
Sekunde, in Spitzenzeiten etwa das Fünffache. Ein Mixture-of-Experts-Modell mit etwa 4 Milliarden aktiven Parametern
bewältigt das auf einer Rechenzentrums-Grafikkarte.

| Größe                        | Kleine Modelle (Router, Guard, Embeddings)                                                        | Großes Modell                                                                                       | Server                                                                                         |
| ---------------------------- | ------------------------------------------------------------------------------------------------- | --------------------------------------------------------------------------------------------------- | ---------------------------------------------------------------------------------------------- |
| Pilot, bis etwa 300 Personen | Prozessor: 16 Kerne, 64 GB Arbeitsspeicher (Jan-v1-4B mit 4 Bit etwa 3 GB, Gemma 4 E4B etwa 4 GB) | Gemma 4 26B-A4B auf einer 24–48-GB-Grafikkarte, 4 Bit oder 8 Bit                                    | Eine Grafikkarten-Maschine (zum Beispiel L40S- oder RTX-6000-Klasse) plus die Anwendungsserver |
| 1.000 Personen               | Dieselbe Grafikkarte wie das große Modell (die kleinen Modelle belegen etwa 8 GB zusätzlich)      | Gemma 4 26B-A4B oder Qwen3.5-35B-A3B, 48-GB-Grafikkarte                                             | Zwei Grafikkarten-Maschinen, damit eine übernehmen kann (eine reicht für die Last)             |
| 5.000 Personen               | Eine separate kleine Grafikkarte oder zwei Prozessor-Maschinen                                    | Gemma 4 31B oder ein Mixture-of-Experts-Modell mit 120 Milliarden Parametern auf 80-GB-Grafikkarten | Zwei bis vier 80-GB-Grafikkarten (H100- oder H200-Klasse), mit Batching                        |

## Die gesamte Installation [#die-gesamte-installation]

Prozessorangaben sind physische Kerne oder virtuelle Prozessoren. Festplatten sind schnelle SSDs. Das Modell ist
optional: Ohne Modell laufen die übrigen Komponenten auf gewöhnlichen Maschinen, eine Grafikkarte ist nicht nötig.

| Komponente                 | Pilot, bis 300 Personen                                                                      | 1.000 Personen                                                                               | 5.000 Personen                                                                |
| -------------------------- | -------------------------------------------------------------------------------------------- | -------------------------------------------------------------------------------------------- | ----------------------------------------------------------------------------- |
| Webanwendung               | 1 × 4 Prozessoren, 8 GB                                                                      | 2 × 8 Prozessoren, 16 GB, hinter einem Load Balancer                                         | 4 × 8 Prozessoren, 16 GB                                                      |
| Hintergrundaufgaben        | Teilt sich die Web-Maschine                                                                  | 1 × 4 Prozessoren, 8 GB                                                                      | 2 × 8 Prozessoren, 16 GB                                                      |
| Datenbank                  | 4 Prozessoren, 16 GB, 200 GB                                                                 | 8 Prozessoren, 32 GB, 500 GB, plus eine nachlaufende Kopie                                   | 16 Prozessoren, 64 GB, 1–2 TB, plus eine Kopie                                |
| Sicherungen und Dateien    | 500 GB                                                                                       | 2 TB                                                                                         | 5–10 TB                                                                       |
| Sicherer Zugang            | Auf der Web-Maschine                                                                         | Zwei kleine Maschinen (2 Prozessoren, 4 GB)                                                  | Zwei kleine Maschinen                                                         |
| Überwachung und Protokolle | 2 Prozessoren, 4 GB                                                                          | 4 Prozessoren, 8 GB, 200 GB                                                                  | 8 Prozessoren, 16 GB, 500 GB                                                  |
| Modellmaschine             | Eine Maschine: eine 24–48-GB-Grafikkarte, 8–16 Kerne, 64 GB Arbeitsspeicher, 1 TB Festplatte | Zwei Maschinen: je eine 48-GB-Grafikkarte, 16 Kerne, 128 GB Arbeitsspeicher, 2 TB Festplatte | Zwei bis vier Maschinen: 80-GB-Grafikkarten, 32 Kerne, 256 GB Arbeitsspeicher |

<Callout type="idea" title="Tipp">
  Laufen nur die kleinen Modelle und nutzen nur Administratoren sie, ist keine Grafikkarte nötig. Eine Maschine mit 16
  Kernen und 64 GB Arbeitsspeicher betreibt Jan-v1-4B, Gemma 4 E4B, EmbeddingGemma und Prompt Guard für bis zu etwa
  300 Personen, die das Modell nutzen.
</Callout>

## Speicherbedarf je Modell [#speicherbedarf-je-modell]

Die Werte gelten nur für die Gewichte. Rechnen Sie 30–50 % hinzu, damit mehrere Personen gleichzeitig bedient werden
können. Faustregel: Parameter × 0,55 GB bei 4 Bit und × 1,05 GB bei 8 Bit. Der Arbeitsspeicher der Maschine sollte
mindestens doppelt so groß sein wie der Grafikkartenspeicher.

| Modell                         | Aufgabe                     | 4 Bit       | 8 Bit      | Nur Prozessor?                                       |
| ------------------------------ | --------------------------- | ----------- | ---------- | ---------------------------------------------------- |
| Prompt Guard 2 (86 Millionen)  | Injection-Prüfung           | unter 1 GB  | unter 1 GB | Ja, und schnell                                      |
| EmbeddingGemma (308 Millionen) | Suche                       | unter 1 GB  | etwa 1 GB  | Ja                                                   |
| Jan-v1-4B                      | Werkzeugauswahl             | etwa 3 GB   | etwa 5 GB  | Ja (etwa 10–20 Tokens pro Sekunde bei einer Anfrage) |
| Gemma 4 E4B                    | Klassifizieren und prüfen   | etwa 4–5 GB | etwa 8 GB  | Ja                                                   |
| Gemma 4 26B-A4B                | Großes Standardmodell       | etwa 16 GB  | etwa 28 GB | Nein                                                 |
| Qwen3.5-35B-A3B                | Großes Ersatzmodell         | etwa 21 GB  | etwa 37 GB | Nein                                                 |
| Gemma 4 31B                    | Größerer On-Premises-Planer | etwa 19 GB  | etwa 33 GB | Nein                                                 |

<BarChart title="Ungefähre Gewichte bei 8 Bit" caption="Nur Gewichte, aus der Tabelle oben. Für mehrere gleichzeitige Nutzer 30–50 % hinzurechnen." unit=" GB" data="[{ label: 'Jan-v1-4B', value: 5 }, { label: 'Gemma 4 E4B', value: 8 }, { label: 'Gemma 4 26B-A4B', value: 28 }, { label: 'Gemma 4 31B', value: 33 }, { label: 'Qwen3.5-35B-A3B', value: 37 }]" />

## Welche Grafikkarte [#welche-grafikkarte]

| Karte                    | Speicher       | Leistung  | Passt für                                                                           | Geeignet für                                            | Hinweis                                                                                                             |
| ------------------------ | -------------- | --------- | ----------------------------------------------------------------------------------- | ------------------------------------------------------- | ------------------------------------------------------------------------------------------------------------------- |
| NVIDIA L4                | 24 GB          | 72 W      | Die kleinen Modelle und Gemma 4 26B-A4B mit 4 Bit                                   | Pilot, geringer Stromverbrauch, jeder 1U-Server         | Langsamer, wenn viele gleichzeitig fragen                                                                           |
| RTX 5090 / 4090          | 32 GB / 24 GB  | 450–575 W | Wie die L4, aber schneller                                                          | Entwicklerrechner oder interne Vorführung               | Die GeForce-Treiberlizenz erlaubt keinen Rechenzentrumsbetrieb, daher nicht für die Produktionsserver des Instituts |
| L40S                     | 48 GB          | 350 W     | 26B-A4B mit 8 Bit, die kleinen Modelle und Reserve für mehrere gleichzeitige Nutzer | 1.000 Personen                                          | Die übliche Wahl                                                                                                    |
| RTX PRO 6000 (Blackwell) | 96 GB          | 300–600 W | Das 31B-Modell mit 8 Bit mit Reserve, oder zwei Modelle                             | Eine Karte für das große Modell und den größeren Planer | Workstation- und Server-Ausführungen                                                                                |
| H100 / H200              | 80 GB / 141 GB | 700 W     | Die Modelle oben, mit vielen gleichzeitigen Nutzern                                 | 5.000 oder mehr Personen                                | Nur wenn die Last es erfordert                                                                                      |

<Callout type="warn" title="Achtung">
  Die GeForce-Treiberlizenz erlaubt keinen Rechenzentrumsbetrieb. Planen Sie RTX-5090- oder 4090-Karten nicht für die
  Produktionsserver des Instituts ein.
</Callout>

## Den Aufwand klein halten [#den-aufwand-klein-halten-1]

<Mermaid
  title="Wie eine Frage verarbeitet wird"
  chart="`flowchart TD
A[Frage] --> B{Können die Datensätze sie beantworten?}
B -->|Ja| C[Abfrage, kein Modellaufruf]
B -->|Nein| D[Router wählt 5–8 Werkzeuge]
D --> E{Limit erreicht?}
E -->|Nein| F[Für die Aufgabe gewähltes Modell]
E -->|Ja| G[&#x22;Standardmodell; der Assistent sagt das&#x22;]`"
/>

* Zuerst aus den Datensätzen antworten. „Meine Stunden diese Woche“ ist eine Abfrage, kein Modellaufruf. Ziel ist,
  dass weniger als ein Viertel der Fragen das große Modell erreicht.
* Nur passende Werkzeuge anbieten. Der Router wählt 5–8 Werkzeuge aus, statt alle 40 Definitionen zu senden. Das
  verkürzt die Eingabe um etwa 60 %.
* Den Anfang des Prompts stabil halten. Anweisungen und Werkzeuge stehen am Anfang und ändern sich im Lauf des Tages
  nicht, sodass ein wiederholter Anfang wiederverwendet werden kann.
* Lange Unterhaltungen zusammenfassen, statt den gesamten Verlauf erneut zu senden.
* Zusammenfassungen über Nacht vorbereiten, damit sie um 8:00 Uhr bereitstehen.
* Jede Organisation und jede Person hat ein Limit. Ist es erreicht, wechselt der Assistent zum Standardmodell und
  sagt das. Er bricht nicht ohne Begründung ab.
* Das größere Modell wird für Projektpläne und für Begründungen eingesetzt, wer die Arbeit übernehmen sollte.
* Auf den eigenen Maschinen des Instituts: Mixture-of-Experts-Modelle, Gewichte mit 4 oder 8 Bit und eine gemeinsame
  Grafikkarte für alle kleinen Modelle.

## Häufige Fragen [#häufige-fragen]

<Accordions type="single">
  <Accordion title="Verlässt eine Frage das Institut?">
    Nein. Das Modell läuft auf den eigenen Maschinen des Instituts. Der Inferenzserver hat keinen Weg nach außen und
    verlangt keinen API-Schlüssel.
  </Accordion>

  <Accordion title="Brauchen wir eine Grafikkarte?">
    Nicht immer. Das Modell ist optional, der Rest der Installation läuft auf gewöhnlichen Maschinen. Laufen nur die
    kleinen Modelle und nutzen nur Administratoren sie, genügt eine Maschine mit 16 Kernen und 64 GB Arbeitsspeicher für
    bis zu etwa 300 Personen, die das Modell nutzen.
  </Accordion>

  <Accordion title="Sind die Dimensionierungswerte gemessene Benchmarks?">
    Nein. Es sind Schätzungen auf Basis von Modellgrößen und Token-Raten.
  </Accordion>

  <Accordion title="Können wir RTX-5090- oder 4090-Karten in der Produktion einsetzen?">
    Nein. Die GeForce-Treiberlizenz erlaubt keinen Rechenzentrumsbetrieb. Diese Karten eignen sich für einen
    Entwicklerrechner oder eine interne Vorführung.
  </Accordion>

  <Accordion title="Was passiert, wenn eine Person ihr Limit erreicht?">
    Der Assistent wechselt zum Standardmodell und sagt das. Er bricht nicht ohne Begründung ab.
  </Accordion>
</Accordions>

## Verwandte Seiten [#verwandte-seiten]

* [Die eigene Verbindung der Organisation](/de/ai/connections)
* [Modelle, die im Institut bleiben](/de/ai/local-models)
* [Was die Assistenz sehen kann](/de/ai/privacy)
