Das Modell im Institut betreiben
Geplant
Überblick
Das Modell läuft auf den eigenen Maschinen des Instituts. Fragen werden nicht an ein Modell außerhalb des Instituts gesendet. Der Inferenzserver hat keinen Weg nach außen und verlangt keinen API-Schlüssel.
Da der Inferenzserver keinen Weg nach außen hat, erreicht keine Frage ein Modell außerhalb des Instituts.
Bereitstellungsprofile
Die Installation bietet zwei Profile.
| Profil | Reservierter Arbeitsspeicher | Reservierte Prozessoren und Karten |
|---|---|---|
| Grafikkarten-Profil | 32 GiB | Eine NVIDIA-Grafikkarte |
| Prozessor-Profil | 16 GiB | 4 Prozessoren |
Hinweis
Diese Werte beschreiben, was die Installation reserviert. Sie sind keine Aussage darüber, wie viele Personen der Server bedienen kann.
Installation planen
Last abschätzen
Lesen Sie die Lastschätzung am Anfang von Wie viele Personen. Sie beruht auf Modellgrößen und Token-Raten und ist kein gemessener Benchmark.
Größe wählen
Wählen Sie in Wie viele Personen die Zeile, die zu Ihrer Personenzahl passt: Pilot mit bis zu etwa 300 Personen, 1.000 Personen oder 5.000 Personen.
Gesamte Installation dimensionieren
Dimensionieren Sie mit Die gesamte Installation Webanwendung, Hintergrundaufgaben, Datenbank, Sicherungen, sicheren Zugang, Überwachung und Modellmaschine.
Modellspeicher prüfen und Karte wählen
Wählen Sie mit Speicherbedarf je Modell und Welche Grafikkarte die Hardware für die geplanten Modelle.
Den Aufwand klein halten
Setzen Sie die Maßnahmen aus Den Aufwand klein halten um, damit weniger Fragen das große Modell erreichen.
Wie viele Personen
Die folgenden Tabellen sind Schätzungen auf Basis von Modellgrößen und Token-Raten, kein gemessener Benchmark. Bei gleicher Nutzung erzeugen 1.000 Personen auf dem großen Modell pro Monat etwa 560 Millionen Eingabe- und 50 Millionen Ausgabe-Tokens. Über die Arbeitszeit verteilt sind das im Mittel rund 1.000 Eingabe- und 80 Ausgabe-Tokens pro Sekunde, in Spitzenzeiten etwa das Fünffache. Ein Mixture-of-Experts-Modell mit etwa 4 Milliarden aktiven Parametern bewältigt das auf einer Rechenzentrums-Grafikkarte.
| Größe | Kleine Modelle (Router, Guard, Embeddings) | Großes Modell | Server |
|---|---|---|---|
| Pilot, bis etwa 300 Personen | Prozessor: 16 Kerne, 64 GB Arbeitsspeicher (Jan-v1-4B mit 4 Bit etwa 3 GB, Gemma 4 E4B etwa 4 GB) | Gemma 4 26B-A4B auf einer 24–48-GB-Grafikkarte, 4 Bit oder 8 Bit | Eine Grafikkarten-Maschine (zum Beispiel L40S- oder RTX-6000-Klasse) plus die Anwendungsserver |
| 1.000 Personen | Dieselbe Grafikkarte wie das große Modell (die kleinen Modelle belegen etwa 8 GB zusätzlich) | Gemma 4 26B-A4B oder Qwen3.5-35B-A3B, 48-GB-Grafikkarte | Zwei Grafikkarten-Maschinen, damit eine übernehmen kann (eine reicht für die Last) |
| 5.000 Personen | Eine separate kleine Grafikkarte oder zwei Prozessor-Maschinen | Gemma 4 31B oder ein Mixture-of-Experts-Modell mit 120 Milliarden Parametern auf 80-GB-Grafikkarten | Zwei bis vier 80-GB-Grafikkarten (H100- oder H200-Klasse), mit Batching |
Die gesamte Installation
Prozessorangaben sind physische Kerne oder virtuelle Prozessoren. Festplatten sind schnelle SSDs. Das Modell ist optional: Ohne Modell laufen die übrigen Komponenten auf gewöhnlichen Maschinen, eine Grafikkarte ist nicht nötig.
| Komponente | Pilot, bis 300 Personen | 1.000 Personen | 5.000 Personen |
|---|---|---|---|
| Webanwendung | 1 × 4 Prozessoren, 8 GB | 2 × 8 Prozessoren, 16 GB, hinter einem Load Balancer | 4 × 8 Prozessoren, 16 GB |
| Hintergrundaufgaben | Teilt sich die Web-Maschine | 1 × 4 Prozessoren, 8 GB | 2 × 8 Prozessoren, 16 GB |
| Datenbank | 4 Prozessoren, 16 GB, 200 GB | 8 Prozessoren, 32 GB, 500 GB, plus eine nachlaufende Kopie | 16 Prozessoren, 64 GB, 1–2 TB, plus eine Kopie |
| Sicherungen und Dateien | 500 GB | 2 TB | 5–10 TB |
| Sicherer Zugang | Auf der Web-Maschine | Zwei kleine Maschinen (2 Prozessoren, 4 GB) | Zwei kleine Maschinen |
| Überwachung und Protokolle | 2 Prozessoren, 4 GB | 4 Prozessoren, 8 GB, 200 GB | 8 Prozessoren, 16 GB, 500 GB |
| Modellmaschine | Eine Maschine: eine 24–48-GB-Grafikkarte, 8–16 Kerne, 64 GB Arbeitsspeicher, 1 TB Festplatte | Zwei Maschinen: je eine 48-GB-Grafikkarte, 16 Kerne, 128 GB Arbeitsspeicher, 2 TB Festplatte | Zwei bis vier Maschinen: 80-GB-Grafikkarten, 32 Kerne, 256 GB Arbeitsspeicher |
Tipp
Laufen nur die kleinen Modelle und nutzen nur Administratoren sie, ist keine Grafikkarte nötig. Eine Maschine mit 16 Kernen und 64 GB Arbeitsspeicher betreibt Jan-v1-4B, Gemma 4 E4B, EmbeddingGemma und Prompt Guard für bis zu etwa 300 Personen, die das Modell nutzen.
Speicherbedarf je Modell
Die Werte gelten nur für die Gewichte. Rechnen Sie 30–50 % hinzu, damit mehrere Personen gleichzeitig bedient werden können. Faustregel: Parameter × 0,55 GB bei 4 Bit und × 1,05 GB bei 8 Bit. Der Arbeitsspeicher der Maschine sollte mindestens doppelt so groß sein wie der Grafikkartenspeicher.
| Modell | Aufgabe | 4 Bit | 8 Bit | Nur Prozessor? |
|---|---|---|---|---|
| Prompt Guard 2 (86 Millionen) | Injection-Prüfung | unter 1 GB | unter 1 GB | Ja, und schnell |
| EmbeddingGemma (308 Millionen) | Suche | unter 1 GB | etwa 1 GB | Ja |
| Jan-v1-4B | Werkzeugauswahl | etwa 3 GB | etwa 5 GB | Ja (etwa 10–20 Tokens pro Sekunde bei einer Anfrage) |
| Gemma 4 E4B | Klassifizieren und prüfen | etwa 4–5 GB | etwa 8 GB | Ja |
| Gemma 4 26B-A4B | Großes Standardmodell | etwa 16 GB | etwa 28 GB | Nein |
| Qwen3.5-35B-A3B | Großes Ersatzmodell | etwa 21 GB | etwa 37 GB | Nein |
| Gemma 4 31B | Größerer On-Premises-Planer | etwa 19 GB | etwa 33 GB | Nein |
| Jan-v1-4B | 5 GB |
|---|---|
| Gemma 4 E4B | 8 GB |
| Gemma 4 26B-A4B | 28 GB |
| Gemma 4 31B | 33 GB |
| Qwen3.5-35B-A3B | 37 GB |
Welche Grafikkarte
| Karte | Speicher | Leistung | Passt für | Geeignet für | Hinweis |
|---|---|---|---|---|---|
| NVIDIA L4 | 24 GB | 72 W | Die kleinen Modelle und Gemma 4 26B-A4B mit 4 Bit | Pilot, geringer Stromverbrauch, jeder 1U-Server | Langsamer, wenn viele gleichzeitig fragen |
| RTX 5090 / 4090 | 32 GB / 24 GB | 450–575 W | Wie die L4, aber schneller | Entwicklerrechner oder interne Vorführung | Die GeForce-Treiberlizenz erlaubt keinen Rechenzentrumsbetrieb, daher nicht für die Produktionsserver des Instituts |
| L40S | 48 GB | 350 W | 26B-A4B mit 8 Bit, die kleinen Modelle und Reserve für mehrere gleichzeitige Nutzer | 1.000 Personen | Die übliche Wahl |
| RTX PRO 6000 (Blackwell) | 96 GB | 300–600 W | Das 31B-Modell mit 8 Bit mit Reserve, oder zwei Modelle | Eine Karte für das große Modell und den größeren Planer | Workstation- und Server-Ausführungen |
| H100 / H200 | 80 GB / 141 GB | 700 W | Die Modelle oben, mit vielen gleichzeitigen Nutzern | 5.000 oder mehr Personen | Nur wenn die Last es erfordert |
Achtung
Die GeForce-Treiberlizenz erlaubt keinen Rechenzentrumsbetrieb. Planen Sie RTX-5090- oder 4090-Karten nicht für die Produktionsserver des Instituts ein.
Den Aufwand klein halten
- Zuerst aus den Datensätzen antworten. „Meine Stunden diese Woche“ ist eine Abfrage, kein Modellaufruf. Ziel ist, dass weniger als ein Viertel der Fragen das große Modell erreicht.
- Nur passende Werkzeuge anbieten. Der Router wählt 5–8 Werkzeuge aus, statt alle 40 Definitionen zu senden. Das verkürzt die Eingabe um etwa 60 %.
- Den Anfang des Prompts stabil halten. Anweisungen und Werkzeuge stehen am Anfang und ändern sich im Lauf des Tages nicht, sodass ein wiederholter Anfang wiederverwendet werden kann.
- Lange Unterhaltungen zusammenfassen, statt den gesamten Verlauf erneut zu senden.
- Zusammenfassungen über Nacht vorbereiten, damit sie um 8:00 Uhr bereitstehen.
- Jede Organisation und jede Person hat ein Limit. Ist es erreicht, wechselt der Assistent zum Standardmodell und sagt das. Er bricht nicht ohne Begründung ab.
- Das größere Modell wird für Projektpläne und für Begründungen eingesetzt, wer die Arbeit übernehmen sollte.
- Auf den eigenen Maschinen des Instituts: Mixture-of-Experts-Modelle, Gewichte mit 4 oder 8 Bit und eine gemeinsame Grafikkarte für alle kleinen Modelle.
Häufige Fragen
Nein. Das Modell läuft auf den eigenen Maschinen des Instituts. Der Inferenzserver hat keinen Weg nach außen und verlangt keinen API-Schlüssel.
Nicht immer. Das Modell ist optional, der Rest der Installation läuft auf gewöhnlichen Maschinen. Laufen nur die kleinen Modelle und nutzen nur Administratoren sie, genügt eine Maschine mit 16 Kernen und 64 GB Arbeitsspeicher für bis zu etwa 300 Personen, die das Modell nutzen.
Nein. Es sind Schätzungen auf Basis von Modellgrößen und Token-Raten.
Nein. Die GeForce-Treiberlizenz erlaubt keinen Rechenzentrumsbetrieb. Diese Karten eignen sich für einen Entwicklerrechner oder eine interne Vorführung.
Der Assistent wechselt zum Standardmodell und sagt das. Er bricht nicht ohne Begründung ab.
Verwandte Seiten
Modelle, die im Institut bleiben
Ein Administrator kann die kleinen Assistenzmodelle auf einer Maschine des Instituts betreiben. Nutzer sehen Vorschläge, keine automatischen Änderungen.
Was die Assistenz sehen kann
Ein Modellaufruf erhält nur die Felder, die eine Frage braucht. Niemand sieht über die Assistenz Datensätze, die er selbst nicht öffnen darf.