Eigenes KI-Modell betreiben
Die KI-Funktionen von Akollo nutzen die Modelle, die Akollo bereitstellt, bis ein Administrator etwas anderes anbindet. Diese Anleitung ist für den Fall gedacht, dass das Modell auf Hardware laufen soll, die Sie selbst kontrollieren: ein Laptop für einen Test, eine Workstation oder ein Server im eigenen Netz. Sie installieren eine Modell-Laufzeitumgebung, starten sie als OpenAI-kompatiblen Server und fügen sie in Akollo als Verbindung vom Typ Own model server (eigener Modellserver) hinzu, direkt oder über den AI Connector.
Warum ein eigenes Modell
- Die Daten bleiben bei Ihnen. Fragen und Antworten gehen an einen Rechner, den Ihre Organisation betreibt, nicht an einen externen KI-Anbieter.
- Sie wählen das Modell. Sie entscheiden, welches offene Modell in welcher Größe läuft und wann es aktualisiert wird.
- Keine KI-Tokens verbraucht. Anfragen über Ihre eigene Verbindung verbrauchen keine Akollo-KI-Tokens Ihrer Organisation. Siehe KI-Zugang und KI-Tokens.
- Ein guter erster Schritt. Für einen Test mit einem kleinen Modell genügt ein Laptop, bevor Sie einen Server planen. Für eine vollständige Installation im Institut siehe Das Modell im Institut betreiben.
Laufzeitumgebung wählen
Jeder Server, der die OpenAI-kompatible API anbietet, funktioniert. Diese drei sind am verbreitetsten und kostenlos nutzbar.
| Laufzeitumgebung | Am besten für | So läuft sie | Embeddings |
|---|---|---|---|
llama.cpp (llama-server) | Server, volle Kontrolle, Rechner ohne Grafikkarte | Kommandozeile, ein Modell pro Serverprozess | Ja, als eigener Server mit --embeddings |
| Ollama | Schnelle Einrichtung auf einem Laptop oder kleinen Server | Hintergrunddienst, Modelle werden per Name geladen | Ja |
| LM Studio | Modelle am Desktop mit grafischer Oberfläche ausprobieren | Desktop-App mit eingebautem lokalem Server | Ja |
Für einen gemeinsamen Server, den die ganze Organisation nutzt, ist llama.cpp (oder vLLM auf einem Server mit Grafikkarte) meist die bessere Wahl. Ollama und LM Studio sind der einfachste Weg, etwas auf einem einzelnen Rechner auszuprobieren.
Installieren
Mit Homebrew:
# llama.cpp (enthält llama-server)
brew install llama.cpp
# oder Ollama
brew install ollamaDie Ollama-App können Sie auch von ollama.com herunterladen. Für LM Studio laden Sie die App von lmstudio.ai herunter und ziehen sie in den Ordner „Programme“. Macs mit Apple Silicon nutzen den gemeinsamen Grafikspeicher automatisch.
Welches Modell für welchen Rechner
Die folgenden Modelle liegen auch Akollos eigener Dimensionierung zugrunde. Es sind offene Modelle, die Sie von Hugging Face herunterladen oder in Ollama und LM Studio per Name laden können.
| Rechner | Modell | Wofür |
|---|---|---|
| Laptop mit 16 GB Arbeitsspeicher | Gemma 4 E4B oder Jan-v1-4B | Ausprobieren, Routing, Sicherheitsprüfung, kurze Antworten |
| Apple Silicon mit 32–48 GB oder PC mit 24-GB-Grafikkarte | Gemma 4 26B-A4B | Alltägliche Antworten und Planung für ein Team oder einen Pilotbetrieb |
| Jeder der obigen Rechner, zusätzlich zum Chat-Modell | EmbeddingGemma | Suche. Es ist klein und läuft gut auf dem Prozessor |
Quantisierung bedeutet, dass die Zahlen des Modells mit weniger Bits gespeichert werden. Eine Q4-Datei (4 Bit)
ist etwa halb so groß wie eine Q8-Datei (8 Bit), lädt schneller und antwortet schneller, bei leicht geringerer
Qualität. Q4 ist ein guter Standard. Wählen Sie Q8 nur, wenn der Rechner genug Speicher übrig hat. Modelldateien für
llama.cpp haben die Endung .gguf, und die Quantisierung steht meist im Dateinamen (zum Beispiel Q4_K_M).
| EmbeddingGemma | 0.5 GB |
|---|---|
| Jan-v1-4B | 3 GB |
| Gemma 4 E4B | 4.5 GB |
| Gemma 4 26B-A4B | 16 GB |
Wie Sie einen Server für Hunderte oder Tausende Personen dimensionieren, steht unter Das Modell im Institut betreiben.
Server starten
In den Beispielen ist <port> ein Port Ihrer Wahl und <model-file> das heruntergeladene Modell. Der
OpenAI-kompatible Endpunkt ist die Serveradresse gefolgt von /v1.
Starten Sie einen Server für Antworten und, wenn Sie Ihr eigenes Modell auch für die Suche nutzen möchten, einen zweiten für Embeddings:
# Chat-Modell
llama-server -m <model-file>.gguf --port <port>
# Oder llama-server lädt ein Modell von Hugging Face
llama-server -hf <publisher>/<model>-GGUF:Q4_K_M --port <port>
# Embedding-Modell, auf eigenem Port
llama-server -m <embedding-model-file>.gguf --embeddings --port <port>Um den Server mit einem Schlüssel zu schützen, ergänzen Sie --api-key <your-key>. Tragen Sie denselben Schlüssel in
Akollo ein.
Wer den Server erreichen kann
Standardmäßig lauschen alle drei Laufzeitumgebungen nur auf dem Rechner selbst (localhost). Das ist die sicherste Einstellung und genügt, wenn der AI Connector auf demselben Rechner läuft.
| Sie möchten | So geht’s |
|---|---|
| Nur dieser Rechner | Standard beibehalten. |
| Andere Rechner im Netz | llama.cpp: --host 0.0.0.0 ergänzen. Ollama: Umgebungsvariable OLLAMA_HOST auf 0.0.0.0 setzen. LM Studio: in den Servereinstellungen die Bereitstellung im lokalen Netz einschalten. |
| Akollo verbindet sich direkt | Server hinter HTTPS mit gültigem Zertifikat stellen (zum Beispiel per Reverse Proxy), mit einem Schlüssel schützen und den Betreiber Ihrer Installation bitten, die Adresse zu den zugelassenen Zielen hinzuzufügen. |
Achtung
Stellen Sie einen Modellserver nie ohne Schlüssel ins Internet. Wer ihn erreicht, kann Ihre Hardware nutzen. Bei
llama.cpp verwenden Sie --api-key. Für Ollama und LM Studio nutzen Sie einen Reverse Proxy, der einen Schlüssel
prüft, oder halten den Server privat und verwenden den AI Connector.
In Akollo verbinden
Verbindungen verwalten Inhaber und Administratoren der Organisation. Die ganze Seite ist unter KI-Verbindungen beschrieben.
Verbindungsseite öffnen
Öffnen Sie Settings › AI › Connections (Einstellungen › KI › Verbindungen).
Server hinzufügen
Wählen Sie unter Add a connection (Verbindung hinzufügen) als Provider (Anbieter) Own model server und
vergeben Sie einen Name. Tragen Sie unter Address (Adresse) die HTTPS-Adresse des Servers einschließlich
/v1 ein, zum Beispiel https://<your-model-server>/v1. Haben Sie auf dem Server einen Schlüssel gesetzt, fügen Sie
ihn unter API key ein, sonst lassen Sie das Feld leer.
Zugelassene Daten festlegen
Wählen Sie unter Data allowed (zugelassene Daten) Public data only, Up to internal data oder Up to confidential data und klicken Sie dann auf Add connection.
Modelle suchen und testen
Klicken Sie auf Find models (Modelle suchen). Die Liste zeigt die Modelle, die Ihr Server bereitstellt. Wählen Sie ein Modell und klicken Sie auf Test. Der Test sendet eine kurze Reihe fester Anfragen: Antworten auf Türkisch, strukturierte Antworten und die Nutzung eines Werkzeugs. Erst wenn er bestanden ist, lässt sich die Verbindung aktivieren.
Aktivieren
Klicken Sie auf Activate (Aktivieren). In Live-Organisationen bestätigt ein zweiter Administrator die Aktivierung auf derselben Seite.
Aufgaben zuordnen
Wählen Sie unter Which model does which job (welches Modell welche Aufgabe übernimmt) für die gewünschten Aufgaben Ihre Verbindung und das Modell und klicken Sie auf Save. Aufgaben, die Sie nicht ändern, nutzen weiterhin die Modelle, die Akollo bereitstellt.
Eine sinnvolle Aufteilung mit den Modellen von oben:
| Aufgabe | Empfohlenes Modell |
|---|---|
| Routing | Jan-v1-4B |
| Safety check (Sicherheitsprüfung) | Gemma 4 E4B |
| Everyday answers (alltägliche Antworten) | Gemma 4 26B-A4B |
| Planning and complex work (Planung und komplexe Arbeit) | Gemma 4 26B-A4B oder die Modelle, die Akollo bereitstellt |
| Search (Suche) | EmbeddingGemma |
Hinweis
Ein kleines Modell kann bei der Werkzeugnutzung oder den strukturierten Antworten durchfallen. Nutzen Sie es für Routing oder Safety check und geben Sie Everyday answers ein größeres Modell.
Server im Firmennetz
Von einer Cloud-Installation aus verbindet sich Akollo nicht mit privaten Netzadressen. Steht Ihr Modellserver im Firmennetz oder möchten Sie keinen eingehenden Port öffnen, verwenden Sie den AI Connector. Das ist ein kleiner Container, der in Ihrem Netz neben dem Modellserver läuft. Er verbindet sich über HTTPS nach außen mit Akollo, holt Anfragen ab, gibt sie an den Modellserver weiter und schickt die Antworten zurück. Es wird kein eingehender Port geöffnet.
Connector in Akollo anlegen
Vergeben Sie auf Settings › AI › Connections unter Add an AI Connector (AI Connector hinzufügen) einen Namen und klicken Sie auf Add connector.
Token kopieren
Kopieren Sie das Connector token. Es wird nur einmal angezeigt. Bewahren Sie es in Ihrem Secret Store auf.
Container starten
Starten Sie den AI-Connector-Container neben dem Modellserver. Er braucht drei Einstellungen: die Adresse von Akollo, das Token und die OpenAI-kompatible Adresse des Modellservers. Eine vierte, optionale Einstellung enthält den Schlüssel des Modellservers, falls er einen braucht.
docker run --restart unless-stopped \
-e AKOLLO_URL=https://<your-akollo-address> \
-e AKOLLO_CONNECTOR_TOKEN=<connector-token> \
-e AKOLLO_CONNECTOR_TARGET=http://<model-server>:<port>/v1 \
-e AKOLLO_CONNECTOR_TARGET_KEY=<model-server-key> \
<ai-connector-image>Prüfen, testen und aktivieren
Sobald der Connector verbunden ist, zeigt die Verbindungskarte Connector online. Danach gehen Sie wie bei einem direkt angebundenen Server über Find models, Test und Activate vor.
- Der Connector braucht nur ausgehendes HTTPS zu Akollo und einen Weg zum Modellserver. Der Modellserver selbst kann in Ihrem Netz bei einfachem HTTP bleiben.
- Betreiben Sie pro Token genau eine Instanz, die bei einem Ausfall automatisch neu startet. Eine zweite Instanz mit demselben Token wird abgewiesen.
- Der Connector leitet die Modellliste und Chat-Antworten weiter. Für die Aufgabe Search nutzen Sie eine direkte Verbindung vom Typ Own model server oder die Modelle, die Akollo bereitstellt.
- New token (neues Token) macht das alte Token sofort ungültig. Starten Sie den Connector mit dem neuen Token neu und testen und aktivieren Sie die Verbindung danach erneut.
- Der Connector protokolliert pro Anfrage eine Zeile, nie das Token oder den Inhalt.
Fehlerbehebung
| Symptom | Wahrscheinliche Ursache | Lösung |
|---|---|---|
| Der Test meldet, dass die Verbindung nicht erreichbar ist | Falsche Adresse, /v1 fehlt, falscher Schlüssel oder der Server läuft nicht | Rufen Sie von einem Rechner, der den Server erreichen soll, die Adresse mit angehängtem /models auf. Prüfen Sie den Schlüssel und testen Sie erneut. |
| Die Adresse wird nicht akzeptiert | Kein HTTPS, nicht auf der Liste zugelassener Ziele oder eine private Netzadresse | Stellen Sie den Server hinter HTTPS und bitten Sie Ihren Betreiber, die Adresse zuzulassen, oder verwenden Sie den AI Connector. |
| Find models zeigt keine Modelle | Kein Modell geladen oder der Schlüssel gehört zu einem anderen Server | Laden Sie ein Modell (in LM Studio in der Serveransicht) und klicken Sie erneut auf Find models. |
| Der Test scheitert an einigen Prüfungen | Das Modell ist zu klein für strukturierte Antworten oder Werkzeugnutzung | Nutzen Sie für Everyday answers ein größeres Modell wie Gemma 4 26B-A4B. Kleine Modelle eignen sich für Routing und Safety check. |
| Antworten sind langsam oder laufen in eine Zeitüberschreitung | Das Modell ist zu groß für den Rechner oder läuft nur auf dem Prozessor | Nutzen Sie ein kleineres Modell oder eine Q4-Datei, stellen Sie sicher, dass die Grafikkarte genutzt wird, und schließen Sie andere speicherhungrige Programme. |
| Der Server bricht mit „out of memory“ ab | Modell und Kontext passen nicht in den Speicher | Nutzen Sie ein kleineres Modell oder eine stärkere Quantisierung oder verkürzen Sie das Kontextfenster. |
| Suchergebnisse sind schlecht oder die Suche schlägt fehl | Für Search wurde ein Chat-Modell gewählt oder der Embedding-Server läuft nicht | Wählen Sie für Search ein Embedding-Modell wie EmbeddingGemma. Bei llama.cpp starten Sie es mit --embeddings. Wechseln Sie das Embedding-Modell nicht hin und her. |
| Zertifikats- oder TLS-Fehler | Selbst signiertes oder abgelaufenes Zertifikat | Nutzen Sie ein Zertifikat, dem Ihre Installation vertraut, oder den AI Connector, damit Akollo den Server nicht direkt anspricht. |
| Browser- oder CORS-Fehler beim manuellen Testen | Die Laufzeitumgebung blockiert Anfragen von Webseiten | Das betrifft Akollo nicht, denn Akollo ruft den Server von den eigenen Servern aus auf. Testen Sie stattdessen mit einem Kommandozeilenwerkzeug. |
| Andere Rechner erreichen den Server nicht | Er lauscht nur auf localhost oder eine Firewall blockiert den Port | Binden Sie ihn an das Netz (siehe oben) und öffnen Sie den Port nur für die Rechner, die ihn brauchen. |
| Connector offline | Falsches Token, Akollo-Adresse nicht erreichbar oder das Token wurde ersetzt | Prüfen Sie das Container-Log, die drei Einstellungen und ausgehendes HTTPS. Nach New token mit dem neuen Token neu starten. |
Häufige Fragen
Nein. Kleine Modelle wie Jan-v1-4B, Gemma 4 E4B und EmbeddingGemma laufen auf dem Prozessor. Eine Grafikkarte oder ein Mac mit Apple Silicon und genug Speicher macht das größere Gemma 4 26B-A4B schnell genug für alltägliche Antworten.
Nein. Anfragen über Ihre eigene Verbindung verbrauchen keine Akollo-KI-Tokens Ihrer Organisation.
Ja. Installieren Sie Ollama oder LM Studio, laden Sie ein kleines Modell und binden Sie es über den AI Connector an, der auf demselben Laptop läuft. Wählen Sie ein Modell, das Ihr Laptop tragen kann, etwa Gemma 4 E4B.
Mit dem AI Connector nicht. Er verbindet sich nach außen mit Akollo, es wird kein eingehender Port geöffnet. Eine direkte Verbindung vom Typ Own model server braucht dagegen eine HTTPS-Adresse, die Akollo erreichen kann.
Ja. Unter Which model does which job wählen Sie für jede Aufgabe einzeln ein Modell. Aufgaben, die Sie nicht ändern, nutzen weiterhin die Modelle, die Akollo bereitstellt.
Anfragen, die ihn nutzen, können nicht beantwortet werden, bis er wieder läuft. Um Aufgaben wieder auf die Modelle von Akollo zu legen, ändern Sie sie unter Which model does which job. Disable schaltet die Verbindung endgültig ab.
Verwandte Seiten
KI-Verbindungen
Eigenen KI-Anbieter oder Modellserver anbinden, testen, freigeben lassen und festlegen, welches Modell welche Aufgabe übernimmt.
Modelle, die im Institut bleiben
Ein Administrator kann die kleinen Assistenzmodelle auf einer Maschine des Instituts betreiben. Nutzer sehen Vorschläge, keine automatischen Änderungen.