# Eigenes KI-Modell betreiben (https://docs.akollo.com/de/ai/local-setup)



Die KI-Funktionen von Akollo nutzen die Modelle, die Akollo bereitstellt, bis ein Administrator etwas anderes
anbindet. Diese Anleitung ist für den Fall gedacht, dass das Modell auf Hardware laufen soll, die Sie selbst
kontrollieren: ein Laptop für einen Test, eine Workstation oder ein Server im eigenen Netz. Sie installieren eine
Modell-Laufzeitumgebung, starten sie als OpenAI-kompatiblen Server und fügen sie in Akollo als Verbindung vom Typ
**Own model server** (eigener Modellserver) hinzu, direkt oder über den **AI Connector**.

## Warum ein eigenes Modell [#warum-ein-eigenes-modell]

* **Die Daten bleiben bei Ihnen.** Fragen und Antworten gehen an einen Rechner, den Ihre Organisation betreibt, nicht
  an einen externen KI-Anbieter.
* **Sie wählen das Modell.** Sie entscheiden, welches offene Modell in welcher Größe läuft und wann es aktualisiert
  wird.
* **Keine KI-Tokens verbraucht.** Anfragen über Ihre eigene Verbindung verbrauchen keine Akollo-KI-Tokens Ihrer
  Organisation. Siehe [KI-Zugang und KI-Tokens](/de/ai/access-and-tokens).
* **Ein guter erster Schritt.** Für einen Test mit einem kleinen Modell genügt ein Laptop, bevor Sie einen Server
  planen. Für eine vollständige Installation im Institut siehe [Das Modell im Institut betreiben](/de/ai/on-prem).

<Mermaid
  title="Vom Modellserver zu den Funktionen in Akollo"
  chart="`flowchart LR
A[Ihr Rechner oder Server] --> B[Modell-Laufzeitumgebung]
B --> C[OpenAI-kompatibler Endpunkt]
C -->|Direkt über HTTPS| D[Verbindung Own model server]
C -->|Über den AI Connector| D
D --> E[Aufgaben: Antworten, Routing, Suche]`"
/>

## Laufzeitumgebung wählen [#laufzeitumgebung-wählen]

Jeder Server, der die OpenAI-kompatible API anbietet, funktioniert. Diese drei sind am verbreitetsten und kostenlos
nutzbar.

| Laufzeitumgebung               | Am besten für                                             | So läuft sie                                       | Embeddings                                |
| ------------------------------ | --------------------------------------------------------- | -------------------------------------------------- | ----------------------------------------- |
| **llama.cpp** (`llama-server`) | Server, volle Kontrolle, Rechner ohne Grafikkarte         | Kommandozeile, ein Modell pro Serverprozess        | Ja, als eigener Server mit `--embeddings` |
| **Ollama**                     | Schnelle Einrichtung auf einem Laptop oder kleinen Server | Hintergrunddienst, Modelle werden per Name geladen | Ja                                        |
| **LM Studio**                  | Modelle am Desktop mit grafischer Oberfläche ausprobieren | Desktop-App mit eingebautem lokalem Server         | Ja                                        |

Für einen gemeinsamen Server, den die ganze Organisation nutzt, ist llama.cpp (oder vLLM auf einem Server mit
Grafikkarte) meist die bessere Wahl. Ollama und LM Studio sind der einfachste Weg, etwas auf einem einzelnen Rechner
auszuprobieren.

### Installieren [#installieren]

<Tabs items="[&#x22;macOS&#x22;,&#x22;Windows&#x22;,&#x22;Linux&#x22;]">
  <Tab value="macOS">
    Mit Homebrew:

    ```bash
    # llama.cpp (enthält llama-server)
    brew install llama.cpp

    # oder Ollama
    brew install ollama
    ```

    Die Ollama-App können Sie auch von ollama.com herunterladen. Für LM Studio laden Sie die App von lmstudio.ai herunter
    und ziehen sie in den Ordner „Programme“. Macs mit Apple Silicon nutzen den gemeinsamen Grafikspeicher automatisch.
  </Tab>

  <Tab value="Windows">
    Mit winget in PowerShell:

    ```powershell
    # llama.cpp (enthält llama-server)
    winget install llama.cpp

    # oder Ollama
    winget install Ollama.Ollama
    ```

    Alternativ laden Sie den Ollama-Installer von ollama.com herunter oder eine fertige llama.cpp-Version aus dem
    llama.cpp-Projekt auf GitHub (wählen Sie den Build, der zu Ihrer Grafikkarte passt, oder den CPU-Build). Für LM Studio
    laden Sie den Installer von lmstudio.ai herunter.
  </Tab>

  <Tab value="Linux">
    Für Ollama gibt es ein offizielles Installationsskript:

    ```bash
    curl -fsSL https://ollama.com/install.sh | sh
    ```

    Für llama.cpp laden Sie eine fertige Version aus dem llama.cpp-Projekt auf GitHub, installieren es über Ihren
    Paketmanager, falls dieser es anbietet (Homebrew unter Linux funktioniert ebenfalls), oder bauen es aus dem Quellcode:

    ```bash
    git clone https://github.com/ggml-org/llama.cpp
    cd llama.cpp
    cmake -B build
    cmake --build build --config Release
    ```

    Haben Sie eine Grafikkarte, ergänzen Sie die passende Build-Option (zum Beispiel CUDA). LM Studio gibt es für Linux
    als AppImage auf lmstudio.ai.
  </Tab>
</Tabs>

## Welches Modell für welchen Rechner [#welches-modell-für-welchen-rechner]

Die folgenden Modelle liegen auch Akollos eigener Dimensionierung zugrunde. Es sind offene Modelle, die Sie von
Hugging Face herunterladen oder in Ollama und LM Studio per Name laden können.

| Rechner                                                  | Modell                             | Wofür                                                                  |
| -------------------------------------------------------- | ---------------------------------- | ---------------------------------------------------------------------- |
| Laptop mit 16 GB Arbeitsspeicher                         | **Gemma 4 E4B** oder **Jan-v1-4B** | Ausprobieren, Routing, Sicherheitsprüfung, kurze Antworten             |
| Apple Silicon mit 32–48 GB oder PC mit 24-GB-Grafikkarte | **Gemma 4 26B-A4B**                | Alltägliche Antworten und Planung für ein Team oder einen Pilotbetrieb |
| Jeder der obigen Rechner, zusätzlich zum Chat-Modell     | **EmbeddingGemma**                 | Suche. Es ist klein und läuft gut auf dem Prozessor                    |

**Quantisierung** bedeutet, dass die Zahlen des Modells mit weniger Bits gespeichert werden. Eine **Q4**-Datei (4 Bit)
ist etwa halb so groß wie eine **Q8**-Datei (8 Bit), lädt schneller und antwortet schneller, bei leicht geringerer
Qualität. Q4 ist ein guter Standard. Wählen Sie Q8 nur, wenn der Rechner genug Speicher übrig hat. Modelldateien für
llama.cpp haben die Endung `.gguf`, und die Quantisierung steht meist im Dateinamen (zum Beispiel `Q4_K_M`).

<BarChart title="Ungefährer Speicherbedarf der Modellgewichte bei 4 Bit" caption="Grobe Richtwerte, nur für die Gewichte. Rechnen Sie 30–50 % hinzu, damit mehrere Personen gleichzeitig bedient werden können, und lassen Sie Speicher für das Betriebssystem frei." unit=" GB" data="[{ label: 'EmbeddingGemma', value: 0.5 }, { label: 'Jan-v1-4B', value: 3 }, { label: 'Gemma 4 E4B', value: 4.5 }, { label: 'Gemma 4 26B-A4B', value: 16 }]" />

Wie Sie einen Server für Hunderte oder Tausende Personen dimensionieren, steht unter
[Das Modell im Institut betreiben](/de/ai/on-prem).

## Server starten [#server-starten]

In den Beispielen ist `<port>` ein Port Ihrer Wahl und `<model-file>` das heruntergeladene Modell. Der
OpenAI-kompatible Endpunkt ist die Serveradresse gefolgt von `/v1`.

<Tabs items="[&#x22;llama.cpp&#x22;,&#x22;Ollama&#x22;,&#x22;LM Studio&#x22;]">
  <Tab value="llama.cpp">
    Starten Sie einen Server für Antworten und, wenn Sie Ihr eigenes Modell auch für die Suche nutzen möchten, einen
    zweiten für Embeddings:

    ```bash
    # Chat-Modell
    llama-server -m <model-file>.gguf --port <port>

    # Oder llama-server lädt ein Modell von Hugging Face
    llama-server -hf <publisher>/<model>-GGUF:Q4_K_M --port <port>

    # Embedding-Modell, auf eigenem Port
    llama-server -m <embedding-model-file>.gguf --embeddings --port <port>
    ```

    Um den Server mit einem Schlüssel zu schützen, ergänzen Sie `--api-key <your-key>`. Tragen Sie denselben Schlüssel in
    Akollo ein.
  </Tab>

  <Tab value="Ollama">
    ```bash
    # Dienst starten (die Desktop-App erledigt das für Sie)
    ollama serve

    # Ein Chat-Modell und ein Embedding-Modell laden
    ollama pull <model>
    ollama pull <embedding-model>

    # Installierte Modelle anzeigen
    ollama list
    ```

    Ollama hat keinen eingebauten Schlüssel. Wenn andere Rechner es erreichen können, stellen Sie einen Reverse Proxy
    davor, der einen Schlüssel prüft und HTTPS ergänzt.
  </Tab>

  <Tab value="LM Studio">
    1. Laden Sie über die Modellsuche der App ein Modell herunter.
    2. Öffnen Sie **Developer** und starten Sie den Server.
    3. Laden Sie das Modell, das bereitgestellt werden soll. Adresse und Port stehen in den Servereinstellungen.

    Den Server können Sie auch auf der Kommandozeile mit `lms server start` starten.
  </Tab>
</Tabs>

### Wer den Server erreichen kann [#wer-den-server-erreichen-kann]

Standardmäßig lauschen alle drei Laufzeitumgebungen nur auf dem Rechner selbst (localhost). Das ist die sicherste
Einstellung und genügt, wenn der AI Connector auf demselben Rechner läuft.

| Sie möchten                  | So geht’s                                                                                                                                                                                                            |
| ---------------------------- | -------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- |
| Nur dieser Rechner           | Standard beibehalten.                                                                                                                                                                                                |
| Andere Rechner im Netz       | llama.cpp: `--host 0.0.0.0` ergänzen. Ollama: Umgebungsvariable `OLLAMA_HOST` auf `0.0.0.0` setzen. LM Studio: in den Servereinstellungen die Bereitstellung im lokalen Netz einschalten.                            |
| Akollo verbindet sich direkt | Server hinter HTTPS mit gültigem Zertifikat stellen (zum Beispiel per Reverse Proxy), mit einem Schlüssel schützen und den Betreiber Ihrer Installation bitten, die Adresse zu den zugelassenen Zielen hinzuzufügen. |

<Callout type="warn" title="Achtung">
  Stellen Sie einen Modellserver nie ohne Schlüssel ins Internet. Wer ihn erreicht, kann Ihre Hardware nutzen. Bei
  llama.cpp verwenden Sie `--api-key`. Für Ollama und LM Studio nutzen Sie einen Reverse Proxy, der einen Schlüssel
  prüft, oder halten den Server privat und verwenden den AI Connector.
</Callout>

## In Akollo verbinden [#in-akollo-verbinden]

Verbindungen verwalten Inhaber und Administratoren der Organisation. Die ganze Seite ist unter
[KI-Verbindungen](/de/ai/connections) beschrieben.

<Steps>
  <Step>
    ### Verbindungsseite öffnen [#verbindungsseite-öffnen]

    Öffnen Sie **Settings › AI › Connections** (Einstellungen › KI › Verbindungen).
  </Step>

  <Step>
    ### Server hinzufügen [#server-hinzufügen]

    Wählen Sie unter **Add a connection** (Verbindung hinzufügen) als **Provider** (Anbieter) **Own model server** und
    vergeben Sie einen **Name**. Tragen Sie unter **Address** (Adresse) die HTTPS-Adresse des Servers einschließlich
    `/v1` ein, zum Beispiel `https://<your-model-server>/v1`. Haben Sie auf dem Server einen Schlüssel gesetzt, fügen Sie
    ihn unter **API key** ein, sonst lassen Sie das Feld leer.
  </Step>

  <Step>
    ### Zugelassene Daten festlegen [#zugelassene-daten-festlegen]

    Wählen Sie unter **Data allowed** (zugelassene Daten) **Public data only**, **Up to internal data** oder **Up to
    confidential data** und klicken Sie dann auf **Add connection**.
  </Step>

  <Step>
    ### Modelle suchen und testen [#modelle-suchen-und-testen]

    Klicken Sie auf **Find models** (Modelle suchen). Die Liste zeigt die Modelle, die Ihr Server bereitstellt. Wählen
    Sie ein Modell und klicken Sie auf **Test**. Der Test sendet eine kurze Reihe fester Anfragen: Antworten auf
    Türkisch, strukturierte Antworten und die Nutzung eines Werkzeugs. Erst wenn er bestanden ist, lässt sich die
    Verbindung aktivieren.
  </Step>

  <Step>
    ### Aktivieren [#aktivieren]

    Klicken Sie auf **Activate** (Aktivieren). In Live-Organisationen bestätigt ein zweiter Administrator die Aktivierung
    auf derselben Seite.
  </Step>

  <Step>
    ### Aufgaben zuordnen [#aufgaben-zuordnen]

    Wählen Sie unter **Which model does which job** (welches Modell welche Aufgabe übernimmt) für die gewünschten
    Aufgaben Ihre Verbindung und das Modell und klicken Sie auf **Save**. Aufgaben, die Sie nicht ändern, nutzen
    weiterhin die Modelle, die Akollo bereitstellt.
  </Step>
</Steps>

Eine sinnvolle Aufteilung mit den Modellen von oben:

| Aufgabe                                                     | Empfohlenes Modell                                        |
| ----------------------------------------------------------- | --------------------------------------------------------- |
| **Routing**                                                 | Jan-v1-4B                                                 |
| **Safety check** (Sicherheitsprüfung)                       | Gemma 4 E4B                                               |
| **Everyday answers** (alltägliche Antworten)                | Gemma 4 26B-A4B                                           |
| **Planning and complex work** (Planung und komplexe Arbeit) | Gemma 4 26B-A4B oder die Modelle, die Akollo bereitstellt |
| **Search** (Suche)                                          | EmbeddingGemma                                            |

<Callout type="info" title="Hinweis">
  Ein kleines Modell kann bei der Werkzeugnutzung oder den strukturierten Antworten durchfallen. Nutzen Sie es für
  **Routing** oder **Safety check** und geben Sie **Everyday answers** ein größeres Modell.
</Callout>

## Server im Firmennetz [#server-im-firmennetz]

Von einer Cloud-Installation aus verbindet sich Akollo nicht mit privaten Netzadressen. Steht Ihr Modellserver im
Firmennetz oder möchten Sie keinen eingehenden Port öffnen, verwenden Sie den **AI Connector**. Das ist ein kleiner
Container, der in Ihrem Netz neben dem Modellserver läuft. Er verbindet sich über HTTPS nach außen mit Akollo, holt
Anfragen ab, gibt sie an den Modellserver weiter und schickt die Antworten zurück. Es wird kein eingehender Port
geöffnet.

<Mermaid
  title="AI Connector im Firmennetz"
  chart="`flowchart LR
subgraph Firmennetz
M[Modellserver] --- K[AI Connector]
end
K -->|Ausgehendes HTTPS mit seinem Token| A[Akollo]`"
/>

<Steps>
  <Step>
    ### Connector in Akollo anlegen [#connector-in-akollo-anlegen]

    Vergeben Sie auf **Settings › AI › Connections** unter **Add an AI Connector** (AI Connector hinzufügen) einen Namen
    und klicken Sie auf **Add connector**.
  </Step>

  <Step>
    ### Token kopieren [#token-kopieren]

    Kopieren Sie das **Connector token**. Es wird nur einmal angezeigt. Bewahren Sie es in Ihrem Secret Store auf.
  </Step>

  <Step>
    ### Container starten [#container-starten]

    Starten Sie den AI-Connector-Container neben dem Modellserver. Er braucht drei Einstellungen: die Adresse von Akollo,
    das Token und die OpenAI-kompatible Adresse des Modellservers. Eine vierte, optionale Einstellung enthält den
    Schlüssel des Modellservers, falls er einen braucht.

    ```bash
    docker run --restart unless-stopped \
      -e AKOLLO_URL=https://<your-akollo-address> \
      -e AKOLLO_CONNECTOR_TOKEN=<connector-token> \
      -e AKOLLO_CONNECTOR_TARGET=http://<model-server>:<port>/v1 \
      -e AKOLLO_CONNECTOR_TARGET_KEY=<model-server-key> \
      <ai-connector-image>
    ```
  </Step>

  <Step>
    ### Prüfen, testen und aktivieren [#prüfen-testen-und-aktivieren]

    Sobald der Connector verbunden ist, zeigt die Verbindungskarte **Connector online**. Danach gehen Sie wie bei einem
    direkt angebundenen Server über **Find models**, **Test** und **Activate** vor.
  </Step>
</Steps>

* Der Connector braucht nur ausgehendes HTTPS zu Akollo und einen Weg zum Modellserver. Der Modellserver selbst kann
  in Ihrem Netz bei einfachem HTTP bleiben.
* Betreiben Sie pro Token genau eine Instanz, die bei einem Ausfall automatisch neu startet. Eine zweite Instanz mit
  demselben Token wird abgewiesen.
* Der Connector leitet die Modellliste und Chat-Antworten weiter. Für die Aufgabe **Search** nutzen Sie eine direkte
  Verbindung vom Typ **Own model server** oder die Modelle, die Akollo bereitstellt.
* **New token** (neues Token) macht das alte Token sofort ungültig. Starten Sie den Connector mit dem neuen Token neu
  und testen und aktivieren Sie die Verbindung danach erneut.
* Der Connector protokolliert pro Anfrage eine Zeile, nie das Token oder den Inhalt.

## Fehlerbehebung [#fehlerbehebung]

| Symptom                                                       | Wahrscheinliche Ursache                                                            | Lösung                                                                                                                                                                   |
| ------------------------------------------------------------- | ---------------------------------------------------------------------------------- | ------------------------------------------------------------------------------------------------------------------------------------------------------------------------ |
| Der Test meldet, dass die Verbindung nicht erreichbar ist     | Falsche Adresse, `/v1` fehlt, falscher Schlüssel oder der Server läuft nicht       | Rufen Sie von einem Rechner, der den Server erreichen soll, die Adresse mit angehängtem `/models` auf. Prüfen Sie den Schlüssel und testen Sie erneut.                   |
| Die Adresse wird nicht akzeptiert                             | Kein HTTPS, nicht auf der Liste zugelassener Ziele oder eine private Netzadresse   | Stellen Sie den Server hinter HTTPS und bitten Sie Ihren Betreiber, die Adresse zuzulassen, oder verwenden Sie den AI Connector.                                         |
| **Find models** zeigt keine Modelle                           | Kein Modell geladen oder der Schlüssel gehört zu einem anderen Server              | Laden Sie ein Modell (in LM Studio in der Serveransicht) und klicken Sie erneut auf **Find models**.                                                                     |
| Der Test scheitert an einigen Prüfungen                       | Das Modell ist zu klein für strukturierte Antworten oder Werkzeugnutzung           | Nutzen Sie für **Everyday answers** ein größeres Modell wie Gemma 4 26B-A4B. Kleine Modelle eignen sich für **Routing** und **Safety check**.                            |
| Antworten sind langsam oder laufen in eine Zeitüberschreitung | Das Modell ist zu groß für den Rechner oder läuft nur auf dem Prozessor            | Nutzen Sie ein kleineres Modell oder eine Q4-Datei, stellen Sie sicher, dass die Grafikkarte genutzt wird, und schließen Sie andere speicherhungrige Programme.          |
| Der Server bricht mit „out of memory“ ab                      | Modell und Kontext passen nicht in den Speicher                                    | Nutzen Sie ein kleineres Modell oder eine stärkere Quantisierung oder verkürzen Sie das Kontextfenster.                                                                  |
| Suchergebnisse sind schlecht oder die Suche schlägt fehl      | Für **Search** wurde ein Chat-Modell gewählt oder der Embedding-Server läuft nicht | Wählen Sie für **Search** ein Embedding-Modell wie EmbeddingGemma. Bei llama.cpp starten Sie es mit `--embeddings`. Wechseln Sie das Embedding-Modell nicht hin und her. |
| Zertifikats- oder TLS-Fehler                                  | Selbst signiertes oder abgelaufenes Zertifikat                                     | Nutzen Sie ein Zertifikat, dem Ihre Installation vertraut, oder den AI Connector, damit Akollo den Server nicht direkt anspricht.                                        |
| Browser- oder CORS-Fehler beim manuellen Testen               | Die Laufzeitumgebung blockiert Anfragen von Webseiten                              | Das betrifft Akollo nicht, denn Akollo ruft den Server von den eigenen Servern aus auf. Testen Sie stattdessen mit einem Kommandozeilenwerkzeug.                         |
| Andere Rechner erreichen den Server nicht                     | Er lauscht nur auf localhost oder eine Firewall blockiert den Port                 | Binden Sie ihn an das Netz (siehe oben) und öffnen Sie den Port nur für die Rechner, die ihn brauchen.                                                                   |
| **Connector offline**                                         | Falsches Token, Akollo-Adresse nicht erreichbar oder das Token wurde ersetzt       | Prüfen Sie das Container-Log, die drei Einstellungen und ausgehendes HTTPS. Nach **New token** mit dem neuen Token neu starten.                                          |

## Häufige Fragen [#häufige-fragen]

<Accordions type="single">
  <Accordion title="Brauche ich eine Grafikkarte?">
    Nein. Kleine Modelle wie Jan-v1-4B, Gemma 4 E4B und EmbeddingGemma laufen auf dem Prozessor. Eine Grafikkarte oder
    ein Mac mit Apple Silicon und genug Speicher macht das größere Gemma 4 26B-A4B schnell genug für alltägliche
    Antworten.
  </Accordion>

  <Accordion title="Verbrauchen Anfragen an mein eigenes Modell unsere KI-Tokens?">
    Nein. Anfragen über Ihre eigene Verbindung verbrauchen keine Akollo-KI-Tokens Ihrer Organisation.
  </Accordion>

  <Accordion title="Kann ich es zuerst auf meinem Laptop ausprobieren?">
    Ja. Installieren Sie Ollama oder LM Studio, laden Sie ein kleines Modell und binden Sie es über den AI Connector an,
    der auf demselben Laptop läuft. Wählen Sie ein Modell, das Ihr Laptop tragen kann, etwa Gemma 4 E4B.
  </Accordion>

  <Accordion title="Muss ich einen Port in unserer Firewall öffnen?">
    Mit dem AI Connector nicht. Er verbindet sich nach außen mit Akollo, es wird kein eingehender Port geöffnet. Eine
    direkte Verbindung vom Typ **Own model server** braucht dagegen eine HTTPS-Adresse, die Akollo erreichen kann.
  </Accordion>

  <Accordion title="Kann ich für manche Aufgaben mein eigenes Modell und für andere die Modelle von Akollo nutzen?">
    Ja. Unter **Which model does which job** wählen Sie für jede Aufgabe einzeln ein Modell. Aufgaben, die Sie nicht
    ändern, nutzen weiterhin die Modelle, die Akollo bereitstellt.
  </Accordion>

  <Accordion title="Was passiert, wenn mein Server ausfällt?">
    Anfragen, die ihn nutzen, können nicht beantwortet werden, bis er wieder läuft. Um Aufgaben wieder auf die Modelle
    von Akollo zu legen, ändern Sie sie unter **Which model does which job**. **Disable** schaltet die Verbindung
    endgültig ab.
  </Accordion>
</Accordions>

## Verwandte Seiten [#verwandte-seiten]

* [KI-Verbindungen](/de/ai/connections)
* [Modelle, die im Institut bleiben](/de/ai/local-models)
* [Das Modell im Institut betreiben](/de/ai/on-prem)
* [Was die Assistenz sehen kann](/de/ai/privacy)
* [KI-Zugang und KI-Tokens](/de/ai/access-and-tokens)
