# Modeli kurumda çalıştırmak (https://docs.akollo.com/tr/ai/on-prem)



<Callout title="Planlanıyor">
  Bu alan planlama aşamasında. Hazırlık yapabilmeniz için burada anlatılıyor; mevcut sürümde henüz yer almıyor.
</Callout>

## Nedir [#nedir]

Model, kurumun kendi makinelerinde çalışır. Sorular kurum dışındaki bir modele gönderilmez. Çıkarım sunucusunun
dışarıya giden bir yolu yoktur ve API anahtarı istemez.

<Mermaid
  title="Kurum içindeki veri yolu"
  chart="`flowchart LR
A[Çalışan bir soru sorar] --> B[Akollo uygulaması]
B --> C[Çıkarım sunucusu]
C --> B
C --x|Dışarıya yol yok| D[Kurum dışındaki model]`"
/>

Çıkarım sunucusunun dışarıya yolu olmadığı için hiçbir soru kurum dışındaki bir modele ulaşmaz.

## Kurulum profilleri [#kurulum-profilleri]

Kurulum iki profil sunar.

| Profil              | Ayrılan bellek | Ayrılan işlemci ve kart |
| ------------------- | -------------- | ----------------------- |
| Ekran kartlı profil | 32 GiB         | Bir NVIDIA ekran kartı  |
| İşlemcili profil    | 16 GiB         | 4 işlemci               |

<Callout type="info" title="Not">
  Bu sayılar kurulumun ayırdığı kaynakları gösterir. Sunucunun kaç kişiye hizmet verebileceğine dair bir taahhüt
  değildir.
</Callout>

## Kurulumu planlama [#kurulumu-planlama]

<Steps>
  <Step>
    ### Yükü tahmin edin [#yükü-tahmin-edin]

    **Kaç kişi** bölümünün başındaki yük tahminini okuyun. Bu tahmin model boyutlarından ve token hızlarından
    çıkarılmıştır; ölçülmüş bir test sonucu değildir.
  </Step>

  <Step>
    ### Boyutu seçin [#boyutu-seçin]

    **Kaç kişi** tablosunda kişi sayınıza uyan satırı seçin: en çok yaklaşık 300 kişilik pilot, 1.000 kişi ya da
    5.000 kişi.
  </Step>

  <Step>
    ### Kurulumun tamamını boyutlandırın [#kurulumun-tamamını-boyutlandırın]

    Web uygulaması, arka plan işleri, veritabanı, yedekler, güvenli giriş, izleme ve model makinesi için **Kurulumun
    tamamı** tablosunu kullanın.
  </Step>

  <Step>
    ### Model belleğini kontrol edip kartı seçin [#model-belleğini-kontrol-edip-kartı-seçin]

    Çalıştırmayı planladığınız modeller için **Her modelin belleği** ve **Hangi ekran kartı** tablolarından donanımı
    belirleyin.
  </Step>

  <Step>
    ### İşi küçük tutun [#i̇şi-küçük-tutun]

    Büyük modele daha az soru gitmesi için **İşi küçük tutmak** bölümündeki önlemleri uygulayın.
  </Step>
</Steps>

## Kaç kişi [#kaç-kişi]

Aşağıdaki tablolar model boyutlarından ve token hızlarından çıkarılmış tahminlerdir; ölçülmüş bir test sonucu
değildir. Aynı kullanımda 1.000 kişi, büyük modelde ayda yaklaşık 560 milyon giriş ve 50 milyon çıkış token’ı
üretir. İş saatlerine yayıldığında bu, ortalama saniyede kabaca 1.000 giriş ve 80 çıkış token’ı eder; yoğun
saatlerde ise bunun yaklaşık beş katına çıkar. Yaklaşık 4 milyar etkin parametreli bir uzman karışımı modeli bu yükü
tek bir veri merkezi ekran kartıyla karşılar.

| Boyut                           | Küçük modeller (yönlendirici, denetim, gömme)                                                 | Büyük model                                                                                 | Sunucu                                                                               |
| ------------------------------- | --------------------------------------------------------------------------------------------- | ------------------------------------------------------------------------------------------- | ------------------------------------------------------------------------------------ |
| Pilot, en çok yaklaşık 300 kişi | İşlemci: 16 çekirdek, 64 GB bellek (Jan-v1-4B 4 bit yaklaşık 3 GB, Gemma 4 E4B yaklaşık 4 GB) | Gemma 4 26B-A4B, tek bir 24–48 GB ekran kartında, 4 bit ya da 8 bit                         | Bir ekran kartı makinesi (örneğin L40S ya da RTX 6000 sınıfı) ve uygulama sunucuları |
| 1.000 kişi                      | Büyük modelle aynı ekran kartı (küçük modeller yaklaşık 8 GB ekler)                           | Gemma 4 26B-A4B ya da Qwen3.5-35B-A3B, 48 GB ekran kartı                                    | Yedeklilik için iki ekran kartı makinesi (yük için biri yeter)                       |
| 5.000 kişi                      | Ayrı küçük bir ekran kartı ya da iki işlemci makinesi                                         | Gemma 4 31B ya da 120 milyar parametreli bir uzman karışımı modeli, 80 GB ekran kartlarında | İki ila dört adet 80 GB ekran kartı (H100 ya da H200 sınıfı), toplu işlemeyle        |

## Kurulumun tamamı [#kurulumun-tamamı]

İşlemci sayıları fiziksel çekirdek ya da sanal işlemci sayısıdır. Diskler hızlı katı hal sürücüleridir (SSD). Model
isteğe bağlıdır: model olmadan da diğer bileşenler sıradan makinelerde çalışır ve ekran kartı gerekmez.

| Bileşen              | Pilot, en çok 300 kişi                                                            | 1.000 kişi                                                                                | 5.000 kişi                                                            |
| -------------------- | --------------------------------------------------------------------------------- | ----------------------------------------------------------------------------------------- | --------------------------------------------------------------------- |
| Web uygulaması       | 1 × 4 işlemci, 8 GB                                                               | 2 × 8 işlemci, 16 GB, yük dengeleyicinin arkasında                                        | 4 × 8 işlemci, 16 GB                                                  |
| Arka plan işleri     | Web makinesiyle ortak                                                             | 1 × 4 işlemci, 8 GB                                                                       | 2 × 8 işlemci, 16 GB                                                  |
| Veritabanı           | 4 işlemci, 16 GB, 200 GB                                                          | 8 işlemci, 32 GB, 500 GB ve onu izleyen bir kopya                                         | 16 işlemci, 64 GB, 1–2 TB ve bir kopya                                |
| Yedekler ve dosyalar | 500 GB                                                                            | 2 TB                                                                                      | 5–10 TB                                                               |
| Güvenli giriş        | Web makinesinde                                                                   | İki küçük makine (2 işlemci, 4 GB)                                                        | İki küçük makine                                                      |
| İzleme ve günlükler  | 2 işlemci, 4 GB                                                                   | 4 işlemci, 8 GB, 200 GB                                                                   | 8 işlemci, 16 GB, 500 GB                                              |
| Model makinesi       | Bir makine: bir adet 24–48 GB ekran kartı, 8–16 çekirdek, 64 GB bellek, 1 TB disk | İki makine: her birinde bir adet 48 GB ekran kartı, 16 çekirdek, 128 GB bellek, 2 TB disk | İki ila dört makine: 80 GB ekran kartları, 32 çekirdek, 256 GB bellek |

<Callout type="idea" title="İpucu">
  Yalnızca küçük modeller çalışıyorsa ve bunları yalnızca yöneticiler kullanıyorsa ekran kartı gerekmez. 16 çekirdekli
  ve 64 GB bellekli tek bir makine; modeli kullanan en çok yaklaşık 300 kişi için Jan-v1-4B, Gemma 4 E4B,
  EmbeddingGemma ve Prompt Guard modellerini çalıştırır.
</Callout>

## Her modelin belleği [#her-modelin-belleği]

Bu sayılar yalnızca ağırlıkları kapsar. Aynı anda birden fazla kişiye hizmet verebilmek için yüzde 30–50 ekleyin.
Kabaca kural şudur: 4 bitte parametre × 0,55 GB, 8 bitte parametre × 1,05 GB. Makinenin kendi belleği, ekran kartı
belleğinin en az iki katı olmalıdır.

| Model                       | Görevi                          | 4 bit           | 8 bit          | Yalnızca işlemciyle?                             |
| --------------------------- | ------------------------------- | --------------- | -------------- | ------------------------------------------------ |
| Prompt Guard 2 (86 milyon)  | Enjeksiyon denetimi             | 1 GB altı       | 1 GB altı      | Evet, hızlıdır                                   |
| EmbeddingGemma (308 milyon) | Arama                           | 1 GB altı       | yaklaşık 1 GB  | Evet                                             |
| Jan-v1-4B                   | Araç seçimi                     | yaklaşık 3 GB   | yaklaşık 5 GB  | Evet (tek istekte saniyede yaklaşık 10–20 token) |
| Gemma 4 E4B                 | Sınıflandırma ve denetim        | yaklaşık 4–5 GB | yaklaşık 8 GB  | Evet                                             |
| Gemma 4 26B-A4B             | Standart büyük model            | yaklaşık 16 GB  | yaklaşık 28 GB | Hayır                                            |
| Qwen3.5-35B-A3B             | Yedek büyük model               | yaklaşık 21 GB  | yaklaşık 37 GB | Hayır                                            |
| Gemma 4 31B                 | Daha büyük kurum içi planlayıcı | yaklaşık 19 GB  | yaklaşık 33 GB | Hayır                                            |

<BarChart title="8 bitte yaklaşık ağırlık boyutu" caption="Yalnızca ağırlıklar, yukarıdaki tablodan. Aynı anda birkaç kişiye hizmet için yüzde 30–50 ekleyin." unit=" GB" data="[{ label: 'Jan-v1-4B', value: 5 }, { label: 'Gemma 4 E4B', value: 8 }, { label: 'Gemma 4 26B-A4B', value: 28 }, { label: 'Gemma 4 31B', value: 33 }, { label: 'Qwen3.5-35B-A3B', value: 37 }]" />

## Hangi ekran kartı [#hangi-ekran-kartı]

| Kart                     | Bellek         | Güç       | Neyi kaldırır                                                        | Uygun olduğu kullanım                              | Not                                                                                                         |
| ------------------------ | -------------- | --------- | -------------------------------------------------------------------- | -------------------------------------------------- | ----------------------------------------------------------------------------------------------------------- |
| NVIDIA L4                | 24 GB          | 72 W      | Küçük modeller ve 4 bit Gemma 4 26B-A4B                              | Pilot, düşük güç tüketimi, her 1U sunucu           | Aynı anda çok kişi soru sorduğunda yavaşlar                                                                 |
| RTX 5090 / 4090          | 32 GB / 24 GB  | 450–575 W | L4 ile aynı, daha hızlı                                              | Geliştirici makinesi ya da kurum içi tanıtım       | GeForce sürücü lisansı veri merkezinde kullanıma izin vermez; kurumun üretim sunucuları için uygun değildir |
| L40S                     | 48 GB          | 350 W     | 8 bit 26B-A4B, küçük modeller ve aynı anda birkaç kişiye yetecek pay | 1.000 kişi                                         | Yaygın tercih                                                                                               |
| RTX PRO 6000 (Blackwell) | 96 GB          | 300–600 W | Pay bırakarak 8 bit 31B model ya da iki model                        | Büyük model ve daha büyük planlayıcı için tek kart | İş istasyonu ve sunucu sürümleri var                                                                        |
| H100 / H200              | 80 GB / 141 GB | 700 W     | Yukarıdaki modeller, aynı anda çok sayıda kişiyle                    | 5.000 ve üzeri kişi                                | Yalnızca yük gerektirdiğinde                                                                                |

<Callout type="warn" title="Dikkat">
  GeForce sürücü lisansı veri merkezinde kullanıma izin vermez. Kurumun üretim sunucuları için RTX 5090 ya da 4090
  kartları planlamayın.
</Callout>

## İşi küçük tutmak [#i̇şi-küçük-tutmak]

<Mermaid
  title="Bir soru nasıl işlenir"
  chart="`flowchart TD
A[Soru] --> B{Kayıtlar yanıtlayabilir mi?}
B -->|Evet| C[Sorgu, model çağrısı yok]
B -->|Hayır| D[Yönlendirici 5–8 araç seçer]
D --> E{Sınıra ulaşıldı mı?}
E -->|Hayır| F[İşe atanmış model]
E -->|Evet| G[&#x22;Standart model; asistan bunu belirtir&#x22;]`"
/>

* Önce kayıtlardan yanıt verin. “Bu haftaki saatlerim” bir sorgudur, model çağrısı gerektirmez. Hedef, soruların
  dörtte birinden azının büyük modele gitmesidir.
* Yalnızca soruya uyan araçları sunun. Yönlendirici 40 tanımın tamamını göndermek yerine 5–8 araç seçer; bu da
  girdiyi yaklaşık yüzde 60 azaltır.
* İstemin başlangıcını sabit tutun. Yönergeler ve araçlar başta yer alır ve gün içinde değişmez; böylece tekrarlanan
  başlangıç yeniden kullanılabilir.
* Uzun bir konuşmanın tüm geçmişini yeniden göndermek yerine özetleyin.
* Özetleri gece hazırlayın; sabah 8:00’de hazır olsunlar.
* Her kurumun ve her kişinin bir sınırı vardır. Sınıra ulaşıldığında asistan standart modele geçer ve bunu belirtir.
  Nedenini söylemeden durmaz.
* Daha büyük model; proje planları ve işi kimin yapması gerektiğine dair açıklamalar için kullanılır.
* Kurumun kendi makinelerinde: uzman karışımı modeller, 4 bit ya da 8 bit ağırlıklar ve küçük modellerin tümü için
  ortak bir ekran kartı.

## Sık sorulan sorular [#sık-sorulan-sorular]

<Accordions type="single">
  <Accordion title="Herhangi bir soru kurum dışına çıkar mı?">
    Hayır. Model kurumun kendi makinelerinde çalışır. Çıkarım sunucusunun dışarıya yolu yoktur ve API anahtarı istemez.
  </Accordion>

  <Accordion title="Ekran kartı şart mı?">
    Her zaman değil. Model isteğe bağlıdır; kurulumun geri kalanı sıradan makinelerde çalışır. Yalnızca küçük modeller
    çalışıyor ve bunları yalnızca yöneticiler kullanıyorsa, modeli kullanan en çok yaklaşık 300 kişi için 16 çekirdekli
    ve 64 GB bellekli tek bir makine yeterlidir.
  </Accordion>

  <Accordion title="Boyutlandırma sayıları ölçülmüş test sonuçları mı?">
    Hayır. Model boyutlarından ve token hızlarından çıkarılmış tahminlerdir.
  </Accordion>

  <Accordion title="RTX 5090 ya da 4090 kartlarını üretimde kullanabilir miyiz?">
    Hayır. GeForce sürücü lisansı veri merkezinde kullanıma izin vermez. Bu kartlar geliştirici makinesi ya da kurum içi
    tanıtım için uygundur.
  </Accordion>

  <Accordion title="Bir kişi sınırına ulaştığında ne olur?">
    Asistan standart modele geçer ve bunu belirtir. Nedenini söylemeden durmaz.
  </Accordion>
</Accordions>

## İlgili sayfalar [#i̇lgili-sayfalar]

* [Kurumun kendi bağlantısı](/tr/ai/connections)
* [Kurumun kendi makinelerinde çalışan modeller](/tr/ai/local-models)
* [Yardım neyi görür](/tr/ai/privacy)
