Modeli kurumda çalıştırmak
Planlanıyor
Nedir
Model, kurumun kendi makinelerinde çalışır. Sorular kurum dışındaki bir modele gönderilmez. Çıkarım sunucusunun dışarıya giden bir yolu yoktur ve API anahtarı istemez.
Çıkarım sunucusunun dışarıya yolu olmadığı için hiçbir soru kurum dışındaki bir modele ulaşmaz.
Kurulum profilleri
Kurulum iki profil sunar.
| Profil | Ayrılan bellek | Ayrılan işlemci ve kart |
|---|---|---|
| Ekran kartlı profil | 32 GiB | Bir NVIDIA ekran kartı |
| İşlemcili profil | 16 GiB | 4 işlemci |
Not
Bu sayılar kurulumun ayırdığı kaynakları gösterir. Sunucunun kaç kişiye hizmet verebileceğine dair bir taahhüt değildir.
Kurulumu planlama
Yükü tahmin edin
Kaç kişi bölümünün başındaki yük tahminini okuyun. Bu tahmin model boyutlarından ve token hızlarından çıkarılmıştır; ölçülmüş bir test sonucu değildir.
Boyutu seçin
Kaç kişi tablosunda kişi sayınıza uyan satırı seçin: en çok yaklaşık 300 kişilik pilot, 1.000 kişi ya da 5.000 kişi.
Kurulumun tamamını boyutlandırın
Web uygulaması, arka plan işleri, veritabanı, yedekler, güvenli giriş, izleme ve model makinesi için Kurulumun tamamı tablosunu kullanın.
Model belleğini kontrol edip kartı seçin
Çalıştırmayı planladığınız modeller için Her modelin belleği ve Hangi ekran kartı tablolarından donanımı belirleyin.
İşi küçük tutun
Büyük modele daha az soru gitmesi için İşi küçük tutmak bölümündeki önlemleri uygulayın.
Kaç kişi
Aşağıdaki tablolar model boyutlarından ve token hızlarından çıkarılmış tahminlerdir; ölçülmüş bir test sonucu değildir. Aynı kullanımda 1.000 kişi, büyük modelde ayda yaklaşık 560 milyon giriş ve 50 milyon çıkış token’ı üretir. İş saatlerine yayıldığında bu, ortalama saniyede kabaca 1.000 giriş ve 80 çıkış token’ı eder; yoğun saatlerde ise bunun yaklaşık beş katına çıkar. Yaklaşık 4 milyar etkin parametreli bir uzman karışımı modeli bu yükü tek bir veri merkezi ekran kartıyla karşılar.
| Boyut | Küçük modeller (yönlendirici, denetim, gömme) | Büyük model | Sunucu |
|---|---|---|---|
| Pilot, en çok yaklaşık 300 kişi | İşlemci: 16 çekirdek, 64 GB bellek (Jan-v1-4B 4 bit yaklaşık 3 GB, Gemma 4 E4B yaklaşık 4 GB) | Gemma 4 26B-A4B, tek bir 24–48 GB ekran kartında, 4 bit ya da 8 bit | Bir ekran kartı makinesi (örneğin L40S ya da RTX 6000 sınıfı) ve uygulama sunucuları |
| 1.000 kişi | Büyük modelle aynı ekran kartı (küçük modeller yaklaşık 8 GB ekler) | Gemma 4 26B-A4B ya da Qwen3.5-35B-A3B, 48 GB ekran kartı | Yedeklilik için iki ekran kartı makinesi (yük için biri yeter) |
| 5.000 kişi | Ayrı küçük bir ekran kartı ya da iki işlemci makinesi | Gemma 4 31B ya da 120 milyar parametreli bir uzman karışımı modeli, 80 GB ekran kartlarında | İki ila dört adet 80 GB ekran kartı (H100 ya da H200 sınıfı), toplu işlemeyle |
Kurulumun tamamı
İşlemci sayıları fiziksel çekirdek ya da sanal işlemci sayısıdır. Diskler hızlı katı hal sürücüleridir (SSD). Model isteğe bağlıdır: model olmadan da diğer bileşenler sıradan makinelerde çalışır ve ekran kartı gerekmez.
| Bileşen | Pilot, en çok 300 kişi | 1.000 kişi | 5.000 kişi |
|---|---|---|---|
| Web uygulaması | 1 × 4 işlemci, 8 GB | 2 × 8 işlemci, 16 GB, yük dengeleyicinin arkasında | 4 × 8 işlemci, 16 GB |
| Arka plan işleri | Web makinesiyle ortak | 1 × 4 işlemci, 8 GB | 2 × 8 işlemci, 16 GB |
| Veritabanı | 4 işlemci, 16 GB, 200 GB | 8 işlemci, 32 GB, 500 GB ve onu izleyen bir kopya | 16 işlemci, 64 GB, 1–2 TB ve bir kopya |
| Yedekler ve dosyalar | 500 GB | 2 TB | 5–10 TB |
| Güvenli giriş | Web makinesinde | İki küçük makine (2 işlemci, 4 GB) | İki küçük makine |
| İzleme ve günlükler | 2 işlemci, 4 GB | 4 işlemci, 8 GB, 200 GB | 8 işlemci, 16 GB, 500 GB |
| Model makinesi | Bir makine: bir adet 24–48 GB ekran kartı, 8–16 çekirdek, 64 GB bellek, 1 TB disk | İki makine: her birinde bir adet 48 GB ekran kartı, 16 çekirdek, 128 GB bellek, 2 TB disk | İki ila dört makine: 80 GB ekran kartları, 32 çekirdek, 256 GB bellek |
İpucu
Yalnızca küçük modeller çalışıyorsa ve bunları yalnızca yöneticiler kullanıyorsa ekran kartı gerekmez. 16 çekirdekli ve 64 GB bellekli tek bir makine; modeli kullanan en çok yaklaşık 300 kişi için Jan-v1-4B, Gemma 4 E4B, EmbeddingGemma ve Prompt Guard modellerini çalıştırır.
Her modelin belleği
Bu sayılar yalnızca ağırlıkları kapsar. Aynı anda birden fazla kişiye hizmet verebilmek için yüzde 30–50 ekleyin. Kabaca kural şudur: 4 bitte parametre × 0,55 GB, 8 bitte parametre × 1,05 GB. Makinenin kendi belleği, ekran kartı belleğinin en az iki katı olmalıdır.
| Model | Görevi | 4 bit | 8 bit | Yalnızca işlemciyle? |
|---|---|---|---|---|
| Prompt Guard 2 (86 milyon) | Enjeksiyon denetimi | 1 GB altı | 1 GB altı | Evet, hızlıdır |
| EmbeddingGemma (308 milyon) | Arama | 1 GB altı | yaklaşık 1 GB | Evet |
| Jan-v1-4B | Araç seçimi | yaklaşık 3 GB | yaklaşık 5 GB | Evet (tek istekte saniyede yaklaşık 10–20 token) |
| Gemma 4 E4B | Sınıflandırma ve denetim | yaklaşık 4–5 GB | yaklaşık 8 GB | Evet |
| Gemma 4 26B-A4B | Standart büyük model | yaklaşık 16 GB | yaklaşık 28 GB | Hayır |
| Qwen3.5-35B-A3B | Yedek büyük model | yaklaşık 21 GB | yaklaşık 37 GB | Hayır |
| Gemma 4 31B | Daha büyük kurum içi planlayıcı | yaklaşık 19 GB | yaklaşık 33 GB | Hayır |
| Jan-v1-4B | 5 GB |
|---|---|
| Gemma 4 E4B | 8 GB |
| Gemma 4 26B-A4B | 28 GB |
| Gemma 4 31B | 33 GB |
| Qwen3.5-35B-A3B | 37 GB |
Hangi ekran kartı
| Kart | Bellek | Güç | Neyi kaldırır | Uygun olduğu kullanım | Not |
|---|---|---|---|---|---|
| NVIDIA L4 | 24 GB | 72 W | Küçük modeller ve 4 bit Gemma 4 26B-A4B | Pilot, düşük güç tüketimi, her 1U sunucu | Aynı anda çok kişi soru sorduğunda yavaşlar |
| RTX 5090 / 4090 | 32 GB / 24 GB | 450–575 W | L4 ile aynı, daha hızlı | Geliştirici makinesi ya da kurum içi tanıtım | GeForce sürücü lisansı veri merkezinde kullanıma izin vermez; kurumun üretim sunucuları için uygun değildir |
| L40S | 48 GB | 350 W | 8 bit 26B-A4B, küçük modeller ve aynı anda birkaç kişiye yetecek pay | 1.000 kişi | Yaygın tercih |
| RTX PRO 6000 (Blackwell) | 96 GB | 300–600 W | Pay bırakarak 8 bit 31B model ya da iki model | Büyük model ve daha büyük planlayıcı için tek kart | İş istasyonu ve sunucu sürümleri var |
| H100 / H200 | 80 GB / 141 GB | 700 W | Yukarıdaki modeller, aynı anda çok sayıda kişiyle | 5.000 ve üzeri kişi | Yalnızca yük gerektirdiğinde |
Dikkat
GeForce sürücü lisansı veri merkezinde kullanıma izin vermez. Kurumun üretim sunucuları için RTX 5090 ya da 4090 kartları planlamayın.
İşi küçük tutmak
- Önce kayıtlardan yanıt verin. “Bu haftaki saatlerim” bir sorgudur, model çağrısı gerektirmez. Hedef, soruların dörtte birinden azının büyük modele gitmesidir.
- Yalnızca soruya uyan araçları sunun. Yönlendirici 40 tanımın tamamını göndermek yerine 5–8 araç seçer; bu da girdiyi yaklaşık yüzde 60 azaltır.
- İstemin başlangıcını sabit tutun. Yönergeler ve araçlar başta yer alır ve gün içinde değişmez; böylece tekrarlanan başlangıç yeniden kullanılabilir.
- Uzun bir konuşmanın tüm geçmişini yeniden göndermek yerine özetleyin.
- Özetleri gece hazırlayın; sabah 8:00’de hazır olsunlar.
- Her kurumun ve her kişinin bir sınırı vardır. Sınıra ulaşıldığında asistan standart modele geçer ve bunu belirtir. Nedenini söylemeden durmaz.
- Daha büyük model; proje planları ve işi kimin yapması gerektiğine dair açıklamalar için kullanılır.
- Kurumun kendi makinelerinde: uzman karışımı modeller, 4 bit ya da 8 bit ağırlıklar ve küçük modellerin tümü için ortak bir ekran kartı.
Sık sorulan sorular
Hayır. Model kurumun kendi makinelerinde çalışır. Çıkarım sunucusunun dışarıya yolu yoktur ve API anahtarı istemez.
Her zaman değil. Model isteğe bağlıdır; kurulumun geri kalanı sıradan makinelerde çalışır. Yalnızca küçük modeller çalışıyor ve bunları yalnızca yöneticiler kullanıyorsa, modeli kullanan en çok yaklaşık 300 kişi için 16 çekirdekli ve 64 GB bellekli tek bir makine yeterlidir.
Hayır. Model boyutlarından ve token hızlarından çıkarılmış tahminlerdir.
Hayır. GeForce sürücü lisansı veri merkezinde kullanıma izin vermez. Bu kartlar geliştirici makinesi ya da kurum içi tanıtım için uygundur.
Asistan standart modele geçer ve bunu belirtir. Nedenini söylemeden durmaz.
İlgili sayfalar
Kurumun kendi makinelerinde çalışan modeller
Yönetici, küçük yardımcı modelleri kurumun kendi makinesinde çalıştırabilir. Kişiler yalnızca öneri görür; kayıtlar kendiliğinden değişmez.
Yardım neyi görür
Model çağrısı yalnızca sorunun gerektirdiği alanları alır. Kimse, kendisinin açamadığı bir kaydı yardım aracılığıyla göremez.