Yapay zekâ

Modeli kurumda çalıştırmak

Bu sayfayı yapay zekâya sorun

Planlanıyor

Bu alan planlama aşamasında. Hazırlık yapabilmeniz için burada anlatılıyor; mevcut sürümde henüz yer almıyor.

Nedir

Model, kurumun kendi makinelerinde çalışır. Sorular kurum dışındaki bir modele gönderilmez. Çıkarım sunucusunun dışarıya giden bir yolu yoktur ve API anahtarı istemez.

Kurum içindeki veri yolu

Çıkarım sunucusunun dışarıya yolu olmadığı için hiçbir soru kurum dışındaki bir modele ulaşmaz.

Kurulum profilleri

Kurulum iki profil sunar.

ProfilAyrılan bellekAyrılan işlemci ve kart
Ekran kartlı profil32 GiBBir NVIDIA ekran kartı
İşlemcili profil16 GiB4 işlemci

Not

Bu sayılar kurulumun ayırdığı kaynakları gösterir. Sunucunun kaç kişiye hizmet verebileceğine dair bir taahhüt değildir.

Kurulumu planlama

Yükü tahmin edin

Kaç kişi bölümünün başındaki yük tahminini okuyun. Bu tahmin model boyutlarından ve token hızlarından çıkarılmıştır; ölçülmüş bir test sonucu değildir.

Boyutu seçin

Kaç kişi tablosunda kişi sayınıza uyan satırı seçin: en çok yaklaşık 300 kişilik pilot, 1.000 kişi ya da 5.000 kişi.

Kurulumun tamamını boyutlandırın

Web uygulaması, arka plan işleri, veritabanı, yedekler, güvenli giriş, izleme ve model makinesi için Kurulumun tamamı tablosunu kullanın.

Model belleğini kontrol edip kartı seçin

Çalıştırmayı planladığınız modeller için Her modelin belleği ve Hangi ekran kartı tablolarından donanımı belirleyin.

İşi küçük tutun

Büyük modele daha az soru gitmesi için İşi küçük tutmak bölümündeki önlemleri uygulayın.

Kaç kişi

Aşağıdaki tablolar model boyutlarından ve token hızlarından çıkarılmış tahminlerdir; ölçülmüş bir test sonucu değildir. Aynı kullanımda 1.000 kişi, büyük modelde ayda yaklaşık 560 milyon giriş ve 50 milyon çıkış token’ı üretir. İş saatlerine yayıldığında bu, ortalama saniyede kabaca 1.000 giriş ve 80 çıkış token’ı eder; yoğun saatlerde ise bunun yaklaşık beş katına çıkar. Yaklaşık 4 milyar etkin parametreli bir uzman karışımı modeli bu yükü tek bir veri merkezi ekran kartıyla karşılar.

BoyutKüçük modeller (yönlendirici, denetim, gömme)Büyük modelSunucu
Pilot, en çok yaklaşık 300 kişiİşlemci: 16 çekirdek, 64 GB bellek (Jan-v1-4B 4 bit yaklaşık 3 GB, Gemma 4 E4B yaklaşık 4 GB)Gemma 4 26B-A4B, tek bir 24–48 GB ekran kartında, 4 bit ya da 8 bitBir ekran kartı makinesi (örneğin L40S ya da RTX 6000 sınıfı) ve uygulama sunucuları
1.000 kişiBüyük modelle aynı ekran kartı (küçük modeller yaklaşık 8 GB ekler)Gemma 4 26B-A4B ya da Qwen3.5-35B-A3B, 48 GB ekran kartıYedeklilik için iki ekran kartı makinesi (yük için biri yeter)
5.000 kişiAyrı küçük bir ekran kartı ya da iki işlemci makinesiGemma 4 31B ya da 120 milyar parametreli bir uzman karışımı modeli, 80 GB ekran kartlarındaİki ila dört adet 80 GB ekran kartı (H100 ya da H200 sınıfı), toplu işlemeyle

Kurulumun tamamı

İşlemci sayıları fiziksel çekirdek ya da sanal işlemci sayısıdır. Diskler hızlı katı hal sürücüleridir (SSD). Model isteğe bağlıdır: model olmadan da diğer bileşenler sıradan makinelerde çalışır ve ekran kartı gerekmez.

BileşenPilot, en çok 300 kişi1.000 kişi5.000 kişi
Web uygulaması1 × 4 işlemci, 8 GB2 × 8 işlemci, 16 GB, yük dengeleyicinin arkasında4 × 8 işlemci, 16 GB
Arka plan işleriWeb makinesiyle ortak1 × 4 işlemci, 8 GB2 × 8 işlemci, 16 GB
Veritabanı4 işlemci, 16 GB, 200 GB8 işlemci, 32 GB, 500 GB ve onu izleyen bir kopya16 işlemci, 64 GB, 1–2 TB ve bir kopya
Yedekler ve dosyalar500 GB2 TB5–10 TB
Güvenli girişWeb makinesindeİki küçük makine (2 işlemci, 4 GB)İki küçük makine
İzleme ve günlükler2 işlemci, 4 GB4 işlemci, 8 GB, 200 GB8 işlemci, 16 GB, 500 GB
Model makinesiBir makine: bir adet 24–48 GB ekran kartı, 8–16 çekirdek, 64 GB bellek, 1 TB diskİki makine: her birinde bir adet 48 GB ekran kartı, 16 çekirdek, 128 GB bellek, 2 TB diskİki ila dört makine: 80 GB ekran kartları, 32 çekirdek, 256 GB bellek

İpucu

Yalnızca küçük modeller çalışıyorsa ve bunları yalnızca yöneticiler kullanıyorsa ekran kartı gerekmez. 16 çekirdekli ve 64 GB bellekli tek bir makine; modeli kullanan en çok yaklaşık 300 kişi için Jan-v1-4B, Gemma 4 E4B, EmbeddingGemma ve Prompt Guard modellerini çalıştırır.

Her modelin belleği

Bu sayılar yalnızca ağırlıkları kapsar. Aynı anda birden fazla kişiye hizmet verebilmek için yüzde 30–50 ekleyin. Kabaca kural şudur: 4 bitte parametre × 0,55 GB, 8 bitte parametre × 1,05 GB. Makinenin kendi belleği, ekran kartı belleğinin en az iki katı olmalıdır.

ModelGörevi4 bit8 bitYalnızca işlemciyle?
Prompt Guard 2 (86 milyon)Enjeksiyon denetimi1 GB altı1 GB altıEvet, hızlıdır
EmbeddingGemma (308 milyon)Arama1 GB altıyaklaşık 1 GBEvet
Jan-v1-4BAraç seçimiyaklaşık 3 GByaklaşık 5 GBEvet (tek istekte saniyede yaklaşık 10–20 token)
Gemma 4 E4BSınıflandırma ve denetimyaklaşık 4–5 GByaklaşık 8 GBEvet
Gemma 4 26B-A4BStandart büyük modelyaklaşık 16 GByaklaşık 28 GBHayır
Qwen3.5-35B-A3BYedek büyük modelyaklaşık 21 GByaklaşık 37 GBHayır
Gemma 4 31BDaha büyük kurum içi planlayıcıyaklaşık 19 GByaklaşık 33 GBHayır
8 bitte yaklaşık ağırlık boyutuYalnızca ağırlıklar, yukarıdaki tablodan. Aynı anda birkaç kişiye hizmet için yüzde 30–50 ekleyin.
Jan-v1-4B5 GB
Gemma 4 E4B8 GB
Gemma 4 26B-A4B28 GB
Gemma 4 31B33 GB
Qwen3.5-35B-A3B37 GB

Hangi ekran kartı

KartBellekGüçNeyi kaldırırUygun olduğu kullanımNot
NVIDIA L424 GB72 WKüçük modeller ve 4 bit Gemma 4 26B-A4BPilot, düşük güç tüketimi, her 1U sunucuAynı anda çok kişi soru sorduğunda yavaşlar
RTX 5090 / 409032 GB / 24 GB450–575 WL4 ile aynı, daha hızlıGeliştirici makinesi ya da kurum içi tanıtımGeForce sürücü lisansı veri merkezinde kullanıma izin vermez; kurumun üretim sunucuları için uygun değildir
L40S48 GB350 W8 bit 26B-A4B, küçük modeller ve aynı anda birkaç kişiye yetecek pay1.000 kişiYaygın tercih
RTX PRO 6000 (Blackwell)96 GB300–600 WPay bırakarak 8 bit 31B model ya da iki modelBüyük model ve daha büyük planlayıcı için tek kartİş istasyonu ve sunucu sürümleri var
H100 / H20080 GB / 141 GB700 WYukarıdaki modeller, aynı anda çok sayıda kişiyle5.000 ve üzeri kişiYalnızca yük gerektirdiğinde

Dikkat

GeForce sürücü lisansı veri merkezinde kullanıma izin vermez. Kurumun üretim sunucuları için RTX 5090 ya da 4090 kartları planlamayın.

İşi küçük tutmak

Bir soru nasıl işlenir
  • Önce kayıtlardan yanıt verin. “Bu haftaki saatlerim” bir sorgudur, model çağrısı gerektirmez. Hedef, soruların dörtte birinden azının büyük modele gitmesidir.
  • Yalnızca soruya uyan araçları sunun. Yönlendirici 40 tanımın tamamını göndermek yerine 5–8 araç seçer; bu da girdiyi yaklaşık yüzde 60 azaltır.
  • İstemin başlangıcını sabit tutun. Yönergeler ve araçlar başta yer alır ve gün içinde değişmez; böylece tekrarlanan başlangıç yeniden kullanılabilir.
  • Uzun bir konuşmanın tüm geçmişini yeniden göndermek yerine özetleyin.
  • Özetleri gece hazırlayın; sabah 8:00’de hazır olsunlar.
  • Her kurumun ve her kişinin bir sınırı vardır. Sınıra ulaşıldığında asistan standart modele geçer ve bunu belirtir. Nedenini söylemeden durmaz.
  • Daha büyük model; proje planları ve işi kimin yapması gerektiğine dair açıklamalar için kullanılır.
  • Kurumun kendi makinelerinde: uzman karışımı modeller, 4 bit ya da 8 bit ağırlıklar ve küçük modellerin tümü için ortak bir ekran kartı.

Sık sorulan sorular

İlgili sayfalar

Bu sayfada