sunucu.com.tr

LLM VRAM hesaplayıcı: Model hangi GPU'ya sığar?

Model boyutunu, nicelemeyi, bağlam uzunluğunu ve eşzamanlı kullanıcı sayısını girin; yaklaşık GPU belleği ihtiyacını ve size uygun sunucuyu görün. Hesap tarayıcınızda yapılır, hiçbir veri gönderilmez.

Karma uzman (MoE) modellerde toplam parametre sayısını girin.

0,5 ile 2.000 arası

Düşük bit daha az bellek ister; 4 bitte kalite kaybı genellikle küçüktür.

Bir konuşmada modelin aynı anda gördüğü en fazla token.

Aynı anda yanıt bekleyen istek sayısı (toplam çalışan sayısı değil).

Çoğu çalıştırıcı 16 bit kullanır; 8 bit KV belleği yarıya indirir.

Yaklaşık bellek ihtiyacı

11,8 GB

Çubuk ölçeği: önerilen 16 GB RAM

Model ağırlıkları
4,5 GB
KV önbelleği
5,4 GB
Çalışma payı
2 GB

Varsayım: 40 katman, 8 KV başlığı × 128 boyut; token başına KV 0,164 MB. Tüm kullanıcıların bağlamı aynı anda dolu kabul edilir, yani üst sınırdır.

Öneri: bulut sunucuda CPU ile

8 vCPU · 16 GB RAM · 50 GB SSD

Bu boyuttaki bir model ve az kullanıcı için GPU şart değil; model belleğe sığar ve işlemciyle çalışır. Yanıtlar GPU'ya göre yavaştır, deneme, iç araçlar ve otomasyon için uygundur. Veriniz Türkiye lokasyonunu seçerseniz İstanbul'da kalır.

Hız ya da kullanıcı sayısı artarsa: Tek H200 NVL (141 GB GPU belleği) yeter.

Bu hesabın bağlantısını paylaşın

VRAM nasıl hesaplanır?

Bir dil modelinin GPU belleği üç parçadan oluşur: model ağırlıkları, konuşmaların KV önbelleği ve çalışma payı. Hesaplayıcı şu formülü kullanır:

ağırlık (GB) = parametre (milyar) × bit ÷ 8

KV (bayt) = 2 × katman × KV başlığı × başlık boyutu

× KV baytı × bağlam × kullanıcı

pay = (ağırlık + KV) × %20, en az 1 GB

toplam = ağırlık + KV + pay

Ağırlık: 16 bitte parametre başına 2 bayt, 8 bitte 1 bayt. 4 bit nicelemede ölçek verileriyle birlikte ortalama 4,5 bit (yaklaşık 0,56 bayt) alınır.

KV önbelleği: modelin mimarisi bilinmediği için güncel modellerde yaygın gruplu dikkat varsayılır: 8 KV başlığı × 128 boyut. Katman sayısı parametreden tahmin edilir (yaklaşık 20 × parametre^⅓; 70 milyarda 82 katman). KV 16 bitte 2, 8 bitte 1 bayttır.

Pay: aktivasyonlar, çalışma ortamı ve bellek parçalanması için.

Örnek: 70 milyar parametre, 8 bit, 8.192 token, 10 kullanıcı → ağırlık 70 GB + KV 27,5 GB + pay 19,5 GB = 117 GB, Tek H200 NVL (141 GB) yeter.

Model boyutuna göre yaklaşık bellek

8.192 token bağlam ve tek kullanıcı için toplam (ağırlık + KV + pay). Kullanıcı ve bağlam arttıkça KV önbelleği büyür; kendi değerleriniz için yukarıdaki aracı kullanın.

Model boyutuÖrnek modeller16 bit8 bit4 bit
3 milyar parametreLlama 3.2 3B, Qwen3 4B, Phi-4 mini8,4 GB5 GB3,7 GB
8 milyar parametreLlama 3.1 8B, Qwen3 8B, Mistral 7B20,8 GB11,2 GB7 GB
14 milyar parametreQwen3 14B, Phi-4 14B, Gemma 3 12B35,5 GB18,7 GB11,4 GB
32 milyar parametreQwen3 32B, Gemma 3 27B, Mistral Small 24B79,3 GB40,9 GB24,1 GB
70 milyar parametreLlama 3.3 70B, Qwen2.5 72B, DeepSeek R1 Distill 70B171,3 GB87,3 GB50,6 GB
120 milyar parametregpt-oss 120B, Mistral Large 123B292 GB148 GB85 GB

Ayrıntılı anlatım için rehberimiz: LLM VRAM hesaplama: model ağırlığı, KV önbelleği ve GPU sunucu seçimi. Hangi işe hangi sunucunun uyduğunu yapay zeka sunucusu sayfasında karşılaştırdık.

Sık sorulan sorular

70 milyar parametreli model kaç GB VRAM ister?

Yalnız ağırlıklar 16 bitte 140 GB, 8 bitte 70 GB, 4 bitte yaklaşık 39,4 GB yer kaplar. Buna KV önbelleği ve çalışma payı eklenir: 8 bit, 8.192 token bağlam ve 10 eşzamanlı kullanıcıyla toplam tahmin 117 GB.

KV önbelleği nedir, neden bu kadar yer kaplar?

Model her token için katman başına bir anahtar ve bir değer vektörü saklar; bu sayede konuşmanın başını her seferinde yeniden hesaplamaz. Boyutu bağlam uzunluğu ve eşzamanlı kullanıcı sayısıyla doğrusal büyür; uzun bağlamda ağırlıklardan bile büyük olabilir.

Niceleme (quantization) kaliteyi düşürür mü?

8 bitte kalite farkı genellikle fark edilmez. 4 bitte küçük bir kayıp olur, çoğu sohbet ve özetleme işinde kabul edilebilir düzeydedir. Kod ve matematik gibi hassas işlerde 8 bit ya da 16 bit tercih edilir.

GPU olmadan dil modeli çalışır mı?

Çalışır. Yaklaşık 14 milyar parametreye kadar modeller 4 bitle yüksek RAM'li bir bulut sunucuda işlemciyle çalışır; yanıtlar GPU'ya göre yavaştır. Hesaplayıcı en fazla 4 eşzamanlı kullanıcıya kadar bu seçeneği önerir.

Hesap neden üst sınır veriyor?

Tüm kullanıcıların bağlamının aynı anda tamamen dolu olduğu varsayılır. Gerçekte konuşmalar farklı uzunluktadır ve modern çalıştırıcılar belleği sayfa sayfa ayırır; ihtiyaç çoğu zaman daha düşüktür. Boyutlandırmada bu pay sizi güvende tutar.

Model birden çok GPU'ya bölünebilir mi?

Evet. Çalıştırıcılar modeli katmanlara ya da tensörlere bölerek birden çok karta dağıtabilir; toplam bellek karşılaştırması bu yüzden geçerlidir. Kartlar arası iletişim nedeniyle hız doğrusal artmaz.

Karma uzman (MoE) modellerde hangi sayıyı girmeliyim?

Toplam parametre sayısını girin. Her token için parametrelerin yalnız bir kısmı çalışsa da tüm uzmanların ağırlıkları bellekte durmalıdır.

Sonuç hangi sunucuyu önerir?

Küçük model ve az kullanıcıda bulut sunucu (CPU), aksi halde toplam belleği yeten en küçük GPU sunucu yapılandırması önerilir. GPU sunucular Frankfurt, Almanya lokasyonundadır. Tek sunucuya sığmayan durumlarda çoklu sunucu için bize ulaşabilirsiniz.

Sonuçtan emin değil misiniz?

Çalıştırmak istediğiniz modeli ve kullanıcı sayısını anlatın; doğru yapılandırmayı birlikte seçelim.