LLM VRAM hesaplayıcı: Model hangi GPU'ya sığar?
Model boyutunu, nicelemeyi, bağlam uzunluğunu ve eşzamanlı kullanıcı sayısını girin; yaklaşık GPU belleği ihtiyacını ve size uygun sunucuyu görün. Hesap tarayıcınızda yapılır, hiçbir veri gönderilmez.
Karma uzman (MoE) modellerde toplam parametre sayısını girin.
Düşük bit daha az bellek ister; 4 bitte kalite kaybı genellikle küçüktür.
Bir konuşmada modelin aynı anda gördüğü en fazla token.
Aynı anda yanıt bekleyen istek sayısı (toplam çalışan sayısı değil).
Çoğu çalıştırıcı 16 bit kullanır; 8 bit KV belleği yarıya indirir.
Yaklaşık bellek ihtiyacı
11,8 GB
Çubuk ölçeği: önerilen 16 GB RAM
- Model ağırlıkları
- 4,5 GB
- KV önbelleği
- 5,4 GB
- Çalışma payı
- 2 GB
Varsayım: 40 katman, 8 KV başlığı × 128 boyut; token başına KV 0,164 MB. Tüm kullanıcıların bağlamı aynı anda dolu kabul edilir, yani üst sınırdır.
Öneri: bulut sunucuda CPU ile
8 vCPU · 16 GB RAM · 50 GB SSD
Bu boyuttaki bir model ve az kullanıcı için GPU şart değil; model belleğe sığar ve işlemciyle çalışır. Yanıtlar GPU'ya göre yavaştır, deneme, iç araçlar ve otomasyon için uygundur. Veriniz Türkiye lokasyonunu seçerseniz İstanbul'da kalır.
Hız ya da kullanıcı sayısı artarsa: Tek H200 NVL (141 GB GPU belleği) yeter.
VRAM nasıl hesaplanır?
Bir dil modelinin GPU belleği üç parçadan oluşur: model ağırlıkları, konuşmaların KV önbelleği ve çalışma payı. Hesaplayıcı şu formülü kullanır:
ağırlık (GB) = parametre (milyar) × bit ÷ 8
KV (bayt) = 2 × katman × KV başlığı × başlık boyutu
× KV baytı × bağlam × kullanıcı
pay = (ağırlık + KV) × %20, en az 1 GB
toplam = ağırlık + KV + pay
Ağırlık: 16 bitte parametre başına 2 bayt, 8 bitte 1 bayt. 4 bit nicelemede ölçek verileriyle birlikte ortalama 4,5 bit (yaklaşık 0,56 bayt) alınır.
KV önbelleği: modelin mimarisi bilinmediği için güncel modellerde yaygın gruplu dikkat varsayılır: 8 KV başlığı × 128 boyut. Katman sayısı parametreden tahmin edilir (yaklaşık 20 × parametre^⅓; 70 milyarda 82 katman). KV 16 bitte 2, 8 bitte 1 bayttır.
Pay: aktivasyonlar, çalışma ortamı ve bellek parçalanması için.
Örnek: 70 milyar parametre, 8 bit, 8.192 token, 10 kullanıcı → ağırlık 70 GB + KV 27,5 GB + pay 19,5 GB = 117 GB, Tek H200 NVL (141 GB) yeter.
Model boyutuna göre yaklaşık bellek
8.192 token bağlam ve tek kullanıcı için toplam (ağırlık + KV + pay). Kullanıcı ve bağlam arttıkça KV önbelleği büyür; kendi değerleriniz için yukarıdaki aracı kullanın.
| Model boyutu | Örnek modeller | 16 bit | 8 bit | 4 bit |
|---|---|---|---|---|
| 3 milyar parametre | Llama 3.2 3B, Qwen3 4B, Phi-4 mini | 8,4 GB | 5 GB | 3,7 GB |
| 8 milyar parametre | Llama 3.1 8B, Qwen3 8B, Mistral 7B | 20,8 GB | 11,2 GB | 7 GB |
| 14 milyar parametre | Qwen3 14B, Phi-4 14B, Gemma 3 12B | 35,5 GB | 18,7 GB | 11,4 GB |
| 32 milyar parametre | Qwen3 32B, Gemma 3 27B, Mistral Small 24B | 79,3 GB | 40,9 GB | 24,1 GB |
| 70 milyar parametre | Llama 3.3 70B, Qwen2.5 72B, DeepSeek R1 Distill 70B | 171,3 GB | 87,3 GB | 50,6 GB |
| 120 milyar parametre | gpt-oss 120B, Mistral Large 123B | 292 GB | 148 GB | 85 GB |
Ayrıntılı anlatım için rehberimiz: LLM VRAM hesaplama: model ağırlığı, KV önbelleği ve GPU sunucu seçimi. Hangi işe hangi sunucunun uyduğunu yapay zeka sunucusu sayfasında karşılaştırdık.
Blog
İlgili rehberler
- Yapay ZekaLLM VRAM hesaplama: model ağırlığı, KV cache ve eşzamanlı kullanıcıya göre GPU sunucu seçimi
- Yapay ZekaQwen-Image-2.1 yayında: 7B görsel üretim modelini kendi GPU sunucunuzda çalıştırma ve lisans uyarısı
- Yapay ZekaEmbeddingGemma 2 yayında: çok modlu embedding modelini kendi sunucunuzda RAG ve kurum içi arama için çalıştırma
Sık sorulan sorular
70 milyar parametreli model kaç GB VRAM ister?
Yalnız ağırlıklar 16 bitte 140 GB, 8 bitte 70 GB, 4 bitte yaklaşık 39,4 GB yer kaplar. Buna KV önbelleği ve çalışma payı eklenir: 8 bit, 8.192 token bağlam ve 10 eşzamanlı kullanıcıyla toplam tahmin 117 GB.
KV önbelleği nedir, neden bu kadar yer kaplar?
Model her token için katman başına bir anahtar ve bir değer vektörü saklar; bu sayede konuşmanın başını her seferinde yeniden hesaplamaz. Boyutu bağlam uzunluğu ve eşzamanlı kullanıcı sayısıyla doğrusal büyür; uzun bağlamda ağırlıklardan bile büyük olabilir.
Niceleme (quantization) kaliteyi düşürür mü?
8 bitte kalite farkı genellikle fark edilmez. 4 bitte küçük bir kayıp olur, çoğu sohbet ve özetleme işinde kabul edilebilir düzeydedir. Kod ve matematik gibi hassas işlerde 8 bit ya da 16 bit tercih edilir.
GPU olmadan dil modeli çalışır mı?
Çalışır. Yaklaşık 14 milyar parametreye kadar modeller 4 bitle yüksek RAM'li bir bulut sunucuda işlemciyle çalışır; yanıtlar GPU'ya göre yavaştır. Hesaplayıcı en fazla 4 eşzamanlı kullanıcıya kadar bu seçeneği önerir.
Hesap neden üst sınır veriyor?
Tüm kullanıcıların bağlamının aynı anda tamamen dolu olduğu varsayılır. Gerçekte konuşmalar farklı uzunluktadır ve modern çalıştırıcılar belleği sayfa sayfa ayırır; ihtiyaç çoğu zaman daha düşüktür. Boyutlandırmada bu pay sizi güvende tutar.
Model birden çok GPU'ya bölünebilir mi?
Evet. Çalıştırıcılar modeli katmanlara ya da tensörlere bölerek birden çok karta dağıtabilir; toplam bellek karşılaştırması bu yüzden geçerlidir. Kartlar arası iletişim nedeniyle hız doğrusal artmaz.
Karma uzman (MoE) modellerde hangi sayıyı girmeliyim?
Toplam parametre sayısını girin. Her token için parametrelerin yalnız bir kısmı çalışsa da tüm uzmanların ağırlıkları bellekte durmalıdır.
Sonuç hangi sunucuyu önerir?
Küçük model ve az kullanıcıda bulut sunucu (CPU), aksi halde toplam belleği yeten en küçük GPU sunucu yapılandırması önerilir. GPU sunucular Frankfurt, Almanya lokasyonundadır. Tek sunucuya sığmayan durumlarda çoklu sunucu için bize ulaşabilirsiniz.
Sonuçtan emin değil misiniz?
Çalıştırmak istediğiniz modeli ve kullanıcı sayısını anlatın; doğru yapılandırmayı birlikte seçelim.

