sunucu.com.tr
Yapay Zeka

llama.cpp v0.6.0 yayında: yeni batch API, GLM-5.3-Flash desteği ve GPU sunucuda llama-server'ı güncelleme

llama.cpp v0.6.0 yeni bir batch API'si, GLM-5.3-Flash desteği, CUDA iyileştirmeleri ve yeni llama-server uç noktalarıyla geldi. Son sürümlerdeki geriye uyumsuz değişiklikleri ve GPU sunucuda güvenli yükseltme adımlarını özetledik.

sunucu.com.tr Ekibi4 dk okuma

llama.cpp, numaralı sürüm düzenine geçtikten sonra yayımladığı v0.6.0 ile hem kütüphane API'sine hem de llama-server'a önemli eklemeler yaptı. Modeli kendi donanımında çalıştıran geliştiriciler ve sistem yöneticileri için asıl mesele yalnızca yeni özellikler değil. Son birkaç sürümde biriken geriye uyumsuz değişiklikler de dikkatsiz bir yükseltmede servisi durdurabilir.

Ne değişti

v0.6.0'ın öne çıkanları

  • Genişletilmiş batch API'si: llama_batch_ext adlı yeni yapı, aynı batch içinde token ve embedding girdilerini birlikte kabul ediyor. Kütüphaneyi doğrudan kullanan ve çok kipli (multimodal) girdi hazırlayan uygulamalar için bu, daha esnek bir giriş noktası demek.
  • Yeni model desteği: MoE mimarili, metin ve görüntü işleyebilen 320B'lik GLM-5.3-Flash artık destekleniyor. Bunun yanında Clef ve Nimble karar modelleri de eklendi.
  • llama-server uç noktaları: Karar modelleri için /v1/systemone uç noktası geldi. /v1/embeddings ise artık görüntü, ses ve video içeriğini de kabul ediyor.
  • CUDA iyileştirmeleri: NVFP4 ve MXFP4 için W4A4 çarpım yolu, MMVQ tarafında paylaşımlı uzman (shared-expert) birleştirmesi ve flash attention için daha iyi zamanlama.
  • Speküler kod çözme: Qwen4Exp için MTP desteği eklendi. Sürüm notlarına göre DGX Spark üzerinde kod çözme yaklaşık 1,5 kat hızlanıyor.
  • Oturum biçimi: LLAMA_SESSION_VERSION 11'e, LLAMA_STATE_SEQ_VERSION 4'e çıktı. ggml de v0.26.0'a güncellendi.

Arada kalan iki sürüm

Doğrudan eski bir sürümden v0.6.0'a atlayanlar arada gelen değişiklikleri de üstlenmiş olur:

  • v0.4.1: Kullanımdan kaldırılmış olan --mmap, --mlock ve --direct-io parametreleri tamamen silindi. Yerlerine tek bir --load-mode parametresi geldi. Bu değişiklik geriye uyumlu değil, yani eski parametrelerle başlatılan bir servis yeni sürümde açılmayabilir.
  • v0.5.0: llama-server'ın --host parametresi virgülle ayrılmış birden fazla TCP adresini ve UNIX soketlerini kabul ediyor. Ayrıca birleşik QKV kullanan modellerde tensor-parallel bölme ile ilgili hatalar düzeltildi. Bu, çoklu GPU kurulumlarındaki doğruluk sorunlarını gideriyor.

Ne anlama geliyor

Servis dosyalarınızı kontrol etmeden yükseltmeyin. En olası kırılma noktası --load-mode geçişi. systemd birimi, Docker Compose dosyası ya da başlangıç betiğinde eski bellek eşleme parametreleri kaldıysa servis yeni ikili dosyayla başlamayabilir. Hangi değerin eski davranışınıza karşılık geldiğini resmi sürüm notlarından doğrulayın.

Kayıtlı oturumlar geçersiz kalabilir. Oturum ve durum biçimi sürümleri değiştiği için daha önce diske yazdığınız prompt önbelleği ya da oturum dosyalarının yeni sürümde yüklenmemesini beklemek gerekir. Bu dosyalara dayanan bir iş akışınız varsa yükseltmeden sonra bunları yeniden üretmeyi planlayın.

Çoklu GPU kullananlar için v0.5.0 önemli. Tensor-parallel bölme kullanıyorsanız ve çıktılarda tutarsızlık gördüyseniz, bu düzeltmeler doğrudan sizi ilgilendiriyor. Yükseltme sonrası aynı istemlerle karşılaştırmalı bir test yapmak iyi olur.

Türkiye'deki ekipler açısından. llama.cpp'nin asıl avantajı, veriyi dışarıya göndermeden modeli kendi altyapınızda çalıştırabilmeniz. Müşteri yazışmaları, sözleşmeler ya da iç belgeler üzerinde çalışan ekipler için bu, KVKK kapsamında veri işleme ve yurt dışına aktarım sorularını sadeleştirir. Embedding uç noktasının görüntü, ses ve video kabul etmesi de, örneğin taranmış belgeler ya da ses kayıtları üzerinde arama yapmak isteyen ekiplerin bu işi kurum içinde tutmasını kolaylaştırabilir. Türkçe kalitesi modele göre değişir. Yeni bir modeli üretime almadan önce kendi Türkçe örneklerinizle ölçün.

Karar modelleri (Clef gibi) ajan iş akışlarında yönlendirme için kullanılıyor. Bu modellerin klasik LLM'den farkını Cloudflare Clef yazımızda ayrıntılı ele aldık.

Nasıl denenir

  1. Önce yedek alın. Model dosyalarını, servis yapılandırmasını ve varsa oturum dosyalarını ayrı bir yere kopyalayın. Büyük GGUF dosyalarını yeniden indirmek zaman alır. Planlı bir yedekleme düzeni bu adımı rutin hale getirir.
  2. Kaldırılan parametreleri arayın. Başlangıç yapılandırmanızda eski parametreler kalmış mı, kontrol edin:
bash
# Örnek yol; kendi servis dosyanızın konumuna göre değiştirin
grep -nE -- '--(mmap|mlock|direct-io)' /etc/systemd/system/llama-server.service
  1. Yeni sürümü ayrı bir dizinde derleyin ya da indirin. Çalışan sürümün üzerine yazmak yerine yan yana tutarsanız geri dönüş tek bir yol değişikliğinden ibaret olur.
  2. Test portunda başlatın. Yeni ikiliyi farklı bir portta, yalnızca localhost üzerinde açın. Aynı istemleri iki sürüme gönderip yanıtları ve hızı karşılaştırın.
  3. Dışarıya güvenli açın. Birden fazla adrese bağlanma özelliği, servisi yerel arayüzde tutup önüne bir ters vekil koymayı kolaylaştırıyor. Kimlik doğrulama ve TLS mantığı için Ollama API'sini güvenli açma rehberimiz llama-server için de büyük ölçüde geçerli.

GPU belleği için genel ilke

Gereken bellek; parametre sayısı, kullanılan nicemleme (quantization) biçimi ve bağlam uzunluğuna bağlı KV önbelleğiyle birlikte belirlenir. 320B'lik bir MoE modelde her token için yalnızca bazı uzmanlar çalışsa da tüm ağırlıkların bir yerde, GPU belleğinde ya da kısmen sistem belleğinde, tutulması gerekir. Bu yüzden büyük modeller genellikle çoklu GPU ya da GPU ile CPU arasında katman paylaştırma ister. NVFP4 ve MXFP4 gibi 4 bitlik biçimlerdeki CUDA iyileştirmeleri tam da bu tür ağır yükler için anlam taşıyor. Donanımı modele göre seçmek istiyorsanız GPU sunucu seçeneklerini inceleyebilirsiniz.

Sık sorulan sorular

Eski sürümden v0.6.0'a doğrudan geçebilir miyim?

Geçebilirsiniz, ancak v0.4.1'deki --load-mode değişikliğini ve v0.6.0'daki oturum biçimi güncellemesini hesaba katın. Yapılandırmayı güncellemeden geçerseniz servis açılmayabilir.

Eski kayıtlı oturum dosyalarım çalışır mı?

Oturum ve durum biçimi sürümleri yükseltildiği için uyumlu olmamaları muhtemel. Gerekiyorsa yeni sürümle yeniden oluşturun.

Yeni CUDA iyileştirmelerinden her model yararlanır mı?

Hayır. W4A4 yolu NVFP4 ve MXFP4 biçimlerine, paylaşımlı uzman birleştirmesi ise bu yapıyı kullanan MoE modellere yönelik. Kazancı kendi modeliniz ve donanımınızla ölçmek en sağlıklısı.

Kaynaklar

  • #llama.cpp
  • #llama-server
  • #açık ağırlıklı model
  • #gpu sunucu
  • #kendi sunucunda llm
  • #cuda
  • #yapay zeka gündemi

İlgili yazılar

Yapay Zeka yazıları