Xiaomi MiMo-V2.6 açık ağırlıklı olarak yayında: Pro ve Flash modellerini kendi GPU sunucunuzda çalıştırmak için ne gerekir?
Xiaomi MiMo-V2.6 serisini açık ağırlıklı olarak yayınladı. Pro modeli için gereken en az 680 GB VRAM'i, vLLM nightly şartını, 1 milyon token bağlamın ne anlama geldiğini ve API mi kendi sunucu mu kararını Türkiye'deki ekipler açısından ele alıyoruz.
sunucu.com.tr Ekibi4 dk okuma
Xiaomi, MiMo-V2.6 serisini açık ağırlıklı olarak yayınladı. Seride üç model var: Pro, Flash ve Distill-Qwen-9B. Bu yazı, modeli API yerine kendi donanımında çalıştırmak isteyen ekipler için. Pro sürümün donanım ihtiyacı yüksek, vLLM tarafında da dikkat edilmesi gereken bir sürüm şartı var.
Ne değişti
Haberlere göre seri 22 Eylül 2026'da açık kaynak olarak yayınlandı. Xiaomi bu sürümde pekiştirmeli öğrenme aşamasını büyütmüş. Bildirilen rakamlara göre yaklaşık 750 bin yörüngeyle 30 adımlık RL eğitimi altı günden kısa sürede tamamlanmış. Eğitim maliyeti Pro için 2,62 milyon dolar, Flash için 850 bin dolar olarak açıklanmış. Haberde ayrıca 3B uzamsal akıl yürütme, çok modlu algı ve bilgisayar kullanımı yeteneklerinin yanında bir masaüstü istemcisinin de eklendiği geçiyor.
Aktarılan bir karşılaştırmaya göre MiMo-V2.6-Pro, Artificial Analysis Intelligence Index'te 46 puan almış. Aynı listede Kimi K3 44, GLM-5.3 ise 45 puanda. Bu tür genel endekslerdeki fark küçükse kendi iş yükünüzdeki sonucu belirlemez. Yine de modelin açık ağırlıklı modeller arasında ön sıralarda olduğunu gösteriyor.
Asıl teknik ayrıntı vLLM tarifinde:
- Bağlam: MiMo-V2.6-Pro-RL 1 milyon token bağlam destekliyor.
- Sayısal biçim: Ağırlıklar mxfp4 biçiminde saklanıyor. Hesaplama ise 128x128 blok tabanlı FP8 (e4m3) ile yapılıyor.
- Spekülatif kod çözme: Modelin içinde 5 katmanlı, DFlash tarzı bir MTP taslak modeli var. Bu taslak model her geçişte 7 token öngörüyor.
- Donanım: 8 adet H200 (TP8), 4 adet MI355X (TP4) ya da toplamda en az 680 GB VRAM sağlayan eşdeğer bir yapı gerekiyor.
- Yazılım: 0.29.0 ve öncesindeki kararlı vLLM sürümleri bu ağırlıkları doğru yükleyemiyor. Tarif, 20 Eylül 2026'dan sonra derlenmiş bir nightly sürüm istiyor.
Ne anlama geliyor
Pro modeli tek kartlı bir iş istasyonuna sığmaz. Çok GPU'lu, kartları arasında hızlı bağlantı olan bir sunucu sınıfına ait. 680 GB, tarifte verilen alt sınır. Uzun bağlamla ve çok sayıda eş zamanlı istekle çalışacaksanız KV önbellek için ek bellek pay etmeniz gerekir. 1 milyon token bağlamı tam kullanmak bellek tüketimini ciddi biçimde artırır. Bu yüzden canlı ortamda bağlam sınırını iş ihtiyacınıza göre düşük tutmak daha gerçekçi olur.
Türkiye'deki ekipler açısından birkaç nokta öne çıkıyor:
- KVKK ve veri gizliliği: Müşteri yazışmalarını, sözleşmeleri ya da kaynak kodu yurt dışındaki bir API'ye göndermek istemeyen kurumlar için açık ağırlık önemli bir seçenek. Model kendi sunucunuzda çalıştığında verinin nerede işlendiğini siz belirlersiniz.
- Maliyet: 8 adet H200 sınıfı donanım ancak sürekli ve yoğun kullanımda mantıklı olur. Arada sırada yapılan denemeler için saatlik ya da aylık kiralık GPU sunucu satın almaktan daha esnek bir yol.
- Gecikme: Kullanıcılarınız Türkiye'deyse yurt içindeki bir sunucuda yapılan inference, ağ gecikmesini düşürür. Bu fark özellikle ajan döngülerinde birikerek hissedilir.
- Türkçe: Kaynaklarda Türkçe performansına dair bir bilgi yok. Kendi örnek verinizle ölçmeden üretime almayın.
Flash ve Distill-Qwen-9B için donanım bilgisi doğrulanmış kaynaklarda yer almıyor. Distill modelinin adı küçük ölçekli, damıtılmış bir sürüm olduğunu düşündürüyor. Daha mütevazı donanımda denemek istiyorsanız resmi model kartlarındaki gereksinimleri kontrol edin.
Nasıl denenir
- Önce küçük başlayın. İş akışınızı damıtılmış ya da daha küçük bir modelle kurun. Değerlendirme setinizi hazırlayın. Pro'ya ancak bundan sonra geçin.
- Donanımı doğrulayın. Toplam VRAM en az 680 GB olmalı. Tensör paralelliğinin verimli çalışması için GPU'lar arası bağlantı da önemli.
- vLLM sürümünü kontrol edin. Kararlı 0.29.0 ve öncesi bu ağırlıkları doğru yükleyemiyor. Tarifin önerdiği nightly sürümü ayrı bir sanal ortamda ya da konteynerde deneyin. Mevcut servislerinizi bozmamak için bu ayrımı koruyun. Sürüm geçişlerindeki genel tuzaklar için vLLM 0.31.0 yazımıza bakabilirsiniz. Desteğin hangi sürümle geldiğini her zaman resmi tariften teyit edin.
- Bağlamı sınırlayın. İlk denemede bağlam uzunluğunu düşük tutun. Bellek ve hız davranışını gördükten sonra kademeli olarak artırın.
Örnek bir başlangıç şöyle olabilir. Bayrakların güncel hali için tarife bakın:
# Sürüm ve GPU kontrolü
python -c "import vllm; print(vllm.__version__)"
nvidia-smi --query-gpu=name,memory.total --format=csv
# 8 GPU'ya bölünmüş servis, bağlam bilinçli olarak kısıtlı
vllm serve XiaomiMiMo/MiMo-V2.6-Pro-RL \
--tensor-parallel-size 8 \
--max-model-len 131072 \
--host 127.0.0.1 --port 8000
# Yerelden test
curl http://localhost:8000/v1/models
Servisi doğrudan internete açmayın. Önüne kimlik doğrulamalı bir ters vekil koyun. Kurum içinde kalıcı kullanım planlıyorsanız size ayrılmış, yönetilen bir özel bulut ortamı da düşünülebilir. Benzer ölçekteki başka bir açık modelin kurulumunu DeepSeek-V4.1-Flash yazımızda anlattık.
Sık sorulan sorular
MiMo-V2.6-Pro tek bir GPU'da çalışır mı?
Hayır. Tarif 8 adet H200, 4 adet MI355X ya da toplamda en az 680 GB VRAM sağlayan eşdeğer bir donanım istiyor.
Mevcut kararlı vLLM kurulumum yeterli mi?
0.29.0 ve öncesiyse yeterli değil. Tarif, 20 Eylül 2026'dan sonra derlenmiş bir nightly sürüm öneriyor.
1 milyon token bağlamı hemen kullanmalı mıyım?
Önerilmez. Uzun bağlam, KV önbellek için ciddi ek bellek ister. İhtiyacınız kadar bir sınırla başlayın.
API mi, kendi sunucu mu?
Kişisel veri işliyorsanız ve kullanımınız sürekliyse kendi sunucu öne çıkar. Seyrek denemelerde API ya da kısa süreli GPU kiralama daha az maliyetli olur.
Kaynaklar
- #xiaomi mimo
- #açık ağırlıklı model
- #vllm
- #gpu sunucu
- #kvkk
- #kendi sunucunda model
- #yapay zeka gündemi