sunucu.com.tr
Yapay Zeka

Qwen-Image-2.1 yayında: 7B görsel üretim modelini kendi GPU sunucunuzda çalıştırma ve lisans uyarısı

Qwen-Image-2.1 metinden görsel üretimi ve düzenlemeyi tek modelde topluyor, şeffaf PNG üretebiliyor. Neler değiştiğini, Qwen Research License'ın ticari kullanım için ne anlama geldiğini ve modeli kendi GPU sunucunuzda nasıl deneyebileceğinizi anlatıyoruz.

sunucu.com.tr Ekibi4 dk okuma

Qwen ekibi 20 Eylül 2026'da Qwen-Image-2.1'i yayınladı. Ağırlıklar Hugging Face ve ModelScope'tan indirilebiliyor. Model metinden görsel üretimi ve görsel düzenlemeyi tek çatıda birleştiriyor, şeffaf arka planlı görsel de üretebiliyor. Ürün fotoğrafı, kampanya görseli ya da arayüz öğesi hazırlayan ekiplerin ilgisini çekecek bir sürüm. Yalnız lisansı ticari kullanımı doğrudan serbest bırakmıyor, o yüzden kurulumdan önce bir uyarımız var.

Ne değişti

Qwen-Image-2.1'de öne çıkan teknik noktalar şunlar:

  • Mimari: Görsel üretimi yapan bileşen 7 milyar parametreli, 32 katmanlı bir Single-Stream DiT.
  • Metin kodlayıcı: İstemi anlama işini Qwen3-VL 8B üstleniyor. Yani sistemde aslında iki büyük parça birlikte çalışıyor.
  • RGBA desteği: VAE tarafında 64 kanallı, 16 kat uzamsal sıkıştırma yapan bir RGBA otomatik kodlayıcı var. Model şeffaf görseli sonradan arka plan silerek değil, doğrudan üretebiliyor.
  • Düzenleme: Düzenleme sırasında 10 adede kadar referans görsel verilebiliyor. Daire çizerek, maske vererek ya da çizim notu ekleyerek yalnız belli bir bölgeyi değiştirmek mümkün.
  • Çözünürlük: Model 2048x2048 çözünürlüğü yerel olarak destekliyor.
  • Ekosistem: Diffusers, ComfyUI, vLLM-Omni, SGLang ve LightX2V modeli ilk günden destekliyor. Diffusers'taki işlem hattının adı QwenImage21Pipeline.

Qwen-Image-2.1 ne anlama geliyor

Şeffaf görsel ve çoklu referans kimin işine yarar

E-ticaret ekiplerinde arka planı temizlenmiş ürün görseli her gün gereken bir şey. Şeffaf PNG'nin doğrudan üretilmesi, bu iş için ayrı bir arka plan silme aracına gerek bırakmayabilir. Kenar kalitesi yine de kendi ürünlerinizle test edilmeli. On referans görsel desteği ise marka tutarlılığı için anlamlı: logo, ürün ve renk paleti örneklerini birlikte verip aynı tarzda seri görsel istemek mümkün hale geliyor. Bölgesel düzenleme de ajans iş akışında "yalnız şu köşedeki yazıyı değiştir" tipi revizyonları kısaltabilir.

Lisans uyarısı: Qwen Research License

Bu sürümün en kritik ayrıntısı lisans. Qwen-Image-2.1, Apache 2.0 ile değil Qwen Research License Agreement ile dağıtılıyor. Açık ağırlıklı olması, ürettiğiniz görselleri ya da modeli serbestçe ticari işte kullanabileceğiniz anlamına gelmiyor. Müşteri kampanyası, satışa sunulan ürün görseli ya da ücretli bir servis kurmayı düşünüyorsanız lisans metnini hukuk ekibinizle birlikte okuyun. Denemeyi ve iç değerlendirmeyi bu kontrol tamamlanana kadar ayrı tutmak en güvenli yol.

Türkiye'deki ekipler için

  • Veri gizliliği ve KVKK: Henüz yayınlanmamış ürün fotoğrafları, müşteri logoları ya da kişi içeren görseller dış bir API'ye gönderilmeden kendi sunucunuzda işlenebilir. Bu, veri işleme sözleşmeleri ve yurt dışına aktarım konusunda işinizi kolaylaştırır.
  • Maliyet: Görsel başına ücret yerine sunucu saatine ödeme yapılır. Toplu üretim yapan ekipler için bu hesap farklı çıkabilir, kendi hacminizle karşılaştırın.
  • Türkçe istem: Metin kodlayıcı çok dilli bir model olsa da Türkçe istemlerin ve özellikle görsel üzerindeki Türkçe yazıların (ğ, ş, İ gibi karakterlerin) ne kadar doğru çıktığını mutlaka kendiniz deneyin. Gerekirse istemi İngilizce yazıp görsel içi metni ayrıca belirtmek işe yarayabilir.

Nasıl denenir: kendi GPU sunucunuzda çalıştırma

Araç seçimi

  • ComfyUI: Tasarım ekibi düğüm tabanlı arayüzle denemek istiyorsa en rahat başlangıç noktası. Maske ve referans görsel akışları görsel olarak kurulur.
  • Diffusers: Python ile kendi betiğinizi ya da küçük bir servis yazacaksanız QwenImage21Pipeline üzerinden ilerleyebilirsiniz. Sürüm uyumu için resmi depodaki örneklere bakın.
  • vLLM-Omni ve SGLang: Çok kullanıcılı, API olarak sunulan bir servis kuracaksanız bunlar daha uygun. vLLM-Omni prefix KV önbelleği, FP8 kuantizasyonu ve tensör paralelliği sunuyor. SGLang tarafında Cache-DiT, CUDA grafikleri ve çoklu GPU paralelliği var.

GPU belleği için genel ilkeler

Bellek planlarken yalnız 7B'lik görsel modeli değil, 8B'lik metin kodlayıcıyı ve VAE'yi de hesaba katın. BF16 gibi 16 bitlik hassasiyette parametre başına kabaca 2 bayt gerekir. FP8 kuantizasyonu bunu yaklaşık yarıya indirir. Bunun üstüne çözünürlüğe göre büyüyen ara bellek eklenir: 2048x2048 üretim, düşük çözünürlüğe göre belirgin biçimde daha fazla bellek ister. Tek kartta sığmıyorsa metin kodlayıcıyı CPU'ya almak (daha yavaş olur) ya da tensör paralelliğiyle iki karta bölmek seçenekler arasında. Kesin ihtiyacı küçük bir test ortamında ölçmek en doğrusu.

Pratik adımlar

  1. Önce saatlik bir GPU sunucu üzerinde ComfyUI ya da Diffusers ile kendi ürün görsellerinizi deneyin.
  2. Şeffaf çıktı kalitesini, Türkçe yazı başarısını ve görsel başına süreyi not alın.
  3. Lisans kontrolü tamamlandıysa ve kullanım sürekliyse vLLM-Omni ya da SGLang ile kalıcı bir servis kurun. Servisi doğrudan internete açmayın, önüne kimlik doğrulamalı bir ters vekil koyun.
  4. Üretilen görsel arşivi zamanla büyür ve kaybolması iş kaybıdır. Çıktıları S3 uyumlu nesne depolamaya yazmak ve planlı yedekleme kurmak model sunucusunu da tek hata noktası olmaktan çıkarır.

E-ticaret mağazası işletiyorsanız görsel üretim sunucusunu mağaza sunucusundan ayrı tutmak, kampanya döneminde yoğun GPU işinin siteyi yavaşlatmasını önler.

Sık sorulan sorular

Qwen-Image-2.1 ile ürettiğim görselleri ticari olarak kullanabilir miyim?

Bu sorunun yanıtı Qwen Research License Agreement koşullarına bağlı. Model Apache 2.0 ile lisanslanmadığı için ticari kullanımdan önce lisans metnini incelemeniz gerekiyor.

Şeffaf PNG için ayrıca arka plan silme aracı gerekir mi?

Model RGBA görseli doğrudan üretebildiği için çoğu durumda gerekmeyebilir. Saç, cam ya da ince kenarlı ürünlerde sonucu kendi örneklerinizle kontrol edin.

Tek GPU yeterli olur mu?

Kullandığınız hassasiyete, çözünürlüğe ve aynı anda kaç istek işleyeceğinize bağlı. FP8 kuantizasyonu ve metin kodlayıcıyı ayrı yere taşımak bellek ihtiyacını azaltır. Çok kullanıcılı servislerde çoklu GPU paralelliği daha rahat bir seçenek.

Kaynaklar

  • #qwen-image-2.1
  • #görsel üretim
  • #açık ağırlıklı model
  • #comfyui
  • #gpu sunucu
  • #diffusers
  • #yapay zeka gündemi

İlgili yazılar

Yapay Zeka yazıları