EmbeddingGemma 2 yayında: çok modlu embedding modelini kendi sunucunuzda RAG ve kurum içi arama için çalıştırma
EmbeddingGemma 2 metin, kod, görsel, video ve sesi aynı vektör uzayına taşıyan açık bir model. Modüler yapısını, Matryoshka ile depolama tasarrufunu ve kurum içi RAG için kendi sunucunuzda nasıl deneyeceğinizi özetliyoruz.
sunucu.com.tr Ekibi4 dk okuma
Google, EmbeddingGemma 2'yi duyurdu: metin, kod, görsel, video ve sesi tek bir ortak embedding uzayına yerleştiren açık bir model. Belgelerinde, toplantı kayıtlarında ya da ürün görsellerinde arama yapmak isteyen, ama bu veriyi dışarıdaki bir API'ye göndermek istemeyen ekipler için EmbeddingGemma 2 dikkate değer bir seçenek. Model küçük, lisansı ticari kullanıma açık ve yaygın çalıştırma araçlarıyla uyumlu.
Ne değişti
EmbeddingGemma 2, Gemma 4 mimarisinin üzerine kurulu ve Apache 2.0 lisansıyla yayımlandı. Ağırlıklar Hugging Face ve Kaggle üzerinden indirilebiliyor.
En önemli fark çok modluluk. İlk EmbeddingGemma metin odaklıydı. Yeni sürüm ise bir PDF paragrafını, bir ekran görüntüsünü ve bir ses kaydını aynı uzayda temsil edebiliyor. Bu sayede "geçen ayki fiyat toplantısında indirim nerede konuşuldu" gibi bir metin sorgusu, doğrudan bir ses parçasıyla eşleşebiliyor.
Modüler yapı: 270M'den 740M'e
Model tek parça yüklenmek zorunda değil. Geliştirici rehberine göre:
- Yalnız metin ve kod için 270M parametre,
- Görsel eklendiğinde 440M,
- Ses eklendiğinde 570M,
- Tam çok modlu hâlde 740M parametre.
Yani yalnız doküman araması yapacaksanız görsel ve ses bileşenlerini yüklemeden en hafif sürümle başlayabilirsiniz.
Bağlam ve kalite
Model kartına göre bağlam penceresi 8.192 token. Google bunun ilk sürüme göre 4 kat büyük olduğunu söylüyor. Bu bütçe ortak kullanılıyor: yaklaşık 29 görsel, 58 video karesi ya da 327 saniye ses sığıyor. Model kartında 768 boyutta MTEB çok dilli ortalama 61,36, MTEB kod skoru 78,68 olarak veriliyor; kod skorundaki artış önceki sürüme göre 9,92 puan. Model 100'den fazla dili anlıyor. Türkçe performansı için kendi verinizle test etmenizi öneririz, çünkü çok dilli ortalama tek bir dilin sonucunu göstermez.
Ne anlama geliyor
Veri sunucunuzda kalıyor
RAG kurulumunda embedding adımı bütün belge arşivinizin modelden geçmesi demek. Bunu dış bir API ile yapmak, müşteri sözleşmelerinin, personel dosyalarının ya da çağrı kayıtlarının yurt dışına gitmesi anlamına gelebilir. KVKK açısından bu, açık rıza ve yurt dışı aktarım sorularını beraberinde getirir. Açık ağırlıklı ve küçük bir modelle embedding üretimini kendi sunucunuzda yaptığınızda ham veri şirketin altyapısından çıkmaz.
Maliyet: model değil, depolama büyür
Embedding modelinin kendisi küçük; asıl büyüyen şey vektör veritabanı. Rehberdeki örnek iyi bir referans: bfloat16 hassasiyette bir milyon adet 768 boyutlu vektör yaklaşık 1,5 GB tutuyor. Vektörler 128 boyuta kısaltılınca bu yaklaşık 250 MB'a iniyor.
EmbeddingGemma 2 ile Matryoshka boyut kısaltma
Model Matryoshka yöntemiyle eğitildiği için vektörün ilk kısmını alıp gerisini atabilirsiniz. Google'ın verdiği değerler:
- 256 boyut: depolama yaklaşık 3 kat azalıyor, çok modlu aramada kalitenin yaklaşık %95'i korunuyor.
- 128 boyut: metin ve kod aramasında kalite yaklaşık %90.
Pratik öneri: önce 768 boyutla küçük bir değerlendirme seti oluşturun, sonra 256 ve 128 ile aynı sorguları çalıştırıp sonuçları karşılaştırın. Kayıp sizin kullanım senaryonuzda kabul edilebilir düzeydeyse disk, RAM ve yedekleme maliyetinde ciddi kazanç sağlarsınız. Unutmayın: boyutu sonradan değiştirmek tüm arşivi yeniden indekslemek demek olabilir, bu kararı baştan verin.
Nasıl denenir
Geliştirici rehberine göre model Sentence Transformers (v6.1.0 ve üzeri), Hugging Face Transformers, vLLM, SGLang, Ollama, LM Studio, MLX, llama.cpp ve LiteRT ile kullanılabiliyor. Başlamak için en kısa yol Python tarafında Sentence Transformers:
python3 -m venv venv && . venv/bin/activate
pip install "sentence-transformers>=6.1.0"
Model kimliği ve örnek kod için Hugging Face model sayfasındaki resmi kullanımı izleyin. Genel adımlar şöyle:
- Kapsamı seçin. Yalnız belge arayacaksanız metin sürümüyle başlayın; görsel ya da ses gerçekten gerekiyorsa ilgili bileşeni ekleyin.
- Parçalama yapın. Belgeleri bağlam penceresine sığacak, anlamlı parçalara bölün; ses kayıtlarını da kısa dilimlere ayırın.
- Vektör veritabanını kurun. Boyutu (768, 256 ya da 128) baştan belirleyin.
- Değerlendirin. Ekibinizden gerçek Türkçe sorgular toplayın ve doğru sonucun ilk birkaç sonuç içinde gelip gelmediğini ölçün.
- Servisleştirin. Üretimde vLLM ya da Ollama ile bir API uç noktası açabilirsiniz; bu uç noktayı internete doğrudan açmayın. Bunun için Ollama API'sini Nginx ters vekil ve kimlik doğrulamayla koruma yazımızdaki yaklaşım embedding servisi için de geçerli.
Donanım ihtiyacı
Ağırlıkların kapladığı bellek, kabaca parametre sayısı ile hassasiyetin bayt değerinin çarpımıdır; üstüne toplu işleme (batch) ve girdilerin ön işlenmesi için ek pay gerekir. Birkaç yüz milyon parametrelik bir modelde bu ihtiyaç büyük dil modellerine göre çok küçüktür. Az sayıda belgeyi ve sorguyu işleyecekseniz CPU'lu bir bulut sunucu başlangıç için yeterli olabilir. Arşivin tamamını ilk kez indekslerken ya da video ve ses gibi ağır girdilerle çalışırken tek kartlı bir GPU sunucu süreyi belirgin biçimde kısaltır.
Vektör veritabanı da artık kritik bir veri. Yeniden indekslemek saatler sürebileceği için onu düzenli yedekleme planına dahil edin.
Sık sorulan sorular
EmbeddingGemma 2 ticari projede kullanılabilir mi?
Evet, model Apache 2.0 lisansıyla yayımlandı ve bu lisans ticari kullanıma izin veriyor. Yine de lisans metnini kendi hukuk ekibinizle gözden geçirin.
Türkçe belgelerde işe yarar mı?
Model 100'den fazla dili anlıyor ve çok dilli MTEB ortalaması yayımlandı. Ancak Türkçe için ayrı bir skor paylaşılmadı. Kendi belgelerinizle küçük bir test seti hazırlayıp ölçmek en güvenilir yöntem.
Sohbet modeli yerine mi kullanılır?
Hayır. EmbeddingGemma 2 metin üretmez, yalnız arama ve eşleştirme için vektör üretir. RAG'de ilgili parçaları bulur; yanıtı ise ayrı bir dil modeli yazar.
Mevcut ilk sürüm vektörlerimi kullanmaya devam edebilir miyim?
Farklı modellerin vektörleri aynı uzayda değildir. Yeni modele geçerseniz arşivi yeniden indekslemeniz gerekir; bunu planlarken depolama boyutunu da yeniden değerlendirin.
Kaynaklar
- #embeddinggemma 2
- #embedding modeli
- #rag
- #açık ağırlıklı model
- #vektör veritabanı
- #kvkk
- #gpu sunucu
- #yapay zeka gündemi

