Cloudflare Clef: AI ajanlarında yönlendirme için açık ağırlıklı karar modelleri ve kendi GPU sunucunuzda çalıştırma
Cloudflare, metin yerine yapılandırılmış karar döndüren Clef ve Clef-flash modellerini Apache 2.0 lisansıyla açtı. Bu modellerin LLM'den farkını, ajan iş akışlarında nerede işe yaradığını ve KVKK açısından kendi GPU sunucunuzda nasıl planlanabileceğini anlatıyoruz.
sunucu.com.tr Ekibi4 dk okuma
Cloudflare, 1 Ekim 2026'da Clef ve Clef-flash adlı iki "karar modeli" duyurdu ve ağırlıklarını Apache 2.0 lisansıyla Hugging Face üzerinden erişime açtı. Bu modellerin amacı uzun metin yazmak değil: bir girdiye bakıp evet/hayır, seçenek ya da puan biçiminde karar vermek. AI ajanı kuran, destek taleplerini otomatik dağıtmak isteyen ya da içerik denetimi yapan ekipler için konuşulmaya değer bir gelişme.
Ne değişti
Ajan sistemlerinde işin büyük kısmı aslında küçük kararlardan oluşur: "Bu talep faturalama mı, teknik destek mi?", "Bu çıktı onaylanabilir mi?", "Bu mesaj güvenlik politikasını ihlal ediyor mu?" Bu kararlar bugün çoğunlukla genel amaçlı bir LLM'e sorulup dönen metin ayrıştırılarak veriliyor. Clef bu adımı ayrı bir model türüne taşıyor.
Duyuruda öne çıkan noktalar şunlar:
- İki boyut: Clef, Qwen 3.8-27B tabanı üzerine; Clef-flash ise Qwen 3.5-9B tabanı üzerine kurulu. Workers AI'da
@cf/cloudflare/clefve@cf/cloudflare/clef-flashkimlikleriyle yer alıyorlar. - Soru tipleri: Evet/hayır kararları için
noul, seçenekler arasından seçim içinchoice, belirli ölçütlere göre puanlama içinscoretipi var. Tek istekte en fazla 64 soru sorulabiliyor. - Girdi: 64k bağlam penceresi sunuluyor; metne ek olarak en fazla dört görsel verilebiliyor.
- Hız: Cloudflare'in ölçümlerine göre medyan gecikme Clef için 209,3 ms, Clef-flash için 38,8 ms. Clef-flash'ın p95 değeri 122,4 ms.
- Karşılaştırma: Cloudflare, Clef'in 10 karar benchmark'ının 7'sinde önde olduğunu, BANKING77'de 94,20 ve CLINC150+OOS'ta 97,43 macro-F1 aldığını bildiriyor. Rakip olarak andığı Jev'in 32k bağlam penceresine ve 524,1 ms medyan gecikmesine göre Clef-flash'ın 13 kat hızlı olduğunu söylüyor. Bunlar üreticinin kendi ölçümleri; kendi verinizle doğrulamanız gerekir.
- İnce ayar: Pekiştirmeli öğrenme ile ince ayar hizmeti şimdilik Cloudflare mühendisleriyle birlikte yürütülüyor. Kendi başınıza kullanabileceğiniz platform ileride gelecek.
Ne anlama geliyor
LLM'den farkı: metin değil, karar
Genel amaçlı bir modelden "sadece EVET ya da HAYIR yaz" dediğinizde bile bazen açıklama ekler, biçimi bozar ya da kararsız kalır. Karar modelinde çıktı baştan tiplidir. Bu, ajan akışındaki ayrıştırma kodunu sadeleştirir ve yanlış biçimden kaynaklanan hataları azaltır. Pratikte şöyle bir mimari öne çıkıyor: ön kapıda hızlı bir karar modeli yönlendirmeyi yapar, pahalı üretken model yalnız gerçekten metin yazılması gereken adımda devreye girer.
Türkiye'deki ekipler için
- KVKK ve veri yerleşimi: Ağırlıkların Apache 2.0 ile açık olması asıl önemli nokta. Müşteri talepleri, sipariş notları ya da çağrı dökümleri gibi kişisel veri içeren girdileri yurt dışındaki bir API'ye göndermeden, Türkiye'deki kendi sunucunuzda sınıflandırabilirsiniz. Ticari kullanım ve üzerinde değişiklik yapmak da lisans gereği mümkün.
- Maliyet: Yönlendirme gibi çok sık çağrılan adımlar token faturasını hızla büyütür. Bu adımları yerelde çalışan küçük bir modele almak, harici API'yi yalnız gerekli işlere ayırmanızı sağlar.
- Gecikme: Kullanıcıya en yakın noktada çalışan bir karar modeli, ajanın her adımda beklemesini kısaltır. Yurt dışı bir uç noktaya gidip gelme süresi, karar süresinin kendisini rahatlıkla geçebilir.
- Türkçe: Duyurudaki benchmark'lar İngilizce ağırlıklı veri kümeleri üzerinde. Türkçe talepler, karışık dil ve yazım hatalı mesajlarda başarımı kendi örneklerinizle ölçmeden üretime almayın.
Nasıl denenir
1. Önce kararlarınızı tanımlayın
Elinizdeki iş akışındaki karar noktalarını listeleyin ve her birini üç tipten birine eşleyin: evet/hayır (noul), kategori seçimi (choice) ya da puanlama (score). Geçmiş kayıtlardan etiketli birkaç yüz örnek ayırın; modelin başarısını bu setle ölçeceksiniz.
2. Hızlı deneme için yönetilen ortam
Kod yazmadan önce davranışı görmek istiyorsanız Workers AI üzerindeki model kimlikleriyle deneme yapabilirsiniz. Gerçek kişisel veri yerine anonimleştirilmiş örnekler kullanın.
3. Kendi GPU sunucunuzda çalıştırma
Veriyi dışarı çıkarmak istemiyorsanız ağırlıkları indirip kendi altyapınızda servis edebilirsiniz. Donanımı planlarken şu genel ilkeler geçerli:
- Ağırlık belleği: Gereken GPU belleği kabaca parametre sayısı ile parametre başına bayt sayısının çarpımıdır. 16 bit hassasiyette her parametre 2 bayt tutar; kuantize sürümler bunu düşürür ama doğrulukta değişikliğe yol açabilir.
- Bağlam ve eşzamanlılık: 64k gibi uzun bağlam kullanmak ve aynı anda çok istek işlemek KV önbelleği için ek bellek ister. Gerçekte kullandığınız bağlam uzunluğunu sınırlamak belleği ciddi ölçüde rahatlatır.
- Boyut seçimi: Yüksek hacimli ve gecikmeye duyarlı yönlendirmede 9B tabanlı Clef-flash daha uygun bir başlangıçtır. Daha zor ve nadir kararlar için 27B tabanlı Clef'i ayrı tutmak mantıklı olabilir.
Servis katmanı için modelin kartında önerilen çalıştırma yöntemini izleyin. Açık ağırlıklı modelleri sunucuda servis etme pratiğine dair vLLM 0.31.0 ve hızlı yeniden başlatma yazımız genel bir çerçeve sunuyor. Model için GPU sunucu seçeneklerine, ajanın orkestrasyon ve kuyruk katmanını çalıştırmak için de bulut sunucu seçeneklerine göz atabilirsiniz. Karar kayıtlarını denetim amacıyla saklıyorsanız bunları KVKK uyumlu yedekleme kapsamına almayı unutmayın.
4. Ölçün ve kademeli geçin
Önce modeli gölge modda çalıştırın: mevcut sistem karar verirken Clef de karar versin, ama sonucu yalnız kaydedin. İki sonucu karşılaştırdıktan sonra düşük riskli kararlardan başlayarak devreye alın. score tipinde bir eşik belirleyip eşiğin altında kalan durumları insana yönlendirmek iyi bir güvenlik ağıdır.
Sık sorulan sorular
Clef bir sohbet modeli yerine kullanılabilir mi?
Hayır. Clef serbest metin üretmek için değil, tipli karar döndürmek için tasarlandı. Yanıt yazma işi yine üretken bir modelde kalır; Clef bu modelin önünde yönlendirme ve onay katmanı olarak çalışır.
Ticari projede kullanabilir miyim?
Ağırlıklar Apache 2.0 lisansıyla yayımlandı. Bu lisans ticari kullanıma ve değişikliğe izin verir; yine de lisans metnindeki bildirim yükümlülüklerini kendi hukuk ekibinizle kontrol edin.
Kendi verimle ince ayar yapabilir miyim?
Cloudflare'in pekiştirmeli öğrenmeyle ince ayar hizmeti şimdilik şirketin mühendis ekibiyle birlikte yürütülüyor; kendi kendine kullanılan sürüm henüz yok. Ağırlıklar açık olduğu için kendi altyapınızda ince ayar denemek teknik olarak mümkün, ancak bunun için resmi bir yöntem duyurulmadı.
Türkçe metinlerde ne kadar başarılı?
Duyuruda Türkçeye özel bir sonuç paylaşılmadı. Kendi etiketli Türkçe örneklerinizle test etmeden karar vermeyin.
Kaynaklar
- #cloudflare clef
- #karar modeli
- #açık ağırlıklı model
- #ai ajan
- #gpu sunucu
- #kvkk
- #yapay zeka gündemi