Alibaba’nın açık kaynaklı Qwen ailesine yeni bir üye eklendi: Qwen3.8-27B. 27 milyar parametreli, görsel anlama (vision), araç çağırma (tool-calling) ve 262 bin token’lık devasa bir bağlam penceresine sahip bu model, kısa süre içinde topluluk tarafından “sansürsüz” (uncensored) bir sürüme kavuştu. Bu yazıda, bu sürümün ne olduğunu, neden bu kadar dikkat çektiğini ve yerelde nasıl çalıştırılabileceğini ele alıyoruz.
İçindekiler
Qwen3.8-27B Nedir?
Qwen3.8-27B, Alibaba’nın geliştirdiği yoğun (dense) mimarili, hibrit dikkat (hybrid-attention) yapısına sahip bir dil modeli. Gated DeltaNet tabanlı doğrusal dikkat katmanları ile tam dikkat katmanlarını bir araya getiren bu mimari, modele hem hız hem de uzun bağlamda tutarlılık kazandırıyor. Model; görsel girdileri anlayabiliyor, harici araçları çağırabiliyor, “düşünme” (thinking) modunu açıp kapatabiliyor ve MTP (multi-token prediction) tekniğiyle hızlandırılmış çıktı üretebiliyor. Apache 2.0 lisansıyla yayınlanması, ticari kullanım, değiştirme ve yeniden dağıtım konusunda geniş bir özgürlük sağlıyor.
Sansürsüz Sürüm Nasıl Ortaya Çıktı?
OrcaRouter adlı topluluk, “abliteration” (ablitasyon) adı verilen bir teknikle Qwen3.8-27B’nin ret (refusal) davranışını kontrol eden yönü modelin iç temsillerinden ayrıştırarak kaldırdı. Bu teknik, 2024 yılında yayımlanan “Refusal in Language Models Is Mediated by a Single Direction” başlıklı araştırmaya dayanıyor; modelin reddetme davranışının tek bir yönle ilişkilendirilebildiğini ve bu yönün ağırlıklardan çıkarılabildiğini gösteriyor. Sonuç olarak ortaya çıkan Qwen3.8-27B-Uncensored, temel modelin tüm yeteneklerini korurken çok daha az “yapamam” yanıtı veriyor.
Yerelde Çalıştırmanın Sunduğu Özgürlük
Bu modelin en çok dikkat çeken yanı, tamamen kendi donanımınızda, herhangi bir API anahtarı, bulut faturası ya da uzak sunucu gecikmesi olmadan çalışabilmesi. GGUF formatında 2-bit’ten 16-bit’e kadar farklı kuantizasyon seviyelerinde sunulan model, llama.cpp üzerinden CPU, CUDA, Metal ya da ROCm ile çalıştırılabiliyor. Apple Silicon kullanıcıları için özel olarak optimize edilmiş MLX sürümleri de mevcut. Bu da demek oluyor ki 24 GB VRAM’e sahip bir kart ile Q4_K_M kuantizasyonunu (yaklaşık 17 GB) rahatlıkla çalıştırabilirsiniz. Ollama kullanıcıları için işler daha da basit: tek bir komutla (ollama run huihui_ai/Qwen3.8-abliterated) modeli anında indirip kullanmaya başlayabiliyorsunuz.
Neden Bu Kadar İlgi Görüyor?
Yerelde, sansürsüz bir modelle çalışmak birçok kullanıcı için farklı anlamlar taşıyor: bulut tabanlı servislerin dayattığı kullanım kısıtlarından bağımsız olmak, verilerin hiçbir zaman kendi bilgisayarınızdan çıkmaması, token başına ödeme yapmadan sınırsız deneme yapabilmek ve modelin kendi ihtiyaçlarınıza göre ince ayar (fine-tuning) yapılabilir olması. Özellikle geliştiriciler, araştırmacılar ve teknik meraklılar için bu, modelle etkileşimde daha fazla kontrol ve esneklik anlamına geliyor.
Kurulum İçin Ne Gerekiyor?
Modeli denemek isteyenler için en pratik yol Ollama üzerinden ilerlemek. Daha fazla kontrol isteyenler ise Hugging Face üzerinden doğrudan GGUF dosyalarını indirip llama.cpp ile çalıştırabilir. Donanım gereksinimleri seçilen kuantizasyon seviyesine göre değişiyor; 12 GB VRAM’den başlayan seçenekler mevcut, ancak modelin tam 262K bağlam penceresinden faydalanmak için daha güçlü bir kart önerilir.
Teknik Bir Not
Model kartında da belirtildiği üzere, bu sürümde güvenlik hizalaması (safety alignment) büyük ölçüde kaldırılmış durumda — yani yerleşik reddetme mekanizmaları önemli ölçüde azaltılmış. Bu, modeli daha esnek ve kısıtlamasız kullanmak isteyenler için çekici bir özellik; kullanım sorumluluğu tamamen kullanıcıya ait.
Son Söz
Qwen3.8-27B-Uncensored, açık kaynak yapay zeka dünyasında yerelde çalışan, esnek ve kısıtlamalardan bağımsız modellere olan ilgiyi bir kez daha gözler önüne seriyor. Apache 2.0 lisansı sayesinde hem ticari hem bireysel projelerde özgürce kullanılabilen bu model, bulut bağımlılığından kurtulmak isteyen herkes için ciddi bir alternatif sunuyor.
Tik Tak Bilgi Tik Tak Bilgi