İçeriğe geç
LargeLanguageModel.com.tr
Tüm yazılar

Z.ai, MIT lisanslı GLM-5.3-Flash'ı Çin çipleriyle yayımladı

2 dk okuma

Çinli Z.ai, 26 Ağustos 2026'da GLM-5 ailesinin ilk doğal çoklu-ortam modeli GLM-5.3-Flash'ı MIT lisansıyla yayımladı. 320 milyar toplam, 18 milyar aktif parametreli model 1 milyon token bağlam sunuyor. Şirket, önizleme sürecinin tamamen yerli Çin yapay zeka çipleri üzerinde yürütüldüğünü bildirdi.

Çinli yapay zeka şirketi Z.ai (Zhipu AI), 26 Ağustos 2026'da GLM-5 ailesinin ilk doğal çoklu-ortam modeli olan GLM-5.3-Flash'ı yayımladı. Uzmanlar karışımı (MoE) mimarisine sahip model 320 milyar toplam parametre taşıyor ve token başına 18 milyar parametre etkinleştiriyor; bağlam penceresi 1.048.576 token. Ağırlıklar MIT lisansı altında Hugging Face üzerinde erişime açıldı. Şirket, modelin lansmandan önceki bir hafta boyunca OpenCode ve OpenRouter üzerinde "Ox Alpha" adıyla isimsiz olarak çalıştığını ve bu sürecin tamamen yerli üretim Çin yapay zeka çipleri üzerinde yürütüldüğünü açıkladı.


Z.ai'nin paylaştığı ölçüm sonuçlarına göre model, Terminal-Bench 2.1 testinde 84,3 puan aldı; aynı testte Claude Opus 4.8 için 85,0, GPT-5.6 Terra için 87,4 puan referans olarak verildi. DeepSWE v1.1'de 63,4 puana ulaşan model, bir önceki sürüm GLM-5.2'nin 46,2 puanının belirgin şekilde üzerine çıktı; AutomationBench'te ise puan 26,2'den 48,8'e yükseldi. Bağımsız değerlendirme kuruluşu Artificial Analysis modeli Zeka Endeksi'nde 57 puanla derecelendirdi ve Z.ai API'sinde saniyede 48,7 çıktı token'ı ile 1,52 saniyelik ilk token süresi ölçtü. Standart API fiyatlandırması milyon token başına 0,15 dolar giriş, 0,03 dolar önbellekli giriş ve 0,50 dolar çıkış olarak belirlendi. Ölçümlerin farklı test düzenekleriyle yapıldığı, bu nedenle modeller arası karşılaştırmaların kurulum bağımlı olduğu şirket tarafından not edildi.


Verimlilik kazanımının kaynağı mimari değişiklikler. Model 30 trilyon token'lık çoklu-ortam veri kümesiyle sıfırdan eğitildi ve GLM serisinde ilk kez doğrusal dikkat ile seyrek dikkat mekanizmalarını birlikte kullanıyor: doğrusal katmanlar yerel bağımlılıkları, seyrek katmanlar küresel bağlam erişimini üstleniyor. IndexPool adı verilen bileşen, indeksleyici anahtar vektörlerini ağırlıklı havuzlamayla sıkıştırarak milyon token ölçeğinde gecikmeyi ve bellek kullanımını sınırlıyor; Z.ai bu sayede yaklaşık 3 kat daha az dikkat hesabı ve 4,4 kat küçülmüş KV önbelleği bildiriyor. Model ayrıca ölçekleme verimliliği için manifold kısıtlı hiper-bağlantılar (mHC) yaklaşımını benimsiyor. Çin cephesindeki açık model yarışı ağustos ayında hızlanmış durumda: Alibaba'nın Qwen ekibi de 26 Ağustos'ta 125 milyar parametreli Qwen3.8-Flash-Next'i yayımladı, Moonshot AI ise temmuzda 2,8 trilyon parametreli Kimi K3'ü duyurmuştu.


Sunum tarafındaki iddia, modelin teknik özelliklerinden daha geniş bir tartışmaya işaret ediyor. Z.ai, kodlama, ön doldurma ve kod çözme aşamalarını birbirinden ayıran SGLang tabanlı özel bir motor kullandığını ve on binlerce yerli hızlandırıcı üzerinde uçtan uca 3 kat sunum iyileştirmesi elde ettiğini bildirdi. Bu, Çinli laboratuvarların NVIDIA donanımına erişimin kısıtlandığı bir dönemde yerli çip yığınıyla sınır seviyesine yakın model çalıştırabildiği yönündeki iddiaları güçlendiriyor. Aynı dönemde Pekin'in, gelişmiş Çin modellerinin ağırlıklarının ve çip tasarımlarının yurt dışına aktarımını sınırlamayı değerlendirdiği bildiriliyor; söz konusu düzenlemeler henüz kesinleşmedi. Model şu anda tüm GLM Coding Plan katmanlarında GLM-5.3'ün 3 katı kullanım kotasıyla sunuluyor; yerel çalıştırma için SGLang, vLLM, TokenSpeed ve KTransformers destekleniyor. Varsayılan FP8 kontrol noktası KV önbelleği hariç yaklaşık 306 GiB yer kapladığı için kendi altyapısında barındırma, en az 8 GPU'lu düğüme sahip kuruluşlarla sınırlı kalıyor.

Paylaş