- Qwen3.8-Flash-Next, Alibaba’nın Ağustos 2026‘da çıkardığı yeni yapay zeka modeli. Metin ve görsel okuyup cevap yazıyor, özellikle kod yazma ve bilgisayarda iş takip etme işlerine ayarlanmış.
- Model dosyaları herkese açık, 24 Ağustos’tan beri indirilebiliyor. Ama lisansı tam serbest değil, ürüne koymadan önce okumak gerekiyor.
- Asıl olay şu: Alibaba bunu bir sonraki büyük sürümün, yani Qwen4’ün provası olarak çıkardı. Model dosyalarının içindeki kimlik bile
qwen4_exp, yani “Qwen4 deneme” yazıyor. - Boyutu 125 milyar parametre, ama her kelime için yalnızca 6 milyarı çalışıyor. Büyük bir modelin bilgisi, küçük bir modelin faturası.
- Tek seferde yaklaşık 750 bin kelime okuyabiliyor (1 milyon token). Bu kadar uzun metinde kendi büyük kardeşinden 8 kat hızlı.
- Eğitmesi, 397 milyarlık Qwen3.7-Plus’ın yaklaşık 9’da 1’i kadar tutmuş; buna rağmen kodlama ve ofis işlerinde onu geçiyor.
- Kullanması ucuz: 1 milyon token başına $0,16 girdi / $0,47 çıktı. Aynı ailenin amiral gemisi bunun 12 katı fiyatta.
Alibaba geçen yıl Qwen3-Next’i çıkarırken şöyle demişti: bu tam bir ürün değil, bir sonraki neslin mimarisinin erken sürümü, gelin topluluk olarak inceleyelim. O mimari sonra Qwen3.5’ten Qwen3.8’e kadar bütün seriye yayıldı.
Qwen3.8-Flash-Next aynı hamlenin tekrarı. Model bugün kullanılabilir durumda ve fiyatı çok ucuz, ama Alibaba’nın asıl anlattığı şey Qwen4’ün üstüne kurulacağı mimari. Hugging Face deposundaki model_type alanına bile qwen4_exp yazmışlar, yani niyet gizli bile değil.
Gelin 6 milyar aktif parametreyle 397 milyarlık modeli geçen bu şeye bakalım. 👇🏻
Qwen3.8-Flash-Next Nedir?
Metin ve görsel okuyup metin üreten, uzman karışımı (MoE) mimarili, ağırlıkları indirilebilir bir model. Kodlama ve ajan işleri için ayarlanmış.
Rakamlar şöyle:
| Qwen3.8-Flash-Next | |
|---|---|
| Toplam parametre | 125 milyar |
| Aktif parametre (token başına) | 6 milyar (10 uzman + 1 paylaşımlı) |
| N-gram gömme | 51 milyar (ayrı) |
| MTP modülü | 4 milyar |
| Katman | 48 |
| Uzman havuzu | 512 |
| Bağlam | 262.144 token, YaRN ile ~1 milyon |
| Girdi | Metin + görsel |
| Lisans | qwen-community-1.0 |
Kritik satır ortadaki: 6 milyar aktif parametre. Bir MoE modelinde toplam parametre pazarlama rakamı, faturayı ve hızı belirleyen her token için kaç parametrenin çalıştığı. Burada 125 milyarın yalnızca yüzde 5’i devrede.
Karşılaştırma daha çarpıcı: Alibaba’nın kendi 397 milyarlık Qwen3.7-Plus modeli her token’da 17 milyar parametre çalıştırıyor. Flash-Next bunun üçte birinden azıyla çalışıp kodlama ve ofis testlerinde onu geçiyor. Eğitim maliyeti de yaklaşık 9’da 1.
Çünkü o parametreler çarpma işlemine girmiyor, sadece aranıp bulunuyor. Normal bir gömme tablosu tek bir token’a bakıp karşılığını getirir. N-gram gömme ise o token ile ondan önceki birkaç token’ın oluşturduğu kalıba bakıp karşılığını getiriyor, yani “sık geçen kelime öbekleri” için hazır bir hafıza.
Nerede duracağı önceden hesaplanabildiği için bu tablo GPU belleğinde durmak zorunda değil: sistem belleğinde tutulup model hesaplarken paralel olarak önceden çekiliyor. Model kapasitesi 51 milyar parametre büyüyor, token başına hesap neredeyse hiç artmıyor.
Mimaride Ne Değişti? 🧠
Alibaba dört başlıkta değişiklik yaptığını söylüyor: dikkat, artık bağlantı, gömme ve optimizasyon.

1. Dikkat: GDN + QSA
Klasik tam dikkat (full attention) her yeni token’ı geçmişteki bütün token’larla karşılaştırır. Bağlam uzadıkça hem hesap hem KV önbelleği patlar.
Flash-Next bunu ikiye bölüyor. Her 4 katmanın 3’ü Gated DeltaNet (GDN) kullanıyor: geçmişi sabit boyutlu bir duruma sıkıştırıyor, yani “hatırlıyor”. Kalan 1 katman ise küresel dikkat yapıyor, yani bağlamın herhangi bir yerinden kesin bilgi “çekiyor”.
Yeni olan kısım o küresel katmanda: Qwen Sparse Attention (QSA). Seyrek dikkat fikri yeni değil, DeepSeek’in DSA’sı da benzer işi yapıyor. Fark şurada: DSA önemli konumları token seviyesinde işaretleyen bir indeksleyici kullanıyor ve bağlam uzadıkça indeksleyicinin kendisi ciddi bir maliyet kalemine dönüşüyor.
QSA önce diziyi mikro bloklara topluyor, önemi blok seviyesinde tahmin ediyor, sonra sadece kazanan bölgelere dikkat uyguluyor. Böylece hem dikkatin hem de “nereye bakayım” hesabının maliyeti düşüyor. Ayrıca her katman kendi sıkıştırmasını yapıyor, katmanlar arası indeks paylaşan yöntemlerin aksine.
Özetle: GDN hatırlıyor, QSA buluyor.
2. Artık bağlantı: dört şeritli yol
Normal bir Transformer’da bütün katmanlar aynı “artık akışa” (residual stream) yazıp aynı akıştan okur. Ağ derinleştikçe baştaki bilgiler sonradan gelenlerle karışıp seyreliyor.
Gated Residual (GR) bu tek şeridi dört paralel şeride çıkarıyor ve her katmanın hangi şeritten ne kadar okuyup hangisine ne kadar yazacağını içeriğe göre bir kapı belirliyor. Alibaba’nın ölçümünde şeritlerden biri kendiliğinden “uzun mesafe hattına” dönüşüp ilk dikkat katmanını orta ve sonraki katmanlara doğrudan bağlıyor. Artık durumu ayrıca FP8 saklanabiliyor, yani bellek trafiği de düşüyor.
3. Optimizasyon: Muon ve batch ısınmasının sonu
Model Muon optimizatörüyle eğitilmiş. Gerçek anlamda iki boyutlu doğrusal dönüşüm olan ağırlıklar (dikkat, GDN, MoE uzmanları) Muon’a, gömme tabloları ve yönlendirici AdamW’ye bırakılmış.
Buradan çıkan pratik bulgu ilginç: büyük model eğitiminde standart sayılan batch size warmup gereksizmiş. Küçük batch’ten hedefe kademeli çıkmak sonucu iyileştirmemiş, üstüne yüzde 18,8 daha fazla optimizasyon adımı gerektirmiş. Nihai tarifte doğrudan hedef batch ile başlıyorlar.
Uzun Bağlamda Ne Kadar Hızlı? ⚡
Asıl satış argümanı burada.

Resmi rakamlar:
- 1 milyon token’da QSA çekirdeği prefill’de 7,6 kat, decode’da 4,9 kat hızlanma veriyor.
- Gerçek servis koşullarına yakın bir kurulumda (yüzde 90 önek önbelleği isabeti), 1 milyon token bağlamda Qwen3.7-Plus’ın 8,6 katı prefill verimi.
Prefill, modelin size cevap yazmaya başlamadan önce girdiyi okuduğu aşama. Uzun bağlamla çalışan bir ajanda beklemenin çoğu tam olarak orada geçiyor. Kendi metninizin kaç token tuttuğunu merak ediyorsanız token sayacı aracımıza yapıştırabilirsiniz.
Benchmark Skorları 📊
Bütün skorlar Alibaba’nın kendi ölçümü. Sütunlar: Flash-Next, yoğun 27 milyarlık Qwen3.8-27B, 397 milyarlık Qwen3.7-Plus, DeepSeek-V4-Flash-0731 ve Claude Opus 4.6 (Max).
Kodlama:
| Test | Flash-Next | 3.8-27B | 3.7-Plus | DeepSeek-V4-Flash | Opus 4.6 |
|---|---|---|---|---|---|
| DeepSWE 1.1 | 58,7 | 42,2 | 16,5 | 54,4 | – |
| SWE-bench Pro | 62,5 | 61,7 | 55,8 | 56,0 | 53,4 |
| SWE-bench Multilingual | 81,0 | 73,8 | 75,8 | – | 77,5 |
| NL2Repo-Bench | 48,1 | 42,3 | 41,1 | 54,2 | 47,6 |
| LiveCodeBench v6 | 91,9 | 90,3 | 89,6 | 90,6 | 88,8 |
Ajan ve genel:
| Test | Flash-Next | 3.8-27B | 3.7-Plus | DeepSeek-V4-Flash | Opus 4.6 |
|---|---|---|---|---|---|
| CoWorkBench (uzun soluklu ofis işi) | 73,9 | 70,7 | 65,1 | 45,1 | 68,2 |
| JobBench (mesleki görevler) | 55,7 | 33,4 | 27,6 | 41,3 | 36,6 |
| Toolathlon Verified (araç kullanımı) | 73,5 | 67,1 | 50,6 | 70,3 | – |
| IFBench (talimat takibi) | 81,3 | 79,5 | 79,1 | 79,2 | 62,5 |
| GPQA Diamond | 91,7 | 89,2 | 90,3 | 90,8 | 91,3 |
| HLE | 35,9 | 30,8 | 34,7 | 33,8 | 40,0 |
Görsel tarafta da AndroidWorld’de 84,5, LVBench’te (uzun video) 76,6, RealWorldQA’da 88,5, MathVision’da 90,6 (kod yorumlayıcıyla 95,7) alıyor. Bilgisayar kullanımında (OSWorld 2.0) kısmi skor 52,3, tam görev tamamlama ise 19,4; yani bilgisayarı baştan sona kendi kullanma işi hâlâ herkes için zor.
Rakamların tamamı Alibaba’nın kendi koşturduğu testler ve şirketler doğal olarak iyi göründükleri testleri seçer. Buradaki fark şu: ağırlıklar açık, yani bu skorlar bağımsız olarak tekrarlanabilir. Kapalı bir modelin doğrulanamayan iddiası değil.
Bir de şu var: SWE-bench Pro gibi testler “Claude Code harness” ile ölçülmüş. Yani skor sadece modelin değil, model + ajan iskeleti ikilisinin skoru.
Temel model tarafı
Ham (post-training öncesi) modelde de tablo benzer: 14 testin 8’inde Flash-Next-Base birinci, aralarında MMLU-Pro (73,23), SuperGPQA (51,36), BBH (90,87), EvalPlus (78,76) ve SWEBench-Pretrain (50,99) var. Kalanlarda 397 milyarlık Qwen3.7-Plus-Base’e yakın duruyor. 6 milyar aktif parametre için dikkat çekici bir sonuç.
Fiyatı Ne Kadar? 💸
Üretim sürümü QwenCloud’da qwen3.8-flash adıyla servis ediliyor: varsayılan olarak 1 milyon token bağlam ve yerleşik resmi araçlarla geliyor.
| Kalem | 1 milyon token başına |
|---|---|
| Girdi | $0,16 |
| Çıktı | $0,47 |
Kıyas için: aynı ailenin amiral gemisi Qwen3.8-Max‘te bu rakamlar $2 ve $6. Yani Flash-Next girdide yaklaşık 12 kat, çıktıda 13 kat ucuz. Yüksek hacimli, araç çağıran, günlerce koşan ajanlar için asıl fark burada.
Kendi iş yükünüzde ne tutacağını LLM maliyet hesaplayıcımızda Claude ve GPT fiyatlarıyla yan yana görebilirsiniz.
Nasıl Kullanılır?
API hem OpenAI hem Anthropic uyumlu. Anahtarı QwenCloud’dan alıyorsunuz:
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ.get("DASHSCOPE_API_KEY"),
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
cevap = client.chat.completions.create(
model="qwen3.8-flash",
messages=[{"role": "user", "content": "İki sıralı bağlı listeyi birleştiren Python fonksiyonu yaz."}],
extra_body={"enable_thinking": True},
reasoning_effort="xhigh", # xhigh, medium veya low
stream=True,
)
Türkiye’den en makul gecikme Singapur ucunda (dashscope-intl); diğerleri Pekin ve ABD Virginia.
Claude Code ile: Qwen API’si Anthropic protokolünü desteklediği için tek yapmanız gereken üç ortam değişkeni:
export ANTHROPIC_MODEL="qwen3.8-flash"
export ANTHROPIC_SMALL_FAST_MODEL="qwen3.8-flash"
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=<api_anahtariniz>
claude
Codex (OpenAI Responses protokolü), Qoder CLI, Qwen Code ve OpenClaw da destekleniyor. Alibaba ayrıca kendi verimlilik platformu QwenWork’ün yeni “Standard” modunu bu modelle çalıştırıyor.
Kendi sunucunuzda
Ağırlıklar Hugging Face ve ModelScope’ta. vLLM örneği:
vllm serve Qwen/Qwen3.8-Flash-Next \
--tensor-parallel-size 4 \
--max-model-len 262144 \
--enable-auto-tool-choice --tool-call-parser qwen3_coder
SGLang ve TokenSpeed için de aynı bayraklar geçerli. Hızlı deneme için transformers serve OpenAI uyumlu bir uç nokta açıyor; llama.cpp ve Unsloth tarafı da destekliyor.
Örnekleme ayarları: düşünme modunda temperature=1.0, top_p=0.95, top_k=20, talimat modunda temperature=0.7, top_p=0.80, top_k=20, presence_penalty=1.5.
Aktif parametre 6 milyar diye kanmayın: ağırlıkların tamamı belleğe yüklenmek zorunda. 125 milyarlık gövde 4 bit nicemlemeyle kabaca 65-70 GB, üstüne 51 milyarlık n-gram tablosu ve KV önbelleği geliyor.
İyi haber, n-gram tablosunun GPU’da durması gerekmemesi; onu sistem belleğine bırakabiliyorsunuz. Yine de bu model tek 24 GB’lık kartın işi değil. Tek kartla yerelde çalıştırmak istiyorsanız doğru adres Apache 2.0 lisanslı Qwen3.8-27B.
Lisans
Lisans Apache 2.0 değil, qwen-community-1.0. Qwen ailesinde küçük modellerin Apache 2.0 rahatlığına alışkınsanız, bu modeli bir ürüne koymadan önce lisans metnini okuyun.
Kimin İçin Mantıklı?
- Yüksek hacimli, araç çağıran ajanlar: Fiyat ve uzun bağlam verimi bu modelin bütün varlık sebebi. Toolathlon ve CoWorkBench skorları da bunu destekliyor.
- Uzun bağlamla çalışan kod asistanları: 1 milyon token bağlam, SWE-bench Multilingual’da 81,0 ve token başına birkaç kuruş.
- Mimariyle ilgilenen araştırmacılar: Qwen4’ün üstüne kurulacağı yapıyı bugünden inceleyebilirsiniz. Zaten yayınlanma sebebi bu.
- Tek ekran kartıyla yerelde çalıştırmak isteyenler: Bu model değil. Qwen3.8-27B‘ye bakın.
Sıkça Sorulan Sorular
Soru: Qwen3.8-Flash-Next ne zaman çıktı? Cevap: Ağustos 2026. Ağırlıklar 24 Ağustos 2026’da Hugging Face ve ModelScope’ta yayınlandı.
Soru: Qwen3.8-Flash-Next kaç parametre? Cevap: 125 milyar toplam, her token’da 6 milyarı aktif. Ayrıca 51 milyarlık bir n-gram gömme tablosu ve 4 milyarlık MTP modülü var. N-gram tablosu çarpma işlemine girmediği için token başına hesap yükünü artırmıyor.
Soru: Qwen4 ne zaman çıkacak? Cevap: Alibaba tarih vermedi. Söylediği şey, Qwen3.8-Flash-Next’in Qwen4 ailesinin üstüne kurulacağı mimarinin erken sürümü olduğu ve topluluk incelesin diye önden yayınlandığı.
Soru: Qwen3.8-Flash-Next açık kaynak mı, indirebilir miyim? Cevap: Ağırlıklar indirilebilir durumda, ama lisans Apache 2.0 değil, qwen-community-1.0. Doğru terim “açık ağırlıklı”: model dosyaları verildi, eğitim verisi verilmedi.
Soru: Qwen3.8-Flash-Next fiyatı ne kadar? Cevap: QwenCloud’da qwen3.8-flash adıyla 1 milyon token başına $0,16 girdi ve $0,47 çıktı. Kendi sunucunuzda çalıştırırsanız API ücreti yok, donanım maliyeti var.
Soru: Bağlam penceresi ne kadar? Cevap: 262.144 token yerel destek, YaRN gibi RoPE ölçekleme yöntemleriyle 1 milyon token’a kadar. QwenCloud’daki üretim sürümü zaten varsayılan 1 milyonla geliyor.
Soru: Kaç GB VRAM gerekiyor? Cevap: 4 bit nicemlemeyle 125 milyarlık gövde için kabaca 65-70 GB, üstüne KV önbelleği. 51 milyarlık n-gram tablosu sistem belleğine bırakılabiliyor. Tek tüketici kartıyla rahat çalışacak bir model değil.
Soru: Ollama veya llama.cpp ile çalışır mı? Cevap: Depo llama.cpp ve Unsloth’u yerel seçenekler arasında sayıyor. Sunucu tarafında SGLang, vLLM ve TokenSpeed için hazır komutlar var. Yeni bir mimari olduğu için araçların güncel sürümünü kullanın.
Soru: Qwen3.8-Flash-Next mi, Qwen3.8-27B mi? Cevap: Tek ekran kartında yerel çalıştırma istiyorsanız 27B (Apache 2.0, yoğun mimari). Ucuz API, 1 milyon token bağlam ve uzun soluklu ajan işleri istiyorsanız Flash-Next. Skorlarda Flash-Next çoğu testte önde.
Soru: Claude Code ile kullanabilir miyim? Cevap: Evet. ANTHROPIC_BASE_URL değerini https://dashscope-intl.aliyuncs.com/apps/anthropic yapıp ANTHROPIC_MODEL=qwen3.8-flash verdiğinizde Claude Code doğrudan bu modele bağlanıyor. Codex, Qoder CLI, Qwen Code ve OpenClaw da destekleniyor.
Soru: Türkçe biliyor mu? Cevap: Evet, Türkçe soru sorup Türkçe cevap alabilirsiniz. Çok dilli testlerde (MMMLU 84,86, MGSM 89,33) iyi duruyor ama Alibaba ayrı bir Türkçe skoru paylaşmadı.
Sağlıcakla kalın… 🙂
