Özet: 30 Saniyede Qwen3.8-Max
  • Qwen3.8-Max, Alibaba’nın 2 Ağustos 2026‘da yayına aldığı yeni amiral gemisi modeli. 2,4 trilyon parametre, 95 milyarı aktif (MoE mimarisi).
  • Metin, görsel ve video okuyup metin üretiyor. Bağlam penceresi 1 milyon token sınıfında.
  • Tek bir görevde 125 saat (yaklaşık 5 gün) kimseye sormadan çalışıp bir makine öğrenmesi makalesindeki deneyi sıfırdan kurdu, altı bulgusunu doğruladı ve sonra makaleyi geçen yeni bir yöntem buldu.
  • Kodlama ve ajan testlerinin çoğunda Claude Opus 4.8’i geçiyor, Claude Fable 5 ve GPT-5.6 Sol ile bazı testlerde başa baş, bazılarında geride.
  • API fiyatı 1 milyon token başına $2 girdi / $6 çıktı. Tekrar eden girdi $0,25.
  • Alibaba’nın Max sınıfında ilk kez açık ağırlık verdiği model. Ağırlıklar 12 Ağustos 2026‘da Hugging Face’e yüklendi, ama Apache 2.0 ile değil, kendi yazdığı Qwen3.8-Max lisansıyla.
  • İki gün sonra, 14 Ağustos’ta Qwen3.8-27B de çıktı. Yoğun 27 milyarlık model, Apache 2.0, tek kartta çalışabiliyor.

Bir yapay zekaya “şu makaledeki deneyi baştan kur, sonra da geliştir” derseniz ne olur? Normalde birkaç turda tıkanır, siz araya girip yönlendirirsiniz.

Alibaba’nın 2 Ağustos 2026‘da yayına aldığı Qwen3.8-Max modeli ise bu işi 125 saat boyunca, yani kesintisiz beş gün, hiç kimseye danışmadan yaptı. Elinde sadece makale ve bir grup GPU vardı: başlangıç kodu yok, hazır iş akışı yok. Yaklaşık 7.600 satır kod yazdı, 1.100’den fazla işlem yaptı, 33 tur GPU eğitimi koşturdu ve sonunda makalenin kendi yöntemini geçen yeni bir yöntem buldu.

Model ilk kez 19 Temmuz’da Şanghay’daki Dünya Yapay Zeka Konferansı’nda önizleme olarak gösterilmişti. Şimdi herkese açıldı, resmi skorları ve demo videoları da yayınlandı. Gelin bu 2,4 trilyon parametrelik devin ne yaptığına bakalım. 👇🏻

0:00
Qwen3.8-Max tanıtım videosu, Alibaba Qwen

Qwen3.8-Max Nedir?

Qwen3.8-Max, Çinli Alibaba Cloud‘un Qwen ailesindeki en büyük ve en yetenekli modeli. Şubat ayında incelediğimiz Qwen3.5 serisinin iki nesil ötesi.

Ne işe yarıyor? ChatGPT veya Claude ne yapıyorsa aynısı: soru soruyorsunuz, cevap veriyor. Kod yazıyor, belge okuyor, görsel analiz ediyor. Farkı üç yerde:

  • Girdi olarak video kabul ediyor. Metin ve görselin yanında video da veriyorsunuz, çıktı olarak metin alıyorsunuz.
  • 1 milyon token sınıfında bağlam penceresi var. Kabaca 750 bin kelime, yani birkaç roman ya da koca bir kod tabanı tek seferde.
  • Uzun soluklu işler için tasarlanmış. Alibaba’nın bütün tanıtımı “long-horizon” yani günlerce süren görevler üzerine kurulu.

2,4 trilyon parametre ne demek?

Parametre, modelin öğrendiği bilgiyi sakladığı ayar düğmeleri gibi düşünülebilir. 2,4 trilyon, bugün duyurulmuş en büyük rakamlardan biri. Temmuz ayında çıkan Kimi K3‘ün 2,8 trilyonundan biraz küçük.

Model seyrek uzman karışımı (sparse MoE) mimarisi kullanıyor. Yani her kelime için 2,4 trilyonun tamamı çalışmıyor, sadece 95 milyarı devreye giriyor.

Asıl önemli rakam: 95 milyar

Bir MoE modelinde toplam parametre pazarlama rakamıdır. Sunucu maliyetini, hızı ve modeli kendi donanımınızda çalıştırıp çalıştıramayacağınızı belirleyen, her token için kaç parametrenin çalıştığıdır. Qwen3.8-Max’te bu sayı 95 milyar, yani toplamın yaklaşık %4’ü.

Şöyle düşünün: kocaman bir hastaneye gidiyorsunuz ama sizinle sadece derdinize bakan birkaç doktor ilgileniyor. Hastane devasa, faturanız küçük. Alibaba’nın $2’lık girdi fiyatını nasıl verebildiği de büyük ölçüde buradan geliyor.

Bağlam penceresinin gerçek sayıları

“1 milyon token” pazarlama başlığı. API belgelerindeki gerçek limitler biraz daha düşük:

SınırDeğer
Maksimum girdi991.000 token
Maksimum girdi (düşünme açıkken)983.000 token
Maksimum çıktı131.000 token
Düşünme bütçesi262.000 token’a kadar

Kendi metniniz veya kod dosyanız kaç token tutuyor merak ediyorsanız, token sayacı aracımıza yapıştırıp saniyesinde görebilirsiniz.


Reklam

Gerçekte Neler Yaptı? 🤯

Rakamlar sıkıcı, yapılan işler değil. Alibaba’nın duyuruda paylaştığı otonom koşular ve videoları sırayla geçelim.

16 gün boyunca kendi kendini geliştiren bir yazılım

Modele “oh-my-cli adında bir proje kur” dendi ve bırakıldı. Model GitHub Issues üzerinde çalışan bir döngü kurdu: talep issue’ya dönüşüyor, bir ajan onu üstleniyor, kod yazılıyor, testler ve CI koşuyor, geçerse PR birleştiriliyor. Topluluk geri bildirimini ve kendi test sonuçlarını da bu döngüye besledi.

30 Temmuz 2026 itibarıyla, yaklaşık 16 günlük tamamen otonom çalışmanın sonucu: 265 commit, 127 PR, 151 issue. Bütün iz kaydı qwen-code-dev-bot/oh-my-cli deposunda açık duruyor.

0:00
10+ günlük otonom kodlama koşusu, Alibaba Qwen

125 saatte bir makaleyi tekrarladı, sonra geçti

Modele “Unified Data Selection for LLM Reasoning” adlı güncel bir makale verildi ve iki şey istendi: deneyi kodla tekrarla, sonra daha iyisini yap.

İlk 37 saatte boru hattının tamamını sıfırdan kurdu ve makalenin altı ana bulgusunu doğruladı. Kalan 88 saatte ise kendi hipotezlerini üretip test eden bir araştırma döngüsüne girdi: dört turda 18 farklı iyileştirme fikri denedi, her turun sonucunu bir sonrakine besledi ve sonunda makalenin yönteminden AIME24 matematik sınavında 2,7 puan daha iyi yeni bir yöntem çıkardı.

👉🏻 Bu koşunun interaktif kaydını Qwen’in sitesinde inceleyebilirsiniz.

24 saatlik yarışmada 458 insan takımını geçti

Model, Alibaba Cloud Tianchi platformundaki gerçek bir yarışmaya sokuldu: WWW2025 Multimodal Dialogue Intent Recognition Challenge, 526 insan takımı katılımcı. Görev, müşteri hizmetleri yazışmalarını hem metin hem ekran görüntüsüyle okuyup müşterinin ne istediğini bulmak.

24 saat sınırı içinde kuralları okudu, çözümü kendi kodladı. Metin tarafında BERT, MacBERT ve RoBERTa modellerini ince ayarlayıp birleştirdi; ekran görüntüleri için Qwen2.5-VL-7B’yi eğitti ve emin olamadığı görsellerde Chinese-CLIP’e danıştı. 45 gönderim boyunca doğruluğu 0,60’tan 0,853’e çıkardı ve 526 takımın 458’ini geçti (yüzde 87’si).

Yüzlerce meslekte gerçek işler

Alibaba modeli birkaç yüz yüksek katma değerli meslekte test etti. Örnekler:

  • Kurumsal uyum avukatı: yüzlerce belgelik bir arşivde tek geçişte 1.284 ilgili maddeyi buldu, incelemeyi bir saatin altında bitirdi. Aynı iş normalde bir hukuk ekibinin bir haftasını alıyor.
  • UI/UX tasarımcı: NOVA adlı dijital bankacılık uygulaması için 8 ekranlık, tutarlı tasarım sistemine sahip etkileşimli prototipi tek seferde çıkardı, sıfır revizyon turuyla.
  • Restoran kurucusu: yüzden fazla tedarik brifingini okuyup 26 yemeklik tam menü hazırladı; her yemekte ortalama kalori ve malzeme kaynağı yazıyor, gıda maliyet oranı %33,8’de tutulmuş.
  • İnşaat mühendisi: tek bir çizim setinden 30 katlı ofis kulesinin deprem modelini tarayıcıda kurdu; doğal periyot, taban kesme kuvveti ve katlar arası ötelenme oranı üzerine gelince anlık okunuyor.
0:00
Yüzlerce meslekte iş yetkinliği testi, Alibaba Qwen

Tek sohbette baştan sona kuantitatif yatırım stratejisi

Tek satırlık bir görev tanımından yola çıkıp ETF rotasyon stratejisi geliştirdi: veri sistemini kurdu, temel faktörleri üretti, geriye dönük testleri analiz edip rotayı kendi düzeltti. Aşırı uyum sinyali gördüğünde fazla faktörleri budadı, farklı yollar aynı sinyallere çıkınca çoklu tohum doğrulaması ekledi.

Genişlik tarafı daha çarpıcı: momentum, değer, kalite, yatırım, düşük risk ve duyarlılık olmak üzere altı klasik faktör ailesinin her birini 50 araştırma yönüne böldü, yaklaşık 330 alt ajan çalıştırdı ve yaklaşık 6.000 geriye dönük test koşturdu. Seçilen faktörler 0,64 ile 1,48 arasında fazla Sharpe oranı verdi.

0:00
Tek oturumda uçtan uca kuant strateji, Alibaba Qwen

500 turda çip tasarımını 12 kat küçülttü

Model bir GCD/RSA kriptografi donanım hızlandırıcısını sıfırdan tasarladı. Elinde boş modül şablonları ve bir doğrulama betiği vardı, referans tasarım yoktu. Iverilog (simülasyon), Yosys (sentez) ve OpenROAD (fiziksel tasarım) araçlarının kurulu olduğu bir kum havuzunda çalıştı.

Tek bir kesintisiz koşuda yaklaşık 500 tur ve 71 değerlendirme yaptı. İlk çalışan tasarımı 8.298 kapı kullanıyordu; bunu 678 kapıya indirdi. En büyük sıçrama 22. turda geldi: pahalı 16 bitlik donanım bölücüyü kaydırma-çıkarma mimarisiyle değiştirip tek hamlede 6.288 kapı sildi.

Fiziksel yerleşimde de sonuç aynı: yonga alanı 106x106 µm²’den 46x46 µm²’ye düştü (yüzde 81 küçülme), tel uzunluğu 33.369 µm’den 4.187 µm’ye indi ve tasarım 500 MHz’de zamanlama kapattı. İşin can alıcı yanı, modelin yüzlerce tur sonra bile hâlâ yapısal atılım yapabilmesi; çoğu model erken kolay kazanımlardan sonra platoya oturuyor.

👉🏻 Tasarımın tur tur evrimini buradan izleyebilirsiniz.

365 günlük e-ticaret simülasyonunda parayı 4 katladı

E-Commerce Bench, Taobao ve Tmall’un gerçek (kimliksizleştirilmiş) işlem verisi üzerine kurulu bir yıllık işletme simülasyonu: 12 mağaza tipi, 60 ürün kategorisi, yaklaşık 600 tedarikçi, 7.000 ürün. Modele 100.000 yuan sermaye veriliyor ve aynı anda birkaç mağazayı yönetmesi isteniyor.

İşin içinde tuzaklar var: 600 tedarikçinin arasına 152 dolandırıcı satıcı gizlenmiş (üyelik ücreti tuzağı, düşük fiyat yemi, tarife uymayan mal). Üstüne mevsimsel talep dalgalanmaları, tayfun ve malzeme krizi gibi rastgele olaylar ekleniyor.

Qwen3.8-Max yıl sonunda 416.252 yuan bakiyeye ulaştı, yani parayı 4,16 katladı. İkinci sıradaki GLM 5.2’yi yüzde 38, kendi önceki nesli Qwen3.7-Max’i yüzde 152 geçti. Tedarikçi pazarlıklarında aynı satıcıyla tekrar tekrar konuştukça fiyatı kademeli düşürebilmesi, yani 2.000’den fazla tur boyunca öğrenmeye devam etmesi öne çıkan detay.

0:00
365 günlük e-ticaret simülasyonu, Alibaba Qwen

Görmenin iş akışına girmesi

Multimodal tarafta Alibaba’nın vurgusu ilginç: görsel yetenek sadece girdide değil, yürütme sırasında da çalışıyor.

200 sayfayı aşan finansal raporları ve karmaşık PDF’leri sayfalar arası bağlam kurarak okuyabiliyor. 100 saatten uzun videolarda ise sadece an bulmuyor; kişileri, olayları, zaman damgalarını ve sahneleri bir “video hafıza grafiği"ne diziyor.

Asıl fark üretim sırasında: model kendi ara sonucunu izleyip değerlendiriyor. Sayfa yerleşimini, nesnelerin yönünü, animasyon kalitesini kontrol ediyor. Televizyonun ters durduğunu ya da arayüzün kaydığını fark ettiğinde planı revize edip çıktıyı kendi düzeltiyor. Yani görme, ajan için sadece bir girdi kanalı değil, planla-uygula-doğrula-düzelt döngüsünün parçası.

0:00
Multimodal ajanlar, Alibaba Qwen
Bu rakamları nasıl okumalı?
Yukarıdaki koşuların hepsi Alibaba’nın kendi testleri ve kendi anlatımı. Bağımsız bir araştırmacı bunları henüz tekrarlamadı. Anthropic ve OpenAI de modellerini tanıtırken aynı şeyi yapıyor, yani sektörde normal, ama doğrulanmış değil.

Rakiplerine Karşı Nasıl? 📊

Alibaba resmi benchmark tablosunu bu kez yayınladı. Karşısındakiler bugünün en güçlü dört modeli: Claude Fable 5, Claude Opus 4.8, GPT-5.6 Sol ve Gemini 3.1 Pro.

Qwen3.8-Max modelinin Claude Fable 5, Claude Opus 4.8, GPT-5.6 Sol ve Gemini 3.1 Pro ile kodlama, ajan ve görsel benchmark skorlarının karşılaştırma tablosu
Qwen3.8-Max Benchmark Sonuçları, Alibaba Qwen

Tablo mobilde okumak zor, o yüzden önemli satırları yazayım.

Qwen3.8-Max’in açık ara lider olduğu yerler:

  • PaperBench (bilimsel makale tekrarı): 93,0. Fable 5 ve GPT-5.6 Sol’un ikisini de geçiyor.
  • TerminalBench-2.1 (terminal ajanı): 86,6. İki Claude modelinin de üstünde, GPT-5.6 Sol’un (88,8) hafif gerisinde.
  • OSWorld-Verified (bilgisayarı kendi kullanma): 86,1. Buradaki en yüksek skor.
  • ERQA (bedenlenmiş akıl yürütme): 77,8. En yakın rakip 70,0.
  • PerceptionBench (görsel algı): 63,5. Fark belirgin.
  • LVBench (uzun video anlama): 81,8. Video tarafında rakipsiz görünüyor.
  • Vision2Web (görselden web geliştirme): 69,0.
  • CoWorkBench (profesyonel iş görevleri): 74,8, sadece Fable 5’in (75,9) gerisinde.

Geride kaldığı yerler:

  • SWE-Pro (yazılım mühendisliği): 67,7. Fable 5 burada 80,0 ile açık ara önde, Opus 4.8 bile (69,2) üstünde.
  • FrontierSWE: 73,5. Fable 5 88,8. Yine de kendi önceki sürümü Qwen3.7-Max’in 40,7’sinden devasa bir sıçrama.
  • JobBench (ajanların insan iş akışlarını güçlendirmesi): 53,4, Fable 5 57,4.
  • Agents’ Last Exam: 52,4, GPT-5.6 Sol 53,6. Kıl payı fark.
  • MobileWorld (mobil ajan kullanımı): 77,8, Fable 5 85,5.

Toparlarsak: Qwen3.8-Max araştırma, terminal, bilgisayar kullanımı ve görsel/video işlerinde liderliğe oynuyor. Saf yazılım mühendisliğinde ise Claude Fable 5 hâlâ net biçimde önde. Kendi bir önceki nesline göre sıçrama çok sert: FrontierSWE’de 40,7’den 73,5’e çıkmış.

Bu skorları nasıl okumalı?
Tablodaki bütün rakamlar Alibaba’nın kendi ölçümü. Şirketler kendi tablolarında iyi göründükleri testleri seçme eğilimindedir. İyi haber şu: ağırlıklar 12 Ağustos’ta yayınlandığı için bu skorlar artık bağımsız olarak tekrarlanabilir durumda, kapalı bir modelin iddiası olmaktan çıktı.

Fiyatı Ne Kadar, Ücretsiz mi? 💸

En pratik deneme yolu Qwen Chat. Sınırlı biçimde ücretsiz kullanabiliyorsunuz.

Kendi uygulamanıza bağlamak isterseniz API fiyatları şöyle (1 milyon token başına):

KalemFiyat
Girdi (yeni içerik)$2,00
Girdi (tekrar eden içerik)$0,25
Çıktı (modelin yazdığı)$6,00

İki nokta önemli:

Kademeli fiyat yok. Uzun istem gönderdiğinizde fiyat artmıyor. 1 milyon token’lık dev bir istek de, 2 bin token’lık kısa bir soru da aynı tarifeden işliyor. Bazı rakiplerde 200 bin token’ı geçince tarife iki katına çıkıyor, burada öyle bir şey yok.

Tekrar eden içerik sekizde bir fiyata sayılıyor. Aynı uzun belgeyi veya kod tabanını her istekte tekrar gönderiyorsanız, ikinci seferden itibaren $2 yerine $0,25 ödüyorsunuz.

Kıyas için: Kimi K3’te girdi $3, çıktı $15. Claude ve GPT’nin amiral gemileri bunun da üstünde. Qwen3.8-Max, bu sınıfın en ucuzlarından.

Bu rakamlar sizin işinizde ne tutar? LLM maliyet hesaplayıcımızda girdi ve çıktı token sayınızı yazıp Qwen’i GPT ve Claude ile yan yana kıyaslayabilirsiniz.

Hız sınırları da cömert: dakikada 2 milyon token ve 15 bin istek.


Geliştiriciyseniz: 5 Satırda Başlangıç

API hem OpenAI hem de Anthropic uyumlu. Anahtarı QwenCloud‘dan alıyorsunuz. Yani ChatGPT ya da Claude için yazdığınız kod, iki satır değişiklikle Qwen3.8-Max’e bağlanıyor:

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ.get("DASHSCOPE_API_KEY"),
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",  # tek fark burası
)

cevap = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{"role": "user", "content": "Qwen3.8-Max'i tek cümleyle anlat."}],
    extra_body={"enable_thinking": True},
    reasoning_effort="xhigh",   # xhigh, medium veya low
    stream=True,
)

Üç incelik var:

  • enable_thinking düşünme modunu açıyor. Açtığınızda maksimum girdi 991 binden 983 bin token’a düşüyor, çünkü düşünme adımları da bağlam penceresinden yer yiyor.
  • reasoning_effort üç kademe kabul ediyor: low, medium, xhigh. Varsayılan xhigh, yani en pahalı ve en yavaş kademe. Basit işlerde düşürmek hem parayı hem süreyi ciddi kısar.
  • Uç nokta bölgesi seçilebiliyor. Türkiye’den en makul gecikme Singapur ucunda: dashscope-intl. Diğerleri Pekin (dashscope) ve ABD Virginia (dashscope-us).

Claude Code ile kullanmak

Qwen API’si Anthropic protokolünü desteklediği için Claude Code’u doğrudan bu modele bağlayabiliyorsunuz:

export ANTHROPIC_MODEL="qwen3.8-max"
export ANTHROPIC_SMALL_FAST_MODEL="qwen3.8-max"
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=<api_anahtariniz>
claude

Aynı şekilde Codex (OpenAI Responses protokolü), Qoder CLI, Qwen Code ve OpenClaw da destekleniyor. Alibaba modeli zaten bu araçların hepsinde ayrı ayrı eğitmiş, tek bir harness’a bağımlı değil.


Ağırlıklar Açıldı: Qwen3.8-Max Lisansı

Duyuruda “önümüzdeki hafta” denmişti ve söz tutuldu: 12 Ağustos 2026‘da Qwen/Qwen3.8-2.4T-A95B deposu Hugging Face’te yayına girdi. Yanında resmi bir FP8 sürümü de var, üstüne llama.cpp, LM Studio, Jan ve Ollama için onlarca topluluk nicemlemesi eklendi.

Bu, Qwen ailesinde bir Max sınıfı modelin ilk kez açılması oldu. Şimdiye kadar açık ağırlık küçük ve orta modellere mahsustu, amiral gemisi kapalı kalıyordu.

Ama lisans Apache 2.0 değil. Alibaba bu model için qwen3.8-max adında kendi lisansını yazdı. Küçük ve orta modellerdeki Apache 2.0 rahatlığını burada beklemeyin. Öne çıkan maddeler:

KonuNe diyor
Ticari kullanımSerbest
Değiştirme, dağıtma, ince ayarSerbest, türev çalışma üretebilirsiniz
AtıfTelif notunu ve lisans metnini kopyalarda tutmak zorunlu
Büyük ürünler100 milyon aylık aktif kullanıcı ya da aylık 20 milyon dolar gelir üstündeyseniz model adını arayüzde açıkça göstermek zorundasınız
MaaS ve yapay zeka asistanı işleriArdışık 12 ayda 50 milyon doları aşan ciro varsa ayrı bir ticari lisans almanız gerekiyor

Yani tipik bir geliştirici, şirket içi kullanım ya da orta ölçekli ürün için pratikte serbestsiniz. Model üstüne büyük bir servis kurup ölçeklendirecekseniz lisans metnini avukatınıza okutun.

Bir de pratik soru var: açıldı da ne oldu? 2,4 trilyonluk modeli 4 bit sıkıştırmayla bile diske yazmak yaklaşık 1,2 TB yer istiyor. Bunu evde çalıştırmak mümkün değil; ağırlıkların asıl anlamı araştırmacılar, bulut sağlayıcılar ve kendi altyapısına kuracak büyük ekipler için. Kendi donanımınızda çalıştırmak istiyorsanız asıl bakmanız gereken model bir alt başlıkta.

Açık kaynak mı, açık ağırlıklı mı?
Yapay zekada “açık kaynak” kelimesi yazılımdaki anlamıyla birebir aynı değil. Alibaba modelin ağırlıklarını (öğrendiği bilgiyi) verdi; hangi veriyle ve hangi kodla eğitildiğini vermedi. Doğru terim “açık ağırlıklı” (open-weight). Sizin için pratik fark yine de büyük: ChatGPT’yi indiremezsiniz, açık ağırlıklı bir modeli indirip kendi sunucunuzda çalıştırabilirsiniz. Verileriniz dışarı çıkmaz, aylık abonelik ödemezsiniz.

Qwen3.8-27B Var mı? Evet, Çıktı

Kısa cevap: var. Max’in ağırlıklarından iki gün sonra, 14 Ağustos 2026‘da Qwen/Qwen3.8-27B deposu açıldı ve bu sefer lisans Apache 2.0. Aynı gün Unsloth’un GGUF dosyaları da yayınlandı, yani Ollama ve llama.cpp ile bugün indirip çalıştırabilirsiniz.

Evde çalıştırılabilir olan model bu. Max 1,2 TB’lık bir canavarken 27B tek ekran kartına sığıyor.

Qwen3.8-27B
MimariYoğun (dense), 64 katman
Parametre27 milyar, hepsi her token’da aktif
Bağlam262.144 token, ~1 milyona kadar genişletilebiliyor
GirdiMetin + görsel + video
DüşünmeVarsayılan açık, enable_thinking ile kapatılabiliyor
Akıl yürütme seviyesixhigh, medium, low olarak ayarlanabiliyor
Araç kullanımıVar
LisansApache 2.0

Model kartındaki skorlar (yine Alibaba’nın kendi ölçümü):

TestSkor
SWE-bench Pro61,7
GPQA Diamond89,2
OSWorld-Verified (bilgisayar kullanımı)84,3
WebArena-Verified (tarayıcı kullanımı)64,8
MathVision94,6

27 milyarlık bir modelin GPQA Diamond’da 89,2 alması dikkat çekici; bir yıl önce bu seviye yalnızca kapalı amiral gemisi modellerinde vardı.

Yoğun mu, MoE mi? Yerelde hangisi rahat koşar

Qwen3.8-27B yoğun (dense) bir model: 27 milyar parametrenin tamamı her token’da çalışıyor.

Bir önceki kuşaktaki Qwen3.6-35B-A3B ise uzman karışımı (MoE) ve her token için yalnızca 3 milyar parametre devreye giriyor. Yani ismi büyük olsa da aynı donanımda belirgin biçimde hızlı koşar.

Kaliteyi önceliyorsanız 3.8-27B, hızı ve düşük bellek kullanımını önceliyorsanız 3.6-35B-A3B. İkisi de Apache 2.0.

Ne kadar VRAM gerekiyor?

Kaba hesap basit: yaklaşık olarak parametre sayısı çarpı her parametrenin kaç bayt tuttuğu. 27 milyarlık yoğun model için:

NicemlemeYaklaşık ağırlık boyutu
BF16 (sıkıştırmasız)~54 GB
FP8~27 GB
Q6~22 GB
Q4~15-16 GB

Bunlar sadece ağırlıklar. Üstüne bir de bağlam penceresi için KV önbelleği geliyor ve uzun bağlamda bu rakam hızla büyüyor. 262 bin token’lık pencereyi sonuna kadar kullanacaksanız tek kart yetmez; Qwen’in kendi dokümanı en iyi performans için 8 GPU’ya bölmeyi öneriyor, bellek yetmediğinde de bağlamı kısmayı ama akıl yürütmeyi korumak için 128 bin token’ın altına inmemeyi söylüyor.

Pratikte 24 GB’lık tek bir kartla Q4 nicemlenmiş 27B’yi makul bir bağlamla çalıştırmak mümkün. Bellek sıkışıyorsa bağlamı kısın, modeli küçültmeyin.

Hazır nicemlenmiş sürümler mevcut: GGUF dosyaları (Ollama ve llama.cpp için) Unsloth deposunda modelle aynı gün yayınlandı, Max tarafında da resmi FP8 sürümü Qwen’in kendi deposunda duruyor.

Hangi modeli indirmeli?
  • Tek ekran kartınız var, kaliteyi önemsiyorsunuz: Qwen3.8-27B, Q4 GGUF. Apache 2.0, görsel ve video okuyor, düşünme modu açık geliyor.
  • Hız ve düşük bellek önceliğiniz: Qwen3.6-35B-A3B. MoE olduğu için her token’da sadece 3 milyar parametre çalışıyor.
  • Sunucu filonuz ve 1,2 TB diskiniz var: Qwen3.8-2.4T-A95B, yani Max’in kendisi. Ama lisansı Apache 2.0 değil, yukarıdaki tabloya bakın.

Kimi K3 ile Qwen3.8-Max Arasındaki Fark Ne?

İki model üç hafta arayla çıktı ve ikisi de Çin merkezli. Kısa kıyas:

Kimi K3Qwen3.8-Max
ŞirketMoonshot AIAlibaba Cloud
Parametre2,8 trilyon2,4 trilyon
Aktif parametre896 uzmandan 16’sı95 milyar
Video girdisiVarVar
Girdi / Çıktı fiyatı$3 / $15$2 / $6
AğırlıklarYayınlandıYayınlandı (12 Ağustos)
Güçlü yanıUzun soluklu yazılımAraştırma, terminal, görsel

Kimi K3 incelememizde o modeli ayrıntılı anlatmıştık.


Sıkça Sorulan Sorular

Soru: Qwen3.8-Max ne zaman çıktı? Cevap: Alibaba modeli 19 Temmuz 2026‘da Şanghay’daki Dünya Yapay Zeka Konferansı’nda önizleme olarak duyurdu, 2 Ağustos 2026‘da ise genel kullanıma açtı.

Soru: Qwen3.8-Max kaç parametre? Cevap: Toplam 2,4 trilyon, bunun 95 milyarı aktif. Seyrek uzman karışımı (MoE) mimarisi kullandığı için her token’da parametrelerin yalnızca yüzde 4’ü çalışıyor. Maliyet ve hız açısından asıl belirleyici olan bu 95 milyarlık rakam.

Soru: Qwen3.8-Max ücretsiz mi? Cevap: Qwen Chat üzerinden sınırlı biçimde ücretsiz denenebiliyor. Geliştirici erişimi ücretli: 1 milyon token başına $2 girdi, $6 çıktı.

Soru: Qwen3.8-Max açık kaynak mı, indirebilir miyim? Cevap: Ağırlıklar 12 Ağustos 2026’da Hugging Face’te yayınlandı, indirebilirsiniz. Ama lisans Apache 2.0 değil, Alibaba’nın kendi yazdığı Qwen3.8-Max lisansı: ticari kullanım ve türev üretmek serbest, buna karşılık 100 milyon aylık aktif kullanıcı ya da aylık 20 milyon dolar gelir üstündeki ürünlerin model adını arayüzde göstermesi, 12 ayda 50 milyon doları aşan MaaS işlerinin de ayrı lisans alması gerekiyor. Doğru terim “açık ağırlıklı”: model dosyaları verildi, eğitim verisi verilmedi. Pratik not: 4 bit sıkıştırmayla bile yaklaşık 1,2 TB yer kaplıyor.

Soru: Qwen3.8-Max, Claude ve ChatGPT’den iyi mi? Cevap: Duruma göre. Araştırma tekrarı (PaperBench), terminal ajanı, bilgisayar kullanımı ve video anlamada resmi skorlarda önde. Saf yazılım mühendisliğinde (SWE-Pro, FrontierSWE) Claude Fable 5 açık farkla önde. Skorların hepsi Alibaba’nın kendi ölçümü.

Soru: Qwen3.8-Max bağlam penceresi ne kadar? Cevap: 1 milyon token sınıfında. API’de gerçek limitler 991 bin token girdi (düşünme açıkken 983 bin) ve 131 bin token çıktı.

Soru: Qwen3.8-27B diye bir model var mı? Cevap: Var. 14 Ağustos 2026’da Hugging Face’te yayınlandı ve lisansı Apache 2.0. Yoğun (dense) 27 milyar parametreli bir model; 262.144 token bağlam (yaklaşık 1 milyona genişletilebiliyor), görsel ve video girdisi, varsayılan açık düşünme modu ve ayarlanabilir akıl yürütme seviyesi sunuyor. Unsloth’un GGUF dosyaları aynı gün çıktığı için Ollama ve llama.cpp ile hemen çalıştırılabiliyor.

Soru: Qwen 27B çalıştırmak için kaç GB VRAM lazım? Cevap: Sadece ağırlıklar için kabaca BF16’da ~54 GB, FP8’de ~27 GB, Q4’te ~15-16 GB. Üstüne bağlam penceresi için KV önbelleği ekleniyor. 24 GB’lık tek kartta Q4 ile makul bir bağlamda çalışır; uzun bağlam için birden fazla GPU gerekir.

Soru: Qwen 27B mi 35B-A3B mi daha hızlı? Cevap: Genelde 35B-A3B. İsmi büyük olsa da uzman karışımı mimarisi sayesinde her token’da sadece 3 milyar parametre çalışıyor. Yoğun 27B’de 27 milyarın tamamı devrede.

Soru: Qwen3.8-Max’i Claude Code ile kullanabilir miyim? Cevap: Evet. Qwen API’si Anthropic protokolünü destekliyor. ANTHROPIC_BASE_URL değerini https://dashscope-intl.aliyuncs.com/apps/anthropic yapıp ANTHROPIC_MODEL=qwen3.8-max verdiğinizde Claude Code doğrudan bu modele bağlanıyor. Codex, Qoder CLI, Qwen Code ve OpenClaw da destekleniyor.

Soru: Qwen3.8-Max Türkçe biliyor mu? Cevap: Evet, Türkçe soru sorup Türkçe cevap alabilirsiniz. Alibaba bu sürüm için resmi bir Türkçe test skoru paylaşmadı, kendi işinizde denemek en sağlıklısı.


Sağlıcakla kalın… 🙂

Yapay Zeka Tarafından Oluşturulan İçerik Uyarısı
Bu blog tamamen yapay zeka tarafından oluşturulmuştur. Yapay zeka içerik oluşturmaya yardımcı olsa da, hala hatalar veya önyargılar içerebilir. Kritik detayları kullanmadan önce doğrulayın.