- Qwen3.8-Max, Alibaba’nın 2 Ağustos 2026‘da yayına aldığı yeni amiral gemisi modeli. 2,4 trilyon parametre, 95 milyarı aktif (MoE mimarisi).
- Metin, görsel ve video okuyup metin üretiyor. Bağlam penceresi 1 milyon token sınıfında.
- Tek bir görevde 125 saat (yaklaşık 5 gün) kimseye sormadan çalışıp bir makine öğrenmesi makalesindeki deneyi sıfırdan kurdu, altı bulgusunu doğruladı ve sonra makaleyi geçen yeni bir yöntem buldu.
- Kodlama ve ajan testlerinin çoğunda Claude Opus 4.8’i geçiyor, Claude Fable 5 ve GPT-5.6 Sol ile bazı testlerde başa baş, bazılarında geride.
- API fiyatı 1 milyon token başına $2 girdi / $6 çıktı. Tekrar eden girdi $0,25.
- Alibaba’nın Max sınıfında ilk kez açık ağırlık verdiği model. Ağırlıklar 12 Ağustos 2026‘da Hugging Face’e yüklendi, ama Apache 2.0 ile değil, kendi yazdığı Qwen3.8-Max lisansıyla.
- İki gün sonra, 14 Ağustos’ta Qwen3.8-27B de çıktı. Yoğun 27 milyarlık model, Apache 2.0, tek kartta çalışabiliyor.
Bir yapay zekaya “şu makaledeki deneyi baştan kur, sonra da geliştir” derseniz ne olur? Normalde birkaç turda tıkanır, siz araya girip yönlendirirsiniz.
Alibaba’nın 2 Ağustos 2026‘da yayına aldığı Qwen3.8-Max modeli ise bu işi 125 saat boyunca, yani kesintisiz beş gün, hiç kimseye danışmadan yaptı. Elinde sadece makale ve bir grup GPU vardı: başlangıç kodu yok, hazır iş akışı yok. Yaklaşık 7.600 satır kod yazdı, 1.100’den fazla işlem yaptı, 33 tur GPU eğitimi koşturdu ve sonunda makalenin kendi yöntemini geçen yeni bir yöntem buldu.
Model ilk kez 19 Temmuz’da Şanghay’daki Dünya Yapay Zeka Konferansı’nda önizleme olarak gösterilmişti. Şimdi herkese açıldı, resmi skorları ve demo videoları da yayınlandı. Gelin bu 2,4 trilyon parametrelik devin ne yaptığına bakalım. 👇🏻
Qwen3.8-Max Nedir?
Qwen3.8-Max, Çinli Alibaba Cloud‘un Qwen ailesindeki en büyük ve en yetenekli modeli. Şubat ayında incelediğimiz Qwen3.5 serisinin iki nesil ötesi.
Ne işe yarıyor? ChatGPT veya Claude ne yapıyorsa aynısı: soru soruyorsunuz, cevap veriyor. Kod yazıyor, belge okuyor, görsel analiz ediyor. Farkı üç yerde:
- Girdi olarak video kabul ediyor. Metin ve görselin yanında video da veriyorsunuz, çıktı olarak metin alıyorsunuz.
- 1 milyon token sınıfında bağlam penceresi var. Kabaca 750 bin kelime, yani birkaç roman ya da koca bir kod tabanı tek seferde.
- Uzun soluklu işler için tasarlanmış. Alibaba’nın bütün tanıtımı “long-horizon” yani günlerce süren görevler üzerine kurulu.
2,4 trilyon parametre ne demek?
Parametre, modelin öğrendiği bilgiyi sakladığı ayar düğmeleri gibi düşünülebilir. 2,4 trilyon, bugün duyurulmuş en büyük rakamlardan biri. Temmuz ayında çıkan Kimi K3‘ün 2,8 trilyonundan biraz küçük.
Model seyrek uzman karışımı (sparse MoE) mimarisi kullanıyor. Yani her kelime için 2,4 trilyonun tamamı çalışmıyor, sadece 95 milyarı devreye giriyor.
Bir MoE modelinde toplam parametre pazarlama rakamıdır. Sunucu maliyetini, hızı ve modeli kendi donanımınızda çalıştırıp çalıştıramayacağınızı belirleyen, her token için kaç parametrenin çalıştığıdır. Qwen3.8-Max’te bu sayı 95 milyar, yani toplamın yaklaşık %4’ü.
Şöyle düşünün: kocaman bir hastaneye gidiyorsunuz ama sizinle sadece derdinize bakan birkaç doktor ilgileniyor. Hastane devasa, faturanız küçük. Alibaba’nın $2’lık girdi fiyatını nasıl verebildiği de büyük ölçüde buradan geliyor.
Bağlam penceresinin gerçek sayıları
“1 milyon token” pazarlama başlığı. API belgelerindeki gerçek limitler biraz daha düşük:
| Sınır | Değer |
|---|---|
| Maksimum girdi | 991.000 token |
| Maksimum girdi (düşünme açıkken) | 983.000 token |
| Maksimum çıktı | 131.000 token |
| Düşünme bütçesi | 262.000 token’a kadar |
Kendi metniniz veya kod dosyanız kaç token tutuyor merak ediyorsanız, token sayacı aracımıza yapıştırıp saniyesinde görebilirsiniz.
Gerçekte Neler Yaptı? 🤯
Rakamlar sıkıcı, yapılan işler değil. Alibaba’nın duyuruda paylaştığı otonom koşular ve videoları sırayla geçelim.
16 gün boyunca kendi kendini geliştiren bir yazılım
Modele “oh-my-cli adında bir proje kur” dendi ve bırakıldı. Model GitHub Issues üzerinde çalışan bir döngü kurdu: talep issue’ya dönüşüyor, bir ajan onu üstleniyor, kod yazılıyor, testler ve CI koşuyor, geçerse PR birleştiriliyor. Topluluk geri bildirimini ve kendi test sonuçlarını da bu döngüye besledi.
30 Temmuz 2026 itibarıyla, yaklaşık 16 günlük tamamen otonom çalışmanın sonucu: 265 commit, 127 PR, 151 issue. Bütün iz kaydı qwen-code-dev-bot/oh-my-cli deposunda açık duruyor.
125 saatte bir makaleyi tekrarladı, sonra geçti
Modele “Unified Data Selection for LLM Reasoning” adlı güncel bir makale verildi ve iki şey istendi: deneyi kodla tekrarla, sonra daha iyisini yap.
İlk 37 saatte boru hattının tamamını sıfırdan kurdu ve makalenin altı ana bulgusunu doğruladı. Kalan 88 saatte ise kendi hipotezlerini üretip test eden bir araştırma döngüsüne girdi: dört turda 18 farklı iyileştirme fikri denedi, her turun sonucunu bir sonrakine besledi ve sonunda makalenin yönteminden AIME24 matematik sınavında 2,7 puan daha iyi yeni bir yöntem çıkardı.
👉🏻 Bu koşunun interaktif kaydını Qwen’in sitesinde inceleyebilirsiniz.
24 saatlik yarışmada 458 insan takımını geçti
Model, Alibaba Cloud Tianchi platformundaki gerçek bir yarışmaya sokuldu: WWW2025 Multimodal Dialogue Intent Recognition Challenge, 526 insan takımı katılımcı. Görev, müşteri hizmetleri yazışmalarını hem metin hem ekran görüntüsüyle okuyup müşterinin ne istediğini bulmak.
24 saat sınırı içinde kuralları okudu, çözümü kendi kodladı. Metin tarafında BERT, MacBERT ve RoBERTa modellerini ince ayarlayıp birleştirdi; ekran görüntüleri için Qwen2.5-VL-7B’yi eğitti ve emin olamadığı görsellerde Chinese-CLIP’e danıştı. 45 gönderim boyunca doğruluğu 0,60’tan 0,853’e çıkardı ve 526 takımın 458’ini geçti (yüzde 87’si).
Yüzlerce meslekte gerçek işler
Alibaba modeli birkaç yüz yüksek katma değerli meslekte test etti. Örnekler:
- Kurumsal uyum avukatı: yüzlerce belgelik bir arşivde tek geçişte 1.284 ilgili maddeyi buldu, incelemeyi bir saatin altında bitirdi. Aynı iş normalde bir hukuk ekibinin bir haftasını alıyor.
- UI/UX tasarımcı: NOVA adlı dijital bankacılık uygulaması için 8 ekranlık, tutarlı tasarım sistemine sahip etkileşimli prototipi tek seferde çıkardı, sıfır revizyon turuyla.
- Restoran kurucusu: yüzden fazla tedarik brifingini okuyup 26 yemeklik tam menü hazırladı; her yemekte ortalama kalori ve malzeme kaynağı yazıyor, gıda maliyet oranı %33,8’de tutulmuş.
- İnşaat mühendisi: tek bir çizim setinden 30 katlı ofis kulesinin deprem modelini tarayıcıda kurdu; doğal periyot, taban kesme kuvveti ve katlar arası ötelenme oranı üzerine gelince anlık okunuyor.
Tek sohbette baştan sona kuantitatif yatırım stratejisi
Tek satırlık bir görev tanımından yola çıkıp ETF rotasyon stratejisi geliştirdi: veri sistemini kurdu, temel faktörleri üretti, geriye dönük testleri analiz edip rotayı kendi düzeltti. Aşırı uyum sinyali gördüğünde fazla faktörleri budadı, farklı yollar aynı sinyallere çıkınca çoklu tohum doğrulaması ekledi.
Genişlik tarafı daha çarpıcı: momentum, değer, kalite, yatırım, düşük risk ve duyarlılık olmak üzere altı klasik faktör ailesinin her birini 50 araştırma yönüne böldü, yaklaşık 330 alt ajan çalıştırdı ve yaklaşık 6.000 geriye dönük test koşturdu. Seçilen faktörler 0,64 ile 1,48 arasında fazla Sharpe oranı verdi.
500 turda çip tasarımını 12 kat küçülttü
Model bir GCD/RSA kriptografi donanım hızlandırıcısını sıfırdan tasarladı. Elinde boş modül şablonları ve bir doğrulama betiği vardı, referans tasarım yoktu. Iverilog (simülasyon), Yosys (sentez) ve OpenROAD (fiziksel tasarım) araçlarının kurulu olduğu bir kum havuzunda çalıştı.
Tek bir kesintisiz koşuda yaklaşık 500 tur ve 71 değerlendirme yaptı. İlk çalışan tasarımı 8.298 kapı kullanıyordu; bunu 678 kapıya indirdi. En büyük sıçrama 22. turda geldi: pahalı 16 bitlik donanım bölücüyü kaydırma-çıkarma mimarisiyle değiştirip tek hamlede 6.288 kapı sildi.
Fiziksel yerleşimde de sonuç aynı: yonga alanı 106x106 µm²’den 46x46 µm²’ye düştü (yüzde 81 küçülme), tel uzunluğu 33.369 µm’den 4.187 µm’ye indi ve tasarım 500 MHz’de zamanlama kapattı. İşin can alıcı yanı, modelin yüzlerce tur sonra bile hâlâ yapısal atılım yapabilmesi; çoğu model erken kolay kazanımlardan sonra platoya oturuyor.
👉🏻 Tasarımın tur tur evrimini buradan izleyebilirsiniz.
365 günlük e-ticaret simülasyonunda parayı 4 katladı
E-Commerce Bench, Taobao ve Tmall’un gerçek (kimliksizleştirilmiş) işlem verisi üzerine kurulu bir yıllık işletme simülasyonu: 12 mağaza tipi, 60 ürün kategorisi, yaklaşık 600 tedarikçi, 7.000 ürün. Modele 100.000 yuan sermaye veriliyor ve aynı anda birkaç mağazayı yönetmesi isteniyor.
İşin içinde tuzaklar var: 600 tedarikçinin arasına 152 dolandırıcı satıcı gizlenmiş (üyelik ücreti tuzağı, düşük fiyat yemi, tarife uymayan mal). Üstüne mevsimsel talep dalgalanmaları, tayfun ve malzeme krizi gibi rastgele olaylar ekleniyor.
Qwen3.8-Max yıl sonunda 416.252 yuan bakiyeye ulaştı, yani parayı 4,16 katladı. İkinci sıradaki GLM 5.2’yi yüzde 38, kendi önceki nesli Qwen3.7-Max’i yüzde 152 geçti. Tedarikçi pazarlıklarında aynı satıcıyla tekrar tekrar konuştukça fiyatı kademeli düşürebilmesi, yani 2.000’den fazla tur boyunca öğrenmeye devam etmesi öne çıkan detay.
Görmenin iş akışına girmesi
Multimodal tarafta Alibaba’nın vurgusu ilginç: görsel yetenek sadece girdide değil, yürütme sırasında da çalışıyor.
200 sayfayı aşan finansal raporları ve karmaşık PDF’leri sayfalar arası bağlam kurarak okuyabiliyor. 100 saatten uzun videolarda ise sadece an bulmuyor; kişileri, olayları, zaman damgalarını ve sahneleri bir “video hafıza grafiği"ne diziyor.
Asıl fark üretim sırasında: model kendi ara sonucunu izleyip değerlendiriyor. Sayfa yerleşimini, nesnelerin yönünü, animasyon kalitesini kontrol ediyor. Televizyonun ters durduğunu ya da arayüzün kaydığını fark ettiğinde planı revize edip çıktıyı kendi düzeltiyor. Yani görme, ajan için sadece bir girdi kanalı değil, planla-uygula-doğrula-düzelt döngüsünün parçası.
Rakiplerine Karşı Nasıl? 📊
Alibaba resmi benchmark tablosunu bu kez yayınladı. Karşısındakiler bugünün en güçlü dört modeli: Claude Fable 5, Claude Opus 4.8, GPT-5.6 Sol ve Gemini 3.1 Pro.

Tablo mobilde okumak zor, o yüzden önemli satırları yazayım.
Qwen3.8-Max’in açık ara lider olduğu yerler:
- PaperBench (bilimsel makale tekrarı): 93,0. Fable 5 ve GPT-5.6 Sol’un ikisini de geçiyor.
- TerminalBench-2.1 (terminal ajanı): 86,6. İki Claude modelinin de üstünde, GPT-5.6 Sol’un (88,8) hafif gerisinde.
- OSWorld-Verified (bilgisayarı kendi kullanma): 86,1. Buradaki en yüksek skor.
- ERQA (bedenlenmiş akıl yürütme): 77,8. En yakın rakip 70,0.
- PerceptionBench (görsel algı): 63,5. Fark belirgin.
- LVBench (uzun video anlama): 81,8. Video tarafında rakipsiz görünüyor.
- Vision2Web (görselden web geliştirme): 69,0.
- CoWorkBench (profesyonel iş görevleri): 74,8, sadece Fable 5’in (75,9) gerisinde.
Geride kaldığı yerler:
- SWE-Pro (yazılım mühendisliği): 67,7. Fable 5 burada 80,0 ile açık ara önde, Opus 4.8 bile (69,2) üstünde.
- FrontierSWE: 73,5. Fable 5 88,8. Yine de kendi önceki sürümü Qwen3.7-Max’in 40,7’sinden devasa bir sıçrama.
- JobBench (ajanların insan iş akışlarını güçlendirmesi): 53,4, Fable 5 57,4.
- Agents’ Last Exam: 52,4, GPT-5.6 Sol 53,6. Kıl payı fark.
- MobileWorld (mobil ajan kullanımı): 77,8, Fable 5 85,5.
Toparlarsak: Qwen3.8-Max araştırma, terminal, bilgisayar kullanımı ve görsel/video işlerinde liderliğe oynuyor. Saf yazılım mühendisliğinde ise Claude Fable 5 hâlâ net biçimde önde. Kendi bir önceki nesline göre sıçrama çok sert: FrontierSWE’de 40,7’den 73,5’e çıkmış.
Fiyatı Ne Kadar, Ücretsiz mi? 💸
En pratik deneme yolu Qwen Chat. Sınırlı biçimde ücretsiz kullanabiliyorsunuz.
Kendi uygulamanıza bağlamak isterseniz API fiyatları şöyle (1 milyon token başına):
| Kalem | Fiyat |
|---|---|
| Girdi (yeni içerik) | $2,00 |
| Girdi (tekrar eden içerik) | $0,25 |
| Çıktı (modelin yazdığı) | $6,00 |
İki nokta önemli:
Kademeli fiyat yok. Uzun istem gönderdiğinizde fiyat artmıyor. 1 milyon token’lık dev bir istek de, 2 bin token’lık kısa bir soru da aynı tarifeden işliyor. Bazı rakiplerde 200 bin token’ı geçince tarife iki katına çıkıyor, burada öyle bir şey yok.
Tekrar eden içerik sekizde bir fiyata sayılıyor. Aynı uzun belgeyi veya kod tabanını her istekte tekrar gönderiyorsanız, ikinci seferden itibaren $2 yerine $0,25 ödüyorsunuz.
Kıyas için: Kimi K3’te girdi $3, çıktı $15. Claude ve GPT’nin amiral gemileri bunun da üstünde. Qwen3.8-Max, bu sınıfın en ucuzlarından.
Bu rakamlar sizin işinizde ne tutar? LLM maliyet hesaplayıcımızda girdi ve çıktı token sayınızı yazıp Qwen’i GPT ve Claude ile yan yana kıyaslayabilirsiniz.
Hız sınırları da cömert: dakikada 2 milyon token ve 15 bin istek.
Geliştiriciyseniz: 5 Satırda Başlangıç
API hem OpenAI hem de Anthropic uyumlu. Anahtarı QwenCloud‘dan alıyorsunuz. Yani ChatGPT ya da Claude için yazdığınız kod, iki satır değişiklikle Qwen3.8-Max’e bağlanıyor:
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ.get("DASHSCOPE_API_KEY"),
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1", # tek fark burası
)
cevap = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Qwen3.8-Max'i tek cümleyle anlat."}],
extra_body={"enable_thinking": True},
reasoning_effort="xhigh", # xhigh, medium veya low
stream=True,
)
Üç incelik var:
enable_thinkingdüşünme modunu açıyor. Açtığınızda maksimum girdi 991 binden 983 bin token’a düşüyor, çünkü düşünme adımları da bağlam penceresinden yer yiyor.reasoning_effortüç kademe kabul ediyor:low,medium,xhigh. Varsayılanxhigh, yani en pahalı ve en yavaş kademe. Basit işlerde düşürmek hem parayı hem süreyi ciddi kısar.- Uç nokta bölgesi seçilebiliyor. Türkiye’den en makul gecikme Singapur ucunda:
dashscope-intl. Diğerleri Pekin (dashscope) ve ABD Virginia (dashscope-us).
Claude Code ile kullanmak
Qwen API’si Anthropic protokolünü desteklediği için Claude Code’u doğrudan bu modele bağlayabiliyorsunuz:
export ANTHROPIC_MODEL="qwen3.8-max"
export ANTHROPIC_SMALL_FAST_MODEL="qwen3.8-max"
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=<api_anahtariniz>
claude
Aynı şekilde Codex (OpenAI Responses protokolü), Qoder CLI, Qwen Code ve OpenClaw da destekleniyor. Alibaba modeli zaten bu araçların hepsinde ayrı ayrı eğitmiş, tek bir harness’a bağımlı değil.
Ağırlıklar Açıldı: Qwen3.8-Max Lisansı
Duyuruda “önümüzdeki hafta” denmişti ve söz tutuldu: 12 Ağustos 2026‘da Qwen/Qwen3.8-2.4T-A95B deposu Hugging Face’te yayına girdi. Yanında resmi bir FP8 sürümü de var, üstüne llama.cpp, LM Studio, Jan ve Ollama için onlarca topluluk nicemlemesi eklendi.
Bu, Qwen ailesinde bir Max sınıfı modelin ilk kez açılması oldu. Şimdiye kadar açık ağırlık küçük ve orta modellere mahsustu, amiral gemisi kapalı kalıyordu.
Ama lisans Apache 2.0 değil. Alibaba bu model için qwen3.8-max adında kendi lisansını yazdı. Küçük ve orta modellerdeki Apache 2.0 rahatlığını burada beklemeyin. Öne çıkan maddeler:
| Konu | Ne diyor |
|---|---|
| Ticari kullanım | Serbest |
| Değiştirme, dağıtma, ince ayar | Serbest, türev çalışma üretebilirsiniz |
| Atıf | Telif notunu ve lisans metnini kopyalarda tutmak zorunlu |
| Büyük ürünler | 100 milyon aylık aktif kullanıcı ya da aylık 20 milyon dolar gelir üstündeyseniz model adını arayüzde açıkça göstermek zorundasınız |
| MaaS ve yapay zeka asistanı işleri | Ardışık 12 ayda 50 milyon doları aşan ciro varsa ayrı bir ticari lisans almanız gerekiyor |
Yani tipik bir geliştirici, şirket içi kullanım ya da orta ölçekli ürün için pratikte serbestsiniz. Model üstüne büyük bir servis kurup ölçeklendirecekseniz lisans metnini avukatınıza okutun.
Bir de pratik soru var: açıldı da ne oldu? 2,4 trilyonluk modeli 4 bit sıkıştırmayla bile diske yazmak yaklaşık 1,2 TB yer istiyor. Bunu evde çalıştırmak mümkün değil; ağırlıkların asıl anlamı araştırmacılar, bulut sağlayıcılar ve kendi altyapısına kuracak büyük ekipler için. Kendi donanımınızda çalıştırmak istiyorsanız asıl bakmanız gereken model bir alt başlıkta.
Qwen3.8-27B Var mı? Evet, Çıktı
Kısa cevap: var. Max’in ağırlıklarından iki gün sonra, 14 Ağustos 2026‘da Qwen/Qwen3.8-27B deposu açıldı ve bu sefer lisans Apache 2.0. Aynı gün Unsloth’un GGUF dosyaları da yayınlandı, yani Ollama ve llama.cpp ile bugün indirip çalıştırabilirsiniz.
Evde çalıştırılabilir olan model bu. Max 1,2 TB’lık bir canavarken 27B tek ekran kartına sığıyor.
| Qwen3.8-27B | |
|---|---|
| Mimari | Yoğun (dense), 64 katman |
| Parametre | 27 milyar, hepsi her token’da aktif |
| Bağlam | 262.144 token, ~1 milyona kadar genişletilebiliyor |
| Girdi | Metin + görsel + video |
| Düşünme | Varsayılan açık, enable_thinking ile kapatılabiliyor |
| Akıl yürütme seviyesi | xhigh, medium, low olarak ayarlanabiliyor |
| Araç kullanımı | Var |
| Lisans | Apache 2.0 |
Model kartındaki skorlar (yine Alibaba’nın kendi ölçümü):
| Test | Skor |
|---|---|
| SWE-bench Pro | 61,7 |
| GPQA Diamond | 89,2 |
| OSWorld-Verified (bilgisayar kullanımı) | 84,3 |
| WebArena-Verified (tarayıcı kullanımı) | 64,8 |
| MathVision | 94,6 |
27 milyarlık bir modelin GPQA Diamond’da 89,2 alması dikkat çekici; bir yıl önce bu seviye yalnızca kapalı amiral gemisi modellerinde vardı.
Qwen3.8-27B yoğun (dense) bir model: 27 milyar parametrenin tamamı her token’da çalışıyor.
Bir önceki kuşaktaki Qwen3.6-35B-A3B ise uzman karışımı (MoE) ve her token için yalnızca 3 milyar parametre devreye giriyor. Yani ismi büyük olsa da aynı donanımda belirgin biçimde hızlı koşar.
Kaliteyi önceliyorsanız 3.8-27B, hızı ve düşük bellek kullanımını önceliyorsanız 3.6-35B-A3B. İkisi de Apache 2.0.
Ne kadar VRAM gerekiyor?
Kaba hesap basit: yaklaşık olarak parametre sayısı çarpı her parametrenin kaç bayt tuttuğu. 27 milyarlık yoğun model için:
| Nicemleme | Yaklaşık ağırlık boyutu |
|---|---|
| BF16 (sıkıştırmasız) | ~54 GB |
| FP8 | ~27 GB |
| Q6 | ~22 GB |
| Q4 | ~15-16 GB |
Bunlar sadece ağırlıklar. Üstüne bir de bağlam penceresi için KV önbelleği geliyor ve uzun bağlamda bu rakam hızla büyüyor. 262 bin token’lık pencereyi sonuna kadar kullanacaksanız tek kart yetmez; Qwen’in kendi dokümanı en iyi performans için 8 GPU’ya bölmeyi öneriyor, bellek yetmediğinde de bağlamı kısmayı ama akıl yürütmeyi korumak için 128 bin token’ın altına inmemeyi söylüyor.
Pratikte 24 GB’lık tek bir kartla Q4 nicemlenmiş 27B’yi makul bir bağlamla çalıştırmak mümkün. Bellek sıkışıyorsa bağlamı kısın, modeli küçültmeyin.
Hazır nicemlenmiş sürümler mevcut: GGUF dosyaları (Ollama ve llama.cpp için) Unsloth deposunda modelle aynı gün yayınlandı, Max tarafında da resmi FP8 sürümü Qwen’in kendi deposunda duruyor.
- Tek ekran kartınız var, kaliteyi önemsiyorsunuz: Qwen3.8-27B, Q4 GGUF. Apache 2.0, görsel ve video okuyor, düşünme modu açık geliyor.
- Hız ve düşük bellek önceliğiniz: Qwen3.6-35B-A3B. MoE olduğu için her token’da sadece 3 milyar parametre çalışıyor.
- Sunucu filonuz ve 1,2 TB diskiniz var: Qwen3.8-2.4T-A95B, yani Max’in kendisi. Ama lisansı Apache 2.0 değil, yukarıdaki tabloya bakın.
Kimi K3 ile Qwen3.8-Max Arasındaki Fark Ne?
İki model üç hafta arayla çıktı ve ikisi de Çin merkezli. Kısa kıyas:
| Kimi K3 | Qwen3.8-Max | |
|---|---|---|
| Şirket | Moonshot AI | Alibaba Cloud |
| Parametre | 2,8 trilyon | 2,4 trilyon |
| Aktif parametre | 896 uzmandan 16’sı | 95 milyar |
| Video girdisi | Var | Var |
| Girdi / Çıktı fiyatı | $3 / $15 | $2 / $6 |
| Ağırlıklar | Yayınlandı | Yayınlandı (12 Ağustos) |
| Güçlü yanı | Uzun soluklu yazılım | Araştırma, terminal, görsel |
Kimi K3 incelememizde o modeli ayrıntılı anlatmıştık.
Sıkça Sorulan Sorular
Soru: Qwen3.8-Max ne zaman çıktı? Cevap: Alibaba modeli 19 Temmuz 2026‘da Şanghay’daki Dünya Yapay Zeka Konferansı’nda önizleme olarak duyurdu, 2 Ağustos 2026‘da ise genel kullanıma açtı.
Soru: Qwen3.8-Max kaç parametre? Cevap: Toplam 2,4 trilyon, bunun 95 milyarı aktif. Seyrek uzman karışımı (MoE) mimarisi kullandığı için her token’da parametrelerin yalnızca yüzde 4’ü çalışıyor. Maliyet ve hız açısından asıl belirleyici olan bu 95 milyarlık rakam.
Soru: Qwen3.8-Max ücretsiz mi? Cevap: Qwen Chat üzerinden sınırlı biçimde ücretsiz denenebiliyor. Geliştirici erişimi ücretli: 1 milyon token başına $2 girdi, $6 çıktı.
Soru: Qwen3.8-Max açık kaynak mı, indirebilir miyim? Cevap: Ağırlıklar 12 Ağustos 2026’da Hugging Face’te yayınlandı, indirebilirsiniz. Ama lisans Apache 2.0 değil, Alibaba’nın kendi yazdığı Qwen3.8-Max lisansı: ticari kullanım ve türev üretmek serbest, buna karşılık 100 milyon aylık aktif kullanıcı ya da aylık 20 milyon dolar gelir üstündeki ürünlerin model adını arayüzde göstermesi, 12 ayda 50 milyon doları aşan MaaS işlerinin de ayrı lisans alması gerekiyor. Doğru terim “açık ağırlıklı”: model dosyaları verildi, eğitim verisi verilmedi. Pratik not: 4 bit sıkıştırmayla bile yaklaşık 1,2 TB yer kaplıyor.
Soru: Qwen3.8-Max, Claude ve ChatGPT’den iyi mi? Cevap: Duruma göre. Araştırma tekrarı (PaperBench), terminal ajanı, bilgisayar kullanımı ve video anlamada resmi skorlarda önde. Saf yazılım mühendisliğinde (SWE-Pro, FrontierSWE) Claude Fable 5 açık farkla önde. Skorların hepsi Alibaba’nın kendi ölçümü.
Soru: Qwen3.8-Max bağlam penceresi ne kadar? Cevap: 1 milyon token sınıfında. API’de gerçek limitler 991 bin token girdi (düşünme açıkken 983 bin) ve 131 bin token çıktı.
Soru: Qwen3.8-27B diye bir model var mı? Cevap: Var. 14 Ağustos 2026’da Hugging Face’te yayınlandı ve lisansı Apache 2.0. Yoğun (dense) 27 milyar parametreli bir model; 262.144 token bağlam (yaklaşık 1 milyona genişletilebiliyor), görsel ve video girdisi, varsayılan açık düşünme modu ve ayarlanabilir akıl yürütme seviyesi sunuyor. Unsloth’un GGUF dosyaları aynı gün çıktığı için Ollama ve llama.cpp ile hemen çalıştırılabiliyor.
Soru: Qwen 27B çalıştırmak için kaç GB VRAM lazım? Cevap: Sadece ağırlıklar için kabaca BF16’da ~54 GB, FP8’de ~27 GB, Q4’te ~15-16 GB. Üstüne bağlam penceresi için KV önbelleği ekleniyor. 24 GB’lık tek kartta Q4 ile makul bir bağlamda çalışır; uzun bağlam için birden fazla GPU gerekir.
Soru: Qwen 27B mi 35B-A3B mi daha hızlı? Cevap: Genelde 35B-A3B. İsmi büyük olsa da uzman karışımı mimarisi sayesinde her token’da sadece 3 milyar parametre çalışıyor. Yoğun 27B’de 27 milyarın tamamı devrede.
Soru: Qwen3.8-Max’i Claude Code ile kullanabilir miyim? Cevap: Evet. Qwen API’si Anthropic protokolünü destekliyor. ANTHROPIC_BASE_URL değerini https://dashscope-intl.aliyuncs.com/apps/anthropic yapıp ANTHROPIC_MODEL=qwen3.8-max verdiğinizde Claude Code doğrudan bu modele bağlanıyor. Codex, Qoder CLI, Qwen Code ve OpenClaw da destekleniyor.
Soru: Qwen3.8-Max Türkçe biliyor mu? Cevap: Evet, Türkçe soru sorup Türkçe cevap alabilirsiniz. Alibaba bu sürüm için resmi bir Türkçe test skoru paylaşmadı, kendi işinizde denemek en sağlıklısı.
Sağlıcakla kalın… 🙂
