Özet: 30 Saniyede DeepSeek V4.1 Flash
  • DeepSeek-V4.1-Flash, 10 Eylül 2026’da yayınlandı. Lisans MIT, ağırlıklar Hugging Face’te.
  • 552 milyar gövde parametresi, ama token başına yalnızca 8 milyar aktif (girdi işlerken) / 16 milyar aktif (üretim yaparken). Bu asimetri modelin bütün fikri.
  • Yeni mimari: Causal Encoder-Decoder (CED). 40 katman, 20’si nedensel kodlayıcı, 20’si kod çözücü. Kod çözücünün KV önbelleği kendi katmanlarından değil, kodlayıcının son gizli durumlarından türetiliyor.
  • Sonuç: global KV önbelleği token başına 890 bayt. V4-Flash’ın dörtte biri, DeepSeek-V1’in 437’de biri.
  • Doğuştan çok modlu: görsel girdiyi kendi eğitilmiş DeepSeek-ViT kodlayıcısıyla, dil modelinin ön eğitiminin en başından itibaren işliyor. Ön eğitim 45 trilyon token.
  • Ajan testlerinde Claude Opus 5’i geçiyor: Terminal-Bench 2.1’de 90,6‘ya 89,1, DeepSWE v1.1’de 74,2‘ye 74,0, AutomationBench’te 54,8’e 50,3.
  • Akıl yürütme çabası 1-100 arası sürekli ayarlanabiliyor. Açık/kapalı düşünme kademesi değil, kaydırma çubuğu.
  • API fiyatı 1 milyon token başına yoğun olmayan saatte $0,15 girdi / $0,60 çıktı, yoğun saatte iki katı. Claude Opus 5’in çıktı fiyatının kabaca yirmide biri.
  • DeepSeek V4 Pro’yu emekliye ayırıyor: 14 Eylül 2026’dan itibaren deepseek-v4-pro istekleri V4.1 Flash’a yönlendirilip Flash fiyatından faturalanacak.

Bu yılın açık ağırlıklı model yarışında herkes aynı iki rakamı kovalıyor: aktif parametre ve KV önbelleği. Birincisi her token’ın kaça mal olduğunu, ikincisi uzun bağlamın ne kadar bellek yediğini belirliyor. GLM-5.3-Flash hibrit dikkatle, Qwen3.8-Flash-Next ise 6 milyar aktif parametreyle cevap vermişti.

DeepSeek’in cevabı daha radikal. DeepSeek-V4.1-Flash modeli ikiye bölüyor: girdiyi okuyan yarı ile cevabı üreten yarı artık aynı maliyet yapısına sahip değil. Teknik raporun başlığı da zaten bunu söylüyor: KV önbelleği sıkıştırmasının sınırlarını zorlamak.

İşin ilginç tarafı, model bir hafta önce API’de deepseek-v4.1-flash-expires-on-0910 adıyla belirdi. Adındaki “10 Eylül’de sona erecek” ifadesi bir kapanış değil, bir çıkış tarihiymiş. Gelin sırayla bakalım. 👇🏻


DeepSeek V4.1 Flash Nedir?

Metin ve görsel okuyup metin üreten, uzman karışımı (MoE) mimarili, ağırlıkları MIT lisansıyla indirilebilen bir model. DeepSeek’in V4 serisindeki ara sürümü, ama “ara sürüm” kelimesi yanıltmasın: mimari V4’ün ilk önizlemesinden bu yana serideki en büyük değişiklik.

ÖzellikDeepSeek-V4.1-Flash
Gövde parametresi552 milyar
Aktif parametre8 milyar (prefill) / 16 milyar (decode)
Katman40 (20 kodlayıcı + 20 kod çözücü)
Uzman1 paylaşılan + 384 yönlendirilen, token başına 6 aktif
Ek bellekEngram, 196 milyar parametre (seyrek erişimli)
Ön eğitim45 trilyon token, çok modlu
Bağlam1 milyon token
Maksimum çıktı384 bin token
GirdiMetin + görsel
Global KV önbelleğiToken başına 890 bayt
LisansMIT
Kaynak: DeepSeek-V4.1-Flash model kartı

Kritik satır ikincisi. MoE modellerinde toplam parametre pazarlama rakamıdır; faturayı belirleyen, her token için kaç parametrenin devreye girdiğidir. Burada iki ayrı rakam var, çünkü model girdiyi işlerken ve cevap üretirken farklı miktarda hesap harcıyor.

Kıyas için DeepSeek’in kendi önceki modelleri: V4-Flash 284 milyar toplam / 13 milyar aktif, V4-Pro 1,6 trilyon toplam / 49 milyar aktif. V4.1-Flash, V4-Flash’ın iki katı büyüklükte bir gövdeyi V4-Flash’tan daha az aktif parametreyle çalıştırıyor.


Reklam

Mimaride Ne Değişti? 🧠

1. Causal Encoder-Decoder: girdi ucuz, çıktı pahalı

Klasik bir Transformer’da her katman kendi gizli durumundan kendi KV önbelleğini üretir. Ajan iş yüklerinde bu ters bir denge kuruyor: bir kod ajanı 200 bin token bağlam okuyup 500 token cevap yazabiliyor, yani hesabın ezici çoğunluğu okuma tarafında.

CED bu dengeyi düzeltiyor. Model 20 katmanlık nedensel bir kodlayıcı ve 20 katmanlık bir kod çözücü olarak ayrılıyor; kod çözücünün global KV önbelleği kendi katmanlarından değil, kodlayıcının son gizli durumlarından yansıtılıyor. Böylece girdi okunurken token başına 8 milyar, cevap üretilirken 16 milyar parametre çalışıyor.

DeepSeek-V4.1-Flash Causal Encoder-Decoder mimarisi: 20 katmanlık kodlayıcı 8 milyar, 20 katmanlık kod çözücü 16 milyar aktif parametre çalıştırıyor, tek global KV önbelleği kodlayıcının son gizli durumlarından üretiliyor
Klasik Transformer'da her katman kendi KV önbelleğini taşır; CED'de tek bir global önbellek kodlayıcıdan yansıtılır. Kaynak: DeepSeek model kartı

Buna eşlik eden ikinci fikir SWA Bounded Replay: kayan pencere dikkatinin eksik KV durumlarını diskte saklamak yerine, yalnızca son n_win token’ı yeniden oynatarak geri üretiyor. Kalıcı KV önbelleği ayak izi V4-Flash’ın kabaca sekizde birine iniyor.

2. CSA2: dikkat katmanlarının üç modu

Compressed Sparse Attention 2, her dikkat katmanına üç statik moddan birini atıyor: Full, Reindex veya Reuse. Full modundaki katman işi baştan yapıyor; diğer ikisi ana KV’yi ve indeksleyici anahtarlarını katmanlar arasında paylaşıp Top-K seyrek dikkat indekslerini yeniden kullanıyor.

Kod çözücüde ayrıca Hiyerarşik Seyrek İndeksleyici var: sonraki indeksleme katmanları, ilk Full katmanının kurduğu aday havuzuyla sınırlanıyor. Yani derindeki indeksleyicinin maliyeti bağlam uzunluğundan bağımsız hale geliyor. Bir milyon token bağlamda “nereye bakacağımı bulma” maliyetinin kendisi ciddi bir kalem olduğu için bu önemli.

Üstüne FP4 ana KV önbelleği geliyor (E2M1 formatı, her 16 kanal için bir E4M3 ölçek). Toplamda global KV önbelleği token başına 890 bayta iniyor. DeepSeek’in kendi grafiğindeki tam rakamlar şöyle: 2023’te V1’de 389.120 bayt, 2025 sonunda V3.2’de 48.068, bu yılın nisanında V4-Flash’ta 3.514 ve şimdi 890.

890 bayt ne demek?

Bunu somutlaştıralım: 1 milyon tokenlık dolu bir bağlam penceresi, global KV önbelleği tarafında kabaca 890 MB yer tutuyor. Aynı bağlam V4-Flash’ta dört katı, DeepSeek-V1 mimarisinde ise 437 katı yer tutardı.

KV önbelleği neden önemli? Çünkü uzun bağlamda darboğaz genellikle hesap gücü değil, bellek kapasitesi ve bant genişliği oluyor. Önbellek küçüldükçe aynı GPU’ya daha fazla eşzamanlı istek sığıyor. Fiyat listesindeki 2500 eşzamanlı istek limiti ile bu rakam doğrudan bağlantılı.

DeepSeek kuşaklarında token başına global KV önbelleği: V1 389.120 bayt, V3.2 48.068 bayt, V4-Flash 3.514 bayt, V4.1-Flash 890 bayt
Token başına global KV önbelleği, DeepSeek kuşakları. Kaynak: DeepSeek-V4.1-Flash model kartı (Şekil 1b)

3. Engram, DSpark ve mHC

Üç ek bileşen daha var: Engram, token tabanlı aramayla seyrek erişilen 196 milyar parametrelik koşullu bellek (gövde sayısının dışında duruyor); DSpark, yarı-otoregresif taslak üretimi ve güven zamanlamalı doğrulama kullanan spekülatif kod çözme; Single-Pass mHC, artık akış karışımının verimli bir Mega-mHC çekirdeğiyle yeniden yazılmış hali.

4. Görsel yetenek sonradan eklenmedi

Görselleri DeepSeek-ViT işliyor: sıfırdan eğitilmiş, 2D-RoPE ve 3×3 piksel-unshuffle altörnekleme kullanan bir görü kodlayıcısı. İki katmanlı bir MLP yansıtıcı görsel gömüleri metin gömüleriyle aynı akışa katıyor ve bu, dil modeli ön eğitiminin en başından itibaren böyle.

Pratikte bu, modelin görüntüyü ne zaman kullanacağına da karar verebilmesi demek; sonradan yapıştırılmış bir görü modülünde olmayan bir şey.


Benchmark Skorları 📊

Temel model

Post-training öncesi ham skorlar, mimarinin işe yarayıp yaramadığını görmenin en dürüst yolu. Bütün ölçümler DeepSeek’in kendi çerçevesinde, aynı ayarlarla yapılmış:

TestV4.1-Flash-BaseV4-Flash-BaseV4-Pro-Base
Aktif / gövde parametre8B-16B / 552B13B / 284B49B / 1,6T
MMLU-Pro74,168,373,5
SimpleQA-Verified42,330,155,2
HumanEval79,469,576,8
GSM8K93,090,892,6
MATH61,157,464,5
LongBench-V245,244,751,5
MMMU-Pro (çok modlu)56,5----
DocVQA (çok modlu)95,6----
Kaynak: DeepSeek, kendi değerlendirme çerçevesi

Okuma şekli: V4.1-Flash-Base, kod ve matematiğin bir kısmında 49 milyar aktif parametreli V4-Pro-Base’i geçiyor. Buna karşılık ansiklopedik bilgi ölçen SimpleQA-Verified’da açık ara geride (42,3’e 55,2) ve uzun bağlam anlamada da (LongBench-V2) Pro önde. Bu beklenen bir sonuç: 1,6 trilyon parametre daha fazla olgu depoluyor.

Sınır modellerle karşılaştırma

Aşağıdaki skorların tamamı en yüksek akıl yürütme çabasıyla (reasoning_effort=100) alınmış:

TestDS-V4.1-FlashDS-V4-ProOpus 5GPT-5.6 SolK3GLM-5.3
HLE36,842,756,344,543,542,0
Codeforces (puan)34713348--------
Terminal-Bench 2.190,687,989,188,888,388,2
Terminal-Bench 3.030,011,843,334,417,728,3
Terminal-Bench 4.031,212,451,839,912,637,9
DeepSWE v1.174,262,774,073,067,566,9
NL2Repo-Bench64,061,575,356,858,058,0
CyberGym88,183,3--84,580,084,5
AutomationBench54,843,250,345,846,748,8
Agent's Last Exam31,825,728,626,727,628,5
HLE (araçlarla)63,960,063,6--59,862,5
Tüm skorlar en yüksek akıl yürütme çabasıyla (reasoning_effort=100). Kaynak: DeepSeek
Ajan testlerinde DeepSeek-V4.1-Flash, Kimi-K3, GLM-5.3, Opus 5 ve GPT-5.6 Sol karşılaştırması: Terminal-Bench 3.0, DeepSWE v1.1, CyberGym ve AutomationBench skorları
DeepSeek'in kendi duyuru grafiği. Terminal-Bench 3.0'da Opus 5 önde, diğer üç testte V4.1-Flash. Kaynak: DeepSeek-V4.1-Flash model kartı (Şekil 1a)

Tablonun anlattığı hikâye iki başlıklı.

Ajan işlerinde model gerçekten sınırda. Terminal-Bench 2.1, DeepSWE v1.1, AutomationBench, Agent’s Last Exam ve CyberGym’de listedeki bütün modelleri geçiyor. CyberGym’deki 88,1 özellikle dikkat çekici, çünkü orası güvenlik odaklı bir test ve GPT-5.6 Sol ile GLM-5.3 aynı skorda (84,5) kalıyor.

Ham bilgide değil. HLE’de 36,8 ile Opus 5’in 56,3’ünün çok gerisinde. Aynı test araçlarla koşturulduğunda skor 63,9’a fırlıyor (Opus 5: 63,6), yani model “bilmiyor ama bulabiliyor”. Bilgiyi kafasında tutmak isteyen işler için bu model değil.

Terminal-Bench 2.1'de birinci, 3.0'da üçüncü: nasıl?

Tabloda kafa karıştıran satır bu. V4.1-Flash Terminal-Bench 2.1’de 90,6 ile listenin en iyisi, ama aynı testin 3.0 sürümünde 30,0 ile Opus 5’in (43,3) ve GPT-5.6 Sol’un (34,4) arkasında.

Sebep şu: Terminal-Bench 3.0 ve 4.0 belirgin şekilde daha zor sürümler ve bütün modellerin skorları çöküyor (K3 17,7, V4-Pro 11,8). 2.1 doygunluğa ulaşmış bir test; herkes 88-90 bandında sıkışmış durumda, aradaki 1-2 puan gürültüden ibaret olabilir. Asıl ayrım 3.0 ve 4.0’da ortaya çıkıyor ve orada Opus 5 hâlâ açık farkla önde.

Yani “Opus 5’i geçti” cümlesini test sürümü belirtmeden kurmak yanıltıcı olur.

Aynı model, farklı iskele, farklı skor

DeepSeek’in paylaştığı en öğretici tablo bu. Aynı model, aynı test, sekiz farklı ajan iskelesi:

Testmini-SWEDSH MinimalClaude CodeCodexOpenCodePiDSH Standard
DeepSWE v1.174,272,669,865,665,566,270,5
Terminal-Bench 2.190,390,688,084,185,086,185,8
Kaynak: DeepSeek
DeepSeek-V4.1-Flash'ın DeepSWE v1.1 skoru sekiz farklı ajan iskelesinde: mini-SWE 74,2'den OpenCode 65,5'e
Aynı model, aynı test, sekiz farklı ajan iskelesi. Kaynak: DeepSeek model kartı

DeepSWE’de en iyi ve en kötü iskele arasında 8,7 puan fark var. Manşetlere çıkan 74,2 rakamı mini-SWE iskelesinden geliyor; aynı model Codex iskelesinde 65,6 alıyor, yani GLM-5.3’ün (66,9) altına düşüyor.

Buradan çıkan pratik ders: bir benchmark skoru modelin değil, model + iskele ikilisinin skorudur. Kendi ajanınızda göreceğiniz sayı, kullandığınız iskeleye göre bu aralığın herhangi bir yerinde olabilir.


Akıl Yürütme Çabası: Kaydırma Çubuğu 🎚️

Çoğu modelde düşünme ayarı kademeli: kapalı, düşük, orta, yüksek. V4.1-Flash bunu 1 ile 100 arası tam sayı olarak sürekli hale getiriyor. Hesap maliyeti ile doğruluk arasındaki takası kademe kademe değil, tıklaya tıklaya ayarlıyorsunuz.

Yukarıdaki bütün skorlar reasoning_effort=100 ile, yani en pahalı ayarla alındı. Üretimde 30-40 bandında koşturduğunuzda hem fatura hem gecikme düşer, skorlar da bir miktar geriler. DeepSeek çaba-doğruluk eğrisini yayımlamadığı için doğru rakamı kendi iş yükünüzde denemeniz gerekiyor.


Fiyatı Ne Kadar? 💸

Fiyatlar 1 milyon token başına, 10 Eylül 2026 saat 12:00’den (Pekin) itibaren geçerli:

KalemYoğun olmayan saatYoğun saat
Girdi (önbellek isabeti)$0,003$0,006
Girdi (önbellek ıskası)$0,15$0,30
Çıktı$0,60$1,20
1 milyon token başına. Kaynak: DeepSeek API fiyat sayfası
1 milyon çıktı tokenı fiyat karşılaştırması: Claude Opus 5 25 dolar, GLM-5.3 4,40 dolar, DeepSeek V4-Pro 3,96 dolar, DeepSeek V4.1-Flash yoğun saatte 1,20 dolar ve yoğun olmayan saatte 0,60 dolar
1 milyon çıktı tokenı için API liste fiyatları. Kaynak: DeepSeek, Anthropic ve Z.ai fiyat sayfaları

Yoğun saat hafta içi 01:00-04:00 ve 06:00-10:00 UTC. Geri kalan her şey, hafta sonları ve tatiller dahil, yarı fiyat. Türkiye saatiyle düşünürseniz: yoğun saat aralığı 04:00-07:00 ve 09:00-13:00 arası. Yani mesai saatlerinizin çoğu ve bütün akşam ucuz tarifede.

Model adı artık deepseek-flash. Eski deepseek-v4-flash ve deepseek-v4-flash-vision-exp adları kabul edilmeye devam ediyor ama karşılıklarındaki modeller emekliye ayrıldı; o istekler de V4.1-Flash’a gidip Flash fiyatından faturalanıyor. Eşzamanlı istek limiti 2500.

V4 Pro emekliye ayrılıyor

Duyurunun en çok gözden kaçan kısmı bu. DeepSeek fiyat sayfasında şunu yazıyor: kapsamlı testlerden sonra V4.1 Flash performans, maliyet, hız ve toplam sürede V4 Pro’yu bütünüyle geçti, bu yüzden V4 Pro düzenli biçimde emekliye ayrılıyor.

14 Eylül 2026 saat 12:00’den (Pekin) itibaren deepseek-v4-pro isteklerinin tamamı V4.1 Flash’a yönlendirilecek ve V4.1 Flash fiyatından faturalanacak. Yani girdi maliyetiniz 4,4 kat, çıktı maliyetiniz 3,3 kat düşüyor; karşılığında modeliniz sessizce değişiyor.

V4 Pro’ya bağlı bir üretim iş akışınız varsa, ham bilgi gerektiren istemleri (SimpleQA farkı 13 puan) ve uzun bağlam işlerini bu tarihten önce tekrar test edin. V4.1 Pro geldiğinde durumun ne olacağı belirsiz.

Kıyas için Claude Opus 5 aynı birimde $5 girdi / $25 çıktı. Çıktı tarafında aradaki fark yoğun saatte kabaca 20 kat, yoğun olmayan saatte 40 kat. Kendi iş yükünüzde ne tutacağını LLM maliyet hesaplayıcımızda yan yana görebilirsiniz; girdinizin kaç token ettiğini de token sayacına yapıştırarak ölçebilirsiniz.


Nasıl Kullanılır?

API OpenAI uyumlu, temel adres değişmedi:

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ.get("DEEPSEEK_API_KEY"),
    base_url="https://api.deepseek.com",
)

cevap = client.chat.completions.create(
    model="deepseek-flash",
    messages=[{
        "role": "user",
        "content": "Bu hata kaydını oku ve olası kök nedeni sırala.",
    }],
    stream=True,
)

DeepSeek ayrıca Anthropic uyumlu bir uç nokta veriyor, yani Claude Code’u bu modele bağlamak iki değişkenlik iş:

export ANTHROPIC_BASE_URL=https://api.deepseek.com/anthropic
export ANTHROPIC_AUTH_TOKEN=<api_anahtariniz>
claude

Kendi sunucunuzda

Ağırlıklar Hugging Face’te deepseek-ai/DeepSeek-V4.1-Flash altında, MIT lisansıyla. Önerilen örnekleme ayarları: temperature=1.0, top_p=0.95 veya 1.0, max_tokens en az 256 bin.

Bu sürümde Jinja formatında bir sohbet şablonu yok. Depodaki encoding/ klasörü kendi kendine yeten bir Python referans uygulaması içeriyor; üretim için DeepSeek ayrıca deepseek-recipe adında, Python bağlamaları olan Rust kütüphaneleri yayımladı. Bu kütüphane Messages, Chat Completions ve Responses API isteklerini modelin beklediği istem formatına çeviriyor, çıktıyı da geri ayrıştırıyor. Çıkarım motorunu ve HTTP taşımasını size bırakıyor.

Evde çalışır mı?

Aktif parametrenin 8-16 milyar olması yanıltmasın: ağırlıkların tamamı belleğe yüklenmek zorunda. 552 milyarlık gövdenin üstüne 196 milyar parametrelik Engram belleği de geliyor.

Kabaca hesap: FP8 hassasiyette gövde tek başına 550 GB civarı, 4 bit nicemlemeyle 280-300 GB bandına iniyor. Yani tek tüketici kartının işi değil, ciddi bir çok GPU’lu kurulum ya da bol sistem belleğiyle CPU’ya taşırma gerekiyor.

İyi haber KV önbelleği tarafında: token başına 890 bayt ile 1 milyon tokenlık bağlam kabaca 890 MB tutuyor. Uzun bağlam, bu modelde bellek bütçesinin en ucuz kalemi.


Kimin İçin Mantıklı?

  • Girdi ağırlıklı ajan iş yükleri: CED mimarisinin varlık sebebi tam olarak bu. Çok okuyup az yazan bir kod ajanı ya da belge işleme hattı, token başına 8 milyar aktif parametreden doğrudan kazanç sağlıyor.
  • V4 Pro kullananlar: Seçim şansınız zaten 14 Eylül’de kalkıyor. Fiyat 3-4 kat düşüyor, ajan testlerinde skorlar yükseliyor. Bilgi yoğun istemlerinizi bir kez daha test edin, o kadar.
  • Uzun bağlam ve otomasyon işleri: 1 milyon tokenı 890 MB KV önbelleğiyle servis eden başka bir açık ağırlıklı model yok; CyberGym (88,1) ve AutomationBench (54,8) skorları da listenin en yükseği. Lisans MIT olduğu için ticari üründe okunacak ince yazı da yok.
  • Ansiklopedik bilgi gerektiren işler: Bu model değil. HLE 36,8 ve SimpleQA farkı bunu net söylüyor. Araç kullanımı açıksa tablo değişiyor, ama arama olmadan olgu üretmesini beklemeyin.
  • Tek ekran kartıyla yerel kurulum: Bu da değil.

Sıkça Sorulan Sorular

Soru: DeepSeek V4.1 Flash ne zaman çıktı? Cevap: 10 Eylül 2026. Bir hafta önce API’de deepseek-v4.1-flash-expires-on-0910 adıyla sınırlı bir beta olarak test edildi; addaki tarih bir kapanış değil, çıkış tarihiymiş. Yeni Flash fiyatları da aynı gün saat 12:00’de (Pekin) yürürlüğe girdi.

Soru: DeepSeek V4.1 Flash kaç parametre? Cevap: 552 milyar gövde parametresi, artı 196 milyar parametrelik seyrek erişimli Engram belleği. Token başına aktif olan kısım girdi işlenirken 8 milyar, cevap üretilirken 16 milyar. Her MoE katmanında 1 paylaşılan ve 384 yönlendirilen uzman var, token başına 6 tanesi çalışıyor.

Soru: DeepSeek V4.1 Flash açık kaynak mı, indirebilir miyim? Cevap: Ağırlıklar Hugging Face’te deepseek-ai/DeepSeek-V4.1-Flash altında ve lisans MIT, yani ticari kullanım dahil neredeyse kısıtsız. Yine de doğru terim “açık ağırlık”: model dosyaları paylaşıldı, eğitim verisi paylaşılmadı.

Soru: DeepSeek V4.1 Flash fiyatı ne kadar? Cevap: 1 milyon token başına yoğun olmayan saatte $0,15 girdi (önbellek ıskası) ve $0,60 çıktı; yoğun saatte iki katı. Önbellek isabeti $0,003. Yoğun saat hafta içi 01:00-04:00 ve 06:00-10:00 UTC, kalan her şey yarı fiyat.

Soru: DeepSeek V4 Pro’ya ne oluyor? Cevap: Emekliye ayrılıyor. 14 Eylül 2026 saat 12:00’den (Pekin) itibaren deepseek-v4-pro istekleri V4.1 Flash’a yönlendirilip Flash fiyatından faturalanacak. DeepSeek gerekçe olarak V4.1 Flash’ın performans, maliyet, hız ve toplam sürede V4 Pro’yu bütünüyle geçmesini gösteriyor.

Soru: Bağlam penceresi ne kadar? Cevap: 1 milyon token, maksimum çıktı 384 bin token. Ön eğitim 64 bin uzunlukta seyrek dikkatle yapılmış, bağlam 34 trilyon token noktasında 1 milyona genişletilmiş.

Soru: DeepSeek V4.1 Flash Claude Opus 5’ten iyi mi? Cevap: Teste bağlı. Ajan testlerinin bir kısmında evet: Terminal-Bench 2.1’de 90,6’ya 89,1, DeepSWE v1.1’de 74,2’ye 74,0, AutomationBench’te 54,8’e 50,3. Terminal-Bench’in daha zor 3.0 ve 4.0 sürümlerinde ve bilgi ağırlıklı HLE’de Opus 5 açık farkla önde. Fiyat tarafında V4.1 Flash çıktıda kabaca 20 kat ucuz.

Soru: Görsel girdi kabul ediyor mu? Cevap: Evet. Görselleri DeepSeek-ViT adlı, sıfırdan eğitilmiş bir görü kodlayıcısı işliyor ve bu yetenek dil modeli ön eğitiminin en başından beri var, sonradan eklenmedi. MMMU-Pro’da 56,5, DocVQA’da 95,6 alıyor.

Soru: Akıl yürütme çabası ayarı nedir? Cevap: 1 ile 100 arası bir tam sayı; hesap maliyeti ile doğruluk arasındaki takası sürekli olarak ayarlamanızı sağlıyor. Yayımlanan bütün benchmark skorları en yüksek ayarla (100) alındı, yani üretimde daha düşük bir değerle çalışırsanız hem fatura hem skor düşer.

Soru: Kaç GB VRAM gerekiyor? Cevap: Aktif parametre az olsa da ağırlıkların tamamı belleğe girmek zorunda. Kabaca FP8’de 550 GB, 4 bit nicemlemeyle 280-300 GB bandı. Tek tüketici kartıyla çalışacak bir model değil. Buna karşılık KV önbelleği token başına yalnızca 890 bayt, yani uzun bağlam bu modelde ucuz.

Soru: Claude Code ile kullanabilir miyim? Cevap: Evet. DeepSeek Anthropic uyumlu bir uç nokta veriyor: ANTHROPIC_BASE_URL değerini https://api.deepseek.com/anthropic yapıp anahtarınızı ANTHROPIC_AUTH_TOKEN olarak tanımlamanız yeterli.

Soru: Ollama veya llama.cpp ile çalışır mı? Cevap: Sürümde Jinja sohbet şablonu yok ve mimari yeni, bu yüzden araçların hemen uyum sağlaması beklenmez. DeepSeek istem formatı için deepseek-recipe adında Rust tabanlı bir kütüphane yayımladı; topluluk nicemlemeleri çıktıkça llama.cpp ve Ollama tarafı da gelecektir.

Soru: Türkçe biliyor mu? Cevap: Evet, Türkçe soru sorup Türkçe cevap alabilirsiniz. DeepSeek ayrı bir Türkçe skoru paylaşmadı; çok dilli testlerde (MultiLoKo 45,5) V4-Pro’nun (50,9) gerisinde kalıyor, yani Türkçe üretimde İngilizce kadar keskin olmasını beklemeyin. Türkçe metinlerin İngilizceye göre daha fazla token harcadığını da hesaba katın.


Sağlıcakla kalın… 🙂

Yapay Zeka Tarafından Oluşturulan İçerik Uyarısı
Bu blog tamamen yapay zeka tarafından oluşturulmuştur. Yapay zeka içerik oluşturmaya yardımcı olsa da, hala hatalar veya önyargılar içerebilir. Kritik detayları kullanmadan önce doğrulayın.