Özet: 30 Saniyede Muse Glimmer
  • Muse Glimmer, Meta Superintelligence Labs’in 10 Ağustos 2026‘da yayınladığı 30 milyar parametreli ajan modeli. Ağırlıklar Apache 2.0 ile açık.
  • Bulut gerekmiyor. 4 bit sıkıştırmayla dil modeli 20 GB’ın altına iniyor, 24 GB veya 32 GB VRAM’i olan tek bir tüketici ekran kartında çalışıyor.
  • Metin ve görsel okuyup metin üretiyor. Bağlam penceresi varsayılan 128 bin token, model daha fazlasını destekliyor.
  • Ajan testlerinde kendi boy sınıfını açık ara geçiyor: MCP Atlas 75,5 (Gemma4-31B 54,2, Qwen3.6-27B 62,5). Matematikte AIME 2026’da 94,7.
  • Yanında gelen DFlash taslak modeli üretimi RTX 5090’da 3,1 kat, M5 Max’te 1,8 kat hızlandırıyor.
  • Meta’nın bulut modeli Muse Spark’tan damıtılmış, yani büyük modelin ajan davranışı küçük modele aktarılmış.
  • Zuckerberg aynı gün, amiral gemisi model Muse Spark 1.2’nin ağırlıklarının da açılacağını duyurdu. Tarih verilmedi, “yakında” deniyor.

Yapay zeka ajanı denince akla gelen şey bir API anahtarı, bir internet bağlantısı ve her istekte akan bir faturadır. Meta bugün bunun tersini denedi.

Muse Glimmer, Meta Superintelligence Labs’in 10 Ağustos 2026‘da yayınladığı 30 milyar parametreli bir ajan modeli. Ağırlıkları Hugging Face’te, lisansı Apache 2.0, yani ticari kullanım dahil neredeyse hiçbir kısıtı yok. Asıl iddia ise şu: model, tek bir tüketici ekran kartı olan bir masaüstünde ya da bir MacBook’ta, internetsiz, uçtan uca ajan işi yapacak kadar hızlı.


Muse Glimmer Nedir?

Muse Glimmer, Meta’nın bulutta çalışan büyük modeli Muse Spark’tan damıtılmış küçük kardeşi. Damıtma (distillation) şu demek: büyük model bir soruya cevap verirken hangi kelimeye ne kadar olasılık verdiğini gösteriyor, küçük model de sadece doğru cevabı değil, o olasılık dağılımının tamamını taklit etmeyi öğreniyor. Meta bu yönteme logit damıtma diyor ve ön eğitimin tamamını böyle yapmış.

Model kartındaki teknik künye:

ÖzellikDeğer
MimariYoğun (dense) causal transformer + algı kodlayıcı
Toplam parametre~29,6 milyar (görsel kodlayıcı dahil)
Katman sayısı52
Gizli boyut6.656
Dikkat başlıkları32 sorgu / 2 anahtar-değer (GQA 16:1)
Dikkat düzeni[Yerel, Yerel, Yerel, Global] tekrarlı, pencere 2048
Görsel kodlayıcı~1,8 milyar parametreli ViT-G/14, 50 katman
Sözlük202.048 token
Bağlam penceresi131.072+ (varsayılan 128K)
Bilgi kesim tarihi4 Ocak 2026
LisansApache 2.0

Dikkat çeken iki detay var. Birincisi GQA oranı 16:1: 32 sorgu başlığına karşılık sadece 2 anahtar-değer başlığı var. Bu, uzun konuşmalarda KV önbelleğinin şişmesini engelliyor ve modelin 24 GB’lık bir karta sığmasının sessiz kahramanı. İkincisi katmanların dörtte üçünün 2048 token’lık kayan pencere kullanması; sadece her dördüncü katman bağlamın tamamına bakıyor.

Kendi metninizin kaç token tuttuğunu merak ediyorsanız token sayacı aracımıza yapıştırıp anında görebilirsiniz.


Reklam

Neden Yerel Çalışması Önemli?

Bulut modelleri güçlü ama üç yerde sürtünme yaratıyor: internet bağımlılığı, gecikme ve veri. Takviminizi düzenleyen, mesajlarınızı yazan, dosyalarınızı toplayan bir ajanın hepsini görmesi gerekiyor. O verinin cihazdan çıkmaması, yalnızca bir gizlilik tercihi değil, birçok kurumda zorunluluk.

Meta’nın seçtiği yol, modeli baştan bu kısıtla tasarlamak olmuş: kompakt mimari, ajan davranışını büyük öğretmen modelden aktaran damıtma tarifi ve sonrasında gecikmeyi düşüren çıkarım optimizasyonları. Eğitim üç aşamada anlatılıyor:

  • Ön eğitim: Muse Spark’ın çıktıları üzerinde logit damıtma, öğretmenle benzer veri karışımı.
  • Orta eğitim: Daha uzun bağlamlı, ajan ağırlıklı ve daha zengin akıl yürütme izleri içeren veri.
  • Son eğitim: Denetimli ince ayar, üstüne politika içi damıtma ve genel, akıl yürütme, kodlama ve ajan alanlarında pekiştirmeli öğrenme.

Ajan Olarak Neler Yapıyor?

Meta modeli tek bir yetenek üzerinden değil, bir ajanın ihtiyaç duyduğu yetenek demeti üzerinden tanıtıyor:

  • Uçtan uca görev tamamlama. DeepSearch QA, MCP-Atlas, 𝛕3-Bench ve SWE-Bench gibi tam görev testlerinde ölçülüyor.
  • Güvenilir araç kullanımı. Şema uyumlu fonksiyon çağrılarını uzun iş akışları boyunca sürdürüyor.
  • Çok adımlı akıl yürütme. Uzun soluklu planları tutarlı biçimde zincirleyebiliyor.
  • Hatadan dönme. Bir araç çağrısı patladığında ya da beklenmedik sonuç döndüğünde durup teslim olmak yerine teşhis edip tekrar deniyor.
  • Görsel girdi. Ayrı bir algı kodlayıcı sayesinde metinle görseli iç içe kabul ediyor: ekran görüntüsü, grafik, belge.
  • İskelet uyumluluğu. OpenClaw, Hermes Agent ve benzeri ajan çatılarıyla çalışıyor.
  • Ayarlanabilir düşünme. Dört kademe var: low, medium, high, xhigh.
  • Çok dillilik. 100’den fazla dilin verisiyle eğitilmiş.

Bu listede en çok fark yaratan madde dördüncüsü. Yerel ajanların pratikte tıkanma sebebi çoğu zaman zekâ eksikliği değil, ilk araç hatasında zincirin kopması oluyor.

Meta’nın demosu: tek istemden çalışan panel

Meta duyuruda iki dakikalık bir ekran kaydı paylaştı. Kullanıcı OpenCode terminalinde tek bir cümle yazıyor: “Raspberry Pi’ıma Home Assistant kurdum, A/V alıcımı kontrol edecek özel bir panel yap.”

Model gerisini kendi hallediyor. Ağdaki Home Assistant’ın IP adresini bulmak için arka arkaya araç çağırıyor, curl ile API’yi yokluyor, uzun ömürlü erişim jetonunu kullanıcıdan istiyor, ses seviyesi ve kaynak seçimi uç noktalarını tek tek deniyor, sonra paneli sıfırdan yazıyor. Sonunda yerel bir sunucu ayağa kaldırıp panelin tarayıcıda düzgün açıldığını kendi doğruluyor.

Muse Glimmer'ın OpenCode içinde tek bir istemden ürettiği Home Assistant A/V alıcı kontrol paneli: güç ve ses, kaynaklar ve ses modu kartları
Tek istemden üretilen A/V kontrol paneli, Meta AI Research demo videosundan

Dikkat çeken nokta panelin görüntüsü değil, araya hiç girilmemesi. Model jeton isterken duruyor, cevabı alınca kaldığı yerden devam ediyor ve API çağrısı hata döndüğünde kendi düzeltiyor.


Benchmark Sonuçları 📊

Meta modeli kendi boy sınıfındaki iki güçlü rakiple kıyaslıyor: Gemma4-31B ve Qwen3.6-27B. Üçü de düşünme modu açıkken ölçülmüş.

Muse Glimmer 30B, Gemma4-31B ve Qwen3.6-27B modellerinin ajan, kodlama, çok modlu, güvenlik ve akıl yürütme testlerindeki skorlarını karşılaştıran tablo
Muse Glimmer Benchmark Sonuçları, Meta AI Research

Tablo mobilde okunaklı değil, o yüzden önemli satırları yazalım.

Muse Glimmer’ın açık ara önde olduğu yerler:

  • MCP Atlas (araç çağırma): 75,5. Gemma4 54,2, Qwen3.6 62,5. Aradaki fark 13 ile 21 puan, bu tabloda görülen en geniş açık.
  • DeepSearch QA: 74,6 (61,7 ve 71,1).
  • 𝛕3-Banking (çok turlu bankacılık senaryosu): 23,5. Rakipler 15,1 ve 16,7. Mutlak sayı düşük çünkü test zor, ama oransal fark büyük.
  • GAIA2: 43,3, WildClawBench: 47,6, SWE-Bench Pro: 51,2. Üçünde de birinci.
  • AA-LCR (uzun bağlamda akıl yürütme): 80,0. Rakipler 68,3 ve 73,3.
  • AIME 2026: 94,7 (89,2 ve 94,1). IFBench: 77,0.

Geride kaldığı yerler:

  • OSWorld-Verified (bilgisayarı kendi kullanma): 65,9. Qwen3.6-27B 75,6 ile net önde.
  • TerminalBench 2.1: 51,7, Qwen 60,7.
  • SWE-Bench Verified: 76,0, Qwen 77,2. Kıl payı.
  • GPQA Diamond: 83,5, Gemma4 85,7. HLE Text: 22,0, Gemma4 23,6.
  • GDPVal-AA: 953, Qwen 1141. Buradaki fark belirgin.

Çok modlu tarafta üçü de birbirine çok yakın duruyor: ScreenSpot Pro’da 75,4’e karşı 75,9 ve 76,1, MMMU Pro’da 74’e karşı 73 ve 75. Yani görsel anlama Muse Glimmer’ın ayrıştığı yer değil, ajanlık için yeterli seviyede olması amaçlanmış.

Güvenlik satırları da ilginç: Siren AgentDojo‘da dolaylı istem enjeksiyonunun başarı oranı 28,4 (düşük iyi), Gemma4 25,6 ile daha dirençli. Ama Muse Glimmer aynı testte 94,2 fayda skoruyla en yükseği tutturuyor, yani saldırıya direnirken işi de yapıyor.

Bu skorları nasıl okumalı?
Tablodaki bütün rakamlar Meta’nın kendi ölçümü ve rakip modeller Meta’nın kurduğu düzenekte koşturulmuş. Bağımsız bir kuruluş henüz doğrulamadı. İyi haber şu ki ağırlıklar Apache 2.0 ile açık olduğu için bu skorlar kısa sürede topluluk tarafından tekrarlanabilecek.

Hangi Donanımda Çalışır? 💻

Asıl mühendislik burada. 30 milyar parametreli bir model tam hassasiyette 55 GB’ın üzerinde yer kaplıyor, yani hiçbir tüketici ekran kartına sığmıyor. Meta ağırlıkları yaklaşık 4 bite sıkıştırıp dil modelini 20 GB’ın altına indirmiş. Kalan yer KV önbelleği, görsel kodlayıcı ve taslak modeli için ayrılmış.

Muse Glimmer kuantizasyon tablosu: tam hassasiyet, K-Quant-Dynamic ve K-Quant-17GB sürümlerinin doğruluk kaybı ve hedef donanım karşılaştırması
Kuantizasyon sürümleri ve doğruluk kaybı, Meta AI Research
SürümDoğruluk kaybıHedef donanım
Tam hassasiyet (BF16)-64 GB VRAM
K-Quant-Dynamic%0,232 GB VRAM
K-Quant-17GB%1,024 GB VRAM

Kayıp oranları 15 yaygın testin doğruluk ortalaması üzerinden ölçülmüş. %0,2’lik kayıp pratikte yok sayılabilir, %1 ise 24 GB’a sığmanın bedeli olarak makul.

Pratik karşılığı: RTX 4090, RTX 5090 ya da 32 GB birleşik belleği olan bir Apple Silicon Mac yeter. 16 GB’lık bir kartta bu model çalışmıyor.

Hız: DFlash spekülatif çözümleme

Yerel model yavaşsa kimse kullanmaz. Muse Glimmer yanında DFlash tabanlı küçük bir “taslakçı” modelle geliyor. Klasik üretimde model token’ları teker teker yazar. DFlash ise 16 token’lık blokları tek seferde öneriyor, ana model bu önerileri paralel doğrulayıp doğruları kabul ediyor, yanlışları düzeltiyor. Çıktı kalitesi birebir aynı kalıyor, sadece bekleme süresi düşüyor.

DFlash spekülatif çözümlemenin RTX 5090, M5 Max ve M4 Max üzerinde Muse Glimmer üretim hızını kaç kat artırdığını gösteren sütun grafiği
DFlash spekülatif çözümleme hız testi, Meta AI Research
DonanımTaslakçısızDFlash ileKazanç
NVIDIA RTX 509074,9 token/sn233,4 token/sn3,1 kat
Apple M5 Max26,6 token/sn50,2 token/sn1,8 kat
Apple M4 Max23,7 token/sn37,8 token/sn1,5 kat

Ölçümler K-Quant-17GB sürümü, tek istek ve açgözlü çözümleme ile yapılmış. Mac tarafında ExecuTorch, RTX tarafında llama.cpp kullanılmış. Saniyede 233 token, okuma hızınızın çok üstünde bir akış demek; 37 token/saniye ise sohbet için rahat, uzun ajan zincirlerinde ise sabır isteyen bir seviye.

Meta farkı yan yana da gösterdi: aynı LRU cache kodlama isteği, 64 GB’lık bir MacBook Pro M5 Max üzerinde iki pencerede aynı anda koşuyor. Soldaki DFlash açık, sağdaki kapalı.

MacBook Pro M5 Max üzerinde yan yana iki terminal: DFlash spekülatif çözümleme açıkken saniyede 57,8 token, kapalıyken 26,2 token
DFlash açık ve kapalı yan yana karşılaştırma, Meta AI Research demo videosundan

Bu koşuda ölçülen değerler 57,8’e karşı 26,2 token/saniye. Tablodaki ortalamadan yüksek çıkmasının sebebi kod üretiminin spekülatif çözümlemeye çok uygun olması: kod tahmin edilebilir kalıplar içerdiği için taslakçının önerdiği 16 token’lık blokların kabul oranı yükseliyor. İki demo videosunu da Meta’nın duyuru sayfasında izleyebilirsiniz.


Nasıl İndirilir ve Çalıştırılır? 🚀

Ağırlıklar Hugging Face’te meta-models hesabında. Dört ayrı paket var: BF16 tam ağırlıklar, GGUF kuantize sürümler, DFlash taslakçısı ve ExecuTorch derlemesi.

pip install huggingface_hub
huggingface-cli download meta-models/Muse-Glimmer-30B --local-dir ./muse-glimmer-30b

Depo safetensors ağırlıkların yanında tokenizer’ı, sohbet şablonunu ve görsel ön işleme yapılandırmasını da içeriyor. Hangi paketi seçeceğiniz kullanımınıza bağlı:

KullanımPaket
Tek GPU’lu sunucu ya da iş istasyonuMuse-Glimmer-30B (BF16)
Yerel kuantize çıkarımMuse-Glimmer-30B-GGUF
Spekülatif çözümlemeMuse-Glimmer-30B-assistant (DFlash taslakçısı)
Uç cihazMuse-Glimmer-30B-ExecuTorch-PTE

Meta, Ollama, LM Studio ve Unsloth tarafındaki hazır paketlerin, ayrıca llama.cpp, ExecuTorch ve MLX optimizasyonlarının önümüzdeki günlerde geleceğini söylüyor. Ölçekli servis için vLLM ve SGLang, denemek için Together AI, Fireworks AI ve OpenRouter listeleniyor. Donanım tarafında AMD, Arm, Dell, Intel ve NVIDIA ile ortak optimizasyon çalışması sürüyor.

Sohbet şablonu ve önerilen ayarlar

Muse Glimmer’ın istem formatı Llama’nınkinden farklı. Her tur <|start|> ile açılıyor, rolü yazıyor, içeriği <|message|> ile ayırıyor ve <|eot|> ile kapanıyor. Elle kurmaya çalışmayın, apply_chat_template kullanın:

from transformers import AutoTokenizer

tokenizer = AutoTokenizer.from_pretrained("meta-models/Muse-Glimmer-30B")

mesajlar = [
    {"role": "system", "content": "Kıdemli bir Python geliştiricisisin."},
    {"role": "user", "content": "Spekülatif çözümlemeyi iki cümlede anlat."},
]

istem = tokenizer.apply_chat_template(
    mesajlar,
    tokenize=False,
    add_generation_prompt=True,
    reasoning_strength="high",   # xhigh, high, medium veya low
)

Model kartındaki önerilen örnekleme ayarları: temperature = 1.0, top_p = 0.95, top_k = 64. Karmaşık problem çözme, kodlama ve ajan işlerinde high ya da xhigh öneriliyor.

Görsel vermek istiyorsanız AutoTokenizer yerine AutoProcessor kullanmanız gerekiyor, çünkü görselin ön işlemesini o yapıyor.

Araç çağırma: ATEM formatı

Model araç çağrılarını ATEM adı verilen kendi XML benzeri formatında üretiyor. OpenAI tarzı fonksiyon şemalarını apply_chat_template‘e tools parametresiyle veriyorsunuz, şablon araç kataloğunu sistem turuna yerleştiriyor.

Tek seferde tek araç

Muse Glimmer paralel araç çağrısını desteklemiyor. Bir turda yalnızca bir araç çağırıyor; sonucu döndürmeden sıradaki aracı seçmesini isteyemiyorsunuz. Aynı anda beş dosyayı okutup birleştiren iş akışları kuruyorsanız bu ciddi bir tasarım kısıtı.

İyi haber: modeli vLLM ya da llama.cpp’nin OpenAI uyumlu sunucusunun arkasında koşturursanız sunucu ATEM’i ayrıştırıp size standart tool_calls JSON’u veriyor, yani ATEM’e hiç dokunmuyorsunuz.


Sınırları ve Güvenlik Tarafı

Meta model kartında sınırları açıkça sayıyor:

  • Ses girdisi ve çıktısı yok. Sadece metin ve görsel giriyor, metin çıkıyor.
  • Video için optimize edilmemiş. Video verirseniz ayrı kareler olarak işleniyor.
  • Kuantize çıkarımda uç durumlarda tam hassasiyete göre küçük kalite farkları görülebiliyor.
  • Eğitim verisindeki bütün diller test edilmemiş, güçlü desteklenen set dışında performans düşebiliyor.
  • Model 18 yaş altı kullanıma yönelik değil.

Güvenlik tarafında Meta dört eksende değerlendirme yaptığını söylüyor: içerik güvenliği, ajan riski (geri alınamaz işlemde onay isteme, veri minimizasyonu, istem enjeksiyonu direnci), gizlilik ve hazırlık (kimyasal, biyolojik, siber, kontrol kaybı). Model Meta’nın kendi çerçevesinde “Frontier AI” tanımına girmiyor, çünkü Muse Spark’tan belirgin biçimde daha zayıf. Kimyasal ve biyolojik testlerde skorları kendi boy sınıfıyla aynı hizada, birçok satırda Gemma4-31B’nin altında.

Meta’nın kendi tavsiyesi net: modeli tek başına bir uç nokta gibi kullanmayın, etrafına koruma katmanları koyun ve gerçek dünyada işlem yapan ajanlarda geri alınamaz adımlar için insan onayı bırakın.


Kimin İşine Yarar?

Yerel ajan kurmak isteyenler. Asıl hedef kitle bu. 24 GB’lık bir kartla internetsiz çalışan, dosyalarınıza dokunan, araç çağıran bir ajan artık mümkün.

Veri dışarı çıkamayanlar. Hastane, hukuk bürosu, savunma, finans. Apache 2.0 lisansı ticari kullanıma da izin verdiği için kurum içi konuşlandırmada engel yok.

Maliyeti düşürmek isteyenler. Bulut API’sine ödediğiniz token ücreti burada elektrik faturasına dönüşüyor. Mevcut bulut harcamanızın ne kadar olduğunu görmek isterseniz LLM maliyet hesaplayıcımızda girdi ve çıktı token sayınızı yazıp modelleri yan yana kıyaslayabilirsiniz.

Kimin işine yaramaz: 16 GB ve altı ekran kartı olanlar, ses işleyen uygulama yazanlar, paralel araç çağrısına dayanan iş akışları kuranlar ve saf yazılım mühendisliğinde en yüksek skoru arayanlar. Son grup için Qwen3.6-27B hâlâ birkaç puan önde.


Asıl Haber: Muse Spark 1.2 de Açılıyor

Duyurunun gölgede kalan kısmı bu. Mark Zuckerberg ve Meta Superintelligence Labs’in başındaki Alexandr Wang, aynı gün Muse Spark 1.2’nin ağırlıklarının da açılacağını söyledi. Muse Spark, Glimmer’ın damıtıldığı öğretmen model; 1 milyon token bağlam penceresiyle şu an sadece ücretli API üzerinden sunuluyor.

Tarih verilmedi, “yakında” ve “önümüzdeki haftalar” ifadeleri kullanıldı. Lisansın Apache 2.0 olup olmayacağı da belli değil. Gerçekleşirse, sınır sınıfı bir modelin ağırlıklarının açılması demek, yani Glimmer’dan çok daha büyük bir haber.

O yüzden Muse Glimmer’ı tek başına değil, ikili bir hamlenin küçük ayağı olarak okumak daha doğru: biri cihazınıza sığan model, diğeri amiral gemisi.


Sonuç

Muse Glimmer bir “en güçlü model” iddiası değil. Meta zaten Muse Spark’ın daha yetenekli olduğunu açıkça yazıyor. İddia şu: ajan işi yapmaya yetecek kadar iyi bir model, cihazınıza sığacak kadar küçük ve kullanılabilir olacak kadar hızlı olabilir.

Tablodaki en anlamlı satır MCP Atlas’taki 21 puanlık fark. Rakipler genel yeteneklerde başa baş, hatta bazı testlerde önde. Muse Glimmer’ın ayrıştığı yer araç çağırma ve çok adımlı görev tamamlama, yani tam da yerel bir ajanın günlük işi.

Ağırlıklar açık olduğu için bu iddianın sınanması uzun sürmeyecek. Ollama ve LM Studio paketleri düştüğünde topluluk ölçümleri gelmeye başlar. O zamana kadar elimizdeki tek kaynak Meta’nın kendi tablosu, ve bunu böyle okumakta fayda var.

👉🏻 Ağırlıkları Hugging Face’ten indirebilirsiniz.