- Muse Glimmer, Meta Superintelligence Labs’in 10 Ağustos 2026‘da yayınladığı 30 milyar parametreli ajan modeli. Ağırlıklar Apache 2.0 ile açık.
- Bulut gerekmiyor. 4 bit sıkıştırmayla dil modeli 20 GB’ın altına iniyor, 24 GB veya 32 GB VRAM’i olan tek bir tüketici ekran kartında çalışıyor.
- Metin ve görsel okuyup metin üretiyor. Bağlam penceresi varsayılan 128 bin token, model daha fazlasını destekliyor.
- Ajan testlerinde kendi boy sınıfını açık ara geçiyor: MCP Atlas 75,5 (Gemma4-31B 54,2, Qwen3.6-27B 62,5). Matematikte AIME 2026’da 94,7.
- Yanında gelen DFlash taslak modeli üretimi RTX 5090’da 3,1 kat, M5 Max’te 1,8 kat hızlandırıyor.
- Meta’nın bulut modeli Muse Spark’tan damıtılmış, yani büyük modelin ajan davranışı küçük modele aktarılmış.
- Zuckerberg aynı gün, amiral gemisi model Muse Spark 1.2’nin ağırlıklarının da açılacağını duyurdu. Tarih verilmedi, “yakında” deniyor.
Yapay zeka ajanı denince akla gelen şey bir API anahtarı, bir internet bağlantısı ve her istekte akan bir faturadır. Meta bugün bunun tersini denedi.
Muse Glimmer, Meta Superintelligence Labs’in 10 Ağustos 2026‘da yayınladığı 30 milyar parametreli bir ajan modeli. Ağırlıkları Hugging Face’te, lisansı Apache 2.0, yani ticari kullanım dahil neredeyse hiçbir kısıtı yok. Asıl iddia ise şu: model, tek bir tüketici ekran kartı olan bir masaüstünde ya da bir MacBook’ta, internetsiz, uçtan uca ajan işi yapacak kadar hızlı.
Muse Glimmer Nedir?
Muse Glimmer, Meta’nın bulutta çalışan büyük modeli Muse Spark’tan damıtılmış küçük kardeşi. Damıtma (distillation) şu demek: büyük model bir soruya cevap verirken hangi kelimeye ne kadar olasılık verdiğini gösteriyor, küçük model de sadece doğru cevabı değil, o olasılık dağılımının tamamını taklit etmeyi öğreniyor. Meta bu yönteme logit damıtma diyor ve ön eğitimin tamamını böyle yapmış.
Model kartındaki teknik künye:
| Özellik | Değer |
|---|---|
| Mimari | Yoğun (dense) causal transformer + algı kodlayıcı |
| Toplam parametre | ~29,6 milyar (görsel kodlayıcı dahil) |
| Katman sayısı | 52 |
| Gizli boyut | 6.656 |
| Dikkat başlıkları | 32 sorgu / 2 anahtar-değer (GQA 16:1) |
| Dikkat düzeni | [Yerel, Yerel, Yerel, Global] tekrarlı, pencere 2048 |
| Görsel kodlayıcı | ~1,8 milyar parametreli ViT-G/14, 50 katman |
| Sözlük | 202.048 token |
| Bağlam penceresi | 131.072+ (varsayılan 128K) |
| Bilgi kesim tarihi | 4 Ocak 2026 |
| Lisans | Apache 2.0 |
Dikkat çeken iki detay var. Birincisi GQA oranı 16:1: 32 sorgu başlığına karşılık sadece 2 anahtar-değer başlığı var. Bu, uzun konuşmalarda KV önbelleğinin şişmesini engelliyor ve modelin 24 GB’lık bir karta sığmasının sessiz kahramanı. İkincisi katmanların dörtte üçünün 2048 token’lık kayan pencere kullanması; sadece her dördüncü katman bağlamın tamamına bakıyor.
Kendi metninizin kaç token tuttuğunu merak ediyorsanız token sayacı aracımıza yapıştırıp anında görebilirsiniz.
Neden Yerel Çalışması Önemli?
Bulut modelleri güçlü ama üç yerde sürtünme yaratıyor: internet bağımlılığı, gecikme ve veri. Takviminizi düzenleyen, mesajlarınızı yazan, dosyalarınızı toplayan bir ajanın hepsini görmesi gerekiyor. O verinin cihazdan çıkmaması, yalnızca bir gizlilik tercihi değil, birçok kurumda zorunluluk.
Meta’nın seçtiği yol, modeli baştan bu kısıtla tasarlamak olmuş: kompakt mimari, ajan davranışını büyük öğretmen modelden aktaran damıtma tarifi ve sonrasında gecikmeyi düşüren çıkarım optimizasyonları. Eğitim üç aşamada anlatılıyor:
- Ön eğitim: Muse Spark’ın çıktıları üzerinde logit damıtma, öğretmenle benzer veri karışımı.
- Orta eğitim: Daha uzun bağlamlı, ajan ağırlıklı ve daha zengin akıl yürütme izleri içeren veri.
- Son eğitim: Denetimli ince ayar, üstüne politika içi damıtma ve genel, akıl yürütme, kodlama ve ajan alanlarında pekiştirmeli öğrenme.
Ajan Olarak Neler Yapıyor?
Meta modeli tek bir yetenek üzerinden değil, bir ajanın ihtiyaç duyduğu yetenek demeti üzerinden tanıtıyor:
- Uçtan uca görev tamamlama. DeepSearch QA, MCP-Atlas, 𝛕3-Bench ve SWE-Bench gibi tam görev testlerinde ölçülüyor.
- Güvenilir araç kullanımı. Şema uyumlu fonksiyon çağrılarını uzun iş akışları boyunca sürdürüyor.
- Çok adımlı akıl yürütme. Uzun soluklu planları tutarlı biçimde zincirleyebiliyor.
- Hatadan dönme. Bir araç çağrısı patladığında ya da beklenmedik sonuç döndüğünde durup teslim olmak yerine teşhis edip tekrar deniyor.
- Görsel girdi. Ayrı bir algı kodlayıcı sayesinde metinle görseli iç içe kabul ediyor: ekran görüntüsü, grafik, belge.
- İskelet uyumluluğu. OpenClaw, Hermes Agent ve benzeri ajan çatılarıyla çalışıyor.
- Ayarlanabilir düşünme. Dört kademe var:
low,medium,high,xhigh. - Çok dillilik. 100’den fazla dilin verisiyle eğitilmiş.
Bu listede en çok fark yaratan madde dördüncüsü. Yerel ajanların pratikte tıkanma sebebi çoğu zaman zekâ eksikliği değil, ilk araç hatasında zincirin kopması oluyor.
Meta’nın demosu: tek istemden çalışan panel
Meta duyuruda iki dakikalık bir ekran kaydı paylaştı. Kullanıcı OpenCode terminalinde tek bir cümle yazıyor: “Raspberry Pi’ıma Home Assistant kurdum, A/V alıcımı kontrol edecek özel bir panel yap.”
Model gerisini kendi hallediyor. Ağdaki Home Assistant’ın IP adresini bulmak için arka arkaya araç çağırıyor, curl ile API’yi yokluyor, uzun ömürlü erişim jetonunu kullanıcıdan istiyor, ses seviyesi ve kaynak seçimi uç noktalarını tek tek deniyor, sonra paneli sıfırdan yazıyor. Sonunda yerel bir sunucu ayağa kaldırıp panelin tarayıcıda düzgün açıldığını kendi doğruluyor.

Dikkat çeken nokta panelin görüntüsü değil, araya hiç girilmemesi. Model jeton isterken duruyor, cevabı alınca kaldığı yerden devam ediyor ve API çağrısı hata döndüğünde kendi düzeltiyor.
Benchmark Sonuçları 📊
Meta modeli kendi boy sınıfındaki iki güçlü rakiple kıyaslıyor: Gemma4-31B ve Qwen3.6-27B. Üçü de düşünme modu açıkken ölçülmüş.

Tablo mobilde okunaklı değil, o yüzden önemli satırları yazalım.
Muse Glimmer’ın açık ara önde olduğu yerler:
- MCP Atlas (araç çağırma): 75,5. Gemma4 54,2, Qwen3.6 62,5. Aradaki fark 13 ile 21 puan, bu tabloda görülen en geniş açık.
- DeepSearch QA: 74,6 (61,7 ve 71,1).
- 𝛕3-Banking (çok turlu bankacılık senaryosu): 23,5. Rakipler 15,1 ve 16,7. Mutlak sayı düşük çünkü test zor, ama oransal fark büyük.
- GAIA2: 43,3, WildClawBench: 47,6, SWE-Bench Pro: 51,2. Üçünde de birinci.
- AA-LCR (uzun bağlamda akıl yürütme): 80,0. Rakipler 68,3 ve 73,3.
- AIME 2026: 94,7 (89,2 ve 94,1). IFBench: 77,0.
Geride kaldığı yerler:
- OSWorld-Verified (bilgisayarı kendi kullanma): 65,9. Qwen3.6-27B 75,6 ile net önde.
- TerminalBench 2.1: 51,7, Qwen 60,7.
- SWE-Bench Verified: 76,0, Qwen 77,2. Kıl payı.
- GPQA Diamond: 83,5, Gemma4 85,7. HLE Text: 22,0, Gemma4 23,6.
- GDPVal-AA: 953, Qwen 1141. Buradaki fark belirgin.
Çok modlu tarafta üçü de birbirine çok yakın duruyor: ScreenSpot Pro’da 75,4’e karşı 75,9 ve 76,1, MMMU Pro’da 74’e karşı 73 ve 75. Yani görsel anlama Muse Glimmer’ın ayrıştığı yer değil, ajanlık için yeterli seviyede olması amaçlanmış.
Güvenlik satırları da ilginç: Siren AgentDojo‘da dolaylı istem enjeksiyonunun başarı oranı 28,4 (düşük iyi), Gemma4 25,6 ile daha dirençli. Ama Muse Glimmer aynı testte 94,2 fayda skoruyla en yükseği tutturuyor, yani saldırıya direnirken işi de yapıyor.
Hangi Donanımda Çalışır? 💻
Asıl mühendislik burada. 30 milyar parametreli bir model tam hassasiyette 55 GB’ın üzerinde yer kaplıyor, yani hiçbir tüketici ekran kartına sığmıyor. Meta ağırlıkları yaklaşık 4 bite sıkıştırıp dil modelini 20 GB’ın altına indirmiş. Kalan yer KV önbelleği, görsel kodlayıcı ve taslak modeli için ayrılmış.

| Sürüm | Doğruluk kaybı | Hedef donanım |
|---|---|---|
| Tam hassasiyet (BF16) | - | 64 GB VRAM |
| K-Quant-Dynamic | %0,2 | 32 GB VRAM |
| K-Quant-17GB | %1,0 | 24 GB VRAM |
Kayıp oranları 15 yaygın testin doğruluk ortalaması üzerinden ölçülmüş. %0,2’lik kayıp pratikte yok sayılabilir, %1 ise 24 GB’a sığmanın bedeli olarak makul.
Pratik karşılığı: RTX 4090, RTX 5090 ya da 32 GB birleşik belleği olan bir Apple Silicon Mac yeter. 16 GB’lık bir kartta bu model çalışmıyor.
Hız: DFlash spekülatif çözümleme
Yerel model yavaşsa kimse kullanmaz. Muse Glimmer yanında DFlash tabanlı küçük bir “taslakçı” modelle geliyor. Klasik üretimde model token’ları teker teker yazar. DFlash ise 16 token’lık blokları tek seferde öneriyor, ana model bu önerileri paralel doğrulayıp doğruları kabul ediyor, yanlışları düzeltiyor. Çıktı kalitesi birebir aynı kalıyor, sadece bekleme süresi düşüyor.

| Donanım | Taslakçısız | DFlash ile | Kazanç |
|---|---|---|---|
| NVIDIA RTX 5090 | 74,9 token/sn | 233,4 token/sn | 3,1 kat |
| Apple M5 Max | 26,6 token/sn | 50,2 token/sn | 1,8 kat |
| Apple M4 Max | 23,7 token/sn | 37,8 token/sn | 1,5 kat |
Ölçümler K-Quant-17GB sürümü, tek istek ve açgözlü çözümleme ile yapılmış. Mac tarafında ExecuTorch, RTX tarafında llama.cpp kullanılmış. Saniyede 233 token, okuma hızınızın çok üstünde bir akış demek; 37 token/saniye ise sohbet için rahat, uzun ajan zincirlerinde ise sabır isteyen bir seviye.
Meta farkı yan yana da gösterdi: aynı LRU cache kodlama isteği, 64 GB’lık bir MacBook Pro M5 Max üzerinde iki pencerede aynı anda koşuyor. Soldaki DFlash açık, sağdaki kapalı.

Bu koşuda ölçülen değerler 57,8’e karşı 26,2 token/saniye. Tablodaki ortalamadan yüksek çıkmasının sebebi kod üretiminin spekülatif çözümlemeye çok uygun olması: kod tahmin edilebilir kalıplar içerdiği için taslakçının önerdiği 16 token’lık blokların kabul oranı yükseliyor. İki demo videosunu da Meta’nın duyuru sayfasında izleyebilirsiniz.
Nasıl İndirilir ve Çalıştırılır? 🚀
Ağırlıklar Hugging Face’te meta-models hesabında. Dört ayrı paket var: BF16 tam ağırlıklar, GGUF kuantize sürümler, DFlash taslakçısı ve ExecuTorch derlemesi.
pip install huggingface_hub
huggingface-cli download meta-models/Muse-Glimmer-30B --local-dir ./muse-glimmer-30b
Depo safetensors ağırlıkların yanında tokenizer’ı, sohbet şablonunu ve görsel ön işleme yapılandırmasını da içeriyor. Hangi paketi seçeceğiniz kullanımınıza bağlı:
| Kullanım | Paket |
|---|---|
| Tek GPU’lu sunucu ya da iş istasyonu | Muse-Glimmer-30B (BF16) |
| Yerel kuantize çıkarım | Muse-Glimmer-30B-GGUF |
| Spekülatif çözümleme | Muse-Glimmer-30B-assistant (DFlash taslakçısı) |
| Uç cihaz | Muse-Glimmer-30B-ExecuTorch-PTE |
Meta, Ollama, LM Studio ve Unsloth tarafındaki hazır paketlerin, ayrıca llama.cpp, ExecuTorch ve MLX optimizasyonlarının önümüzdeki günlerde geleceğini söylüyor. Ölçekli servis için vLLM ve SGLang, denemek için Together AI, Fireworks AI ve OpenRouter listeleniyor. Donanım tarafında AMD, Arm, Dell, Intel ve NVIDIA ile ortak optimizasyon çalışması sürüyor.
Sohbet şablonu ve önerilen ayarlar
Muse Glimmer’ın istem formatı Llama’nınkinden farklı. Her tur <|start|> ile açılıyor, rolü yazıyor, içeriği <|message|> ile ayırıyor ve <|eot|> ile kapanıyor. Elle kurmaya çalışmayın, apply_chat_template kullanın:
from transformers import AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained("meta-models/Muse-Glimmer-30B")
mesajlar = [
{"role": "system", "content": "Kıdemli bir Python geliştiricisisin."},
{"role": "user", "content": "Spekülatif çözümlemeyi iki cümlede anlat."},
]
istem = tokenizer.apply_chat_template(
mesajlar,
tokenize=False,
add_generation_prompt=True,
reasoning_strength="high", # xhigh, high, medium veya low
)
Model kartındaki önerilen örnekleme ayarları: temperature = 1.0, top_p = 0.95, top_k = 64. Karmaşık problem çözme, kodlama ve ajan işlerinde high ya da xhigh öneriliyor.
Görsel vermek istiyorsanız AutoTokenizer yerine AutoProcessor kullanmanız gerekiyor, çünkü görselin ön işlemesini o yapıyor.
Araç çağırma: ATEM formatı
Model araç çağrılarını ATEM adı verilen kendi XML benzeri formatında üretiyor. OpenAI tarzı fonksiyon şemalarını apply_chat_template‘e tools parametresiyle veriyorsunuz, şablon araç kataloğunu sistem turuna yerleştiriyor.
Muse Glimmer paralel araç çağrısını desteklemiyor. Bir turda yalnızca bir araç çağırıyor; sonucu döndürmeden sıradaki aracı seçmesini isteyemiyorsunuz. Aynı anda beş dosyayı okutup birleştiren iş akışları kuruyorsanız bu ciddi bir tasarım kısıtı.
İyi haber: modeli vLLM ya da llama.cpp’nin OpenAI uyumlu sunucusunun arkasında koşturursanız sunucu ATEM’i ayrıştırıp size standart tool_calls JSON’u veriyor, yani ATEM’e hiç dokunmuyorsunuz.
Sınırları ve Güvenlik Tarafı
Meta model kartında sınırları açıkça sayıyor:
- Ses girdisi ve çıktısı yok. Sadece metin ve görsel giriyor, metin çıkıyor.
- Video için optimize edilmemiş. Video verirseniz ayrı kareler olarak işleniyor.
- Kuantize çıkarımda uç durumlarda tam hassasiyete göre küçük kalite farkları görülebiliyor.
- Eğitim verisindeki bütün diller test edilmemiş, güçlü desteklenen set dışında performans düşebiliyor.
- Model 18 yaş altı kullanıma yönelik değil.
Güvenlik tarafında Meta dört eksende değerlendirme yaptığını söylüyor: içerik güvenliği, ajan riski (geri alınamaz işlemde onay isteme, veri minimizasyonu, istem enjeksiyonu direnci), gizlilik ve hazırlık (kimyasal, biyolojik, siber, kontrol kaybı). Model Meta’nın kendi çerçevesinde “Frontier AI” tanımına girmiyor, çünkü Muse Spark’tan belirgin biçimde daha zayıf. Kimyasal ve biyolojik testlerde skorları kendi boy sınıfıyla aynı hizada, birçok satırda Gemma4-31B’nin altında.
Meta’nın kendi tavsiyesi net: modeli tek başına bir uç nokta gibi kullanmayın, etrafına koruma katmanları koyun ve gerçek dünyada işlem yapan ajanlarda geri alınamaz adımlar için insan onayı bırakın.
Kimin İşine Yarar?
Yerel ajan kurmak isteyenler. Asıl hedef kitle bu. 24 GB’lık bir kartla internetsiz çalışan, dosyalarınıza dokunan, araç çağıran bir ajan artık mümkün.
Veri dışarı çıkamayanlar. Hastane, hukuk bürosu, savunma, finans. Apache 2.0 lisansı ticari kullanıma da izin verdiği için kurum içi konuşlandırmada engel yok.
Maliyeti düşürmek isteyenler. Bulut API’sine ödediğiniz token ücreti burada elektrik faturasına dönüşüyor. Mevcut bulut harcamanızın ne kadar olduğunu görmek isterseniz LLM maliyet hesaplayıcımızda girdi ve çıktı token sayınızı yazıp modelleri yan yana kıyaslayabilirsiniz.
Kimin işine yaramaz: 16 GB ve altı ekran kartı olanlar, ses işleyen uygulama yazanlar, paralel araç çağrısına dayanan iş akışları kuranlar ve saf yazılım mühendisliğinde en yüksek skoru arayanlar. Son grup için Qwen3.6-27B hâlâ birkaç puan önde.
Asıl Haber: Muse Spark 1.2 de Açılıyor
Duyurunun gölgede kalan kısmı bu. Mark Zuckerberg ve Meta Superintelligence Labs’in başındaki Alexandr Wang, aynı gün Muse Spark 1.2’nin ağırlıklarının da açılacağını söyledi. Muse Spark, Glimmer’ın damıtıldığı öğretmen model; 1 milyon token bağlam penceresiyle şu an sadece ücretli API üzerinden sunuluyor.
Tarih verilmedi, “yakında” ve “önümüzdeki haftalar” ifadeleri kullanıldı. Lisansın Apache 2.0 olup olmayacağı da belli değil. Gerçekleşirse, sınır sınıfı bir modelin ağırlıklarının açılması demek, yani Glimmer’dan çok daha büyük bir haber.
O yüzden Muse Glimmer’ı tek başına değil, ikili bir hamlenin küçük ayağı olarak okumak daha doğru: biri cihazınıza sığan model, diğeri amiral gemisi.
Sonuç
Muse Glimmer bir “en güçlü model” iddiası değil. Meta zaten Muse Spark’ın daha yetenekli olduğunu açıkça yazıyor. İddia şu: ajan işi yapmaya yetecek kadar iyi bir model, cihazınıza sığacak kadar küçük ve kullanılabilir olacak kadar hızlı olabilir.
Tablodaki en anlamlı satır MCP Atlas’taki 21 puanlık fark. Rakipler genel yeteneklerde başa baş, hatta bazı testlerde önde. Muse Glimmer’ın ayrıştığı yer araç çağırma ve çok adımlı görev tamamlama, yani tam da yerel bir ajanın günlük işi.
Ağırlıklar açık olduğu için bu iddianın sınanması uzun sürmeyecek. Ollama ve LM Studio paketleri düştüğünde topluluk ölçümleri gelmeye başlar. O zamana kadar elimizdeki tek kaynak Meta’nın kendi tablosu, ve bunu böyle okumakta fayda var.
