- Portal’ı tek başına bitirdi. 3.336 araç çağrısı, yaklaşık 21 saat, 571,18 dolar fatura.
- Factorio Space Age 2.1’de uzaya roket fırlattı. Bugüne kadar hiçbir model mavi bilimin ötesine geçememişti.
- Pokémon’u 18 saat 12 dakikada bitirdi. GPT-5.6 Sol aynı işi 96 saat 35 dakikada yapıyordu.
- Robot kolunda 20 denemenin 19’unu başardı, koşu başına 0,94 dolar.
- Blender’da tek komutla 3.295 düzenlenebilir nesne üretti.
- Ortak nokta: hepsinin bir fatura rakamı var ve bu rakam küçük değil.
GPT-6 Astra’nın çıkış yazısında benchmark tablosunu, fiyatı ve erişim koşullarını anlatmıştık. Duyurunun üzerinden beş gün geçti ve tablo değişti: artık OpenAI’ın slaytlarına değil, insanların modele gerçekten ne yaptırdığına bakabiliyoruz.
Aşağıdaki 12 örneğin tamamı doğrulanabilir. Her birinin videosu, canlı linki veya ölçüm raporu var; hepsini kendiniz açıp bakabilirsiniz. Rakamları da ekledim, çünkü “yapay zeka oyunu bitirdi” cümlesi ile “yapay zeka oyunu 571 dolara bitirdi” cümlesi aynı şey değil. 👇🏻
1. Portal’ı Tek Başına Bitirdi: 3.336 Hamle, 571 Dolar 🎮
Listenin imzası bu. cozyblaze adlı geliştirici Astra’yı Valve’ın 2007 tarihli bulmaca oyunu Portal’a bağladı ve tek bir insan müdahalesi olmadan oyunu baştan sona bitirtti.
Kritik ayrıntı, modelin oyunun kodunun içine sızmaması. Astra ekran görüntülerine bakıyor, tıpkı bir insan gibi klavye ve fare komutları üretiyor. Yani portal tabancasının nereye ateş edeceğine, gördüğü kareden karar veriyor.
Bilanço: 3.336 araç çağrısı, yaklaşık 21 saat düşünme süresi ve 571,18 dolar token faturası. Koşunun tamamı kayıt altında, aşağıdan izleyebilirsiniz:
- 🐦 Geliştiricinin paylaşımı: @cozyblazex
- 📰 Haber: Tom’s Hardware
2. Factorio’da Uzaya Roket Fırlattı 🚀
Portal bir bulmaca oyunu, Factorio ise saatlerce süren bir üretim zinciri kurma maratonu. Yapay zeka için asıl zor olan ikincisi, çünkü onlarca saat boyunca tutarlı bir plan izlemek gerekiyor.
Bir kullanıcı Codex’i, Astra’nın düşük efor kademesiyle Factorio Space Age 2.1’e bağladı. Oyunu kontrol etmek için Lua ile yazılmış bir MCP sunucusu kullanıldı. Sonuç: yaklaşık 10 saat sonra uzaya roket fırlatıldı ve ajan 20 saati aşan koşuda bir sonraki gezegene ilerlemeye devam etti.
Bunun neden büyük olduğunu tartışmadaki bir yorum iyi özetliyor: bugüne kadar hiçbir modelin geçemediği eşik “mavi bilim” seviyesiydi, yani on basamaklı ağacın ikinci ya da üçüncü basamağı.
- 💬 Tartışma ve kayıt: Hacker News
3. Pokémon’u 18 Saat 12 Dakikada Bitirdi
Clad3815 aynı düzeneği üç modelde çalıştırdı, sonuçlar yan yana konunca ilerlemenin hızı net görünüyor:
| Model | Şampiyon olma süresi |
|---|---|
| GPT-6 Astra (high) | 18 sa 12 dk |
| GPT-5.6 Sol (max) | 96 sa 35 dk |
| GPT-5.5 | 218 saatte bitiremedi |
Burada da RAM okuma, hazır çözüm rehberi veya insan ipucu yok. Model ekran görüntüsüne bakıyor, nerede olduğunu kendi takip ediyor.
- 🐦 Karşılaştırma: @Clad3815
4. ARC-AGI-3’te %99,9, Faturası 19 Bin Dolar
ARC Prize ekibi kendi bağımsız ölçümünü yayımladı ve buradaki iki satır, tek başına bütün lansmanın en dürüst özeti:
| Kurgu | Skor | Maliyet |
|---|---|---|
| Standart harness | %62,7 | 26.098 $ |
| Sağlayıcı adaptörlü harness | %99,9 | 19.000 $ |
Aynı model, aynı test. Aradaki 37 puanlık farkı yapan şey modelin zekası değil, etrafına kurulan iskele. Sonuçtaki en çarpıcı ayrıntı ise şu: adaptörlü kurguda Astra, seviyelerin %96’sında insan katılımcıdan daha az hamle kullandı, ortalamada %51,7 daha az. İnsan katılımcılara oyun başına yaklaşık 12,78 dolar ödendiğini de not edelim.
ARC Prize ekibi yine de altını çiziyor: bu testin doygunluğa ulaşması AGI kanıtı değil, çünkü ortam kapalı uçlu ve deterministik.
- 📊 Rapor: arcprize.org/blog/astra
5. Robot Kolu Kullandı: 20 Denemede 19 🦾
Ekrandan çıkıp fiziksel dünyaya geçen tek örnek bu. Astra, her biri altı serbestlik dereceli çift kollu YAM robot koluna bağlandı; üç kamera görüntüsü ve eklem konum verisiyle besleniyor.
| Görev | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|
| Kırmızı bloğu kaseye koy | 19/20 (%95) | %40 |
| Yuvarlak parçayı yuvasına oturt | 2/20 | 2/20 |
Basit kavrama işinde fark uçurum, hassas yerleştirmede ise iki model de aynı yerde takılıyor: parçayı yuvanın üstüne getiriyor, son itmeyi yapamıyor. Koşu başına süre 2,5 dakika, maliyet 0,94 dolar.
- 🔬 Test raporu: openai.robocurve.org
6. Blender’da Tek Seferde 3.295 Nesne
Astra 3B modelleme yapmıyor, Blender’ı kullanıyor: sahneyi planlıyor, Python yazıyor, render alıyor, sonuca bakıp düzeltiyor. Bu bölümdeki videolar doğrudan aşağıda oynuyor.
Tom Krcha, eski bir buharlı lokomotif çizimini verdi ve Astra birkaç dakikada 3.295 düzenlenebilir nesne üretti:
Tom Krcha: buharlı lokomotif çiziminden Blender sahnesi (video)
Aynı geliştirici, bir evin fotoğraflarından 30 dakikadan kısa sürede 3B modelini çıkarttı:
Tom Krcha: ev fotoğraflarından 3B model (video)
Sharif Shameem ise San Francisco’daki Palace of Fine Arts’ı modelletti; sonuç referans fotoğraflarla yan yana konabilecek düzeyde:
Sharif Shameem: Palace of Fine Arts Blender'da (video)
Bir de tarayıcıda gezilebileni var: Peter Gostev, Van Gogh’un tablosundaki kasabayı yürünebilir hale getirdi. Canlı link
7. Tek Komutla Oynanabilir Oyunlar 🕹️
Astra ile ChatGPT içindeki Sites özelliği birleşince tek komuttan yayınlanmış oyun çıkıyor. Hepsi tarayıcıda açılıyor, kurulum yok:
- Zork’un 3B versiyonu (Ethan Mollick)
- Gogh Strike, Van Gogh tablolarında geçen nişancı oyunu (Peter Gostev)
- Jelly Baby Playground, yumuşak cisim fiziği denemesi (Scott)
- Universe Duel
Bunların hepsi ve fazlası, kaynak paylaşımlarıyla birlikte 117 vaka ve 43 canlı link içeren awesome-gpt-6-astra listesinde derlenmiş durumda. Bir öğleden sonrasını götürecek bir liste, uyarayım.
8. Web’de: 2.234 Parçalık Anatomi Atlası
Oyun dışı tarafta da benzer bir yoğunluk var:
- ashe, 2.234 ayrı parçadan oluşan, patlatılmış görünümlü bir insan anatomisi atlası yaptırdı.
- Max Weinbach, tarayıcıda çalışan bir macOS 27 simülatörünü 75 dakikada çıkarttı.
- Ethan Mollick, gerçek zamanlı bir mercan resifi ekosistemi simülasyonu olan ABYSSAL‘i yayımladı.
- Derya Unutmaz, altı Brandenburg konçertosunu çalan etkileşimli bir piyano yaptırdı.
9. Matematikte 1930’lardan Beri İlk İyileştirme
Eğlence tarafını bir kenara bırakıp en ciddi sonuca gelelim. Matematikçi Mehtaab Sawhney, Astra’nın yardımıyla ardışık asal sayılar arasındaki en büyük boşluğa dair bir sınırı iyileştirdiğini duyurdu. İyileştirme kabaca bir log log n çarpanı kadar ve bu sınırda 1930’lardan beri ilerleme kaydedilmemişti.
Ayrıca Epoch’un derlediği 68 çözülmemiş Erdős problemi setinde Astra ikisini çözdü. Rakam küçük görünebilir; ancak aynı sette GPT-5.6 Sol, GPT-5.5, Claude Fable 5.1 ve Fable 5 doğrulanmış tek bir çözüm üretemedi.
10. Kod İncelemesinde Ölçüldü: %22 Daha Fazla Hata
CodeRabbit, kendi kod inceleme hattında Astra’yı etiketli hata veri setiyle test etti. Sonuçlar mütevazı ama gerçek işten geliyor:
| Karşılaştırma | Yakalanan ek hata |
|---|---|
| GPT-5.6 Sol’e karşı | %4 |
| Opus 5’e karşı | %22 |
| Dosyalar arası karmaşık incelemede (Sol) | %20 |
| Dosyalar arası karmaşık incelemede (Opus 5) | %33 |
Fiyat tarafı ise acıtıyor: 100 bin girdi ve 10 bin çıktı token’ı sabitlendiğinde görev başına 1,50 dolar, yani Sol’ün 0,60 dolarının 2,5 katı.
- 📋 Değerlendirme: CodeRabbit blog
11. Token Verimliliği: Aynı Skor, Üçte Bir Token
Artificial Analysis’in bağımsız ölçümü, fiyat tartışmasını başka bir yere çekiyor. Astra, Coding Agent Index’te 67 puanla Claude Opus 5 ve Fable 5 ile aynı seviyede. Ama aynı işi yaparken Sol’den %70 daha az token harcıyor; azami eforda selefinin kullandığı token’ın üçte biriyle çalışıyor.
Bir başka kayda değer sonuç: AA-Omniscience testinde halüsinasyon oranı %92’den %51’e düşmüş. Genel zeka endeksinde ise 61 puanla Sol ile eşit, Fable 5.1’in beş puan gerisinde.
Yani Astra her işte daha iyi bir model değil; kodlama ajanlığı ve uydurma azaltma yönünde uzmanlaşmış bir model.
- 📈 Ölçüm: Artificial Analysis
12. Şirket Tarafı: Playco ve Code Arena
Oyun stüdyosu Playco, prototipleme akışında Astra’ya geçtikten sonra elle yapılan düzeltmelerin yarıya indiğini bildirdi. Astra ayrıca lansman haftasında Code Arena sıralamasında birinciliğe yerleşti.
Bu Listeden Çıkan Üç Ders
1. İskele, modelin kendisi kadar önemli. ARC-AGI-3’teki %62,7 ile %99,9 aynı modelin skoru. Aradaki farkı harness yapıyor. Aynı şekilde Factorio koşusunu mümkün kılan şey Lua ile yazılmış bir MCP sunucusu. Modeli değil, etrafını kurmak asıl iş.
2. Fatura artık ana kısıt. Portal 571 dolar, ARC koşusu 19 bin dolar, kod incelemesi görev başına 1,50 dolar. Astra’nın yapabildikleri etkileyici, fakat “yapabiliyor” ile “yapması mantıklı” arasındaki çizgiyi çeken şey token maliyeti.
3. Hassasiyet hâlâ duvar. Robot kolu testinde parçayı yuvanın ağzına getirmek kolay, son milimetreyi bastırmak imkansız. Aynı desen yazılımda da var: model işin %95’ini götürüyor, kalan %5 hâlâ insanda.
Bunları Kendiniz Nasıl Denersiniz?
Yukarıdaki örneklerin çoğu ChatGPT’nin Work ve Codex deneyimlerinde ya da doğrudan API’de yapıldı. Hangi planda modelin nerede göründüğünü, mesaj limitlerini ve Codex kurulumunu GPT-6 Astra nasıl kullanılır yazısında adım adım anlattım.
Denemeye başlamadan önce bir hesap yapmanızı öneririm: 1 milyon token için 10 dolar girdi ve 50 dolar çıktı tarifesinde, uzun soluklu bir ajan görevi beklediğinizden hızlı büyüyor. LLM maliyet hesaplayıcı ile Astra’yı diğer modellerle yan yana koyup görevin faturasını önceden çıkarabilirsiniz.
Sıkça Sorulan Sorular
Soru: GPT-6 Astra gerçekten Portal’ı tek başına mı bitirdi? Cevap: Evet. cozyblaze adlı geliştiricinin koşusunda model insan müdahalesi olmadan oyunu tamamladı ve oyunun kodunun içine erişmedi; sadece ekran görüntülerine bakıp klavye ve fare komutları üretti. Koşu 3.336 araç çağrısı sürdü ve token faturası 571,18 dolar oldu.
Soru: Astra ile oyun yapmak için kod bilmek gerekiyor mu? Cevap: Yayınlanan örneklerin çoğu ChatGPT içindeki Sites özelliğiyle, tek bir komut yazılarak üretildi ve sonuç doğrudan bir web adresinde yayına alındı. Kod bilgisi sonucu düzeltmek ve büyütmek için gerekiyor, başlamak için değil.
Soru: Bu örnekler kaça mal oluyor? Cevap: İşe göre çok değişiyor. Robot kolu görevinde koşu başına 0,94 dolar, kod incelemesinde görev başına 1,50 dolar, Portal koşusunda toplam 571,18 dolar, ARC-AGI-3 değerlendirmesinde 19.000 dolar. Tarife 1 milyon token için 10 dolar girdi ve 50 dolar çıktı.
Soru: Astra 3B modelleme yapabiliyor mu? Cevap: Doğrudan 3B model üretmiyor; Blender uygulamasını kullanıyor. Sahneyi planlıyor, Blender Python kodu yazıyor, render alıp sonucu kendi kontrol ediyor. Bu yüzden çıktı düzenlenebilir nesnelerden oluşuyor, bir mesh yığını değil.
Soru: ARC-AGI-3’teki %99,9 skoru AGI anlamına geliyor mu? Cevap: Hayır. ARC Prize ekibi bu testin doygunluğa ulaşmasının AGI kanıtı olmadığını açıkça belirtiyor, çünkü test ortamı kapalı uçlu ve deterministik. Ayrıca aynı model standart harness ile %62,7 alıyor.
Soru: Türkiye’den bu örnekleri denemek mümkün mü? Cevap: Evet. ChatGPT Plus, Pro, Business ve Enterprise planları ile OpenAI API Türkiye’den kullanılabiliyor. Astra ücretsiz planda yok; erişim kademelerinin ayrıntısı için nasıl kullanılır yazısına bakabilirsiniz.
Sağlıcakla kalın… 🙂
