Özet: İlk Beş Günün Bilançosu
  • Portal’ı tek başına bitirdi. 3.336 araç çağrısı, yaklaşık 21 saat, 571,18 dolar fatura.
  • Factorio Space Age 2.1’de uzaya roket fırlattı. Bugüne kadar hiçbir model mavi bilimin ötesine geçememişti.
  • Pokémon’u 18 saat 12 dakikada bitirdi. GPT-5.6 Sol aynı işi 96 saat 35 dakikada yapıyordu.
  • Robot kolunda 20 denemenin 19’unu başardı, koşu başına 0,94 dolar.
  • Blender’da tek komutla 3.295 düzenlenebilir nesne üretti.
  • Ortak nokta: hepsinin bir fatura rakamı var ve bu rakam küçük değil.

GPT-6 Astra’nın çıkış yazısında benchmark tablosunu, fiyatı ve erişim koşullarını anlatmıştık. Duyurunun üzerinden beş gün geçti ve tablo değişti: artık OpenAI’ın slaytlarına değil, insanların modele gerçekten ne yaptırdığına bakabiliyoruz.

Aşağıdaki 12 örneğin tamamı doğrulanabilir. Her birinin videosu, canlı linki veya ölçüm raporu var; hepsini kendiniz açıp bakabilirsiniz. Rakamları da ekledim, çünkü “yapay zeka oyunu bitirdi” cümlesi ile “yapay zeka oyunu 571 dolara bitirdi” cümlesi aynı şey değil. 👇🏻


1. Portal’ı Tek Başına Bitirdi: 3.336 Hamle, 571 Dolar 🎮

Listenin imzası bu. cozyblaze adlı geliştirici Astra’yı Valve’ın 2007 tarihli bulmaca oyunu Portal’a bağladı ve tek bir insan müdahalesi olmadan oyunu baştan sona bitirtti.

Kritik ayrıntı, modelin oyunun kodunun içine sızmaması. Astra ekran görüntülerine bakıyor, tıpkı bir insan gibi klavye ve fare komutları üretiyor. Yani portal tabancasının nereye ateş edeceğine, gördüğü kareden karar veriyor.

Bilanço: 3.336 araç çağrısı, yaklaşık 21 saat düşünme süresi ve 571,18 dolar token faturası. Koşunun tamamı kayıt altında, aşağıdan izleyebilirsiniz:

GPT-6 Astra, Portal'ı insan müdahalesi olmadan bitiriyor

Reklam

2. Factorio’da Uzaya Roket Fırlattı 🚀

Portal bir bulmaca oyunu, Factorio ise saatlerce süren bir üretim zinciri kurma maratonu. Yapay zeka için asıl zor olan ikincisi, çünkü onlarca saat boyunca tutarlı bir plan izlemek gerekiyor.

Bir kullanıcı Codex’i, Astra’nın düşük efor kademesiyle Factorio Space Age 2.1’e bağladı. Oyunu kontrol etmek için Lua ile yazılmış bir MCP sunucusu kullanıldı. Sonuç: yaklaşık 10 saat sonra uzaya roket fırlatıldı ve ajan 20 saati aşan koşuda bir sonraki gezegene ilerlemeye devam etti.

Bunun neden büyük olduğunu tartışmadaki bir yorum iyi özetliyor: bugüne kadar hiçbir modelin geçemediği eşik “mavi bilim” seviyesiydi, yani on basamaklı ağacın ikinci ya da üçüncü basamağı.


3. Pokémon’u 18 Saat 12 Dakikada Bitirdi

Clad3815 aynı düzeneği üç modelde çalıştırdı, sonuçlar yan yana konunca ilerlemenin hızı net görünüyor:

ModelŞampiyon olma süresi
GPT-6 Astra (high)18 sa 12 dk
GPT-5.6 Sol (max)96 sa 35 dk
GPT-5.5218 saatte bitiremedi

Burada da RAM okuma, hazır çözüm rehberi veya insan ipucu yok. Model ekran görüntüsüne bakıyor, nerede olduğunu kendi takip ediyor.


4. ARC-AGI-3’te %99,9, Faturası 19 Bin Dolar

ARC Prize ekibi kendi bağımsız ölçümünü yayımladı ve buradaki iki satır, tek başına bütün lansmanın en dürüst özeti:

KurguSkorMaliyet
Standart harness%62,726.098 $
Sağlayıcı adaptörlü harness%99,919.000 $

Aynı model, aynı test. Aradaki 37 puanlık farkı yapan şey modelin zekası değil, etrafına kurulan iskele. Sonuçtaki en çarpıcı ayrıntı ise şu: adaptörlü kurguda Astra, seviyelerin %96’sında insan katılımcıdan daha az hamle kullandı, ortalamada %51,7 daha az. İnsan katılımcılara oyun başına yaklaşık 12,78 dolar ödendiğini de not edelim.

ARC Prize ekibi yine de altını çiziyor: bu testin doygunluğa ulaşması AGI kanıtı değil, çünkü ortam kapalı uçlu ve deterministik.


5. Robot Kolu Kullandı: 20 Denemede 19 🦾

Ekrandan çıkıp fiziksel dünyaya geçen tek örnek bu. Astra, her biri altı serbestlik dereceli çift kollu YAM robot koluna bağlandı; üç kamera görüntüsü ve eklem konum verisiyle besleniyor.

GörevGPT-6 AstraClaude Fable 5.1
Kırmızı bloğu kaseye koy19/20 (%95)%40
Yuvarlak parçayı yuvasına oturt2/202/20

Basit kavrama işinde fark uçurum, hassas yerleştirmede ise iki model de aynı yerde takılıyor: parçayı yuvanın üstüne getiriyor, son itmeyi yapamıyor. Koşu başına süre 2,5 dakika, maliyet 0,94 dolar.


6. Blender’da Tek Seferde 3.295 Nesne

Astra 3B modelleme yapmıyor, Blender’ı kullanıyor: sahneyi planlıyor, Python yazıyor, render alıyor, sonuca bakıp düzeltiyor. Bu bölümdeki videolar doğrudan aşağıda oynuyor.

Tom Krcha, eski bir buharlı lokomotif çizimini verdi ve Astra birkaç dakikada 3.295 düzenlenebilir nesne üretti:

Aynı geliştirici, bir evin fotoğraflarından 30 dakikadan kısa sürede 3B modelini çıkarttı:

Sharif Shameem ise San Francisco’daki Palace of Fine Arts’ı modelletti; sonuç referans fotoğraflarla yan yana konabilecek düzeyde:

Bir de tarayıcıda gezilebileni var: Peter Gostev, Van Gogh’un tablosundaki kasabayı yürünebilir hale getirdi. Canlı link


7. Tek Komutla Oynanabilir Oyunlar 🕹️

Astra ile ChatGPT içindeki Sites özelliği birleşince tek komuttan yayınlanmış oyun çıkıyor. Hepsi tarayıcıda açılıyor, kurulum yok:

Bunların hepsi ve fazlası, kaynak paylaşımlarıyla birlikte 117 vaka ve 43 canlı link içeren awesome-gpt-6-astra listesinde derlenmiş durumda. Bir öğleden sonrasını götürecek bir liste, uyarayım.


8. Web’de: 2.234 Parçalık Anatomi Atlası

Oyun dışı tarafta da benzer bir yoğunluk var:


9. Matematikte 1930’lardan Beri İlk İyileştirme

Eğlence tarafını bir kenara bırakıp en ciddi sonuca gelelim. Matematikçi Mehtaab Sawhney, Astra’nın yardımıyla ardışık asal sayılar arasındaki en büyük boşluğa dair bir sınırı iyileştirdiğini duyurdu. İyileştirme kabaca bir log log n çarpanı kadar ve bu sınırda 1930’lardan beri ilerleme kaydedilmemişti.

Ayrıca Epoch’un derlediği 68 çözülmemiş Erdős problemi setinde Astra ikisini çözdü. Rakam küçük görünebilir; ancak aynı sette GPT-5.6 Sol, GPT-5.5, Claude Fable 5.1 ve Fable 5 doğrulanmış tek bir çözüm üretemedi.

Buradaki yıldız
Asal boşluk sonucunun ispat dosyası yaklaşık 10 MB’lık Lean kodu. Lean derleyicisi doğruluyor, fakat henüz bağımsız bir insan uzman anlamsal incelemeden geçirmiş değil. “Model teoremi kanıtladı” cümlesini bu dipnotla okuyun.

10. Kod İncelemesinde Ölçüldü: %22 Daha Fazla Hata

CodeRabbit, kendi kod inceleme hattında Astra’yı etiketli hata veri setiyle test etti. Sonuçlar mütevazı ama gerçek işten geliyor:

KarşılaştırmaYakalanan ek hata
GPT-5.6 Sol’e karşı%4
Opus 5’e karşı%22
Dosyalar arası karmaşık incelemede (Sol)%20
Dosyalar arası karmaşık incelemede (Opus 5)%33

Fiyat tarafı ise acıtıyor: 100 bin girdi ve 10 bin çıktı token’ı sabitlendiğinde görev başına 1,50 dolar, yani Sol’ün 0,60 dolarının 2,5 katı.


11. Token Verimliliği: Aynı Skor, Üçte Bir Token

Artificial Analysis’in bağımsız ölçümü, fiyat tartışmasını başka bir yere çekiyor. Astra, Coding Agent Index’te 67 puanla Claude Opus 5 ve Fable 5 ile aynı seviyede. Ama aynı işi yaparken Sol’den %70 daha az token harcıyor; azami eforda selefinin kullandığı token’ın üçte biriyle çalışıyor.

Bir başka kayda değer sonuç: AA-Omniscience testinde halüsinasyon oranı %92’den %51’e düşmüş. Genel zeka endeksinde ise 61 puanla Sol ile eşit, Fable 5.1’in beş puan gerisinde.

Yani Astra her işte daha iyi bir model değil; kodlama ajanlığı ve uydurma azaltma yönünde uzmanlaşmış bir model.


12. Şirket Tarafı: Playco ve Code Arena

Oyun stüdyosu Playco, prototipleme akışında Astra’ya geçtikten sonra elle yapılan düzeltmelerin yarıya indiğini bildirdi. Astra ayrıca lansman haftasında Code Arena sıralamasında birinciliğe yerleşti.


Bu Listeden Çıkan Üç Ders

1. İskele, modelin kendisi kadar önemli. ARC-AGI-3’teki %62,7 ile %99,9 aynı modelin skoru. Aradaki farkı harness yapıyor. Aynı şekilde Factorio koşusunu mümkün kılan şey Lua ile yazılmış bir MCP sunucusu. Modeli değil, etrafını kurmak asıl iş.

2. Fatura artık ana kısıt. Portal 571 dolar, ARC koşusu 19 bin dolar, kod incelemesi görev başına 1,50 dolar. Astra’nın yapabildikleri etkileyici, fakat “yapabiliyor” ile “yapması mantıklı” arasındaki çizgiyi çeken şey token maliyeti.

3. Hassasiyet hâlâ duvar. Robot kolu testinde parçayı yuvanın ağzına getirmek kolay, son milimetreyi bastırmak imkansız. Aynı desen yazılımda da var: model işin %95’ini götürüyor, kalan %5 hâlâ insanda.


Bunları Kendiniz Nasıl Denersiniz?

Yukarıdaki örneklerin çoğu ChatGPT’nin Work ve Codex deneyimlerinde ya da doğrudan API’de yapıldı. Hangi planda modelin nerede göründüğünü, mesaj limitlerini ve Codex kurulumunu GPT-6 Astra nasıl kullanılır yazısında adım adım anlattım.

Denemeye başlamadan önce bir hesap yapmanızı öneririm: 1 milyon token için 10 dolar girdi ve 50 dolar çıktı tarifesinde, uzun soluklu bir ajan görevi beklediğinizden hızlı büyüyor. LLM maliyet hesaplayıcı ile Astra’yı diğer modellerle yan yana koyup görevin faturasını önceden çıkarabilirsiniz.


Sıkça Sorulan Sorular

Soru: GPT-6 Astra gerçekten Portal’ı tek başına mı bitirdi? Cevap: Evet. cozyblaze adlı geliştiricinin koşusunda model insan müdahalesi olmadan oyunu tamamladı ve oyunun kodunun içine erişmedi; sadece ekran görüntülerine bakıp klavye ve fare komutları üretti. Koşu 3.336 araç çağrısı sürdü ve token faturası 571,18 dolar oldu.

Soru: Astra ile oyun yapmak için kod bilmek gerekiyor mu? Cevap: Yayınlanan örneklerin çoğu ChatGPT içindeki Sites özelliğiyle, tek bir komut yazılarak üretildi ve sonuç doğrudan bir web adresinde yayına alındı. Kod bilgisi sonucu düzeltmek ve büyütmek için gerekiyor, başlamak için değil.

Soru: Bu örnekler kaça mal oluyor? Cevap: İşe göre çok değişiyor. Robot kolu görevinde koşu başına 0,94 dolar, kod incelemesinde görev başına 1,50 dolar, Portal koşusunda toplam 571,18 dolar, ARC-AGI-3 değerlendirmesinde 19.000 dolar. Tarife 1 milyon token için 10 dolar girdi ve 50 dolar çıktı.

Soru: Astra 3B modelleme yapabiliyor mu? Cevap: Doğrudan 3B model üretmiyor; Blender uygulamasını kullanıyor. Sahneyi planlıyor, Blender Python kodu yazıyor, render alıp sonucu kendi kontrol ediyor. Bu yüzden çıktı düzenlenebilir nesnelerden oluşuyor, bir mesh yığını değil.

Soru: ARC-AGI-3’teki %99,9 skoru AGI anlamına geliyor mu? Cevap: Hayır. ARC Prize ekibi bu testin doygunluğa ulaşmasının AGI kanıtı olmadığını açıkça belirtiyor, çünkü test ortamı kapalı uçlu ve deterministik. Ayrıca aynı model standart harness ile %62,7 alıyor.

Soru: Türkiye’den bu örnekleri denemek mümkün mü? Cevap: Evet. ChatGPT Plus, Pro, Business ve Enterprise planları ile OpenAI API Türkiye’den kullanılabiliyor. Astra ücretsiz planda yok; erişim kademelerinin ayrıntısı için nasıl kullanılır yazısına bakabilirsiniz.


Sağlıcakla kalın… 🙂

Yapay Zeka Tarafından Oluşturulan İçerik Uyarısı
Bu blog tamamen yapay zeka tarafından oluşturulmuştur. Yapay zeka içerik oluşturmaya yardımcı olsa da, hala hatalar veya önyargılar içerebilir. Kritik detayları kullanmadan önce doğrulayın.