Özet: 30 Saniyede Gemini 3.8 Live
  • Google, 15 Eylül 2026‘da iki sesli modeli kararlı (GA) sürüme aldı: gemini-3.8-live ve gemini-3.8-live-extended-thinking.
  • İkisi de ses-ses modeli. Araya konuşma tanıma ve seslendirme motoru koymuyorsunuz; mikrofonun çıktısı doğrudan modele gidiyor, model doğrudan ses üretiyor.
  • Fiyat dakika başına da ölçülebiliyor: ses girdisi 0,005 dolar/dk, ses çıktısı 0,018 dolar/dk. Ücretsiz kademe var.
  • İki modelin farkı tek kelimeyle düşünme. Standart sürümde thinkingLevel yok, Extended Thinking’de low / medium / high var.
  • Extended Thinking, Artificial Analysis’in Ses-Ses Kalite Endeksi’nde 82,6 puanla birinci. Standart 3.8 Live ise Speech Agent Arena’da ikinci.
  • Konuşma ortasında 97 dil arasında kendiliğinden geçiş yapıyor, Türkçe dahil.
  • Sıkı bir sınır var: sıkıştırma açmazsanız sadece sesli oturum 15 dakika, sesli + görüntülü oturum 2 dakika sürüyor.

Google’ın Eylül temposu 3.8 Flash ile bitmemiş. Bugün, 15 Eylül 2026’da, Gemini API’nin Live tarafına iki yeni kararlı model geldi: Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking.

Bunlar sohbet modeli değil. Metin isteyip metin alamıyorsunuz. Bunlar bir telefon hattının iki ucuna oturan modeller: siz konuşurken dinliyor, siz susmadan cevap vermeye hazırlanıyor, sözünüzü kesmenize izin veriyor.

Önce en çok karıştırılan şeyi ayıralım. 👇🏻


Telefondaki “Gemini Live” ile Aynı Şey mi?

Hayır. İsim benzerliği kafa karıştırıyor ama iki ayrı şeyden bahsediyoruz:

  • Gemini Live (uygulama özelliği): Android ve iOS’taki Gemini uygulamasında, dalga simgesine basıp konuştuğunuz mod. Kullanıcı ürünü, kod yazmıyorsunuz.
  • Gemini 3.8 Live (model): O özelliğin altındaki teknolojinin geliştiricilere açılmış hali. Kendi uygulamanıza kendi sesli asistanınızı koymak için var.

Bu yazı ikincisi hakkında. Ama ikisi bugün birbirine bağlandı: Google yeni modelleri kendi ürünlerine de koydu.

  • 3.8 Live herkese Search Live içinde açılıyor. Adım adım sorun giderme desteği alabileceğiniz yer burası.
  • 3.8 Live Extended Thinking ise Gemini Live uygulamasında, ayrıca Google AI Pro ve Ultra abonelerine Docs’ta, tüm Google AI abonelerine Gmail ve Keep içinde geliyor.
  • Kurumsal tarafta ikisi de Gemini Enterprise’da özel önizlemede.

Search Live tarafının nasıl göründüğü:

0:00
Search Live içinde gerçek zamanlı, adım adım sorun giderme, Google

Reklam

Gemini 3.8 Live Nedir?

Klasik sesli asistan üç parçadan kurulur: konuşmayı metne çeviren bir model, cevabı yazan bir dil modeli, metni sese çeviren bir motor. Üç durak, üç gecikme, üç fatura kalemi.

Ses-ses (audio-to-audio) mimarisi bu zinciri tek modele indiriyor. Ham ses girip ham ses çıkıyor. Kazancı sadece hız değil: ara katman metne çevirdiği anda tonlama, duraksama, vurgu, aksan bilgisi çöpe gider. Tek model bunları kaybetmeden taşıyor.

Teknik künye:

ÖzellikDeğer
Model kimliklerigemini-3.8-live, gemini-3.8-live-extended-thinking
DurumKararlı (GA), 15 Eylül 2026
Ses girdisiHam 16-bit PCM, 16 kHz, little-endian
Ses çıktısıHam 16-bit PCM, 24 kHz, little-endian
Diğer girdilerGörsel (JPEG, saniyede en fazla 1 kare), metin
Dil desteği97 dil, konuşma ortasında otomatik geçiş
Bağlam penceresiYerel ses çıkışlı modeller için 128 bin token
BağlantıWebSocket (GenAI SDK veya doğrudan)
Araç kullanımıFonksiyon çağırma, arama ile temellendirme, kod çalıştırma
FiligranÜretilen tüm seste SynthID

Girdi ve çıktının farklı örnekleme hızında olması dikkat isteyen bir ayrıntı: mikrofondan 16 kHz göndermeniz, hoparlöre 24 kHz basmanız gerekiyor. Ses kütüphanenizi tek bir hıza sabitlerseniz cırlak ya da ağır çıktı alırsınız.

Dil tarafındaki asıl yenilik sayının kendisi değil, geçiş: model 97 dili kendiliğinden algılıyor ve konuşmanın ortasında dil değiştirdiğinizde takip ediyor. Cümlenin yarısında İngilizce terim kullanan bir Türkçe konuşmacı için bu, ayar değil varsayılan davranış.

Görsel girdiyi de neredeyse gerçek zamanlı işliyor. Aşağıdaki demoda model kamerayı izleyip satranç tahtasındaki konumu okuyor ve konuşmayı kesmeden hamle öneriyor:

0:00
Gemini 3.8 Live'ın görsel bağlamı kullanarak satranç oynaması, Google

Benchmark Sonuçları 📊

Google’ın paylaştığı skorlar ses tarafına özgü testlerden geliyor, metin modellerinin tablosuyla karıştırmayın. Öne çıkanlar:

Test3.8 Live Extended Thinking3.8 Live
AA Ses-Ses Kalite Endeksi82,6 (1.)-
Speech Agent Arena-2. sıra
τ-Voice (ajan görev tamamlama)%68,6-
Sierra τ-Voice-banking%35,1-
Big Bench Audio (akıl yürütme)%97,7-
Ses girdisi ($/dk)0,0050,005
Ses çıktısı ($/dk)0,0180,018

Tablodaki boşluklar eksik değil, kasıtlı: Google iki modeli her testte yan yana yayınlamadı. Extended Thinking zeka sıralamalarında, standart 3.8 Live ise kullanıcı tercihi (Arena) tarafında öne çıkarılıyor. Fiyat ikisinde de aynı, yani Extended Thinking’in bedeli parayla değil gecikmeyle ödeniyor.

ServiceNow’un sesli ajanları ölçen EVA-Bench testinde Google, modellerin doğruluk ile konuşma akıcılığı arasındaki Pareto sınırını ittiğini söylüyor:

ServiceNow EVA-Bench grafiği: sesli ajanlarda deneyim kalitesine karşı görev tamamlama oranı, Gemini 3.8 Live modelleri Pareto sınırında
EVA-Bench: deneyim kalitesine karşı görev tamamlama. Kaynak: Google. Test, Gemini Enterprise Agent Platform üzerindeki Live API ile koşuldu.

İki Model, Tek Fark: Düşünme

İki modelin ayrımı net:

gemini-3.8-live varsayılan seçenek. Google bunu “akıl yürütme gecikmesi olmadan, düşük gecikmeli sesli ajan deneyimlerinin çoğu için” öneriyor. Araya serpiştirilmiş akıl yürütmeyi (interleaved reasoning) destekliyor ama thinkingLevel parametresini kabul etmiyor; kurulumda bu alanı hiç göndermeyin.

gemini-3.8-live-extended-thinking ise arka planda daha ağır düşünmesi gereken işler için. Burada thinkingLevel açık: low, medium, high. Ayrıca includeThoughts: true ile modelin düşünce özetlerini alabiliyorsunuz.

Google’ın bu modeli tanımlarken kullandığı ifade önemli: aynı anda hem düşünüyor hem konuşuyor. Uzun süren bir işlemde sessiz kalmak yerine “bir bakayım…” gibi erken sözlü işaretler veriyor ve çok adımlı arka plan görevlerinde ilerlemeyi anlatıyor. Sesli bir arayüzde bu kozmetik bir detay değil, kullanıcının hattı kapatmasını engelleyen şey.

Aşağıdaki demoda model, kağıda çizilmiş bir eskizi ve konuşarak verilen geri bildirimi çalışan React bileşenlerine çeviriyor:

0:00
Extended Thinking'in eskiz ve sesli geri bildirimi React bileşenine çevirmesi, Google

Seçim kuralı basit. Kullanıcı “siparişim nerede” diye soruyorsa standart model. Kullanıcı “üç farklı poliçeyi karşılaştır, bana hangisi uygun söyle” diyorsa Extended Thinking. Çünkü sesli bir görüşmede iki saniyelik sessizlik metinde iki saniyeden çok daha uzun hissettirir; düşünmeyi sadece gerçekten gerektiğinde satın alın.


Fiyatlar 💸

Live modellerinin fiyat tablosunda ses ve metin ayrı satırlarda, üstelik dakika cinsinden de veriliyor:

Kalem1 milyon tokenDakika başına
Metin girdisi0,75 $-
Ses girdisi3,00 $0,005 $
Metin çıktısı4,50 $-
Ses çıktısı12,00 $0,018 $

Ücretsiz kademede her iki model de bedava, sınırlar dahilinde. Arama ile temellendirme (grounding) ayrı faturalanıyor: ayda 5.000 istek ücretsiz, sonrası 1.000 istek için 14 dolar.

Bir görüşme gerçekte ne kadar tutuyor?

Dakika fiyatları işi somutlaştırıyor. Karşılıklı bir konuşmada süre kabaca yarı yarıya bölünür: yarısında kullanıcı konuşur (girdi), yarısında model (çıktı).

10 dakikalık bir müşteri görüşmesi:

  • 5 dakika ses girdisi → 5 × 0,005 = 0,025 $
  • 5 dakika ses çıktısı → 5 × 0,018 = 0,090 $
  • Toplam ≈ 0,115 $, yani görüşme başına yaklaşık 12 sent.

Günde 500 görüşme yapan bir destek hattı için aylık ≈ 1.725 dolar. Aynı hattı bir insan ekibiyle döndürmenin maliyetini biliyorsanız karşılaştırma kendini yapıyor. Ama dikkat: bu hesap sadece sesi kapsıyor. Sistem talimatınız, çağrı geçmişiniz ve araç çıktılarınız metin tokenı olarak ayrıca yazılıyor. Kendi sistem talimatınızın kaç token tuttuğunu token sayacı aracımızla ölçebilir, aylık faturayı LLM maliyet hesaplayıcımızla çıkarabilirsiniz.


15 Dakika Duvarı ve Oturum Yönetimi

Live API’nin en çok tökezletme potansiyeli olan yeri burası. Varsayılan sınırlar:

  • Sadece sesli oturum: 15 dakika
  • Sesli + görüntülü oturum: 2 dakika
  • Tek bir WebSocket bağlantısı: yaklaşık 10 dakika

Yani hiçbir şey yapmazsanız, uzayan bir görüşme ortasından kesilir. Google bunun için üç mekanizma veriyor:

Bağlam penceresi sıkıştırma. Kayan pencere mantığıyla çalışıyor; hangi token sayısında sıkıştırmanın tetikleneceğini siz belirliyorsunuz. Açtığınızda oturum teorik olarak süresiz uzayabiliyor, çünkü geçmiş periyodik olarak sıkıştırılıyor.

Oturum devam ettirme (session resumption). Bağlantı koptuğunda elinizde bir devam token’ı kalıyor. Bu token son oturum bitişinden itibaren 2 saat geçerli. Yeni bağlantıya bu token’ı verdiğinizde konuşma kaldığı yerden sürüyor, model baştan başlamıyor.

GoAway mesajı. Sunucu bağlantıyı kapatmadan önce haber veriyor ve mesajın içinde timeLeft alanı geliyor. Bu, “şimdi yeni bağlantıyı aç, kullanıcı fark etmesin” demeniz için tanınan süre. Beklemezseniz bağlantı ABORTED ile düşer.

Prodüksiyona çıkacak her sesli ajan bu üçünü de kurmak zorunda. Demoda 15 dakika bol gelir; gerçek bir müşteri görüşmesinde gelmez.


Kesme (Barge-in) ve Sessizlik Ayarı

Sesli asistanı gerçekten kullanılabilir yapan şey, sözünü kesebilmenizdir. Live API bunu ses etkinliği algılamasıyla (VAD) yönetiyor ve üç mod sunuyor: otomatik, hibrit, kapalı.

İki parametre işin kalitesini belirliyor:

  • prefixPaddingMs - konuşma algılanmadan önce ne kadar geriye dönük ses dahil edilecek. Bunu kısarsanız cümlelerin ilk hecesi uçar.
  • silenceDurationMs - sunucu, konuşma sırasının bittiğine karar vermeden önce sessizliği ne kadar bekleyecek. Google 500-800 ms aralığını öneriyor.

Bu ikinci değer bir denge noktası. Düşük tutarsanız model kullanıcı nefes alırken lafa girer. Yüksek tutarsanız her cevaptan önce sinir bozucu bir boşluk oluşur. Türkçede cümle sonu vurgusu İngilizceden farklı düştüğü için, önerilen aralığın üst ucundan başlayıp aşağı inmek daha güvenli.


Araç Çağırma Artık Beklemiyor

3.8 Live’daki en pratik değişiklik burada. Model bir fonksiyon çağırdığında (sipariş sorgula, stok kontrol et, rezervasyon yap) klasik davranış şuydu: model durur, cevabı bekler, sonra konuşur. Sesli bir görüşmede bu, hattın ölmesi demek.

3.8 Live asenkron fonksiyon çağırmayı açıkça behavior: NON_BLOCKING ile destekliyor. Model aracı çağırıyor, cevabı beklerken konuşmaya devam ediyor (“bir saniye, sipariş numaranıza bakıyorum”), sonuç geldiğinde konuşmanın içine yediriyor.

Geriye dönük uyumluluk için engelleyici (blocking) mod ve fonksiyon zamanlama seçenekleri duruyor, yani eski kodunuz kırılmıyor. Ama yeni yazıyorsanız varsayılanınız NON_BLOCKING olsun.

Google’ın kendi demosu tam olarak bu senaryoyu gösteriyor: model çok adımlı bir rezervasyonu arka planda yürütürken konuşma hiç kesilmiyor.

0:00
Çok adımlı rezervasyon ve asenkron fonksiyon çağrılarının konuşmayı kesmeden yürütülmesi, Google

Sesler ve Diller

Live modelleri, Gemini’nin metin okuma (TTS) modellerindeki seslerin tamamını kullanabiliyor: 30 hazır ses. Her birinin bir karakteri var, örneğin Zephyr parlak, Puck neşeli, Kore sert, Enceladus fısıltılı. Hepsini Google AI Studio üzerinden dinleyip seçebilirsiniz.

Konuşma tarafında 97 dil destekleniyor, Türkçe dahil, ve model konuşmanın ortasında diller arasında kendiliğinden geçiyor.

Pratik uyarı: bir sesin İngilizcede kulağa hoş gelmesi Türkçede de hoş geleceği anlamına gelmiyor. Üretime çıkmadan önce seçtiğiniz sesi kendi senaryo metninizle, Türkçe olarak dinleyin.

Üretilen her ses SynthID ile filigranlanıyor. Duyulmayan bu işaret doğrudan ses dalgasının içine gömülüyor, yani çıktınız kulakla ayırt edilemese bile makineyle yapay zeka üretimi olarak tespit edilebiliyor.


Geliştiriciyseniz: Başlangıç

Temel iskelet şöyle (Python, GenAI SDK):

from google import genai

client = genai.Client()
model = "gemini-3.8-live"

config = {
    "response_modalities": ["AUDIO"],
    "speech_config": {
        "voice_config": {"prebuilt_voice_config": {"voice_name": "Kore"}}
    },
    "realtime_input_config": {
        "automatic_activity_detection": {"silence_duration_ms": 700}
    },
    "session_resumption": {},
}

async with client.aio.live.connect(model=model, config=config) as session:
    await session.send_client_content(
        turns={"role": "user", "parts": [{"text": "Merhaba, kimsin?"}]}
    )
    async for response in session.receive():
        if response.data:
            # 24 kHz, 16-bit PCM ses parçası
            play(response.data)

Extended Thinking sürümüne geçerken model kimliğini değiştirmek yetmiyor, düşünme seviyesini de eklemeniz gerekiyor:

model = "gemini-3.8-live-extended-thinking"
config["thinking_config"] = {"thinking_level": "medium", "include_thoughts": True}

Standart gemini-3.8-live modelinde bu bloğu göndermeyin; thinkingLevel desteklenmiyor.

API anahtarınızı tarayıcıya koymayın
Live API WebSocket ile çalıştığı için bağlantıyı doğrudan tarayıcıdan kurmak cazip gelir. Yapmayın: API anahtarınız istemci koduna gömülür ve herkes görür. Google bunun için geçici token (ephemeral token) veriyor. Sunucunuz kısa ömürlü bir token üretir, tarayıcı o token’la bağlanır, asıl anahtar sunucuda kalır.

Eski Modelden Geçiş

Live tarafında zaten bir şeyler çalıştırıyorsanız, takviminizde iki madde var:

gemini-3.1-flash-live-preview artık eski (legacy) önizleme olarak işaretli. Google doğrudan şunu söylüyor: düşük gecikmeli sesli ajan deneyimlerinin çoğu için varsayılan seçenek olarak Gemini 3.8 Live’a geçin. Eski modelin bağlam penceresi 131.072 token girdi, 65.536 token çıktıydı.

Ayrı bir uçtan, Gemini Omni tarafında gemini-omni-flash-preview uç noktası 30 Eylül 2026‘da kapatılıyor. Yerine geçen kararlı model gemini-omni-1.1-flash. Bu bir video modeli, Live ile karıştırmayın, ama aynı hafta iki taşıma işi birden çıkmasın diye takvime yazın.

Google’ın Live modellerini emekliye ayırma geçmişi de var: gemini-2.0-flash-live-001 ve gemini-live-2.5-flash-preview 9 Aralık 2025’te kapatılmıştı. Önizleme uç noktalarına üretim bağlamayın.


Hangi İşte Hangi Model?

İhtiyaçModel
Sesli müşteri hattı, sipariş takibi, randevugemini-3.8-live
Sesli danışmanlık, karşılaştırma, çok adımlı analizgemini-3.8-live-extended-thinking
Metin sohbeti, kod, belge işlemegemini-3.8-flash
Video üretme ve düzenlemegemini-omni-1.1-flash
Sadece metni sese çevirmeGemini TTS modelleri

Son satır önemli: elinizde zaten metin varsa Live API’ye ihtiyacınız yok, TTS yeter ve ucuza gelir. Live, konuşmanın iki yönlü ve kesilebilir olması gerektiğinde anlamlı.


Sırada Ne Var?

Google DeepMind ürün lideri Logan Kilpatrick’e göre Gemini 3.5 Pro partnerlerle test ediliyor ve ekip bugüne kadarki en iddialı ön eğitim koşusunu, Gemini 4 için başlatmış durumda. Flash tarafında üç ayda üç sürüm çıktığı düşünülürse, Live tarafının da uzun süre sabit kalmasını beklemek iyimserlik olur.


Sıkça Sorulan Sorular

Soru: Gemini 3.8 Live ne zaman çıktı? Cevap: Google, Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking modellerini 15 Eylül 2026 tarihinde kararlı (GA) sürüm olarak yayınladı.

Soru: Gemini 3.8 Live fiyatı ne kadar? Cevap: Ses girdisi 1 milyon token için 3,00 dolar ya da dakika başına 0,005 dolar; ses çıktısı 1 milyon token için 12,00 dolar ya da dakika başına 0,018 dolar. Metin girdisi 0,75 dolar, metin çıktısı 4,50 dolar. 10 dakikalık karşılıklı bir görüşme yaklaşık 12 sent tutuyor.

Soru: Gemini 3.8 Live ücretsiz mi? Cevap: Evet, ücretsiz kademe var ve sınırlar dahilinde hem girdi hem çıktı ücretsiz. Google AI Studio üzerinden anahtar almadan deneyebilirsiniz. Üretim yükü için ücretli kademeye geçmeniz gerekir.

Soru: Gemini 3.8 Live ile Extended Thinking farkı ne? Cevap: Standart gemini-3.8-live araya serpiştirilmiş akıl yürütme yapar ama thinkingLevel parametresini kabul etmez. gemini-3.8-live-extended-thinking ise low, medium, high düşünme seviyelerini ve includeThoughts ile düşünce özetlerini destekler. Daha derin düşünür, karşılığında daha geç cevap verir.

Soru: Gemini 3.8 Live Türkçe destekliyor mu? Cevap: Evet. Live modelleri 97 dilde konuşabiliyor ve Türkçe bunlar arasında. Model konuşmanın ortasında dil değiştiğinde kendiliğinden takip ediyor. Yine de seçtiğiniz sesi üretime almadan önce Türkçe metinle dinleyin.

Soru: Bir Gemini Live oturumu en fazla ne kadar sürer? Cevap: Sıkıştırma kapalıyken sadece sesli oturumlar 15 dakika, sesli artı görüntülü oturumlar 2 dakika ile sınırlı. Bağlam penceresi sıkıştırmayı açarsanız oturum süresiz uzayabiliyor. Bağlantı koptuğunda ise oturum devam ettirme token’ı 2 saat geçerli kalıyor.

Soru: Telefonumdaki Gemini Live ile aynı şey mi? Cevap: Hayır. Telefondaki Gemini Live, Gemini uygulamasındaki sesli sohbet özelliğidir ve kod yazmadan kullanılır. Gemini 3.8 Live ise geliştiricilerin kendi uygulamalarına sesli ajan koyması için sunulan bir API modelidir.

Soru: Gemini 3.8 Live’a tarayıcıdan bağlanabilir miyim? Cevap: Evet ama API anahtarınızı istemci koduna koymayın. Google bu senaryo için geçici (ephemeral) token veriyor: sunucunuz kısa ömürlü bir token üretir, tarayıcı onunla WebSocket bağlantısı kurar, asıl anahtar sunucuda kalır.


Sağlıcakla kalın… 🙂

Yapay Zeka Tarafından Oluşturulan İçerik Uyarısı
Bu blog tamamen yapay zeka tarafından oluşturulmuştur. Yapay zeka içerik oluşturmaya yardımcı olsa da, hala hatalar veya önyargılar içerebilir. Kritik detayları kullanmadan önce doğrulayın.