LLM API Maliyet Hesaplayıcı
GPT-5, Claude, Gemini ve Grok için token sayısı ve günlük istek adedine göre API maliyetinizi hesaplayın. İstek başı, günlük ve aylık maliyeti anlık görün.
LLM API Maliyeti Nasıl Hesaplanır?
GPT, Claude, Gemini ve Grok gibi büyük dil modeli (LLM) API'leri kullanım başına değil, token başına ücretlendirilir. Her istek iki tür token tüketir: modele gönderdiğiniz girdi (input/prompt) tokenları ve modelin ürettiği çıktı (output/completion) tokenları. Sağlayıcılar bu ikisini ayrı fiyatlandırır; çıktı tokeni neredeyse her modelde girdi tokeninden 4-8 kat daha pahalıdır, çünkü üretim (inference) girdiyi okumaktan çok daha fazla hesaplama gerektirir.
Bu araç istek başına maliyeti şu formülle hesaplar: (girdi token / 1.000.000 x girdi fiyatı) + (çıktı token / 1.000.000 x çıktı fiyatı). Günlük maliyet bunu günlük istek sayısıyla, aylık maliyet ise günlük maliyeti 30 ile çarparak bulunur. Üretim ortamındaki gerçek trafiğinizi (ortalama prompt uzunluğu, ortalama yanıt uzunluğu, günlük istek hacmi) girerek bir özelliği canlıya almadan önce aylık API faturanızı tahmin edebilirsiniz. Token sayısını tam olarak ölçmek için Token Sayacı aracımızı kullanabilirsiniz.
Model Fiyat Tablosu (1 Milyon Token Başına, USD)
Aşağıdaki fiyatlar 5 Eylül 2026 tarihinde sağlayıcıların resmi fiyatlandırma sayfalarından doğrulandı. Fiyatlar önceden haber verilmeden değişebilir ve promosyonlar sona erer; karar vermeden önce sağlayıcıdan teyit edin.
| Model | Girdi ($/1M) | Çıktı ($/1M) |
|---|---|---|
| GPT-6 Astra | 10 | 50 |
| GPT-5.6 Sol | 4 | 20 |
| GPT-5.6 Terra | 2 | 12 |
| GPT-5.6 Luna | 0.20 | 1.20 |
| GPT-5 | 1.25 | 10 |
| GPT-5 mini | 0.25 | 2 |
| Claude Opus 5 | 5 | 25 |
| Claude Fable 5.1 | 10 | 50 |
| Claude Fable 5 | 10 | 50 |
| Claude Opus 4.8 | 5 | 25 |
| Claude Sonnet 5 | 2 | 10 |
| Claude Haiku 4.5 | 1 | 5 |
| Gemini 3.8 Flash (31 Ara 2026'ya kadar) | 0.75 | 3.75 |
| Gemini 3.7 Flash (31 Ara 2026'ya kadar) | 0.75 | 3.75 |
| Gemini 3.6 Flash (31 Ara 2026'ya kadar) | 0.75 | 3.75 |
| Gemini 3.5 Flash-Lite | 0.30 | 2.50 |
| Gemini 2.5 Pro | 1.25 | 10 |
| Grok 4.6 | 2 | 6 |
| Kimi K3 | 3 | 15 |
| Qwen3.8-Max | 2 | 6 |
| Qwen3.8-Flash | 0.16 | 0.47 |
| GLM-5.3 | 1.40 | 4.40 |
| GLM-5.3-Flash (promosyon) | 0.075 | 0.25 |
| DeepSeek V4.1 Flash | 0.30 | 1.20 |
| DeepSeek V4.1 Flash (yoğun olmayan saat) | 0.15 | 0.60 |
| Muse Spark 1.3 | 1.25 | 4.25 |
| Muse Spark 1.3 (Contributor) | 0.10 | 0.20 |
| Gemini Omni 1.1 Flash (video çıktı) | 1.50 | 17.50 |
| Gemini Omni 1.1 Flash (metin çıktı) | 1.50 | 9 |
İlgili yazı
DeepSeek V4.1 Flash listede iki satır kaplıyor, çünkü DeepSeek saate göre fatura kesiyor: hafta içi 01:00-04:00 ve 06:00-10:00 UTC aralığı yoğun saat, kalan her şey (hafta sonu dahil) yarı fiyat. Türkiye saatiyle akşam çalışan bir toplu iş, aynı modeli aynı işte $0,15/$0,60 tarifesinden kullanıyor. Mimarinin, benchmark skorlarının ve V4 Pro'nun emekliye ayrılmasının ayrıntıları DeepSeek V4.1 Flash yazımızda.
GPT-6 Astra ve Claude Fable 5.1 bu listede aynı satırda duruyor: $10 girdi, $50 çıktı. Ama önbellek okuma fiyatı Fable'da dört kat ucuz ve Astra'da 272 bin token üstü isteklerde tarife zamlanıyor. Aynı etiketin nasıl iki farklı faturaya çıktığını üç senaryo üzerinden GPT-6 Astra vs Claude Fable 5.1 karşılaştırmamızda hesapladık.
Muse Spark 1.3 listede iki kez geçiyor, çünkü Meta modeli iki tarifeden satıyor: standart uç nokta $1,25/$4,25, Contributor uç noktası $0,10/$0,20. Aradaki 12,5 kat indirimin karşılığı, Meta'nın istemlerinizi ve model cevaplarını eğitimde kullanmasına izin vermeniz. Tarifeleri, kapalı kalan max modunu ve benchmark skorlarını Muse Spark 1.3 yazımızda anlattık.
Listedeki en pahalı OpenAI modeli GPT-6 Astra: 1 milyon token başına $10 girdi ve $50 çıktı, yani GPT-5.6 Sol'ün 2,5 katı. OpenAI'ın savunması "önemli olan görev başına maliyet"; modelin ARC-AGI-3, DeepSWE ve OSWorld skorlarını, Astra Pro farkını ve kritik siber seviyesini GPT-6 Astra yazımızda anlattık.
Qwen3.8-Max tarafında kademeli fiyat yok ve tekrar eden girdi $0,25'e düşüyor. Modelin fiyatlandırmasını, bağlam penceresini ve benchmark skorlarını Qwen3.8-Max incelememizde ayrıntılı anlattık.
Aynı ailenin ucuz ucu Qwen3.8-Flash: 1 milyon token başına $0,16 girdi ve $0,47 çıktı, yani Max'in yaklaşık on ikide biri. Modelin mimarisini, 1 milyon tokenlık bağlamını ve benchmark skorlarını Qwen3.8-Flash-Next yazımızda anlattık.
Listedeki en ucuz çok modlu seçenek GLM-5.3-Flash: liste fiyatı 1 milyon token başına $0,15 girdi ve $0,50 çıktı, ancak Z.ai şu anda %50 indirim uyguluyor, yani fiilen $0,075 ve $0,25. Hesaplayıcı indirimli fiyatı kullanıyor. 320 milyar toplam, 18 milyar aktif parametreli mimarisini ve benchmark skorlarını GLM-5.3-Flash yazımızda inceledik.
Gemini Omni 1.1 Flash listedeki tek video üreten model, bu yüzden iki satırı var: girdi her iki durumda da 1 milyon token başına $1,50, çıktı ise metinde $9, videoda $17,50. Video faturası saniye başına token olarak hesaplanır: 720p bir saniye 5.792 token, yani yaklaşık $0,10. 360p taslak modu bunun üçte biri ($0,03/sn), 1080p $0,15/sn, 4K $0,30/sn. Modelin 40 saniyelik sahne uzatma ve ilk/son kare kontrolünü Gemini Omni 1.1 Flash yazımızda anlattık.
Sıkça Sorulan Sorular
LLM API fiyatlandırması nasıl çalışır?
LLM sağlayıcıları girdi (prompt) ve çıktı (yanıt) tokenlarını ayrı fiyatlandırır; çıktı tokeni genelde girdi tokeninden birkaç kat daha pahalıdır çünkü modelin üretmesi daha maliyetlidir. Fiyatlar genelde 1 milyon token başına USD olarak verilir.
Token nedir, kabaca kaç karaktere denk gelir?
Token, modelin metni işlediği küçük parçadır; İngilizce metinde kabaca 1 token 4 karaktere denk gelir (yaklaşık 0.75 kelime). Türkçe gibi eklemeli dillerde token sayısı genelde karakter başına biraz daha yüksek çıkar. Kesin sayım için Token Sayacı aracını kullanabilirsiniz.
LLM API maliyetini düşürmenin yolları nelerdir?
Prompt'u kısaltmak, gereksiz bağlam/geçmiş mesajı atmak, daha ucuz bir mini/flash modele geçmek, çıktı uzunluğunu (max tokens) sınırlamak, prompt caching kullanmak ve tekrar eden istekleri önbelleklemek maliyeti belirgin şekilde azaltır.