En iyi yapay zeka sohbet modeli
Açık uçlu sohbette bugün en yüksek puan Claude Fable 5 de: Arena metin tablosunda 389 model arasında 1506 ile birinci, Opus 5 ise on iki puan geride ve yarı fiyatına. Ama bu tablo uygulamaları değil modelleri sıralıyor ve ChatGPT nin neden satırı olmadığını açıklayan tek şey bu karar.
- dokuz model, hepsi sıralı
- ağırlıklar sayfada
- modeller sıralanıyor, uygulamalar değil
Son kontrol: Bu bir referans sayfasıdır. Üretici kaynaklarına karşı yeniden doğrulanır ve yeni bir sürüm çıktığında güncellenir. Neler değişti
Bugünün sıralaması, sayı, tarih ve oy sayısı yayımlayan bir tablodan
Bu tablonun altında sırasız tek aday yok. Boş hücre, üreticinin hiçbir şey yayımlamadığı anlamına gelir; modelin sıfır aldığı anlamına değil.
| Sıra | Araç | Puan | Genel metin tablosu 45 | Dolar başına puan 20 | Bağlam penceresi 15 | Araç olgunluğu 10 | İrandan erişim 10 |
|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 Güncel seçim | 78.6 | 1,506 Kaynak | 30.1 Kaynak | 1 milyon token Kaynak | 4/4 Opus 5 ile ayni altyapiyi tasiyor ve bes yolun hepsinde sunuluyor: Anthropic in kendi API si, Bedrock, AWS uzerinde Claude Platform, Google Cloud ve Microsoft Foundry. | engelli / çalışan bir yol yok Iran, Anthropic in desteklenen ulkeler listesinde yok. Ag uzerinde olculerek degil, Anthropic in kendi sayfasindan okundu. |
| 2 | Claude Opus 5 | 71.1 | 1,494 Kaynak | 59.8 Kaynak | 1 milyon token Kaynak | 4/4 API, resmî uygulama, komut satırı aracı, ajan SDK si, toplu çalıştırma ve üç büyük bulutta sunum | engelli / çalışan bir yol yok İran, Anthropic in iki desteklenen ülke listesinin hiçbirinde yok: ne API listesinde ne claude.ai listesinde. Bunu ölçerek değil, Anthropic in kendi sayfasında okuyarak biliyoruz: bağımsız bir ağ testi henüz yapılmadı ve yapıldığında buraya yazılacak. |
| 3 | GPT-5.6 Sol | 54.2 | 1,481 Kaynak | 49.4 Kaynak | 1 milyon token Kaynak | 4/4 En ust basamagi ureticinin kendi belgelerinden aliyor: API, SDK lar ve resmi bir komut satiri, Codex editor eklentisi, bir Agents SDK, toplu is hatti ve openai.gpt-5.6-sol kimligini adiyla anan resmi bir Amazon Bedrock rehberi. Bu model icin openai.com hic acilmadan dolan tek sutun bu. | doğrulanmadı |
| 4 | Qwen3.8 Max | 49.4 | 1,490 Kaynak | 248.3 Kaynak | 1 milyon token Kaynak | doğrulanmadı | doğrulanmadı |
| 5 | Kimi K3 Max | 48.2 | 1,487 Kaynak | 99.1 Kaynak | 1 milyon token Kaynak | 1/4 OpenAI uyumlu bir API ve tek bir resmi istemci. Platform belgeleri resmi bir komut satiri araci ya da editor eklentisi listelemiyor, bu yuzden daha yuksek puan vermiyoruz. | doğrulanmadı |
| 6 | Gemini 3.1 Pro | 42.7 | 1,486 Kaynak | 123.8 Kaynak | doğrulanmadı | doğrulanmadı | engelli / çalışan bir yol yok Gemini API nin kullanilabilir bolgeler sayfasi, API nin calistigi ulkeleri listeliyor ve Iran o listede yok. Bunu olcerek degil, orada okuyarak biliyoruz; bagimsiz bir test henuz yapilmadi. |
| 7 | GLM-5.2 Max | 37.0 | 1,470 Kaynak | 334.1 Kaynak | 1 milyon token Kaynak | 1/4 Belgelenmis bir API ve tek bir resmi istemci. Belgelerde resmi bir komut satiri araci ya da editor eklentisi listelenmiyor. | doğrulanmadı |
| 8 | DeepSeek V4 Flash | 33.6 | 1,435 Kaynak | 5,125.0 Kaynak | 1 milyon token Kaynak | 1/4 Belgelenmis bir API ve tek bir resmi istemci. Resmi ajan araci ya da editor eklentisi listelenmemis. | doğrulanmadı |
| 9 | Grok 4.5 | 29.1 | 1,469 Kaynak | 244.8 Kaynak | 500 bin token Kaynak | 3/4 OpenAI uyumlu bir API, Python ve JavaScript SDK lari ve Grok Build adinda resmi bir komut satiri ajani. Ust basamaga cikmiyor: birinci taraf editor eklentisi yok ve toplu is hatti tam da bu modeli reddediyor. | doğrulanmadı |
Boş bir hücre, o değeri doğrulayamadığımız anlamına gelir; aracın sıfır aldığı anlamına gelmez.
Bu sıralama nasıl hesaplanıyor
Aşağıdaki her ölçütün bir ağırlığı ve bir kaynağı var. Bir ağırlığı değiştirin, tablo baştan hesaplanır. Bu rehberde elle yerleştirilmiş hiçbir sıra yok.
| Ölçüt | Ağırlık | Kanıt |
|---|---|---|
| Genel metin tablosu | 45 | Arena (Text)Açık uçlu sohbette insan tercihi. Sohbet için doğru ölçüye en yakın şey bu, ağırlığın en büyüğünü de bu yüzden taşıyor |
| Dolar başına puan | 20 | yukarıdaki iki değerden hesaplanırBir API üzerine sohbet kuruyorsanız yüzde bir puan için iki kat fiyat kötü bir takas. Uygulama aboneliği alıyorsanız bu sütun size dokunmuyor |
| Bağlam penceresi | 15 | üreticinin belirttiği özellikUzun sohbet, pencere dolduğunda önce hafızasını kaybeder, sonra pahalılaşır |
| Araç olgunluğu | 10 | tanımlı ölçek, her atama için yazılı gerekçe ileResmi uygulaması, SDK sı ve bulut yolu olmayan model, günlük işte kendinden biraz zayıf olanın gerisine düşer |
| İrandan erişim | 10 | erişim sütunumuz, yöntemi yazılıYüzde on, çünkü bu sütunun kendi sayfası var. Bugün dokuz satırdan yalnızca üçü burada kanıt taşıyor |
Fable 5 neden önde ve bu neden tartışmalı
Bir sayı ve bir koşul. Sayı şu: Fable 5, Arena metin tablosunda 389 model arasında 1506 ile birinci ve kırk beş ağırlıklı sütunun tamamını alıyor. Koşul şu: aynı model dolar başına puan sütununu tamamen kaybediyor. Çıktısı milyon token başına 50 dolar, tablonun en pahalı satırı; oranı 30.1 e iniyor ve bu tablonun dibi.
Opus 5 on iki puan aşağıda ve yarı fiyatına. Üst kesimin tamamının yaklaşık elli puana sığdığı bir tabloda on iki puan çok değil. Yani gerçek cevap soruya göre ikiye ayrılıyor: bir API üzerine sohbet kuruyor ve aylık fatura ödüyorsanız Opus 5; uygulama aboneliği alıyorsanız fiyat sütunu size işlemiyor ve istediğiniz şey tablonun tepesi.
Kendi birincimizin aleyhine, buradaki hiçbir sütunun ölçmediği bir şey: Fable 5, Anthropic in kendi tablosunda yavaş diye işaretlenen tek model ve uyarlanabilir düşünmesi hep açık, yani kısacak bir kol yok. Sohbette gecikme hissedilir. Tablomuz bunu görmüyor, siz on dakikada göreceksiniz.
Bu tablo uygulamaları değil modelleri sıralıyor
Bilinçli bir seçim ve bedeli var, o yüzden açıkça söyleyelim. Buradaki beş sütun da bir model hakkında yayımlanan sayılar: liderlik puanı, milyon token fiyatı, bağlam penceresi. Hiçbir üretici bunların üçünü de sohbet uygulaması için yayımlamıyor. Uygulamaları sıralasak beş sütunun üçü çoğu satırda boş kalır ve bu artık tablo olmaz.
İkinci sebep daha önemli: tek bir model birkaç uygulamanın altında çalışıyor ve uygulama, altındaki modeli size haber vermeden değiştiriyor. Opus 5 aynı anda Claude uygulamasının, API nin ve Claude Code un altında. "Claude" u satır yaparsanız aynı sayıyı kodlama tablosunda ikinci kez saymış olursunuz. Video kategorisinin araçları değil sürümleri sıralamasının sebebi de aynı.
Ders çalışma kategorisinde tam tersi kararı verdik ve orada doğruydu, çünkü Google defterin kendi limitlerini sayı olarak yayımlıyor: elli kaynak, beş yüz bin kelime. Sohbet uygulaması için hiçbir üretici benzerini yayımlamıyor. Bedeli de şu: Claude, Gemini ve ChatGPT birer uygulama olarak burada satır taşımıyor; o sorular kendi sayfalarında cevaplanıyor.
ChatGPT neden satırsız ve OpenAI den elimizde ne var
Kısa cevap: ChatGPT bir ürün, bu tablo ise modelleri sıralıyor, yani zaten satır olmayacaktı. Ama uzun cevap bizim aleyhimize ve daha önemli: istesek de onu tarif edemezdik. openai.com üzerindeki her yol bu sunucuya 403 dönüyor, 12 Ağustos 2026 da yeniden denendi ve o alan adının kendi robots.txt dosyası taramayı yasaklamıyor.
Buna karşılık açık olan ve bugüne kadar kullanmadığımız bir kapı var: developers.openai.com eksiksiz yanıt veriyor. GPT-5.6 Sol orada 5 dolar giriş, 30 dolar çıkış, 1,05 milyon tokenlik pencere, 128 bin token azami çıktı ve 16 Şubat 2026 bilgi kesimiyle listeli. Arena satırları da mevcut. Yani bugün tam da bu tablonun üçüncü satırı.
Özeti tek cümle: model sıralanabiliyor, uygulama tarif edilemiyor. Size hâlâ söyleyemediğimiz şey, bugün ChatGPT nin altında hangi modelin çalıştığı, planlarının ne tuttuğu ve İrandan açılıp açılmadığı. Üçü de yanıt vermeyen alan adında duruyor. OpenAI sayfası bu sınırı tam olarak yazıyor.
Liderlik tablosunu doğru okumanın öğrettiği
Doğrulanmamış diye kaydettiğimiz iki satır aslında baştan beri tablodaydı. GLM-5.2 Max 1470 ile 33., DeepSeek V4 Flash 1435 ile 83. sırada. Önceki tur sayfanın üst kısmını okumuş; bu tur sayfanın kendi gönderdiği JSON u okudu. Böylece bu kategoride sıralanamayan iki aday sıralanabilir oldu ve kodlama tablosu da kaydı. O boşluk üreticilerin değil bizimdi.
İkincisi satırın adıyla ilgili. Bu referans daha önce, bir Arena satırının modeli değil bir sunum yapılandırmasını adlandırdığını savunmuştu. OpenAI de bir adım öteye gidiyor: WebDev satırı harfi harfine gpt-5.6-sol-xhigh (codex-harness) yazıyor. Yani o puan, çıplak modele değil, OpenAI nin kendi kodlama ajanının içindeki modele ait. Fiyat ve pencere temel modele yapışır, puan ise gerçekte test edilene.
Üçüncüsü düşmediğimiz bir tuzaktı. Aynı tabloda deepseek-v4-pro adlı bir satır 1458 ile Flash in üstünde oturuyor. O, bir ayar değil, aynı ailedeki başka bir model; o yüzden sayısını ödünç almadık. Alsaydık DeepSeek iki sıra yükselirdi ve kimse fark etmezdi.
Kendi yöntemimizin abarttığı yer
Dokuz satırın hepsi 71 Elo puanına sığıyor, 1506 dan 1435 e. Min-maks normalleştirme bu 71 puanı 78.6 ile 29.1 arasına yayıyor. Yani puan sütunu mesafeyi olduğundan büyük gösteriyor ve son satır zayıf değil: üst düzey modellerden oluşan bir tablonun sonuncusu.
Daha keskin bir örnek, çünkü bizi de şaşırttı. Bağlam sütununu GPT-5.6 Sol 1.050.000 tokenle kazanıyor, Kimi K3 Max ise 1.048.576 taşıyor. Fark 1.424 token, yaklaşık binde bir, ve pratikte hiçbir şeyi değiştirmiyor. İkisi de sütunun neredeyse tamamını alıyor ve bu doğru; ama yarın iki milyonluk pencereli bir model eklensin, ikisi birden o sütunu kaybeder, kendilerinde hiçbir şey değişmeden.
İlk seçimimizi ne zaman almamalısınız
- Model değil uygulama arıyorsanız bu tablo cevabınız değil. Claude ve Gemini ürün sayfaları o soruyu doğru düzeyden cevaplıyor.
- İşiniz kodsa buradaki sıra kodlama tablosundan farklı ve oradaki ölçütler tamamen başka.
- İş yükünüz yüksek hacimli ve kısa cevaplıysa ilk sütunu geçin ve dolar başına puanı okuyun; DeepSeek orada açık farkla önde.
- İrandan resmi bir yol olmadan sohbete ulaşıyorsanız, modellerin sırası sorununuza en son değen şey.
Yetersiz kaldığı yerler
- Ana ölçüt bir insan tercihi tablosu: hangi cevabın tercih edildiğini ölçüyor, hangisinin doğru olduğunu değil.
- Tablonun tamamı 71 Elo puanına sığıyor ve normalleştirme bunu 78.6 ile 29.1 arasına yayıyor, yani puan sütunu gerçek mesafeyi büyütüyor.
- Dokuz satırın altısı İran sütununda kanıt taşımıyor, çünkü üreticileri hiçbir ülke listesi yayımlamıyor. Bunu yalnızca Anthropic ve Google yapıyor.
- ChatGPT, Claude uygulaması ve Gemini uygulaması burada satır taşımıyor, çünkü tablo uygulamaları değil modelleri sıralıyor.
- Qwen3.8 Max ve Gemini 3.1 Pro nun ikisinde de iki boş sütun var. Bu, üreticinin yayımladığındaki bir boşluk; modelin zayıflığı değil, ama puanlarını gerçekten aşağı çekiyor.
- DeepSeek 0,28 dolarlık çıktısıyla dolar başına puan sütununu öyle geriyor ki Opus 5 ile Qwen arasındaki dört katlık fark o sütunda bir puanın altına iniyor.
Bizim görüşümüz
Bir API üzerine sohbet kuruyor ve birini seçmek zorundaysanız Opus 5: Fable 5 ten on iki puan aşağıda ve yarı fiyatına. Uygulama aboneliği alıyorsanız bu tablonun fiyat sütunu size işlemiyor, okumanız gereken tablonun tepesi. Hangisi müşterinize cevap verir diye soruyorsanız, dürüst cevabımız hiçbiri, çünkü o başka bir iş.
İnsanların gerçekten sorduğu sorular
En iyi yapay zeka sohbet modeli hangisi
Arena metin tablosunda bugün Claude Fable 5 1506 ile önde. Ama Opus 5, 1494 ile yarı fiyatına ve üst kesimin elli puana sığdığı bir tabloda bu on iki puanı pratikte hissetmek zor.
ChatGPT neden bu tabloda yok
Çünkü tablo modelleri sıralıyor, ChatGPT ise bir ürün. Modeli burada: GPT-5.6 Sol üçüncü satır. Uygulamanın kendisini tarif edemiyoruz, çünkü openai.com üzerindeki her yol sunucumuza 403 dönüyor.
Bu sıra neden kodlama tablosundan farklı
Çünkü ölçütler farklı. Orada WebDev tablosu yüzde kırk taşıyor, burada genel metin tablosu yüzde kırk beş. Daha iyi kod yazan model, insanların tercih ettiği cevapları vermek zorunda değil ve Opus 5 ile Fable 5 tam da bu iki tablo arasında yer değiştiriyor.
Bunların hangisi İrandan çalışıyor
Hiçbirinin resmi bir yolu yok. Anthropic ve Google ülke listesi yayımlıyor ve İran ikisinde de yok; diğer üreticiler hiç liste yayımlamıyor, o hücreler bu yüzden boş. Hesap satmıyor, engel aşma önermiyoruz.
Bu tablonun tepesindeki model size cevap verir, müşterinize değil. İkinci iş için robot değil insan gönderiyoruz ve tam olarak bu şudur: sanal asistan hizmetimiz