En iyi yapay zeka sohbet modeli
Açık uçlu sohbette en yüksek Arena metin puanı hâlâ 1507 ile Claude Fable 5 te ve bugünün tuhaf yanı da bu: Anthropic aynı modeli 1 Eylül de eskiye aldı ve halefi üç puan geride tam altında oturuyor. Tablo uygulamaları değil modelleri sıralıyor; ChatGPT nin neden satırı olmadığı da bundan.
- on iki model, hepsi sıralı
- ağırlıklar sayfada
- modeller sıralanıyor, uygulamalar değil
Son kontrol: Bu bir referans sayfasıdır. Üretici kaynaklarına karşı yeniden doğrulanır ve yeni bir sürüm çıktığında güncellenir. Neler değişti
Her aracın puanı nereden geliyor
Aşağıdaki halka, tablonun sütun başlıklarında yazan ağırlıkların ta kendisidir.
- Genel metin tablosu 45
- Dolar başına puan 20
- Bağlam penceresi 15
- Araç olgunluğu 10
- İrandan erişim 10
Bu ağırlıkları biz seçtik ve tablodaki tek yorum bu. Ağırlıkları değiştirin, sıra da değişir.
Bugünün sıralaması, sayı, tarih ve oy sayısı yayımlayan bir tablodan
Bu tablonun altında sırasız tek aday yok. Boş hücre, üreticinin hiçbir şey yayımlamadığı anlamına gelir; modelin sıfır aldığı anlamına değil.
Boş bir hücre, o değeri doğrulayamadığımız anlamına gelir; aracın sıfır aldığı anlamına gelmez.
Her sayinin arkasinda
Bu tablodaki her takdire dayali puanin yazili bir gerekcesi var ve Iran sutunu nasil kontrol edildigini soyluyor. Bu ikisi burada acik. Her sayinin arkasindaki olcum izi, yani hangi liderlik tablosunun hangi satiri ve kac oy, ait oldugu modelin altinda aciliyor.
1 Claude Fable 5
Araç olgunluğu 4/4 Opus 5 ile ayni altyapiyi tasiyor ve bes yolun hepsinde sunuluyor: Anthropic in kendi API si, Bedrock, AWS uzerinde Claude Platform, Google Cloud ve Microsoft Foundry.
İrandan erişim engelli / çalışan bir yol yok Iran, Anthropic in desteklenen ulkeler listesinde yok. Ag uzerinde olculerek degil, Anthropic in kendi sayfasindan okundu.
Olcum izi (2)
Genel metin tablosu 1,507 claude-fable-5 satırı. Arena metin tablosunda 1. sıra. 2 Eylül 2026 güncellemesi. 7.999.020 oy
Dolar başına puan 30.1 Arena (Text) puanı, milyon çıktı tokeni fiyatına bölünür
2 Claude Fable 5.1
Araç olgunluğu 4/4 Bes yolun hepsinde sunuluyor ve Anthropic in kendi tablosu her biri icin bir model kimligi yaziyor. Ayni tabloda Claude Platform on AWS hucresi Opus 5 icin bir tire, bu model icin bir kimlik.
İrandan erişim engelli / çalışan bir yol yok Iran, Anthropic in desteklenen ulkeler listesinde yok. Ag uzerinde olculerek degil, Anthropic in kendi sayfasindan okundu. Bu surumde de degisen bir sey yok.
Olcum izi (2)
Genel metin tablosu 1,504 claude-fable-5.1-max satırı, Arena metin tablosunda 3. sıra, 2 Eylül 2026 güncellemesi, 7.999.020 oy
Dolar başına puan 30.1 Arena (Text) puanı, milyon çıktı tokeni fiyatına bölünür
3 Muse Spark 1.2
Araç olgunluğu 2/4 1.3 ile ayni yollar: Meta Model API ve OpenRouter; Meta nin kendi belgelerinde resmi bir komut satiri ve editor eklentisi yok.
Olcum izi (2)
Genel metin tablosu 1,499 muse-spark-1.2 (xHigh) satırı, Arena metin tablosunda 5. sıra, 2 Eylül 2026 güncellemesi, 7.999.020 oy
Dolar başına puan 352.7 Arena (Text) puanı, milyon çıktı tokeni fiyatına bölünür
4 Gemini 3.8 Flash
Araç olgunluğu 3/4 Bir API, resmi SDK lar, bir web studyosu ve Google Cloud uzerinde Vertex yolu. Dorduncu basamagi vermiyoruz cunku Google bu aile icin Anthropic ve OpenAI in aksine ayri bir resmi kodlama komut satiri listelemiyor.
İrandan erişim engelli / çalışan bir yol yok Gemini API kullanilabilir bolgeler sayfasi yaklasik 195 ulke ve bolge sayiyor, Iran aralarinda yok. Ag uzerinde olculerek degil, Google in kendi sayfasindan okundu.
Olcum izi (2)
Genel metin tablosu 1,494 gemini-3.8-flash-high satırı, Arena metin tablosunda 8. sıra, 2 Eylül 2026 güncellemesi, 7.999.020 oy
Dolar başına puan 398.4 Arena (Text) puanı, milyon çıktı tokeni fiyatına bölünür
5 Claude Opus 5
Araç olgunluğu 4/4 API, resmî uygulama, komut satırı aracı, ajan SDK si, toplu çalıştırma ve üç büyük bulutta sunum
İrandan erişim engelli / çalışan bir yol yok İran, Anthropic in iki desteklenen ülke listesinin hiçbirinde yok: ne API listesinde ne claude.ai listesinde. Bunu ölçerek değil, Anthropic in kendi sayfasında okuyarak biliyoruz: bağımsız bir ağ testi henüz yapılmadı ve yapıldığında buraya yazılacak.
Olcum izi (2)
Genel metin tablosu 1,493 claude-opus-5-high satırı. Arena metin tablosunda 9. sıra. 2 Eylül 2026 güncellemesi. 7.999.020 oy
Dolar başına puan 59.7 Arena (Text) puanı, milyon çıktı tokeni fiyatına bölünür
6 GPT-5.6 Sol
Araç olgunluğu 4/4 En ust basamagi ureticinin kendi belgelerinden aliyor: API, SDK lar ve resmi bir komut satiri, Codex editor eklentisi, bir Agents SDK, toplu is hatti ve openai.gpt-5.6-sol kimligini adiyla anan resmi bir Amazon Bedrock rehberi. Bu model icin openai.com hic acilmadan dolan tek sutun bu.
İrandan erişim engelli / çalışan bir yol yok Bu sutun bugune kadar bostu, artik degil. Desteklenen ulkeler listesi openai.com uzerinde ve o alan adi hala 403 donuyor, ama ayni liste developers.openai.com uzerinde de var ve o alan adi acik. Yaklasik 195 ulke ve bolge sayiliyor, Iran aralarinda yok. Sayfanin kendisi, listenin disindan erisimin hesabin engellenmesine yol acabilecegini soyluyor. Ag uzerinde olculerek degil, ureticinin kendi sayfasindan okundu.
Olcum izi (2)
Genel metin tablosu 1,483 gpt-5.6-sol-xhigh satırı. Arena metin tablosunda 17. sıra. 2 Eylül 2026 güncellemesi. 7.999.020 oy
Dolar başına puan 74.2 Arena (Text) puanı, milyon çıktı tokeni fiyatına bölünür
7 Kimi K3 Max
Araç olgunluğu 1/4 OpenAI uyumlu bir API ve tek bir resmi istemci. Platform belgeleri resmi bir komut satiri araci ya da editor eklentisi listelemiyor, bu yuzden daha yuksek puan vermiyoruz.
Olcum izi (2)
Genel metin tablosu 1,489 kimi-k3-max satırı. Arena metin tablosunda 12. sıra. 2 Eylül 2026 güncellemesi. 7.999.020 oy
Dolar başına puan 99.3 Arena (Text) puanı, milyon çıktı tokeni fiyatına bölünür
8 Qwen3.8 Max
Olcum izi (2)
Genel metin tablosu 1,480 qwen3.8-max satırı. Arena metin tablosunda 22. sıra. 2 Eylül 2026 güncellemesi. 7.999.020 oy
Dolar başına puan 246.7 Arena (Text) puanı, milyon çıktı tokeni fiyatına bölünür
9 Gemini 3.1 Pro
İrandan erişim engelli / çalışan bir yol yok Gemini API nin kullanilabilir bolgeler sayfasi, API nin calistigi ulkeleri listeliyor ve Iran o listede yok. Bunu olcerek degil, orada okuyarak biliyoruz; bagimsiz bir test henuz yapilmadi.
Olcum izi (2)
Genel metin tablosu 1,487 gemini-3.1-pro-preview satırı. Arena metin tablosunda 15. sıra. 2 Eylül 2026 güncellemesi. 7.999.020 oy
Dolar başına puan 123.9 Arena (Text) puanı, milyon çıktı tokeni fiyatına bölünür
10 GLM-5.2 Max
Araç olgunluğu 1/4 Belgelenmis bir API ve tek bir resmi istemci. Belgelerde resmi bir komut satiri araci ya da editor eklentisi listelenmiyor.
Olcum izi (2)
Genel metin tablosu 1,472 glm-5.2-max satırı. Arena metin tablosunda 37. sıra. 2 Eylül 2026 güncellemesi. 7.999.020 oy
Dolar başına puan 334.5 Arena (Text) puanı, milyon çıktı tokeni fiyatına bölünür
11 Grok 4.5
Araç olgunluğu 3/4 OpenAI uyumlu bir API, Python ve JavaScript SDK lari ve Grok Build adinda resmi bir komut satiri ajani. Ust basamaga cikmiyor: birinci taraf editor eklentisi yok ve toplu is hatti tam da bu modeli reddediyor.
Olcum izi (2)
Genel metin tablosu 1,471 grok-4.5 satırı. Arena metin tablosunda 38. sıra. 2 Eylül 2026 güncellemesi. 7.999.020 oy
Dolar başına puan 245.2 Arena (Text) puanı, milyon çıktı tokeni fiyatına bölünür

Bu sıralama nasıl hesaplanıyor
Aşağıdaki her ölçütün bir ağırlığı ve bir kaynağı var. Bir ağırlığı değiştirin, tablo baştan hesaplanır. Bu rehberde elle yerleştirilmiş hiçbir sıra yok.
| Ölçüt | Ağırlık | Kanıt |
|---|---|---|
| Genel metin tablosu | 45 | Arena (Text)Açık uçlu sohbette insan tercihi. Sohbet için doğru ölçüye en yakın şey bu, ağırlığın en büyüğünü de bu yüzden taşıyor |
| Dolar başına puan | 20 | yukarıdaki iki değerden hesaplanırBir API üzerine sohbet kuruyorsanız yüzde bir puan için iki kat fiyat kötü bir takas. Uygulama aboneliği alıyorsanız bu sütun size dokunmuyor |
| Bağlam penceresi | 15 | üreticinin belirttiği özellikUzun sohbet, pencere dolduğunda önce hafızasını kaybeder, sonra pahalılaşır |
| Araç olgunluğu | 10 | tanımlı ölçek, her atama için yazılı gerekçe ileResmi uygulaması, SDK sı ve bulut yolu olmayan model, günlük işte kendinden biraz zayıf olanın gerisine düşer |
| İrandan erişim | 10 | erişim sütunumuz, yöntemi yazılıYüzde on, çünkü bu sütunun kendi sayfası var. Bugün dokuz satırdan yalnızca üçü burada kanıt taşıyor |
Fable 5 neden önde ve bu kez neden her zamankinden tuhaf
Bir sayı ve bir çelişki. Sayı şu: Arena metin tablosunun 2 Eylül güncellemesinde Fable 5, 1507 ile birinci ve kırk beş ağırlıklı sütunun tamamını alıyor. Çelişki şu: Anthropic aynı modeli 1 Eylül de eskiye aldı. Yani bu tablonun tepesi bugün, üreticisinin artık önermediği bir model.
Halefi de tam altında. Fable 5.1, 1504 le ikinci; üç puan geride, aynı fiyat ve aynı bağlam penceresiyle. Bu tabloda üç puan, sohbette kimsenin hissedeceği bir fark değil. Yani sıralama doğruyu söylüyor, pratik tavsiye ise başka bir şey ve biz ikisini birden gösteriyoruz: bu tablodaki Fable 5 adının altına yerine geçen modeli yazıyoruz. Eskiye alınmak bir olgudur, bir puan değil; rubric in ona puan verecek bir yolu yok ve olmamalı da.
İkisi de dolar başına puan sütununu tamamen kaybediyor. İkisinin de çıktısı milyon token başına 50 dolar, tablonun en pahalı satırları; oranları 30.1 e iniyor ve bu tablonun dibi. Opus 5, 1493 le on dört puan aşağıda ve yarı fiyatına.
Opus 5 on iki puan aşağıda ve yarı fiyatına. Üst kesimin tamamının yaklaşık elli puana sığdığı bir tabloda on iki puan çok değil. Yani gerçek cevap soruya göre ikiye ayrılıyor: bir API üzerine sohbet kuruyor ve aylık fatura ödüyorsanız Opus 5; uygulama aboneliği alıyorsanız fiyat sütunu size işlemiyor ve istediğiniz şey tablonun tepesi.
Kendi birincimizin aleyhine, buradaki hiçbir sütunun ölçmediği bir şey: Fable 5, Anthropic in kendi tablosunda yavaş diye işaretlenen tek model ve uyarlanabilir düşünmesi hep açık, yani kısacak bir kol yok. Sohbette gecikme hissedilir. Tablomuz bunu görmüyor, siz on dakikada göreceksiniz.
Bu tablo uygulamaları değil modelleri sıralıyor
Bilinçli bir seçim ve bedeli var, o yüzden açıkça söyleyelim. Buradaki beş sütun da bir model hakkında yayımlanan sayılar: liderlik puanı, milyon token fiyatı, bağlam penceresi. Hiçbir üretici bunların üçünü de sohbet uygulaması için yayımlamıyor. Uygulamaları sıralasak beş sütunun üçü çoğu satırda boş kalır ve bu artık tablo olmaz.
İkinci sebep daha önemli: tek bir model birkaç uygulamanın altında çalışıyor ve uygulama, altındaki modeli size haber vermeden değiştiriyor. Opus 5 aynı anda Claude uygulamasının, API nin ve Claude Code un altında. "Claude" u satır yaparsanız aynı sayıyı kodlama tablosunda ikinci kez saymış olursunuz. Video kategorisinin araçları değil sürümleri sıralamasının sebebi de aynı.
Ders çalışma kategorisinde tam tersi kararı verdik ve orada doğruydu, çünkü Google defterin kendi limitlerini sayı olarak yayımlıyor: elli kaynak, beş yüz bin kelime. Sohbet uygulaması için hiçbir üretici benzerini yayımlamıyor. Bedeli de şu: Claude, Gemini ve ChatGPT birer uygulama olarak burada satır taşımıyor; o sorular kendi sayfalarında cevaplanıyor.
ChatGPT neden satırsız ve OpenAI den elimizde ne var
Kısa cevap: ChatGPT bir ürün, bu tablo ise modelleri sıralıyor, yani zaten satır olmayacaktı. Ama uzun cevap bizim aleyhimize ve daha önemli: istesek de onu tarif edemezdik. openai.com üzerindeki her yol bu sunucuya 403 dönüyor, 12 Ağustos 2026 da yeniden denendi ve o alan adının kendi robots.txt dosyası taramayı yasaklamıyor.
Buna karşılık açık olan bir kapı var: developers.openai.com eksiksiz yanıt veriyor. GPT-5.6 Sol orada 4 dolar giriş, 20 dolar çıkış, 1,05 milyon tokenlik pencere, 128 bin token azami çıktı ve 16 Şubat 2026 bilgi kesimiyle listeli. O fiyat 12 Ağustos ta hâlâ 5 ve 30 dolardı; yani bu tabloda ucuzlayan tek model o.
Bu turda kendi yazdığımızın aleyhine düzelttiğimiz bir şey daha var. OpenAI nin desteklenen ülkeler listesinin yalnızca openai.com da olduğunu ve o alan adının bize yanıt vermediğini yazmıştık. Yarısı doğruydu: alan adı hâlâ 403 dönüyor, ama aynı liste developers.openai.com da da duruyor ve orası açık. Yaklaşık 195 ülke ve bölge sayılıyor, İran aralarında yok ve sayfanın kendisi listenin dışından erişimin hesabı engelleyebileceğini söylüyor. Yani bu satırın İran sütunu bugünden itibaren dolu.
O sütunun on ağırlığı, fiyat düşüşüyle birlikte, GPT-5.6 Sol u 54,2 den 65,2 ye taşıdı. Yine de bir basamak inip dördüncü oldu, çünkü Fable 5.1 onun üstünde tabloya girdi. Göreli puanın anlamı tam olarak budur ve her satırın hesabının bu sayfada basılmasının sebebi de odur.
Özeti tek cümle: model sıralanabiliyor, uygulama tarif edilemiyor. Size hâlâ söyleyemediğimiz şey, bugün ChatGPT nin altında hangi modelin çalıştığı, planlarının ne tuttuğu ve İrandan açılıp açılmadığı. Üçü de yanıt vermeyen alan adında duruyor. OpenAI sayfası bu sınırı tam olarak yazıyor.
Liderlik tablosunu doğru okumanın öğrettiği
Doğrulanmamış diye kaydettiğimiz iki satır aslında baştan beri tablodaydı. GLM-5.2 Max 1472 ile 37., DeepSeek V4 Flash 1438 ile 85. sırada. Önceki tur sayfanın üst kısmını okumuş; bu tur sayfanın kendi gönderdiği JSON u okudu. Böylece bu kategoride sıralanamayan iki aday sıralanabilir oldu ve kodlama tablosu da kaydı. O boşluk üreticilerin değil bizimdi.
İkincisi satırın adıyla ilgili. Bu referans daha önce, bir Arena satırının modeli değil bir sunum yapılandırmasını adlandırdığını savunmuştu. OpenAI de bir adım öteye gidiyor: WebDev satırı harfi harfine gpt-5.6-sol-xhigh (codex-harness) yazıyor. Yani o puan, çıplak modele değil, OpenAI nin kendi kodlama ajanının içindeki modele ait. Fiyat ve pencere temel modele yapışır, puan ise gerçekte test edilene.
Üçüncüsü düşmediğimiz bir tuzaktı. Aynı tabloda deepseek-v4-pro adlı bir satır 1458 ile Flash in üstünde oturuyor. O, bir ayar değil, aynı ailedeki başka bir model; o yüzden sayısını ödünç almadık. Alsaydık DeepSeek iki sıra yükselirdi ve kimse fark etmezdi.
Kendi yöntemimizin abarttığı yer
On iki satırın hepsi 69 Elo puanına sığıyor, 1507 den 1438 e. Min-maks normalleştirme bu 69 puanı 78.6 ile 32.2 arasına yayıyor. Yani puan sütunu mesafeyi olduğundan büyük gösteriyor ve son satır zayıf değil: üst düzey modellerden oluşan bir tablonun sonuncusu.
Bugün tabloya üç yeni aday katıldı ve hiçbiri kendisiyle ilgili bir şey değiştirmemişti: Fable 5.1 ikinci, Meta dan Muse Spark 1.2 beşinci ve Google dan Gemini 3.8 Flash altıncı. Gelişleri Qwen3.8 Max i dördüncülükten sekizinciliğe itti; oysa Qwen in başına gelen tek gerçek şey, aynı tablodaki sayısının 1490 dan 1480 e inmesi. Dünkü sırayı bir yere not ettiyseniz, farkın açıklaması bu.
Daha keskin bir örnek, çünkü bizi de şaşırttı. Bağlam sütununu GPT-5.6 Sol 1.050.000 tokenle kazanıyor, Kimi K3 Max ise 1.048.576 taşıyor. Fark 1.424 token, yaklaşık binde bir, ve pratikte hiçbir şeyi değiştirmiyor. İkisi de sütunun neredeyse tamamını alıyor ve bu doğru; ama yarın iki milyonluk pencereli bir model eklensin, ikisi birden o sütunu kaybeder, kendilerinde hiçbir şey değişmeden.
İlk seçimimizi ne zaman almamalısınız
- Model değil uygulama arıyorsanız bu tablo cevabınız değil. Claude ve Gemini ürün sayfaları o soruyu doğru düzeyden cevaplıyor.
- İşiniz kodsa buradaki sıra kodlama tablosundan farklı ve oradaki ölçütler tamamen başka.
- İş yükünüz yüksek hacimli ve kısa cevaplıysa ilk sütunu geçin ve dolar başına puanı okuyun; DeepSeek orada açık farkla önde.
- İrandan resmi bir yol olmadan sohbete ulaşıyorsanız, modellerin sırası sorununuza en son değen şey.
Yetersiz kaldığı yerler
- Ana ölçüt bir insan tercihi tablosu: hangi cevabın tercih edildiğini ölçüyor, hangisinin doğru olduğunu değil.
- Tablonun tamamı 69 Elo puanına sığıyor ve normalleştirme bunu 78.6 ile 32.2 arasına yayıyor, yani puan sütunu gerçek mesafeyi büyütüyor.
- On iki satırın altısı İran sütununda kanıt taşımıyor, çünkü üreticileri hiçbir ülke listesi yayımlamıyor. Bunu yalnızca Anthropic, Google ve OpenAI yapıyor.
- ChatGPT, Claude uygulaması ve Gemini uygulaması burada satır taşımıyor, çünkü tablo uygulamaları değil modelleri sıralıyor.
- Qwen3.8 Max ve Gemini 3.1 Pro nun ikisinde de iki boş sütun var. Bu, üreticinin yayımladığındaki bir boşluk; modelin zayıflığı değil, ama puanlarını gerçekten aşağı çekiyor.
- DeepSeek 1,32 dolarlık çıktısıyla dolar başına puan sütununu öyle geriyor ki Opus 5 ile Qwen arasındaki dört katlık fark o sütunda bir puanın altına iniyor.
- Tablonun tepesi emekliye ayrılmış bir model. Sıralama puanı ölçüyor, halefiyeti ölçmüyor; bunu puan olarak değil, model adının altında bir not olarak gösteriyoruz.
Bizim görüşümüz
Bir API üzerine sohbet kuruyor ve birini seçmek zorundaysanız Opus 5: tablonun tepesinden on dört puan aşağıda ve yarı fiyatına. Uygulama aboneliği alıyorsanız fiyat sütunu size işlemiyor, okumanız gereken tablonun tepesi; ama Fable 5 i değil Fable 5.1 i alın, çünkü üreticisinin emekliye ayırdığı bir model için üç puan kötü bir takas. Hangisi müşterinize cevap verir diye soruyorsanız, dürüst cevabımız hiçbiri, çünkü o başka bir iş.
İnsanların gerçekten sorduğu sorular
En iyi yapay zeka sohbet modeli hangisi
Arena metin tablosunda Claude Fable 5 1507 ile önde, ama Anthropic o modeli emekliye ayırdı. Halefi Fable 5.1 1504 ile ikinci ve alınması gereken o. Maliyet önemliyse Opus 5, 1493 ile ikisinin de yarı fiyatında.
ChatGPT neden bu tabloda yok
Çünkü tablo modelleri sıralıyor, ChatGPT ise bir ürün. Modeli burada: GPT-5.6 Sol dördüncü satır. Uygulamanın kendisini tarif edemiyoruz, çünkü openai.com üzerindeki her yol sunucumuza 403 dönüyor. OpenAI nin ülke listesi ise bu turda, geliştirici alan adından okundu.
Bu sıra neden kodlama tablosundan farklı
Çünkü ölçütler farklı. Orada WebDev tablosu yüzde kırk taşıyor, burada genel metin tablosu yüzde kırk beş. Daha iyi kod yazan model, insanların tercih ettiği cevapları vermek zorunda değil ve Opus 5 ile Fable 5 tam da bu iki tablo arasında yer değiştiriyor.
Bunların hangisi İrandan çalışıyor
Hiçbirinin resmi bir yolu yok. Anthropic, Google ve bu turdan itibaren OpenAI ülke listesi yayımlıyor ve İran hiçbirinde yok; diğer üreticiler hiç liste yayımlamıyor, o hücreler bu yüzden boş. Hesap satmıyor, engel aşma önermiyoruz.
Bu tablonun tepesindeki model size cevap verir, müşterinize değil. İkinci iş için robot değil insan gönderiyoruz ve tam olarak bu şudur:
sanal asistan hizmetimiz