İş

Kodlama için en iyi yapay zekâ

En yüksek puanı Claude Fable 5.1 alıyor, çünkü WebDev Arena nın 2 Eylül güncellemesi onu 1765 ile birinci sıraya koyuyor ve bir sonraki satır yetmiş sekiz puan altta kalıyor. Aynı zamanda tablonun en pahalı satırı ve bu sayfa, bu takasın kimin için değdiğini kimin için değmediğini gösteriyor.

  • gerçek kanıtlı on bir model
  • ağırlıklar sayfada
  • elle yerleştirilmiş sıra yok

Son kontrol: Bu bir referans sayfasıdır. Üretici kaynaklarına karşı yeniden doğrulanır ve yeni bir sürüm çıktığında güncellenir. Neler değişti

Her aracın puanı nereden geliyor

Aşağıdaki halka, tablonun sütun başlıklarında yazan ağırlıkların ta kendisidir.

100Agirliklar
  • WebDev tablosu 40
  • Dolar başına puan 20
  • Araç olgunluğu 15
  • Genel metin tablosu 10
  • Bağlam penceresi 10
  • İrandan erişim 5

Bu ağırlıkları biz seçtik ve tablodaki tek yorum bu. Ağırlıkları değiştirin, sıra da değişir.

Bugünün sıralaması, doğrulanmış kanıttan

Liderlik tablosunda bizi geçen bir model, sayfasını yazmamış olsak da tabloda yer alır; yoksa birincilik yalnızca yazmaya vakit bulduklarımızın birincisi olurdu.

Kodlama için en iyi yapay zekâ
Sıra Araç Puan WebDev tablosu 40 Dolar başına puan 20 Araç olgunluğu 15 Genel metin tablosu 10 Bağlam penceresi 10 İrandan erişim 5
1 Claude Fable 5.1 Güncel seçim 73.1 1,764 Kaynak: arena.ai 35.3 Kaynak: arena.ai 4/4 1,504 Kaynak: arena.ai 1 milyon token Kaynak: platform.claude.com engelli / çalışan bir yol yok
2 GPT-6 Astra 70.2 1,796 Kaynak: arena.ai 35.9 Kaynak: arena.ai 4/4 doğrulanmadı 1 milyon token Kaynak: developers.openai.com engelli / çalışan bir yol yok
3 Claude Opus 5 59.0 1,688 Kaynak: arena.ai 67.5 Kaynak: arena.ai 4/4 1,493 Kaynak: arena.ai 1 milyon token Kaynak: platform.claude.com engelli / çalışan bir yol yok
4 Claude Fable 5 üretici bunu şununla değiştirdi: Claude Fable 5.1 51.1 1,628 Kaynak: arena.ai 32.6 Kaynak: arena.ai 4/4 1,507 Kaynak: arena.ai 1 milyon token Kaynak: platform.claude.com engelli / çalışan bir yol yok
5 Muse Spark 1.3 48.2 1,650 Kaynak: arena.ai 388.2 Kaynak: arena.ai 2/4 doğrulanmadı 1 milyon token Kaynak: developer.meta.com doğrulanmadı
6 GPT-5.6 Sol 46.0 1,617 Kaynak: arena.ai 80.9 Kaynak: arena.ai 4/4 1,483 Kaynak: arena.ai 1 milyon token Kaynak: developers.openai.com engelli / çalışan bir yol yok
7 Gemini 3.8 Flash 43.4 1,568 Kaynak: arena.ai 418.1 Kaynak: arena.ai 3/4 1,494 Kaynak: arena.ai doğrulanmadı engelli / çalışan bir yol yok
8 Qwen3.8 Max 43.3 1,670 Kaynak: arena.ai 278.3 Kaynak: arena.ai doğrulanmadı 1,480 Kaynak: arena.ai 1 milyon token Kaynak: www.alibabacloud.com doğrulanmadı
9 Kimi K3 Max 38.7 1,674 Kaynak: arena.ai 111.6 Kaynak: arena.ai 1/4 1,489 Kaynak: arena.ai 1 milyon token Kaynak: platform.kimi.ai doğrulanmadı
10 GLM-5.2 Max 31.9 1,589 Kaynak: arena.ai 361.1 Kaynak: arena.ai 1/4 1,472 Kaynak: arena.ai 1 milyon token Kaynak: docs.z.ai doğrulanmadı
11 Grok 4.5 21.8 1,556 Kaynak: arena.ai 259.3 Kaynak: arena.ai 3/4 1,471 Kaynak: arena.ai 500 bin token Kaynak: docs.x.ai doğrulanmadı
12 Hy4 preview 20.3 1,623 Kaynak: arena.ai doğrulanmadı doğrulanmadı doğrulanmadı 1 milyon token Kaynak: huggingface.co doğrulanmadı

Boş bir hücre, o değeri doğrulayamadığımız anlamına gelir; aracın sıfır aldığı anlamına gelmez.

Her sayinin arkasinda

Bu tablodaki her takdire dayali puanin yazili bir gerekcesi var ve Iran sutunu nasil kontrol edildigini soyluyor. Bu ikisi burada acik. Her sayinin arkasindaki olcum izi, yani hangi liderlik tablosunun hangi satiri ve kac oy, ait oldugu modelin altinda aciliyor.

1 Claude Fable 5.1

Araç olgunluğu 4/4 Bes yolun hepsinde sunuluyor ve Anthropic in kendi tablosu her biri icin bir model kimligi yaziyor. Ayni tabloda Claude Platform on AWS hucresi Opus 5 icin bir tire, bu model icin bir kimlik.

İrandan erişim engelli / çalışan bir yol yok Iran, Anthropic in desteklenen ulkeler listesinde yok. Ag uzerinde olculerek degil, Anthropic in kendi sayfasindan okundu. Bu surumde de degisen bir sey yok.

Olcum izi (3)

WebDev tablosu 1,764 claude-fable-5.1-max satırı, WebDev Arena tablosunda 2. sıra, 8 Eylül 2026 güncellemesi, 663.027 oy. Arena bu satıra 1 ile 2 arasında bir sıra aralığı veriyor, üstteki satırla aynı aralık; yani tablonun kendisi birinciyle ikinciyi kesinleştirmiyor.

Dolar başına puan 35.3 WebDev Arena puanı, milyon çıktı tokeni fiyatına bölünür

Genel metin tablosu 1,504 claude-fable-5.1-max satırı, Arena metin tablosunda 3. sıra, 2 Eylül 2026 güncellemesi, 7.999.020 oy

2 GPT-6 Astra

Araç olgunluğu 4/4 En üst basamağı üreticinin kendi belgelerinden alıyor: toplu iş hattıyla API, web aramasından bilgisayar kullanımına ve MCP ye kadar barındırılan araçlar, 10 Eylül de yönetilen bir Codex ortamıyla genel betaya giren Agents API ve Amazon Bedrock üzerinde sunulması. OpenAI nin kendi Bedrock rehberi, modelin şimdilik tek bir bölgede, us-west-2 de sunulduğunu söylüyor.

İrandan erişim engelli / çalışan bir yol yok OpenAI API için desteklenen ülkeler listesini 11 Eylül 2026 da developers.openai.com üzerinde yeniden okuduk; yaklaşık 195 ülke ve bölge sayılıyor ve İran aralarında yok. Ağ üzerinde ölçülerek değil, üreticinin kendi sayfasından okundu.

Olcum izi (2)

WebDev tablosu 1,796 gpt-6-astra-max satırı, WebDev Arena tablosunda 1. sıra, 8 Eylül 2026 güncellemesi, 663.027 oy; bunların 1.810 u bu satırda. Satırın iç anahtarı codex-harness içeriyor, yani model çıplak değil, OpenAI nin kendi kodlama ajanının içinde test edildi. Arena bu satıra 1 ile 2 arasında bir sıra aralığı veriyor; altındaki satırla aynı aralık.

Dolar başına puan 35.9 WebDev Arena puanı, milyon çıktı tokeni fiyatına bölünür

3 Claude Opus 5

Araç olgunluğu 4/4 API, resmî uygulama, komut satırı aracı, ajan SDK si, toplu çalıştırma ve üç büyük bulutta sunum

İrandan erişim engelli / çalışan bir yol yok İran, Anthropic in iki desteklenen ülke listesinin hiçbirinde yok: ne API listesinde ne claude.ai listesinde. Bunu ölçerek değil, Anthropic in kendi sayfasında okuyarak biliyoruz: bağımsız bir ağ testi henüz yapılmadı ve yapıldığında buraya yazılacak.

Olcum izi (3)

WebDev tablosu 1,688 claude-opus-5-max satırı, WebDev Arena tablosunda 3. sıra, 8 Eylül 2026 güncellemesi, 663.027 oy

Dolar başına puan 67.5 WebDev Arena puanı, milyon çıktı tokeni fiyatına bölünür

Genel metin tablosu 1,493 claude-opus-5-high satırı. Arena metin tablosunda 9. sıra. 2 Eylül 2026 güncellemesi. 7.999.020 oy

4 Claude Fable 5

Araç olgunluğu 4/4 Opus 5 ile ayni altyapiyi tasiyor ve bes yolun hepsinde sunuluyor: Anthropic in kendi API si, Bedrock, AWS uzerinde Claude Platform, Google Cloud ve Microsoft Foundry.

İrandan erişim engelli / çalışan bir yol yok Iran, Anthropic in desteklenen ulkeler listesinde yok. Ag uzerinde olculerek degil, Anthropic in kendi sayfasindan okundu.

Olcum izi (3)

WebDev tablosu 1,628 claude-fable-5 satırı, WebDev Arena tablosunda 10. sıra, 8 Eylül 2026 güncellemesi, 663.027 oy

Dolar başına puan 32.6 WebDev Arena puanı, milyon çıktı tokeni fiyatına bölünür

Genel metin tablosu 1,507 claude-fable-5 satırı. Arena metin tablosunda 1. sıra. 2 Eylül 2026 güncellemesi. 7.999.020 oy

5 Muse Spark 1.3

Araç olgunluğu 2/4 Meta Model API ve OpenRouter uzerinde sunum, ki bu ciplak bir uc noktadan fazlasi. Ama Meta nin kendi belgeleri ne resmi bir komut satiri ne de bir editor eklentisi listeliyor, bu yuzden ikinci basamagi gecmiyor.

Olcum izi (2)

WebDev tablosu 1,650 muse-spark-1.3-max satırı, WebDev Arena tablosunda 8. sıra, 8 Eylül 2026 güncellemesi, 663.027 oy. Bu satır 8 Eylül de eklendi. Daha önce kaydettiğimiz xhigh satırı artık 11. sırada 1625 te; diğer bütün adaylarda olduğu gibi aynı modelin yüksek olan satırını yazıyoruz.

Dolar başına puan 388.2 WebDev Arena puanı, milyon çıktı tokeni fiyatına bölünür

6 GPT-5.6 Sol

Araç olgunluğu 4/4 En ust basamagi ureticinin kendi belgelerinden aliyor: API, SDK lar ve resmi bir komut satiri, Codex editor eklentisi, bir Agents SDK, toplu is hatti ve openai.gpt-5.6-sol kimligini adiyla anan resmi bir Amazon Bedrock rehberi. Bu model icin openai.com hic acilmadan dolan tek sutun bu.

İrandan erişim engelli / çalışan bir yol yok Bu sutun bugune kadar bostu, artik degil. Desteklenen ulkeler listesi openai.com uzerinde ve o alan adi hala 403 donuyor, ama ayni liste developers.openai.com uzerinde de var ve o alan adi acik. Yaklasik 195 ulke ve bolge sayiliyor, Iran aralarinda yok. Sayfanin kendisi, listenin disindan erisimin hesabin engellenmesine yol acabilecegini soyluyor. Ag uzerinde olculerek degil, ureticinin kendi sayfasindan okundu.

Olcum izi (3)

WebDev tablosu 1,617 gpt-5.6-sol-xhigh (codex-harness) satırı, WebDev Arena tablosunda 14. sıra, 8 Eylül 2026 güncellemesi, 663.027 oy

Dolar başına puan 80.9 WebDev Arena puanı, milyon çıktı tokeni fiyatına bölünür

Genel metin tablosu 1,483 gpt-5.6-sol-xhigh satırı. Arena metin tablosunda 17. sıra. 2 Eylül 2026 güncellemesi. 7.999.020 oy

7 Gemini 3.8 Flash

Araç olgunluğu 3/4 Bir API, resmi SDK lar, bir web studyosu ve Google Cloud uzerinde Vertex yolu. Dorduncu basamagi vermiyoruz cunku Google bu aile icin Anthropic ve OpenAI in aksine ayri bir resmi kodlama komut satiri listelemiyor.

İrandan erişim engelli / çalışan bir yol yok Gemini API kullanilabilir bolgeler sayfasi yaklasik 195 ulke ve bolge sayiyor, Iran aralarinda yok. Ag uzerinde olculerek degil, Google in kendi sayfasindan okundu.

Olcum izi (3)

WebDev tablosu 1,568 gemini-3.8-flash-high satırı, WebDev Arena tablosunda 22. sıra, 8 Eylül 2026 güncellemesi, 663.027 oy

Dolar başına puan 418.1 WebDev Arena puanı, milyon çıktı tokeni fiyatına bölünür

Genel metin tablosu 1,494 gemini-3.8-flash-high satırı, Arena metin tablosunda 8. sıra, 2 Eylül 2026 güncellemesi, 7.999.020 oy

8 Qwen3.8 Max

Olcum izi (3)

WebDev tablosu 1,670 qwen3.8-max satırı, WebDev Arena tablosunda 6. sıra, 8 Eylül 2026 güncellemesi, 663.027 oy

Dolar başına puan 278.3 WebDev Arena puanı, milyon çıktı tokeni fiyatına bölünür

Genel metin tablosu 1,480 qwen3.8-max satırı. Arena metin tablosunda 22. sıra. 2 Eylül 2026 güncellemesi. 7.999.020 oy

9 Kimi K3 Max

Araç olgunluğu 1/4 OpenAI uyumlu bir API ve tek bir resmi istemci. Platform belgeleri resmi bir komut satiri araci ya da editor eklentisi listelemiyor, bu yuzden daha yuksek puan vermiyoruz.

Olcum izi (3)

WebDev tablosu 1,674 kimi-k3-max satırı, WebDev Arena tablosunda 5. sıra, 8 Eylül 2026 güncellemesi, 663.027 oy

Dolar başına puan 111.6 WebDev Arena puanı, milyon çıktı tokeni fiyatına bölünür

Genel metin tablosu 1,489 kimi-k3-max satırı. Arena metin tablosunda 12. sıra. 2 Eylül 2026 güncellemesi. 7.999.020 oy

10 GLM-5.2 Max

Araç olgunluğu 1/4 Belgelenmis bir API ve tek bir resmi istemci. Belgelerde resmi bir komut satiri araci ya da editor eklentisi listelenmiyor.

Olcum izi (3)

WebDev tablosu 1,589 glm-5.2-max satırı, WebDev Arena tablosunda 18. sıra, 8 Eylül 2026 güncellemesi, 663.027 oy

Dolar başına puan 361.1 WebDev Arena puanı, milyon çıktı tokeni fiyatına bölünür

Genel metin tablosu 1,472 glm-5.2-max satırı. Arena metin tablosunda 37. sıra. 2 Eylül 2026 güncellemesi. 7.999.020 oy

11 Grok 4.5

Araç olgunluğu 3/4 OpenAI uyumlu bir API, Python ve JavaScript SDK lari ve Grok Build adinda resmi bir komut satiri ajani. Ust basamaga cikmiyor: birinci taraf editor eklentisi yok ve toplu is hatti tam da bu modeli reddediyor.

Olcum izi (3)

WebDev tablosu 1,556 grok-4.5 satırı, WebDev Arena tablosunda 25. sıra, 8 Eylül 2026 güncellemesi, 663.027 oy

Dolar başına puan 259.3 WebDev Arena puanı, milyon çıktı tokeni fiyatına bölünür

Genel metin tablosu 1,471 grok-4.5 satırı. Arena metin tablosunda 38. sıra. 2 Eylül 2026 güncellemesi. 7.999.020 oy

12 Hy4 preview

Olcum izi (1)

WebDev tablosu 1,623 hy4-preview satırı, WebDev Arena tablosunda 13. sıra, 8 Eylül 2026 güncellemesi, 663.027 oy. Tablo üreticiyi Tencent, lisansı Apache 2.0 olarak yazıyor. Satırın yanında görünen fiyat hiçbir Tencent sayfasından okunmadı, bu yüzden bu rehberde yok.

Sıralamak için yeterli doğrulanmış veri yok

Bunlar takip ettiğimiz gerçek araçlar, ancak ölçütlerinin yarısından fazlasının doğrulanmış bir değeri yok; sıralamak tahmin olurdu.

2026 da kodlama için en iyi yapay zekâ, kaynaklı
2026 da kodlama için en iyi yapay zekâ, kaynaklı

Bu sıralama nasıl hesaplanıyor

Aşağıdaki her ölçütün bir ağırlığı ve bir kaynağı var. Bir ağırlığı değiştirin, tablo baştan hesaplanır. Bu rehberde elle yerleştirilmiş hiçbir sıra yok.

Ölçüt Ağırlık Kanıt
WebDev tablosu 40 WebDev ArenaAraçlarla ve birkaç adımda yürüyen gerçek web geliştirme işleri; tek soruluk bir sınavdan günlük işe daha yakın
Dolar başına puan 20 yukarıdaki iki değerden hesaplanırAylık fatura taşıyan bir ekip için yüzde bir önde olan pahalı model kötü bir alım
Araç olgunluğu 15 tanımlı ölçek, her atama için yazılı gerekçe ileKomut satırı aracı ve ajan SDK si olmayan iyi bir model günlük işte yavaşlar
Genel metin tablosu 10 Arena (Text)Ağırlığı düşük, çünkü genel sohbet bir kodlama ölçüsü değil; yine de tamamen ilgisiz değil
Bağlam penceresi 10 üreticinin belirttiği özellikBüyük bir depoda küçük pencere parçalamak demek, parçalamak da bağlamı yitirmek demek
İrandan erişim 5 erişim sütunumuz, yöntemi yazılıAğırlığı düşük, çünkü bu sütunun İranda yapay zekâ sayfasında kendi yeri var

Fable 5.1 neden önde ve fiyat bu kez neden onu durduramadı

Meseleyi tek bir sayı çözdü. WebDev Arena nın 2 Eylül güncellemesinde claude-fable-5.1-max satırı 1765 ile birinci; bizim taşıdığımız bir sonraki satır, claude-opus-5-max, 1687 de. Yetmiş sekiz puan; üstelik bir hafta önce üst ucunun tamamı yirmi iki puana sığan bir sütunda.

Üstelik bu model değer sütununu tamamen kaybediyor. Milyon çıktı tokeni 50 dolar, yani Opus 5 in iki katı, ve o sütunda sıfır alıyor. Daha önce her seferinde pahalı modeli deviren şey bu sütun olmuştu. Bir puan farkının fiyata üstün geldiği ilk sefer bu ve sebebi açık: liderlik sütununun kırk ağırlığını tam olarak alıyor, ayrıca araç, bağlam ve İran sütunlarını da taşıyor.

Yani kısa cevap tek bir cevap değil. API üzerinden çalışıyor ve aylık fatura ödüyorsanız, Opus 5 yarı fiyatta ve aynı tabloda ikinci. İşiniz bir kerede doğru yapılmasının iki kere yapılmasından ucuz olduğu türdense, yetmiş sekiz puan tam da bedelini ödediğiniz şey.

Bu tablo nerede yetersiz

Birincil ölçütümüz otomatik bir test değil, insan tercihine dayalı bir liderlik tablosu. WebDev Arena mutlak bir puan, bir tarih ve oy sayısı veriyor; yayımlamak için gereken de bu. Ama insan tercihi kodun doğruluğu kadar cevabın okunurluğuna ve biçimine de tepki verir. SWE-bench Verified daha keskin bir ölçü olurdu, ancak liderlik tablosu JavaScript ile çiziliyor ve değerleri doğrudan okuyamadık. Okumadığımız bir sayıyı, başkası aktarmış olsa da yazmıyoruz.

Bu sayfada tek bir aday sırasız: Gemini 3.1 Pro. Genel metin tablosunda gerçek bir puanı var, ama WebDev Arena satırını okumadık ve Google onun için hiç bağlam penceresi yayımlamıyor; bu yüzden ölçüt ağırlığının yarısından fazlası boş. Adı tablonun altında, sırası değil. GLM-5.2 Max ile DeepSeek V4 Flash de bir süre oradaydı; fiyatları ve bağlam pencereleri kendi belgelerinden doğrulandığı için artık sıraları var.

Bu tabloyu okurken bu kez karşımıza çıkan ve başka yerde yazılmayan bir nokta: Qwen in iki ayrı satırı var. 1669 la qwen3.8-max ve tüm tabloda ikinci olan 1688 le qwen3.8-max-0902. Biz birincisini kaydediyoruz, çünkü Alibaba nın kendi belgelerindeki kimlik odur ve tarihli satır tek bir sunum yapılandırmasının anlık görüntüsüdür. Başka bir yerde Qwen i ikinci sırada görürseniz sebebi budur, bizim hatamız değil.

Sayılar kafanızı karıştırmasın diye bir not daha: puanlar göreli. Her sütun kendi asgari ve azami değeri arasında normalleştiriliyor, dolayısıyla tabloya yeni bir aday eklemek, hiçbir model değişmeden herkesin puanını oynatıyor. 12 Ağustos 2026 da Grok 4.5 in eklenmesi tam da bunu yaptı: sıra korundu, sayılar yükseldi. Bugünkü rakam geçen haftadan kalma bir ekran görüntüsüyle uyuşmuyorsa nedeni budur; bir şeye elle dokunduğumuz için değil.

Aynı gün iki veri değişikliği daha sayıları oynattı. Birincisi, metin liderlik tablosunu bu kez baştan sona okuduk ve GLM-5.2 Max ile DeepSeek V4 Flash satırlarının en baştan orada olduğunu gördük; önceki tur sayfanın yalnızca üst kısmını okumuş. İkisinin de genel metin sütunu doldu. İkincisi, GPT-5.6 Sol sekizinci aday oldu: openai.com hâlâ sunucumuza yanıt vermiyor, ama geliştirici belgeleri fiyatı ve bağlam penceresini yayımlıyor ve liderlik satırı mevcut. O satırla ilgili bir şerh, burası kodlama sayfası olduğuna göre: adı gpt-5.6-sol-xhigh (codex-harness), yani puan çıplak modele değil OpenAI nin kendi kodlama ajanının içindeki modele ait. GPT, Kimi ile Qwen arasına yerleşti ve mevcut satırlardan hiçbiri diğerlerine göre yer değiştirmedi.

28 Ağustos: DeepSeek pahalandı ve üç satır yer değiştirdi

Bu, bu rehberde bugüne dek yükselen tek sayı. 12 Ağustos ta DeepSeek V4 Flash girdide 0,14 ve çıktıda 0,28 dolardı. Kendi fiyat sayfasında artık iki sütun var, yoğun saat ve yoğun olmayan saat, ve ucuz olan sütun bile eski fiyatın üstünde: yoğun olmayan saatte 0,22 ve 0,66, yoğun saatte 0,44 ve 1,32. Biz yoğun saat sütununu yazıyoruz, çünkü DeepSeek in yoğun saatleri İran iş gününün tam ortasına düşüyor.

DeepSeek in kendisi sıra kaybetmedi, çünkü hâlâ tablonun en ucuz satırı ve değer sütununun tepesini hâlâ o tutuyor. Ama arayı kapattı ve her sütun kendi en küçük ve en büyük değeri arasında normalleştirildiği için bu daralma üç satırı yukarı taşıdı: Qwen3.8 Max beşincilikten üçüncülüğe, Kimi K3 Max üçüncülükten dördüncülüğe ve GPT-5.6 Sol dördüncülükten beşinciliğe. Bu üç model hiçbir şey değiştirmedi. Göreli sıralama tam olarak bu demek ve hesabın bu sayfada basılmasının sebebi de bu.

3 Eylül: tepedeki fark 22 puandan 78 e çıktı

Geçen haftaya kadar bu sütundaki en yüksek üç puan 22 puana sığıyordu: 1692, 1674 ve 1670. Bu sayfanın o zamanki sonucu, modellerin sayıların ima ettiğinden daha az farklı olduğu ve bir iş gününü asıl değiştiren şeyin araç olgunluğu olduğuydu: komut satırı aracı, toplu çalıştırma ve şirketinizin zaten sözleşmesi olan bir bulutta bulunmak. İkinciden on birinciye kadar bu hâlâ doğru ve ölçütün on beş ağırlık taşımasının sebebi de bu. Birincilik için artık doğru değil.

Aynı güncellemede üç satır daha, kendilerinde hiçbir şey değişmeden yer değiştirdi. Kimi K3 Max üçüncülükten beşinciliğe, Qwen3.8 Max beşincilikten altıncılığa geçti; üstelik Kimi nin tablo puanı tam olarak 1674 te kaldı. GPT-5.6 Sol dördüncülüğü korudu ama puanı 51,6 dan 48,8 e indi. Üçünün de sebebi aynı: tabloya yeni adayların girmesi ve sütunların yeniden normalleşmesi.

Üç yeni aday ve tabloda bilerek yer almayan bir model

Meta dan Muse Spark 1.3 ve Google dan Gemini 3.8 Flash bugün tabloya katıldı; ikisinin de aynı liderlik tablosunda gerçek bir satırı var. Muse Spark, başka listelerin pek dile getirmediği bir noktayı taşıyor: Meta yıllarca ağırlıklarını yayımlayan üretici olarak bilindi ve bu modelin ağırlıkları yayımlanmıyor. Meta nın hattının tepesindeki model bugün kapalı bir model.

Tabloda olmayan model ise şu: OpenAI nin yeni amiral gemisi GPT-6 Astra, girdide 10 ve çıktıda 50 dolar. Bu sayfadaki iki liderlik tablosunun hiçbirinde bu adla bir satır yok; yani yüz ağırlığın yetmişi boş kalırdı ve tabloya koymak yalnızca «sıralanmadı» yazan bir satır üretirdi. Model kataloğunda yer alıyor ve tabloda neden olmadığını, kimse gözden kaçırdığımızı sanmasın diye buraya yazdık.

İlk seçimimizi ne zaman almamalısınız

  • Ekibiniz Opus 5 taşımayan bir bulutta çalışıyorsa, araçları çalışan ikinci model araçsız birinciyi geçer.
  • İşiniz kod değil genel sohbetse bu tabloyu yok sayın. Metin tablosu sırayı başka kuruyor.
  • Bütçe gerçekten darsa, aşağıdaki açık ağırlıklı modeller puanda fiyatta olduğundan daha az geride kalıyor.

Yetersiz kaldığı yerler

  • Birincil ölçüt insan tercihine dayalı bir tablo; gerçek depolar üzerinde otomatik bir test değil.
  • Tabloda SWE-bench Verified değeri yok, çünkü o liderlik tablosunu doğrudan okuyamadık.
  • Anthropic in Frontier-Bench iddiaları göreli ve mutlak sayı taşımıyor, o sütun boş kalıyor.
  • Qwen3.8 Max in artık doğrulanmış bir fiyatı ve bağlam penceresi var, ama araç olgunluğu ile İran sütunları hâlâ kanıtsız; yani 100 ağırlığının 20 si ölçülmemiş. Bu bizim veri boşluğumuz, modelin zayıflığı değil.
  • Tablonun tepesindeki model aynı zamanda en pahalı satırı ve değer sütununda sıfır alıyor. Maliyet sizin için belirleyiciyse buradaki birincilik sizin cevabınız değil.
  • OpenAI nin yeni amiral gemisi GPT-6 Astra tabloda hiç yok, çünkü iki liderlik tablosunun da bu adla bir satırı yok. Yani bu tablo şu anda OpenAI nin sattığı en pahalı modeli ölçmüyor.

Bizim görüşümüz

Bir tanesini seçmek zorundaysanız ve maliyet bir kısıt değilse Fable 5.1 i alın. Aylık faturanız varsa Opus 5 yarı fiyatta ve yetmiş sekiz puan altta; bu takası sizin yapmanız gerekir, biz sizin yerinize yapamayız. Model değiştirmeden önce ise bir kez kendi token tüketiminize bakın: gördüğümüz işlerde bağlamı kısaltmak model değiştirmekten daha fazla tasarruf ettiriyor.

İnsanların gerçekten sorduğu sorular

Kodlama için en iyi yapay zekâ hangisi

Bugün Claude Fable 5.1; WebDev Arena da 1765 le birincilik ve bir sonraki satıra yetmiş sekiz puan fark sayesinde. Aynı zamanda tablonun en pahalı satırı; maliyet sizin için belirleyiciyse pratik cevap Opus 5 olur. Bu cevap tarihlidir ve her yeni sürüm onu değiştirebilir.

Açık ağırlıklı modeller kod için kullanılabilir mi

Evet, ama 2 Eylül de fark açıldı. Kimi K3 Max 1674 ve Qwen3.8 Max 1669 hâlâ Opus 5 e yakın ve tablonun tepesindeki modelin yaklaşık doksan puan altında. Bilmeye değer yeni bir şey daha var: bugün tabloya katılan Meta nın Muse Spark ı ağırlıklarını yayımlamıyor; yani ağırlık yayımlamakla tanınan üretici, kendi en üst modelini kapalı sunuyor.

Bu sıralama diğer listelerden neden farklı

Çünkü ölçütleri ve ağırlıkları görebileceğiniz bir yere yazdık. Listelerin çoğu sırasını hiç açıklamaz ve açıklama yoksa her sıra mümkündür.

Bu araçları bir projeye bağlamak için bir hafta harcamak istemiyorsanız, o iş şunun bir parçası:

uygulama ve özel yazılım geliştirme hizmetimiz