مهمة

أفضل ذكاء اصطناعي للبرمجة

كلود فيبل 5.1 يحصل على أعلى نتيجة، لأن تحديث 2 سبتمبر في WebDev Arena يضعه أولا بـ1765 والصف التالي يأتي أدنى منه بثمان وسبعين نقطة. وهو أيضا أغلى صف في الجدول، وهذه الصفحة تبيّن لمن تستحق هذه المقايضة ولمن لا تستحق.

  • أحد عشر نموذجا بأدلة حقيقية
  • الأوزان على الصفحة
  • بلا ترتيب يدوي

آخر تحقق: هذه صفحة مرجعية. نعيد التحقق منها من مصادر الشركة المطوّرة ونحدّثها عند صدور أي إصدار جديد. ما الذي تغيّر

من أين تأتي نتيجة كل أداة

الحلقة أدناه هي الأوزان نفسها المكتوبة في رؤوس أعمدة الجدول.

100الأوزان
  • لوحة تطوير الويب 40
  • النتيجة لكل دولار 20
  • نضج الأدوات 15
  • لوحة النص العامة 10
  • نافذة السياق 10
  • الوصول من إيران 5

نحن اخترنا هذه الأوزان، وهذا هو الحكم الوحيد في الجدول. بأوزان أخرى يصبح الترتيب مختلفا.

ترتيب اليوم، من أدلة موثّقة

النموذج الذي يتقدّمنا في لوحة الصدارة موجود في الجدول حتى لو لم نكتب صفحته، وإلا فالمركز الأول يعني الأول بين ما أسعفنا الوقت لكتابته.

أفضل ذكاء اصطناعي للبرمجة
الترتيب الأداة النتيجة لوحة تطوير الويب 40 النتيجة لكل دولار 20 نضج الأدوات 15 لوحة النص العامة 10 نافذة السياق 10 الوصول من إيران 5
1 كلود فيبل 5.1 الخيار الحالي 73.1 1,764 المصدر: arena.ai 35.3 المصدر: arena.ai 4/4 1,504 المصدر: arena.ai 1 مليون رمز المصدر: platform.claude.com محجوب / لا طريق يعمل
2 GPT-6 Astra 70.2 1,796 المصدر: arena.ai 35.9 المصدر: arena.ai 4/4 غير موثّق 1 مليون رمز المصدر: developers.openai.com محجوب / لا طريق يعمل
3 كلود أوبس 5 59.0 1,688 المصدر: arena.ai 67.5 المصدر: arena.ai 4/4 1,493 المصدر: arena.ai 1 مليون رمز المصدر: platform.claude.com محجوب / لا طريق يعمل
4 كلود فيبل 5 البديل لدى الشركة: كلود فيبل 5.1 51.1 1,628 المصدر: arena.ai 32.6 المصدر: arena.ai 4/4 1,507 المصدر: arena.ai 1 مليون رمز المصدر: platform.claude.com محجوب / لا طريق يعمل
5 Muse Spark 1.3 48.2 1,650 المصدر: arena.ai 388.2 المصدر: arena.ai 2/4 غير موثّق 1 مليون رمز المصدر: developer.meta.com غير موثّق
6 GPT-5.6 Sol 46.0 1,617 المصدر: arena.ai 80.9 المصدر: arena.ai 4/4 1,483 المصدر: arena.ai 1 مليون رمز المصدر: developers.openai.com محجوب / لا طريق يعمل
7 Gemini 3.8 Flash 43.4 1,568 المصدر: arena.ai 418.1 المصدر: arena.ai 3/4 1,494 المصدر: arena.ai غير موثّق محجوب / لا طريق يعمل
8 كوين 3.8 ماكس 43.3 1,670 المصدر: arena.ai 278.3 المصدر: arena.ai غير موثّق 1,480 المصدر: arena.ai 1 مليون رمز المصدر: www.alibabacloud.com غير موثّق
9 كيمي K3 ماكس 38.7 1,674 المصدر: arena.ai 111.6 المصدر: arena.ai 1/4 1,489 المصدر: arena.ai 1 مليون رمز المصدر: platform.kimi.ai غير موثّق
10 GLM-5.2 ماكس 31.9 1,589 المصدر: arena.ai 361.1 المصدر: arena.ai 1/4 1,472 المصدر: arena.ai 1 مليون رمز المصدر: docs.z.ai غير موثّق
11 Grok 4.5 21.8 1,556 المصدر: arena.ai 259.3 المصدر: arena.ai 3/4 1,471 المصدر: arena.ai 500 ألف رمز المصدر: docs.x.ai غير موثّق
12 Hy4 preview 20.3 1,623 المصدر: arena.ai غير موثّق غير موثّق غير موثّق 1 مليون رمز المصدر: huggingface.co غير موثّق

الخلية الفارغة تعني أننا لم نتمكن من التحقق من الرقم، لا أن الأداة حصلت على صفر.

خلف كل رقم

لكل درجة تقديرية في هذا الجدول سبب مكتوب، وعمود إيران يقول كيف جرى التحقق. هذان مفتوحان هنا. أما أثر القياس خلف كل رقم، أي من أي صف في أي لوحة وعلى كم صوت، فيُفتح تحت النموذج الذي يخصه.

1 كلود فيبل 5.1

نضج الأدوات 4/4 يتوفر على المسارات الخمسة وجدول انثروبيك نفسه يطبع معرف نموذج لكل منها. وفي الجدول ذاته تظهر خانة Claude Platform on AWS شرطة لاوبس 5 ومعرفا لهذا النموذج.

الوصول من إيران محجوب / لا طريق يعمل إيران ليست في قائمة انثروبيك للدول المدعومة. قرئ من صفحة انثروبيك نفسها لا بقياس شبكي. ولم يتغير شيء في هذا الإصدار.

أثر القياس (3)

لوحة تطوير الويب 1,764 صف claude-fable-5.1-max، المرتبة 2 في لوحة WebDev Arena، تحديث 8 سبتمبر 2026 بعدد أصوات 663,027. ويعطي Arena هذا الصف نطاق مرتبة من 1 إلى 2، وهو نطاق الصف الذي فوقه نفسه، فاللوحة نفسها لا تحسم الأول والثاني.

النتيجة لكل دولار 35.3 نتيجة WebDev Arena مقسومة على سعر كل مليون رمز مُخرج

لوحة النص العامة 1,504 صف claude-fable-5.1-max، المرتبة 3 في لوحة Arena النصية، تحديث 2 سبتمبر 2026 بـ 7,999,020 صوتا

2 GPT-6 Astra

نضج الأدوات 4/4 يبلغ الدرجة الرابعة اعتمادا على توثيق الصانع نفسه: الواجهة البرمجية مع مسار الدفعات، وأدوات مستضافة من البحث في الويب حتى استخدام الحاسوب وMCP، وواجهة Agents API التي دخلت الإصدار التجريبي العام في 10 سبتمبر مع بيئة Codex مُدارة، والتوفر على Amazon Bedrock. ودليل OpenAI نفسه لبدروك يقول إن النموذج متاح حتى الآن في منطقة واحدة هي us-west-2.

الوصول من إيران محجوب / لا طريق يعمل أعدنا قراءة قائمة الدول المدعومة لواجهة OpenAI على developers.openai.com في 11 سبتمبر 2026؛ فيها نحو 195 دولة وإقليما وإيران ليست بينها. قُرئ من صفحة الصانع لا بقياس شبكي.

أثر القياس (2)

لوحة تطوير الويب 1,796 صف gpt-6-astra-max، المرتبة 1 في لوحة WebDev Arena، تحديث 8 سبتمبر 2026 بعدد أصوات 663,027، منها 1,810 على هذا الصف. ويحمل المفتاح الداخلي للصف عبارة codex-harness، أي أن النموذج اختُبر داخل وكيل البرمجة الذي تصنعه OpenAI لا مجردا. ويعطي Arena هذا الصف نطاق مرتبة من 1 إلى 2، وهو نطاق الصف الذي يليه نفسه.

النتيجة لكل دولار 35.9 نتيجة WebDev Arena مقسومة على سعر كل مليون رمز مُخرج

3 كلود أوبس 5

نضج الأدوات 4/4 واجهة برمجية، تطبيق رسمي، أداة سطر أوامر، SDK للوكلاء، تنفيذ دفعي، وإصدار على ثلاث سحابات كبرى

الوصول من إيران محجوب / لا طريق يعمل إيران غير موجودة في أي من قائمتي الدول المدعومة لدى أنثروبيك، لا قائمة الواجهة البرمجية ولا قائمة claude.ai. قرأنا ذلك على صفحة أنثروبيك نفسها ولم نقِسه: لم يُجرَ اختبار شبكة مستقل بعد، وعندما يُجرى سيُكتب هنا.

أثر القياس (3)

لوحة تطوير الويب 1,688 صف claude-opus-5-max، المرتبة 3 في لوحة WebDev Arena، تحديث 8 سبتمبر 2026 بعدد أصوات 663,027

النتيجة لكل دولار 67.5 نتيجة WebDev Arena مقسومة على سعر كل مليون رمز مُخرج

لوحة النص العامة 1,493 صف claude-opus-5-high، المرتبة 9 في لوحة Arena النصية، تحديث 2 سبتمبر 2026 بـ 7,999,020 صوتا

4 كلود فيبل 5

نضج الأدوات 4/4 يحمل البنية نفسها التي لاوبوس 5 ويتوفر على المسارات الخمسة: واجهة انثروبيك، وبدروك، ومنصة كلود على AWS، وجوجل كلاود، ومايكروسوفت فاوندري.

الوصول من إيران محجوب / لا طريق يعمل إيران ليست في قائمة انثروبيك للدول المدعومة. قرئ من صفحة انثروبيك نفسها لا بقياس شبكي.

أثر القياس (3)

لوحة تطوير الويب 1,628 صف claude-fable-5، المرتبة 10 في لوحة WebDev Arena، تحديث 8 سبتمبر 2026 بعدد أصوات 663,027

النتيجة لكل دولار 32.6 نتيجة WebDev Arena مقسومة على سعر كل مليون رمز مُخرج

لوحة النص العامة 1,507 صف claude-fable-5، المرتبة 1 في لوحة Arena النصية، تحديث 2 سبتمبر 2026 بـ 7,999,020 صوتا

5 Muse Spark 1.3

نضج الأدوات 2/4 واجهة Meta Model API اضافة الى التوفر على OpenRouter، وهذا اكثر من نقطة نهاية مجردة. لكن توثيق ميتا نفسه لا يدرج اداة سطر اوامر رسمية ولا اضافة محرر، فلا يتجاوز الدرجة الثانية.

أثر القياس (2)

لوحة تطوير الويب 1,650 صف muse-spark-1.3-max، المرتبة 8 في لوحة WebDev Arena، تحديث 8 سبتمبر 2026 بعدد أصوات 663,027. أُضيف هذا الصف في 8 سبتمبر. أما صف xhigh الذي سجلناه سابقا فصار عند 1625 في المرتبة 11؛ وكما مع كل مرشح آخر نسجل الصف الأعلى للنموذج نفسه.

النتيجة لكل دولار 388.2 نتيجة WebDev Arena مقسومة على سعر كل مليون رمز مُخرج

6 GPT-5.6 Sol

نضج الأدوات 4/4 يبلغ الدرجة الرابعة اعتمادا على توثيق الصانع نفسه: واجهة برمجية وحزم تطوير وسطر أوامر رسمي، وإضافة محرر Codex، وحزمة تطوير للوكلاء، ومسار دفعات، ودليل رسمي للتشغيل على Amazon Bedrock يسمي المعرف openai.gpt-5.6-sol. وهذا هو العمود الوحيد الذي اكتمل لهذا النموذج دون أن يُفتح openai.com.

الوصول من إيران محجوب / لا طريق يعمل كان هذا العمود فارغا حتى اليوم ولم يعد كذلك. قائمة الدول المدعومة على openai.com الذي ما زال يعيد 403، لكن القائمة نفسها موجودة على developers.openai.com وهذا النطاق مفتوح. فيها نحو 195 دولة وإقليما وإيران ليست بينها. والصفحة نفسها تقول إن الوصول من خارج القائمة قد يؤدي إلى حظر الحساب. قرئ من صفحة الصانع لا بقياس شبكي.

أثر القياس (3)

لوحة تطوير الويب 1,617 صف gpt-5.6-sol-xhigh (codex-harness)، المرتبة 14 في لوحة WebDev Arena، تحديث 8 سبتمبر 2026 بعدد أصوات 663,027

النتيجة لكل دولار 80.9 نتيجة WebDev Arena مقسومة على سعر كل مليون رمز مُخرج

لوحة النص العامة 1,483 صف gpt-5.6-sol-xhigh، المرتبة 17 في لوحة Arena النصية، تحديث 2 سبتمبر 2026 بـ 7,999,020 صوتا

7 Gemini 3.8 Flash

نضج الأدوات 3/4 واجهة برمجية وحزم تطوير رسمية واستوديو ويب ومسار Vertex على سحابة جوجل. ونمتنع عن الدرجة الرابعة لان جوجل لا تدرج اداة سطر اوامر برمجية رسمية مستقلة لهذه العائلة، بخلاف انثروبيك وOpenAI.

الوصول من إيران محجوب / لا طريق يعمل صفحة المناطق المتاحة لواجهة Gemini تسمي نحو 195 دولة وإقليما وإيران ليست بينها. قرئ من صفحة جوجل نفسها لا بقياس شبكي.

أثر القياس (3)

لوحة تطوير الويب 1,568 صف gemini-3.8-flash-high، المرتبة 22 في لوحة WebDev Arena، تحديث 8 سبتمبر 2026 بعدد أصوات 663,027

النتيجة لكل دولار 418.1 نتيجة WebDev Arena مقسومة على سعر كل مليون رمز مُخرج

لوحة النص العامة 1,494 صف gemini-3.8-flash-high، المرتبة 8 في لوحة Arena النصية، تحديث 2 سبتمبر 2026 بـ 7,999,020 صوتا

8 كوين 3.8 ماكس

أثر القياس (3)

لوحة تطوير الويب 1,670 صف qwen3.8-max، المرتبة 6 في لوحة WebDev Arena، تحديث 8 سبتمبر 2026 بعدد أصوات 663,027

النتيجة لكل دولار 278.3 نتيجة WebDev Arena مقسومة على سعر كل مليون رمز مُخرج

لوحة النص العامة 1,480 صف qwen3.8-max، المرتبة 22 في لوحة Arena النصية، تحديث 2 سبتمبر 2026 بـ 7,999,020 صوتا

9 كيمي K3 ماكس

نضج الأدوات 1/4 واجهة برمجية متوافقة مع OpenAI مع عميل رسمي واحد. ووثائق المنصة لا تدرج اداة سطر اوامر رسمية ولا اضافة محرر، فلا نمنحه اكثر من ذلك.

أثر القياس (3)

لوحة تطوير الويب 1,674 صف kimi-k3-max، المرتبة 5 في لوحة WebDev Arena، تحديث 8 سبتمبر 2026 بعدد أصوات 663,027

النتيجة لكل دولار 111.6 نتيجة WebDev Arena مقسومة على سعر كل مليون رمز مُخرج

لوحة النص العامة 1,489 صف kimi-k3-max، المرتبة 12 في لوحة Arena النصية، تحديث 2 سبتمبر 2026 بـ 7,999,020 صوتا

10 GLM-5.2 ماكس

نضج الأدوات 1/4 واجهة برمجية موثقة مع عميل رسمي واحد. ولا تدرج الوثائق اداة سطر اوامر رسمية ولا اضافة محرر.

أثر القياس (3)

لوحة تطوير الويب 1,589 صف glm-5.2-max، المرتبة 18 في لوحة WebDev Arena، تحديث 8 سبتمبر 2026 بعدد أصوات 663,027

النتيجة لكل دولار 361.1 نتيجة WebDev Arena مقسومة على سعر كل مليون رمز مُخرج

لوحة النص العامة 1,472 صف glm-5.2-max، المرتبة 37 في لوحة Arena النصية، تحديث 2 سبتمبر 2026 بـ 7,999,020 صوتا

11 Grok 4.5

نضج الأدوات 3/4 واجهة متوافقة مع OpenAI، وحزمتا تطوير بايثون وجافاسكربت، ووكيل سطر أوامر رسمي اسمه Grok Build. ولا يبلغ الدرجة الرابعة: لا إضافة محرر رسمية، ومسار الدفعات يرفض هذا النموذج بالذات.

أثر القياس (3)

لوحة تطوير الويب 1,556 صف grok-4.5، المرتبة 25 في لوحة WebDev Arena، تحديث 8 سبتمبر 2026 بعدد أصوات 663,027

النتيجة لكل دولار 259.3 نتيجة WebDev Arena مقسومة على سعر كل مليون رمز مُخرج

لوحة النص العامة 1,471 صف grok-4.5، المرتبة 38 في لوحة Arena النصية، تحديث 2 سبتمبر 2026 بـ 7,999,020 صوتا

12 Hy4 preview

أثر القياس (1)

لوحة تطوير الويب 1,623 صف hy4-preview، المرتبة 13 في لوحة WebDev Arena، تحديث 8 سبتمبر 2026 بعدد أصوات 663,027. تطبع اللوحة اسم الصانع Tencent والرخصة Apache 2.0. أما السعر المعروض بجانب الصف فلم نقرأه من أي صفحة لتينسنت، لذلك لا يرد في هذا المرجع.

لا توجد بيانات موثّقة كافية للترتيب

هذه أدوات حقيقية نتابعها، لكن أكثر من نصف معاييرها بلا رقم موثّق حتى الآن، فترتيبها سيكون تخمينا.

أفضل ذكاء اصطناعي للبرمجة في 2026 مع المصادر
أفضل ذكاء اصطناعي للبرمجة في 2026 مع المصادر

كيف يُحسب هذا الترتيب

كل معيار أدناه له وزن ومصدر. غيّر وزنا فيُعاد حساب الجدول كله. لا يوجد ترتيب موضوع باليد في أي مكان من هذا المرجع.

المعيار الوزن الدليل
لوحة تطوير الويب 40 WebDev Arenaأعمال تطوير ويب حقيقية بأدوات وعلى عدة خطوات، وهي أقرب للعمل اليومي من اختبار بسؤال واحد
النتيجة لكل دولار 20 محسوب من رقمين أعلاهللفريق الذي يحمل فاتورة شهرية، نموذج أغلى يتقدّم بواحد بالمئة هو شراء سيئ
نضج الأدوات 15 مقياس مُعرَّف، مع سبب مكتوب لكل تقييمنموذج جيد بلا أداة سطر أوامر وبلا SDK للوكلاء يتباطأ في العمل اليومي
لوحة النص العامة 10 Arena (Text)وزنه منخفض لأن المحادثة العامة ليست مقياسا للبرمجة، وإن لم تكن بلا صلة
نافذة السياق 10 مواصفة معلنة من الشركةفي مستودع كبير، النافذة الصغيرة تعني التقطيع، والتقطيع يعني فقدان السياق
الوصول من إيران 5 عمود الوصول عندنا، بطريقته المعلنةوزنه منخفض لأن لهذا العمود صفحته الخاصة تحت الذكاء الاصطناعي في إيران

لماذا يتصدّر فيبل 5.1، ولماذا لم يوقفه السعر هذه المرة

رقم واحد حسم الأمر. في تحديث 2 سبتمبر للوحة WebDev Arena يجلس صف claude-fable-5.1-max أولا بـ1765، ويأتي بعده الصف الذي نحمله، claude-opus-5-max، بـ1687. ثمان وسبعون نقطة، في عمود كان طرفه الأعلى كله يتسع لاثنتين وعشرين نقطة قبل أسبوع.

وهذا النموذج يخسر عمود القيمة مقابل السعر خسارة كاملة. مخرجاته 50 دولارا لكل مليون رمز، أي ضعف أوبس 5، وينال في ذلك العمود صفرا. في كل مرة سابقة كان هذا العمود هو ما يُسقط النموذج الغالي. وهذه أول مرة يتغلّب فيها فارق النتيجة على السعر، والسبب بسيط: يأخذ وزن عمود اللوحة الأربعين كاملا، ويحمل أيضا أعمدة الأدوات ونافذة السياق وإيران.

فالجواب القصير ليس جوابا واحدا. إن كنت تعمل عبر الواجهة البرمجية ولديك فاتورة شهرية، فأوبس 5 بنصف السعر وثانٍ في الجدول نفسه. وإن كان عملك من النوع الذي يكون إنجازه صحيحا مرة أرخص من إنجازه مرتين، فثمان وسبعون نقطة هي ما تدفع مقابله.

حيث يُقصّر هذا الجدول

معيارنا الأساسي لوحة تفضيل بشري، لا اختبار آلي. WebDev Arena يعطي نتيجة مطلقة وتاريخا وعدد أصوات، وهو ما يلزم للنشر، لكن التفضيل البشري يتأثر أيضا بوضوح الجواب وشكله لا بصحة الكود فقط. وكان SWE-bench Verified مقياسا أدق، لكن لوحته تُرسَم بجافاسكربت ولم نقرأ أرقامها مباشرة. ولا نطبع رقما لم نقرأه، ولو نقله غيرنا.

مرشح واحد في هذه الصفحة بلا ترتيب: جيميني 3.1 برو. له نتيجة حقيقية في لوحة النص العامة، لكننا لم نقرأ صفه في WebDev Arena ولا تنشر غوغل له نافذة سياق أصلا، فأكثر من نصف وزن المعايير فارغ. اسمه تحت الجدول، ومركزه لا. وقد جلس GLM-5.2 ماكس وديب سيك V4 فلاش هناك مدة أيضا، والآن بعد توثيق سعرهما ونافذة سياقهما من وثائقهما نفسها صار لهما ترتيب.

وملاحظة عن قراءة هذه اللوحة ظهرت هذه المرة ولا تُكتب في مكان آخر: لكوين صفّان منفصلان. صف qwen3.8-max بـ1669، وصف qwen3.8-max-0902 بـ1688 وهو الثاني على اللوحة كلها. ونحن نسجّل الأول، لأن المعرّف الوارد في وثائق علي بابا هو ذاك، ولأن الصف المؤرَّخ لقطة لتهيئة تقديم بعينها. فإن رأيت كوين ثانيا في مكان آخر فهذا سببه، لا خطأ عندنا.

وأمر آخر حتى لا تربكك الأرقام: النقاط نسبية. كل عمود يُطبَّع بين حده الأدنى والأقصى، فإضافة مرشح جديد تحرّك نقاط الجميع دون أن يتغير أي نموذج. وإضافة Grok 4.5 في 12 أغسطس 2026 فعلت ذلك بالضبط: بقي الترتيب وارتفعت الأرقام. فإن لم يطابق رقم اليوم لقطة شاشة من الأسبوع الماضي، فهذا سببه، لا أننا مسسنا شيئا.

وفي اليوم نفسه حرّك الأرقامَ تغييران آخران في البيانات. أولا، قرأنا لوحة النص كاملة هذه المرة فتبيّن أن صفّي GLM-5.2 ماكس وديب سيك V4 فلاش كانا عليها منذ البداية، وأن جولة سابقة لم تقرأ سوى أعلى الصفحة؛ فامتلأ عمود لوحة النص العامة لكليهما. وثانيا، صار GPT-5.6 Sol مرشحا ثامنا: فـopenai.com لا يزال لا يجيب خادمنا، لكن توثيق مطوّريه ينشر السعر ونافذة السياق، وصفه في اللوحة موجود. وملاحظة عن ذلك الصف، ما دامت هذه صفحة البرمجة: اسمه gpt-5.6-sol-xhigh (codex-harness)، أي أن النقطة للنموذج داخل وكيل البرمجة الخاص بأوبن إيه آي لا للنموذج المجرّد. وقد حلّ GPT بين كيمي وكوين، ولم يتبدّل موقع أي صف قديم بالنسبة إلى الصفوف الأخرى.

28 أغسطس: ارتفع سعر ديب سيك فتحرّكت ثلاثة صفوف

هذا هو الرقم الوحيد في هذا المرجع الذي ارتفع حتى اليوم. في 12 أغسطس كان ديب سيك V4 فلاش بـ0.14 دولار للمدخلات و0.28 للمخرجات. وصفحة أسعاره نفسها صار فيها عمودان، ساعة الذروة وغيرها، وحتى العمود الأرخص أعلى من السعر القديم: 0.22 و0.66 خارج الذروة، و0.44 و1.32 في الذروة. ونحن نسجّل عمود الذروة، لأن ساعات ذروة ديب سيك تقع في منتصف يوم العمل الإيراني.

لم يخسر ديب سيك مرتبته، فهو ما زال أرخص صف في الجدول وما زال يتصدّر عمود القيمة مقابل السعر. لكن الفارق بينه وبين غيره ضاق، ولأن كل عمود يُطبَّع بين حدّه الأدنى وحدّه الأعلى فإن ضيق الفارق رفع ثلاثة صفوف أخرى: كوين 3.8 ماكس من الخامس إلى الثالث، وكيمي K3 ماكس من الثالث إلى الرابع، وGPT-5.6 Sol من الرابع إلى الخامس. ولم تغيّر هذه النماذج الثلاثة شيئا على الإطلاق. هذا بالضبط معنى الترتيب النسبي، وهو سبب طباعة الحساب على هذه الصفحة نفسها.

3 سبتمبر: الفارق في أعلى الجدول انتقل من 22 نقطة إلى 78

حتى الأسبوع الماضي كانت أعلى ثلاث نقاط في هذا العمود تتسع لـ22 نقطة، هي 1692 و1674 و1670. وكان استنتاج هذه الصفحة حينها أن الفرق بين النماذج أقل مما توحي به الأرقام، وأن ما يغيّر يوم العمل فعلا هو نضج الأدوات: أداة سطر أوامر، وتنفيذ دفعي، وحضور على سحابة تملك شركتك عقدا معها. وهذا ما زال صحيحا للمراتب من الثانية إلى الحادية عشرة، ولهذا يحمل ذلك المعيار خمسة عشر وزنا. أما المرتبة الأولى فلم يعد صحيحا فيها.

وتحرّكت ثلاثة صفوف أخرى في التحديث نفسه دون أن تغيّر شيئا في ذاتها. انتقل كيمي K3 ماكس من الثالث إلى الخامس، وكوين 3.8 ماكس من الخامس إلى السادس، بينما بقي رقم كيمي على اللوحة 1674 كما هو تماما. وبقي GPT-5.6 Sol رابعا لكن نتيجته نزلت من 51.6 إلى 48.8. وسبب الثلاثة واحد: دخول مرشحين جدد وإعادة تطبيع الأعمدة.

ثلاثة مرشحين جدد، ونموذج خارج الجدول عن قصد

دخل الجدول اليوم ميوز سبارك 1.3 من ميتا وجيميني 3.8 فلاش من غوغل، ولكليهما صف حقيقي على اللوحة نفسها. وميوز سبارك يحمل نقطة قلّما تقولها القوائم الأخرى: ظلت ميتا سنوات تُعرَف بأنها الصانع الذي ينشر أوزان نماذجه، وهذا النموذج أوزانه غير منشورة. النموذج الأعلى في خط ميتا اليوم نموذج مغلق.

والنموذج الغائب عن الجدول: GPT-6 Astra، رأس حربة OpenAI الجديد بـ10 دولارات للمدخلات و50 للمخرجات. لا توجد في أي من لوحتي هذه الصفحة صف بهذا الاسم، فسبعون من مئة وزن ستبقى فارغة، ووضعه في الجدول لن ينتج إلا سطرا مكتوبا فيه «غير مرتَّب». هو في كاتالوج النماذج، وكتبنا هنا سبب غيابه عن الجدول كي لا يظن أحد أننا لم نره.

متى لا تأخذ خيارنا الأول

  • إن كان فريقك يعمل على سحابة لا تحمل أوبس 5، فالنموذج الثاني بأدوات عاملة يتقدّم على الأول بلا أدوات.
  • إن كان عملك محادثة عامة لا كودا، فتجاهل هذا الجدول. لوحة النص ترتّب الأمور بشكل آخر.
  • إن كانت الميزانية ضيقة فعلا، فالنماذج مفتوحة الأوزان في أسفل الجدول تتأخر في النتيجة أقل مما تتأخر في السعر.

حيث تُقصّر

  • المعيار الأساسي لوحة تفضيل بشري، لا اختبار آلي على مستودعات حقيقية.
  • لا يوجد رقم SWE-bench Verified في الجدول، لأننا لم نتمكن من قراءة تلك اللوحة مباشرة.
  • ادعاءات أنثروبيك عن Frontier-Bench نسبية وبلا رقم مطلق، فيبقى ذلك العمود فارغا.
  • صار لكوين 3.8 ماكس سعر ونافذة سياق موثّقان، لكن عمودَي بلوغ الأدوات وإيران ما زالا بلا شاهد، أي أن 20 من أصل 100 من وزنه غير مقيس. وهذه فجوة في بياناتنا لا ضعف في النموذج.
  • النموذج المتصدّر لهذا الجدول هو أيضا أغلى صف فيه، وينال صفرا في عمود القيمة مقابل السعر. فإن كانت الكلفة هي الفيصل عندك، فالمركز الأول هنا ليس جوابك.
  • GPT-6 Astra، رأس حربة OpenAI الجديد، غائب عن الجدول تماما لأن أيا من اللوحتين لا تحمل صفا بهذا الاسم. أي أن هذا الجدول لا يقيس اليوم أغلى نموذج تبيعه OpenAI.

رأينا

إن كان عليك اختيار واحد ولم تكن الكلفة قيدا، فخذ فيبل 5.1. وإن كانت لديك فاتورة شهرية، فأوبس 5 بنصف السعر وأدنى بثمان وسبعين نقطة، وهذه مقايضة عليك أنت أن تعقدها. وقبل تغيير النموذج أصلا، انظر مرة في استهلاكك للرموز: في ما رأيناه، تقليم السياق يوفّر أكثر من تبديل النموذج.

أسئلة يطرحها الناس فعلا

ما أفضل ذكاء اصطناعي للبرمجة

اليوم كلود فيبل 5.1، بحكم المركز الأول في WebDev Arena بـ1765 وفارق ثمان وسبعين نقطة عن الصف التالي. وهو أيضا أغلى صف في الجدول، فإن كانت الكلفة هي الفيصل عندك فالجواب العملي هو أوبس 5. هذا الجواب مؤرّخ وأي إصدار جديد قد يغيّره.

هل النماذج مفتوحة الأوزان صالحة للكود

نعم، لكن الفارق اتّسع في 2 سبتمبر. كيمي K3 ماكس بـ1674 وكوين 3.8 ماكس بـ1669 ما زالا قريبين من أوبس 5، وأدنى بنحو تسعين نقطة من متصدّر الجدول. وثمة أمر جديد يستحق المعرفة: ميوز سبارك من ميتا، الذي دخل الجدول اليوم، لا تُنشر أوزانه؛ أي أن الصانع الذي اشتُهر بنشر الأوزان يقدّم نموذجه الأعلى مغلقا.

لماذا يختلف هذا الترتيب عن قوائم أخرى

لأننا كتبنا المعايير والأوزان في مكان تراه. معظم القوائم لا تشرح ترتيبها أبدا، وحين لا يوجد شرح، فأي ترتيب ممكن.

إن كنت تفضّل ألا تصرف أسبوعا في توصيل هذه الأدوات بمشروع، فهذا العمل جزء من

خدمة تطوير التطبيقات والبرمجيات المخصّصة