مهمة

أفضل ذكاء اصطناعي للبرمجة

كلود أوبس 5 يحصل على أعلى نتيجة اليوم، لأنه الأول في WebDev Arena بـ1692 وفي الوقت نفسه بنصف سعر أغلى نموذج في السوق. الجدول أدناه يعرض المعايير وأوزانها، وكل رقم يحمل رابط مصدره.

  • ستة نماذج بأدلة حقيقية
  • الأوزان على الصفحة
  • بلا ترتيب يدوي

آخر تحقق: هذه صفحة مرجعية. نعيد التحقق منها من مصادر الشركة المطوّرة ونحدّثها عند صدور أي إصدار جديد. ما الذي تغيّر

ترتيب اليوم، من أدلة موثّقة

النموذج الذي يتقدّمنا في لوحة الصدارة موجود في الجدول حتى لو لم نكتب صفحته، وإلا فالمركز الأول يعني الأول بين ما أسعفنا الوقت لكتابته.

أفضل ذكاء اصطناعي للبرمجة
الترتيب الأداة النتيجة لوحة تطوير الويب 40 النتيجة لكل دولار 20 نضج الأدوات 15 لوحة النص العامة 10 نافذة السياق 10 الوصول من إيران 5
1 كلود أوبس 5 الخيار الحالي 94.0 1,692 المصدر 67.7 المصدر 4/4 واجهة برمجية، تطبيق رسمي، أداة سطر أوامر، SDK للوكلاء، تنفيذ دفعي، وإصدار على ثلاث سحابات كبرى 1,494 المصدر 1 مليون رمز المصدر محجوب / لا طريق يعمل إيران غير موجودة في أي من قائمتي الدول المدعومة لدى أنثروبيك، لا قائمة الواجهة البرمجية ولا قائمة claude.ai. قرأنا ذلك على صفحة أنثروبيك نفسها ولم نقِسه: لم يُجرَ اختبار شبكة مستقل بعد، وعندما يُجرى سيُكتب هنا.
2 كلود فيبل 5 36.1 1,628 المصدر 32.6 المصدر غير موثّق 1,506 المصدر 1 مليون رمز المصدر غير موثّق
3 كوين 3.8 ماكس 33.8 1,670 المصدر غير موثّق غير موثّق 1,490 المصدر غير موثّق غير موثّق
4 كيمي K3 ماكس 33.8 1,674 المصدر غير موثّق غير موثّق 1,487 المصدر غير موثّق غير موثّق

الخلية الفارغة تعني أننا لم نتمكن من التحقق من الرقم، لا أن الأداة حصلت على صفر.

لا توجد بيانات موثّقة كافية للترتيب

هذه أدوات حقيقية نتابعها، لكن أكثر من نصف معاييرها بلا رقم موثّق حتى الآن، فترتيبها سيكون تخمينا.

كيف يُحسب هذا الترتيب

كل معيار أدناه له وزن ومصدر. غيّر وزنا فيُعاد حساب الجدول كله. لا يوجد ترتيب موضوع باليد في أي مكان من هذا المرجع.

المعيار الوزن الدليل
لوحة تطوير الويب 40 WebDev Arenaأعمال تطوير ويب حقيقية بأدوات وعلى عدة خطوات، وهي أقرب للعمل اليومي من اختبار بسؤال واحد
النتيجة لكل دولار 20 محسوب من رقمين أعلاهللفريق الذي يحمل فاتورة شهرية، نموذج أغلى يتقدّم بواحد بالمئة هو شراء سيئ
نضج الأدوات 15 مقياس مُعرَّف، مع سبب مكتوب لكل تقييمنموذج جيد بلا أداة سطر أوامر وبلا SDK للوكلاء يتباطأ في العمل اليومي
لوحة النص العامة 10 Arena (Text)وزنه منخفض لأن المحادثة العامة ليست مقياسا للبرمجة، وإن لم تكن بلا صلة
نافذة السياق 10 مواصفة معلنة من الشركةفي مستودع كبير، النافذة الصغيرة تعني التقطيع، والتقطيع يعني فقدان السياق
الوصول من إيران 5 عمود الوصول عندنا، بطريقته المعلنةوزنه منخفض لأن لهذا العمود صفحته الخاصة تحت الذكاء الاصطناعي في إيران

لماذا يتقدّم أوبس 5

أمران معا. أولا، في WebDev Arena الذي يقيس أعمال تطوير الويب الحقيقية بأدوات وعلى عدة خطوات، يجلس صف claude-opus-5-max أولا بـ1692، أمام كيمي K3 ماكس بـ1674 وكوين 3.8 ماكس بـ1670. وثانيا، يتقاضى 25 دولارا لكل مليون رمز مُخرج، أي نصف فيبل 5 الذي نتيجته أدنى عند 1628. والنموذج الأعلى والأرخص في الوقت نفسه يأتي أولا في أي وزن معقول.

حيث يُقصّر هذا الجدول

معيارنا الأساسي لوحة تفضيل بشري، لا اختبار آلي. WebDev Arena يعطي نتيجة مطلقة وتاريخا وعدد أصوات، وهو ما يلزم للنشر، لكن التفضيل البشري يتأثر أيضا بوضوح الجواب وشكله لا بصحة الكود فقط. وكان SWE-bench Verified مقياسا أدق، لكن لوحته تُرسَم بجافاسكربت ولم نقرأ أرقامها مباشرة. ولا نطبع رقما لم نقرأه، ولو نقله غيرنا.

نموذجان في هذه الصفحة بلا ترتيب: GLM-5.2 ماكس وديب سيك V4 فلاش. لكليهما نتيجة حقيقية في لوحة تطوير الويب، لكننا لم نوثّق سعرهما ولا نافذة سياقهما من توثيقهما نفسه، فأكثر من نصف وزن المعايير فارغ لهما. أسماؤهما تحت الجدول، ومراكزهما لا.

شيء لا يظهر إلا في العمل اليومي

الفارق بين الأول والرابع في هذا الجدول نحو ستة وعشرين نقطة، ويُحَس عمليا أقل بكثير مما يوحي الرقم. ما يغيّر يوم العمل فعلا هو نضج الأدوات: أن يكون للنموذج أداة سطر أوامر وتنفيذ دفعي وحضور على سحابة تملك شركتك عقدا معها. ولهذا يحمل هذا المعيار خمسة عشر وزنا لا خمسة.

متى لا تأخذ خيارنا الأول

  • إن كان فريقك يعمل على سحابة لا تحمل أوبس 5، فالنموذج الثاني بأدوات عاملة يتقدّم على الأول بلا أدوات.
  • إن كان عملك محادثة عامة لا كودا، فتجاهل هذا الجدول. لوحة النص ترتّب الأمور بشكل آخر.
  • إن كانت الميزانية ضيقة فعلا، فالنماذج مفتوحة الأوزان في أسفل الجدول تتأخر في النتيجة أقل مما تتأخر في السعر.

حيث تُقصّر

  • المعيار الأساسي لوحة تفضيل بشري، لا اختبار آلي على مستودعات حقيقية.
  • لا يوجد رقم SWE-bench Verified في الجدول، لأننا لم نتمكن من قراءة تلك اللوحة مباشرة.
  • ادعاءات أنثروبيك عن Frontier-Bench نسبية وبلا رقم مطلق، فيبقى ذلك العمود فارغا.
  • النماذج الصينية هنا (كيمي وكوين وGLM وديب سيك) بلا سعر موثّق في بياناتنا، وهذا وحده يخفض ترتيبها. وهذه فجوة في بياناتنا لا ضعف فيها.

رأينا

إن كان عليك اختيار واحد وإيران ليست قيدا، فخذ أوبس 5. وإن كانت التكلفة هي القيد، فانظر في استهلاكك للرموز قبل تغيير النموذج: في ما رأيناه، تقليم السياق يوفّر أكثر من تبديل النموذج.

أسئلة يطرحها الناس فعلا

ما أفضل ذكاء اصطناعي للبرمجة

اليوم كلود أوبس 5، بحكم المركز الأول في WebDev Arena وسعر يساوي نصف أغلى نموذج في السوق. هذا الجواب مؤرّخ وأي إصدار جديد قد يغيّره.

هل النماذج مفتوحة الأوزان صالحة للكود

نعم. في اللوحة نفسها يحصل كوين 3.8 ماكس على 1670 وكيمي K3 ماكس على 1674، وكلاهما قريب من المتصدّر. نخفض ترتيبهما لأننا لم نوثّق سعرهما ومواصفاتهما من توثيقهما، لا لأن أداءهما سيئ.

لماذا يختلف هذا الترتيب عن قوائم أخرى

لأننا كتبنا المعايير والأوزان في مكان تراه. معظم القوائم لا تشرح ترتيبها أبدا، وحين لا يوجد شرح، فأي ترتيب ممكن.

إن كنت تفضّل ألا تصرف أسبوعا في توصيل هذه الأدوات بمشروع، فهذا العمل جزء من خدمة تطوير التطبيقات والبرمجيات المخصّصة