أفضل ذكاء اصطناعي للدردشة
في المحادثة المفتوحة يتقدم اليوم Claude Fable 5 بـ1506 نقطة، الأول من بين 389 نموذجا على لوحة Arena النصية، بينما يقف Opus 5 خلفه باثنتي عشرة نقطة وبنصف السعر. لكن هذا الجدول يرتّب النماذج لا التطبيقات، وهذا القرار وحده يفسّر غياب صف لشات جي بي تي فيه.
- تسعة نماذج، كلها مرتّبة
- الأوزان على الصفحة
- ترتيب للنماذج لا للتطبيقات
آخر تحقق: هذه صفحة مرجعية. نعيد التحقق منها من مصادر الشركة المطوّرة ونحدّثها عند صدور أي إصدار جديد. ما الذي تغيّر
ترتيب اليوم، من لوحة تنشر رقما وتاريخا وعدد أصوات
لا مرشح تحت هذا الجدول بلا ترتيب. والخانة الفارغة تعني أن الشركة لم تنشر شيئا، لا أن النموذج نال صفرا.
| الترتيب | الأداة | النتيجة | لوحة النص العامة 45 | النقاط لكل دولار 20 | نافذة السياق 15 | نضج الأدوات 10 | الوصول من إيران 10 |
|---|---|---|---|---|---|---|---|
| 1 | كلود فيبل 5 الخيار الحالي | 78.6 | 1,506 المصدر | 30.1 المصدر | 1 مليون رمز المصدر | 4/4 يحمل البنية نفسها التي لاوبوس 5 ويتوفر على المسارات الخمسة: واجهة انثروبيك، وبدروك، ومنصة كلود على AWS، وجوجل كلاود، ومايكروسوفت فاوندري. | محجوب / لا طريق يعمل إيران ليست في قائمة انثروبيك للدول المدعومة. قرئ من صفحة انثروبيك نفسها لا بقياس شبكي. |
| 2 | كلود أوبس 5 | 71.1 | 1,494 المصدر | 59.8 المصدر | 1 مليون رمز المصدر | 4/4 واجهة برمجية، تطبيق رسمي، أداة سطر أوامر، SDK للوكلاء، تنفيذ دفعي، وإصدار على ثلاث سحابات كبرى | محجوب / لا طريق يعمل إيران غير موجودة في أي من قائمتي الدول المدعومة لدى أنثروبيك، لا قائمة الواجهة البرمجية ولا قائمة claude.ai. قرأنا ذلك على صفحة أنثروبيك نفسها ولم نقِسه: لم يُجرَ اختبار شبكة مستقل بعد، وعندما يُجرى سيُكتب هنا. |
| 3 | GPT-5.6 Sol | 54.2 | 1,481 المصدر | 49.4 المصدر | 1 مليون رمز المصدر | 4/4 يبلغ الدرجة الرابعة اعتمادا على توثيق الصانع نفسه: واجهة برمجية وحزم تطوير وسطر أوامر رسمي، وإضافة محرر Codex، وحزمة تطوير للوكلاء، ومسار دفعات، ودليل رسمي للتشغيل على Amazon Bedrock يسمي المعرف openai.gpt-5.6-sol. وهذا هو العمود الوحيد الذي اكتمل لهذا النموذج دون أن يُفتح openai.com. | غير موثّق |
| 4 | كوين 3.8 ماكس | 49.4 | 1,490 المصدر | 248.3 المصدر | 1 مليون رمز المصدر | غير موثّق | غير موثّق |
| 5 | كيمي K3 ماكس | 48.2 | 1,487 المصدر | 99.1 المصدر | 1 مليون رمز المصدر | 1/4 واجهة برمجية متوافقة مع OpenAI مع عميل رسمي واحد. ووثائق المنصة لا تدرج اداة سطر اوامر رسمية ولا اضافة محرر، فلا نمنحه اكثر من ذلك. | غير موثّق |
| 6 | جيميني 3.1 برو | 42.7 | 1,486 المصدر | 123.8 المصدر | غير موثّق | غير موثّق | محجوب / لا طريق يعمل تسرد صفحة المناطق المتاحة لواجهة Gemini الدول التي تعمل فيها الواجهة، وإيران ليست في تلك القائمة. قرأنا ذلك هناك ولم نقِسه: لم يُجرَ اختبار مستقل بعد. |
| 7 | GLM-5.2 ماكس | 37.0 | 1,470 المصدر | 334.1 المصدر | 1 مليون رمز المصدر | 1/4 واجهة برمجية موثقة مع عميل رسمي واحد. ولا تدرج الوثائق اداة سطر اوامر رسمية ولا اضافة محرر. | غير موثّق |
| 8 | ديب سيك V4 فلاش | 33.6 | 1,435 المصدر | 5,125.0 المصدر | 1 مليون رمز المصدر | 1/4 واجهة برمجية موثقة مع عميل رسمي واحد. ولا تدرج ادوات وكلاء رسمية ولا اضافة محرر. | غير موثّق |
| 9 | Grok 4.5 | 29.1 | 1,469 المصدر | 244.8 المصدر | 500 ألف رمز المصدر | 3/4 واجهة متوافقة مع OpenAI، وحزمتا تطوير بايثون وجافاسكربت، ووكيل سطر أوامر رسمي اسمه Grok Build. ولا يبلغ الدرجة الرابعة: لا إضافة محرر رسمية، ومسار الدفعات يرفض هذا النموذج بالذات. | غير موثّق |
الخلية الفارغة تعني أننا لم نتمكن من التحقق من الرقم، لا أن الأداة حصلت على صفر.
كيف يُحسب هذا الترتيب
كل معيار أدناه له وزن ومصدر. غيّر وزنا فيُعاد حساب الجدول كله. لا يوجد ترتيب موضوع باليد في أي مكان من هذا المرجع.
| المعيار | الوزن | الدليل |
|---|---|---|
| لوحة النص العامة | 45 | Arena (Text)تفضيل البشر في محادثة مفتوحة. وهو أقرب ما يوجد إلى مقياس صحيح للدردشة، ولذلك حمل الوزن الأكبر |
| النقاط لكل دولار | 20 | محسوب من رقمين أعلاهإن كنت تبني دردشة على واجهة برمجية، فضعف السعر مقابل واحد بالمئة من النقاط صفقة سيئة. وإن كنت تشتري اشتراك تطبيق فهذا العمود لا يمسّك |
| نافذة السياق | 15 | مواصفة معلنة من الشركةالمحادثة الطويلة تفقد ذاكرتها أولا ثم تصير مكلفة ثانيا، حالما تمتلئ النافذة |
| نضج الأدوات | 10 | مقياس مُعرَّف، مع سبب مكتوب لكل تقييمالنموذج بلا تطبيق رسمي ولا حزمة تطوير ولا مسار سحابي يتأخر في العمل اليومي خلف نموذج أضعف منه قليلا |
| الوصول من إيران | 10 | عمود الوصول عندنا، بطريقته المعلنةعشرة من مئة، لأن لهذا العمود صفحته الخاصة. واليوم ثلاثة صفوف فقط من تسعة تحمل فيه دليلا |
لماذا يتقدم Fable 5، ولماذا في ذلك خلاف
رقم واحد وشرط واحد. الرقم: Fable 5 أول من بين 389 نموذجا على لوحة Arena النصية بـ1506، فيأخذ العمود ذا الخمسة والأربعين وزنا كاملا. والشرط: النموذج نفسه يخسر عمود النقاط لكل دولار كليا. فمخرجاته بخمسين دولارا لكل مليون رمز، أغلى صف في الجدول، فتصير نسبته 30.1 وهي قاع الجدول.
وOpus 5 أدنى باثنتي عشرة نقطة وبنصف السعر. وعلى لوحة تتسع فئتها العليا كلها لخمسين نقطة تقريبا، فاثنتا عشرة ليست كثيرا. فالجواب الحقيقي ينقسم بحسب السؤال: إن كنت تبني دردشة على واجهة برمجية وتدفع فاتورة شهرية فـOpus 5؛ وإن كنت تشتري اشتراك تطبيق فعمود السعر لا ينطبق عليك ورأس الجدول هو ما تريد.
وأمر واحد ضد متصدّرنا نفسه لا يقيسه أي عمود هنا: Fable 5 هو النموذج الوحيد الذي تصفه أنثروبيك في جدولها بأنه أبطأ، وتفكيره التكيفي يعمل دائما فلا رافعة لخفضه. وفي المحادثة يُحسّ التأخير. جدولنا لا يراه وأنت ستراه خلال عشر دقائق من الاستعمال.
هذا الجدول يرتّب النماذج لا التطبيقات
قرار مقصود وله ثمن، فلنقله صراحة. الأعمدة الخمسة كلها أرقام تُنشر عن نموذج: نقطة لوحة، سعر لكل مليون رمز، نافذة سياق. ولا شركة تنشر أيا من الثلاثة عن تطبيق دردشتها. ولو رتّبنا التطبيقات لفرغت ثلاثة أعمدة من خمسة في أكثر الصفوف، وذلك يكفّ عن كونه جدولا.
والسبب الثاني أهم: النموذج الواحد يعمل تحت تطبيقات عدة، والتطبيق يبدّل النموذج تحته دون أن يخبرك. فـOpus 5 يقف تحت تطبيق كلود والواجهة البرمجية وClaude Code في وقت واحد. واجعل «كلود» صفا فتعُدّ الرقم نفسه مرة أخرى في جدول البرمجة. وهو السبب ذاته الذي جعل فئة الفيديو ترتّب الإصدارات لا الأدوات.
وقد اتخذنا القرار المعاكس في فئة الدراسة وكان صائبا هناك، لأن غوغل تنشر حدود الدفتر نفسه أرقاما: خمسون مصدرا، خمسمئة ألف كلمة. أما تطبيق الدردشة فلا شركة تنشر عنه ما يشبه ذلك. والثمن أن كلود وجيميني وشات جي بي تي، كتطبيقات، بلا صف هنا، وصفحاتها هي موضع تلك الأسئلة.
لماذا لا صف لشات جي بي تي، وماذا لدينا من أوبن إيه آي
الجواب القصير أن شات جي بي تي منتج وهذا الجدول يرتّب النماذج، فما كان ليصير صفا أصلا. لكن الجواب الأطول يقع علينا لا لنا وهو الأهم: حتى لو أردنا لما استطعنا وصفه. كل مسار على openai.com يعيد 403 لهذا الخادم، أعدنا اختباره في 12 أغسطس 2026، بينما ملف robots.txt للنطاق نفسه لا يمنع الزحف.
غير أن بابا واحدا مفتوح لم نستعمله حتى اليوم: developers.openai.com يستجيب كاملا. وGPT-5.6 Sol مدرج هناك بخمسة دولارات للدخل وثلاثين للخرج، ونافذة 1.05 مليون رمز، وسقف خرج 128 ألف رمز، وتاريخ قطع معرفة 16 فبراير 2026. وصفوفه في Arena موجودة كذلك. فهو اليوم الصف الثالث في هذا الجدول عينه.
والخلاصة جملة واحدة: النموذج يمكن ترتيبه والتطبيق لا يمكن وصفه. وما لا نستطيع قوله لك بعد هو أي نموذج يعمل تحت شات جي بي تي اليوم، وكم تكلّف خططه، وهل يُفتح من إيران. والثلاثة كلها على النطاق الذي لا يجيب. صفحة أوبن إيه آي تكتب هذا الحد كاملا.
ما علّمتنا إياه قراءة اللوحة كما ينبغي
صفّان سجّلناهما «غير موثّقين» كانا على اللوحة طوال الوقت. GLM-5.2 Max ثالث وثلاثون بـ1470، وDeepSeek V4 Flash ثالث وثمانون بـ1435. قرأت جولة سابقة أعلى الصفحة فحسب؛ أما هذه فقرأت ملف JSON الذي ترسله الصفحة نفسها. فالمرشحان اللذان تعذّر ترتيبهما في هذه الفئة صارا مرتّبين، وتحرّك جدول البرمجة أيضا. وتلك فجوتنا نحن لا فجوة الشركات.
والثاني يخصّ اسم الصف. سبق لهذا المرجع أن قال إن صف Arena يسمّي تهيئة خدمة لا نموذجا. ومع أوبن إيه آي يمضي خطوة أبعد: صف تطوير الويب مكتوب حرفيا gpt-5.6-sol-xhigh (codex-harness). أي أن تلك النقطة للنموذج داخل وكيل البرمجة الخاص بأوبن إيه آي لا للنموذج المجرّد. السعر والنافذة يلتصقان بالنموذج الأساس، والنقطة تلتصق بما جُرّب فعلا.
والثالث فخّ لم نقع فيه. على اللوحة ذاتها صف اسمه deepseek-v4-pro بـ1458 يجلس فوق Flash. وهو نموذج آخر من العائلة نفسها لا إعداد، فلم نستعر رقمه. ولو فعلنا لصعد DeepSeek مرتبتين ولما انتبه أحد.
حيث تبالغ طريقتنا نحن
الصفوف التسعة كلها تتسع لـ71 نقطة إيلو، من 1506 إلى 1435. والتطبيع بالحد الأدنى والأقصى يمدّ هذه الـ71 إلى مدى من 78.6 إلى 29.1. أي أن عمود النقاط يُظهر المسافة أكبر مما هي، وآخر صف ليس ضعيفا: هو آخر جدول من نماذج الصف الأول.
ومثال أدقّ، لأنه فاجأنا نحن أيضا. يفوز GPT-5.6 Sol بعمود النافذة بـ1,050,000 رمز، ويحمل Kimi K3 Max عدد 1,048,576. الفارق 1,424 رمزا، نحو عُشر بالمئة، ولا يغيّر شيئا عمليا. وكلاهما يأخذ العمود كاملا تقريبا وهذا صحيح؛ لكن أضف غدا نموذجا بنافذة مليونين فيخسران العمود معا دون أن يتغير فيهما شيء.
متى لا تأخذ خيارنا الأول
- إن أردت تطبيقا لا نموذجا فهذا الجدول ليس جوابك. صفحتا كلود وجيميني تجيبان ذلك السؤال من المستوى الصحيح.
- إن كان عملك برمجة فالترتيب هنا يختلف عن جدول البرمجة، ومعاييره هناك مختلفة تماما.
- إن كان حملك كبير الحجم قصير الإجابات فتجاوز العمود الأول واقرأ النقاط لكل دولار، حيث يتقدم DeepSeek بفارق واسع.
- إن كنت تصل إلى الدردشة من إيران بلا طريق رسمي فترتيب النماذج آخر ما يمسّ مشكلتك.
حيث تُقصّر
- المعيار الأول لوحة تفضيل بشري: تقيس أي الإجابات يفضّلها الناس، لا أيها أصحّ.
- الجدول كله يتسع لـ71 نقطة إيلو، والتطبيع يمدّها إلى ما بين 78.6 و29.1، فعمود النقاط يضخّم المسافة الحقيقية.
- ستة صفوف من تسعة بلا دليل في عمود إيران، لأن شركاتها لا تنشر أي قائمة دول. وأنثروبيك وغوغل وحدهما تفعلان.
- شات جي بي تي وتطبيق كلود وتطبيق جيميني بلا صف هنا، لأن الجدول يرتّب النماذج لا التطبيقات.
- Qwen3.8 Max وGemini 3.1 Pro لكل منهما عمودان فارغان. وتلك فجوة في ما تنشره الشركة لا ضعف في النموذج، لكنها تخفض نقاطهما فعلا.
- DeepSeek بمخرجات 0.28 دولار يمدّ عمود النقاط لكل دولار حتى يصير الفارق الرباعي بين Opus 5 وQwen أقل من نقطة واحدة فيه.
رأينا
إن كنت تبني دردشة على واجهة برمجية وعليك اختيار واحد فـOpus 5: أدنى باثنتي عشرة نقطة من Fable 5 وبنصف سعره. وإن كنت تشتري اشتراك تطبيق فعمود السعر هنا لا ينطبق عليك ورأس الجدول هو ما تقرأ. وإن كنت تسأل أيها سيجيب عملاءك، فجوابنا الصادق: لا أحد منها، لأن تلك مهمة أخرى.
أسئلة يطرحها الناس فعلا
ما أفضل ذكاء اصطناعي للدردشة
على لوحة Arena النصية اليوم يتقدم Claude Fable 5 بـ1506. لكن Opus 5 عند 1494 بنصف السعر، وعلى لوحة تتسع فئتها العليا لخمسين نقطة يصعب الإحساس بهذه الاثنتي عشرة عمليا.
لماذا شات جي بي تي غائب عن هذا الجدول
لأن الجدول يرتّب النماذج وشات جي بي تي منتج. ونموذجه حاضر: GPT-5.6 Sol هو الصف الثالث. أما التطبيق نفسه فلا نستطيع وصفه، لأن كل مسار على openai.com يعيد 403 لخادمنا.
لماذا يختلف هذا الترتيب عن جدول البرمجة
لأن المعايير تختلف. هناك تحمل لوحة تطوير الويب أربعين من مئة، وهنا تحمل لوحة النص العامة خمسة وأربعين. والنموذج الذي يكتب كودا أفضل لا يعطي بالضرورة إجابات يفضّلها الناس، وOpus 5 وFable 5 يتبادلان الموقعين بين هذين الجدولين بالذات.
أي منها يعمل من إيران
لا طريق رسمي لأي منها. أنثروبيك وغوغل تنشران قوائم دول وإيران ليست في أي منهما؛ وبقية الشركات لا تنشر قائمة أصلا، ولذلك بقيت تلك الخانات فارغة. ولا نبيع حسابات ولا نوصي بالتحايل.
النموذج الأول في هذا الجدول يجيبك أنت، لا عملاءك. وللمهمة الثانية نرسل إنسانا لا روبوتا، وهذا بالضبط ما هي خدمة المساعد الافتراضي لدينا