دسته

بهترین هوش مصنوعی برای چت

برای گفت و گوی عمومی کلود فیبل ۵ با ۱۵۰۷ هنوز بالاترین امتیاز لیدربورد متن Arena را دارد، و نکته امروز همین است: انتروپیک همان مدل را ۱ سپتامبر بازنشسته کرد و جانشینش با سه امتیاز کمتر درست زیرش نشسته. جدول مدل ها را رتبه می دهد و نه اپ ها را، و همین توضیح می دهد چرا چت جی پی تی ردیفی ندارد.

  • دوازده مدل، همه رتبه دار
  • وزن ها روی صفحه
  • مدل رتبه می گیرد، نه اپ

آخرین بررسی: این صفحه یک مرجع است. با هر نسخه تازه، منابع سازنده دوباره خوانده و صفحه بهروز می شود. چه چیزی عوض شد

امتیاز هر ابزار از کجا می آید

حلقه زیر، همان وزن هایی است که در سرستون های جدول پایین نوشته شده.

۱۰۰وزن ها
  • لیدربورد متن عمومی ۴۵
  • امتیاز به ازای دلار ۲۰
  • پنجره متن ۱۵
  • بلوغ ابزار ۱۰
  • دسترسی از ایران ۱۰

وزن ها را ما انتخاب کرده ایم و همین تنها جای سلیقه این جدول است. اگر وزن دیگری درست تر می دانید، ترتیب هم عوض می شود.

رتبه بندی امروز، از روی لیدربوردی که عدد و تاریخ و تعداد رای می دهد

هیچ نامزدی بی رتبه زیر این جدول نمانده. ستون خالی یعنی سازنده چیزی منتشر نکرده، نه اینکه صفر گرفته.

بهترین هوش مصنوعی برای چت
رتبه ابزار امتیاز لیدربورد متن عمومی ۴۵ امتیاز به ازای دلار ۲۰ پنجره متن ۱۵ بلوغ ابزار ۱۰ دسترسی از ایران ۱۰
۱ کلود فیبل ۵ انتخاب فعلی سازنده جایگزینش کرده با کلود فیبل ۵.۱ ۷۸.۶ ۱,۵۰۷ منبع: arena.ai ۳۰.۱ منبع: arena.ai ۱ میلیون توکن منبع: platform.claude.com ۴/۴ مسدود / راه کارآمدی ندارد
۲ کلود فیبل ۵.۱ ۷۶.۷ ۱,۵۰۴ منبع: arena.ai ۳۰.۱ منبع: arena.ai ۱ میلیون توکن منبع: platform.claude.com ۴/۴ مسدود / راه کارآمدی ندارد
۳ کلود اپوس ۵ ۷۰.۱ ۱,۴۹۳ منبع: arena.ai ۵۹.۷ منبع: arena.ai ۱ میلیون توکن منبع: platform.claude.com ۴/۴ مسدود / راه کارآمدی ندارد
۴ جی پی تی ۵.۶ سول ۶۵.۲ ۱,۴۸۳ منبع: arena.ai ۷۴.۲ منبع: arena.ai ۱ میلیون توکن منبع: developers.openai.com ۴/۴ مسدود / راه کارآمدی ندارد
۵ میوز اسپارک ۱.۲ ۶۲.۸ ۱,۴۹۹ منبع: arena.ai ۳۵۲.۷ منبع: arena.ai ۱ میلیون توکن منبع: developer.meta.com ۲/۴ تایید نشده
۶ جمینای ۳.۸ فلش ۶۰.۱ ۱,۴۹۴ منبع: arena.ai ۳۹۸.۴ منبع: arena.ai تایید نشده ۳/۴ مسدود / راه کارآمدی ندارد
۷ کیمی کی۳ مکس ۴۹.۵ ۱,۴۸۹ منبع: arena.ai ۹۹.۳ منبع: arena.ai ۱ میلیون توکن منبع: platform.kimi.ai ۱/۴ تایید نشده
۸ قوان ۳.۸ مکس ۴۵.۱ ۱,۴۸۰ منبع: arena.ai ۲۴۶.۷ منبع: arena.ai ۱ میلیون توکن منبع: www.alibabacloud.com تایید نشده تایید نشده
۹ جمینای ۳.۱ پرو ۴۳.۷ ۱,۴۸۷ منبع: arena.ai ۱۲۳.۹ منبع: arena.ai تایید نشده تایید نشده مسدود / راه کارآمدی ندارد
۱۰ جیالام ۵.۲ مکس ۴۱.۶ ۱,۴۷۲ منبع: arena.ai ۳۳۴.۵ منبع: arena.ai ۱ میلیون توکن منبع: docs.z.ai ۱/۴ تایید نشده
۱۱ دیپ سیک وی۴ فلش ۳۳.۶ ۱,۴۳۸ منبع: arena.ai ۱,۰۸۹.۴ منبع: arena.ai ۱ میلیون توکن منبع: api-docs.deepseek.com ۱/۴ تایید نشده
۱۲ گراک ۴.۵ ۳۲.۲ ۱,۴۷۱ منبع: arena.ai ۲۴۵.۲ منبع: arena.ai ۵۰۰ هزار توکن منبع: docs.x.ai ۳/۴ تایید نشده

سلول خالی یعنی آن عدد را نتوانسته ایم تایید کنیم، نه اینکه ابزار صفر گرفته است.

پشت هر عدد

هر نمره داوری این جدول یک دلیل نوشته شده دارد و ستون ایران می گوید چطور بررسی شده. آن دو اینجا بازند. رد اندازه گیری هر عدد، یعنی اینکه از کدام ردیف کدام لیدربورد و با چند رای آمده، زیر همان مدل باز می شود.

۱ کلود فیبل ۵

بلوغ ابزار ۴/۴ همان زیرساخت اپوس ۵ را دارد و روی هر پنج مسیر عرضه شده: API خود انتروپیک، بدراک، کلود پلتفرم روی AWS، گوگل کلاد و مایکروسافت فاندری.

دسترسی از ایران مسدود / راه کارآمدی ندارد ایران در فهرست کشورهای پشتیبانی شده انتروپیک نیست. از صفحه خود انتروپیک خوانده شده، نه از تست شبکه.

رد اندازه گیری (۲ مورد)

لیدربورد متن عمومی ۱,۵۰۷ ردیف claude-fable-5، رتبه ۱ در لیدربورد متن Arena، به روزرسانی ۲ سپتامبر ۲۰۲۶ با ۷۹۹۹۰۲۰ رای

امتیاز به ازای دلار ۳۰.۱ امتیاز Arena (Text) تقسیم بر قیمت هر یک میلیون توکن خروجی

۲ کلود فیبل ۵.۱

بلوغ ابزار ۴/۴ روی هر پنج مسیر عرضه شده و جدول خود انتروپیک برای هر پنج تا شناسه مدل چاپ کرده. در همان جدول، ستون Claude Platform on AWS برای اپوس ۵ خط تیره است و برای این مدل شناسه دارد.

دسترسی از ایران مسدود / راه کارآمدی ندارد ایران در فهرست کشورهای پشتیبانی شده انتروپیک نیست. از صفحه خود انتروپیک خوانده شده، نه از تست شبکه. برای این نسخه هم هیچ چیز عوض نشده.

رد اندازه گیری (۲ مورد)

لیدربورد متن عمومی ۱,۵۰۴ ردیف claude-fable-5.1-max، رتبه ۳ در لیدربورد متن Arena، به روزرسانی ۲ سپتامبر ۲۰۲۶ با ۷۹۹۹۰۲۰ رای

امتیاز به ازای دلار ۳۰.۱ امتیاز Arena (Text) تقسیم بر قیمت هر یک میلیون توکن خروجی

۳ کلود اپوس ۵

بلوغ ابزار ۴/۴ API، اپ رسمی، ابزار خط فرمان، SDK عامل، اجرای دسته ای، و عرضه روی سه ابر بزرگ

دسترسی از ایران مسدود / راه کارآمدی ندارد ایران در هیچ یک از دو فهرست کشورهای پشتیبانی شده انتروپیک (API و claude.ai) نیست. این را از صفحه خود انتروپیک خوانده ایم و نه از تست شبکه؛ اندازه گیری مستقل شبکه ای هنوز انجام نشده و وقتی انجام شد همین جا نوشته می شود.

رد اندازه گیری (۲ مورد)

لیدربورد متن عمومی ۱,۴۹۳ ردیف claude-opus-5-high، رتبه ۹ در لیدربورد متن Arena، به روزرسانی ۲ سپتامبر ۲۰۲۶ با ۷۹۹۹۰۲۰ رای

امتیاز به ازای دلار ۵۹.۷ امتیاز Arena (Text) تقسیم بر قیمت هر یک میلیون توکن خروجی

۴ جی پی تی ۵.۶ سول

بلوغ ابزار ۴/۴ پله چهارم را از روی مستندات خود سازنده می گیرد: API و اس دی کی و خط فرمان رسمی، افزونه ویرایشگر کدکس، اس دی کی عامل، مسیر اجرای دسته ای، و راهنمای رسمی عرضه روی آمازون بدراک که شناسه openai.gpt-5.6-sol را نام می برد. این تنها ستونی است که برای این مدل بدون باز شدن openai.com هم کامل شد.

دسترسی از ایران مسدود / راه کارآمدی ندارد این ستون تا امروز خالی بود و حالا نیست. فهرست کشورهای پشتیبانی شده روی openai.com است و آن دامنه هنوز ۴۰۳ می دهد، ولی همان فهرست روی developers.openai.com هم هست و آنجا باز است. حدود ۱۹۵ کشور و قلمرو نام برده شده و ایران در آنها نیست. صفحه خودش می گوید دسترسی از بیرون این فهرست می تواند به مسدود شدن حساب برسد. از صفحه سازنده خوانده شده و نه از تست شبکه.

رد اندازه گیری (۲ مورد)

لیدربورد متن عمومی ۱,۴۸۳ ردیف gpt-5.6-sol-xhigh، رتبه ۱۷ در لیدربورد متن Arena، به روزرسانی ۲ سپتامبر ۲۰۲۶ با ۷۹۹۹۰۲۰ رای

امتیاز به ازای دلار ۷۴.۲ امتیاز Arena (Text) تقسیم بر قیمت هر یک میلیون توکن خروجی

۵ میوز اسپارک ۱.۲

بلوغ ابزار ۲/۴ همان مسیرهای ۱.۳: Meta Model API و OpenRouter، بدون ابزار خط فرمان رسمی و بدون افزونه ویرایشگر در مستندات خود متا.

رد اندازه گیری (۲ مورد)

لیدربورد متن عمومی ۱,۴۹۹ ردیف muse-spark-1.2 (xHigh)، رتبه ۵ در لیدربورد متن Arena، به روزرسانی ۲ سپتامبر ۲۰۲۶ با ۷۹۹۹۰۲۰ رای

امتیاز به ازای دلار ۳۵۲.۷ امتیاز Arena (Text) تقسیم بر قیمت هر یک میلیون توکن خروجی

۶ جمینای ۳.۸ فلش

بلوغ ابزار ۳/۴ API و اس دی کی رسمی و استودیو وب و مسیر ورتکس روی ابر گوگل. پله چهارم را نمی دهیم چون گوگل برای این خانواده ابزار خط فرمان کدنویسی رسمی جدا فهرست نمی کند، بر خلاف انتروپیک و اوپن ای آی.

دسترسی از ایران مسدود / راه کارآمدی ندارد صفحه مناطق در دسترس Gemini API حدود ۱۹۵ کشور و قلمرو را نام می برد و ایران در آنها نیست. از صفحه خود گوگل خوانده شده و نه از تست شبکه.

رد اندازه گیری (۲ مورد)

لیدربورد متن عمومی ۱,۴۹۴ ردیف gemini-3.8-flash-high، رتبه ۸ در لیدربورد متن Arena، به روزرسانی ۲ سپتامبر ۲۰۲۶ با ۷۹۹۹۰۲۰ رای

امتیاز به ازای دلار ۳۹۸.۴ امتیاز Arena (Text) تقسیم بر قیمت هر یک میلیون توکن خروجی

۷ کیمی کی۳ مکس

بلوغ ابزار ۱/۴ API سازگار با اوپنایآی به اضافه یک کلاینت رسمی. مستندات پلتفرم ابزار خط فرمان یا افزونه ویرایشگر رسمی فهرست نمی کند، پس بالاتر از این نمره نمی دهیم.

رد اندازه گیری (۲ مورد)

لیدربورد متن عمومی ۱,۴۸۹ ردیف kimi-k3-max، رتبه ۱۲ در لیدربورد متن Arena، به روزرسانی ۲ سپتامبر ۲۰۲۶ با ۷۹۹۹۰۲۰ رای

امتیاز به ازای دلار ۹۹.۳ امتیاز Arena (Text) تقسیم بر قیمت هر یک میلیون توکن خروجی

۸ قوان ۳.۸ مکس

رد اندازه گیری (۲ مورد)

لیدربورد متن عمومی ۱,۴۸۰ ردیف qwen3.8-max، رتبه ۲۲ در لیدربورد متن Arena، به روزرسانی ۲ سپتامبر ۲۰۲۶ با ۷۹۹۹۰۲۰ رای

امتیاز به ازای دلار ۲۴۶.۷ امتیاز Arena (Text) تقسیم بر قیمت هر یک میلیون توکن خروجی

۹ جمینای ۳.۱ پرو

دسترسی از ایران مسدود / راه کارآمدی ندارد صفحه مناطق در دسترس Gemini API فهرست کشورهایی را می دهد که این واجهه در آنها کار می کند و ایران در آن فهرست نیست. این را از همان صفحه خوانده ایم و نه از تست شبکه؛ اندازه گیری مستقل هنوز انجام نشده.

رد اندازه گیری (۲ مورد)

لیدربورد متن عمومی ۱,۴۸۷ ردیف gemini-3.1-pro-preview، رتبه ۱۵ در لیدربورد متن Arena، به روزرسانی ۲ سپتامبر ۲۰۲۶ با ۷۹۹۹۰۲۰ رای

امتیاز به ازای دلار ۱۲۳.۹ امتیاز Arena (Text) تقسیم بر قیمت هر یک میلیون توکن خروجی

۱۰ جیالام ۵.۲ مکس

بلوغ ابزار ۱/۴ API و مستندات کامل به اضافه یک کلاینت رسمی. ابزار خط فرمان یا افزونه ویرایشگر رسمی در مستندات فهرست نشده.

رد اندازه گیری (۲ مورد)

لیدربورد متن عمومی ۱,۴۷۲ ردیف glm-5.2-max، رتبه ۳۷ در لیدربورد متن Arena، به روزرسانی ۲ سپتامبر ۲۰۲۶ با ۷۹۹۹۰۲۰ رای

امتیاز به ازای دلار ۳۳۴.۵ امتیاز Arena (Text) تقسیم بر قیمت هر یک میلیون توکن خروجی

۱۱ دیپ سیک وی۴ فلش

بلوغ ابزار ۱/۴ API مستندشده به اضافه یک کلاینت رسمی. ابزار عاملی یا افزونه ویرایشگر رسمی فهرست نشده.

رد اندازه گیری (۲ مورد)

لیدربورد متن عمومی ۱,۴۳۸ ردیف deepseek-v4-flash-high-preview، رتبه ۸۵ در لیدربورد متن Arena، به روزرسانی ۲ سپتامبر ۲۰۲۶ با ۷۹۹۹۰۲۰ رای

امتیاز به ازای دلار ۱,۰۸۹.۴ امتیاز Arena (Text) تقسیم بر قیمت هر یک میلیون توکن خروجی

۱۲ گراک ۴.۵

بلوغ ابزار ۳/۴ API سازگار با اوپن ای آی، اس دی کی پایتون و جاوااسکریپت، و یک عامل خط فرمان رسمی به اسم گراک بیلد. پله چهارم را نمی گیرد چون افزونه ویرایشگر رسمی ندارد و اجرای دسته ای هم همین مدل را قبول نمی کند.

رد اندازه گیری (۲ مورد)

لیدربورد متن عمومی ۱,۴۷۱ ردیف grok-4.5، رتبه ۳۸ در لیدربورد متن Arena، به روزرسانی ۲ سپتامبر ۲۰۲۶ با ۷۹۹۹۰۲۰ رای

امتیاز به ازای دلار ۲۴۵.۲ امتیاز Arena (Text) تقسیم بر قیمت هر یک میلیون توکن خروجی

این رتبه بندی چطور حساب می شود

هر معیار زیر یک وزن دارد و یک منبع. وزن را عوض کنید، کل جدول از نو حساب می شود. هیچ جای این مرجع، جایگاهی دستی گذاشته نشده است.

معیار وزن شاهد
لیدربورد متن عمومی ۴۵ Arena (Text)ترجیح آدم ها در گفت و گوی باز. برای چت نزدیک ترین چیزی است که به معیار درست داریم، و برای همین بیشترین وزن را گرفته
امتیاز به ازای دلار ۲۰ محاسبه شده از دو عدد بالااگر با API چت می سازید، دو برابر قیمت برای یک درصد امتیاز بیشتر انتخاب بدی است. اگر اشتراک اپ می خرید، این ستون به شما ربطی ندارد
پنجره متن ۱۵ مشخصات اعلامی سازندهگفت و گوی طولانی وقتی پنجره پر شود اول حافظه اش را از دست می دهد و بعد گران می شود
بلوغ ابزار ۱۰ مقیاس تعریف شده، با دلیل نوشته برای هر انتسابمدل بدون اپ رسمی و اس دی کی و مسیر ابری، در کار روزمره از مدلی که کمی ضعیف تر است عقب می افتد
دسترسی از ایران ۱۰ ستون دسترسی ما، با روش اعلام شدهده وزن، چون صفحه خودش را دارد. امروز فقط سه ردیف از نه ردیف در این ستون شاهد دارند

چرا فیبل ۵ اول است، و چرا این بار عجیب تر از همیشه است

یک عدد، و یک تناقض. عدد این است که فیبل ۵ در به روزرسانی ۲ سپتامبر لیدربورد متن Arena با ۱۵۰۷ رتبه یک است و کل ستون چهل و پنج وزنی را می برد. تناقض این است که انتروپیک همان مدل را ۱ سپتامبر legacy کرد. یعنی اول این جدول امروز مدلی است که سازنده اش دیگر پیشنهادش نمی کند.

جانشینش هم درست زیرش است. فیبل ۵.۱ با ۱۵۰۴ رتبه دوم است، سه امتیاز پایین تر، با همان قیمت و همان پنجره متن. سه امتیاز روی این بورد چیزی نیست که کسی در گفت و گو حس کند. پس رتبه بندی راست می گوید و توصیه عملی چیز دیگری است، و ما هر دو را نشان می دهیم: زیر نام فیبل ۵ در همین جدول نوشته ایم جانشینش کدام است. بازنشسته شدن یک واقعیت است و نه یک امتیاز، و rubric راهی برای امتیاز دادن به آن ندارد و نباید داشته باشد.

هر دو ستون امتیاز به ازای دلار را کامل می بازند. خروجی هر دو ۵۰ دلار برای هر میلیون توکن است، گران ترین ردیف های جدول، و نسبت امتیاز به قیمتشان ۳۰.۱ می شود که کف جدول است. اپوس ۵ با ۱۴۹۳ چهارده امتیاز پایین تر و نصف قیمت است. پس جواب واقعی به دو سوال مختلف دو جواب مختلف دارد: اگر با API چت می سازید و قبض ماهانه دارید، اپوس ۵؛ اگر اشتراک اپ می خرید، ستون قیمت به شما نمی خورد و بالای جدول همان است که می خواهید، با این تبصره که ۵.۱ را بگیرید و نه ۵.

یک نکته علیه نامزد اول خودمان، که در جدول ستون ندارد: فیبل ۵ تنها مدلی است که خود انتروپیک در جدولش «کندتر» علامت زده و تفکر تطبیقی اش همیشه روشن است، یعنی اهرمی برای خاموش کردنش نیست. در گفت و گو، تاخیر حس می شود. جدول ما این را نمی سنجد و شما در ده دقیقه اول کار با آن متوجهش می شوید.

این جدول مدل را رتبه می دهد و نه اپ را

تصمیم آگاهانه ای است و هزینه دارد، پس بگذارید صریح بگوییم. هر پنج ستون این جدول عددی است که درباره یک مدل منتشر می شود: امتیاز لیدربورد، قیمت هر میلیون توکن، پنجره متن. هیچ سازنده ای این سه را برای اپ چتش منتشر نمی کند. اگر اپ ها را ردیف می کردیم، سه ستون از پنج ستون برای بیشتر ردیف ها خالی می ماند و آن دیگر جدول نبود.

دلیل دوم مهم تر است: یک مدل زیر چند اپ کار می کند و یک اپ مدل زیرش را بی خبر عوض می کند. اپوس ۵ همزمان زیر اپ کلود، API و کلود کد است. اگر «کلود» را یک ردیف بگیریم، همان عدد را در جدول کدنویسی هم دوباره می شماریم. این همان دلیلی است که دسته ویدیو هم نسخه رتبه می دهد و نه ابزار.

در دسته مطالعه تصمیم عکس گرفتیم و آنجا درست بود، چون گوگل محدودیت های خود نوتبوک را با عدد منتشر می کند: پنجاه منبع، پانصد هزار کلمه. برای اپ چت هیچ سازنده ای چنین عددی نمی دهد. هزینه اش این است که کلود، جمینای و چت جی پی تی به عنوان اپ در این جدول ردیف ندارند و باید صفحه خودشان را ببینید.

چرا چت جی پی تی ردیف ندارد، و چه چیزی از اوپن ای آی داریم

جواب کوتاه این است که چت جی پی تی یک محصول است و این جدول مدل رتبه می دهد، پس در هر حال ردیف نمی شد. ولی جواب بلندتر مهم تر است و به ضرر خودمان تمام می شود: حتی اگر می خواستیم هم نمی توانستیم توصیفش کنیم. هر مسیری روی openai.com از این سرور کد ۴۰۳ برمی گرداند، در ۱۲ اوت ۲۰۲۶ دوباره آزمایش شد، و robots.txt همان دامنه خزیدن را منع نکرده است.

ولی یک چیز باز است: developers.openai.com کامل جواب می دهد. جی پی تی ۵.۶ سول آنجا با ۴ دلار ورودی و ۲۰ دلار خروجی، پنجره ۱.۰۵ میلیون توکن، سقف خروجی ۱۲۸ هزار توکن و تاریخ قطع دانش ۱۶ فوریه ۲۰۲۶ فهرست شده. آن قیمت تا ۱۲ اوت ۵ و ۳۰ دلار بود، پس تنها مدل این جدول است که ارزان شده.

و یک چیزی که در همین اجرا اصلاح شد و به ضرر حرف قبلی خودمان تمام می شود. نوشته بودیم فهرست کشورهای پشتیبانی شده اوپن ای آی فقط روی openai.com است و آن دامنه به سرور ما جواب نمی دهد. نصفش درست بود: دامنه هنوز ۴۰۳ می دهد، ولی همان فهرست روی developers.openai.com هم هست و آنجا باز است. حدود ۱۹۵ کشور و قلمرو نام برده شده، ایران در آنها نیست، و خود صفحه می گوید دسترسی از بیرون این فهرست می تواند به مسدود شدن حساب برسد. پس ستون ایران این ردیف از امروز پر است.

ده وزن آن ستون به اضافه افت قیمت، امتیاز جی پی تی ۵.۶ سول را از ۵۴.۲ به ۶۵.۲ رساند. با این حال یک پله پایین آمد و چهارم شد، چون فیبل ۵.۱ بالای سرش وارد جدول شد. این دقیقا همان چیزی است که «امتیاز نسبی» یعنی و دلیل اینکه حساب هر ردیف روی همین صفحه چاپ می شود.

خلاصه اش این جمله است: مدل را می شود رتبه داد، اپ را نمی شود توصیف کرد. چیزی که هنوز نمی توانیم بگوییم این است که امروز زیر چت جی پی تی کدام مدل کار می کند و پلن هایش چقدر است. هر دو روی همان دامنه ای هستند که جواب نمی دهد. صفحه اوپن ای آی همین مرز را کامل تر نوشته.

چیزی که موقع خواندن لیدربورد فهمیدیم

دو ردیف را که خودمان «تایید نشده» ثبت کرده بودیم، لیدربورد از اول داشت. جیالام ۵.۲ مکس با ۱۴۷۲ سی وهفتم است و دیپ سیک وی۴ فلش با ۱۴۳۸ هشتاد وپنجم. اجرای قبلی فقط بالای صفحه را خوانده بود؛ این بار همان JSON ای را خواندیم که خود صفحه می فرستد. پس هر دو نامزدی که در این دسته رتبه نداشتند حالا دارند، و جدول کدنویسی هم جا به جا شد. این کمبود ما بود و نه کمبود سازنده ها.

دومی درباره اسم ردیف هاست. این مرجع قبلا نوشته بود که ردیف Arena یک پیکربندی سرویس دهی را نام می برد و نه یک مدل. برای اوپن ای آی یک پله جلوتر می رود: ردیف توسعه وب عینا نوشته شده gpt-5.6-sol-xhigh (codex-harness). یعنی آن عدد برای مدل داخل عامل کدنویسی خود اوپن ای آی است و نه برای مدل خام. قیمت و پنجره به مدل پایه می چسبند، امتیاز به آن چیزی که واقعا آزمایش شده.

سومی یک دام بود که در آن نیفتادیم. در همان لیدربورد ردیفی به اسم deepseek-v4-pro با ۱۴۵۸ بالاتر از فلش نشسته. آن یک مدل دیگر از همان خانواده است و نه یک تنظیم، پس عددش را قرض نگرفتیم. اگر می گرفتیم، دیپ سیک دو ردیف بالاتر می آمد و هیچ کس هم متوجه نمی شد.

جایی که روش خودمان اغراق می کند

دوازده ردیف این جدول در ۶۹ امتیاز الو جا شده اند، از ۱۵۰۷ تا ۱۴۳۸. نرمال سازی کمینه بیشینه همین ۶۹ امتیاز را به فاصله ۷۸.۶ تا ۳۲.۲ باز می کند. یعنی ستون امتیاز فاصله را بزرگ تر از واقع نشان می دهد و ردیف آخر «ضعیف» نیست، آخرین ردیف یک جدول از مدل های رده بالاست.

سه نامزد تازه امروز وارد این جدول شدند و هیچ کدام از آنها هیچ چیز درباره خودش عوض نکرده بود. فیبل ۵.۱ دوم، میوز اسپارک ۱.۲ از متا پنجم و جمینای ۳.۸ فلش از گوگل ششم. ورودشان قوان ۳.۸ مکس را از چهارم به هشتم برد، در حالی که تنها اتفاق واقعی برای قوان این بود که عددش روی همان لیدربورد از ۱۴۹۰ به ۱۴۸۰ آمد. اگر رتبه دیروز را جایی یادداشت کرده اید، این توضیح تفاوت است.

یک نمونه دقیق تر، چون خودمان هم موقع بررسی جدول جا خوردیم. ستون پنجره متن را جی پی تی ۵.۶ سول با ۱،۰۵۰،۰۰۰ توکن می برد و کیمی کی۳ مکس ۱،۰۴۸،۵۷۶ توکن دارد. اختلاف ۱۴۲۴ توکن است، حدود یک دهم درصد، و در عمل هیچ فرقی نمی کند. هر دو در آن ستون عملا تمام وزن را می گیرند و این درست است؛ ولی اگر روزی یک مدل با پنجره دو میلیونی اضافه شود، هر دوی اینها همین ستون را با هم می بازند بی آنکه چیزی درباره خودشان عوض شده باشد.

چه وقت انتخاب اول ما را نگیرید

  • اگر دنبال اپ هستید و نه مدل، این جدول جواب شما نیست. صفحه های محصول کلود و جمینای همان سوال را از سطح درست جواب می دهند.
  • اگر کارتان کد است، ترتیب اینجا با ترتیب جدول کدنویسی فرق دارد و آنجا معیارها کاملا دیگرند.
  • اگر بار کاری تان حجم بالا و جواب کوتاه است، ستون اول را رها کنید و ستون امتیاز به ازای دلار را بخوانید؛ دیپ سیک آنجا با اختلاف زیاد اول است.
  • اگر از ایران و بدون راه رسمی سراغ چت می روید، ترتیب مدل ها آخرین چیزی است که به مسئله شما ربط دارد.

کجا کم می آورد

  • معیار اصلی یک لیدربورد ترجیح انسانی است: می سنجد جواب کدام مدل را آدم ها بیشتر می پسندند، نه اینکه کدام درست تر است.
  • کل جدول در ۶۹ امتیاز الو جا شده و نرمال سازی این را به فاصله ۷۸.۶ تا ۳۲.۲ باز می کند، پس ستون امتیاز فاصله واقعی را بزرگ نشان می دهد.
  • شش ردیف از دوازده ردیف در ستون ایران شاهد ندارند، چون سازنده شان هیچ فهرست کشوری منتشر نمی کند. فقط انتروپیک و گوگل و اوپن ای آی این کار را می کنند.
  • چت جی پی تی، اپ کلود و اپ جمینای در این جدول ردیف ندارند، چون جدول مدل رتبه می دهد و نه اپ.
  • قوان ۳.۸ مکس و جمینای ۳.۱ پرو هر کدام دو ستون خالی دارند. این کمبود انتشار سازنده است و نه ضعف مدل، ولی امتیازشان را واقعا پایین می آورد.
  • ستون امتیاز به ازای دلار را دیپ سیک با خروجی ۱.۳۲ دلار چنان کشیده که فاصله چهار برابری اپوس ۵ و قوان در آن ستون به کمتر از یک امتیاز تبدیل می شود.
  • اول جدول یک مدل بازنشسته است. رتبه بندی امتیاز را می سنجد و جانشینی را نمی سنجد، و ما آن را به جای امتیاز، به صورت یادداشت زیر نام مدل نشان می دهیم.

نظر ما

اگر با API چت می سازید و یکی را باید بردارید، اپوس ۵: چهارده امتیاز پایین تر از صدر جدول و نصف قیمتش. اگر اشتراک اپ می خرید، ستون قیمت به شما نمی خورد و باید بالای جدول را بخوانید، ولی فیبل ۵.۱ را بگیرید و نه ۵؛ سه امتیاز اختلاف در برابر مدلی که سازنده اش بازنشسته اش کرده، معامله بدی است. و اگر می پرسید کدامشان جواب مشتری شما را می دهد، جواب صادقانه ما این است که هیچ کدام؛ آن یک کار دیگر است.

پرسش هایی که واقعا پرسیده می شود

بهترین هوش مصنوعی برای چت کدام است

در لیدربورد متن Arena کلود فیبل ۵ با ۱۵۰۷ اول است، ولی انتروپیک همان مدل را بازنشسته کرده. جانشینش فیبل ۵.۱ با ۱۵۰۴ دوم است و همان را بگیرید. اگر هزینه مهم است اپوس ۵ با ۱۴۹۳ نصف قیمت هر دوی آنهاست.

چرا چت جی پی تی در این جدول نیست

چون جدول مدل رتبه می دهد و چت جی پی تی یک محصول است. مدلش هست: جی پی تی ۵.۶ سول چهارمین ردیف است. خود اپ را نتوانسته ایم توصیف کنیم، چون هر مسیری روی openai.com به سرور ما ۴۰۳ می دهد. فهرست کشورهای اوپن ای آی اما از این اجرا خوانده شده، روی دامنه توسعه دهندگان.

چرا ترتیب اینجا با جدول کدنویسی فرق دارد

چون معیار فرق دارد. آنجا لیدربورد توسعه وب چهل وزن دارد و اینجا لیدربورد متن عمومی چهل و پنج. مدلی که کد بهتری می نویسد لزوما جوابی نمی دهد که آدم ها بیشتر بپسندند، و اپوس ۵ و فیبل ۵ دقیقا در همین دو جدول جایشان را با هم عوض می کنند.

کدام یک از اینها از ایران کار می کند

هیچ کدام راه رسمی ندارند. انتروپیک و گوگل و از این اجرا اوپن ای آی، هر سه فهرست کشورهایشان را منتشر می کنند و ایران در هیچ کدام نیست؛ بقیه سازنده ها اصلا فهرستی منتشر نمی کنند، پس ستونشان خالی مانده. ما نه اکانت می فروشیم و نه راه دور زدن پیشنهاد می کنیم.

مدل اول این جدول جواب شما را می دهد، نه جواب مشتری شما را. برای دومی ما آدم می فرستیم و نه ربات، و همین است

دستیار مجازی و منشی آنلاین