بهترین هوش مصنوعی برای چت
برای گفت و گوی عمومی امروز کلود فیبل ۵ بالاترین امتیاز را دارد: در لیدربورد متن Arena با ۱۵۰۶ اول از ۳۸۹ مدل است، و اپوس ۵ با ۱۴۹۴ نصف قیمت آن را می گیرد. ولی این جدول مدل ها را رتبه می دهد و نه اپ ها را، و همین یک تصمیم توضیح می دهد که چرا چت جی پی تی ردیفی در آن ندارد.
- نه مدل، همه رتبه دار
- وزن ها روی صفحه
- مدل رتبه می گیرد، نه اپ
آخرین بررسی: این صفحه یک مرجع است. با هر نسخه تازه، منابع سازنده دوباره خوانده و صفحه بهروز می شود. چه چیزی عوض شد
رتبه بندی امروز، از روی لیدربوردی که عدد و تاریخ و تعداد رای می دهد
هیچ نامزدی بی رتبه زیر این جدول نمانده. ستون خالی یعنی سازنده چیزی منتشر نکرده، نه اینکه صفر گرفته.
| رتبه | ابزار | امتیاز | لیدربورد متن عمومی ۴۵ | امتیاز به ازای دلار ۲۰ | پنجره متن ۱۵ | بلوغ ابزار ۱۰ | دسترسی از ایران ۱۰ |
|---|---|---|---|---|---|---|---|
| ۱ | کلود فیبل ۵ انتخاب فعلی | ۷۸.۶ | ۱,۵۰۶ منبع | ۳۰.۱ منبع | ۱ میلیون توکن منبع | ۴/۴ همان زیرساخت اپوس ۵ را دارد و روی هر پنج مسیر عرضه شده: API خود انتروپیک، بدراک، کلود پلتفرم روی AWS، گوگل کلاد و مایکروسافت فاندری. | blocked / none ایران در فهرست کشورهای پشتیبانی شده انتروپیک نیست. از صفحه خود انتروپیک خوانده شده، نه از تست شبکه. |
| ۲ | کلود اپوس ۵ | ۷۱.۱ | ۱,۴۹۴ منبع | ۵۹.۸ منبع | ۱ میلیون توکن منبع | ۴/۴ API، اپ رسمی، ابزار خط فرمان، SDK عامل، اجرای دسته ای، و عرضه روی سه ابر بزرگ | blocked / none ایران در هیچ یک از دو فهرست کشورهای پشتیبانی شده انتروپیک (API و claude.ai) نیست. این را از صفحه خود انتروپیک خوانده ایم و نه از تست شبکه؛ اندازه گیری مستقل شبکه ای هنوز انجام نشده و وقتی انجام شد همین جا نوشته می شود. |
| ۳ | جی پی تی ۵.۶ سول | ۵۴.۲ | ۱,۴۸۱ منبع | ۴۹.۴ منبع | ۱ میلیون توکن منبع | ۴/۴ پله چهارم را از روی مستندات خود سازنده می گیرد: API و اس دی کی و خط فرمان رسمی، افزونه ویرایشگر کدکس، اس دی کی عامل، مسیر اجرای دسته ای، و راهنمای رسمی عرضه روی آمازون بدراک که شناسه openai.gpt-5.6-sol را نام می برد. این تنها ستونی است که برای این مدل بدون باز شدن openai.com هم کامل شد. | تایید نشده |
| ۴ | قوان ۳.۸ مکس | ۴۹.۴ | ۱,۴۹۰ منبع | ۲۴۸.۳ منبع | ۱ میلیون توکن منبع | تایید نشده | تایید نشده |
| ۵ | کیمی کی۳ مکس | ۴۸.۲ | ۱,۴۸۷ منبع | ۹۹.۱ منبع | ۱ میلیون توکن منبع | ۱/۴ API سازگار با اوپنایآی به اضافه یک کلاینت رسمی. مستندات پلتفرم ابزار خط فرمان یا افزونه ویرایشگر رسمی فهرست نمی کند، پس بالاتر از این نمره نمی دهیم. | تایید نشده |
| ۶ | جمینای ۳.۱ پرو | ۴۲.۷ | ۱,۴۸۶ منبع | ۱۲۳.۸ منبع | تایید نشده | تایید نشده | blocked / none صفحه مناطق در دسترس Gemini API فهرست کشورهایی را می دهد که این واجهه در آنها کار می کند و ایران در آن فهرست نیست. این را از همان صفحه خوانده ایم و نه از تست شبکه؛ اندازه گیری مستقل هنوز انجام نشده. |
| ۷ | جیالام ۵.۲ مکس | ۳۷.۰ | ۱,۴۷۰ منبع | ۳۳۴.۱ منبع | ۱ میلیون توکن منبع | ۱/۴ API و مستندات کامل به اضافه یک کلاینت رسمی. ابزار خط فرمان یا افزونه ویرایشگر رسمی در مستندات فهرست نشده. | تایید نشده |
| ۸ | دیپ سیک وی۴ فلش | ۳۳.۶ | ۱,۴۳۵ منبع | ۵,۱۲۵.۰ منبع | ۱ میلیون توکن منبع | ۱/۴ API مستندشده به اضافه یک کلاینت رسمی. ابزار عاملی یا افزونه ویرایشگر رسمی فهرست نشده. | تایید نشده |
| ۹ | گراک ۴.۵ | ۲۹.۱ | ۱,۴۶۹ منبع | ۲۴۴.۸ منبع | ۵۰۰ هزار توکن منبع | ۳/۴ API سازگار با اوپن ای آی، اس دی کی پایتون و جاوااسکریپت، و یک عامل خط فرمان رسمی به اسم گراک بیلد. پله چهارم را نمی گیرد چون افزونه ویرایشگر رسمی ندارد و اجرای دسته ای هم همین مدل را قبول نمی کند. | تایید نشده |
سلول خالی یعنی آن عدد را نتوانسته ایم تایید کنیم، نه اینکه ابزار صفر گرفته است.
این رتبه بندی چطور حساب می شود
هر معیار زیر یک وزن دارد و یک منبع. وزن را عوض کنید، کل جدول از نو حساب می شود. هیچ جای این مرجع، جایگاهی دستی گذاشته نشده است.
| معیار | وزن | شاهد |
|---|---|---|
| لیدربورد متن عمومی | ۴۵ | Arena (Text)ترجیح آدم ها در گفت و گوی باز. برای چت نزدیک ترین چیزی است که به معیار درست داریم، و برای همین بیشترین وزن را گرفته |
| امتیاز به ازای دلار | ۲۰ | محاسبه شده از دو عدد بالااگر با API چت می سازید، دو برابر قیمت برای یک درصد امتیاز بیشتر انتخاب بدی است. اگر اشتراک اپ می خرید، این ستون به شما ربطی ندارد |
| پنجره متن | ۱۵ | مشخصات اعلامی سازندهگفت و گوی طولانی وقتی پنجره پر شود اول حافظه اش را از دست می دهد و بعد گران می شود |
| بلوغ ابزار | ۱۰ | مقیاس تعریف شده، با دلیل نوشته برای هر انتسابمدل بدون اپ رسمی و اس دی کی و مسیر ابری، در کار روزمره از مدلی که کمی ضعیف تر است عقب می افتد |
| دسترسی از ایران | ۱۰ | ستون دسترسی ما، با روش اعلام شدهده وزن، چون صفحه خودش را دارد. امروز فقط سه ردیف از نه ردیف در این ستون شاهد دارند |
چرا فیبل ۵ اول است، و چرا این جای بحث دارد
یک عدد، و یک شرط. عدد این است که فیبل ۵ در لیدربورد متن Arena با ۱۵۰۶ رتبه یک از ۳۸۹ مدل است و کل ستون چهل و پنج وزنی را می برد. شرط این است که همان مدل، ستون امتیاز به ازای دلار را کامل می بازد: خروجی اش ۵۰ دلار برای هر میلیون توکن است، گران ترین ردیف جدول، و نسبت امتیاز به قیمتش ۳۰.۱ می شود که کف جدول است.
اپوس ۵ دوازده امتیاز پایین تر است و نصف قیمت. روی لیدربوردی که کل رده بالایش در حدود پنجاه امتیاز جا شده، دوازده امتیاز فاصله زیادی نیست. پس جواب واقعی به دو سوال مختلف دو جواب مختلف دارد: اگر با API چت می سازید و قبض ماهانه دارید، اپوس ۵؛ اگر اشتراک یک اپ می خرید، ستون قیمت اصلا به شما نمی خورد و بالای جدول همان چیزی است که می خواهید.
یک نکته علیه نامزد اول خودمان، که در جدول ستون ندارد: فیبل ۵ تنها مدلی است که خود انتروپیک در جدولش «کندتر» علامت زده و تفکر تطبیقی اش همیشه روشن است، یعنی اهرمی برای خاموش کردنش نیست. در گفت و گو، تاخیر حس می شود. جدول ما این را نمی سنجد و شما در ده دقیقه اول کار با آن متوجهش می شوید.
این جدول مدل را رتبه می دهد و نه اپ را
تصمیم آگاهانه ای است و هزینه دارد، پس بگذارید صریح بگوییم. هر پنج ستون این جدول عددی است که درباره یک مدل منتشر می شود: امتیاز لیدربورد، قیمت هر میلیون توکن، پنجره متن. هیچ سازنده ای این سه را برای اپ چتش منتشر نمی کند. اگر اپ ها را ردیف می کردیم، سه ستون از پنج ستون برای بیشتر ردیف ها خالی می ماند و آن دیگر جدول نبود.
دلیل دوم مهم تر است: یک مدل زیر چند اپ کار می کند و یک اپ مدل زیرش را بی خبر عوض می کند. اپوس ۵ همزمان زیر اپ کلود، API و کلود کد است. اگر «کلود» را یک ردیف بگیریم، همان عدد را در جدول کدنویسی هم دوباره می شماریم. این همان دلیلی است که دسته ویدیو هم نسخه رتبه می دهد و نه ابزار.
در دسته مطالعه تصمیم عکس گرفتیم و آنجا درست بود، چون گوگل محدودیت های خود نوتبوک را با عدد منتشر می کند: پنجاه منبع، پانصد هزار کلمه. برای اپ چت هیچ سازنده ای چنین عددی نمی دهد. هزینه اش این است که کلود، جمینای و چت جی پی تی به عنوان اپ در این جدول ردیف ندارند و باید صفحه خودشان را ببینید.
چرا چت جی پی تی ردیف ندارد، و چه چیزی از اوپن ای آی داریم
جواب کوتاه این است که چت جی پی تی یک محصول است و این جدول مدل رتبه می دهد، پس در هر حال ردیف نمی شد. ولی جواب بلندتر مهم تر است و به ضرر خودمان تمام می شود: حتی اگر می خواستیم هم نمی توانستیم توصیفش کنیم. هر مسیری روی openai.com از این سرور کد ۴۰۳ برمی گرداند، در ۱۲ اوت ۲۰۲۶ دوباره آزمایش شد، و robots.txt همان دامنه خزیدن را منع نکرده است.
ولی یک چیز باز است و تا امروز از آن استفاده نکرده بودیم: developers.openai.com کامل جواب می دهد. جی پی تی ۵.۶ سول آنجا با ۵ دلار ورودی و ۳۰ دلار خروجی، پنجره ۱.۰۵ میلیون توکن، سقف خروجی ۱۲۸ هزار توکن و تاریخ قطع دانش ۱۶ فوریه ۲۰۲۶ فهرست شده. ردیف Arena اش هم هست. پس امروز سومین ردیف همین جدول است.
خلاصه اش این جمله است: مدل را می شود رتبه داد، اپ را نمی شود توصیف کرد. چیزی که هنوز نمی توانیم به شما بگوییم این است که امروز زیر چت جی پی تی کدام مدل کار می کند، پلن هایش چقدر است، و از ایران باز می شود یا نه. هر سه روی همان دامنه ای هستند که جواب نمی دهد. صفحه اوپن ای آی همین مرز را کامل تر نوشته.
چیزی که موقع خواندن لیدربورد فهمیدیم
دو ردیف را که خودمان «تایید نشده» ثبت کرده بودیم، لیدربورد از اول داشت. جیالام ۵.۲ مکس با ۱۴۷۰ سی وسوم است و دیپ سیک وی۴ فلش با ۱۴۳۵ هشتاد وسوم. اجرای قبلی فقط بالای صفحه را خوانده بود؛ این بار همان JSON ای را خواندیم که خود صفحه می فرستد. پس هر دو نامزدی که در این دسته رتبه نداشتند حالا دارند، و جدول کدنویسی هم جا به جا شد. این کمبود ما بود و نه کمبود سازنده ها.
دومی درباره اسم ردیف هاست. این مرجع قبلا نوشته بود که ردیف Arena یک پیکربندی سرویس دهی را نام می برد و نه یک مدل. برای اوپن ای آی یک پله جلوتر می رود: ردیف توسعه وب عینا نوشته شده gpt-5.6-sol-xhigh (codex-harness). یعنی آن عدد برای مدل داخل عامل کدنویسی خود اوپن ای آی است و نه برای مدل خام. قیمت و پنجره به مدل پایه می چسبند، امتیاز به آن چیزی که واقعا آزمایش شده.
سومی یک دام بود که در آن نیفتادیم. در همان لیدربورد ردیفی به اسم deepseek-v4-pro با ۱۴۵۸ بالاتر از فلش نشسته. آن یک مدل دیگر از همان خانواده است و نه یک تنظیم، پس عددش را قرض نگرفتیم. اگر می گرفتیم، دیپ سیک دو ردیف بالاتر می آمد و هیچ کس هم متوجه نمی شد.
جایی که روش خودمان اغراق می کند
نه ردیف این جدول در ۷۱ امتیاز الو جا شده اند، از ۱۵۰۶ تا ۱۴۳۵. نرمال سازی کمینه بیشینه همین ۷۱ امتیاز را به فاصله ۷۸.۶ تا ۲۹.۱ باز می کند. یعنی ستون امتیاز فاصله را بزرگ تر از واقع نشان می دهد و ردیف آخر «ضعیف» نیست، آخرین ردیف یک جدول از مدل های رده بالاست.
یک نمونه دقیق تر، چون خودمان هم موقع بررسی جدول جا خوردیم. ستون پنجره متن را جی پی تی ۵.۶ سول با ۱،۰۵۰،۰۰۰ توکن می برد و کیمی کی۳ مکس ۱،۰۴۸،۵۷۶ توکن دارد. اختلاف ۱۴۲۴ توکن است، حدود یک دهم درصد، و در عمل هیچ فرقی نمی کند. هر دو در آن ستون عملا تمام وزن را می گیرند و این درست است؛ ولی اگر روزی یک مدل با پنجره دو میلیونی اضافه شود، هر دوی اینها همین ستون را با هم می بازند بی آنکه چیزی درباره خودشان عوض شده باشد.
چه وقت انتخاب اول ما را نگیرید
- اگر دنبال اپ هستید و نه مدل، این جدول جواب شما نیست. صفحه های محصول کلود و جمینای همان سوال را از سطح درست جواب می دهند.
- اگر کارتان کد است، ترتیب اینجا با ترتیب جدول کدنویسی فرق دارد و آنجا معیارها کاملا دیگرند.
- اگر بار کاری تان حجم بالا و جواب کوتاه است، ستون اول را رها کنید و ستون امتیاز به ازای دلار را بخوانید؛ دیپ سیک آنجا با اختلاف زیاد اول است.
- اگر از ایران و بدون راه رسمی سراغ چت می روید، ترتیب مدل ها آخرین چیزی است که به مسئله شما ربط دارد.
کجا کم می آورد
- معیار اصلی یک لیدربورد ترجیح انسانی است: می سنجد جواب کدام مدل را آدم ها بیشتر می پسندند، نه اینکه کدام درست تر است.
- کل جدول در ۷۱ امتیاز الو جا شده و نرمال سازی این را به فاصله ۷۸.۶ تا ۲۹.۱ باز می کند، پس ستون امتیاز فاصله واقعی را بزرگ نشان می دهد.
- شش ردیف از نه ردیف در ستون ایران شاهد ندارند، چون سازنده شان هیچ فهرست کشوری منتشر نمی کند. فقط انتروپیک و گوگل این کار را می کنند.
- چت جی پی تی، اپ کلود و اپ جمینای در این جدول ردیف ندارند، چون جدول مدل رتبه می دهد و نه اپ.
- قوان ۳.۸ مکس و جمینای ۳.۱ پرو هر کدام دو ستون خالی دارند. این کمبود انتشار سازنده است و نه ضعف مدل، ولی امتیازشان را واقعا پایین می آورد.
- ستون امتیاز به ازای دلار را دیپ سیک با خروجی ۰.۲۸ دلار چنان کشیده که فاصله چهار برابری اپوس ۵ و قوان در آن ستون به کمتر از یک امتیاز تبدیل می شود.
نظر ما
اگر با API چت می سازید و یکی را باید بردارید، اپوس ۵: دوازده امتیاز پایین تر از فیبل ۵ و نصف قیمتش. اگر اشتراک اپ می خرید، ستون قیمت این جدول به شما نمی خورد و باید بالای جدول را بخوانید. و اگر می پرسید کدامشان جواب مشتری شما را می دهد، جواب صادقانه ما این است که هیچ کدام؛ آن یک کار دیگر است.
پرسش هایی که واقعا پرسیده می شود
بهترین هوش مصنوعی برای چت کدام است
در لیدربورد متن Arena امروز کلود فیبل ۵ با ۱۵۰۶ اول است. ولی اپوس ۵ با ۱۴۹۴ نصف قیمت دارد، و روی لیدربوردی که رده بالایش در پنجاه امتیاز جا شده، این دوازده امتیاز را به سختی می شود در عمل حس کرد.
چرا چت جی پی تی در این جدول نیست
چون جدول مدل رتبه می دهد و چت جی پی تی یک محصول است. مدلش هست: جی پی تی ۵.۶ سول سومین ردیف است. خود اپ را نتوانسته ایم توصیف کنیم، چون هر مسیری روی openai.com به سرور ما ۴۰۳ می دهد.
چرا ترتیب اینجا با جدول کدنویسی فرق دارد
چون معیار فرق دارد. آنجا لیدربورد توسعه وب چهل وزن دارد و اینجا لیدربورد متن عمومی چهل و پنج. مدلی که کد بهتری می نویسد لزوما جوابی نمی دهد که آدم ها بیشتر بپسندند، و اپوس ۵ و فیبل ۵ دقیقا در همین دو جدول جایشان را با هم عوض می کنند.
کدام یک از اینها از ایران کار می کند
هیچ کدام راه رسمی ندارند. انتروپیک و گوگل فهرست کشورهایشان را منتشر می کنند و ایران در هیچ کدام نیست؛ بقیه سازنده ها اصلا فهرستی منتشر نمی کنند، پس ستونشان خالی مانده. ما نه اکانت می فروشیم و نه راه دور زدن پیشنهاد می کنیم.
مدل اول این جدول جواب شما را می دهد، نه جواب مشتری شما را. برای دومی ما آدم می فرستیم و نه ربات، و همین است دستیار مجازی و منشی آنلاین