بهترین هوش مصنوعی برای کدنویسی
کلود فیبل ۵.۱ بالاترین امتیاز را دارد، چون در به روزرسانی ۲ سپتامبر لیدربورد WebDev Arena با ۱۷۶۵ اول است و ردیف بعدی هفتاد و هشت امتیاز پایین تر می آید. گران ترین ردیف جدول هم هست، و همین صفحه نشان می دهد این معامله برای چه کسی می ارزد و برای چه کسی نه.
- یازده مدل با شاهد واقعی
- وزن ها روی صفحه
- بدون جایگاه دستی
آخرین بررسی: این صفحه یک مرجع است. با هر نسخه تازه، منابع سازنده دوباره خوانده و صفحه بهروز می شود. چه چیزی عوض شد
امتیاز هر ابزار از کجا می آید
حلقه زیر، همان وزن هایی است که در سرستون های جدول پایین نوشته شده.
- لیدربورد توسعه وب ۴۰
- امتیاز به ازای دلار ۲۰
- بلوغ ابزار ۱۵
- لیدربورد متن عمومی ۱۰
- پنجره متن ۱۰
- دسترسی از ایران ۵
وزن ها را ما انتخاب کرده ایم و همین تنها جای سلیقه این جدول است. اگر وزن دیگری درست تر می دانید، ترتیب هم عوض می شود.
رتبه بندی امروز، بر پایه شاهد تاییدشده
مدلی که در لیدربورد بالاتر از ما نشسته حتی اگر صفحه اش را ننوشته باشیم در جدول هست، وگرنه رتبه اول یعنی اول بین آنهایی که وقت داشتیم بنویسیم.
سلول خالی یعنی آن عدد را نتوانسته ایم تایید کنیم، نه اینکه ابزار صفر گرفته است.
پشت هر عدد
هر نمره داوری این جدول یک دلیل نوشته شده دارد و ستون ایران می گوید چطور بررسی شده. آن دو اینجا بازند. رد اندازه گیری هر عدد، یعنی اینکه از کدام ردیف کدام لیدربورد و با چند رای آمده، زیر همان مدل باز می شود.
۱ کلود فیبل ۵.۱
بلوغ ابزار ۴/۴ روی هر پنج مسیر عرضه شده و جدول خود انتروپیک برای هر پنج تا شناسه مدل چاپ کرده. در همان جدول، ستون Claude Platform on AWS برای اپوس ۵ خط تیره است و برای این مدل شناسه دارد.
دسترسی از ایران مسدود / راه کارآمدی ندارد ایران در فهرست کشورهای پشتیبانی شده انتروپیک نیست. از صفحه خود انتروپیک خوانده شده، نه از تست شبکه. برای این نسخه هم هیچ چیز عوض نشده.
رد اندازه گیری (۳ مورد)
لیدربورد توسعه وب ۱,۷۶۵ ردیف claude-fable-5.1-max، رتبه ۱ در لیدربورد WebDev Arena، به روزرسانی ۲ سپتامبر ۲۰۲۶ با ۶۴۰۸۰۶ رای
امتیاز به ازای دلار ۳۵.۳ امتیاز WebDev Arena تقسیم بر قیمت هر یک میلیون توکن خروجی
لیدربورد متن عمومی ۱,۵۰۴ ردیف claude-fable-5.1-max، رتبه ۳ در لیدربورد متن Arena، به روزرسانی ۲ سپتامبر ۲۰۲۶ با ۷۹۹۹۰۲۰ رای
۲ کلود اپوس ۵
بلوغ ابزار ۴/۴ API، اپ رسمی، ابزار خط فرمان، SDK عامل، اجرای دسته ای، و عرضه روی سه ابر بزرگ
دسترسی از ایران مسدود / راه کارآمدی ندارد ایران در هیچ یک از دو فهرست کشورهای پشتیبانی شده انتروپیک (API و claude.ai) نیست. این را از صفحه خود انتروپیک خوانده ایم و نه از تست شبکه؛ اندازه گیری مستقل شبکه ای هنوز انجام نشده و وقتی انجام شد همین جا نوشته می شود.
رد اندازه گیری (۳ مورد)
لیدربورد توسعه وب ۱,۶۸۷ ردیف claude-opus-5-max، رتبه ۳ در لیدربورد WebDev Arena، به روزرسانی ۲ سپتامبر ۲۰۲۶ با ۶۴۰۸۰۶ رای
امتیاز به ازای دلار ۶۷.۵ امتیاز WebDev Arena تقسیم بر قیمت هر یک میلیون توکن خروجی
لیدربورد متن عمومی ۱,۴۹۳ ردیف claude-opus-5-high، رتبه ۹ در لیدربورد متن Arena، به روزرسانی ۲ سپتامبر ۲۰۲۶ با ۷۹۹۹۰۲۰ رای
۳ کلود فیبل ۵
بلوغ ابزار ۴/۴ همان زیرساخت اپوس ۵ را دارد و روی هر پنج مسیر عرضه شده: API خود انتروپیک، بدراک، کلود پلتفرم روی AWS، گوگل کلاد و مایکروسافت فاندری.
دسترسی از ایران مسدود / راه کارآمدی ندارد ایران در فهرست کشورهای پشتیبانی شده انتروپیک نیست. از صفحه خود انتروپیک خوانده شده، نه از تست شبکه.
رد اندازه گیری (۳ مورد)
لیدربورد توسعه وب ۱,۶۲۸ ردیف claude-fable-5، رتبه ۸ در لیدربورد WebDev Arena، به روزرسانی ۲ سپتامبر ۲۰۲۶ با ۶۴۰۸۰۶ رای
امتیاز به ازای دلار ۳۲.۶ امتیاز WebDev Arena تقسیم بر قیمت هر یک میلیون توکن خروجی
لیدربورد متن عمومی ۱,۵۰۷ ردیف claude-fable-5، رتبه ۱ در لیدربورد متن Arena، به روزرسانی ۲ سپتامبر ۲۰۲۶ با ۷۹۹۹۰۲۰ رای
۴ جی پی تی ۵.۶ سول
بلوغ ابزار ۴/۴ پله چهارم را از روی مستندات خود سازنده می گیرد: API و اس دی کی و خط فرمان رسمی، افزونه ویرایشگر کدکس، اس دی کی عامل، مسیر اجرای دسته ای، و راهنمای رسمی عرضه روی آمازون بدراک که شناسه openai.gpt-5.6-sol را نام می برد. این تنها ستونی است که برای این مدل بدون باز شدن openai.com هم کامل شد.
دسترسی از ایران مسدود / راه کارآمدی ندارد این ستون تا امروز خالی بود و حالا نیست. فهرست کشورهای پشتیبانی شده روی openai.com است و آن دامنه هنوز ۴۰۳ می دهد، ولی همان فهرست روی developers.openai.com هم هست و آنجا باز است. حدود ۱۹۵ کشور و قلمرو نام برده شده و ایران در آنها نیست. صفحه خودش می گوید دسترسی از بیرون این فهرست می تواند به مسدود شدن حساب برسد. از صفحه سازنده خوانده شده و نه از تست شبکه.
رد اندازه گیری (۳ مورد)
لیدربورد توسعه وب ۱,۶۱۶ ردیف gpt-5.6-sol-xhigh (codex-harness)، رتبه ۱۱ در لیدربورد WebDev Arena، به روزرسانی ۲ سپتامبر ۲۰۲۶ با ۶۴۰۸۰۶ رای
امتیاز به ازای دلار ۸۰.۸ امتیاز WebDev Arena تقسیم بر قیمت هر یک میلیون توکن خروجی
لیدربورد متن عمومی ۱,۴۸۳ ردیف gpt-5.6-sol-xhigh، رتبه ۱۷ در لیدربورد متن Arena، به روزرسانی ۲ سپتامبر ۲۰۲۶ با ۷۹۹۹۰۲۰ رای
۵ کیمی کی۳ مکس
بلوغ ابزار ۱/۴ API سازگار با اوپنایآی به اضافه یک کلاینت رسمی. مستندات پلتفرم ابزار خط فرمان یا افزونه ویرایشگر رسمی فهرست نمی کند، پس بالاتر از این نمره نمی دهیم.
رد اندازه گیری (۳ مورد)
لیدربورد توسعه وب ۱,۶۷۴ ردیف kimi-k3-max، رتبه ۴ در لیدربورد WebDev Arena، به روزرسانی ۲ سپتامبر ۲۰۲۶ با ۶۴۰۸۰۶ رای
امتیاز به ازای دلار ۱۱۱.۶ امتیاز WebDev Arena تقسیم بر قیمت هر یک میلیون توکن خروجی
لیدربورد متن عمومی ۱,۴۸۹ ردیف kimi-k3-max، رتبه ۱۲ در لیدربورد متن Arena، به روزرسانی ۲ سپتامبر ۲۰۲۶ با ۷۹۹۹۰۲۰ رای
۶ قوان ۳.۸ مکس
رد اندازه گیری (۳ مورد)
لیدربورد توسعه وب ۱,۶۶۹ ردیف qwen3.8-max، رتبه ۵ در لیدربورد WebDev Arena، به روزرسانی ۲ سپتامبر ۲۰۲۶ با ۶۴۰۸۰۶ رای
امتیاز به ازای دلار ۲۷۸.۲ امتیاز WebDev Arena تقسیم بر قیمت هر یک میلیون توکن خروجی
لیدربورد متن عمومی ۱,۴۸۰ ردیف qwen3.8-max، رتبه ۲۲ در لیدربورد متن Arena، به روزرسانی ۲ سپتامبر ۲۰۲۶ با ۷۹۹۹۰۲۰ رای
۷ دیپ سیک وی۴ فلش
بلوغ ابزار ۱/۴ API مستندشده به اضافه یک کلاینت رسمی. ابزار عاملی یا افزونه ویرایشگر رسمی فهرست نشده.
رد اندازه گیری (۳ مورد)
لیدربورد توسعه وب ۱,۵۸۱ ردیف deepseek-v4-flash-high، رتبه ۱۸ در لیدربورد WebDev Arena، به روزرسانی ۲ سپتامبر ۲۰۲۶ با ۶۴۰۸۰۶ رای
امتیاز به ازای دلار ۱,۱۹۷.۷ امتیاز WebDev Arena تقسیم بر قیمت هر یک میلیون توکن خروجی
لیدربورد متن عمومی ۱,۴۳۸ ردیف deepseek-v4-flash-high-preview، رتبه ۸۵ در لیدربورد متن Arena، به روزرسانی ۲ سپتامبر ۲۰۲۶ با ۷۹۹۹۰۲۰ رای
۸ میوز اسپارک ۱.۳
بلوغ ابزار ۲/۴ Meta Model API و عرضه روی OpenRouter، که یعنی بیشتر از یک واجهه تنها. ولی مستندات خود متا نه ابزار خط فرمان رسمی فهرست می کند و نه افزونه ویرایشگر، پس بالاتر از پله دوم نمی رود.
رد اندازه گیری (۲ مورد)
لیدربورد توسعه وب ۱,۶۲۳ ردیف muse-spark-1.3-xhigh در لیدربورد WebDev Arena، به روزرسانی ۲ سپتامبر ۲۰۲۶ با ۶۴۰۸۰۶ رای. ستون رتبه این ردیف N/A است و نه یک عدد، یعنی امتیاز ثبت شده و رتبه رسمی هنوز نه.
امتیاز به ازای دلار ۳۸۱.۹ امتیاز WebDev Arena تقسیم بر قیمت هر یک میلیون توکن خروجی
۹ جمینای ۳.۸ فلش
بلوغ ابزار ۳/۴ API و اس دی کی رسمی و استودیو وب و مسیر ورتکس روی ابر گوگل. پله چهارم را نمی دهیم چون گوگل برای این خانواده ابزار خط فرمان کدنویسی رسمی جدا فهرست نمی کند، بر خلاف انتروپیک و اوپن ای آی.
دسترسی از ایران مسدود / راه کارآمدی ندارد صفحه مناطق در دسترس Gemini API حدود ۱۹۵ کشور و قلمرو را نام می برد و ایران در آنها نیست. از صفحه خود گوگل خوانده شده و نه از تست شبکه.
رد اندازه گیری (۳ مورد)
لیدربورد توسعه وب ۱,۵۶۷ ردیف gemini-3.8-flash-high، رتبه ۱۹ در لیدربورد WebDev Arena، به روزرسانی ۲ سپتامبر ۲۰۲۶ با ۶۴۰۸۰۶ رای
امتیاز به ازای دلار ۴۱۷.۹ امتیاز WebDev Arena تقسیم بر قیمت هر یک میلیون توکن خروجی
لیدربورد متن عمومی ۱,۴۹۴ ردیف gemini-3.8-flash-high، رتبه ۸ در لیدربورد متن Arena، به روزرسانی ۲ سپتامبر ۲۰۲۶ با ۷۹۹۹۰۲۰ رای
۱۰ جیالام ۵.۲ مکس
بلوغ ابزار ۱/۴ API و مستندات کامل به اضافه یک کلاینت رسمی. ابزار خط فرمان یا افزونه ویرایشگر رسمی در مستندات فهرست نشده.
رد اندازه گیری (۳ مورد)
لیدربورد توسعه وب ۱,۵۸۵ ردیف glm-5.2-max، رتبه ۱۶ در لیدربورد WebDev Arena، به روزرسانی ۲ سپتامبر ۲۰۲۶ با ۶۴۰۸۰۶ رای
امتیاز به ازای دلار ۳۶۰.۲ امتیاز WebDev Arena تقسیم بر قیمت هر یک میلیون توکن خروجی
لیدربورد متن عمومی ۱,۴۷۲ ردیف glm-5.2-max، رتبه ۳۷ در لیدربورد متن Arena، به روزرسانی ۲ سپتامبر ۲۰۲۶ با ۷۹۹۹۰۲۰ رای
۱۱ گراک ۴.۵
بلوغ ابزار ۳/۴ API سازگار با اوپن ای آی، اس دی کی پایتون و جاوااسکریپت، و یک عامل خط فرمان رسمی به اسم گراک بیلد. پله چهارم را نمی گیرد چون افزونه ویرایشگر رسمی ندارد و اجرای دسته ای هم همین مدل را قبول نمی کند.
رد اندازه گیری (۳ مورد)
لیدربورد توسعه وب ۱,۵۵۶ ردیف grok-4.5، رتبه ۲۳ در لیدربورد WebDev Arena، به روزرسانی ۲ سپتامبر ۲۰۲۶ با ۶۴۰۸۰۶ رای
امتیاز به ازای دلار ۲۵۹.۳ امتیاز WebDev Arena تقسیم بر قیمت هر یک میلیون توکن خروجی
لیدربورد متن عمومی ۱,۴۷۱ ردیف grok-4.5، رتبه ۳۸ در لیدربورد متن Arena، به روزرسانی ۲ سپتامبر ۲۰۲۶ با ۷۹۹۹۰۲۰ رای
برای رتبه دادن، داده تاییدشده کافی نداریم
اینها ابزارهای واقعی اند و پیگیری شان می کنیم، ولی بیش از نیم وزن معیارها برایشان عدد تاییدشده ندارد، پس رتبه دادنشان حدس زدن بود.
این رتبه بندی چطور حساب می شود
هر معیار زیر یک وزن دارد و یک منبع. وزن را عوض کنید، کل جدول از نو حساب می شود. هیچ جای این مرجع، جایگاهی دستی گذاشته نشده است.
| معیار | وزن | شاهد |
|---|---|---|
| لیدربورد توسعه وب | ۴۰ | WebDev Arenaکارهای واقعی توسعه وب با ابزار و چند مرحله، که به کار روزمره نزدیک تر از آزمون تک سوالی است |
| امتیاز به ازای دلار | ۲۰ | محاسبه شده از دو عدد بالابرای تیمی که هزینه ماهانه دارد، مدل گران تر با یک درصد امتیاز بیشتر انتخاب بدی است |
| بلوغ ابزار | ۱۵ | مقیاس تعریف شده، با دلیل نوشته برای هر انتسابمدل خوب بدون ابزار خط فرمان و SDK عامل، در کار روزمره کند می شود |
| لیدربورد متن عمومی | ۱۰ | Arena (Text)وزن کم دارد چون گفتوگوی عمومی معیار کدنویسی نیست، ولی کاملا بی ربط هم نیست |
| پنجره متن | ۱۰ | مشخصات اعلامی سازندهبرای کار روی مخزن بزرگ، پنجره کوچک یعنی تکه تکه کردن و از دست دادن زمینه |
| دسترسی از ایران | ۵ | ستون دسترسی ما، با روش اعلام شدهوزنش کم است چون این ستون جای خودش را در صفحه «هوش مصنوعی در ایران» دارد |
چرا فیبل ۵.۱ اول است، و چرا قیمت این بار جلویش را نگرفت
یک عدد کار را تمام کرد. در به روزرسانی ۲ سپتامبر لیدربورد WebDev Arena، ردیف claude-fable-5.1-max با ۱۷۶۵ اول است و ردیف بعدی که ما نگه می داریم، claude-opus-5-max، با ۱۶۸۷ می آید. هفتاد و هشت امتیاز فاصله، در ستونی که کل رده بالایش تا هفته پیش در بیست و دو امتیاز جا شده بود.
و این مدل ستون امتیاز به ازای دلار را کامل می بازد. خروجی اش ۵۰ دلار برای هر میلیون توکن است، دو برابر اپوس ۵، و در آن ستون صفر می گیرد. هر بار پیش از این، همین ستون مدل گران را زمین زده بود. این اولین باری است که فاصله امتیاز از پس قیمت برمی آید، و دلیلش هم ساده است: چهل وزن ستون لیدربورد را تمام و کمال می برد و ستون های ابزار و پنجره متن و ایران را هم دارد.
پس جواب کوتاه یکی نیست. اگر با API کار می کنید و قبض ماهانه دارید، اپوس ۵ نصف قیمت است و در همین جدول دوم. اگر کاری دارید که یک بار درست انجام شدنش از دو بار انجام دادنش ارزان تر است، هفتاد و هشت امتیاز فاصله همان چیزی است که بابتش پول می دهید.
جایی که این جدول کم می آورد
معیار اصلی ما یک لیدربورد ترجیح انسانی است و نه یک آزمون خودکار. WebDev Arena عدد مطلق و تاریخ و تعداد رای می دهد، که برای چاپ کردن لازم است، ولی ترجیح انسانی به خوانایی و شکل جواب هم حساس است و نه فقط به درست بودن کد. SWE-bench Verified معیار دقیقتری بود، ولی لیدربوردش با جاوااسکریپت رندر می شود و ما عددش را مستقیم نخوانده ایم. عددی که نخوانده باشیم چاپ نمی کنیم، حتی اگر جای دیگری نقلش کرده باشند.
یک نامزد در همین صفحه رتبه نگرفته: جمینای ۳.۱ پرو. در لیدربورد متن عمومی امتیاز واقعی دارد، ولی ردیفش را در لیدربورد توسعه وب نخوانده ایم و گوگل پنجره متنش را اصلا منتشر نکرده، پس بیش از نیم وزن معیارها برایش خالی است. زیر جدول اسمش هست و رتبه اش نیست. جیالام ۵.۲ مکس و دیپ سیک وی۴ فلش هم تا مدتی همین جا بودند و حالا که قیمت و پنجره متنشان از مستندات خودشان تایید شده، در جدول رتبه دارند.
یک نکته درباره خواندن همین لیدربورد که این بار به آن برخوردیم و جای دیگری نوشته نمی شود: قوان دو ردیف جدا دارد. ردیف qwen3.8-max با ۱۶۶۹ و ردیف qwen3.8-max-0902 با ۱۶۸۸ که رتبه دوم کل بورد است. ما اولی را می نویسیم، چون شناسه ای که در مستندات علی بابا هست همان است و ردیف تاریخ دار یک عکس لحظه ای از یک پیکربندی سرو است. اگر جای دیگری دیدید قوان دوم جدول است، دلیلش این است و نه اشتباه ما.
یک چیز دیگر را هم بدانید تا عددها گیجتان نکند: امتیازها نسبی اند. هر ستون بین کمینه و بیشینه همان ستون نرمال می شود، پس اضافه شدن یک نامزد تازه امتیاز همه را جا به جا می کند بی آنکه هیچ مدلی عوض شده باشد. اضافه شدن گراک ۴.۵ در ۱۲ اوت ۲۰۲۶ دقیقا همین کار را کرد: ترتیب دست نخورد و عددها بالا رفتند. اگر عدد امروز را با اسکرین شات هفته پیش مقایسه می کنید، دلیلش این است و نه دست بردن ما.
در همان روز دو تغییر داده ای دیگر هم امتیازها را جا به جا کرد. اول لیدربورد متن را این بار کامل خواندیم و دیدیم ردیف جیالام ۵.۲ مکس و دیپ سیک وی۴ فلش از اول آنجا بوده اند و اجرای قبلی فقط بالای صفحه را دیده بود؛ ستون لیدربورد متن عمومی هر دو پر شد. دوم اینکه جی پی تی ۵.۶ سول نامزد هشتم شد: openai.com همچنان به سرور ما جواب نمی دهد، ولی مستندات توسعه دهندگانش قیمت و پنجره متن را چاپ می کند و ردیف لیدربوردش هم هست. یک نکته درباره همان ردیف، چون اینجا صفحه کدنویسی است: اسمش gpt-5.6-sol-xhigh (codex-harness) است، یعنی عدد برای مدل داخل عامل کدنویسی خود اوپن ای آی است و نه برای مدل خام. جی پی تی بین کیمی و قوان نشست و هیچ ردیف قدیمی نسبت به ردیف های دیگر جا عوض نکرد.
۲۸ اوت: دیپ سیک گران شد و سه ردیف جا به جا شدند
تنها عددی که تا امروز در این مرجع بالا رفته، همین است. تا ۱۲ اوت قیمت دیپ سیک وی۴ فلش ۰.۱۴ دلار ورودی و ۰.۲۸ دلار خروجی بود. حالا صفحه قیمت خودش دو ستون دارد، ساعت اوج و غیر اوج، و ارزان ترین ستونش هم از قیمت قبلی بالاتر است: ۰.۲۲ و ۰.۶۶ در ساعت غیر اوج، و ۰.۴۴ و ۱.۳۲ در ساعت اوج. ما ستون اوج را نوشته ایم، چون ساعت اوج دیپ سیک وسط ساعت کاری ایران می افتد.
خود دیپ سیک از این تغییر پله نباخت، چون هنوز ارزان ترین ردیف جدول است و ستون صرفه اقتصادی را از بالا نگه داشته. ولی فاصله اش با بقیه کم شد، و چون هر ستون بین کمینه و بیشینه خودش نرمال می شود، همین کم شدن فاصله سه ردیف دیگر را بالا برد: قوان ۳.۸ مکس از پنجم به سوم، کیمی کی۳ مکس از سوم به چهارم و جی پی تی ۵.۶ سول از چهارم به پنجم. هیچ کدام از این سه مدل هیچ چیزی عوض نکردند. این دقیقا همان چیزی است که «رتبه نسبی» یعنی، و دلیل اینکه حساب رتبه روی همین صفحه چاپ می شود.
۳ سپتامبر: فاصله بالای جدول از ۲۲ امتیاز به ۷۸ رسید
تا هفته پیش سه امتیاز بالای این ستون در ۲۲ امتیاز جا شده بودند: ۱۶۹۲ و ۱۶۷۴ و ۱۶۷۰. نتیجه گیری این صفحه آن موقع این بود که تفاوت مدل ها کمتر از چیزی است که عدد نشان می دهد، و آنچه یک روز کاری را واقعا عوض می کند بلوغ ابزار است: ابزار خط فرمان، اجرای دسته ای، و بودن روی ابری که شرکت شما از قبل قرارداد دارد. برای رتبه دو تا یازده آن حرف هنوز درست است و برای همین آن معیار پانزده وزن دارد. برای رتبه یک دیگر درست نیست.
سه ردیف دیگر هم در همین به روزرسانی جا عوض کردند بی آنکه خودشان چیزی عوض کنند. کیمی کی۳ مکس از سوم به پنجم رفت و قوان ۳.۸ مکس از پنجم به ششم، در حالی که عدد لیدربورد کیمی مو به مو همان ۱۶۷۴ ماند. جی پی تی ۵.۶ سول چهارم ماند ولی امتیازش از ۵۱.۶ به ۴۸.۸ آمد. دلیل هر سه، ورود نامزدهای تازه و نرمال شدن دوباره ستون هاست.
سه نامزد تازه، و یک مدل که عمدا در جدول نیست
میوز اسپارک ۱.۳ از متا و جمینای ۳.۸ فلش از گوگل امروز وارد جدول شدند، هر دو با ردیف واقعی روی همان لیدربورد. میوز اسپارک نکته ای دارد که در فهرست های دیگر کمتر گفته می شود: متا سال ها با «وزن مدل ها را منتشر می کنیم» شناخته می شد و وزن این یکی منتشر نشده. مدل بالای خط متا امروز یک مدل بسته است.
و مدلی که در جدول نیست: جی پی تی ۶ آسترا، پرچمدار تازه اوپن ای آی با ورودی ۱۰ و خروجی ۵۰ دلار. هیچ کدام از دو لیدربورد این صفحه ردیفی به نامش ندارند، پس هفتاد از صد وزن برایش خالی می ماند و گذاشتنش در جدول فقط یک سطر «رتبه بندی نشده» می سازد. در کاتالوگ مدل ها هست، و همین که چرا در جدول نیست را اینجا نوشتیم تا کسی فکر نکند ندیدیمش.
چه وقت انتخاب اول ما را نگیرید
- اگر تیم شما روی ابری کار می کند که اپوس ۵ رویش نیست، مدل دوم جدول با ابزار موجود بهتر از مدل اول بدون ابزار است.
- اگر کارتان کد نیست و گفتوگوی عمومی است، این جدول را نگاه نکنید. لیدربورد متن ترتیب دیگری دارد.
- اگر بودجه واقعا تنگ است، مدل های متنباز پایین جدول با اختلاف امتیاز کمتری از اختلاف قیمتشان کار می کنند.
کجا کم می آورد
- معیار اصلی یک لیدربورد ترجیح انسانی است، نه یک آزمون خودکار روی مخزن واقعی.
- عدد SWE-bench Verified در جدول نیست، چون لیدربوردش را نتوانسته ایم مستقیم بخوانیم.
- ادعاهای خود انتروپیک درباره Frontier-Bench نسبی اند و عدد مطلق ندارند، پس آن ستون خالی مانده.
- قوان ۳.۸ مکس حالا قیمت و پنجره متن تاییدشده دارد، ولی ستون بلوغ ابزار و ستون ایرانش هنوز شاهد ندارد، یعنی ۲۰ واحد از صد برایش سنجیده نشده. این کمبود داده ما است و نه ضعف مدل.
- مدل اول این جدول گران ترین ردیفش هم هست و ستون امتیاز به ازای دلار را صفر می گیرد. اگر هزینه برایتان تعیین کننده است، رتبه اول این جدول جواب شما نیست.
- جی پی تی ۶ آسترا، پرچمدار تازه اوپن ای آی، اصلا در جدول نیست چون هیچ کدام از دو لیدربورد ردیفی به نامش ندارند. یعنی این جدول امروز گران ترین مدل اوپن ای آی را نمی سنجد.
نظر ما
اگر یکی را باید بردارید و هزینه مسئله نیست، فیبل ۵.۱. اگر قبض ماهانه دارید، اپوس ۵ نصف قیمت است و هفتاد و هشت امتیاز پایین تر، و این معامله ای است که خودتان باید ببندید. و پیش از عوض کردن مدل، یک بار مصرف توکن خودتان را نگاه کنید: در کاری که دیده ایم، صرفه جویی از کوتاه کردن زمینه بیشتر از عوض کردن مدل درمی آید.
پرسش هایی که واقعا پرسیده می شود
بهترین هوش مصنوعی برای کدنویسی کدام است
امروز کلود فیبل ۵.۱، بر پایه رتبه یکش در لیدربورد WebDev Arena با ۱۷۶۵ و هفتاد و هشت امتیاز فاصله با ردیف بعدی. گران ترین ردیف جدول هم هست، پس اگر هزینه برایتان تعیین کننده است جواب عملی تر اپوس ۵ است. این جواب تاریخ دارد و با هر نسخه تازه می تواند عوض شود.
مدل متنباز برای کد به کار می آید
بله، ولی فاصله از ۲ سپتامبر بیشتر شده. کیمی کی۳ مکس با ۱۶۷۴ و قوان ۳.۸ مکس با ۱۶۶۹ هنوز به اپوس ۵ نزدیک اند و حدود نود امتیاز پایین تر از مدل اول جدول. یک نکته تازه هم هست: میوز اسپارک متا که امروز وارد جدول شد وزنش منتشر نمی شود، یعنی سازنده ای که با انتشار وزن شناخته می شد، مدل بالای خودش را بسته عرضه می کند.
چرا رتبه ها با فهرست های دیگر فرق دارد
چون معیار و وزنش را نوشته ایم و شما می توانید ببینید. بیشتر فهرست ها ترتیبشان را توضیح نمی دهند، و وقتی توضیحی نباشد هر ترتیبی ممکن است.
اگر خودتان وقت راه انداختن این ابزارها روی پروژه را ندارید، همین کار بخشی از خدمت
طراحی اپلیکیشن و نرمافزار سفارشی