دسته

بهترین هوش مصنوعی برای کدنویسی

امروز کلود اپوس ۵ بالاترین امتیاز را دارد، چون در لیدربورد WebDev Arena با ۱۶۹۲ رتبه یک است و همزمان نصف قیمت گران ترین مدل بازار را دارد. جدول زیر معیارها و وزنشان را نشان می دهد و هر عدد لینک منبع خودش را دارد.

  • شش مدل با شاهد واقعی
  • وزن ها روی صفحه
  • بدون جایگاه دستی

آخرین بررسی: این صفحه یک مرجع است. با هر نسخه تازه، منابع سازنده دوباره خوانده و صفحه بهروز می شود. چه چیزی عوض شد

رتبه بندی امروز، بر پایه شاهد تاییدشده

مدلی که در لیدربورد بالاتر از ما نشسته حتی اگر صفحه اش را ننوشته باشیم در جدول هست، وگرنه رتبه اول یعنی اول بین آنهایی که وقت داشتیم بنویسیم.

بهترین هوش مصنوعی برای کدنویسی
رتبه ابزار امتیاز لیدربورد توسعه وب ۴۰ امتیاز به ازای دلار ۲۰ بلوغ ابزار ۱۵ لیدربورد متن عمومی ۱۰ پنجره متن ۱۰ دسترسی از ایران ۵
۱ کلود اپوس ۵ انتخاب فعلی ۶۴.۱ ۱,۶۹۲ منبع ۶۷.۷ منبع ۴/۴ API، اپ رسمی، ابزار خط فرمان، SDK عامل، اجرای دسته ای، و عرضه روی سه ابر بزرگ ۱,۴۹۴ منبع ۱ میلیون توکن منبع blocked / none ایران در هیچ یک از دو فهرست کشورهای پشتیبانی شده انتروپیک (API و claude.ai) نیست. این را از صفحه خود انتروپیک خوانده ایم و نه از تست شبکه؛ اندازه گیری مستقل شبکه ای هنوز انجام نشده و وقتی انجام شد همین جا نوشته می شود.
۲ کلود فیبل ۵ ۴۶.۱ ۱,۶۲۸ منبع ۳۲.۶ منبع ۴/۴ همان زیرساخت اپوس ۵ را دارد و روی هر پنج مسیر عرضه شده: API خود انتروپیک، بدراک، کلود پلتفرم روی AWS، گوگل کلاد و مایکروسافت فاندری. ۱,۵۰۶ منبع ۱ میلیون توکن منبع blocked / none ایران در فهرست کشورهای پشتیبانی شده انتروپیک نیست. از صفحه خود انتروپیک خوانده شده، نه از تست شبکه.
۳ کیمی کی۳ مکس ۴۴.۱ ۱,۶۷۴ منبع ۱۱۱.۶ منبع ۱/۴ API سازگار با اوپنایآی به اضافه یک کلاینت رسمی. مستندات پلتفرم ابزار خط فرمان یا افزونه ویرایشگر رسمی فهرست نمی کند، پس بالاتر از این نمره نمی دهیم. ۱,۴۸۷ منبع ۱ میلیون توکن منبع تایید نشده
۴ قوان ۳.۸ مکس ۳۳.۸ ۱,۶۷۰ منبع تایید نشده تایید نشده ۱,۴۹۰ منبع تایید نشده تایید نشده
۵ دیپ سیک وی۴ فلش ۲۰.۰ ۱,۵۸۵ منبع ۵,۶۶۰.۷ منبع ۱/۴ API مستندشده به اضافه یک کلاینت رسمی. ابزار عاملی یا افزونه ویرایشگر رسمی فهرست نشده. تایید نشده ۱ میلیون توکن منبع تایید نشده
۶ جیالام ۵.۲ مکس ۲.۳ ۱,۵۸۸ منبع ۳۶۰.۹ منبع ۱/۴ API و مستندات کامل به اضافه یک کلاینت رسمی. ابزار خط فرمان یا افزونه ویرایشگر رسمی در مستندات فهرست نشده. تایید نشده ۱ میلیون توکن منبع تایید نشده

سلول خالی یعنی آن عدد را نتوانسته ایم تایید کنیم، نه اینکه ابزار صفر گرفته است.

برای رتبه دادن، داده تاییدشده کافی نداریم

اینها ابزارهای واقعی اند و پیگیری شان می کنیم، ولی بیش از نیم وزن معیارها برایشان عدد تاییدشده ندارد، پس رتبه دادنشان حدس زدن بود.

این رتبه بندی چطور حساب می شود

هر معیار زیر یک وزن دارد و یک منبع. وزن را عوض کنید، کل جدول از نو حساب می شود. هیچ جای این مرجع، جایگاهی دستی گذاشته نشده است.

معیار وزن شاهد
لیدربورد توسعه وب ۴۰ WebDev Arenaکارهای واقعی توسعه وب با ابزار و چند مرحله، که به کار روزمره نزدیک تر از آزمون تک سوالی است
امتیاز به ازای دلار ۲۰ محاسبه شده از دو عدد بالابرای تیمی که هزینه ماهانه دارد، مدل گران تر با یک درصد امتیاز بیشتر انتخاب بدی است
بلوغ ابزار ۱۵ مقیاس تعریف شده، با دلیل نوشته برای هر انتسابمدل خوب بدون ابزار خط فرمان و SDK عامل، در کار روزمره کند می شود
لیدربورد متن عمومی ۱۰ Arena (Text)وزن کم دارد چون گفتوگوی عمومی معیار کدنویسی نیست، ولی کاملا بی ربط هم نیست
پنجره متن ۱۰ مشخصات اعلامی سازندهبرای کار روی مخزن بزرگ، پنجره کوچک یعنی تکه تکه کردن و از دست دادن زمینه
دسترسی از ایران ۵ ستون دسترسی ما، با روش اعلام شدهوزنش کم است چون این ستون جای خودش را در صفحه «هوش مصنوعی در ایران» دارد

چرا اپوس ۵ اول است

دو چیز با هم. اول اینکه در WebDev Arena، که کارهای واقعی توسعه وب را با ابزار و چند مرحله می سنجد، ردیف claude-opus-5-max با ۱۶۹۲ امتیاز رتبه یک است و بعدش کیمی کی۳ مکس با ۱۶۷۴ و قوان ۳.۸ مکس با ۱۶۷۰ می آیند. دوم اینکه ۲۵ دلار خروجی می گیرد، یعنی نصف فیبل ۵ که خودش با ۱۶۲۸ پایین تر است. مدلی که هم بالاتر باشد و هم ارزان تر، در هر وزندهی معقولی اول درمی آید.

جایی که این جدول کم می آورد

معیار اصلی ما یک لیدربورد ترجیح انسانی است و نه یک آزمون خودکار. WebDev Arena عدد مطلق و تاریخ و تعداد رای می دهد، که برای چاپ کردن لازم است، ولی ترجیح انسانی به خوانایی و شکل جواب هم حساس است و نه فقط به درست بودن کد. SWE-bench Verified معیار دقیقتری بود، ولی لیدربوردش با جاوااسکریپت رندر می شود و ما عددش را مستقیم نخوانده ایم. عددی که نخوانده باشیم چاپ نمی کنیم، حتی اگر جای دیگری نقلش کرده باشند.

دو مدل هم در همین صفحه رتبه نگرفته اند: جیالام ۵.۲ مکس و دیپ سیک وی۴ فلش. هر دو در لیدربورد توسعه وب امتیاز واقعی دارند، ولی قیمت و پنجره متنشان را از منبع خودشان تایید نکرده ایم، پس بیش از نیم وزن معیارها برایشان خالی است. زیر جدول اسمشان هست و رتبه شان نیست.

نکته ای که فقط در کار روزمره معلوم می شود

اختلاف امتیاز بین مدل اول و چهارم این جدول حدود بیست و شش امتیاز است، که در عمل خیلی کمتر از آن حس می شود که عدد نشان می دهد. چیزی که واقعا در یک روز کاری فرق می گذارد، بلوغ ابزار است: اینکه مدل ابزار خط فرمان دارد، اجرای دسته ای دارد، و روی ابری هست که شرکت شما از قبل قرارداد دارد. برای همین این معیار پانزده وزن گرفته و نه پنج.

چه وقت انتخاب اول ما را نگیرید

  • اگر تیم شما روی ابری کار می کند که اپوس ۵ رویش نیست، مدل دوم جدول با ابزار موجود بهتر از مدل اول بدون ابزار است.
  • اگر کارتان کد نیست و گفتوگوی عمومی است، این جدول را نگاه نکنید. لیدربورد متن ترتیب دیگری دارد.
  • اگر بودجه واقعا تنگ است، مدل های متنباز پایین جدول با اختلاف امتیاز کمتری از اختلاف قیمتشان کار می کنند.

کجا کم می آورد

  • معیار اصلی یک لیدربورد ترجیح انسانی است، نه یک آزمون خودکار روی مخزن واقعی.
  • عدد SWE-bench Verified در جدول نیست، چون لیدربوردش را نتوانسته ایم مستقیم بخوانیم.
  • ادعاهای خود انتروپیک درباره Frontier-Bench نسبی اند و عدد مطلق ندارند، پس آن ستون خالی مانده.
  • مدل های چینی جدول (کیمی، قوان، جیالام، دیپ سیک) قیمت تاییدشده در فایل ما ندارند و همین رتبه شان را پایین نگه می دارد. این کمبود داده ما است و نه ضعف آنها.

نظر ما

اگر یکی را باید بردارید و از ایران هم مسئله نیست، اپوس ۵. اگر مسئله هزینه است، به جای عوض کردن مدل، اول مصرف توکن خودتان را نگاه کنید: در کاری که دیده ایم، صرفهجویی از کوتاه کردن زمینه بیشتر از عوض کردن مدل درمی آید.

پرسش هایی که واقعا پرسیده می شود

بهترین هوش مصنوعی برای کدنویسی کدام است

امروز کلود اپوس ۵، بر پایه رتبه یکش در لیدربورد WebDev Arena و قیمتی که نصف گران ترین مدل بازار است. این جواب تاریخ دارد و با هر نسخه تازه می تواند عوض شود.

مدل متنباز برای کد به کار می آید

بله. در همین لیدربورد، قوان ۳.۸ مکس با ۱۶۷۰ و کیمی کی۳ مکس با ۱۶۷۴ فاصله کمی با مدل اول دارند. ما رتبه شان را پایین نگه داشته ایم چون قیمت و مشخصاتشان را از منبع خودشان تایید نکرده ایم، نه چون بد کار می کنند.

چرا رتبه ها با فهرست های دیگر فرق دارد

چون معیار و وزنش را نوشته ایم و شما می توانید ببینید. بیشتر فهرست ها ترتیبشان را توضیح نمی دهند، و وقتی توضیحی نباشد هر ترتیبی ممکن است.

اگر خودتان وقت راه انداختن این ابزارها روی پروژه را ندارید، همین کار بخشی از خدمت طراحی اپلیکیشن و نرمافزار سفارشی