بهترین هوش مصنوعی برای ساخت عکس
جی پی تی ایمیج ۲ امروز اول است، چون تنها مدلی است که هر دو تخته آرنا را می برد: هم ساخت از متن، هم ویرایش. ولی اگر هزینه برایتان مهم است نانو بنانا ۲ نتیجه نزدیکی می دهد و اگر باید روی سخت افزار خودتان اجرا شود، فقط یک ردیف این جدول برایتان باز است.
- شش مدل، همه رتبه دار
- عددها از مستندات سازنده و لیدربورد
- ستون ایران با روش اعلام شده
آخرین بررسی: این صفحه یک مرجع است. با هر نسخه تازه، منابع سازنده دوباره خوانده و صفحه بهروز می شود. چه چیزی عوض شد
رتبه بندی امروز، بر پایه چیزی که منتشر شده
امتیاز هر دو تخته از آرنا خوانده شده و قیمت و مشخصات از مستندات خود سازنده. سلولی که خالی است یعنی چیزی منتشر نشده، نه اینکه عددش صفر باشد.
| رتبه | ابزار | امتیاز | ساخت تصویر از متن ۳۰ | ویرایش تصویر ۲۰ | قیمت هر تصویر ۲۰ | ورودی مرجع ۱۰ | بازی وزن ها ۱۰ | دسترسی از ایران ۱۰ |
|---|---|---|---|---|---|---|---|---|
| ۱ | جی پی تی ایمیج ۲ انتخاب فعلی | ۷۳.۵ | ۱,۳۸۱ منبع | ۱,۴۶۳ منبع | $۰.۰۵۳ برای هر تصویر منبع | تایید نشده | ۰/۳ وزنی منتشر نشده. صفحه خود مدل فقط سه نقطه پایانی API را می شمارد و هیچ مسیر دانلودی ندارد | blocked / none فهرست کشورهای پشتیبانی شده API اوپن ای آی را امروز روی developers.openai.com خواندیم و ایران در آن نیست. خود openai.com از این سرور ۴۰۳ برمی گرداند، پس این فهرست تنها سند خوانده شدنی است و فقط درباره API حرف می زند، نه درباره اپلیکیشن ChatGPT. تست شبکه از داخل ایران انجام نشده. |
| ۲ | نانو بنانا ۲ | ۶۵.۵ | ۱,۲۶۴ منبع | ۱,۳۸۵ منبع | $۰.۰۶۷ برای هر تصویر منبع | ۱۰ ورودی مرجع منبع | ۰/۳ وزنی منتشر نشده و گوگل برای هیچکدام از مدل های تصویری جمینای مسیر دانلود ندارد | blocked / none صفحه مناطق در دسترس Gemini API فهرست کشورهایی را می دهد که این واجهه در آنها کار می کند و ایران در آن فهرست نیست. این خواندن یک صفحه است و نه اندازه گیری شبکه. |
| ۳ | نانو بنانا پرو | ۴۶.۴ | ۱,۲۴۶ منبع | ۱,۳۸۹ منبع | $۰.۱۳۴ برای هر تصویر منبع | ۶ ورودی مرجع منبع | ۰/۳ وزنی منتشر نشده و گوگل برای هیچکدام از مدل های تصویری جمینای مسیر دانلود ندارد | blocked / none صفحه مناطق در دسترس Gemini API فهرست کشورهایی را می دهد که این واجهه در آنها کار می کند و ایران در آن فهرست نیست. این خواندن یک صفحه است و نه اندازه گیری شبکه. |
| ۴ | سیدریم ۵.۰ پرو | ۳۴.۴ | ۱,۲۵۸ منبع | ۱,۳۹۳ منبع | تایید نشده | تایید نشده | تایید نشده | تایید نشده |
| ۵ | فلاکس ۲ مکس | ۳۴.۰ | ۱,۱۶۲ منبع | ۱,۲۶۲ منبع | $۰.۰۷۰ برای هر تصویر منبع | ۸ ورودی مرجع منبع | ۰/۳ وزن این عضو منتشر نشده. بلک فارست لبز وزن کلاین را می دهد و وزن مکس را نه، و خودش هم همین را در جدول مقایسه نوشته | تایید نشده |
| ۶ | فلاکس ۲ کلاین ۴B | ۳۰.۰ | ۱,۰۳۰ منبع | ۱,۱۸۸ منبع | $۰.۰۱۴ برای هر تصویر منبع | ۴ ورودی مرجع منبع | ۳/۳ وزن زیر پروانه آپاچی ۲.۰ روی هاگینگ فیس، به اضافه نسخه Base بدون تقطیر که خود سازنده برای آموزش دوباره و LoRA پیشنهاد می کند و راهنمای آموزشش را منتشر کرده | تایید نشده |
سلول خالی یعنی آن عدد را نتوانسته ایم تایید کنیم، نه اینکه ابزار صفر گرفته است.
این رتبه بندی چطور حساب می شود
هر معیار زیر یک وزن دارد و یک منبع. وزن را عوض کنید، کل جدول از نو حساب می شود. هیچ جای این مرجع، جایگاهی دستی گذاشته نشده است.
| معیار | وزن | شاهد |
|---|---|---|
| ساخت تصویر از متن | ۳۰ | Arena (Text to Image)امتیاز ترجیح انسانی روی ساخت تصویر از یک پرامپت متنی. بیشترین وزن را دارد چون کاری است که بیشتر آدم ها از این مدل ها می خواهند |
| ویرایش تصویر | ۲۰ | Arena (Image Edit)ترجیح انسانی روی ویرایش یک تصویر موجود. جدا شمرده شد چون ترتیب دو تخته یکی نیست و چند مدل روی یکی بالاترند و روی دیگری پایین تر |
| قیمت هر تصویر | ۲۰ | مشخصات اعلامی سازندهقیمت یک تصویر در ارزان ترین اندازه ای که خود سازنده برایش عدد چاپ کرده. کمتر بهتر است. هر سلول به یک اندازه مشخص گره خورده و قید هر کدام در صفحه خودش آمده |
| ورودی مرجع | ۱۰ | مشخصات اعلامی سازندهچند تصویر مرجع در یک تولید پذیرفته می شود. برای شخصیت یا محصول ثابت، این عدد از هر چیز دیگری مهم تر است |
| بازی وزن ها | ۱۰ | مقیاس تعریف شده، با دلیل نوشته برای هر انتساباز روی پروانه ای که سازنده منتشر کرده، نه از روی نظر ما: از «فقط API» تا «وزن باز زیر پروانه آزاد به اضافه مسیر مستند برای آموزش دوباره» |
| دسترسی از ایران | ۱۰ | ستون دسترسی ما، با روش اعلام شدهامروز این ستون هیچکس را جدا نمی کند: هر سه نامزدی که سند دارند یک وضعیت دارند. توضیحش در متن آمده |
چرا جی پی تی ایمیج ۲ اول شد، با یک سلول خالی
پنجاه امتیاز از صد امتیاز این جدول مال دو تخته آرناست، و این مدل هر دو را می برد. روی ساخت از متن ۱۳۸۱.۱ گرفته در حالی که نفر دوم ۱۲۶۳.۸ است، و روی ویرایش ۱۴۶۲.۷ در برابر ۱۳۹۲.۶. این فاصله ها بزرگند و بازه های اطمینان هیچکدام به رقیب بعدی نمی رسند.
جالب اینکه با یک ستون خالی برنده شده. اوپن ای آی سقف تعداد تصویر مرجع را در مستنداتش چاپ نمی کند؛ نمونه کدش چهار تصویر می دهد ولی نمونه سقف نیست، پس ما آن سلول را پر نکردیم و این مدل ده امتیاز از دست داد. حتی با آن ده امتیاز باخته، هشت امتیاز از نفر دوم جلوتر است.
یک قید که در نام ردیف لیدربورد نوشته شده و بیشتر جاها نادیده گرفته می شود: ردیفی که اول شده «gpt-image-2 (medium)» است، یعنی کیفیت متوسط. کیفیت high روی همان اندازه ۰.۲۱۱ دلار است، یعنی چهار برابر، و اصلا در لیدربورد ردیف ندارد. عددی که ما در ستون قیمت گذاشته ایم همان ۰.۰۵۳ دلار پیکربندی رتبه گرفته است.
ارزان ترین راه به یک نتیجه خوب
نانو بنانا ۲. تنها نامزد این جدول به همراه نانو بنانا پرو است که هر شش ستون را پر کرده، و تنها نامزدی است که هم پوشش کامل دارد و هم امتیاز بالا. ستون مرجع را کامل می برد (ده تصویر شی) و در قیمت هم از رتبه اول ارزان تر است.
و نکته ای که خرید را عوض می کند: نانو بنانا پرو، یعنی مدل پرچمدار و گران گوگل، در این جدول سوم شده و پایین تر از مدل ارزان خودش نشسته. روی ساخت از متن واقعا عقب تر است و بازه های اطمینان هم این را تایید می کنند، روی ویرایش مساوی است، و دو برابر قیمت دارد. اگر بین دو مدل گوگل مانده اید، تقریبا همیشه ارزان تر جواب می دهد.
ردیف آخر جدول، تنها ردیفی است که می توانید دانلود کنید
فلاکس ۲ کلاین ۴B ششم شده و این را نباید به عنوان «بد» خواند. ستون قیمت را کامل می برد (۰.۰۱۴ دلار، یعنی حدود یک چهارم رتبه اول) و تنها نامزدی است که در ستون بازی وزن ها اصلا امتیاز می گیرد. پنج ردیف دیگر همگی صفر گرفته اند، چون هیچکدام وزنی منتشر نکرده اند.
یعنی اگر شرط شما این باشد که مدل باید روی سخت افزار خودتان اجرا شود، این جدول شش گزینه ندارد، یک گزینه دارد. روی یک کارت گرافیک با حدود ۱۳ گیگابایت حافظه اجرا می شود و پروانه اش آپاچی ۲.۰ است، یعنی کار تجاری هم آزاد است. کیفیتش از بالای جدول فاصله دارد و این را باید بپذیرید؛ در عوض نه حساب کاربری می خواهد، نه کارت بانکی، و نه اینکه اسم کشورتان در فهرست کسی باشد.
ستون ایران امروز هیچکس را از هم جدا نمی کند
این را باید صریح بنویسیم چون از جدول پیدا نیست. سه نامزد در این ستون داده دارند: جی پی تی ایمیج ۲ و هر دو مدل گوگل. هر سه دقیقا یک وضعیت دارند، یعنی ایران در فهرست کشورهای پشتیبانی شده شان نیست و راه پرداخت رسمی هم ندارند. وقتی همه مقدارها برابر باشند، موتور به همه شان امتیاز کامل می دهد. پس این ستون بین سه تای اول هیچ تفاوتی نمی سازد.
کاری که واقعا می کند این است: سه نامزد دیگر را ده امتیاز جریمه می کند، نه به این دلیل که وضعشان بدتر است، بلکه به این دلیل که سازنده شان اصلا سندی منتشر نکرده که بشود خواند. برای فلاکس امروز فهرست کامل مستنداتشان را باز کردیم و نه صفحه شرایط استفاده دارد و نه فهرست کشور، و آدرس شرایط استفاده روی سایت اصلی ۴۰۴ می دهد. برای سیدریم هم بایت دنس چنین چیزی منتشر نکرده. یعنی این ستون در عمل دارد می سنجد که «سازنده فهرست کشور منتشر کرده یا نه»، و این با «از ایران کار می کند یا نه» یکی نیست. تا وقتی سند بیشتری پیدا نشود، همین است و پنهانش نمی کنیم.
دو معیاری که عمدا ساخته نشد
اول، سقف رزولوشن. سه سازنده سه چیز متفاوت می نویسند و این سه با هم جمع نمی شوند. گوگل برای مدل هایش «تا ۴K» می نویسد و هیچ جا ابعاد پیکسلی هیچکدام از پله های ۰.۵K تا ۴K را چاپ نمی کند. اوپن ای آی دقیق ترین است: ۳۸۴۰ پیکسل در ضلع بلند و مجموع پیکسل بین ۶۵۵۳۶۰ و ۸۲۹۴۴۰۰. بلک فارست لبز می گوید ۴ مگاپیکسل. یک برچسب بی عدد، یک عدد دقیق و یک واحد سوم؛ از این سه تا ستون در نمی آید. عددها را در فکت های هر مدل نگه داشتیم و ستون نساختیم.
دوم، متن داخل تصویر. برای فارسی زبان ها این مهم ترین سوال ممکن است، و دقیقا همان چیزی است که هیچکس عددش را منتشر نمی کند. گوگل متن مدل هایش را «پیشرفته» توصیف می کند. اوپن ای آی خودش می نویسد که هنوز ممکن است در متن مشکل داشته باشد. بلک فارست لبز فلکس را «تخصصی برای تایپوگرافی» می نامد. اینها سه صفت اند و هیچکدام اندازه گیری نیستند. ستونی که از صفت ساخته شود، ستون نیست. کلید این معیار در ساختار داده ما هست و خالی مانده، تا روزی که یکی عددش را چاپ کند.
چرا میدجرنی اصلا در جدول نیست
چون هیچ چیزی از آن نخوانده ایم. midjourney.com از سرور ما ۴۰۳ برمی گرداند: هم صفحه اصلی، هم صفحه به روزرسانی ها، هم مستنداتش. یک تفاوت با اوپن ای آی که ارزش نوشتن دارد: درباره openai.com دست کم robots.txt جواب می دهد و خزیدن را منع نکرده، ولی midjourney.com/robots.txt هم ۴۰۳ است، یعنی حتی قاعده ای که باید رعایت شود هم خوانده نمی شود.
و برخلاف اوپن ای آی که مدلش روی هر دو تخته ردیف اول دارد، میدجرنی روی هیچکدام از دو تخته تصویر آرنا نیست؛ هفتاد و هفت مدل در ساخت از متن و پنجاه و سه مدل در ویرایش، و اسمش در هیچکدام نبود. پس نه فکتی داریم و نه شاهدی، و ردیف بی عدد هم برایش نمی سازیم. اگر جایی خواندید میدجرنی بهترین است، بپرسید عددش کجاست.
یک ردیف که با نصف جدول رتبه گرفت
سیدریم ۵.۰ پرو چهارم شده در حالی که فقط دو ستون از شش ستون را پر کرده. روی هر دو تخته بالاست (پنجم در ویرایش، هشتم در ساخت از متن) و همین کافی بوده که از فلاکس ۲ مکس با اختلاف چهار دهم امتیاز جلو بیفتد، در حالی که فلاکس چهار ستون پر کرده. این را با احتیاط بخوانید: جای سیدریم در این جدول یعنی «روی دو چیزی که سنجیدیم خوب است»، نه «از فلاکس بهتر است».
دلیل خالی بودن آن چهار ستون هم فراموشکاری ما نیست. صفحه معرفی سیدریم ۵.۰ پرو باز می شود و پر از نمونه است، ولی نه شناسه مدل دارد، نه قیمت، نه سقف ورودی مرجع و نه تاریخ. صفحه سیدریم ۵.۰ کد ۲۰۰ می دهد و بدنه اش خالی است. پوشش این ردیف دقیقا ۵۰ از ۱۰۰ است، یعنی روی مرز: یک سلول خالی دیگر و از جدول می افتاد و زیرش در فهرست «داده کافی نداریم» می نشست.
چه وقت انتخاب اول ما را نگیرید
- اگر متن فارسی داخل تصویر می خواهید، این جدول جواب شما را ندارد: هیچ سازنده ای عددی درباره کیفیت متن منتشر نکرده و ما هم این شش مدل را روی فارسی آزمایش نکرده ایم.
- اگر دنبال یک اشتراک ماهانه با رابط گرافیکی هستید، اینجا جای درستی نیست؛ این جدول مدل ها را می سنجد و قیمت هایش قیمت هر تصویر روی API است.
- اگر باید محلی و بدون اینترنت اجرا شود، فقط ردیف آخر جدول به کارتان می آید و بقیه اصلا گزینه نیستند.
- اگر تصویر شما باید چند شخصیت ثابت داشته باشد، ترتیب این جدول را نگاه نکنید و مستقیم سراغ ستون مرجع بروید.
کجا کم می آورد
- سقف رزولوشن ستون ندارد، چون سه سازنده سه واحد ناسازگار منتشر می کنند.
- کیفیت متن داخل تصویر ستون ندارد، چون هیچکس عددش را منتشر نکرده.
- ستون ایران امروز بین سه نامزد اولی که سند دارند هیچ تفاوتی نمی سازد.
- قیمت ها به یک اندازه مشخص گره خورده اند و برای فلاکس مگاپیکسلی است، یعنی عدد جدول کف است نه قیمت یک تصویر بزرگ.
- سیدریم ۵.۰ پرو با پوشش ۵۰ درصدی رتبه گرفته و جایگاهش را باید با همین قید خواند.
- امتیازهای آرنا به پیکربندی سرویس دهی گره خورده اند: ردیف اول «کیفیت متوسط» است و ردیف نانو بنانا ۲ پسوند جستجوی وب دارد.
- میدجرنی در جدول نیست چون هیچ صفحه ای از آن برای سرور ما باز نمی شود و روی هیچکدام از دو تخته هم ردیف ندارد.
- ما این شش مدل را خودمان کنار هم روی یک پرامپت اجرا نکرده ایم؛ همه عددها منتشرشده اند.
نظر ما
اگر یکی را باید انتخاب کنید و بودجه قید اصلی نیست، جی پی تی ایمیج ۲ روشن ترین انتخاب این جدول است و با فاصله می برد. اگر هزینه مهم است نانو بنانا ۲ بردارید و تفاوت را احتمالا در کار روزمره نبینید. و اگر شرطتان این است که مدل مال خودتان باشد و جایی نرود، فلاکس ۲ کلاین ۴B تنها گزینه است و باید با کیفیت پایین ترش کنار بیایید. سه جواب متفاوت برای سه شرط متفاوت، و هیچکدام «بهترین» بی قید نیست.
پرسش هایی که واقعا پرسیده می شود
بهترین هوش مصنوعی ساخت عکس کدام است
جی پی تی ایمیج ۲، چون تنها مدلی است که هر دو لیدربورد آرنا را می برد. اگر قیمت مهم است نانو بنانا ۲ نتیجه نزدیکی با هزینه کمتر می دهد.
ارزان ترین هوش مصنوعی ساخت عکس کدام است
فلاکس ۲ کلاین ۴B با شروع از ۰.۰۱۴ دلار برای هر تصویر. اگر محلی اجرایش کنید هزینه ای به سازنده نمی دهید، چون وزنش زیر پروانه آپاچی ۲.۰ منتشر شده.
کدام هوش مصنوعی متن فارسی داخل تصویر می نویسد
نمی دانیم و هیچ سازنده ای در این باره عددی منتشر نکرده. سه تا از آنها متنشان را با صفت هایی مثل پیشرفته توصیف می کنند ولی هیچکدام درباره فارسی حرف نزده اند. ما هم این را آزمایش نکرده ایم و تا نکنیم، چیزی نمی نویسیم.
کدام مدل تصویر را می شود روی کامپیوتر خودم اجرا کرد
فقط فلاکس ۲ کلاین ۴B، که وزنش زیر آپاچی ۲.۰ منتشر شده و روی کارت گرافیکی با حدود ۱۳ گیگابایت حافظه اجرا می شود. پنج مدل دیگر این جدول هیچ وزنی منتشر نکرده اند.
از ایران می شود از اینها استفاده کرد
برای جی پی تی ایمیج ۲ و هر دو مدل گوگل، ایران در فهرست کشورهای پشتیبانی شده نیست و راه رسمی وجود ندارد. برای فلاکس و سیدریم اصلا سندی منتشر نشده که بشود خواند. ما اکانت نمی فروشیم و راه دور زدن پیشنهاد نمی کنیم.
چرا میدجرنی در این جدول نیست
چون سایتش از سرور ما ۴۰۳ برمی گرداند و حتی robots.txt آن هم باز نمی شود، و روی هیچکدام از دو تخته تصویر آرنا هم ردیف ندارد. نه فکتی داریم و نه شاهدی، پس ردیف بی عدد هم نمی سازیم.
اگر نتیجه باید یک تصویر آماده انتشار باشد و نه یک خروجی خام، این همان کاری است که در خدمت طراحی گرافیک