الفئة

أفضل ذكاء اصطناعي للتعليق الصوتي

يتصدر إيليفن لابز v3 هذا الجدول اليوم، لأنه النموذج المتقدم الوحيد الذي يدرج الفارسية ضمن لغاته ويتيح بناء صوت جديد برخصة تجارية. والأمر الذي يفاجئ أكثر الناس: النموذج الأسرع والأرخص من الشركة نفسها لا يقرأ الفارسية إطلاقا.

  • ستة نماذج بأدلة حقيقية
  • وزن الفارسية 35 من 100
  • عمود الوصول من إيران

آخر تحقق: هذه صفحة مرجعية. نعيد التحقق منها من مصادر الشركة المطوّرة ونحدّثها عند صدور أي إصدار جديد. ما الذي تغيّر

من أين تأتي نتيجة كل أداة

الحلقة أدناه هي الأوزان نفسها المكتوبة في رؤوس أعمدة الجدول.

100الأوزان
  • يقرأ الفارسية 35
  • التحكم بالصوت 30
  • عدد اللغات 25
  • الوصول من إيران 10

نحن اخترنا هذه الأوزان، وهذا هو الحكم الوحيد في الجدول. بأوزان أخرى يصبح الترتيب مختلفا.

ترتيب اليوم، من قوائم اللغات التي تنشرها الشركات

قُرئ مستوى كل نموذج في الفارسية من قائمة اللغات التي تنشرها شركته، لا من الاستماع. والنموذج الذي لا تنشر شركته قائمة لغات يبقى غير موثّق في هذا العمود.

أفضل ذكاء اصطناعي للتعليق الصوتي
الترتيب الأداة النتيجة يقرأ الفارسية 35 التحكم بالصوت 30 عدد اللغات 25 الوصول من إيران 10
1 ElevenLabs v3 الخيار الحالي 99.0 1/2 3/3 74 لغة المصدر: elevenlabs.io محجوب / لا طريق يعمل
2 Gemini 3.1 Flash TTS 80.0 1/2 1/3 77 لغة المصدر: ai.google.dev محجوب / لا طريق يعمل
3 GPT-4o mini TTS 55.0 1/2 1/3 غير موثّق محجوب / لا طريق يعمل
4 ElevenLabs Flash v2.5 49.4 0/2 3/3 32 لغة المصدر: elevenlabs.io محجوب / لا طريق يعمل
5 ElevenLabs Multilingual v2 48.3 0/2 3/3 29 لغة المصدر: elevenlabs.io محجوب / لا طريق يعمل
6 Amazon Nova Sonic 0.0 0/2 0/3 5 لغة المصدر: docs.aws.amazon.com غير موثّق

الخلية الفارغة تعني أننا لم نتمكن من التحقق من الرقم، لا أن الأداة حصلت على صفر.

خلف كل رقم

لكل درجة تقديرية في هذا الجدول سبب مكتوب، وعمود إيران يقول كيف جرى التحقق. هذان مفتوحان هنا. أما أثر القياس خلف كل رقم، أي من أي صف في أي لوحة وعلى كم صوت، فيُفتح تحت النموذج الذي يخصه.

1 ElevenLabs v3

يقرأ الفارسية 1/2 الفارسية مكتوبة برمز fas في قائمة الـ74 لغة لهذا النموذج في توثيق إيليفن لابز. ولا يُسمّى صوت خاص بالفارسية، فلا يبلغ المستوى الثاني.

التحكم بالصوت 3/3 استنساخ الصوت من عينة، مع رخصة تجارية من مستوى Creator فما فوق. تذكر صفحة الأسعار الاستنساخ الفوري من Starter والاحترافي من Creator.

الوصول من إيران محجوب / لا طريق يعمل تذكر شروط استخدام إيليفن لابز إيران بالاسم: يقر المستخدم بأنه ليس في بلد خاضع لعقوبات اقتصادية أمريكية، وإيران مكتوبة في تلك القائمة. قرأنا ذلك في بند ضوابط التصدير في الصفحة نفسها لا باختبار شبكة.

2 Gemini 3.1 Flash TTS

يقرأ الفارسية 1/2 الفارسية مدرجة في قائمة لغات صفحة توليد الكلام لدى غوغل. ولا تسمي غوغل صوتا خاصا بالفارسية وتقول إن النموذج يكتشف لغة الإدخال تلقائيا، فلا يبلغ المستوى الثاني.

التحكم بالصوت 1/3 ثلاثون صوتا جاهزا مع التحكم بالنبرة عبر تعليمات نصية. وإنشاء صوت جديد من عينة غير مطروح في هذه الصفحة.

الوصول من إيران محجوب / لا طريق يعمل تسرد صفحة المناطق المتاحة لواجهة Gemini الدول التي تعمل فيها الواجهة، وإيران ليست في تلك القائمة. قرئ هناك ولم يُقَس.

3 GPT-4o mini TTS

يقرأ الفارسية 1/2 الفارسية مدرجة صراحة ضمن اللغات المدعومة في دليل تحويل النص إلى كلام لدى أوبن إيه آي. ولا يُسمّى صوت خاص بالفارسية، فلا يبلغ المستوى الثاني.

التحكم بالصوت 1/3 ثلاثة عشر صوتا جاهزا مع التحكم بالنبرة عبر تعليمات. وإنشاء صوت جديد من عينة ليس في هذا الدليل.

الوصول من إيران محجوب / لا طريق يعمل إيران ليست في قائمة الدول المدعومة في توثيق مطوّري أوبن إيه آي. قرئ هناك ولم يُقَس.

4 ElevenLabs Flash v2.5

يقرأ الفارسية 0/2 قائمة الـ32 لغة لهذا النموذج في توثيق إيليفن لابز لا تتضمن الفارسية. العربية والتركية موجودتان، والفارسية لا.

التحكم بالصوت 3/3 استنساخ الصوت من عينة، مع رخصة تجارية من مستوى Creator فما فوق. تذكر صفحة الأسعار الاستنساخ الفوري من Starter والاحترافي من Creator، والاستعمال التجاري في المستويات نفسها.

الوصول من إيران محجوب / لا طريق يعمل تذكر شروط استخدام إيليفن لابز إيران بالاسم: يقر المستخدم بأنه ليس في بلد خاضع لعقوبات اقتصادية أمريكية، وإيران مكتوبة في تلك القائمة. قرأنا ذلك في بند ضوابط التصدير في الصفحة نفسها لا باختبار شبكة.

5 ElevenLabs Multilingual v2

يقرأ الفارسية 0/2 قائمة الـ29 لغة لهذا النموذج في توثيق إيليفن لابز لا تتضمن الفارسية.

التحكم بالصوت 3/3 استنساخ الصوت من عينة، مع رخصة تجارية من مستوى Creator فما فوق. تذكر صفحة الأسعار الاستنساخ الفوري من Starter والاحترافي من Creator، والاستعمال التجاري في المستويات نفسها.

الوصول من إيران محجوب / لا طريق يعمل تذكر شروط استخدام إيليفن لابز إيران بالاسم: يقر المستخدم بأنه ليس في بلد خاضع لعقوبات اقتصادية أمريكية، وإيران مكتوبة في تلك القائمة. قرأنا ذلك في بند ضوابط التصدير في الصفحة نفسها لا باختبار شبكة.

6 Amazon Nova Sonic

يقرأ الفارسية 0/2 تسمّي أمازون خمس لغات لهذا النموذج: الإنجليزية الأمريكية والبريطانية والفرنسية والإيطالية والألمانية والإسبانية. وليست الفارسية منها.

التحكم بالصوت 0/3 أصوات جاهزة من الشركة. وإنشاء صوت جديد من عينة غير مطروح في توثيق نوفا.

لا توجد بيانات موثّقة كافية للترتيب

هذه أدوات حقيقية نتابعها، لكن أكثر من نصف معاييرها بلا رقم موثّق حتى الآن، فترتيبها سيكون تخمينا.

كيف يُحسب هذا الترتيب

كل معيار أدناه له وزن ومصدر. غيّر وزنا فيُعاد حساب الجدول كله. لا يوجد ترتيب موضوع باليد في أي مكان من هذا المرجع.

المعيار الوزن الدليل
يقرأ الفارسية 35 مقياس مُعرَّف، مع سبب مكتوب لكل تقييمفي هذه الفئة للمخرجات نفسها لغة، فالنموذج بلا فارسية هو صفر للنص الفارسي لا أضعف قليلا
التحكم بالصوت 30 مقياس مُعرَّف، مع سبب مكتوب لكل تقييمالعمل الصوتي يعني صوتا محددا. وحفنة أصوات جاهزة ليست كبناء صوت جديد، والرخصة التجارية جزء من ذلك
عدد اللغات 25 مواصفة معلنة من الشركةيُحسب فقط حيث تطبع الشركة القائمة كاملة أو تذكر عددا قاطعا
الوصول من إيران 10 عمود الوصول عندنا، بطريقته المعلنةوزنه خفيف لأن موضعه الأصلي صفحة الذكاء الاصطناعي في إيران، لكنه ليس صفرا

الفخ الذي يقع فيه أكثر الناس

لدى إيليفن لابز ثلاثة نماذج لتحويل النص إلى كلام. والفارسية مدرجة في قائمة واحد منها فقط.

يحمل v3 قائمة من 74 لغة مكتوبة فيها الفارسية برمز fas. ويحمل Flash v2.5 اثنتين وثلاثين لغة وMultilingual v2 تسعا وعشرين، والفارسية ليست في أي منهما. والمشكلة أن Flash v2.5 هو النموذج الذي يتجه إليه الناس: الأسرع بـ75 مللي ثانية، وحد حروفه ثمانية أضعاف v3 (أربعون ألفا مقابل خمسة آلاف)، وهو الأرخص.

فيسجّل أحدهم، ويختار النموذج السريع، ويعطيه نصا فارسيا، فتأتي النتيجة رديئة، فيستنتج أن إيليفن لابز لا يجيد الفارسية. والأدق أن ذلك النموذج لا يجيدها.

لماذا وزن الفارسية 35

في فئة البرمجة ليست لغة المخرجات هي السؤال. وهنا المخرجات صوت، وللصوت لغة. والنموذج الذي يقرأ سبعين لغة وليست الفارسية بينها هو صفر لمن لديه نص فارسي، لا أضعف قليلا. ولا يمثّل ذلك بصدق أي توزيع أوزان آخر.

قُرئت المستويات من قائمة لغات كل شركة، لا من الاستماع. فهذا العمود يخبر بما أعلنته الشركة، لا بجودة اللكنة. والسؤال الثاني يحتاج أذنين ولم نستعمل أذنينا بعد.

ثلاثة معايير تُركت عمدا

زمن الاستجابة. إيليفن لابز وحدها تطبع رقما (75 مللي ثانية لـFlash و280 لـv3 الحواري). ولا تنشر غوغل ولا أوبن إيه آي شيئا. والمعيار الذي له أرقام لمرشحَين من ستة يجرّ البقية إلى الأسفل بلا سبب.

السعر. تبيع إيليفن لابز أرصدة شهرية، وتحاسب غوغل وأوبن إيه آي بالرموز، وتسلّمك ميسترال الأوزان بلا مقابل. ولا تجتمع هذه في عمود واحد.

عدد الأصوات الجاهزة. لدى غوغل ثلاثون ولدى أوبن إيه آي ثلاثة عشر، لكن إيليفن لابز تتيح بناء صوت جديد. وحين يمكنك البناء يفقد عدّ الجاهز معناه.

لم يبلغ أحد المستوى الثاني

لمقياس الفارسية ثلاثة مستويات، والثاني يعني أن تسمّي الشركة صوتا خاصا بالفارسية. ولا يبلغه أي مرشح اليوم. تقول غوغل إن النموذج يكتشف لغة الإدخال تلقائيا ولا تسمّي صوتا فارسيا؛ وأوبن إيه آي لا تربط أصواتها الثلاثة عشر بلغات. فكل هذه النماذج تقرأ الفارسية بصوت لم يُبنَ للفارسية.

تناقض يجب قوله بصراحة

النموذج الذي جاء أولا في هذا الجدول تذكر شروط استخدامه إيران بالاسم. فبند ضوابط التصدير لدى إيليفن لابز يجعل المستخدم يقر بأنه ليس في بلد خاضع لعقوبات اقتصادية أمريكية، وإيران مكتوبة في تلك القائمة.

نكتب ذلك لأنه صحيح وإخفاؤه لا يفيد أحدا. وما لا نكتبه هو كيفية الالتفاف عليه. لا نبيع حسابات ولا نحيل إلى وسطاء ولا نصف طريقا لتجاوز عقوبة.

نموذج بأوزان مفتوحة لا يؤدي عملك

فوكسترال TTS من ميسترال هو النموذج الوحيد في هذا الجدول الذي تُنشر أوزانه، فيعمل على عتادك دون قائمة دول تعترضه. ورخصته CC BY-NC 4.0، وحرفا NC يعنيان منع الاستعمال التجاري.

وفي فئة كل غرضها العمل الصوتي المأجور، هذا بالضبط ما تريد فعله. فالنموذج الأفضل من حيث الوصول هو الأعقم من حيث الرخصة. ولا تنشر ميسترال قائمة لغات له، فيبقى عمود الفارسية غير موثّق ولا يحمل ترتيبا.

متى لا تأخذ خيارنا الأول

  • إن كنت تعمل بالإنجليزية فقط والسرعة تهمك، فFlash v2.5 من الشركة نفسها خيار أفضل بـ75 مللي ثانية، وترتيبه الأدنى هنا سببه الفارسية وحدها.
  • إن أردت استضافة النموذج بنفسك فلا تنفعك الصفوف الثلاثة الأولى، وعليك بفوكسترال مع التحفظ على رخصته.
  • إن كان عملك تفريغ الصوت إلى نص لا التعليق الصوتي، فهذا الجدول ليس جوابك. نماذج Scribe وVoxtral Transcribe تفعل شيئا آخر.

حيث تُقصّر

  • قُرئ مستوى الفارسية من قائمة اللغات المنشورة لا من الاستماع. ولم نحكم على جودة اللكنة.
  • لا عمود سعر هنا إطلاقا، لأن وحدات الشركات الثلاث غير قابلة للمقارنة.
  • زمن الاستجابة منشور لنماذج إيليفن لابز فقط، فلم يدخل الترتيب.
  • قُرئ عمود إيران من صفحات سياسات الشركات لا بقياس من اتصال داخل إيران.

رأينا

إن كان لديك نص فارسي وتريد صوتا محددا، فإيليفن لابز v3 هو الخيار الوحيد اليوم الذي يمنحك الاثنين. واضبط النموذج على v3 يدويا، فالافتراضي الأسرع هو الذي بلا فارسية.

أسئلة يطرحها الناس فعلا

هل يدعم إيليفن لابز الفارسية

يعتمد على النموذج. يحمل v3 قائمة 74 لغة فيها الفارسية برمز fas. ويحمل Flash v2.5 وMultilingual v2 اثنتين وثلاثين وتسعا وعشرين لغة وليست الفارسية في أي منهما. فإن أردت الفارسية فاضبط النموذج على v3 يدويا.

ما أفضل ذكاء اصطناعي لتحويل النص إلى صوت

بحسب جدول هذه الصفحة، إيليفن لابز v3. ثلاثة نماذج تدرج الفارسية، ومن بينها v3 وحده يتيح بناء صوت جديد برخصة تجارية.

ما جودة اللكنة في هذه النماذج

لا نعلم ولا ندّعي. يخبر هذا الجدول بما إذا كانت الشركة تدرج اللغة ضمن لغاتها. والحكم على اللكنة يحتاج اختبار استماع لم نُجرِه بعد.

هل يوجد نموذج مجاني أو مفتوح للتعليق الصوتي

لفوكسترال TTS من ميسترال أوزان مفتوحة، لكن رخصته CC BY-NC 4.0 تمنع الاستعمال التجاري. ولا تنشر ميسترال قائمة لغاته، فلا نعلم إن كان يقرأ الفارسية.

نستطيع تنفيذ الصوت لفيديوك

خدمات الموشن جرافيك والتعليق الصوتي