الترجمة

كيف تعمل الترجمة الآلية، من جوجل ترانسليت إلى النماذج اللغوية

الترجمة الآلية هي تحويل نص من لغة إلى أخرى ببرمجية دون تدخل إنسان في لحظة الترجمة. وقد تعاقبت أربعة أجيال، وأهم ما يميز الأخير ليس أنه يترجم أفضل بل أن أخطاءه لم تعد تشبه أخطاء الآلة.

  • الدرس 2 من 6
  • مبتدئ
  • مجاني، دون تسجيل

أربعة أجيال من الترجمة الآلية، وما تغيّر في كل مرة

الترتيب هو هذا. أما التأريخ الدقيق فمتروك عمدا، لأن الأجيال متداخلة ولا يوم واحد يفصل بين اثنين منها.

  1. 1

    قائم على القواعد

    معجم مضافا إليه قواعد نحوية كتبها الناس بأيديهم. كان متوقعا وينكسر على أي جملة لم يتوقعها أحد.

  2. 2

    إحصائي

    تعلّم من حجم كبير من النصوص الثنائية اللغة أي عبارة تقترن بأي عبارة. صار أسلس وظل يعمل عبارة عبارة.

  3. 3

    عصبي

    يحوّل الجملة كلها إلى تمثيل عددي ويعيد بناء جملة الهدف منه. هنا كفّت الترجمة الآلية العامة عن كونها نكتة.

  4. 4

    نموذج لغوي

    نموذج عام الترجمة فيه مهمة من مهام كثيرة، ويتلقى تعليمات: القارئ والنبرة والكلمات التي لا تُمس.

لم يُحل الجيل الجديد الجيل السابق على التقاعد. فحصة كبيرة من الترجمة الآلية العاملة داخل منتجات حقيقية اليوم لا تزال عصبية، وهي للأعمال الكثيفة المتكررة تبقى الخيار الصحيح.

آخر مراجعة: تُراجع الحقائق وأسماء الأدوات في هذا الدرس مقابل مصادرها في هذا التاريخ.

تغيّرت الترجمة الآلية أربع مرات، وما الذي تغيّر في كل مرة

بدأت الترجمة الآلية من فكرة بسيطة: أعطِ الحاسوب معجما وقواعد النحو وينبغي أن يقدر على بناء جملة. وكان الجيل الأول هذا بالضبط، والناس يكتبون القواعد بأيديهم. وكان ناتجه متوقعا، وأي جملة لم يتوقعها كاتب القواعد كانت تكسره.

وأسقط الجيل الثاني القواعد ولجأ إلى الإحصاء. فبدل أن يُقال للنظام ما هو النحو، أُعطي حجما كبيرا من النصوص الثنائية اللغة وتُرك ليحسب بنفسه أي عبارة تقترن عادة بأي عبارة. فصارت الجمل أسلس وظلت تفوح منها رائحة الآلة، لأن النظام كان يعمل عبارة عبارة ولا يرى الجملة كاملة.

والجيل الثالث هو حيث كفّت الترجمة الآلية العامة عن كونها نكتة. فالنماذج العصبية تحوّل الجملة كلها إلى تمثيل عددي وتعيد توليد جملة الهدف منه. وكانت النتيجة جملا ذات بنية صحيحة يستطيع المرء قراءتها دون أن يضحك.

والجيل الرابع هو النموذج اللغوي، وفرقه عن الثلاثة قبله فرق في النوع لا في الدرجة. فالثلاثة الأولى لم تكن تعرف إلا عملا واحدا. أما النموذج اللغوي فنموذج عام الترجمة فيه مهمة من مهام كثيرة، والأهم أنه يتلقى تعليمات: يمكنك أن تخبره من القارئ، وما ينبغي أن تكون عليه النبرة، وأي الكلمات لا يمسّها. ولم يكن أي من الأجيال الثلاثة السابقة يفهم شيئا من ذلك.

ويحسن هنا تصحيح تصور شائع خاطئ: هذه الأجيال الأربعة لم يحل بعضها محل بعض. فحصة كبيرة من الترجمة الآلية العاملة داخل منتجات حقيقية اليوم لا تزال عصبية لا نموذجا لغويا، وهي لكثير من الأعمال الخيار الصحيح.

الترجمة الآلية: من جوجل ترانسليت إلى النماذج اللغوية

أين يتفوق النموذج اللغوي فعلا على الترجمة الآلية الكلاسيكية

ثلاثة مواضع، وكلها ترجع إلى أمر واحد: النموذج اللغوي يرى خارج الجملة.

أولها السياق. فالضمير الغامض أو الكلمة ذات المعنيين يُتركان للحظ في الترجمة الآلية الكلاسيكية، لأن النظام لا يملك إلا تلك الجملة. أما النموذج اللغوي فيستطيع قراءة بقية الفقرة، وإن أخبرته بموضوع النص كفّ تخمينه عن أن يكون تخمينا.

وثانيها النبرة. لا يمكنك أن تخبر محرك ترجمة كلاسيكيا بأن هذا النص لعميل وينبغي أن يكون رسميا دافئا. أما النموذج اللغوي فيمكنك ذلك ويظهر أثره. ومسألة المستوى اللغوي التي أثيرت في الدرس الأول من هذا المسار صارت لأول مرة شيئا يمكن إصداره كتعليمة.

وثالثها اتساق المصطلح على امتداد وثيقة. فإن أعطيت النموذج قائمة مصطلحات أمكنك أن تشترط أن يستعمل الفصل السابع المقابل الذي استعمله الفصل الأول. وهذا ما تفشل فيه المواقع متعددة اللغات أكثر من أي شيء آخر.

وثمة شرط مهم يسري على الثلاثة: هذه إمكانات لا سلوك افتراضي. فبلا سياق ولا نبرة ولا قائمة مصطلحات يتصرف النموذج اللغوي تصرف المحرك الكلاسيكي تماما، بجمل أسلس فحسب. ومن يكتفي بلصق النص وضغط الزر لا ينال من هذا الجيل شيئا سوى مزيد من السلاسة.

نوعان من الخطأ، وأيهما تراه

كلاهما يخطئ. والفرق في أي منهما يعلن خطؤه عن نفسه.

الترجمة الآلية الكلاسيكية

  • تتفكك الجمل وتسقط الأفعال
  • يُرى الخطأ بنظرة واحدة
  • لا يتلقى تعليمات ولا يفهم نبرة
  • رخيص ومتوقع في الحجم الكبير

نموذج لغوي

  • الجملة صحيحة وقد يكون المصطلح مختلقا
  • الخطأ سلس ويخفي نفسه
  • يتلقى السياق والنبرة وقائمة المصطلحات
  • وبلا تلك التعليمات يتصرف كالجيل السابق

هذا الجدول لا يقول أيهما يترجم أفضل، بل أيهما أغلى في المراجعة. فللنص الذي يُراد فهمه فقط، العمود الأيمن أفضل ما لدينا؛ وللنص الذي يُوقّع، يحتاج العمود الأيمن مراجعة أكثر لا أقل.

أين هو أخطر من الجيل السابق

حين كانت الترجمة الآلية القديمة تخطئ كان الأمر بيّنا. تتفكك الجملة ويسقط فعل، ويرى القارئ بنظرة أن آلة كتبت هذا وأنه يحتاج مراجعة. كانت تلك الأخطاء قبيحة، والقبح نفسه كان تحذيرا.

وقد أزال النموذج اللغوي ذلك التحذير. فأخطاؤه سلسة. جملة صحيحة ونبرة مناسبة، وفي وسطها مصطلح لا يستعمله أحد في ذلك المجال. ومن لا يعرف المجال لا سبيل له إلى التقاطه، لأن لا شيء في النص يبدو نابيا.

وأخطر صوره اختلاق المصطلحات بثقة. فبدل أن يقول إنه لا يعرف، ينتج النموذج مقابلا سليم البنية يبدو محترفا ولا وجود له في أي مصدر. وفي نص طبي أو قانوني، هذا بالضبط مصدر الضرر المالي والبشري. وقد شُرح هذا السلوك بتوسع أكبر في درس هلوسة الذكاء الاصطناعي، وهو يأخذ في الترجمة صورة أسوأ، لأن قارئ النص الهدف لا يملك المصدر أصلا ليقارن به.

وموقفنا صريح: للنص الذي يُراد فهمه فقط، هذا الجيل أفضل ما امتلكناه يوما. أما للنص الذي سيُنشر أو يُوقّع، فهذا الجيل أخطر من سابقه لا أأمن، وذلك بالضبط لأنه ينوّم المراجع.

أي نموذج يسمّي الفارسية فعلا

«متعدد اللغات» ادعاء تسويقي إلى أن تطبع الشركة الصانعة قائمة اللغات. وقد اتخذنا ذلك معيارا في فئة الترجمة في قسم الذكاء الاصطناعي بهذا الموقع، والنتيجة صفّان لا يكتمل أي منهما.

في جهة كوهير. فـ Command A Translate هو النموذج الوحيد في ذلك الكاتالوج الذي سمّاه صانعه صراحة نموذج الترجمة الآلية لديه وأورد لغاته الثلاث والعشرين واحدة واحدة، ولغات هذا الموقع الأربع كلها في تلك القائمة. والوجه الآخر أن نافذته ٨ آلاف رمز، أقصر نافذة في الكاتالوج كله، وأن اتفاقية كوهير التجارية نفسها تكتب اسم إيران في تعريف الموقع المقيّد. أي أن النموذج الذي يعرف الفارسية لا سبيل رسمي لشرائه من إيران.

وفي الجهة الأخرى ميتا. فهي تطرح لاما ٤ بأوزان مفتوحة وبرخصة تسمح بالاستخدام التجاري، أي يمكنك أخذه وتشغيله على خادمك. وقائمة لغاته اثنتا عشرة وهي مغلقة: العربية فيها، والفارسية والتركية ليستا. ونسخة سكاوت منه بنافذة عشرة ملايين رمز.

احفظ هذا الانقلاب، فهو يحدد شكل أي مشروع لترجمة موقع. فالنموذج الذي يسمّي لغتك يتسع لبضع صفحات، والذي لا يسمّيها يتسع لكتاب. والنتيجة العملية أنك تترجم الموقع صفحة صفحة لا دفعة واحدة، وإن أردت تمرير وثيقة طويلة مرة واحدة فأنت تختار عن علم نموذجا لم يُبن للترجمة ولم يعلن لغتك.

وثمة نقطة ترخيص يدركها كثيرون متأخرا: انفتاح الأوزان وحرية الاستخدام ليسا شيئا واحدا. فنموذج مثل آيا إكسبانس نشرت أوزانه ويسمّي اللغات فعلا، لكن رخصته غير تجارية؛ فإن ترجمت به موقع عميل وأخذت أجرا فقد خالفت الرخصة.

النموذج الذي يسمّي لغتك والنموذج الذي تستطيع تشغيله

كفتان لا تمتلئان معا أبدا في هذه الفئة. والعمودان كلاهما من الملفات الموثقة في قسم الذكاء الاصطناعي بهذا الموقع.

يسمّي الفارسية

  • سمّاه صانعه نموذج ترجمة صراحة
  • أوردت لغاته الثلاث والعشرين واحدة واحدة
  • نافذته ٨ آلاف رمز، أقصر ما في ذلك الكاتالوج
  • يكتب عقد الشركة اسم إيران

يمكنك تشغيله

  • أوزانه مفتوحة ويعمل على خادمك أنت
  • قائمة لغاته اثنتا عشرة وهي مغلقة
  • الفارسية والتركية ليستا في تلك القائمة
  • نسخة سكاوت منه بنافذة عشرة ملايين رمز

لا يقول أي من العمودين شيئا عن جودة الترجمة. بل يقولان ما أعلنته الشركة وما تسمح به الرخصة؛ أما قراءة الناتج فعمل آخر لم يُنجز هنا.

ماذا يعني كل هذا لموقع متعدد اللغات

ثلاث نتائج عملية، ولا علاقة لأي منها باختيار أفضل نموذج.

الأولى أن وحدة عملك هي الصفحة لا الموقع. فالنافذة القصيرة لنماذج الترجمة المخصصة تفرض ذلك، وهي مصادفةً أفضل للمراجعة أيضا، لأن خطأ صفحة واحدة يُكتشف في تلك الصفحة. والثانية أن قائمة المصطلحات ينبغي أن تُكتب قبل الصفحة الأولى وأن تسافر مع النص في كل مكالمة، وإلا فالاتساق الموصوف في القسم الثاني لا يحدث ببساطة. والثالثة أن المراجعة البشرية تتركز على الصفحات التي يمر بها قرار أو دفعة مالية، لا أن تتوزع بالتساوي على كل صفحة.

وثمة قول أمين نادرا ما يُكتب. لم تنشر أي من الشركات التي فحصناها في تلك الفئة رقما قابلا للاستشهاد لجودة ترجمة نموذجها. فكوهير تكتب أن Command A Translate نموذجها المتقدم للترجمة ولا تطبع أي نتيجة؛ والبقية لا تطبع كذلك. فأي جدول بالفارسية يدّعي أنه رتّب «أفضل ذكاء اصطناعي للترجمة» فهو إما يستعمل مقياسا خارجيا وعليه أن يقول أيّه، وإما يختلق أرقامه.

ونقول الشيء نفسه عن أنفسنا: تلك الفئة تخبرك أي شركة أدرجت لغتك لذلك النموذج بعينه، لا كم تبدو ترجمته طبيعية. ومعرفة الثانية تعني قراءة الناتج، وذلك عمل آخر لم ندّعِ أننا قمنا به.

المسار السريع مع الذكاء الاصطناعي

الافتراض الشائع أن النموذج اللغوي يتفوق دائما على المحرك الكلاسيكي، وهذا الافتراض خاطئ لبعض النصوص. فعلى النص البسيط المتكرر يكاد الفرق بين الجيلين يبلغ الصفر وأنت تدفع مقابل لا شيء؛ وعلى النص المليء بالإحالات والمصطلحات يكون الفرق نفسه هو كل الحكاية. ويستغرق الأمر عشرين دقيقة، مرة واحدة لكل نوع نص، لتعرف في أي الحالتين أنت، وبعدها لا تعود بحاجة إلى التخمين.

  1. خذ فقرة ممثلة من ذلك النوع من النصوص، ولا تختر أسهلها. خذ فقرة فيها على الأقل ضمير مرجعه إلى الوراء ومصطلح متخصص واحد، لأن الفرق بين الجيلين لا يظهر إلا هناك.
  2. شغّل المرور الأول بلا أي إضافة: الفقرة وسطر واحد يقول ترجم هذا إلى اللغة الهدف. وهذا هو الجيل الكلاسيكي محاكى بنموذج حديث.
  3. شغّل المرور الثاني بالنموذج نفسه والفقرة نفسها، لكن ضع فوقها هذه المرة الأمور الأربعة من الدرس الأول: من القارئ، وما الذي على النص أن يفعله، وأين يقع المستوى اللغوي، وأي الكلمات لا تُترجم.
  4. أعطِ الناتجين للنموذج في مكالمة جديدة وشغّل الوصفة أدناه. وافتح لها محادثة جديدة؛ فطلب المقارنة في المكان نفسه الذي أنتجهما فيه يعني أنه يحكم على عمله هو.
  5. والآن اقرأ الأصناف وحدها. فإن وقعت كل الفروق في صنف الأسلوب والمستوى اللغوي، فهذا النوع من النصوص لا يحتاج بيان سياق ويمكن ترجمته رخيصا وبالجملة. وإن وقع واحد ولو واحد في صنف المصطلح أو المرجع، فهذا النوع حساس للسياق وكل دفعة منه ينبغي أن تسافر مع ذلك البيان.

وصفة جاهزة للنسخ

لديك ترجمتان لنص مصدر واحد.

النص المصدر:
{النص المصدر}

الترجمة أ:
{ناتج المرور الأول}

الترجمة ب:
{ناتج المرور الثاني}

اذكر الفروق وحدها وضع كل فرق في واحد من هذه الأصناف الأربعة:

١) الأسلوب: تغيّرت كلمة أو بنية وبقي المعنى كما هو.
٢) المستوى اللغوي: تغيّرت درجة الرسمية.
٣) المصطلح: تغيّر مقابل مصطلح متخصص.
٤) المرجع: صار ضمير أو إشارة يعود إلى شيء آخر.

انقل الصورتين حرفيا في كل بند. ولا تسمِّ إحداهما أفضل أو أسوأ ولا تقترح صورة ثالثة. وإن كان صنف فارغا فاتركه فارغا.

قبل أن تثق بالناتج: هذا تشخيص لا حكم. فالصنفان الثالث والرابع هما بالضبط حيث يؤدي النموذج أسوأ عمله، فتحقق بنفسك من كل بند وضعه فيهما بالرجوع إلى مصدر حقيقي في ذلك المجال، ولا تثق بتصنيفه. وفقرة واحدة عينة واحدة: فإن خرج المروران متطابقين على أصعب فقرة لديك، فذلك قول عن ذلك النوع من النصوص لا رخصة تشمل كل ما تترجمه.

الذكاء الاصطناعي في هذا العمل

في هذا الموضوع ليس السؤال المفيد أيهما أفضل. السؤال المفيد هو: هل سمّى الصانع لغتك لذلك النموذج بعينه، وهل تستطيع الوصول إليه أصلا. وقد طبّقنا في قسم الذكاء الاصطناعي بهذا الموقع هذين المعيارين بالضبط على مرشحي هذه الفئة فخرج صفّان لا يستوفي أي منهما الشرطين معا. وكل أداة أدناه معرّفة بهذين السؤالين لا بادعاء جودة.

أدوات تساعد فعلا

  • Cohere وثائقها نفسها تقدّم Command A Translate بوصفه نموذج الترجمة الآلية لديها وتورد لغاته الثلاث والعشرين، ومنها الفارسية والعربية والتركية والإنجليزية. ونافذته ٨ آلاف رمز، واتفاقيتها التجارية نفسها تكتب اسم إيران في تعريف الموقع المقيّد.
  • Llama 4 Scout أوزان مفتوحة ورخصة تسمح بالاستخدام التجاري، بسقف ٧٠٠ مليون مستخدم شهريا وإلزام بإظهار اسم لاما. وقائمة لغاته مغلقة من اثنتي عشرة لغة ليست فيها الفارسية ولا التركية، بينما نافذته عشرة ملايين رمز.
  • Mistral Large 3 يحمل أحرّ رخصة في هذه الفئة، أباتشي ٢ بأوزان مفتوحة واستخدام تجاري كامل. ومع ذلك لا تنشر ميسترال لهذا النموذج قائمة لغات كاملة ولا قائمة دول، ولذلك لم ينل ترتيبا في جدولنا. وغياب الدليل جواب في ذاته.
  • Gemini مناسب للمرور التشخيصي أعلاه، لأنه يقرأ الفارسية بنفسه ولا يحتاج النص إلى المرور بالإنجليزية أولا. وصفحة جوجل نفسها تقول إن التطبيق يعمل في أكثر من ٢٣٠ دولة ومنطقة وأكثر من ٧٠ لغة، وإيران ليست في تلك القائمة.

اين ينقلب ضدك

ثلاثة أخطار، وأولها هو ما يدور حوله هذا الدرس كله: الخطأ السلس. فالنموذج اللغوي حين لا يعرف المقابل الصحيح، بدل أن يقول ذلك، ينتج مقابلا سليم البنية يبدو محترفا. ولا شيء يشير إليه. والدفاع الوحيد أن يقرأ الناتج من يعرف المجال، وهذا ما يجعل الترجمة الآلية رخيصة لا مجانية. والخطر الثاني قوائم اللغات: «متعدد اللغات» ادعاء تسويقي إلى أن تطبع الشركة القائمة، وقائمة عائلة النماذج ليست قائمة نسخة بعينها. والثالث لأصحاب المواقع: نشر نص مترجم آليا بالجملة دون مراجعة بشرية هو بالضبط النمط الذي تصفه سياسات جوجل لمكافحة السبام بأنه إساءة استخدام المحتوى واسع النطاق. والمسألة ليست اللغة ولا الأداة، بل نشر ما لم يقرأه أحد.

المصادر: Cohere: models, with the Command A Translate language list and context window Cohere: commercial SaaS agreement (Restricted Locations) Meta: Llama 4 Scout model card Meta: Llama 4 licence Google: where Gemini Apps are available Google Search Central: spam policies for Google web search

حدود هذه النصيحة

هذا الدرس لا يقول شيئا عن جودة ترجمة هذه النماذج ولا ينبغي له. فقد قرأنا القوائم المنشورة من الشركات واستشهدنا بها؛ أما كم تبدو ترجمة كل منها للفارسية طبيعية فيتطلب قراءة الناتج، وذلك لم يُنجز هنا. وثمة حدان آخران. كُتبت الحقب بلا سنوات عمدا، لأنها متداخلة وأي تأريخ دقيق ادعاء لا نستطيع الوقوف خلفه. وقوائم اللغات والرخص والوصول كلها أمور تستطيع الشركة تغييرها غدا؛ وتاريخ المراجعة أعلى هذه الصفحة هو حد صلاحية كل رقم فيها. أما سير العمل العملي، أي كيف تترجم وثيقة وتراجعها فعلا بهذه الأدوات، فهو موضوع الدرس التالي في هذا المسار، وهنا اكتُفي بالتشخيص.

من عملنا نحن

حين كنا نبني فئة الترجمة في قسم الذكاء الاصطناعي بهذا الموقع، كان العمود الأول في الجدول سيكون «درجة جودة الترجمة». ولم يُبنَ ذلك العمود قط، لأن أيا من المرشحين السبعة لم ينشر رقما لجودة ترجمة نموذجه؛ فكوهير تكتب أن Command A Translate نموذجها المتقدم للترجمة ولا تطبع أي درجة، والبقية كذلك. والعمود الذي لا رقم فيه لأي مرشح ليس عمودا. وجُرّب عمود آخر ثم سُحب: نافذة السياق. فمحرك الترتيب ينمّط كل عمود عددي بين أدنى مرشح وأعلاه، وكان الأدنى هنا ٨ آلاف رمز والأعلى عشرة ملايين، أي ثلاث مراتب من حيث الحجم. والنتيجة أن فرقا حقيقيا يبلغ اثنين وثلاثين ضعفا ظهر في الجدول بصورة ٠.٤ مقابل ٠.٢. فخرج الرقم من الجدول وبقيت فكرته في المتن. ولهذين القرارين درس يتجاوز الترجمة: الجدول الذي لا دليل خلف عموده ليس له إلا شكل الجدول.

اسئلة متابعة حقيقية

أيهما أفضل: جوجل ترانسليت أم الترجمة بنموذج لغوي؟

يعتمد على ما تفعله. فلفهم نص بسرعة، أو للحجم الكبير المتكرر، يكون محرك الترجمة المخصص أرخص وأكثر قابلية للتوقع. أما للنص ذي النبرة والسياق واتساق المصطلح فيتفوق النموذج اللغوي، لكن فقط إن أعطيته ذلك السياق؛ فبلا بيان يتقلص الفرق بينهما إلى سلاسة الجمل.

كيف أعرف أن نموذجا يدعم لغتي فعلا؟

ابحث عن قائمة لغات تلك النسخة بعينها في وثائق الشركة نفسها، لا في مقال ولا لعائلة النماذج. فإن لم تعطِ الشركة قائمة واكتفت بقول «متعدد اللغات» فالجواب «غير معلوم» وينبغي أن يُكتب كذلك. وثمة فخ أيضا: القائمة المتروكة مفتوحة بـ«ومنها» ليست كالقائمة المغلقة، والثانية وحدها قابلة للاستشهاد.

هل يسبب نشر نص مترجم آليا مشكلة في السيو؟

المشكلة ليست الترجمة الآلية نفسها بل نشر ما لم يقرأه أحد بالجملة. وسياسات جوجل لمكافحة السبام تصف هذا النمط بأنه إساءة استخدام المحتوى واسع النطاق، ويُقرأ في الصفحة نفسها أن المعيار هو انعدام الفائدة والنطاق لا أداة الإنتاج. فصفحة واحدة مترجمة راجعها إنسان واستقرت لقارئ تلك اللغة لا بأس بها؛ ومئتا صفحة ذهبت من المحرك إلى الموقع مباشرة فيها بأس.