ترجمه

ترجمه زیرنویس؛ چیزی که باید در زمان گوینده جا شود

ترجمه زیرنویس یعنی ترجمه ای که باید در همان مدتی خوانده شود که گوینده حرف زده، و همین یک قید کار را از ترجمه متن جدا می کند. جمله ای که درست است ولی در آن زمان خوانده نمی شود، در زیرنویس جمله غلطی است.

  • درس ۵ از ۶
  • میانی
  • رایگان، بدون ثبت نام

پنج تصمیمی که برای هر رویداد گرفته می شود

ترتیبشان مهم است: زمان پیش از متن تعیین می شود، نه بعد از آن.

  1. ۱

    گفته شده، نه نوشته شده

    مبنا صدای صحنه است؛ فیلم نامه چیز دیگری است و همیشه با آنچه اجرا شده یکی نیست.

  2. ۲

    ساعت رویداد

    زمان ورود و خروج از تصویر می آید و از جمله شما نه. جمله باید در آن جا شود.

  3. ۳

    سقف خواندن

    در این چند ثانیه چقدر می شود خواند و همزمان تصویر را هم دید. عددش را پلتفرم می دهد.

  4. ۴

    تصمیم تراکم

    اگر وقت هست چیزی حذف نمی شود. اگر نیست، نفی و عدد و اسم می مانند و بقیه می روند.

  5. ۵

    خط شکنی و خواندن با سرعت واقعی

    شکستن سر نقطه گذاری، بعد یک بار خواندن روی تصویر. اگر دوباره خواندید، خط بلند است.

این چرخه برای هر رویداد تکرار می شود و همین است که ترجمه زیرنویس را کند می کند. کسی که فقط متن را ترجمه کرده، هنوز مرحله سوم را شروع نکرده است.

آخرین بررسی: فکت ها و نام ابزارهای این درس در همین تاریخ با منابعشان بازبینی شده اند.

چه چیزی ترجمه زیرنویس را از ترجمه متن جدا می کند

در ترجمه متن، خواننده وقت دارد. در زیرنویس وقت را گوینده تعیین کرده و شما فقط جای خالی او را پر می کنید. واحد کار هم دیگر جمله نیست: رویداد است، یک بلوک که سر ثانیه ای مشخص می آید و سر ثانیه ای مشخص می رود، و هر تصمیمی درباره اش باید داخل همان بازه معنا بدهد.

سه قید همزمان روی همین یک بلوک فشار می آورند. ساعت می گوید این متن چند ثانیه روی تصویر می ماند. جعبه می گوید در هر خط چند نویسه جا می شود و چند خط مجاز است. و خواننده، که کار اصلی اش تماشا کردن است نه خواندن؛ اگر تمام توجهش صرف خط شما شود، فیلم را از دست داده و شما هم کارتان را.

یک تفاوت دیگر هم هست که کمتر گفته می شود. زیرنویس تنها ترجمه ای است که مبدا آن هنوز شنیده می شود. مخاطب صدای اصلی را می شنود، خط شما را می بیند و بی اینکه بخواهد مقایسه می کند. کسی که ده کلمه از زبان مبدا بلد است، دقیقا دنبال همان ده کلمه می گردد و اگر پیدایشان نکند حس می کند چیزی جا افتاده، حتی وقتی ترجمه کاملا درست است. برای همین در زیرنویس، ترجمه آزاد اما درست، بیشتر از هر جای دیگری بوی خطا می دهد.

جعبه زیرنویس روی پرده سینما با یک نوار قرمز که از آن بیرون زده و نوار آبی که در آن جا می شود

عددهایی که واقعا دستتان را می بندند

دو راهنمای منتشرشده هست که می شود از رویشان عدد خواند، و هر دو برای تحویل به زبان های اروپایی نوشته شده اند. راهنمای زیرنویس بی بی سی نرخ خواندن را ۱۶۰ تا ۱۸۰ کلمه در دقیقه می گیرد و از همان جا نتیجه می گیرد که برای هر کلمه حدود ۰.۳ ثانیه وقت بگذارید، یعنی زیرنویس چهار کلمه ای دست کم ۱.۲ ثانیه روی تصویر بماند. راهنمای نتفلیکس به جای نرخ، کف و سقف زمان رویداد را می دهد: حداقل پنج ششم ثانیه و حداکثر ۷ ثانیه.

قیدراهنمای بی بی سیراهنمای نتفلیکس
حداکثر خطدو خط برای تصویر افقی، سه خط برای عمودیدو خط
طول خط۳۷ نویسه در پخش تله تکست؛ آنلاین ۶۸ درصد عرض تصویر ۱۶:۹در راهنمای هر زبان تعیین می شود
زمان رویدادحدود ۰.۳ ثانیه برای هر کلمهاز پنج ششم ثانیه تا ۷ ثانیه
جای خط شکنیسر نقطه گذاری، و نه بین حرف تعریف و اسم یا میان اجزای فعلبعد از نقطه گذاری، پیش از حرف ربط و حرف اضافه

یک نکته را بی بی سی صریح می گوید و کمتر کسی نقلش می کند: در فونت تناسبی، شمردن نویسه اصلا معیار درستی نیست، چون پهنای حرف ها فرق دارد و آنچه محدود می کند عرض ناحیه است. برای اینکه عدد قابل استفاده بماند خودش یک معادل می دهد: ۳۷ نویسه در ناحیه ۷۵ درصدی یک ویدیو افقی، تقریبا برابر است با ۲۵ نویسه در ناحیه ۹۰ درصدی یک ویدیو عمودی ۹:۱۶. همان جمله، همان فونت، یک سوم جای کمتر؛ و این تنها به این دلیل که ویدیو عمودی شده است.

حالا مرز صداقت: هیچ کدام از این دو عدد فارسی نیست. نتفلیکس برای هر زبان راهنمای جدا دارد و راهنمای فارسی اش پشت ورود شریک است؛ ما امروز آدرس عمومی اش را باز کردیم و به صفحه ورود رفت، پس هیچ عددی از آن نقل نمی کنیم. کاری که یک حرفه ای می کند این است: عدد را از پلتفرمی می گیرد که قرار است فایل را تحویل بگیرد، و اگر آن پلتفرم عددی ندارد، خودش یک بار اندازه می گیرد و همان را قاعده خودش می کند. لایه فنی خود فایل، یعنی تفاوت SRT و VTT و زیرنویس سوخته و نرم، جای دیگری توضیح داده شده: درس زیرنویس و کپشن.

فارسی در جعبه جا می شود؛ در ساعت شاید نه

سوال عملی هر مترجم زیرنویس این است: متن من در آن خط جا می شود یا نه. جواب را می شود اندازه گرفت و ما روی متن خودمان گرفتیم. این بخش از سایت ۱۵۲ فایل درس دارد که هر کدام چهار زبانه اند و متنشان کنار هم نوشته شده، پس هر بند فارسی یک بند انگلیسی متناظر دارد. روی ۲٬۸۲۷ بند بلند این مجموعه، متن فارسی در ۹۸.۴ درصد موارد از انگلیسی کوتاه تر درآمد و در کل ۸۷ درصد نویسه های انگلیسی را گرفت. عربی ۷۵ درصد و ترکی ۹۵ درصد.

حالا همان بندها را به کلمه بشمارید و جهت عوض می شود: فارسی ۱۰۴ درصد کلمه های انگلیسی را دارد و در ۶۹.۴ درصد بندها کلمه بیشتری برده است. دلیلش در یک عدد دیگر است؛ میانگین نویسه در هر کلمه: فارسی ۴.۶۱ و انگلیسی ۵.۵. یعنی فارسی همان مقدار حرف را در کلمه های کوتاه تر و پرشمارتر می ریزد.

برای زیرنویس این دو عدد دو چیز متفاوت می گویند، و درست همین جاست که مترجم ها اشتباه می کنند. جعبه نویسه می شمارد، پس معمولا خط فارسی جا می شود. ساعت اما با چیزی سنجیده می شود که راهنماها به کلمه نوشته اند، و ۱۶۰ تا ۱۸۰ کلمه در دقیقه یعنی هر کلمه اضافه، وقت اضافه می خواهد. اگر زمان بندی را با قاعده سرانگشتی انگلیسی ببندید، خط فارسی ای می سازید که در جعبه جا شده و در زمان جا نشده: نه سرریز می کند و نه هشدار می دهد، فقط خواننده به آخرش نمی رسد.

پس قید بستن برای فارسی از سمت زمان است نه از سمت پهنا. یک مرز هم دارد که باید صریح گفت: این متن ها نثر آموزشی اند نه دیالوگ، و ترجمه هم نیستند؛ چهار زبان جدا نوشته شده اند. عددها جهت را نشان می دهند و اندازه واقعی گفتار را نه.

همان محتوا، به نویسه و به کلمه

نسبت به انگلیسی، روی ۲٬۸۲۷ بند این بخش، ۹ سپتامبر ۲۰۲۶
  • فارسی ۸۷ درصد۱۰۴ درصد

    در جعبه جا می شود و در زمان گران تر است

  • عربی ۷۵ درصد۷۴ درصد

    هر دو سنجه با هم پایین می آیند

  • ترکی ۹۵ درصد۷۴ درصد

    کلمه های کمتر و بلندتر

نویسهکلمه

فقط در فارسی دو نقطه از هم باز می شوند و همان فاصله، تفاوت جعبه و ساعت است. یک هشدار روش: قاعده نگارشی این سایت نیم فاصله را فاصله معمولی می نویسد، پس شمار کلمه فارسی اینجا کمی بالاتر از حالت متعارف است؛ شمار نویسه دست نخورده می ماند.

تراکم؛ چه چیزی می رود و چه چیزی هرگز

تراکم شهرت بدی دارد چون معمولا بد توضیح داده می شود. تراکم سبک نیست، نتیجه ساعت است. راهنمای بی بی سی این را از سمت دیگر می گوید: اگر وقت هست، بی دلیل ویرایش نکنید؛ هدف این است که بیشترین دسترسی ممکن به صدای اصلی داده شود. حتی کلمه های کوچکی مثل «اما» و «هم» را خود به خود حذف نکنید، چون معنا را می سازند. و ساده سازی برای مخاطب ناشنوا را صریح رد می کند: هم تحقیرآمیز است و هم برای کسی که لب خوانی می کند آزاردهنده.

پس قاعده کاری این می شود: پیش فرض، نگه داشتن است؛ حذف را ساعت به شما تحمیل می کند، نه ذوقتان. و وقتی تحمیل شد، ترتیبش تصادفی نیست. اول چیزهایی می روند که تصویر خودش دارد می گوید یا شنونده همین حالا شنیده: تکرار، تردید، خطاب کردن کسی که در قاب است. بعد نشانگرهای گفتار روزمره، البته با احتیاط، چون همان ها لحن را می سازند. بعد جمله دوم توضیحی، اگر جمله اول کارش را کرده باشد.

و چیزهایی که هیچ وقت قربانی تراکم نمی شوند: نفی، عدد، اسم، و آن یک واژه ای که شوخی یا تهدید یا گره داستان روی آن سوار است. بی بی سی درباره اسم ها هم صریح است و می گوید اسم ها را وقتی برای خطاب کردن به کار می روند حذف نکنید، چون هدف آسانی اند و دنبال کردن داستان به آنها بند است. حذف نفی از همه بدتر است، چون خطایی می سازد که خواننده حتی حس هم نمی کند: جمله سالم می ماند و معنایش وارونه می شود.

در عمل، محک ساده این است: خط را با همان سرعت واقعی بخوانید و همزمان به تصویر نگاه کنید. اگر مجبور شدید دو بار بخوانید، خط بلند است؛ اگر تصویر را از دست دادید، خط بلند است؛ اگر رسیدید و چیزی کم داشت، زیادی کوتاهش کرده اید.

دو کفه ای که در زیرنویس همیشه در جنگند

فشار ساعت

  • تکرار و تردید گوینده حذف می شود
  • چیزی که تصویر خودش می گوید، دوباره نوشته نمی شود
  • جمله دوم توضیحی، اگر اولی کارش را کرده باشد
  • خطاب کردن کسی که همان لحظه در قاب است

چیزی که دست نمی خورد

  • نفی، که حذفش جمله را وارونه می کند
  • عدد و تاریخ و مقدار، عینا
  • اسم ها، حتی وقتی برای خطاب کردن اند
  • آن یک واژه ای که شوخی یا گره داستان رویش سوار است

کفه ها برابر نیستند و نباید باشند: پیش فرض، سمت راست است و کفه چپ فقط وقتی سنگین می شود که ساعت اجازه ندهد. هر حذفی که ساعت لازمش نکرده باشد، تصمیم شماست و باید بتوانید توضیحش بدهید.

خط را کجا بشکنیم، و یک تله که فقط سر فارسی می آید

هر دو راهنما یک منطق مشترک دارند: خط را جایی بشکنید که زبان خودش می شکند. بهترین جا سر نقطه گذاری است، بعد از آن پیش از حرف ربط و حرف اضافه. و چیزهایی که نباید از هم جدا شوند در هر دو فهرست تقریبا یکی است: حرف تعریف از اسم، صفت از موصوف، اسم کوچک از فامیل، ضمیر از فعل، و اجزای یک فعل مرکب.

در فارسی همین منطق دو مصداق دارد که در فهرست های انگلیسی نیست. اول کسره اضافه: «مدیر پروژه» یا «صدای اصلی فیلم» یک واحدند و شکستن خط وسطشان دقیقا همان کاری است که آن راهنماها درباره حرف تعریف و اسم منع می کنند. دوم فعل مرکب فارسی، که جزو اسمی و فعل کمکی اش با هم یک فعل اند؛ «تصمیم» را ته یک خط و «گرفت» را سر خط بعد گذاشتن، خواننده را وسط فعل معلق می کند.

و تله ای که فقط سر متن راست به چپ می آید. فایل زیرنویس متن ساده است و هیچ صفتی برای اعلام جهت ندارد؛ صفحه وب dir دارد و SRT چیزی ندارد. پس وقتی خط فارسی به یک اسم لاتین یا یک عدد ختم می شود، الگوریتم دوجهته یونیکد تصمیم می گیرد که نقطه پایان کجا بنشیند، و در بعضی پخش کننده ها آن نقطه سر دیگر خط ظاهر می شود. راه حل رایج، گذاشتن یکی از نویسه های نامرئی کنترل جهت مثل U+200F است؛ همان دسته ای که در متن این سایت ممنوع است، چون در وب صفت dir کار را انجام می دهد و نویسه نامرئی فقط ردپای ماشین است. در فایل زیرنویس آن صفت وجود ندارد، پس اینجا استثناست و باید آگاهانه به کار برود.

راه ساده تری هم هست که ما ترجیحش می دهیم: خط را طوری بچینید که به اسم لاتین یا عدد ختم نشود. یک کلمه فارسی بعدش کافی است و مسئله کلا پیش نمی آید. اگر هم ناچار شدید، فایل را در همان پخش کننده ای که مخاطب دارد باز کنید و نگاه کنید؛ این چیزی است که در ویرایشگر درست دیده می شود و در دست کاربر خراب.

چیزهایی که در زیرنویس اصلا ترجمه نمی شوند

راهنمای عمومی نتفلیکس چند قاعده دارد که کمتر جایی به فارسی نقل شده و هر کدام یک تصمیم را از دست مترجم می گیرد، به سود کار.

واحد پول تبدیل نمی شود. هر مبلغی که در گفتار می آید با همان واحد اصلی می ماند. یعنی «صد دلار» صد دلار باقی می ماند و به معادل ریالی تبدیل نمی شود؛ نه فقط چون نرخ عوض می شود، بلکه چون آن جمله بخشی از یک صحنه است و شخصیت دلار گفته است.

اسم برند سه راه دارد و فقط همین سه راه: همان نام انگلیسی اگر در آن بازار شناخته شده است، نامی که در آن بازار با آن شناخته می شود، یا یک واژه عمومی برای همان محصول. و یک ممنوعیت صریح: برند یک شرکت را با برند شرکت دیگر عوض نکنید.

نقل قول ها جای حساس ترند. راهنما می گوید بهترین کار این است که برای متن نقل شده ترجمه تازه بسازید، چون ترجمه تازه از حق رایت آزاد است؛ و استفاده از ترجمه موجود فقط وقتی مجاز است که آن ترجمه در مالکیت عمومی باشد یا اجازه مکتوب و پرداخت انجام شده باشد. مترجمی که یک بیت شعر یا یک آیه یا یک جمله از یک رمان ترجمه شده را از اینترنت برمی دارد، دارد یک تصمیم حقوقی می گیرد، نه یک تصمیم زبانی.

و یک قاعده که به خود مترجم برمی گردد: نام مترجم به عنوان آخرین رویداد فایل نوشته می شود، به زبان مقصد، و روی کارت حق رایت پایان برنامه، با زمانی تا ۵ ثانیه. اعتبار حرفه ای شما جای مشخصی در فایل دارد و آن جا خالی نمی ماند مگر خودتان بخواهید.

مسیر سریع با هوش مصنوعی

کاری که یک مدل زبانی در زیرنویس خوب انجام می دهد فشرده کردن یک جمله به یک سقف مشخص است، و کاری که بد انجام می دهد دست زدن به ساختار فایل. پس کل هنر این پاس در قیدهاست: سقف را می گویید، شمارش را از خودش می خواهید، و اجازه ادغام رویداد را از او می گیرید. بدون قید سوم، مدل دو زیرنویس کوتاه را یکی می کند چون جمله روان تری می سازد، و زمان بندی شما را بی سر و صدا خراب می کند.

  1. عدد پلتفرم خودتان را بردارید، نه قاعده عمومی. اگر پلتفرم عددی نمی دهد، یک بار روی ده رویداد واقعی اندازه بگیرید و همان را ثابت نگه دارید. قید بدون عدد، قید نیست.
  2. بلوک های SRT را با شماره و تایم کدشان بچسبانید، نه فقط متن را. مدل باید مدت هر رویداد را ببیند تا بفهمد کدام خط جا نمی شود؛ اگر فقط جمله ها را بدهید، مسئله را نمی بیند و برایتان ترجمه روان می سازد.
  3. دسته را کوچک نگه دارید. پنجره متن مدل ها یکسان نیست و آن مدلی که سازنده اش فارسی را در فهرست زبان هایش نوشته، کوتاه ترین پنجره این دسته را دارد؛ فایل یک فیلم بلند در یک وعده جا نمی شود. دسته کوچک یعنی مسئله یکدستی برمی گردد، و جوابش همان واژه نامه ای است که درس گردش کار ترجمه با هوش مصنوعی می سازد.
  4. نسخه پایین را اجرا کنید. سه قیدی که کار را انجام می دهند این سه اند: ادغام و تقسیم رویداد ممنوع، شمار نویسه بلندترین خط در یک ستون جدا، و خط بلند به جای کوتاه شدن خودسرانه با برچسب علامت بخورد.
  5. پاس انسانی روی سه چیز: اسم ها و عددها، خط های برچسب خورده، و بعد یک بار خواندن با سرعت واقعی روی تصویر. این سومی را نمی شود واگذار کرد، چون تنها جایی است که معلوم می شود خط خوانده می شود یا فقط جا شده است.

نسخه آماده کپی

نقش: مترجم زیرنویس. مبدا {زبان مبدا}، مقصد {زبان مقصد}.

قیدها:
- حداکثر {تعداد خط} خط در هر رویداد، حداکثر {تعداد نویسه} نویسه در هر خط.
- شماره رویداد و تایم کد را عینا نگه دار. هیچ رویدادی را ادغام یا تقسیم نکن.
- واحد پول، واحد اندازه و عدد را تبدیل نکن. نفی را حذف نکن.
- اینها ترجمه نمی شوند: {فهرست ترجمه نشود}

خروجی، فقط یک جدول با این ستون ها:
شماره رویداد | مدت (ثانیه) | متن مبدا | متن مقصد | بلندترین خط (نویسه)

قاعده های خروجی:
- اگر خطی از سقف رد شد، آن را با [بلند] علامت بزن و یک صورت کوتاه تر پیشنهاد بده. خودت کوتاهش نکن.
- هر جا معنا را مطمئن نیستی با [؟] علامت بزن و ترجمه ات را همان جا بگذار.
- هیچ توضیحی بیرون از جدول ننویس.

متن:
{بلوک های SRT}

قبل از اعتماد به خروجی: ستون شمار نویسه را همان مدلی پر می کند که خط را نوشته است، پس آن عدد یک نشانه است نه یک اندازه گیری؛ سنجش واقعی در ویرایشگر زیرنویس خودتان انجام می شود و همان جا هم باید انجام شود. خط های [بلند] و [؟] هم فهرست کار شمایند، نه فهرست کار مدل. و پیش از چسباندن هر دیالوگ منتشر نشده ای در هر سرویسی، سیاست نگهداری داده آن سرویس را بخوانید؛ محتوای منتشر نشده تنها چیزی است که یک بار درز کردنش جبران ندارد.

هوش مصنوعی در این کار

در زیرنویس، مدل زبانی برای یک کار مشخص خوب است: کوتاه کردن یک جمله بدون از دست دادن معنا، ده ها بار پشت سر هم، بدون خسته شدن. برای دو کار دیگر بد است: تصمیم گرفتن درباره زمان بندی و فهمیدن اینکه کدام واژه گره صحنه است. موضع ما این است که مدل را روی جمله بگذارید و ساعت را از دستش دور نگه دارید.

ابزارهایی که واقعا کمک می کنند

  • Gemini برای پاس فشرده سازی حجم بالا، چون رده Flash اش ارزان است و یک فایل زیرنویس معمولا صدها رویداد دارد. صفحه خود گوگل می گوید این اپ در بیش از دویست و سی کشور و منطقه در دسترس است و ایران در آن فهرست نیست.
  • Claude برای همان چند خطی که کوتاه نمی شوند و باید درباره شان بحث کرد؛ جایی که می پرسید کدام نیمه این جمله را می شود انداخت بی اینکه شوخی بمیرد. صفحه حریم خصوصی خودش می گوید گفتگوها به صورت پیش فرض برای آموزش مدل استفاده نمی شوند، که برای دیالوگ منتشر نشده معیار مهمی است.
  • Cohere Command A Translate در مستندات خود کوهر، تنها مدلی است که سازنده اش آن را مدل ترجمه معرفی کرده و ۲۳ زبانش را دانه دانه نوشته، با فارسی و عربی و ترکی در فهرست. اما پنجره متنش ۸ هزار توکن است، پس فایل یک فیلم را دسته دسته باید داد و یکدستی به گردن واژه نامه شما می افتد.

کجا نتیجه معکوس می دهد

خطر خاص این کار، خرابی ای است که هیچ خطایی نمی دهد. مدل وقتی یک فایل زیرنویس می بیند، آن را متن می بیند نه ساختار؛ دو رویداد کوتاه را ادغام می کند، یک جمله را بین دو رویداد جابه جا می کند، و خروجی اش کاملا سالم به نظر می رسد چون شماره ها هنوز پشت سر هم اند. کسی که فایل را باز می کند تازه می فهمد که خط ها با تصویر تکان خورده اند. برای همین قید «ادغام نکن» در نسخه بالا اختیاری نیست. خطر دوم تراکم مطمئن است: مدل جمله را کوتاه می کند و همان واژه ای را می اندازد که گره صحنه بود، و نتیجه روان تر از نسخه شماست. و خطر سوم که در این حرفه جدی است، محرمانگی؛ دیالوگ فیلم منتشر نشده و اسکریپت سریال، مصداق دقیق چیزی هستند که نباید در سرویسی چسبانده شوند که سیاستش را نخوانده اید. صفحه حریم خصوصی گوگل برای اپ های Gemini می گوید بازبین های انسانی بخشی از داده ها را می بینند و گفتگوهای بازبینی شده تا سه سال نگه داشته می شوند، در حالی که صفحه داده Claude می گوید گفتگوها به صورت پیش فرض برای آموزش استفاده نمی شوند. این دو سیاست یکی نیستند و انتخاب بین آنها باید آگاهانه باشد.

منبع ها: Google: where Gemini Apps are available Google: Gemini Apps Privacy Hub (human reviewers, retention) Anthropic: is my data used for model training Cohere: models, Command A Translate languages and context window

حد این توصیه

این درس هیچ عدد فارسی ای برای سرعت خواندن ندارد و نمی تواند داشته باشد: راهنمای زبان فارسی نتفلیکس پشت ورود شریک است و ما هیچ اندازه گیری سرعت خواندن روی مخاطب فارسی زبان انجام نداده ایم. عددهای بی بی سی و نتفلیکس هم مشخصات تحویل دو خانه اند، نه قانون جهانی. اندازه گیری خودمان هم مرز دارد: نثر آموزشی است نه دیالوگ، متن ها ترجمه نشده اند بلکه چهار زبانه نوشته شده اند، و شمار نویسه فقط تقریبی از پهناست، چون در فونت تناسبی آنچه واقعا محدود می کند عرض ناحیه است. سه چیز هم عمدا اینجا نیست: لایه فنی فایل که درس زیرنویس دارد، قراردادهای کپشن برای مخاطب ناشنوا که کار خودش است، و دوبله که ترجمه اش قید متفاوتی دارد و در درس صدا و دوبله است.

از تجربه خود ما

سوال «متن فارسی در خط جا می شود یا نه» را می شد حدس زد؛ ما به جایش شمردیم. امروز روی ۱۵۲ فایل درس همین بخش، هر رشته ای که هر چهار زبان را داشت جدا شد، برچسب های HTML و بلوک های کد از آن پاک شد، و ۱۱٬۴۳۹ واحد چهارزبانه به دست آمد که ۲٬۸۲۷ تای آن بند بلند بودند. نتیجه ای که انتظارش را نداشتیم در تفاوت دو سنجه بود، نه در خود نسبت: فارسی ۸۷ درصد نویسه های انگلیسی را می گیرد و ۱۰۴ درصد کلمه هایش را، چون میانگین طول کلمه فارسی ۴.۶۱ نویسه است در برابر ۵.۵ انگلیسی. برای طراح رابط یعنی خط فارسی جا می شود؛ برای مترجم زیرنویس یعنی همان خط، زمان بیشتری برای خوانده شدن می خواهد، چون سرعت خواندن در راهنماها به کلمه نوشته شده است. یک هشدار روش هم داریم که خودمان به آن برخوردیم: قاعده نگارشی این سایت نیم فاصله را فاصله معمولی می نویسد، پس شمار کلمه فارسی ما کمی بالاتر از نگارش متعارف است و همین عدد ۱۰۴ درصد را باید سقف دانست نه رقم دقیق. شمار نویسه از این قاعده اثر نمی گیرد، چون در هر دو حالت یک نویسه است.

سوال هایی که واقعا پرسیده می شوند

برای زیرنویس فارسی چند نویسه در هر خط درست است؟

عدد منتشرشده ای برای فارسی وجود ندارد که ما بتوانیم به آن ارجاع بدهیم، و ساختن یک عدد فقط برای اینکه جواب داده باشیم بدتر از نداشتن جواب است. عدد را از پلتفرم مقصد بگیرید؛ اگر ندارد، از عدد پخش بین المللی برای زبان های لاتین شروع کنید و روی ده رویداد واقعی خودتان بسنجید که خوانده می شود یا نه.

می شود کل فایل SRT را یکجا به یک مدل داد؟

بستگی به پنجره متن آن مدل دارد و پنجره ها بسیار متفاوتند؛ مدلی که سازنده اش فارسی را در فهرست زبان هایش نوشته، پنجره ۸ هزار توکنی دارد و فایل یک فیلم بلند در آن جا نمی شود. دسته دسته دادن جواب می دهد، به شرطی که واژه نامه و فهرست اسم ها در هر دسته دوباره تکرار شود، وگرنه شخصیت شما در نیمه دوم فیلم اسمش عوض می شود.

ترجمه زیرنویس با ترجمه فیلم نامه فرق دارد؟

بله، و تفاوتشان یک چیز است: فیلم نامه ساعت ندارد. در فیلم نامه شما جمله را کامل ترجمه می کنید و خواننده هر قدر لازم باشد وقت می گذارد؛ در زیرنویس همان جمله باید در بازه ای که گوینده اشغال کرده خوانده شود. برای همین یک فیلم نامه خوب ترجمه شده، مستقیما زیرنویس خوبی نمی سازد و باید دوباره برای ساعت بازنویسی شود.