این عددها از کجا می آیند
هر چیزی که روی صفحه های این بخش می بینید از دو منبع می آید و با یک فرمول ساده حساب می شود. فرمول همین جاست، با دلیل هر تصمیم و با چیزهایی که این داده نمی تواند بگوید.
رشد چطور حساب می شود
برای هر کلمه، میانگین حجم سه ماه آخر را با میانگین همان سه ماه در دوازده ماه قبل مقایسه می کنیم. حاصل، رشد سال به سال آن کلمه است.
ولی رشد خام را رتبه بندی نمی کنیم، و دلیلش یک چیزی است که در اندازه گیری دیدیم. حوالی اسفند ۱۴۰۴ یک افت شدید زیر تمام جست وجوی فارسی نشسته است: پنج کلمه از پنج صنعت بی ربط را که اندازه گرفتیم، هر پنج تا با هم و در همان ماه ها افتادند، و برای بیشتر کلمه ها گوگل آن ماه را اصلا خالی برمی گرداند. اگر رشد خام را رتبه بندی کنیم، هر ردیف قرمز می شود و صفحه ای که قرار است رشد نشان بدهد چیزی جز سقوط نشان نمی دهد.
پس رشد هر کلمه را نسبت به میانه کل پیکره همان زبان می سنجیم. ستون «رشد نسبت به بازار» یعنی همین: این کلمه چقدر از میانه بازار جلوتر یا عقب تر بوده. عدد صفر یعنی دقیقا مثل بازار حرکت کرده، نه اینکه ثابت مانده.
میانه فعلی این پیکره -۵۵.۷ است، محاسبه شده از ۴۹۶ کلمه که رشد قابل محاسبه داشتند.
چیزهایی که این داده نمی تواند بگوید
این بخش کلمه تازه کشف نمی کند. تنها محصولی که پرسش های نوظهور را پیدا می کند، مرتبط های گوگل ترندز است و برای فارسی فهرست خالی برمی گرداند، در هر لوکیشنی که امتحان شد. پس پیکره را خودمان می سازیم و بعد اندازه می گیریم، و هیچ جای این بخش ادعا نمی کند که ترند را خودش پیدا کرده.
حجم ها برآورد گوگل اند، نه شمارش ما. گوگل خودش آنها را در سطل های گرد گزارش می کند، پس دو کلمه با عدد یکسان لزوما دقیقا هم حجم نیستند.
نمودار پنج ساله یک شاخص ۰ تا ۱۰۰ است و نه عدد مطلق. این شاخص نسبت به بیشترین مقدار همان نمودار حساب می شود، پس دو نمودار مختلف با هم قابل مقایسه نیستند. عدد مطلق فقط برای دوازده ماه اخیر وجود دارد و همان است که در ستون حجم و در میله های ماهانه می بینید. نمودار پنج ساله مطلق برای فارسی اصلا وجود ندارد و ما هم نمی سازیمش.
ستون شتاب و اوج فصلی وقتی سری یک کلمه تفکیک پذیری کافی نداشته باشد خالی می ماند. این عمدی است: روی یک سری له شده، هر نسبتی که حساب کنیم عددی می دهد که شبیه اندازه گیری است ولی نیست.
و یک هشدار برای خواندن ستون شتاب: کلمه فصلی، در فصل خودش شتاب بالا نشان می دهد. «اجاره ویلا» هر تابستان بالا می رود و هر زمستان پایین می آید و این رشد نیست. برای همین ستون اوج فصلی کنارش هست.
کلمه ها چطور انتخاب می شوند
برای هر حوزه دو تا سه کلمه پایه می دهیم و گوگل صدها تا هزاران ایده برمی گرداند، هرکدام با حجم خودش. از میان آنها پرحجم ترین ها انتخاب می شوند. یعنی فهرست نهایی را اندازه گیری تعیین می کند، نه سلیقه ما.
یک مرحله میانی هم هست که بدون آن فهرست بی معنا می شد. گوگل برای هر کلمه، گونه های املایی اش را هم با همان حجم برمی گرداند؛ در یک نمونه واقعی هشت املای مختلف یک عبارت ترکی همه با عدد یکسان آمده بودند. اگر ساده بیست و پنج تای اول را برداریم، فهرست حدود هشت پرسش واقعی و هفده املای همان هشت تا می شود. پس گونه ها را در یک ردیف جمع می کنیم و تعدادشان را کنار همان ردیف می نویسیم.
این جمع کردن محافظه کارانه تنظیم شده. دو کلمه فقط وقتی یکی شمرده می شوند که حجم گزارش شده شان دقیقا برابر باشد و املایشان هم به هم نزدیک باشد. اگر شک باشد، جدا می مانند: دو ردیف نزدیک به هم بهتر از یک ردیف است که دو چیز متفاوت را یکی نشان می دهد.
منبع دوم، و اینکه در هر زبان چقدر می ارزد
حجم و روند پنج ساله از گوگل می آید، از راه دیتافورسئو. دو چیز را گوگل نمی گوید و کسی که می خواهد روی یک کلمه کار کند لازمشان دارد: اینکه واقع بینانه می شود روی آن کلمه رتبه گرفت یا نه، و اینکه کسی که تایپش می کند دنبال چیست. آن دو ستون از سمراش می آید و یک اندازه گیری جداگانه با محدودیت های جداگانه است.
سمراش به ازای کشور اندازه می گیرد نه به ازای زبان، و پایگاه جهانی ندارد. پس هر زبان اینجا در یک جای مشخص اندازه گیری شده: انگلیسی در آمریکا، ترکی در ترکیه، عربی در عربستان و هر جا عربستان عددی نداشت در مصر. این انتخاب روی صفحه هر صنعت چاپ شده و در پاورقی پنهان نشده، چون معنای عدد را عوض می کند.
فارسی همان حالتی است که باید صریح گفته شود، چون همان جایی است که یک ابزار کلمه کلیدی بی صدا اشتباه می کند. سمراش پایگاه ایران ندارد. تنها پایگاه فارسی زبانش افغانستان است که کسر کوچکی از جست وجوی فارسی است، پس حجمی که از آن گرفته شود حجم ایران نیست و هیچ جای این سایت چاپ نمی شود. سختی را چاپ می کنیم، با این استدلال که سختی صفحه هایی را توصیف می کند که همین حالا در نتیجه نشسته اند و آن صفحه ها برای یک عبارت فارسی، هر جا تایپ شود، تقریبا همان ها هستند. این استدلال قابل دفاع است، نه قطعی. ضعیف ترین عدد این بخش است و همین طور هم برچسب خورده.
یک نتیجه ارزش بیرون کشیدن دارد. چون یک کلمه در بیش از یک کشور اندازه گیری شده، می شود دید آن کشورها چقدر از هم دورند، و معمولا دورتر از آنی هستند که انتظار می رود. «gold rate today» در هند حدود ۶۸ میلیون جست وجو در ماه دارد و در آمریکا ۸۲۳ هزار تا. «car insurance quotes» در آمریکا ۶۰.۴۸ دلار به ازای هر کلیک است و در هند ۱.۶۸ دلار. هر عدد جهانی واحدی برای یک کلمه انگلیسی، میانگین بازارهایی است که مثل هم رفتار نمی کنند.
پوشش یکنواخت نیست و صفحه هر صنعت پوشش خودش را می نویسد. انگلیسی و ترکی تقریبا کامل برمی گردند، عربی حدود نصف چون بخش بزرگی از پیکره عربی نگارش مصری است که پایگاه عربستان آن را ندارد، و فارسی حدود یک پنجم. هر جا سمراش چیزی برنگردانده، خانه خالی مانده و با صفر پر نشده.
مبنای اندازه گیری
حجم ها از گوگل ادز است، بدون فیلتر کشور و با زبان فارسی. اندازه گیری همان روز نشان داد نیمی از جست وجوی ایرانی ها از بیرون ایران ثبت می شود، پس فیلتر کشور عدد را نصف می کند و این عدد بدون فیلتر، عدد واقعی است.
داده ماهانه تازه می شود. تاریخ آخرین اندازه گیری بالای هر صفحه نوشته شده و همان تاریخ واقعی اجرای اندازه گیری است، نه تاریخ انتشار صفحه.