فحص robots.txt وخريطة الموقع
يُقرأ ملف robots.txt لنطاقك ويُجدول، وتُفتح خرائط الموقع المُعلنة وتُعدّ روابطها، وتُعلَّم الأخطاء المتكررة التي تخفي الموقع عن غوغل.
- بدون تسجيل
- عدّ روابط خريطة الموقع
- كشف الأخطاء الشائعة
شغّل الأداة من هنا
اطلع على ما يسمح لGooglebot بزحفه وما إذا كانت خريطة موقعك سليمة.
- التكلفة مجاني
- مصدر البيانات خادمنا
- الوصول بدون تسجيل
الإجابة المختصرة
يخبر ملف robots.txt الزواحف بالأجزاء التي لا تزحف إليها من الموقع، وتخبرها خريطة الموقع بالروابط الموجودة ومتى تغيرت. فإن كانت صفحة لديك لا تُفهرس، فهذان الملفان أول ما ينبغي النظر فيه، قبل أي شيء آخر.
أسوأ ما يحدث لموقع هو سطر واحد: Disallow: / . كل بيئة اختبار لديها هذا السطر ومن حقها، لكن حين ينتقل الموقع من الاختبار إلى الخادم الحي يسافر معه عادةً ويزيل الموقع كله من غوغل. ولا يظهر أي تحذير في أي مكان؛ بل تنجرف الزيارات إلى الصفر خلال أسابيع ولا أحد يعرف لماذا. وكلما نقلت موقعاً، افحص هذا في اليوم الأول.
والخطأ الذي نراه باستمرار في مواقع ووردبريس الإيرانية هو حجب wp-content. كان المنطق صحيحاً يوماً ولم يعد كذلك: فكي تعرف غوغل ما إذا كانت صفحتك ملائمة للجوال عليها أن ترى CSS وجافاسكربت الخاصين بها، وكلها داخل wp-content. فإن حجبت ذلك المجلد رأت غوغل الصفحة بلا تنسيق وحكمت على صفحة بلا شكل.
وفي خرائط المواقع، الرقم الجدير بالقراءة هو الفجوة بين عدد الروابط داخل الخريطة وعدد الصفحات المفهرسة في Search Console. فإن كانت الخريطة تضم ألف رابط وفهرست غوغل مئتين، فالخريطة ليست المشكلة؛ بل رأت غوغل ثمانمئة صفحة وقررت أنها لا تستحق الفهرسة. والسؤال الصحيح عندها عن جودة تلك الصفحات لا عن ملف الخريطة.
من أين تأتي البيانات
يجلب خادمنا الملف مباشرةً من نطاقك؛ لا خدمة خارجية ولا تكلفة. إذا لم يعلن robots.txt خريطة موقع، تجرب المسارات المتعارفة أيضاً. أمر نراه باستمرار: كثير من مواقع ووردبريس الإيرانية ما زالت تحجب wp-content، فيعرض غوغل الصفحة بلا CSS ولا يعتبرها متوافقة مع الجوال.
متى تفيدك
أول ما يجب فحصه عندما لا تفهرس صفحة. وأيضا بعد أي ترحيل للموقع أو تغيير استضافة، لأن robots.txt الخاص ببيئة الاختبار يحمل عادةً Disallow: / ويمحو الموقع كله من غوغل.
أين لا تفيد
تقول هذه الأداة ما يسمح به robots.txt، لا ما فعلته غوغل فعلاً. فقد تكون صفحة مسموحة تماماً في robots.txt ولا تُفهرس مع ذلك، لأن غوغل لم ترها جديرة أو لأن الكانونيكال يشير إلى مكان آخر. والعكس يحدث أيضاً: فصفحة محجوبة في robots.txt لكن مرتبط بها من مكان آخر تظهر أحياناً في النتائج بعنوان فارغ، لأن robots يسحب إذن الزحف لا إذن الفهرسة. ولأمر لا تُفهرس، الأداة الصحيحة هي وسم noindex لا robots.txt. ولمعرفة ما فعلته غوغل فعلاً برابط، فالمصدر الصحيح الوحيد هو Search Console لذلك الموقع.
ملاحظة من استخدامها
إن لم يُعلن robots.txt خريطة موقع، فإن هذه الأداة تجرّب المسارات المتعارف عليها أيضاً: sitemap.xml وsitemap_index.xml وwp-sitemap.xml. أضفنا ذلك عمداً، لأننا رأينا مراراً في الواقع خريطة موقع موجودة وسليمة لكنها غير مُعلنة في أي مكان، والمالك يظن أنه لا خريطة لديه. وإعلان الخريطة في robots.txt سطر واحد، وذلك السطر هو ما يخبر زاحفاً يصل موقعك أول مرة من أين يبدأ.
التكلفة
تعمل هذه الأداة على خادمنا ولا نشتري لها أي بيانات، فهي مجانية وستبقى كذلك. لها حد يومي فقط كي لا يستهلك روبوت كامل السعة.
يُحسب الحد اليومي لكل زائر. إن احتجت أكثر، يرفع الحساب المجاني حدّك.
أسئلة عن هذه الأداة
هل يسبب غياب robots.txt مشكلة؟
ليس بالضرورة. غياب الملف يعني أن كل شيء مسموح، وهو ما تريده معظم المواقع الصغيرة بالضبط. ويصير الملف ضرورياً حين تريد إبقاء أقسام كصفحات البحث الداخلي أو فلاتر المتجر خارج الزحف.
هل يمكن لـ Disallow إزالة صفحة من غوغل؟
ليس بشكل موثوق. فإن كانت الصفحة مرتبطاً بها من مكان آخر فقد تبقى في النتائج بعنوان فارغ. وللإزالة الحقيقية استخدم وسم noindex، والأهم ألا تحجب الصفحة نفسها في robots.txt، لأن غوغل يجب أن تستطيع الزحف إلى الصفحة كي ترى noindex.
كم مرة ينبغي تحديث خريطة الموقع؟
تلقائياً، مع كل محتوى جديد يُنشر. وتقوم بذلك تقريباً كل إضافات السيو في ووردبريس. وخريطة مبنية يدوياً ولم تُحدَّث منذ أشهر أسوأ من غيابها، لأنها ترسل الزاحف إلى روابط لم تعد موجودة.