زواحف الذكاء الاصطناعي: دليل robots.txt الكامل 2026

0

هناك اليوم أكثر من اثني عشر زاحف ذكاء اصطناعي نشطًا تابعًا لستّ شركات، وهي ليست فئة واحدة. بعضها يجمع بيانات لتدريب النماذج ولن يعود عليك بزيارة واحدة، وبعضها يفهرس صفحاتك أو يجلبها لحظيًا ليستشهد بها أمام المستخدم. الخلط بينها هو أكثر خطأ يكلّف المواقع ظهورها دون أن يدري أصحابها.

القرار الصحيح ليس «اسمح للجميع» ولا «امنع الجميع»، بل فصل الفئتين والتعامل مع كل واحدة بمنطقها.

ما الفرق بين زواحف التدريب وزواحف الاسترجاع؟

زواحف التدريب تنسخ محتواك ليصبح جزءًا من نموذج مستقبلي، دون ذكر لك ودون رابط ودون زيارة. زواحف الاسترجاع تقرأ صفحتك لحظة سؤال المستخدم لتضعها في الإجابة مع رابط ظاهر. الأولى تأخذ، والثانية تعطي. ولهذا يجب أن يكون قرارك مختلفًا تجاه كل فئة.

الجميل أن الشركات الكبرى فصلت الوكلاء عمدًا، فأصبح بإمكانك رفض التدريب والبقاء مؤهّلًا للاستشهاد في الوقت نفسه. هذه ليست ثغرة، بل تصميم مقصود.

ما القائمة الكاملة لزواحف الذكاء الاصطناعي؟

هذه هي الوكلاء المعلنة التي تحتاج إلى قرار صريح منك في ملف robots.txt، مصنّفة حسب الغرض. أي وكيل في عمود التدريب حجبه لا يؤثّر على ظهورك في الإجابات، وأي وكيل في عمود الاسترجاع حجبه يعني اختفاءك من تلك المنصة.

الشركة زاحف تدريب زاحف استرجاع واستشهاد
OpenAI GPTBot OAI-SearchBot، ChatGPT-User
Anthropic ClaudeBot Claude-SearchBot، Claude-User
Google Google-Extended Googlebot
Perplexity لا يوجد منفصل PerplexityBot، Perplexity-User
Meta Meta-ExternalAgent
Apple Applebot-Extended Applebot
ByteDance Bytespider
Common Crawl CCBot
Amazon Amazonbot

انتبه إلى Google-Extended تحديدًا. حجبه يمنع استخدام محتواك في تدريب Gemini، ولا يؤثّر إطلاقًا على ترتيبك في بحث جوجل ولا على ظهورك في الملخصات الذكية، لأن هذه تعتمد على Googlebot نفسه. من ظنّ أن حجبه يخرجه من الملخصات كان مخطئًا.

ما الإعداد الموصى به لملف robots.txt؟

الإعداد المتوازن لمعظم المدوّنات والمواقع التجارية هو: امنع زواحف التدريب التي لا تعطيك مقابلًا، واسمح لكل زواحف الاسترجاع دون استثناء. هذا يحافظ على ظهورك في الإجابات ويقلّل استهلاك محتواك في تدريب نماذج لا تذكرك.

# زواحف التدريب: منع
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: Meta-ExternalAgent
Disallow: /

User-agent: Applebot-Extended
Disallow: /

# زواحف الاسترجاع والاستشهاد: سماح
User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /

إن كان محتواك هو منتجك نفسه، كموقع أبحاث أو أرشيف مدفوع، فاجعل المنع أشمل. وإن كان هدفك الوحيد أوسع انتشار ممكن ولا تمانع التدريب، فاحذف كتلة المنع كاملة. القرار تجاري لا تقني.

هل يلتزم الجميع بملف robots.txt؟

لا. الملف اتفاق أخلاقي لا آلية إنفاذ، ولا شيء تقنيًا يمنع زاحفًا من تجاهله. وُثّق تجاهله من Bytespider مرارًا، ونشرت Cloudflare في أغسطس 2025 تحقيقًا اتّهمت فيه Perplexity بالوصول إلى مواقع حجبته باستخدام وكلاء غير معلنة تنتحل صفة متصفّح عادي.

النتيجة العملية: إن كان قرارك السماح فلا مشكلة أصلًا. أما إن كان المنع جادًّا وله قيمة تجارية حقيقية، فأنت تحتاج إلى حظر على مستوى جدار الحماية أو الخادم بناءً على وكيل المستخدم ونطاق العناوين، لا إلى سطر في ملف نصي.

هل موقعك محجوب دون أن تعلم؟

هذا احتمال حقيقي يغفل عنه كثيرون. بدأت Cloudflare منذ يوليو 2025 حجب زواحف الذكاء الاصطناعي افتراضيًا للنطاقات الجديدة، ضمن توجّهها لجعل الزحف مدفوعًا. فإن كان موقعك خلف Cloudflare أو شبكة توصيل مشابهة، فقد تكون محجوبًا بإعداد لم تختره أنت.

افحص هذا قبل أي شيء آخر. لا معنى لتحسين محتواك ليُقتبس بينما الزاحف يُردّ من البوابة أصلًا. الفحص لا يستغرق دقائق:

  1. افتح موقعك.com/robots.txt وتحقّق من عدم وجود قاعدة عامة User-agent: * متبوعة بـ Disallow: /.
  2. ادخل لوحة تحكم Cloudflare وراجع إعدادات AI Crawl Control أو Bot Management.
  3. افحص سجلّات الخادم وابحث عن OAI-SearchBot وPerplexityBot خلال آخر ثلاثين يومًا. غيابها التام مؤشّر على حجب في مكان ما.
  4. راجع إضافات الحماية في ووردبريس. بعضها يحجب وكلاء غير مألوفة تلقائيًا.

كيف تعرف أن الزواحف تزور موقعك فعلًا؟

الطريقة الوحيدة الموثوقة هي سجلّات الخادم، لا أدوات التحليلات. زواحف الذكاء الاصطناعي لا تشغّل جافاسكربت، فلن تظهر في Google Analytics إطلاقًا. سجلّ الوصول في استضافتك هو المصدر الوحيد الذي يخبرك من زار، وكم مرة، وأي صفحات.

ابحث في السجلّ عن أسماء الوكلاء المذكورة أعلاه، وسجّل ثلاثة أرقام شهريًا: عدد الزيارات لكل زاحف، والصفحات الأكثر زحفًا، ورمز الاستجابة الذي حصل عليه. إن رأيت 403 أو 429 متكررة فأنت تحجب دون قصد.

هل حجب التدريب يضرّ بترتيبك في جوجل؟

لا يضرّ إطلاقًا. Google-Extended وكيل منفصل تمامًا عن Googlebot، وقد صرّحت جوجل بأن حجبه لا يؤثّر على الفهرسة ولا على الترتيب ولا على الظهور في نتائج البحث. الشرط الوحيد ألّا تحجب Googlebot نفسه بالخطأ في قاعدة عامة.

هذا الفصل نفسه ينطبق على المنصات الأخرى، ومن هنا تأتي قيمة التعامل مع كل وكيل باسمه بدل القواعد الشاملة. القاعدة العامة User-agent: * هي أخطر سطر في ملفك، لأنها تشمل ما لم تقصده.

ماذا تفعل الآن؟

افتح ملف robots.txt اليوم وتأكد من أمرين فقط: أن زواحف الاسترجاع الستة مسموح لها، وأن لا قاعدة عامة تحجب ما لم تقصد حجبه. هذان الفحصان يأخذان خمس دقائق ويحسمان ما إن كنت مؤهّلًا للظهور أصلًا.

وبعد أن تفتح الباب، تبقى المسألة في جودة ما سيجده الزاحف خلفه. ابدأ من المحتوى القابل للاستخراج لتعرف ما الذي يجعل فقرتك تُقتبس بعد أن يصل إليها.

الأسئلة الشائعة

هل أحجب GPTBot أم أسمح له؟

القرار تجاري. اسمح إن كنت تبني حضورًا وتريد أوسع انتشار ولا يضرّك أن يصبح محتواك جزءًا من معرفة النموذج. امنع إن كان المحتوى نفسه هو منتجك الذي تبيعه. حجبه لا يؤثّر على ظهورك في بحث ChatGPT لأن ذلك وكيل منفصل.

ما أثر حجب Google-Extended على ترتيبي؟

لا أثر له. أعلنت جوجل صراحةً أن هذا الوكيل يخصّ استخدام المحتوى في تدريب نماذج Gemini فقط، ولا علاقة له بالفهرسة أو الترتيب أو الملخصات الذكية التي تعتمد على Googlebot. الحجب آمن تمامًا من ناحية السيو.

هل ملف llms.txt بديل عن robots.txt؟

ليس بديلًا ولا مكمّلًا فعليًا. ملف robots.txt معيار مدعوم فعلًا من كل الزواحف الكبرى، بينما لا يوجد دليل يُذكر على قراءة llms.txt. راجع الأدلة الكاملة حول llms.txt قبل أن تنفق وقتًا عليه.

لماذا لا تظهر زيارات الزواحف في Google Analytics؟

لأن أدوات التحليلات تعتمد على تنفيذ جافاسكربت في المتصفّح، والزواحف لا تنفّذه. الطريقة الوحيدة لرصدها هي سجلّات الوصول على الخادم، أو لوحات تحليل الزواحف التي توفّرها بعض شبكات التوصيل مثل Cloudflare.

هل يستهلك الزحف موارد خادمي؟

نعم، وقد يكون الاستهلاك ملحوظًا على المواقع الكبيرة. إن رأيت ضغطًا حقيقيًا، استخدم توجيه Crawl-delay للزواحف التي تحترمه، أو حدّد المعدّل على مستوى الخادم، بدل الحجب الكامل الذي يكلّفك الظهور.

كل كم أراجع إعدادات الزواحف؟

كل ثلاثة أشهر على الأقل. تُطلق الشركات وكلاء جديدة وتغيّر أسماء القديمة باستمرار، وملف كُتب قبل عام صار ناقصًا حتمًا. اجعلها مراجعة دورية مثل مراجعة الروابط المكسورة.

قد يعجبك ايضا
اترك تعليقا