Robots.txt and AI crawlers GPTBot ClaudeBot PerplexityBot web scraping 2026

robots.txt هو ملف نصي عمره 30 عاماً يخبر الزواحف بالأجزاء التي يمكنها جلبها من الموقع. في 2026 يؤدي مهمة لم يُصمَّم لها قط: التحكيم في ويب AI، حيث يجلب عشرات الزواحف، مثل GPTBot وClaudeBot وPerplexityBot وGoogle-Extended وغيرها، المحتوى لتدريب النماذج والإجابة عن الأسئلة في الوقت الفعلي. يشرح هذا الدليل ما يستطيع robots.txt فعله وما لا يستطيع في عصر AI، ومشهد الزواحف، وما إذا كانت روبوتات AI تلتزم به فعلاً، والإشارات الأحدث مثل llms.txt وعناصر التحكم من Cloudflare، وما يعنيه كل ذلك سواء كنت تجرّف الويب أو تدير موقعاً يتعرض للتجريف.

أنا Andrii Byzov، مدير تسويق جزئي متخصّص في AI، وأعمل يومياً مع خطوط أنابيب بيانات الويب وظهور AI في البحث. ستجد أدناه رؤية عملية ومحدّثة لعام 2026، مع التحفظات الصادقة اللازمة. للجانب القانوني، راجع دليلنا هل تجريف الويب قانوني، وللظهور في AI، راجع مقالتنا عن تتبّع ترتيب البحث في AI.


حقائق أساسية

  • robots.txt طوعي وليس قانوناً. إنه طلب، جرى تقنينه في RFC 9309، ويُنفَّذ بالالتزام الحسن النية ومن الخوادم وشبكات CDN، لا بالنصوص القانونية.
  • التدريب والبحث أصبحا الآن زاحفين منفصلين. يمكنك حظر تدريب AI، مثل GPTBot وGoogle-Extended وClaudeBot، مع البقاء مؤهلاً للاستشهادات في بحث AI، عبر OAI-SearchBot وClaude-SearchBot وPerplexityBot.
  • عمليات الجلب الفوري من الوكلاء غالباً ما تتجاوز منطق robots.txt. عندما يطلب مستخدم من AI قراءة صفحة، قد لا يُعد هذا الجلب «زحفاً»، لذا قد لا يوقفه robots.txt.
  • يختلف الالتزام باختلاف الروبوت. الزواحف الرئيسية، مثل Googlebot وGPTBot وClaudeBot، تحترم robots.txt عموماً، لكن بعضها لم يفعل ذلك تاريخياً، والتوجيه لا يعمل إلا إذا اختار الروبوت قراءته.
  • توجد إشارات جديدة: llms.txt، الذي يوجّه AI إلى أفضل محتواك، بنسبة تبنٍّ تقارب 10%، إضافة إلى أدوات Cloudflare لحظر AI والتحكم في الدفع مقابل الزحف على طبقة CDN.

ما هو robots.txt وما ليس عليه في 2026

robots.txt هو ملف نصي عادي في جذر النطاق، في /robots.txt، يسرد وكلاء المستخدم والمسارات المطلوب منهم عدم جلبها. جرى توحيده بوصفه RFC 9309 في 2022، لكن فكرته الأساسية لم تتغير منذ 1994: إنه طلب مهذّب. لا يصادق على هوية أحد، ولا يحظر الوصول على مستوى الشبكة، ولا يحمل قوة قانونية بمفرده. يقرأه الزاحف الملتزم ويلتزم به، أما الزاحف الذي يتجاهله فلا يواجه حاجزاً تقنياً من الملف نفسه.

هذا التمييز هو جوهر القصة في عصر AI. ينظّم robots.txt ما توافق الروبوتات الملتزمة على عدم فعله، لكنه ليس قفلاً. ويجري التنفيذ الفعلي، مثل تقييد المعدل والحظر وجدران الدفع، على الخادم أو CDN لا في الملف النصي.

مشهد زواحف AI

يزحف إلى ويب AI عدد متزايد من الجهات، والتحول المهم هو أن كل مزود رئيسي يفصل الآن حركة مرور التدريب عن البحث والإجابة في وكلاء مستخدم مختلفين:

وكيل المستخدم المشغّل الغرض هل يحترم robots.txt؟
GPTBot OpenAI تدريب النماذج نعم، موثّق
OAI-SearchBot OpenAI بحث ChatGPT والاستشهادات نعم
ClaudeBot Anthropic تدريب النماذج نعم
Claude-SearchBot Anthropic البحث والاستشهادات نعم
Google-Extended Google رمز إلغاء الاشتراك في تدريب Gemini نعم، للرمز فقط
PerplexityBot Perplexity البحث والإجابات نعم، موثّق
CCBot Common Crawl مجموعة بيانات مفتوحة تغذي نماذج كثيرة نعم
Meta-ExternalAgent Meta التدريب وميزات AI نعم

لأن التدريب والبحث وكلاء منفصلون، يستطيع الموقع اتخاذ خيار دقيق: إلغاء استخدام محتواه لتدريب النماذج مع البقاء مؤهلاً للاستشهاد به في إجابات AI. مثلاً، احظر GPTBot واسمح لـ OAI-SearchBot.

هل تلتزم زواحف AI فعلاً بـ robots.txt؟

في الغالب، نعم بالنسبة إلى الزواحف الكبرى، ويسهل التحقق من ذلك في سجلات خادمك. توثّق Googlebot وGPTBot وClaudeBot وPerplexityBot وكلاء المستخدم الخاصة بها وتحترم التوجيهات القياسية. لكن هناك ثلاث تحفظات مهمة:

  • الالتزام اختياري. لا يعمل التوجيه إلا إذا قرأه الروبوت واحترمه. تجاهلت بعض الزواحف robots.txt تاريخياً، ويمكن لوكيل مستخدم مزيّف أن يدّعي أي هوية، لذلك الملف معيار سلوكي لا ضمان.
  • عمليات الجلب الفوري من الوكلاء منطقة رمادية. عندما يطلب شخص من ChatGPT أو Perplexity تلخيص URL محدد، تجلب الأداة الصفحة نيابةً عن المستخدم. وغالباً ما يعامل المزودون ذلك بوصفه وصولاً موجهاً من المستخدم لا زحفاً، لذا قد لا تنطبق قواعد تدريب robots.txt أو زحفه كما يتوقع مالكو المواقع.
  • قد تتجاوزك طبقة CDN. وجدت أبحاث في شبكة Cloudflare أن نسبة معتبرة من المواقع تحظر زواحف AI الرئيسية عن غير قصد على CDN بينما ينص robots.txt لديها على «السماح»، ولذلك يجب أن تتوافق الطبقتان.

ما بعد robots.txt: llms.txt وai.txt والدفع مقابل الزحف

ينظّم robots.txt الوصول، بينما ينظّم الملف الأحدث llms.txt التنقل، إذ يوجّه أنظمة AI إلى محتواك الأعلى قيمة والأكثر نقاءً. ما زال التبني مبكراً، بنحو 10% من النطاقات، لكنه إشارة منخفضة المخاطر. وإلى جانبه، دخلت شبكات CDN إلى المشهد: تقدّم Cloudflare حظراً بنقرة واحدة لزواحف AI ونموذج الدفع مقابل الزحف الذي يتيح للناشرين تحصيل رسوم من شركات AI مقابل الوصول، ناقلاً الحوار من «السماح أو الرفض» إلى «الترخيص». والخلاصة لعام 2026: robots.txt طبقة واحدة ضمن بنية تشمل الآن llms.txt وعناصر تحكم CDN وشروطاً تجارية ناشئة.


ما يعنيه هذا إذا كنت تجرّف الويب

إذا كنت تجمع بيانات ويب عامة، فتعامل مع robots.txt بوصفه معياراً مهنياً، لا عقبة للالتفاف حولها. هذا هو النهج القابل للدفاع والمستدام:

  • اقرأ robots.txt واحترمه للمسارات التي تصل إليها، واحترم crawl-delay حيثما يحدده. إنه الحد الأدنى من الجمع الأخلاقي بحسن نية.
  • اجمع بيانات عامة للقراءة فقط، فلا تتجاوز عمليات تسجيل الدخول ولا تجرّف البيانات الشخصية، والتزم بمعدلات معقولة كي لا تضر أداء الموقع المستهدف. راجع هل تجريف الويب قانوني للتأطير القانوني.
  • استخدم بروكسيات ذات مصدر أخلاقي. يجري الجمع المشروع عبر عناوين IP سكنية نظيفة قائمة على الموافقة وتدوير معقول، لا عبر شبكات تخفي حركة مرور مسيئة. ولهذا تحديداً تهم بروكسيات تجريف الويب وطريقة الحصول عليها.

كون robots.txt «مجرد طلب» لا يمنحك ترخيصاً لتجاهله. فالمخاطر العملية للتجريف العدواني تشمل حظر IP وتحديات CDN والاحتكاك بالسمعة والعقود، وهي أمور تتجنبها الممارسة السليمة.

ما يعنيه هذا إذا كنت تدير موقعاً

اتخذ قرارك عن وعي، ثم اجعل robots.txt وCDN متوافقين:

  • هل تريد الظهور في بحث AI؟ اسمح لوكلاء البحث والإجابة، OAI-SearchBot وClaude-SearchBot وPerplexityBot، كي تبقى مؤهلاً للاستشهادات. فالزوار المحالون من AI قناة سريعة النمو وعالية النية.
  • لا تريد تغذية التدريب؟ احظر زواحف التدريب، GPTBot وGoogle-Extended وClaudeBot، مع الإبقاء على وكلاء البحث مسموحاً لهم.
  • تحقق من الطبقتين. تأكد من أن CDN لا تحظر بصمت، أو تكشف، ما يقصده robots.txt، وفكّر في llms.txt لتوجيه الوكلاء إلى أفضل صفحاتك.
  • اختبر ما تراه الوكلاء فعلاً. لأن إجابات AI وعمليات الزحف مخصصة جغرافياً، فإن فحص موقعك وظهوره في AI من عناوين IP في دول مختلفة، عبر بروكسيات سكنية، يريك الصورة الحقيقية لا مجرد المشهد من موقعك المحلي.

الأسئلة الشائعة

هل robots.txt ملزم قانونياً؟

لا. إن robots.txt، الذي جرى توحيده بوصفه RFC 9309، طلب طوعي تحترمه الزواحف الملتزمة. ولا يتمتع بقوة قانونية بمفرده ولا يمنع الوصول تقنياً، فالتنفيذ الفعلي يجري على الخادم أو CDN.

هل يمكنني السماح لـ AI بالاستشهاد بموقعي دون تدريبه عليه؟

نعم. يفصل المزودون الآن بين زواحف التدريب والبحث، لذا يمكنك حظر وكلاء التدريب، GPTBot وGoogle-Extended وClaudeBot، مع السماح لوكلاء البحث، OAI-SearchBot وClaude-SearchBot وPerplexityBot، الذين يجعلونك مؤهلاً للاستشهادات في إجابات AI.

هل تتبع زواحف AI robots.txt فعلاً؟

الزواحف الرئيسية الموثقة، Googlebot وGPTBot وClaudeBot وPerplexityBot، تفعل ذلك عموماً، ويمكنك التحقق في سجلات الخادم. لكن الالتزام اختياري، وعمليات الجلب الفوري التي يشغّلها المستخدم منطقة رمادية، وتوجد وكلاء مستخدم مزيّفة، لذلك فهو معيار لا ضمان.

ما llms.txt، وهل أحتاج إليه؟

llms.txt ملف أحدث يوجّه أنظمة AI إلى محتواك الأكثر قيمة. ينظّم robots.txt الوصول، وينظّم llms.txt التنقل. ما زال التبني مبكراً، بنحو 10% من النطاقات، لكنه إشارة منخفضة الجهد والمخاطر تستحق الإضافة.

هل يهم احترام robots.txt عند التجريف؟

نعم. رغم أنه ليس ملزماً قانونياً، فإن احترام robots.txt وcrawl-delay هو أساس التجريف الأخلاقي والمستدام. يبقيك ضمن مسار قابل للدفاع ويتجنب الحظر وتحديات CDN ومخاطر السمعة.


اجمع بيانات الويب العامة بالطريقة الصحيحة

سواء كنت تبني خط أنابيب بيانات AI أو تراقب كيفية تمثيل AI لعلامتك التجارية، يبدأ الجمع الأخلاقي باحترام إشارات الموقع والعمل على عناوين IP نظيفة قائمة على الموافقة. احصل على بروكسيات سكنية ذات مصدر أخلاقي ابتداءً من $1/GB، مع الدفع حسب الاستخدام، وفي أكثر من 190 دولة، وتحكم جغرافي لاختبار البيانات وجمعها بمسؤولية.

Share article: