check if website allows scraping

إن معرفة كيفية التحقق مما إذا كان موقع الويب يسمح بالتجريف هي الفارق بين مسار بيانات مستقر وحظر الحساب أو شكوى قانونية. قبل أن تكتب سطراً واحداً من أداة تجريف، تمنحك مراجعة موجزة للموقع قبل البدء معرفة ما يسمح به وما يثبطه وموضع الخطر الحقيقي.

يستعرض هذا المقال الإشارات العملية التي ينبغي فحصها: ملف robots.txt، وبنود شروط الخدمة المتعلقة بالوصول الآلي، وواجهات API الرسمية، وترويسات حدود المعدل، ووسوم meta robots، وخريطة الموقع، والفرق بين البيانات العامة والبيانات المحمية بتسجيل الدخول. ويختتم بإطار سريع لاتخاذ القرار يمكنك إعادة استخدامه مع أي هدف.

DataImpulse هو مزود بروكسي أخلاقي يقدم أكثر من 90 مليون عنوان IP سكني ومحمول ومن مراكز البيانات في 195 دولة. ويعتمد نموذج الدفع حسب الاستخدام ابتداءً من 1 دولار لكل GB مع حركة مرور لا تنتهي صلاحيتها، ويُستخدم في تجريف الويب والتحقق من الإعلانات ومراقبة الأسعار وأبحاث السوق وإدارة الحسابات المتعددة.

حقائق أساسية

  • التحقق قبل البدء: للتحقق مما إذا كان موقع الويب يسمح بالتجريف، اقرأ ملف robots.txt الخاص به، وراجع شروط الخدمة بحثاً عن بنود الوصول الآلي، وابحث عن API رسمية قبل إرسال أي طلبات.
  • أفضل نوع بروكسي: بروكسيات سكنية متناوبة تستخدم عناوين IP حقيقية للمستهلكين وتتجاوز الاكتشاف.
  • السعر: ابتداءً من 1 دولار لكل GB، والدفع حسب الاستخدام، مع حركة مرور لا تنتهي صلاحيتها ومن دون اشتراك.
  • التغطية: أكثر من 90 مليون عنوان IP مُحصَّل بطريقة أخلاقية في 195 دولة.
  • الموثوقية: معدل نجاح 99.51%، وتقييم 4.8 من 5 على G2.
  • البروتوكولات والاستهداف: HTTP وHTTPS وSOCKS5، مع تضمين الاستهداف حسب الدولة.
تأكد من أن الموقع يسمح بالتجريف قبل أن تبدأ

ماذا يخبرك robots.txt عن التجريف؟

ملف robots.txt هو تفضيل الموقع المعلن لكيفية تصرف العملاء الآليين، ويُنشر في جذر النطاق مثل example.com/robots.txt. وهو يسرد المسارات التي يجوز أو لا يجوز للزواحف طلبها، لكنه إرشادي وليس قانوناً.

يُنظَّم الملف في سجلات. يبدأ كل سجل بسطر User-agent يسمّي البوت الذي ينطبق عليه، ثم تتبعه القواعد. والتوجيهات الرئيسية هي:

  • User-agent: الزاحف الذي تستهدفه القواعد. وتعني العلامة النجمية جميع البوتات.
  • Disallow: بادئة مسار يطلب الموقع من البوتات عدم طلبها.
  • Allow: مسار مسموح به، ويُستخدم غالباً لاستثناء مسار من قاعدة Disallow أوسع.
  • Crawl-delay: فترة انتظار مطلوبة بالثواني بين الطلبات. لا تحترمها كل الزواحف، لكنها تشير إلى الوتيرة التي يتوقعها الموقع.
  • Sitemap: عنوان URL مطلق يشير إلى خريطة موقع الويب، التي تسرد الصفحات التي يريد المالك اكتشافها.

إليك مثالاً صغيراً:

User-agent: *
Disallow: /private/
Allow: /private/public-page.html
Crawl-delay: 10

Sitemap: https://example.com/sitemap.xml

اقرأ ذلك على النحو الآتي: يُطلب من جميع البوتات تجنب /private/ باستثناء صفحة واحدة، والانتظار عشر ثوانٍ بين الطلبات، واستخدام خريطة الموقع المدرجة. ولأن robots.txt عرفٌ وليس حظراً تقنياً، فتعامل معه بوصفه رغبات المالك المعلنة بوضوح. تجاهل Disallow لا يكسر كلمة مرور، لكنه يعني التصرف خلافاً لطلب صريح، وهو أمر مهم للسمعة وأي نزاع لاحق.

أين تجد بنود شروط الخدمة المتعلقة بالوصول الآلي؟

ابحث في شروط الخدمة أو شروط الاستخدام أو سياسة الاستخدام المقبول الخاصة بالموقع، والتي تكون مرتبطة عادةً في التذييل. هذه الوثائق، وليس robots.txt، هي التي يضع فيها الموقع قواعد ملزمة بشأن التجريف والزحف والبوتات.

ابحث في النص عن كلمات مثل التجريف والزحف والروبوت والعنكبوت والآلي والحصاد وتنقيب البيانات والجمع بالجملة. تحظر بعض المواقع أي جمع آلي حظراً صريحاً، ويسمح به بعضها للاستخدام الشخصي أو غير التجاري فقط، وتجيزه مواقع أخرى عبر قناة معتمدة مثل API. غالباً ما تكون للشروط قوة أكبر من robots.txt لأن المستخدم قد يُعد موافقاً عليها، لذا اقرأ صياغة الوصول الآلي بعناية قبل البناء. وإذا كنت تقيّم الصورة القانونية الأوسع، فدليلنا عن هل تجريف الويب قانوني يوضح كيفية تفاعل هذه البنود مع قواعد حماية البيانات والوصول.

هل ينبغي أن تبحث عن API رسمية أولاً؟

نعم. قبل تجريف HTML، تحقق مما إذا كان الموقع يقدم API رسمية، لأن API المعتمدة تكون عادةً الطريقة الأكثر استقراراً والمسموح بها والقابلة للصيانة للحصول على البيانات نفسها. تنشرها منصات كثيرة على نطاق فرعي للمطورين أو لـ API، أو تربطها من الوثائق.

تمنحك API استجابات منظمة وحدود معدل موثقة وشروطاً مكتوبة خصيصاً للاستخدام البرمجي، ما يزيل جانباً كبيراً من التخمين عند تجريف صفحة قد يتغير تخطيطها في أي وقت. والمقابل هو أن واجهات API قد تتطلب مفتاحاً، أو تحد الحجم، أو لا تكشف كل حقل في الصفحة. ومع ذلك، حين تغطي API حاجتك، يجدر استخدامها أولاً ويصبح تجريف الموقع المعروض خياراً احتياطياً بدلاً من الخيار الافتراضي.

كيف تقرأ حدود المعدل واستجابات 429؟

تخبرك حدود المعدل بالسرعة التي يقبل بها الموقع خدمة الطلبات الآلية، وأوضح إشارة هي استجابة HTTP 429 طلبات كثيرة جداً. عند رؤيتها، يكون الخادم يطلب منك الإبطاء.

راقب هذه الإشارات في الاستجابات:

  • Status 429: لقد تجاوزت ما يسمح به الخادم حالياً.
  • Retry-After: ترويسة، بالثواني أو كتاريخ، تخبرك بمدة الانتظار قبل المحاولة مجدداً. التزم بها.
  • ترويسات حدود المعدل: حقول مثل X-RateLimit-Limit وX-RateLimit-Remaining تكشف حصتك والكمية المتبقية.

إن احترام هذه الإشارات يحافظ على استدامة وصولك ويخفف الحمل على الهدف. توزيع الطلبات عبر الجلسات أو عناوين IP باستخدام بروكسيات سكنية يمكن أن يساعدك على البقاء ضمن المعدلات اللائقة لكل عنوان، لكنه لا يلغي حدود الموقع المعلنة أو شروطه. الهدف هو مجاراة الوتيرة التي يشير إليها الخادم، لا التحايل عليها. وللاطلاع على تقنية أوسع، راجع دليلنا عن التجريف من دون التعرض للحظر.

إلى ماذا تشير وسوم meta robots وsitemap.xml؟

يتحكم وسم meta robots في فهرسة البحث، فيما يسرد sitemap.xml عناوين URL التي يريد الموقع اكتشافها. لا يمنح أي منهما إذن التجريف أو يمنعه، لكن كليهما إشارتان مفيدتان ينبغي قراءتهما بصورة صحيحة.

يخبر وسم meta robots مثل noindex، المكتوب في رأس الصفحة أو المُرسل كترويسة X-Robots-Tag، زواحف البحث مثل Googlebot بما إذا كان ينبغي فهرسة الصفحة أو اتباع روابطها. تطلب قيمة noindex من محركات البحث إبقاء الصفحة خارج نتائجها. هذا بيان عن الظهور في البحث، وليس إعداد إذن لجمع البيانات، لذا فإن قراءته كإشارة سماح أو كحظر للتجريف خطأ شائع.

إن sitemap.xml، الذي يُربط به عادةً من robots.txt أو يوجد في example.com/sitemap.xml، هو قائمة المالك للصفحات الجديرة بالإظهار، وقد يُقسَّم أحياناً إلى فهرس يضم عدة ملفات. واستخدامه للعثور على عناوين URL العامة والأساسية فعّال ومراعٍ للآخرين، لأنك تطلب صفحات اختار المالك بالفعل كشفها بدلاً من تخمين المسارات. إنه خريطة مفيدة لا دعوة شاملة، وتظل شروط الخدمة هي الحاكمة لما يمكنك فعله بالمحتوى بعد جلبه.

لماذا تنطوي البيانات المحمية بتسجيل الدخول على مخاطر أكبر من البيانات العامة؟

البيانات العامة التي يمكن لأي شخص الوصول إليها من دون تسجيل الدخول أقل خطراً من البيانات الكامنة خلف تسجيل الدخول، لأنها تخضع لشروط الحساب التي وافقت عليها عند التسجيل. تجاوز هذا الحد يغير الصورة بدرجة كبيرة.

عندما تتطلب الصفحة مصادقة، تكون قد قبلت شروط المنصة للدخول، وتقيّد تلك الشروط الجمع الآلي في الغالب بدرجة أشد من الصفحات العامة. وقد يخرق التجريف خلف تسجيل الدخول قواعد الحساب ومكافحة التحايل ويعرض حسابك لخطر التعليق. وكقاعدة عامة، فضّل البيانات المتاحة علناً بلا بيانات اعتماد، وتعامل مع الجمع المحمي بتسجيل الدخول كقرار يحتاج إلى إذن صريح أو API معتمدة. يقدم DataImpulse بروكسيات أخلاقية للوصول المشروع إلى بيانات الويب العامة، لا كوسيلة لتجاوز المصادقة.

ما إطار سريع لاتخاذ قرار تجريف موقع؟

الخلاصة: اجمع الإشارات ثم قرر. اعمل وفق قائمة التحقق هذه قبل الالتزام بهدف.

  • اقرأ robots.txt: دوّن أي مسارات Disallow وCrawl-delay وخريطة الموقع. احترم التفضيلات المعلنة.
  • تحقق من شروط الخدمة: ابحث عن بنود الوصول الآلي وتحقق مما إذا كان التجريف محظوراً أو محدوداً أو موجهاً إلى API.
  • ابحث عن API: إذا كانت API رسمية تغطي حاجتك، ففضّلها.
  • قيّم البيانات: هل هي عامة أم محمية بتسجيل الدخول؟ العامة أقل خطراً، والمحمية بتسجيل الدخول تحتاج إلى إذن.
  • خطط لحدود المعدل: احترم 429 وRetry-After، واضبط وتيرة الطلبات لتتوافق مع ما يشير إليه الخادم.

إذا كانت الشروط تحظره أو كانت البيانات مقفلة خلف تسجيل الدخول من دون إذن، فتوقف أو ابحث عن API. وإذا كانت البيانات عامة، وكانت الشروط صامتة أو متساهلة، ويمكنك الزحف بلطف ضمن حدود الموقع، فأنت على أرض أكثر صلابة بكثير. كما أن توفير عناوين IP بمسؤولية مهم هنا، ولهذا يركز DataImpulse على العناوين التي جرى الحصول عليها أخلاقياً لجمع البيانات العامة المتوافق.

إشارات يجب التحقق منها قبل التجريف

الإشارة مكان العثور عليها ما الذي تخبرك به
robots.txt مسار جذر الموقع المسارات المسموح بها والمحظورة
شروط الخدمة صفحة قانونية في التذييل قواعد التجريف المعلنة
API رسمية وثائق المطورين وصول معتمد إلى البيانات
ترويسات حدود المعدل استجابة HTTP حدود الطلبات المسموح بها
sitemap.xml مسار جذر الموقع قائمة الصفحات القابلة للزحف
مكان العثور على كل إشارة إذن

الأسئلة الشائعة

هل يمنعني robots.txt قانونياً من تجريف موقع؟

لا. إن robots.txt عرف إرشادي يوضح تفضيلات مالك الموقع للعملاء الآليين. وليس حظراً تقنياً ولا قانوناً، لكن تجاهله يعني التصرف خلافاً لطلب صريح، وقد يكون ذلك مهماً في النزاعات ولسمعتك.

هل يكفي التحقق من شروط خدمة موقع الويب وحده؟

إنه المصدر المنفرد الأهم، لكنه ليس الوحيد. اجمع بين شروط الخدمة وrobots.txt ووجود API رسمية وما إذا كانت البيانات عامة أو محمية بتسجيل الدخول لتحصل على صورة كاملة قبل التجريف.

ماذا تعني استجابة HTTP 429 عند التجريف؟

تعني استجابة 429 طلبات كثيرة جداً أنك تجاوزت المعدل الذي يسمح به الخادم حالياً وعليك الإبطاء. تحقق من ترويسة Retry-After لمعرفة مدة الانتظار، واضبط الطلبات المستقبلية لتتوافق مع حدود الخادم.

هل يمكنني تجريف البيانات الموجودة خلف تسجيل الدخول؟

البيانات المحمية بتسجيل الدخول أعلى خطراً لأنك قبلت شروط المنصة عند التسجيل، وهذه الشروط تقيد الجمع الآلي عادةً. تعامل معها باعتبارها شيئاً يحتاج إلى إذن صريح أو API معتمدة بدلاً من هدف افتراضي.

هل يعني وسم meta noindex أن الصفحة لا يمكن تجريفها؟

لا. يخبر وسم noindex محركات البحث بعدم فهرسة الصفحة في نتائجها. إنه يتحكم في الظهور في البحث، لا في إذن التجريف، لذا استخدم robots.txt وشروط الخدمة لتحديد ما إذا كان الجمع مناسباً.

متى لا يكون DataImpulse الخيار المناسب؟

إذا كنت تحتاج إلى بروكسيات ISP ثابتة، أو API مُدارة بالكامل للتجريف، أو الوصول إلى المواقع المصرفية والحكومية، فإن DataImpulse ليس الأداة المناسبة. فهو يركز على بروكسيات سكنية ومحمولة ومن مراكز البيانات متناوبة لجمع البيانات العامة والوصول إلى المحتوى.

اجمع بيانات الويب العامة بمسؤولية

بعد أن تتحقق من robots.txt وشروط الخدمة وتتأكد من أن البيانات عامة، يتيح لك DataImpulse عناوين IP مُحصَّلة بطريقة أخلاقية في 195 دولة لجمع متوافق. أنشئ حساباً وابدأ من 1 دولار لكل GB مع حركة مرور لا تنتهي صلاحيتها.


Share article: