In this Article
لا يكون نموذج التعلم الآلي أفضل من البيانات التي يتعلم منها، وبالنسبة إلى معظم الفرق تأتي تلك البيانات من الويب. ويشكّل جمع بيانات التعلم الآلي، أي جمع أمثلة من العالم الحقيقي وتنظيفها وهيكلتها في مجموعة بيانات تدريب، المرحلة التي يُحسم فيها قدر كبير من جودة النموذج أو يُفقد. يشرح هذا الدليل تجريف الويب للتعلم الآلي من البداية إلى النهاية، وكيفية بناء مجموعة بيانات تدريب عالية الجودة: ما معنى الجودة، والخطوات العملية، والتنظيف الأكثر أهمية، والحدود القانونية، ولماذا يعتمد الجمع على نطاق واسع على البروكسيات.
أنا Andrii Byzov، مدير تسويق جزئي متمكن من الذكاء الاصطناعي، وأبني مسارات بيانات الويب للتعلم الآلي والتحليلات. ستجد أدناه خصائص مجموعة البيانات التي تؤثر في أداء النموذج، وسير عمل عملياً من التجريف إلى مجموعة البيانات مع الشيفرة، وكيف تحافظ البروكسيات السكنية على قابلية الجمع للتوسع وتنوعه.
حقائق أساسية
- غالباً ما تكون الجودة وإزالة التكرار ودقة الوسوم أهم من الحجم الخام. يمكن لمجموعة بيانات نظيفة ومتنوعة وموسومة جيداً أن تدرب نموذجاً أفضل من مجموعة أكبر ومشوشة، مع أن الحجم يبقى مفيداً عند ضبط الجودة.
- الويب مصدر شائع لكثير من مجموعات بيانات التعلم الآلي، مثل النصوص والصور والأسعار والمراجعات والقوائم، التي تُجمع بالتجريف حين لا تناسب API أو خلاصة مرخصة أو مجموعة بيانات مفتوحة الغرض المطلوب.
- للمهام الحساسة جغرافياً، استخدم جمعاً يراعي المنطقة. عندما تختلف اللغة أو التسعير أو التوافر حسب الموقع، فإن جلب أمثلة من مناطق كثيرة عبر بروكسيات مستهدفة جغرافياً يتجنب انحياز مجموعة البيانات.
- غالباً ما يستخدم تجريف المواقع محدودة المعدل بكميات كبيرة بروكسيات. يُحظر IP واحد، لذا تعتمد عمليات الجمع الكبيرة على عناوين IP سكنية متناوبة، لكن البروكسيات لا تتجاوز شروط الموقع.
- تكتسب طريقة حصولك على البيانات أهمية قانونية. في قضية Bartz v. Anthropic عام 2025، قضت المحكمة بأن التدريب على كتب مكتسبة بصورة مشروعة استخدام عادل في تلك الوقائع، لكنها رفضت الاستخدام العادل لبناء مكتبة من نسخ مقرصنة، لذا يُعد مصدر البيانات جزءاً من الامتثال.
ما الذي يجعل مجموعة بيانات التدريب جيدة؟
قبل تجريف أي شيء، اعرف ما الذي تستهدفه. تتسم مجموعة بيانات التدريب عالية الجودة بخمس خصائص:
- الملاءمة، أي أن الأمثلة تطابق المهمة والتوزيع الذي سيواجهه نموذجك في بيئة الإنتاج.
- التنوع، أي تنوع المصادر والمناطق والحالات الطرفية كي يعمم النموذج بدلاً من حفظ شريحة واحدة.
- وسوم نظيفة، أي شروح دقيقة ومتسقة، لأن ضوضاء الوسوم تحد من الدقة التي يمكنك بلوغها.
- التوازن، أي تمثيل الفئات والشرائح بنسب منطقية بدلاً من هيمنة ما كان الأسهل تجريفه.
- الحداثة، أي أن تكون حديثة بما يكفي لاستمرار صحة الأنماط، مع خطة للتحديث مع تغير العالم.
ترجع معظم مشكلات عدم استفادة النموذج من المزيد من البيانات إلى ضعف إحدى هذه الخصائص، وغالباً إلى التكرار أو ضوضاء الوسوم أو انحياز مجموعة البيانات لمصدر واحد. يركز هذا الدليل على هذا الجانب، وللاطلاع على منظور شراء البروكسيات راجع أفضل البروكسيات لتدريب التعلم الآلي، وللتعرف إلى المزالق راجع الأخطاء التي تكررها الفرق عند جمع بيانات تدريب الذكاء الاصطناعي.
كيفية بناء مجموعة بيانات تدريب عبر تجريف الويب
الخطوة 1: حدد المخطط والوسوم. قرر الحقول الدقيقة ومجموعة الوسوم قبل الجمع، أي ما الذي يحتويه كل مثال وكيف يُوسم. يساعد البدء من مهمة النموذج والرجوع للخلف في تجنب جمع بيانات لا يمكنك استخدامها.
الخطوة 2: حدد المصادر واجر التجريف على نطاق واسع. حدد المواقع التي تحتوي أمثلتك واجر تجريفها عبر بروكسيات للحصول على الحجم والتنوع الإقليمي. وسّم كل مثال بمصدره ووسمه أثناء الجمع.
import requests
from bs4 import BeautifulSoup
HEADERS = {"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) "
"AppleWebKit/537.36 (KHTML, like Gecko) Chrome/126.0.0.0 Safari/537.36"}
# Rotating residential proxies: scale collection without IP blocks, and pull
# region-diverse examples so the dataset isn't skewed to one location.
proxies = {"http": "http://LOGIN__cr.us;sid.ml1:[email protected]:823",
"https": "http://LOGIN__cr.us;sid.ml1:[email protected]:823"}
def collect(urls, label):
"""Scrape raw text examples and tag each with its source + label."""
rows = []
for url in urls:
try:
r = requests.get(url, headers=HEADERS, proxies=proxies, timeout=30)
r.raise_for_status()
except requests.RequestException:
continue
text = BeautifulSoup(r.text, "html.parser").get_text(" ", strip=True)
rows.append({"text": text, "label": label, "source": url})
return rows
الخطوة 3: نظّف البيانات وأزل التكرار. تكون البيانات الخام المستخرجة بالتجريف مشوشة ومليئة بالتكرارات، والتكرارات أسرع طريق إلى نموذج منحاز ومفرط التكيف. احذف العينات الفارغة والقصيرة جداً، ووحّد النصوص، وأزل التكرارات التامة وشبه التكرارات قبل أي شيء آخر.
import hashlib, re
def clean(t):
return re.sub(r"\s+", " ", t).strip().lower()
def dedup(rows, min_len=40):
"""Drop empties, too-short samples, and exact duplicates — noisy,
duplicated data is the fastest way to a biased, overfit model."""
seen, out = set(), []
for row in rows:
text = row["text"]
if not text or len(text) < min_len:
continue
key = hashlib.sha1(clean(text).encode()).hexdigest()
if key in seen:
continue
seen.add(key)
out.append(row)
return out
urls = ["https://example.com/a", "https://example.com/b"] # your source list
dataset = dedup(collect(urls, label="positive"))
print(f"{len(dataset)} deduplicated examples")
الخطوة 4: ضع الوسوم ونظّم البنية. طبّق وسوماً متسقة، برمجياً حيثما أمكن عبر الإشراف الضعيف والقواعد الإرشادية، مع مراجعة بشرية لعينة لقياس جودة الوسوم. خزّن مجموعة البيانات بتنسيق منظم ومُصدر مثل JSONL/Parquet لتتمكن من إعادة تنفيذ دورات التدريب.
الخطوة 5: تحقق من الجودة. افحص توازن الفئات وتوزيع المصادر والانحياز الواضح قبل التدريب. يكشف تدقيق سريع لعدد الأمثلة لكل فئة ولكل منطقة ولكل مصدر الانحياز الذي يفسد أداء النموذج بهدوء.
لماذا تهم البروكسيات لجمع بيانات التعلم الآلي؟
توجد مشكلتان تجعل جمع بيانات التعلم الآلي على نطاق واسع يفشل من دون بروكسيات. الحجم: تحتاج مجموعات بيانات التدريب إلى آلاف أو ملايين الأمثلة، وتفرض المواقع قيوداً على المعدل وتحظر الزحف المكثف، لذلك يُحظر IP واحد بسرعة. التنوع: إذا جاءت كل الأمثلة من موقع واحد، ترث مجموعة البيانات ذلك الانحياز، لذا تحتاج إلى أمثلة من مناطق عديدة. تساعد بروكسيات DataImpulse السكنية بسعر $1/GB، والمتناوبة عبر 195 دولة، في الأمرين: فالمجموعة المتناوبة الكبيرة تحافظ على الحجم، والاستهداف الجغرافي يجلب أمثلة متنوعة إقليمياً للمهام الحساسة جغرافياً. غير أن البروكسيات تساعدك في الجمع فقط ولا تتجاوز شروط الموقع. وللحصول على الصورة الأوسع عن البيانات المجمعة من الويب، راجع دليلنا حول البيانات البديلة.
هل تجريف البيانات لتدريب التعلم الآلي قانوني؟
الجمع والتدريب مسألتان قانونيتان منفصلتان. الجمع: تسري القواعد المعتادة، فالبيانات العامة غير الشخصية أقل خطراً بوجه عام، لكن الأمر يبقى مرهوناً بحقوق النشر وشروط الموقع وضوابط الوصول وقوانين الخصوصية. تجنب المحتوى المحمي بتسجيل الدخول والبيانات الشخصية وتجاوز ضوابط الوصول. التدريب: في قضية Bartz v. Anthropic عام 2025، قضت محكمة أمريكية بأن التدريب على كتب مكتسبة بصورة مشروعة استخدام عادل في تلك الوقائع، لكنها رفضت الاستخدام العادل لبناء مكتبة من نسخ مقرصنة. لذلك تهم كيفية حصولك على البيانات بقدر أهمية ما تفعله بها. حافظ على سلامة مصدر البيانات، واحترم robots.txt وشروط الموقع، واستشر محامياً بشأن نموذج تجاري. وللاطلاع على الإطار الكامل، راجع مدى قانونية تجريف الويب. هذه معلومات عامة وليست استشارة قانونية.
الأسئلة الشائعة
ما المقصود بجمع بيانات التعلم الآلي؟
إنها عملية جمع أمثلة من العالم الحقيقي وتنظيفها وهيكلتها ضمن مجموعة بيانات يمكن للنموذج أن يتدرب عليها. وبالنسبة إلى معظم الفرق، يكون المصدر الرئيسي هو الويب العام، بما يشمل النصوص والصور والأسعار والمراجعات والقوائم، وتُجمع عبر تجريف الويب عندما لا تتوفر API أو خلاصة مرخصة، ثم تُزال التكرارات وتُوسم البيانات وتُتحقق صحتها.
كم أحتاج من البيانات لتدريب نموذج؟
يتوقف ذلك على المهمة والنموذج، لكن الجودة والتنوع أهم من العدد الخام. فعادة ما تتفوق مجموعة بيانات أصغر ونظيفة ومتوازنة جيداً وموسومة بدقة على مجموعة أكبر مشوشة. ركز على إزالة التكرارات وضوضاء الوسوم، وعلى تغطية الحالات التي سيواجهها نموذجك في بيئة الإنتاج، قبل السعي وراء الحجم.
لماذا تعد إزالة التكرار مهمة جداً لبيانات التدريب؟
تمنح التكرارات وزناً زائداً لما يتكرر، فتتحيز للنموذج وتضخم درجات التقييم، إذ قد يظهر المثال نفسه في مجموعتي التدريب والاختبار معاً. وإزالة التكرارات التامة وشبه التكرارات من أكثر خطوات التنظيف تأثيراً، فهي تحسن قابلية التعميم وتجعل مقاييسك جديرة بالثقة.
هل أحتاج إلى بروكسي لتجريف بيانات تدريب التعلم الآلي؟
عادة نعم عند تجريف مواقع كبيرة الحجم تفرض قيوداً على المعدل بحسب IP، إذ يتطلب بناء مجموعة بيانات طلبات كثيرة ويجري حظر IP واحد سريعاً. تحافظ بروكسيات سكنية متناوبة على الحجم وتتيح لك جلب أمثلة متنوعة حسب المنطقة، لكنها لا تتجاوز شروط الموقع، لذا اجمع البيانات بمسؤولية. وقد تتيح API أو الخلاصات المرخصة أو مجموعات البيانات المفتوحة مثل Common Crawl تجنب التجريف بالكامل أحياناً.
هل تجريف البيانات لتدريب نموذج قانوني؟
الجمع والتدريب مسألتان منفصلتان. جمع البيانات العامة غير الشخصية أقل خطراً بوجه عام، لكنه ليس مباحاً تلقائياً، فما زالت حقوق النشر وشروط الخدمة وضوابط الوصول وقوانين الخصوصية سارية. تجنب تسجيلات الدخول والبيانات الشخصية وتجاوز الضوابط. وفي التدريب، قضت قضية Bartz v. Anthropic في 2025 بأن تدريب الكتب المكتسبة بصورة مشروعة استخدام عادل في تلك الوقائع، لكنها رفضت ذلك لمكتبة من نسخ مقرصنة، لذلك يهم مصدر البيانات. احترم شروط الموقع واستشر محامياً للاستخدام التجاري. هذه ليست استشارة قانونية.
الخلاصة
بناء مجموعة بيانات تدريب عالية الجودة عملية وليس مجرد تنزيل: حدد المخطط، واجر تجريف المصادر المناسبة على نطاق واسع، وأزل التكرارات ونظف البيانات بحزم، وضع الوسوم باتساق، وتحقق من التوازن والانحياز. تعيش معظم البيانات على الويب، لذلك فإن طبقة الجمع المتنوعة جغرافياً وعالية الحجم وغير المحجوبة هي ما يجعل بقية العملية ممكنة، وهذا ما توفره البروكسيات السكنية. حافظ على سلامة مصدر البيانات وضع الحدود القانونية في الحسبان، وسيؤدي جمع بيانات التعلم الآلي لديك إلى مجموعات بيانات يمكن للنموذج التعلم منها فعلياً. وللبنية التحتية، راجع أفضل البروكسيات لتدريب التعلم الآلي وأفضل البروكسيات لتجريف الويب.
آخر تحديث: 25 يونيو 2026.
