In this Article
أصبح قانون الذكاء الاصطناعي للاتحاد الأوروبي الآن الإطار التنظيمي الذي لا تستطيع فرق بيانات الويب والذكاء الاصطناعي تجاهله. واعتباراً من أغسطس 2026، يبدأ تطبيقه فعلياً بحزم، ويلامس التزامان فيه مباشرةً طريقة جمع بيانات التدريب: إذ يتعين على مزودي نماذج الذكاء الاصطناعي للأغراض العامة (GPAI) نشر ملخص لبيانات تدريبهم وتطبيق سياسة لحقوق النشر تحترم طلبات الانسحاب القابلة للقراءة آلياً. وبعبارات بسيطة، فإن الإشارات التي يستخدمها موقع الويب للقول لا تستخرجوا بياناتي، مثل robots.txt وai.txt وتحفظات TDM، تكتسب الآن ثقلاً قانونياً لكل من يدرب نماذج للسوق الأوروبية. يوضح هذا الدليل ما الذي تغير، ومن المتأثر، وما الذي ينبغي فعله إذا كنت تجمع بيانات الويب.
أنا Andrii Byzov، مدير تسويق جزئي يعمل بأسلوب أصيل للذكاء الاصطناعي، وأعمل يومياً مع مسارات بيانات الويب. في ما يلي نظرة عملية ومحدّثة لعام 2026، مع التنبيه المهم إلى أن هذه معلومات عامة وليست استشارة قانونية. للاطلاع على موضوعات ذات صلة، راجع دليل robots.txt وزواحف الذكاء الاصطناعي وهل تجريف الويب قانوني؟.
حقائق أساسية
- قانون الذكاء الاصطناعي للاتحاد الأوروبي (اللائحة 2024/1689) هو أول قانون شامل للذكاء الاصطناعي في العالم، ويعتمد على المخاطر ويجري تطبيقه تدريجياً من 2024 إلى 2027.
- بدأت قواعد GPAI في 2 أغسطس 2025؛ ويبدأ التطبيق الحازم في 2 أغسطس 2026، مع غرامات تصل إلى €15M أو 3% من الإيرادات لمزودي GPAI، إلى جانب التزامات الشفافية والأنظمة عالية المخاطر.
- ملخص بيانات التدريب: يجب على مزودي GPAI نشر عرض عام لمحتوى تدريبهم باستخدام النموذج الإلزامي للمفوضية.
- الانسحاب من حقوق النشر / TDM: يجب أن يتبع المزودون سياسة تحدد وتحترم تحفظات الحقوق المقدمة بموجب استثناء الاتحاد الأوروبي للتنقيب في النصوص والبيانات، بما يشمل الإشارات القابلة للقراءة آلياً مثل robots.txt وai.txt.
- يستهدف مزودي النماذج لا البروكسي: ترتبط الالتزامات بمن ينشئ نماذج GPAI أو يطرحها في سوق الاتحاد الأوروبي وبكيفية جمع البيانات. البنية التحتية، مثل البروكسي، محايدة؛ والمهم هو ما تجمعه وما إذا كنت تحترم طلبات الانسحاب.
ما هو قانون الذكاء الاصطناعي للاتحاد الأوروبي، ولماذا يمس بيانات الويب؟
قانون الذكاء الاصطناعي للاتحاد الأوروبي لائحة قائمة على المخاطر: فهو يصنف استخدامات الذكاء الاصطناعي إلى مستويات محظورة وعالية المخاطر ومحدودة المخاطر ومنخفضة المخاطر، ويفرض التزامات وفقاً لذلك. يتعلق معظم القانون بكيفية بناء أنظمة الذكاء الاصطناعي ونشرها، لكن جزءاً محدداً منه يستهدف نماذج الذكاء الاصطناعي للأغراض العامة، أي النماذج الكبيرة التي تقف وراء روبوتات المحادثة والمساعدين، ويمتد هذا الجزء إلى مرحلة جمع البيانات. ولأن النماذج الحديثة تُدرَّب على بيانات بحجم الويب، فإن قواعد القانون المتعلقة بالشفافية وحقوق النشر تنظم عملياً كيفية جمع بيانات الويب وتوثيقها.
الجدول الزمني المهم
| التاريخ | ما الذي يسري تطبيقه؟ |
|---|---|
| 1 أغسطس 2024 | دخول قانون الذكاء الاصطناعي حيز النفاذ |
| 2 فبراير 2025 | حظر الممارسات المحظورة وواجبات الإلمام بالذكاء الاصطناعي |
| 2 أغسطس 2025 | بدء التزامات GPAI وسريان اشتراط ملخص بيانات التدريب |
| 2 أغسطس 2026 | بدء التطبيق الحازم: غرامات GPAI، وقواعد الشفافية، والتزامات الأنظمة عالية المخاطر |
| 2 أغسطس 2027 | يجب على نماذج GPAI السابقة، المطروحة قبل أغسطس 2025، نشر ملخص بيانات تدريبها |
التزامان يؤثران في جمع البيانات
1. ملخص بيانات التدريب. بموجب المادة 53، يجب على مزودي GPAI نشر ملخص مفصل بالقدر الكافي للمحتوى المستخدم في تدريب النموذج، باستخدام نموذج أصدره مكتب الذكاء الاصطناعي التابع للمفوضية. ويطلب النموذج أنواع المحتوى ومصادر البيانات وطرق الجمع، مع توقع تفاصيل أكثر للبيانات المُجرفة علناً مقارنة بمجموعات البيانات المرخصة أو الخاصة. والأثر العملي هو أنك إذا جرّفت الويب لتدريب نموذج، فعليك أن تعرف وتوثق مصدر بياناتك.
2. سياسة حقوق النشر والانسحاب من TDM. كذلك بموجب المادة 53، يجب على المزودين الحفاظ على سياسة للامتثال لقانون حقوق النشر في الاتحاد الأوروبي، وبصفة خاصة لتحديد واحترام تحفظات الحقوق المقدمة بموجب استثناء التنقيب في النصوص والبيانات (TDM) في توجيه DSM، المادة 4. ويمكن لأصحاب الحقوق استبعاد أعمالهم من التنقيب، والأهم أن هذه التحفظات تُعبَّر عنها عبر إشارات قابلة للقراءة آلياً. ويلزم مدونة ممارسات GPAI الموقعين عليها باحترام robots.txt وبروتوكولات تحفظ الحقوق القابلة للقراءة آلياً. وهنا تتصل الواجبات القانونية بإعدادات الزاحف لديك.
طلبات الانسحاب القابلة للقراءة آلياً أصبحت ذات أثر قانوني
هذا هو التغيير الأهم على الإطلاق لفرق البيانات. لسنوات، كان robots.txt مجرد عرف، راجع دليلنا عن robots.txt وزواحف الذكاء الاصطناعي. وبموجب نظام حقوق النشر في قانون الذكاء الاصطناعي، يصبح احترام طلبات الانسحاب القابلة للقراءة آلياً، مثل robots.txt وai.txt وبروتوكولات تحفظات TDM الناشئة، جزءاً من امتثال مزود GPAI. فتجاهل إشارة صالحة وقابلة للقراءة آلياً تعني لا تستخرجوا بياناتي لم يعد مجرد تصرف غير لائق، بل قد يقوض سياسة الامتثال لحقوق النشر التي يفرضها القانون. وقد أجرت المفوضية مشاورات حتى بشأن بروتوكولات معيارية للتعبير عن هذه التحفظات.
على من ينطبق ذلك فعلياً؟
- مزودو نماذج GPAI، أي كل من ينشئ نموذجاً للأغراض العامة أو يطرحه في سوق الاتحاد الأوروبي، يتحملون واجبات ملخص بيانات التدريب وسياسة حقوق النشر، بصرف النظر عن مقرهم الرئيسي.
- الفرق التي تدرب النماذج أو تضبطها بدقة لمستخدمي الاتحاد الأوروبي باستخدام بيانات مُجرفة، إذ ترث توقعات التوثيق واحترام طلبات الانسحاب.
- مورّدو البيانات والقائمون بالتجريف الذين يرفدون هذه المسارات، إذ تصبح ممارسات جمعهم جزءاً من سلسلة امتثال العميل، ولذلك يهم إثبات المصدر والتعامل مع طلبات الانسحاب تجارياً.
لاحظ التداخل مع GDPR: إذا كانت البيانات المُجرفة تتضمن معلومات شخصية، يسري قانون حماية البيانات في الاتحاد الأوروبي فوق قانون الذكاء الاصطناعي. وينطبق النظامان معاً.
ما الذي ينبغي فعله إذا كنت تجمع بيانات الويب للذكاء الاصطناعي؟
- احترم طلبات الانسحاب القابلة للقراءة آلياً. اقرأ واحترم تحفظات robots.txt وTDM/ai.txt للمصادر التي تتعامل معها، فهذا أصبح جزءاً من الامتثال لحقوق النشر لا مجرد لياقة.
- احتفظ بإثبات المصدر. سجل مصدر كل مجموعة بيانات ووقت جمعها وطريقته، لكي تتمكن من إعداد ملخص بيانات التدريب والإجابة عن الأسئلة اللاحقة.
- فضّل البيانات العامة غير الشخصية وافحص وجود معلومات شخصية لإدارة التعرض لمخاطر GDPR؛ ولا تتجاوز عمليات تسجيل الدخول أو ضوابط الوصول.
- اجمع البيانات بأخلاقية وشفافية. استخدم بنية تحتية بموافقة أصحابها ومصادرها أخلاقية، وبمعدلات معقولة، إذ إن مصدر أدواتك جزء من القصة التي سيُطلب منك توضيحها.
أين يندرج البروكسي؟
البروكسي بنية تحتية محايدة: ينظم قانون الذكاء الاصطناعي ما تجمعه وما إذا كنت تحترم طلبات الانسحاب، لا وسيلة النقل. ومع ذلك، فإن مصدر البروكسيات لديك جزء من مسار يمكن الدفاع عنه وأخلاقي، ولهذا تهم عناوين IP السكنية ذات المصدر الأخلاقي. كما تساعد البروكسيات في جانب اختبار الامتثال: لأن القواعد ولافتات الموافقة والمحتوى تختلف بحسب الدولة، فإن التحقق من طريقة عرض موقعك أنت، أو موقع مستهدف، عبر أسواق الاتحاد الأوروبي من عناوين IP محلية يمنحك صورة دقيقة. بروكسيات DataImpulse ذات مصدر أخلاقي وتعمل بنظام الدفع حسب الاستخدام، مع استهداف على مستوى الدولة في أنحاء الاتحاد الأوروبي. إنها طبقة بنية تحتية موثوقة ضمن عملية جمع مسؤولة، وليست بديلاً عن العمل القانوني.
الأسئلة الشائعة
هل يحظر قانون الذكاء الاصطناعي للاتحاد الأوروبي تجريف الويب؟
لا، فهو لا يحظر التجريف. بل ينظم مزودي نماذج الذكاء الاصطناعي للأغراض العامة، ويشترط ملخصاً لبيانات التدريب وسياسة لحقوق النشر تحترم طلبات الانسحاب القابلة للقراءة آلياً، مما يؤثر بصورة غير مباشرة في كيفية جمع بيانات التدريب وتوثيقها.
متى يبدأ تطبيق قانون الذكاء الاصطناعي للاتحاد الأوروبي؟
دخل حيز النفاذ في 1 أغسطس 2024 ويجري تطبيقه تدريجياً: تبدأ التزامات GPAI في 2 أغسطس 2025، ويبدأ التطبيق الحازم، بما فيه غرامات GPAI التي تصل إلى €15M أو 3% من الإيرادات والتزامات الشفافية والأنظمة عالية المخاطر، في 2 أغسطس 2026.
ما هو ملخص بيانات التدريب؟
بموجب المادة 53، يجب على مزودي GPAI نشر عرض مفصل بالقدر الكافي للمحتوى المستخدم في تدريب نموذجهم، باستخدام النموذج الإلزامي للمفوضية، ويغطي أنواع المحتوى ومصادره وطرق جمعه، مع تفاصيل أكثر للبيانات المُجرفة علناً.
هل يجب أن أحترم robots.txt بموجب قانون الذكاء الاصطناعي؟
عملياً نعم، إذا كنت تدرب نماذج لسوق الاتحاد الأوروبي. فقواعد حقوق النشر في القانون تقتضي احترام طلبات الانسحاب من التنقيب في النصوص والبيانات المعبر عنها عبر إشارات قابلة للقراءة آلياً، وتلزم مدونة ممارسات GPAI باحترام robots.txt وبروتوكولات تحفظ الحقوق.
هل ينطبق قانون الذكاء الاصطناعي على الشركات من خارج الاتحاد الأوروبي؟
نعم. ترتبط الالتزامات بالمزودين الذين يطرحون نماذج الذكاء الاصطناعي للأغراض العامة في سوق الاتحاد الأوروبي بصرف النظر عن مقرهم، لذلك تدخل الفرق من خارج الاتحاد الأوروبي التي تخدم مستخدميه ضمن النطاق.
أنشئ مسار بيانات الذكاء الاصطناعي على بنية تحتية نظيفة وأخلاقية
يبدأ جمع بيانات الذكاء الاصطناعي بمسؤولية من احترام إشارات الموقع والعمل بعناوين IP ذات مصدر أخلاقي. احصل على بروكسيات سكنية ذات مصدر أخلاقي ابتداءً من $1/GB، بنظام الدفع حسب الاستخدام، وتغطية للاتحاد الأوروبي والعالم، مع تحكم جغرافي يتيح لك الجمع والاختبار بمسؤولية.
هذه المقالة معلومات عامة وليست استشارة قانونية. استشر محامياً مؤهلاً بشأن التزاماتك المحددة بموجب قانون الذكاء الاصطناعي للاتحاد الأوروبي وتوجيه DSM وGDPR.
