الوحدة 10 — حقوق التأليف والمصدر والاستخدام المسؤول
كلّ الوحدات السابقة كانت هندسة. هذه الوحدة تفتح ما لا تحلّه الشفرة: النماذج التوليدية تُدرَّب على بيانات تحمل حقوقًا، وتنتج محتوى قد يُنسَب زورًا لأشخاص حقيقيّين، وتُنشَر في فضاء يخضع لتشريعات جديدة تتشكّل بينما نكتب. تجاهل هذه المسائل ليس خيارًا مهنيًّا مقبولًا.
بيانات التدريب: من أين تأتي، وأيّ حقوق تحمل؟
نماذج مثل Stable Diffusion دُرِّبت على LAION-5B، مجموعة بيانات مفتوحة تحوي 5 مليارات زوج (نصّ، صورة) مأخوذة من الويب. جامعو البيانات يدّعون أنّ الجمع «للأغراض البحثيّة» يخضع لاستثناءات الاستعمال العادل. لكن الاستعمال الفعليّ للنماذج تجاريًّا، مع تدريب على صور محميّة الحقوق، فتح دعاوى قضائيّة عديدة:
- Getty Images ضدّ Stability AI (بريطانيا، 2023): استعمال صور Getty في التدريب دون ترخيص، مع بقاء علامتها المائيّة أحيانًا في الصور المولَّدة.
- مصوّرون ورسّامون ضدّ Midjourney وStability (كاليفورنيا، 2023-2024): استعمال أعمالهم في التدريب، مع القدرة على توليد صور «بأسلوب فنّان X».
- صحيفة New York Times ضدّ OpenAI (2023): استعمال محتوى الصحيفة في تدريب GPT، مع قدرة النموذج على استظهار مقاطع طويلة تكاد تكون حرفيّة.
القضايا لم تُحسم كلّها. لكن الاتّجاه واضح: الاستعمال التجاريّ يحتاج إلى تراخيص واضحة على البيانات، أو إلى بيانات تحت رخصة متساهلة (Creative Commons، المجال العامّ). نماذج مثل Adobe Firefly بُنيت من البداية على بيانات مرخّصة، وتُبيَع مع ضمان قانونيّ للعملاء.