أهلاً بكم يا شباب معهد ديف بوينت للتطوير والتقنية. قضية بيانات التدريب الخاصة بنماذج الذكاء الاصطناعي أصبحت واحدة من أكبر القضايا المثارة في الوسط التقني حالياً. في الوقت الذي تتنافس فيه الشركات على إطلاق نماذج أكثر قوة وكفاءة، يظل السؤال الأهم: من أين تأتي هذه البيانات؟ وثائق قضائية وتسريبات حديثة كشفت تفاصيل جديدة حول استخدام ملايين الكتب المحمية بحقوق الملكية الفكرية لتدريب كبرى النماذج اللغوية.
مكتبة LibGen وكواليس تدريب نماذج LLaMA
في قلب هذه الكواليس تبرز مكتبة Library Genesis (LibGen)، وهي إحدى أشهر المكتبات غير المصرح بها على الإنترنت والتي تحتوي على ملايين الكتب والمقالات الرقمية المحمية بحقوق النشر.
موقف الإدارة والقرارات التنفيذية
الوثائق القضائية أوضحت أن القرارات لم تأتِ من صغار المطورين فحسب، بل كانت بعلم وموافقة من المستويات الإدارية العليا، حيث كان الحصول على تراخيص رسمية لكل هذه الكتب سيكلف مبالغ طائلة ويستغرق سنوات من التفاوض.
من مختبرات Meta إلى تأسيس Mistral AI
من أبرز الأسماء التي وردت في الوثائق الباحث غيوم لامبل (Guillaume Lample)، الذي كان يعمل سابقاً في مختبر FAIR لشركة Meta، ويشغل حالياً منصب المدير العلمي والشريك المؤسس لشركة Mistral AI الفرنسية.
أزمة حقوق الملكية بين الابتكار والقانون
توضح هذه القضية حجم التحديات التي تواجه قطاع الذكاء الاصطناعي اليوم. فالوصول إلى كميات هائلة من البيانات أصبح شرطاً أساسياً لبناء نماذج ذكية، لكن السعي نحو التطوير السريع كثيراً ما يصطدم بقوانين الملكية الفكرية وحقوق المبدعين والناشرين.
شاركونا آرائكم يا شباب: هل ترون أن استخدام المحتوى العام للتدريب يعد أمراً مقبولاً لدعم الابتكار التقني؟ أم أن حقوق المؤلفين يجب أن تبقى خطاً أحمر لا يمكن تجاوزه؟
مكتبة LibGen وكواليس تدريب نماذج LLaMA
في قلب هذه الكواليس تبرز مكتبة Library Genesis (LibGen)، وهي إحدى أشهر المكتبات غير المصرح بها على الإنترنت والتي تحتوي على ملايين الكتب والمقالات الرقمية المحمية بحقوق النشر.
- حجم البيانات المستهلكة: تشير الوثائق إلى أن عمليات التنزيل بدأت في أكتوبر 2022 ووصلت إلى ما يقرب من 70 تيرابايت من البيانات، وهو ما يعادل عشرات الآلاف من الكتب الممسوحة ضوئياً.
- الهدف من التنزيل: تم استخدام هذه البيانات بشكل مكثف لتدريب عائلة نماذج LLaMA التابعة لشركة Meta لتتمكن من منافسة الأنظمة المتقدمة مثل ChatGPT.
- المناقشات الداخلية: أظهرت المراسلات أن استخدام هذه المصادر لم يكن مجرد تصرف فردي عابر، بل كان موضوعاً مناقشاً داخل أروقة فرق العمل رغم التحفظات القانونية التي أبداها بعض الموظفين.
موقف الإدارة والقرارات التنفيذية
الوثائق القضائية أوضحت أن القرارات لم تأتِ من صغار المطورين فحسب، بل كانت بعلم وموافقة من المستويات الإدارية العليا، حيث كان الحصول على تراخيص رسمية لكل هذه الكتب سيكلف مبالغ طائلة ويستغرق سنوات من التفاوض.
من فضلك قم , تسجيل الدخول أو تسجيل لعرض المحتوى
من مختبرات Meta إلى تأسيس Mistral AI
من أبرز الأسماء التي وردت في الوثائق الباحث غيوم لامبل (Guillaume Lample)، الذي كان يعمل سابقاً في مختبر FAIR لشركة Meta، ويشغل حالياً منصب المدير العلمي والشريك المؤسس لشركة Mistral AI الفرنسية.
- وجهة النظر الفنية: أظهرت التسريبات تشجيع لامبل على استخدام بيانات LibGen بناءً على قناعته بأن أغلب المطورين والشركات الكبرى في المجال يلجأون لنفس المصادر.
- تأسيس الشركة الجديدة: في عام 2023، شارك لامبل في تأسيس Mistral AI التي أصبحت سريعاً أحد أهم الرموز الأوروبية في مجال الذكاء الاصطناعي وبتقييمات استثمارية ضخمة.
- التزام الشفافية: رغم تأكيد Mistral AI حالياً على اعتمادها على بيانات عالية الجودة وشراكات رسمية مع مؤسسات مكتبية وإعلامية، إلا أن هناك تساؤلات حول طبيعة البيانات المستخدمة في النسخ الأولى من نموذج Mistral 7B.
أزمة حقوق الملكية بين الابتكار والقانون
توضح هذه القضية حجم التحديات التي تواجه قطاع الذكاء الاصطناعي اليوم. فالوصول إلى كميات هائلة من البيانات أصبح شرطاً أساسياً لبناء نماذج ذكية، لكن السعي نحو التطوير السريع كثيراً ما يصطدم بقوانين الملكية الفكرية وحقوق المبدعين والناشرين.
من فضلك قم , تسجيل الدخول أو تسجيل لعرض المحتوى
شاركونا آرائكم يا شباب: هل ترون أن استخدام المحتوى العام للتدريب يعد أمراً مقبولاً لدعم الابتكار التقني؟ أم أن حقوق المؤلفين يجب أن تبقى خطاً أحمر لا يمكن تجاوزه؟