أعلنت شركة الذكاء الاصطناعي Pleias ورابطة GSMA يوم الثلاثاء عن إطلاق CommonLingua، وهو نموذج مفتوح المصدر لتحديد اللغة (LID) يقولون إنه سيساعد في سد فجوة اللغة الأفريقية في الذكاء الاصطناعي.
تم وصفه كأول إصدار مشترك في إطار مبادرة GSMA “نماذج لغة الذكاء الاصطناعي في أفريقيا، من خلال أفريقيا، من أجل أفريقيا”، CommonLingua عبارة عن نموذج LID مفتوح المصدر مدمج مكون من 2 مليون معلمة يغطي 334 لغة – بما في ذلك 61 لغة أفريقية.
هناك أكثر من 2000 لغة حية في أفريقيا، ولا يزال الكثير منها ممثلًا بشكل ناقص في بيانات التدريب على الذكاء الاصطناعي. أحد الأسباب هو أنه قبل بناء النماذج اللغوية، على سبيل المثال، للسواحيلية أو اليوروبا أو الولوف، يجب أولاً تحديد النص الأساسي بشكل صحيح من خلال اللغة.
المشكلة هي أن أنظمة LID مثل fastText، وGlotLID، وOpenLID ــ والتي تم إنشاؤها حول اللغات الأوروبية والآسيوية ذات الموارد العالية ــ كثيرا ما تخطئ في تسمية النصوص المكتوبة باللغة الأفريقية على أنها إنجليزية أو فرنسية.
وفقًا لـ Pleias وGSMA، تم تصميم CommonLingua لإصلاح هذه الخطوة الأولى من خط الأنابيب.
حققت CommonLingua دقة بنسبة 83% ودرجة كلية F1 تبلغ 0.79 وفقًا لمعيار CommonLID الجديد، وهو ما يمثل 10 نقاط مئوية أعلى من نماذج LID الرائدة. مع 2 مليون معلمة وشحن كنقطة تفتيش تبلغ 8 ميجابايت، فإن CommonLingua أيضًا خفيف الوزن نسبيًا، حيث يعمل حوالي 20 نصًا في الثانية على وحدة المعالجة المركزية وما يصل إلى 3000 نص في الثانية على وحدة معالجة رسومات واحدة.
يعمل النموذج مباشرة على تسلسلات بايت UTF-8 بدلاً من الاعتماد على رمز مميز خاص باللغة، والذي قال Pleias وGSMA إنه يتيح معالجة متسقة عبر النصوص بما في ذلك اللاتينية والعربية والإثيوبية وN’Ko وTifinagh.
اللغات الأفريقية الـ 61 التي يدعمها CommonLingua تعمل عبر ثماني عائلات لغوية: البانتو (21)، النيجر-الكونغو / غرب أفريقيا (18)، الأفرو آسيوية والسامية (7)، الكوشية والتشادية (4)، البربرية (3)، النيلية الصحراوية (3)، واللغة المبسطة والكريول وغيرها (5).
قال بيير كارل لانجليز، المؤسس المشارك والرئيس التنفيذي للتكنولوجيا في شركة Pleias: “اللغات الأفريقية ليست حالة طارئة. إنها لغات العمل لمئات الملايين من الأشخاص، وهي تستحق إنشاء بنية تحتية للذكاء الاصطناعي بنفس العناية مثل أي لغة أخرى”. “إن CommonLingua هي اللبنة الأولى التي نضعها عمدًا: لا يمكنك تنظيم ما لا يمكنك تحديده.”
وأضاف لويس باول، مدير مبادرات الذكاء الاصطناعي في رابطة GSMA، أن سد الفجوة في الذكاء الاصطناعي باللغة الأفريقية يعد أمرًا أساسيًا للشمول الرقمي وفتح الفرص الاقتصادية.
وقال باول: “لقد تعثر التقدم منذ فترة طويلة بسبب الافتقار إلى البنية التحتية الأساسية، بدءاً بشيء أساسي مثل تحديد اللغة”. “تعالج CommonLingua هذه الفجوة الحرجة، مما يتيح تطوير مجموعات بيانات أكثر ثراءً وأنظمة ذكاء اصطناعي أكثر تمثيلاً على نطاق واسع.”
يتم تدريب CommonLingua LID حصريًا على محتوى النطاق العام والمرخص والمجمع من خلال مشروع Common Corpus، بما في ذلك Wikipedia، والمنشورات العلمية في OpenAlex، وVOA Africa، وWaxalNLP، والتراث الثقافي، وPralekha. يتم إصدار كافة مجموعات البيانات بموجب تراخيص متساهلة.
