قد تبدو أسئلة طرح السؤال بالعربية والإنجليزية أو الفرنسية متطابقة، لكن نماذج الذكاء الاصطناعي متعددة اللغات قد تقدم إجابات تختلف في الدقة، أو المصطلحات، أو السياق الثقافي. لا يعني هذا أن نموذجاً يفكر بلغة أفضل من أخرى، بل يرتبط ذلك بكيفية بناء النماذج وتمثيلها للغات داخل بنيتها البرمجية.
دور بيانات التدريب ونقطة البداية
تعتمد النماذج اللغوية الكبيرة على كميات هائلة من النصوص أثناء التدريب، وهي بيانات غير موزعة بالتساوي بين اللغات. فالإنجليزية واللغات ذات الحضور الرقمي الواسع تمتلك موارد ضخمة، بينما تعاني لغات أخرى من نقص في النصوص عالية الجودة.
أظهرت دراسة نشرتها دورية “ساينتفيك ريبورتس” شملت 3 نماذج و12 لغة، أن أداء الذكاء الاصطناعي يتأثر بحجم بيانات التدريب ومصدرها والمسافة اللغوية. والمثير أن الإنجليزية لم تكن دائماً الأفضل أداءً في جميع المهام. كما تشير أبحاث أخرى إلى أن إضافة بيانات متعددة اللغات تحسن أداء اللغات منخفضة الموارد، لكن التوسع المفرط دون ضوابط قد يفرض قيوداً على قدرات النموذج.
تأثير تقطيع الكلمات والرموز (Tokens)
قبل معالجة أي سؤال، تحول الكلمات إلى وحدات أصغر تُسمى الرموز، ولا تتم هذه العملية بالشكل نفسه عبر مختلف اللغات.
تؤكد الأبحاث أن استخدام أدوات لتقسيم النصوص مصممة خصيصاً للغة الإنجليزية يؤدي إلى تراجع كبير في كفاءة تمثيل اللغات الأخرى وزيادة تكلفة التدريب. وهذا يعني أن سؤالين متطابقين في المعنى قد لا يصلان إلى النظام بالصورة الحاسوبية ذاتها، مما ينعكس مباشرة على جودة الإجابة.
الترابط بين اللغة والثقافة
لا ينفصل السؤال عن خلفيته الثقافية. كشفت أبحاث مؤتمر “ACL” عن وجود “تآزر لغوي ثقافي” يجعل أداء النماذج أفضل عندما يتماشى السؤال ثقافياً مع اللغة المستخدمة. فاستفسار يتعلق بعادة اجتماعية أو مثل شعبي قد يولد إجابات مختلفة حسب اللغة المستخدمة، لأن اللغة توفر للنموذج إشارات ضمنية تقوده نحو سياق محدد.
تحديات اللغة العربية واللغات منخفضة الموارد
تتضح هذه الإشكالية بوضوح في اللغات التي تملك حضوراً رقمياً محدوداً. في اللغة العربية، تبرز تعقيدات إضافية تتعلق بالتنوع الكبير في اللهجات، والتعقيد الصرفي، ونقص أدوات القياس المتخصصة.
تسعى مبادرات مثل مؤشر “بلسم” (BALSAM) ومعيار “أراديس” (AraDiCE) إلى قياس وتقييم أداء النماذج في اللهجات العربية والوعي الثقافي الإقليمي (كالخليج ومصر وبلاد الشام). وتؤكد تقارير اليونسكو أن نقص البيانات المحلية في اللغات الأقل تمثيلاً يحد من قدرة الأنظمة على معالجة المفاهيم الثقافية بدقة.
هل اختلاف الإجابة دليل على التحيز؟
لا يعد كل اختلاف في الإجابات دليلاً قاطعاً على تحيز متعمد؛ فقد ينجم عن تفاوت حجم البيانات، أو طرق تقسيم النصوص، أو تباين السياقات الثقافية. ومع ذلك، تؤدي هذه الفوارق أحياناً إلى تحيز لغوي فعلي لصالح اللغات المهيمنة.
لهذا السبب، تتحول الأبحاث الحديثة نحو تقييم النماذج عبر بيئات ثقافية ولغوية متعددة لضمان فهم أعمق للسؤال ضمن سياقه الأصلي، بدلاً من الاعتماد المطلق على اختبارات اللغة الإنجليزية وحدها.



