شكّل ظهور ChatGPT نقطة تحول مفصلية في تاريخ الذكاء الاصطناعي، إذ أبرز الإمكانات الهائلة التي تمتلكها نماذج اللغة الكبيرة (Large Language Models - LLMs) في إنتاج نصوص تحاكي أسلوب الإنسان بدقة عالية. وقد أحدثت هذه الموجة من الابتكار نقلة نوعية في طريقة تفاعل الأفراد مع التكنولوجيا، حيث أصبحت نماذج اللغة جزءاً من الحياة اليومية، تُستخدم في تخطيط الرحلات، وصياغة رسائل البريد الإلكتروني، وإنشاء المحتوى، والعديد من المهام الأخرى.
وفي حين استفاد المستخدمون الناطقون باللغة الإنجليزية بشكل كبير من هذا التطور، لا يزال العالم العربي يواجه تحديات خاصة في تطوير نماذج لغوية مصممة خصيصاً للغة العربية. فاللغة العربية تُعد من أكثر لغات العالم انتشاراً، إذ يتحدث بها أكثر من 422 مليون شخص كلغة أم في 27 دولة، وتمتاز بإرث لغوي وثقافي عريق، وبخصائص لغوية فريدة تجعل معالجتها حاسوبيا أكثر تعقيداً.
ويمثل تطوير نماذج اللغة العربية الكبيرة (Arabic Large Language Models - ALLMs) فرصة استراتيجية لسد الفجوة التقنية، وتمكين المجتمعات العربية من الاستفادة الكاملة من تقنيات الذكاء الاصطناعي. وقد شهدت هذه النماذج رحلة تطور طويلة ومثيرة، بدأت بأنظمة بسيطة لمعالجة النصوص، وصولاً إلى نماذج متقدمة مدعومة بالذكاء الاصطناعي وقادرة على الفهم والتوليد والاستدلال بدرجات عالية من الدقة.
ويستعرض هذا المقال مسيرة تطور نماذج اللغة العربية الكبيرة منذ بداياتها حتى الوقت الحاضر، مع تسليط الضوء على الجهود المبذولة لتقييم هذه النماذج من خلال المعايير المرجعية (Benchmarks) ولوحات التصنيف العامة (Leaderboards)، بالإضافة إلى مناقشة أبرز التحديات والفرص التي تمثلها هذه النماذج للعالم العربي.
تعود بدايات معالجة اللغة العربية الطبيعية (Natural Language Processing - NLP) إلى عام 1985، عندما بدأت شركات رائدة، مثل صخر للبرمجيات (Sakhr Software)، في معالجة التحديات الفريدة التي تفرضها اللغة العربية، وعلى رأسها غنى النظام الصرفي وتعقيد التراكيب النحوية. وقد ركزت الأنظمة الأولى على تطوير أدوات أساسية مثل محللات الصرف (Morphological Analyzers)، التي قامت بمهام حيوية كـتجزئة الكلمات، واستخراج الجذور، وتحليل البنية الصرفية، وهي خطوات أساسية لمعالجة لغة تتميز بتنوع اشتقاقاتها وتعقيد قواعدها.
ومع بداية الألفية الجديدة، شهد المجال انتقالاً نحو النماذج الإحصائية، حيث انتشرت تقنيات مثل نماذج N-grams واستخراج الجذور (Stemming) في تطبيقات متعددة، منها:
• تصنيف النصوص.
• استرجاع المعلومات.
• الترجمة الآلية.
وقد مثلت هذه النماذج تطوراً ملحوظاً مقارنة بالأنظمة المعتمدة على القواعد، إلا أنها ظلت تعاني من محدودية البيانات المتاحة، إضافة إلى ضعف قدرتها على التعميم عبر اللهجات العربية المتعددة والتنوع اللغوي الواسع الذي تتميز به العربية. ومع ذلك، فقد شكلت هذه المرحلة حجر الأساس الذي مهد الطريق للجيل التالي من تقنيات معالجة اللغة.
أما خلال العقد الثاني من القرن الحادي والعشرين، فقد شهد المجال تحولاً جذرياً مع ظهور نماذج التعلم العميق للغات، والتي أدخلت تقنيات متقدمة مثل تمثيلات الكلمات (Word Embeddings)، إلى جانب أدوات متخصصة لمعالجة اللغة العربية مثل Farasa، التي أسهمت بشكل كبير في تحسين دقة وكفاءة أنظمة معالجة اللغة العربية.
كما ساعدت نماذج الذاكرة طويلة وقصيرة المدى (LSTM) والشبكات العصبية الالتفافية (CNN) في تحقيق قفزات كبيرة في العديد من التطبيقات، من أبرزها:
• تحليل المشاعر والآراء.
• الترجمة الآلية.
• التعرف على اللهجات العربية.
• فهم النصوص العربية بصورة أكثر عمقاً.
ورغم هذه التطورات، استمرت اللغة العربية في فرض تحدياتها الخاصة، نتيجة تنوع لهجاتها، وغناها الصرفي، واختلاف أساليب التعبير بين الدول والمناطق، ما أبرز الحاجة إلى تطوير نماذج أكثر تقدماً وقابلية للتوسع، وقادرة على استيعاب هذا التنوع اللغوي والثقافي.
أبرز فئات نماذج اللغة العربية الكبيرة المتوافرة حاليا
أولاً: النماذج المطورة خصيصاً للغة العربية (Purpose-Built Arabic Models)
تعتمد هذه النماذج على التدريب المباشر باستخدام بيانات عربية أصلية، بدلاً من الاعتماد على ترجمة البيانات من لغات أخرى، مما يمنحها قدرة أكبر على فهم الخصائص اللغوية والثقافية للعربية.
• Falcon-H1-Arabic
نموذج طُوّر في دولة الإمارات العربية المتحدة، ويعتمد على بنية هجينة تجمع بين معماريتي Mamba وTransformer. يدعم 18 لغة، ويتوافر بأحجام تتراوح بين 3 مليارات و34 مليار معلمة (Parameters)، مع أداء متميز في معالجة اللغة العربية.
• SILMA LLM
مجموعة من النماذج المدمجة بحجم 9 مليارات معلمة، تتميز بكفاءة تشغيل عالية وفهم متقدم للهجات العربية، مما يجعلها مناسبة للتطبيقات المؤسسية وبيئات الأعمال.
• Fanar (Star & Prime)
تركز هذه النماذج على فهم اللهجات الخليجية والمصرية، مع اهتمام خاص بالحفاظ على التراث الثقافي القطري، وتعزيز سيادة البيانات واستضافتها محلياً.
ثانياً: النماذج العالمية متعددة اللغات (Global Multilingual Models)
شهدت النماذج العالمية خلال السنوات الأخيرة تطوراً كبيراً في دعم اللغة العربية، وأصبحت تحقق مراكز متقدمة في اختبارات تقييم النماذج العربية (Arabic Model Benchmarks).
• Gemini 3.1 Pro / Flash (Google)
يتميز بقدرات عالية في الاستدلال المنطقي، وفهم السياقات الطويلة، ومعالجة النصوص العربية بكفاءة كبيرة، إضافة إلى نافذة سياق واسعة تسمح بتحليل كميات كبيرة من المعلومات.
• Claude Opus 4.6 (Anthropic)
يُعرف بأدائه القوي في الترجمة بين العربية والإنجليزية، إلى جانب قدراته المتقدمة في فهم السياقات المعقدة والاستدلال متعدد الخطوات.
• Meta Llama 3.1
يُعد من أكثر النماذج مفتوحة الأوزان استخداماً عالمياً، ويوفر دعماً موثوقاً للغات المتعددة، بما فيها اللغة العربية، مع أداء قوي في تنفيذ التعليمات والتفاعل متعدد اللغات. ثالثاً: نماذج الذكاء الاصطناعي المؤسسية والسيادية (Enterprise & Sovereign AI) تحتاج العديد من المؤسسات، وخاصة في منطقة الشرق الأوسط وشمال إفريقيا، إلى حلول توفر مستويات مرتفعة من أمن البيانات، وسيادة البيانات، والامتثال للتشريعات المحلية والإقليمية. وتوفر منصات مثل Arabic.AI بنية تحتية متوافقة مع متطلبات دول مجلس التعاون الخليجي، تعتمد على بيئات تشغيل معزولة (Air-Gapped Infrastructure)، بما يضمن حماية البيانات الحساسة ومنع انتقالها خارج حدود المؤسسة أو الدولة. كما تتميز هذه الحلول بقدرتها على التعامل بكفاءة مع اللغة العربية الفصحى (Modern Standard Arabic - MSA) إلى جانب مختلف اللهجات المحلية، مما يجعلها مناسبة للجهات الحكومية، والمؤسسات المالية، والقطاعات التي تتطلب أعلى مستويات الخصوصية والامتثال التنظيمي.

هل ترغب بالتعليق على الموضوع؟
لا تتردد في إعطاء تعليقك ومشاركة رأيك