استبعدت لوحة الصدارة العربية بهدوء جزءًا من اختبارها نفسه.
والسبب هو أهمّ جملة في الذكاء الاصطناعي العربي اليوم: الأسئلة كانت مترجمة عن الإنجليزية.
الاختبارات المترجمة تهرّب معها صياغة الإنجليزية وافتراضاتها وثقافتها. فتنتهي إلى قياس مدى تعامل النموذج مع ترجمة — لا مدى معرفته الحقيقية بالعربية. لذلك أعاد المجتمع بناء المعيار حول أسئلة كُتبت أصلًا بالعربية، عن العربية والمنطقة.2
تلك الخطوة وحدها هي قصة سباق النماذج العربية مصغّرةً: لا يمكنك قياس — ولا بناء — نموذجٍ عربيٍّ على بياناتٍ لم تكن عربية أصلًا. إليك حال هذا السباق الآن، وما الذي يقوده حقًّا.
سبورة النتائج: لوحة الصدارة العربية المفتوحة
سنواتٍ طويلة، كان السؤال «أي نموذج عربي أفضل؟» يُجاب عنه بالبيانات الصحفية. الآن صار هناك جواب عام. لوحة الصدارة العربية المفتوحة (OALL)، المستضافة على Hugging Face والتي أطلقها معهد الابتكار التكنولوجي الإماراتي (TII)، تشغّل كل نموذج مُقدَّم عبر السلسلة نفسها من المهام العربية وترتّبها.1
وفي الخلفية تستخدم إطار LightEval من Hugging Face، وتقيّم النماذج بـدقة الاحتمال اللوغاريتمي المُطبَّع — طريقة عادلة لتقدير أسئلة الاختيار من متعدّد ونعم/لا التي تشكّل معظم الاختبارات.2
وما تختبره تغيّر على نحوٍ يستحق الوقوف عنده. النسخة الأولى مزجت بيانات عربية أصيلة مثل AlGhafa وACVA مع ترجمات عربية لمعايير إنجليزية كـ MMLU وEXAMS. أما النسخة الثانية فأسقطت الترجمات وانتقلت إلى معايير أصيلة — ArabicMMLU وALRAGE وAraTrust وMadinahQA — بعد إجماع المجتمع على أن المحتوى المترجم ليس اختبارًا عادلًا للعربية.2
لا يمكنك قياس نموذجٍ عربيٍّ على بياناتٍ لم تكن عربية أصلًا.لماذا أعادت اللوحة بناء نفسها على معايير أصيلة
المتنافسون: أربعة نماذج خليجية
النماذج العربية الجادّة تخرج من سباق سيادي خليجي — كلٌّ تدعمه دولة قرّرت أن امتلاك نموذجها اللغوي يهمّ. وتسلك طرقًا مختلفة: بعضها دُرِّب من الصفر على العربية، وبعضها يكيّف أساسًا متعدّد اللغات قويًّا. إليك الميدان.
| النموذج | الجهة | الأساس | الأحجام | المقاربة | الأوزان |
|---|---|---|---|---|---|
| فالكون-H1 العربي | 🇦🇪TII، أبوظبي | Falcon-H1 | 3B · 7B · 34B | مُكيَّف للعربية | مفتوح |
| علّام | 🇸🇦سدايا / هيومين | ALLaM (v2) | 7B · 13B · 70B · 34B | مُكيَّف، عربي المحور | جزئي |
| فنار | 🇶🇦معهد قطر (HBKU) | Star (من الصفر) / Prime (Gemma 2) | 7B · ~9B · 27B | مختلط؛ 2.0 متعدّد الوسائط | مفتوح |
| جيس | 🇦🇪إنسيبشن (G42) · MBZUAI | Jais | 13B · 30B | مُدرَّب من الصفر | مفتوح |
فالكون-H1 العربي (TII، أبوظبي) هو المتصدّر الحالي، وصدر بأحجام 3B و7B و34B.3 وعلّام هو النموذج الوطني السعودي — بنته سدايا بمشاركة أكثر من 400 خبير و160 جهة حكومية، ودُرِّب على أكثر من 3 تريليونات رمز، وتديره الآن هيومين ويشغّل تطبيق هيومين شات عبر إصدار 34B.4 وفنار هو النموذج السيادي القطري من معهد قطر لبحوث الحوسبة بجامعة حمد بن خليفة؛ وإصدار 2.0 نموذجٌ بحجم 27B متعدّد الوسائط يعالج النصّ والصورة والصوت.5 أما جيس — من إنسيبشن التابعة لـ G42 وجامعة محمد بن زايد — فكان من أوائل النماذج العربية الكبيرة المدرَّبة من الصفر، على 116 مليار رمز عربي و279 مليار رمز إنجليزي.6
من يتصدّر الآن
حتى مطلع 2026، صدارة اللوحة لـفالكون-H1 العربي. يسجّل إصدار 7B متوسط 71.47% عبر مهام اللوحة — متقدّمًا على نماذج أكبر بحجم ~10B منها فنار-1-9B وعلّام 7B. ويسجّل إصدار 34B نسبة 75.36%، متجاوزًا بعض النماذج العامة بحجم 70B وأكثر مثل Qwen2.5-72B وLlama-3.3-70B في العربية.3
تحذيران قبل أن تقرأ في أي رقمٍ أكثر مما يحتمل. أولًا، إنها لقطة لحظية. تصدر نماذج وإصدارات جديدة كل بضعة أسابيع؛ فقد نال علّام لقب أفضل نموذج عربي على ArabicMMLU، ويتصدّر فالكون الإجمالي اليوم، وسيتبدّل الترتيب مجددًا. راجع دائمًا لوحة الصدارة الحيّة لمعرفة الترتيب الراهن.
ثانيًا، المتوسط يخفي التقسيم الذي يهمّك. فقد يتصدّر نموذجٌ المعدّل العام ويتعثّر مع اللهجة الخليجية، أو مع مصطلحات مجالك. وهنا المشكلة التالية.
لماذا العربية صعبة التقييم على نحوٍ فريد
للإنجليزية معيار مكتوب واحد. العربية لا تسلك هذا المسلك، وهذا ما يجعل بناءها واختبارها صعبين معًا.
- ازدواجية اللسان. الفصحى الحديثة هي السجل الرسمي المكتوب، ولا يكاد أحد يتحدّثها يوميًّا. الناس يتحدّثون لهجات — خليجية ومصرية وشامية ومغاربية — تختلف في المفردات والقواعد بما يكفي لإرباك نموذجٍ دُرِّب على الفصحى غالبًا.
- غنى صرفي. الجذر الواحد يتفرّع إلى عشرات الصيغ؛ والتشكيل غالبًا غير مكتوب، فالحروف نفسها قد تكون عدّة كلمات حتى يحسمها السياق.
- الكتابة من اليمين إلى اليسار، وتختلط بالأحرف اللاتينية والأرقام في النصّ الحقيقي — حقلُ ألغامٍ للمُقسِّمات الرمزية والمُصنِّفين معًا.
- كثير من المعرفة ثقافي. أسماء وتاريخ ودين وقانون واصطلاح يفوتها المعيار المترجم ببساطة.
ولهذا تحديدًا تهمّ المعايير الأصيلة. بُني AraDiCE لاختبار الكفاءة اللهجية والثقافية عبر العربية المصرية والشامية والخليجية — ما لا يراه MMLU المترجم.7 ولهذا يعود الباحثون في مسح الميدان إلى الفجوة نفسها: المعايير، والبيانات خلفها، هي عنق الزجاجة — لا معمارية النموذج.8
ما الذي يحسم الترتيب فعلًا
جرّد لوحة الصدارة، وهذا ما يبقى: كل نتيجة قياسٌ للبيانات.
قدرة النموذج على العربية تأتي من الأمثلة العربية التي تعلّم منها. واتّباعه للتعليمات يأتي من أشخاص يكتبون ويرتّبون مطالبات وإجابات عربية — RLHF. ونتيجته تأتي من معايير عربية كتبها بشر. أشخاصٌ عند النقاط الثلاث. فإن لم يتحدّث هؤلاء اللهجة، أو فاتهم السياق الثقافي، تعلّم النموذج الفجوة وورثها المعيار.
وهذا هو الخيط الناظم خلف تاريخ اللوحة نفسه. حين استبدل المجتمع الاختبارات المترجمة بأخرى أصيلة، لم يكن قرارًا يخصّ النمذجة — كان قرار جودة بيانات. بياناتٌ أفضل تدخل، قياسٌ أصدق يخرج.
البشر يعلّمون الآلة.وفي العربية، يعني ذلك ناطقين أصليين — يصنّفون، ويرتّبون، ويراجعون
وهنا يقع العمل الذي نؤدّيه. النماذج أعلاه تتنافس على القدرة؛ وتحتها جميعًا طبقةٌ من التصنيف العربي — وسمٌ ونسخٌ ووسمُ لهجاتٍ وترتيبُ إجاباتٍ وتقييم — تحسم إلى أي مدى يمكن لأيٍّ منها أن يبلغ. والخطوات العملية لتحسين نموذجٍ عربيٍّ نادرًا ما تبدأ من المعمارية:
- اجمع بيانات عربية تمثيلية. ليست الفصحى وحدها — بل اللهجات والمجالات والصيغ التي ينتجها مستخدموك فعلًا.
- صنّفها بناطقين أصليين. اللهجة والكيانات والقصد والسلامة — يصنّفها من يسمع اللغة كما يسمعها مستخدموك.
- رتّب الإجابات لـ RLHF. التفضيل البشري على الإجابات العربية هو ما يحوّل النموذج الأساس إلى نموذجٍ نافعٍ فعلًا بالعربية.
- قيّم على بياناتك أنت. اللوحة تخبرك بالترتيب العام؛ وأمثلتك المُصنَّفة وحدها تخبرك بما يفوز في مهمتك.
من يعلّم آلتك؟
أنا أحمد رفيق فهمي. أدرتُ أنا وشريكي عمليات تصنيف البيانات عقدًا كاملًا — كلانا سابقًا في Affectiva وSmart Eye — من موقع العميل، داخل شركات تدرّب الذكاء الاصطناعي، نحكم على الأدوات وفرق العمل من مقعد المشتري. بنينا Annota8 لتكون ما قال ذلك العقد إن الأداة كان ينبغي أن تكونه، وجعلناها عربيةً أولًا من اليوم الأول.
نحن لا نبني نماذج لغوية عربية. نبني الطبقة التي تُعلَّم عليها وتُختبر بها: محرك التصنيف من Annota8 — 200 واجهة تصنيف عبر 9 وسائط، بمسارات للعربية واللهجات — إضافةً إلى وكيل ذكي على بيانات تصنيفك، ووحدة تشغيل واحدة لإدارة الحلقة. مبنيّة في السعودية؛ وأول عميل يدفع لنا هو جامعة كاليفورنيا في سان دييغو.
أيًّا كان النموذج على اللوحة الذي تبني عليه، فعربيته بجودة من علّموه فقط.
أسئلة شائعة
معيار عام على Hugging Face أطلقه معهد الابتكار التكنولوجي الإماراتي (TII)، يرتّب النماذج بحسب قدرتها على العربية. يشغّل كل نموذج عبر سلسلة مهام عربية بإطار LightEval، ويقيّمها بدقة الاحتمال اللوغاريتمي المُطبَّع. وفي نسخته الثانية استبدل المعايير الإنجليزية المترجمة بأخرى عربية أصيلة — ArabicMMLU وALRAGE وAraTrust وMadinahQA.
حتى مطلع 2026، يتصدّر فالكون-H1 العربي من TII — إصدار 7B بمتوسط 71.47% (متقدّمًا على نماذج ~10B مثل فنار-1-9B وعلّام 7B)، وإصدار 34B بنسبة 75.36% يتجاوز بعض نماذج 70B وأكثر. يتبدّل الترتيب مع كل إصدار، فاعتبره لقطة لحظية وراجع اللوحة الحيّة. — المصدر: TII / لوحة الصدارة العربية المفتوحة
أبرز النماذج الخليجية العربية. فالكون-H1 العربي من TII (أبوظبي). جيس من إنسيبشن (G42) وجامعة محمد بن زايد (الإمارات)، مُدرَّب من الصفر. علّام هو النموذج الوطني السعودي — بنته سدايا وتديره هيومين — ويشغّل هيومين شات. وفنار هو النموذج السيادي القطري من معهد قطر لبحوث الحوسبة بجامعة حمد بن خليفة.
اعتمدت النسخة الأولى على ترجمات عربية لاختبارات إنجليزية كـ MMLU وEXAMS، وهي تحمل صياغة الإنجليزية وافتراضاتها الثقافية وتقيس جودة الترجمة بقدر ما تقيس العربية. فانتقلت النسخة الثانية إلى معايير عربية أصيلة لتعكس النتائج كفاءةً عربيةً حقيقية. إنه قرار جودة بيانات: لا يمكنك قياس نموذجٍ عربيٍّ بعدلٍ على بياناتٍ لم تكن عربية أصلًا.
العربية ازدواجية اللسان — الفصحى مكتوبة، لكن الناس يتحدّثون لهجات (خليجية ومصرية وشامية ومغاربية). وهي غنية صرفيًّا، تُكتب من اليمين إلى اليسار وغالبًا دون تشكيل، وكثير من معرفتها ثقافي. فأي معيار عادل عليه أن يغطّي اللهجة والثقافة والفصحى — ولهذا وُجدت جهود أصيلة مثل AraDiCE وArabicMMLU.
ليس بمفردها. تعتمد اللوحات غالبًا على أسئلة اختيار من متعدّد تُقيَّم بالاحتمال اللوغاريتمي — إشارة مفيدة لا برهانَ أداءٍ على مهمتك ولهجتك وبياناتك. فالنموذج المتصدّر قد يخفق مع صياغة عملائك أو مصطلحات مجالك. والاختبار الموثوق الوحيد هو التقييم على أمثلة مُصنَّفة من حالتك.
كل نتيجة تنبع من البيانات. تتعلّم النماذج من أمثلة عربية مُصنَّفة، وتُقيَّم على معايير عربية كتبها بشر، وتُضبط بأشخاص يرتّبون إجابات عربية (RLHF). فإن لم يتحدّث المُصنِّفون اللهجة أو فاتهم السياق الثقافي، تعلّم النموذج تلك الفجوات. بياناتٌ عربية أفضل — يصنّفها ناطقون أصليون — هي أقوى رافعة مباشرة للجودة.
لا — نبني طبقة البيانات التي تُعلَّم عليها وتُختبر بها. Annota8 منصّة تصنيف عربية أولًا، مبنية في السعودية، تُصنّف فيها الفرق النصوص والصوت والمستندات العربية (الفصحى واللهجات، من اليمين إلى اليسار) وتُشغّل RLHF والتقييم بمصنّفين ناطقين بالعربية. احجز عرضًا لتراها على بياناتك.
المراجع
- لوحة الصدارة العربية المفتوحة (OALL). Hugging Face Space by OALL. huggingface.co/spaces/OALL/Open-Arabic-LLM-Leaderboard
- Introducing the Open Arabic LLM Leaderboard (المعايير، LightEval، الاحتمال اللوغاريتمي المُطبَّع؛ معايير النسخة الثانية الأصيلة). Technology Innovation Institute / Hugging Face. huggingface.co/blog/leaderboard-arabic
- UAE's Falcon-H1 Arabic tops Open Arabic LLM rankings (7B 71.47%؛ 34B 75.36%). ITBrief. itbrief.asia
- تكريم علّام من سدايا كأفضل نموذج لغوي عربي (ArabicMMLU)؛ هيومين شات على علّام 34B. واس / Middle East AI News. spa.gov.sa
- قطر تطلق فنار النموذج السيادي؛ فنار 2.0 (27B، متعدّد الوسائط). Middle East AI News / QCRI. huggingface.co/QCRI/Fanar-1-9B
- Meet "Jais", the world's most advanced Arabic LLM (13B؛ 116B رمز عربي + 279B رمز إنجليزي؛ جيس 30B). MBZUAI / G42 Inception / Cerebras. mbzuai.ac.ae
- AraDiCE: Benchmarks for Dialectal and Cultural Capabilities in LLMs (المصرية، الشامية، الخليجية). arXiv / COLING 2025. arxiv.org/abs/2409.11404
- Evaluating Arabic Large Language Models: A Survey of Benchmarks, Methods, and Gaps. arXiv. arxiv.org/abs/2510.13430