الانتقال إلى المحتوى
استراتيجية المحتوى

كيف تفوّق نموذج بـ7 ملايين معامل على نماذج لغوية أكبر بكثير في ARC-AGI (هل الأكبر أفضل دائمًا؟)

الافتراض السائد في الذكاء الاصطناعي أن الأكبر أفضل. لكن نموذجًا بـ7 ملايين معامل هو TRM سجّل في معيار الألغاز ARC-AGI-1 نتيجة أعلى من Gemini 2.5 Pro وo3-mini، كما تفوّق سلفه HRM بـ27 مليون معامل على o3-mini. إليك ما تقوله الأوراق وإعادة اختبارات ARC Prize فعلًا.

F
Fan Pishgan No Afarin
30 ديسمبر 2025
كيف تفوّق نموذج بـ7 ملايين معامل على نماذج لغوية أكبر بكثير في ARC-AGI (هل الأكبر أفضل دائمًا؟)

وهم التوسع وصعود منافس صغير

نموذج تكراري بـ7 ملايين معامل فقط حقق في معيار الاستدلال ARC-AGI-1 نتيجة أعلى من عدة نماذج لغوية أكبر منه بكثير، منها Gemini 2.5 Pro وo3-mini-high وDeepSeek R1 ذو الـ671 مليار معامل. وقبله بأشهر حقق سلفه HRM، بـ27 مليون معامل، نتيجة مشابهة. هذا لا يعني أن النماذج الصغيرة تتفوق على الكبيرة في كل شيء. لكنه يبيّن أن السماح لشبكة صغيرة بالعودة إلى إجابتها مرة بعد مرة يهم في هذا النوع من الألغاز الشبكية أكثر من عدد المعاملات، وبجزء يسير من التكلفة الحسابية.

يروي هذا المقال قصة ظهور النماذج التكرارية الصغيرة التي غيّرت قواعد اللعبة.

بينما تكافح النماذج اللغوية الكبيرة (LLMs) مع الألغاز المنطقية التي نسمّيها معايير AGI، ظهرت فكرة جديدة ورائعة ضد «فيروس التوسع» هذا. الفكرة بسيطة: ماذا لو، بدلاً من تكبير دماغ النموذج، سمحنا له بالتفكير قبل الإجابة وتحسين استجابته؟

أدّت هذه الفكرة إلى HRM (نموذج الاستدلال الهرمي) الذي نشرته شركة Sapient Intelligence في يونيو 2025 (arXiv 2506.21734). يضم النموذج 27 مليون معامل، ودُرّب على نحو 1000 مثال فقط دون تدريب مسبق على نصوص الإنترنت. تذكر ورقة HRM نتيجة 40.3% في ARC-AGI-1 و5.0% في ARC-AGI-2، متقدمًا في ARC-AGI-1 على o3-mini-high (34.5%) وClaude 3.7 8K (21.2%). هذه نتائج على مجموعة التقييم العامة. وعندما أعاد فريق ARC Prize اختبار HRM على المجموعة المخفية شبه الخاصة (semi-private)، سجّل 32% في ARC-AGI-1 و2% في ARC-AGI-2 (تحليل ARC Prize). ووجد التحليل نفسه أن التصميم «الهرمي» ذا المستويين لم يضف الكثير مقارنة بمحوّل عادي بالحجم نفسه، وأن معظم المكسب جاء من حلقة التحسين الخارجية.


كيف يعمل نموذج HRM؟ (سر التفكير البطيء والسريع)

الفرق الجوهري أن النماذج اللغوية العادية تحاول التنبؤ بكل شيء في «تمريرة أمامية» واحدة. هذا يعني أن الجهد الذي تبذله لحساب «1+1» يساوي الجهد لمشكلة معقدة.

لكن نموذج HRM مستوحى من بنية الدماغ البشري. يتكون هذا النموذج من شبكتي محول صغيرتين تعملان بسرعتين مختلفتين:

  1. شبكة منخفضة المستوى (سريعة): تُجري تغييرات سريعة وتدريجية على «مسودة» ذهنية.
  2. شبكة عالية المستوى (بطيئة): تحدد الاستراتيجية العامة وتقرر ما إذا كانت الإجابة جاهزة أم تحتاج مزيدًا من التفكير.

بدلاً من الاستجابات الفورية، يفكّر هذا النموذج تكراريًا ويحسّن إجابته عدة مرات حتى يصل للنتيجة الصحيحة.


نموذج TRM: عندما يصبح «الصغير» أصغر!

جاء بعده نموذج أبسط هو TRM (النموذج التكراري المتناهي الصغر)، قدّمته الباحثة Alexia Jolicoeur-Martineau من Samsung SAIL Montréal في أكتوبر 2025 (arXiv 2510.04871). يتخلى TRM عن الافتراضات البيولوجية في HRM، ويستخدم شبكة صغيرة واحدة، ويغيّر طريقة التدريب. وبـ7 ملايين معامل، أي نحو ربع حجم HRM، يحقق نتيجة أعلى.

تذكر ورقة TRM نتيجة 44.6% في ARC-AGI-1 و7.8% في ARC-AGI-2 (تُقرَّب عادة إلى 45% و8%). وفي الجدول نفسه يحصل Gemini 2.5 Pro على 37.0% و4.9%، وo3-mini-high على 34.5% و3.0%، وDeepSeek R1 على 15.8% و1.3%. لكن TRM لا يتفوق على الجميع: Grok-4-thinking يسجل 66.7% و16.0%. أما إعادة الاختبار المستقلة من ARC Prize على المجموعة شبه الخاصة فسجّلت 40% في ARC-AGI-1 و6.2% في ARC-AGI-2 (نتائج ARC Prize). ولا يظهر GPT-4 ولا GPT-5 في جدول المقارنة في أيٍّ من الورقتين.

لماذا كان TRM أكثر نجاحًا؟

بدلاً من محاكاة دماغ الفأر (كما فعل HRM)، ركّز نموذج TRM على فصل وظيفي:

  • مساحة لـمسودة التفكير.
  • مساحة لـحاوية الإجابة.

بدلاً من افتراض وصوله لـ«توازن» (وهو خطأ ارتكبه HRM)، يتدرب هذا النموذج بالضبط على الحلقات التي ينفّذها. النقطة الأكثر إثارة أنه عندما حاول الباحثون زيادة طبقات النموذج، انخفض أداؤه. في الواقع، منع حجم النموذج الصغير «الإفراط في التخصيص (Overfitting)» على بيانات محدودة وساعده على التعميم بشكل أفضل.


تشبيه لفهم أفضل

تخيّل أنك تطلب من شخصين رسم لوحة معقدة.

الشخص الأول (نموذج لغوي كبير): عبقري يجب أن يكمل اللوحة بـضربة قلم واحدة دون رفع يده عن الورقة. مهما كان عبقريًا، احتمال الخطأ مرتفع.

الشخص الثاني (TRM): رسام عادي، لكن يُسمح له برسم مسودة أولية، والنظر إليها، والمحو، والتصحيح، والعمل على التفاصيل لساعات حتى يرضى عن النتيجة.

في المشكلات المنطقية والمعقدة، غالبًا ما يفوز الرسام الثاني (النموذج التكراري الصغير) لأن لديه فرصة التفكير والتصحيح، حتى لو كان دماغه (معاملاته) أصغر.


الخاتمة: مستقبل الذكاء الاصطناعي تكراري

أثبت هذا البحث أن حل المشكلات المنطقية الصعبة ليس حكرًا على النماذج اللغوية العملاقة. يمكن للنماذج الصغيرة ذات قدرة التفكير التكراري (Recursion) حل مشكلات لا تستطيع النماذج الكبيرة معالجتها بتمريرة معالجة واحدة.

بدلاً من حفظ البيانات، تتعلم هذه النماذج كيفية تحرير لوحة عمل (Canvas) عبر خطوات متعددة حتى تصل للإجابة الصحيحة.

أهم استنتاجات هذا البحث:

  • الأكبر ليس دائمًا أفضل - البنية وطريقة التفكير تهمان أكثر من الحجم
  • القدرة على المراجعة والتحسين يمكن أن تحل محل مليارات المعاملات
  • الاستلهام من الدماغ البشري (التفكير السريع والبطيء) يمكن أن يؤدي لنماذج أكثر كفاءة
  • يمكن للنماذج الأصغر التعميم بشكل أفضل وهي أقل عرضة للإفراط في التخصيص

ربما يكمن مستقبل الذكاء الاصطناعي ليس في نماذج بتريليونات المعاملات، بل في نماذج ذكية تعرف كيف «تفكّر».

هذا هو الرهان ذاته الذي يخوضه FanMind على نطاق أصغر: مساعد أضيق نطاقاً وملزَم بالاستشهاد يفضّل الرفض على التخمين، يتفوّق على مساعد أوسع يجيب عن كل شيء بسلاسة لكن ليس دائماً بشكل صحيح. تعرّف كيف ينطبق ذلك على مساعد تنظيمي داخلي.

هل تريد بناء حلول ذكاء اصطناعي متقدمة؟

يتخصص فريقنا في تطوير تطبيقات فعّالة مدعومة بالذكاء الاصطناعي. سواء احتجت إلى نماذج صغيرة ومحسّنة أو تكامل كامل للذكاء الاصطناعي، يمكننا مساعدتك في تحقيق رؤيتك.

Discuss Your AI Project

شارك هذا المقال