رفتن به محتوا
استراتژی محتوا

چگونه مدل‌های ۷ و ۲۷ میلیون پارامتری در ARC-AGI از مدل‌های زبانی بسیار بزرگ‌تر جلو زدند؟

باور رایج در هوش مصنوعی این است که هر چه بزرگ‌تر، بهتر. اما مدلی ۷ میلیون پارامتری به نام TRM در بنچمارک معمایی ARC-AGI-1 از مدل‌هایی مثل Gemini 2.5 Pro و o3-mini امتیاز بیشتری گرفت و مدل قبلی آن، HRM با ۲۷ میلیون پارامتر، هم از o3-mini جلو زد. این مقاله نشان می‌دهد مقاله‌ها و بازآزمایی‌های ARC Prize واقعاً چه می‌گویند.

F
Fan Pishgan No Afarin
۹ دی ۱۴۰۴
چگونه مدل‌های ۷ و ۲۷ میلیون پارامتری در ARC-AGI از مدل‌های زبانی بسیار بزرگ‌تر جلو زدند؟

توهم مقیاس‌پذیری و ظهور رقیب کوچک

یک مدل بازگشتی با فقط ۷ میلیون پارامتر در بنچمارک استدلال ARC-AGI-1 امتیازی بالاتر از چند مدل زبانی بسیار بزرگ‌تر گرفت، از جمله Gemini 2.5 Pro، o3-mini-high و DeepSeek R1 با ۶۷۱ میلیارد پارامتر. مدل قبلی، HRM با ۲۷ میلیون پارامتر، چند ماه زودتر نتیجه‌ای مشابه گرفته بود. این به آن معنا نیست که مدل‌های کوچک در همه‌چیز از مدل‌های بزرگ بهترند. ولی نشان می‌دهد در این نوع معماهای شبکه‌ای، اینکه یک شبکه کوچک بارها روی جواب خودش برگردد از تعداد خام پارامتر مهم‌تر است، آن هم با کسری از هزینه محاسباتی.

این مقاله داستان ظهور مدل‌های بازگشتی کوچک (Small Recursive Models) است که قوانین بازی را تغییر داده‌اند.

در حالی که مدل‌های زبانی بزرگ (LLM) در حل معماهای منطقی که ما آن‌ها را بنچمارک AGI می‌نامیم درجا می‌زنند، ایده‌ای جدید و جذاب در خلاف جهت این «ویروس مقیاس‌پذیری» شکل گرفته است. ایده ساده است: چه می‌شود اگر به جای بزرگ کردن مغز مدل، به آن اجازه دهیم قبل از پاسخ دادن فکر کند و جوابش را اصلاح کند؟

این ایده به HRM (مدل استدلال سلسله‌مراتبی) رسید که شرکت Sapient Intelligence در ژوئن ۲۰۲۵ منتشر کرد (arXiv 2506.21734). این مدل ۲۷ میلیون پارامتر دارد و بدون پیش‌آموزش روی متن اینترنت، فقط با حدود ۱۰۰۰ نمونه آموزش دیده است. مقاله HRM امتیاز ۴۰٫۳٪ در ARC-AGI-1 و ۵٫۰٪ در ARC-AGI-2 گزارش می‌کند که در ARC-AGI-1 از o3-mini-high (۳۴٫۵٪) و Claude 3.7 8K (۲۱٫۲٪) بالاتر است. این اعداد مربوط به مجموعه ارزیابی عمومی است. وقتی تیم ARC Prize مدل HRM را روی مجموعه پنهان semi-private دوباره اجرا کرد، ۳۲٪ در ARC-AGI-1 و ۲٪ در ARC-AGI-2 ثبت شد (تحلیل ARC Prize). همان تحلیل نشان داد طراحی دوسطحی «سلسله‌مراتبی» نسبت به یک ترنسفورمر معمولی هم‌اندازه سود چندانی نداشت و بیشتر بهبود از حلقه بیرونی اصلاح جواب می‌آمد.


مدل HRM چطور کار می‌کند؟ (راز تفکر آهسته و سریع)

تفاوت اصلی اینجاست که مدل‌های زبانی معمولی سعی می‌کنند همه چیز را در یک «گذر رو به جلو» (Forward Pass) پیش‌بینی کنند. یعنی تلاشی که برای محاسبه «۱+۱» می‌کنند برابر با تلاشی است که برای یک مسئله پیچیده صرف می‌کنند.

اما مدل HRM از ساختار مغز انسان الهام گرفته است. این مدل از دو شبکه ترانسفورمر کوچک تشکیل شده که با سرعت‌های مختلف کار می‌کنند:

  1. شبکه سطح پایین (سریع): تغییرات جزئی و سریع روی یک «چرک‌نویس ذهنی» (Scratchpad) اعمال می‌کند.
  2. شبکه سطح بالا (آهسته): استراتژی کلی را تعیین می‌کند و تصمیم می‌گیرد که آیا پاسخ آماده است یا نیاز به تفکر بیشتر دارد.

این مدل به جای پاسخ آنی، به صورت بازگشتی فکر می‌کند و جواب خود را بارها صیقل می‌دهد تا به نتیجه درست برسد.


مدل TRM: وقتی «کوچک» باز هم کوچک‌تر می‌شود!

مدل ساده‌تر بعدی، TRM (مدل بازگشتی کوچک)، را الکسیا ژولیکور-مارتینو از Samsung SAIL Montréal در اکتبر ۲۰۲۵ معرفی کرد (arXiv 2510.04871). این مدل فرضیات بیولوژیکی HRM را کنار می‌گذارد، فقط از یک شبکه کوچک استفاده می‌کند و روش آموزش را تغییر می‌دهد. با ۷ میلیون پارامتر، حدود یک‌چهارم HRM، امتیاز بالاتری می‌گیرد.

مقاله TRM امتیاز ۴۴٫۶٪ در ARC-AGI-1 و ۷٫۸٪ در ARC-AGI-2 گزارش می‌کند (که معمولاً به ۴۵٪ و ۸٪ گرد می‌شود). در همان جدول، Gemini 2.5 Pro به ۳۷٫۰٪ و ۴٫۹٪، o3-mini-high به ۳۴٫۵٪ و ۳٫۰٪ و DeepSeek R1 به ۱۵٫۸٪ و ۱٫۳٪ رسیده‌اند. TRM از همه جلو نیست: Grok-4-thinking امتیاز ۶۶٫۷٪ و ۱۶٫۰٪ دارد. بازآزمایی مستقل ARC Prize روی مجموعه semi-private، ۴۰٪ در ARC-AGI-1 و ۶٫۲٪ در ARC-AGI-2 را ثبت کرد (نتایج ARC Prize). نه GPT-4 و نه GPT-5 در جدول مقایسه هیچ‌کدام از این دو مقاله نیستند.

چرا TRM موفق‌تر بود؟

مدل TRM به جای تقلید از مغز موش (که در HRM استفاده شده بود)، بر یک جداسازی عملکردی تمرکز کرد:

  • یک فضای برای چرک‌نویس تفکر (Thinking Scratchpad).
  • یک فضای برای پاسخ نهایی (Answer Placeholder).

این مدل به جای اینکه فرض کند به یک «تعادل» می‌رسد (اشتباهی که HRM داشت)، دقیقاً روی حلقه‌هایی که اجرا می‌کند آموزش می‌بیند. جالب‌ترین نکته اینجاست که وقتی محققان سعی کردند لایه‌های مدل را افزایش دهند، عملکرد آن کاهش یافت. در واقع، کوچک بودن مدل باعث شد که مدل روی داده‌های محدود «Overfit» (بیش‌برازش) نکند و بهتر تعمیم دهد.


آنالوژی برای درک بهتر

تصور کنید از دو نفر می‌خواهید یک نقاشی پیچیده بکشند.

نفر اول (یک مدل زبانی بزرگ): یک نابغه است که باید نقاشی را با یک حرکت قلم و بدون برداشتن دست از روی کاغذ تمام کند. هرچقدر هم که نابغه باشد، احتمال خطا بالاست.

نفر دوم (TRM): یک نقاش معمولی است، اما اجازه دارد طرح اولیه را بکشد، به آن نگاه کند، پاک کند، اصلاح کند و ساعت‌ها روی جزئیات کار کند تا زمانی که از نتیجه راضی شود.

در مسائل منطقی و پیچیده، نقاش دوم (مدل بازگشتی کوچک) اغلب برنده می‌شود، چون فرصت فکر کردن و اصلاح دارد، حتی اگر مغز (پارامتر) کوچکتری داشته باشد.


نتیجه‌گیری: آینده هوش مصنوعی بازگشتی است

این تحقیقات ثابت کرد که حل مسائل سخت منطقی تنها در انحصار مدل‌های غول‌پیکر زبانی نیست. مدل‌های کوچک با قابلیت تفکر بازگشتی (Recursion) می‌توانند مسائلی را حل کنند که مدل‌های بزرگ با یک بار پردازش از پس آن برنمی‌آیند.

این مدل‌ها به جای حفظ کردن داده‌ها، یاد می‌گیرند که چگونه یک بوم نقاشی (Canvas) را در طی چندین مرحله ویرایش کنند تا به جواب درست برسند.

نکات کلیدی این تحقیق:

  • بزرگتر همیشه بهتر نیست - معماری و روش تفکر مهم‌تر از اندازه است
  • قابلیت بازنگری و اصلاح می‌تواند جایگزین میلیاردها پارامتر شود
  • الهام از مغز انسان (تفکر سریع و آهسته) می‌تواند به مدل‌های کارآمدتر منجر شود
  • مدل‌های کوچک‌تر می‌توانند بهتر تعمیم دهند و کمتر دچار بیش‌برازش شوند

شاید آینده هوش مصنوعی نه در مدل‌های تریلیون پارامتری، بلکه در مدل‌های هوشمندی باشد که می‌دانند چگونه «فکر کنند».

فن‌مایند هم دقیقاً همین شرط‌بندی را در مقیاس کوچک‌تر می‌زند: دستیاری محدودتر که موظف به استناد است و ترجیح می‌دهد رد کند تا حدس بزند، از یک دستیار گسترده‌تر که به همه‌چیز روان جواب می‌دهد ولی نه همیشه درست، بهتر عمل می‌کند. ببینید این برای یک دستیار سازمانی داخلی چطور پیش می‌رود.

می‌خواهید راه‌حل‌های هوشمند هوش مصنوعی بسازید؟

تیم ما در توسعه اپلیکیشن‌های مبتنی بر هوش مصنوعی کارآمد تخصص دارد. چه به مدل‌های کوچک و بهینه نیاز داشته باشید و چه به یکپارچه‌سازی کامل AI، می‌توانیم به تحقق چشم‌انداز شما کمک کنیم.

پروژه AI خود را مطرح کنید

اشتراک‌گذاری این مقاله