توهم مقیاسپذیری و ظهور رقیب کوچک
یک مدل بازگشتی با فقط ۷ میلیون پارامتر در بنچمارک استدلال ARC-AGI-1 امتیازی بالاتر از چند مدل زبانی بسیار بزرگتر گرفت، از جمله Gemini 2.5 Pro، o3-mini-high و DeepSeek R1 با ۶۷۱ میلیارد پارامتر. مدل قبلی، HRM با ۲۷ میلیون پارامتر، چند ماه زودتر نتیجهای مشابه گرفته بود. این به آن معنا نیست که مدلهای کوچک در همهچیز از مدلهای بزرگ بهترند. ولی نشان میدهد در این نوع معماهای شبکهای، اینکه یک شبکه کوچک بارها روی جواب خودش برگردد از تعداد خام پارامتر مهمتر است، آن هم با کسری از هزینه محاسباتی.
این مقاله داستان ظهور مدلهای بازگشتی کوچک (Small Recursive Models) است که قوانین بازی را تغییر دادهاند.
در حالی که مدلهای زبانی بزرگ (LLM) در حل معماهای منطقی که ما آنها را بنچمارک AGI مینامیم درجا میزنند، ایدهای جدید و جذاب در خلاف جهت این «ویروس مقیاسپذیری» شکل گرفته است. ایده ساده است: چه میشود اگر به جای بزرگ کردن مغز مدل، به آن اجازه دهیم قبل از پاسخ دادن فکر کند و جوابش را اصلاح کند؟
این ایده به HRM (مدل استدلال سلسلهمراتبی) رسید که شرکت Sapient Intelligence در ژوئن ۲۰۲۵ منتشر کرد (arXiv 2506.21734). این مدل ۲۷ میلیون پارامتر دارد و بدون پیشآموزش روی متن اینترنت، فقط با حدود ۱۰۰۰ نمونه آموزش دیده است. مقاله HRM امتیاز ۴۰٫۳٪ در ARC-AGI-1 و ۵٫۰٪ در ARC-AGI-2 گزارش میکند که در ARC-AGI-1 از o3-mini-high (۳۴٫۵٪) و Claude 3.7 8K (۲۱٫۲٪) بالاتر است. این اعداد مربوط به مجموعه ارزیابی عمومی است. وقتی تیم ARC Prize مدل HRM را روی مجموعه پنهان semi-private دوباره اجرا کرد، ۳۲٪ در ARC-AGI-1 و ۲٪ در ARC-AGI-2 ثبت شد (تحلیل ARC Prize). همان تحلیل نشان داد طراحی دوسطحی «سلسلهمراتبی» نسبت به یک ترنسفورمر معمولی هماندازه سود چندانی نداشت و بیشتر بهبود از حلقه بیرونی اصلاح جواب میآمد.
مدل HRM چطور کار میکند؟ (راز تفکر آهسته و سریع)
تفاوت اصلی اینجاست که مدلهای زبانی معمولی سعی میکنند همه چیز را در یک «گذر رو به جلو» (Forward Pass) پیشبینی کنند. یعنی تلاشی که برای محاسبه «۱+۱» میکنند برابر با تلاشی است که برای یک مسئله پیچیده صرف میکنند.
اما مدل HRM از ساختار مغز انسان الهام گرفته است. این مدل از دو شبکه ترانسفورمر کوچک تشکیل شده که با سرعتهای مختلف کار میکنند:
- شبکه سطح پایین (سریع): تغییرات جزئی و سریع روی یک «چرکنویس ذهنی» (Scratchpad) اعمال میکند.
- شبکه سطح بالا (آهسته): استراتژی کلی را تعیین میکند و تصمیم میگیرد که آیا پاسخ آماده است یا نیاز به تفکر بیشتر دارد.
این مدل به جای پاسخ آنی، به صورت بازگشتی فکر میکند و جواب خود را بارها صیقل میدهد تا به نتیجه درست برسد.
مدل TRM: وقتی «کوچک» باز هم کوچکتر میشود!
مدل سادهتر بعدی، TRM (مدل بازگشتی کوچک)، را الکسیا ژولیکور-مارتینو از Samsung SAIL Montréal در اکتبر ۲۰۲۵ معرفی کرد (arXiv 2510.04871). این مدل فرضیات بیولوژیکی HRM را کنار میگذارد، فقط از یک شبکه کوچک استفاده میکند و روش آموزش را تغییر میدهد. با ۷ میلیون پارامتر، حدود یکچهارم HRM، امتیاز بالاتری میگیرد.
مقاله TRM امتیاز ۴۴٫۶٪ در ARC-AGI-1 و ۷٫۸٪ در ARC-AGI-2 گزارش میکند (که معمولاً به ۴۵٪ و ۸٪ گرد میشود). در همان جدول، Gemini 2.5 Pro به ۳۷٫۰٪ و ۴٫۹٪، o3-mini-high به ۳۴٫۵٪ و ۳٫۰٪ و DeepSeek R1 به ۱۵٫۸٪ و ۱٫۳٪ رسیدهاند. TRM از همه جلو نیست: Grok-4-thinking امتیاز ۶۶٫۷٪ و ۱۶٫۰٪ دارد. بازآزمایی مستقل ARC Prize روی مجموعه semi-private، ۴۰٪ در ARC-AGI-1 و ۶٫۲٪ در ARC-AGI-2 را ثبت کرد (نتایج ARC Prize). نه GPT-4 و نه GPT-5 در جدول مقایسه هیچکدام از این دو مقاله نیستند.
چرا TRM موفقتر بود؟
مدل TRM به جای تقلید از مغز موش (که در HRM استفاده شده بود)، بر یک جداسازی عملکردی تمرکز کرد:
- یک فضای برای چرکنویس تفکر (Thinking Scratchpad).
- یک فضای برای پاسخ نهایی (Answer Placeholder).
این مدل به جای اینکه فرض کند به یک «تعادل» میرسد (اشتباهی که HRM داشت)، دقیقاً روی حلقههایی که اجرا میکند آموزش میبیند. جالبترین نکته اینجاست که وقتی محققان سعی کردند لایههای مدل را افزایش دهند، عملکرد آن کاهش یافت. در واقع، کوچک بودن مدل باعث شد که مدل روی دادههای محدود «Overfit» (بیشبرازش) نکند و بهتر تعمیم دهد.
آنالوژی برای درک بهتر
تصور کنید از دو نفر میخواهید یک نقاشی پیچیده بکشند.
نفر اول (یک مدل زبانی بزرگ): یک نابغه است که باید نقاشی را با یک حرکت قلم و بدون برداشتن دست از روی کاغذ تمام کند. هرچقدر هم که نابغه باشد، احتمال خطا بالاست.
نفر دوم (TRM): یک نقاش معمولی است، اما اجازه دارد طرح اولیه را بکشد، به آن نگاه کند، پاک کند، اصلاح کند و ساعتها روی جزئیات کار کند تا زمانی که از نتیجه راضی شود.
در مسائل منطقی و پیچیده، نقاش دوم (مدل بازگشتی کوچک) اغلب برنده میشود، چون فرصت فکر کردن و اصلاح دارد، حتی اگر مغز (پارامتر) کوچکتری داشته باشد.
نتیجهگیری: آینده هوش مصنوعی بازگشتی است
این تحقیقات ثابت کرد که حل مسائل سخت منطقی تنها در انحصار مدلهای غولپیکر زبانی نیست. مدلهای کوچک با قابلیت تفکر بازگشتی (Recursion) میتوانند مسائلی را حل کنند که مدلهای بزرگ با یک بار پردازش از پس آن برنمیآیند.
این مدلها به جای حفظ کردن دادهها، یاد میگیرند که چگونه یک بوم نقاشی (Canvas) را در طی چندین مرحله ویرایش کنند تا به جواب درست برسند.
نکات کلیدی این تحقیق:
- بزرگتر همیشه بهتر نیست - معماری و روش تفکر مهمتر از اندازه است
- قابلیت بازنگری و اصلاح میتواند جایگزین میلیاردها پارامتر شود
- الهام از مغز انسان (تفکر سریع و آهسته) میتواند به مدلهای کارآمدتر منجر شود
- مدلهای کوچکتر میتوانند بهتر تعمیم دهند و کمتر دچار بیشبرازش شوند
شاید آینده هوش مصنوعی نه در مدلهای تریلیون پارامتری، بلکه در مدلهای هوشمندی باشد که میدانند چگونه «فکر کنند».
فنمایند هم دقیقاً همین شرطبندی را در مقیاس کوچکتر میزند: دستیاری محدودتر که موظف به استناد است و ترجیح میدهد رد کند تا حدس بزند، از یک دستیار گستردهتر که به همهچیز روان جواب میدهد ولی نه همیشه درست، بهتر عمل میکند. ببینید این برای یک دستیار سازمانی داخلی چطور پیش میرود.