گارتنر پیشبینی کرده که تا پایان ۲۰۲۶، ۴۰ درصد از اپلیکیشنهای سازمانی AI agentهای مخصوص یک کار مشخص داشته باشن؛ این رقم توی ۲۰۲۵ کمتر از ۵ درصد بود. توی نظرسنجی PwC در مه ۲۰۲۵ از ۳۰۰ مدیر ارشد آمریکایی، ۷۹ درصد گفتن AI agent توی شرکتشون در حال پذیرشه، ولی دوسومشون گفتن کمتر از نصف کارمندهاشون هر روز با agent کار میکنن. یعنی بخش بزرگی از این «پذیرش» پایلوته، دموئه، یا یه ابزار داخلیه که هیچکس اونقدر بهش اعتماد نداره که واقعاً بذارتش جلوی کاربر واقعی.
جالبه که این فاصله ربطی به ضعف مدلها نداره. چه مدلهای بزرگ مثل GPT چه مدلهای متنباز، مدتهاست از خط «کافیه دیگه، خوبه» رد شدن — طبق دادههای Artificial Analysis که WhatLLM جمعبندی کرده (ژوئن ۲۰۲۶)، بهترین مدلهای متنباز توی شاخصهای agentic و کدنویسی فقط چهار تا پنج امتیاز از مدلهای بسته عقبترن، اونهم با قیمت خیلی کمتر برای هر توکن. مشکل جای دیگهایه: وقتی یه agent جلوی چشم یه ممیز، یه نهاد نظارتی، یا یه مشتری واقعی اشتباه میکنه، چی میشه؟
بهروزرسانی، مهر ۱۴۰۵ (اکتبر ۲۰۲۶). دادههای تازهتر همین حرف رو با نمونهٔ بزرگتر تکرار میکنن. توی پژوهش Wakefield Research برای Teradata (ژوئیه ۲۰۲۶) با ۱٬۰۰۰ مدیر ارشد فناوری و داده در آمریکا، بریتانیا، فرانسه، آلمان، ژاپن و عربستان، فقط ۷٪ سازمانها به مرحلهای رسیده بودن که agent فرایندهای چندمرحلهای رو با اثر تجاری قابل اندازهگیری اجرا کنه؛ ۶۸٪ هنوز توی مرحلهٔ آزمایش یا توسعه بودن. مانعی که اسم میبره هم مدل نیست: ۷۷٪ مدیران گفتن ۲۰٪ یا کمتر از دادهٔ سازمانشون اونقدر توصیف و زمینهدار شده که یه agent بتونه ازش استفاده کنه، و ۶۳٪ گفتن بازده هزینهٔ agentic AI تا حالا حداکثر کم یا تازه در حال شکلگیری بوده.
چرا بانکها زودتر از بیمارستانها به production رسیدن
پذیرش این فناوری اصلاً یکدست نیست. بانکها و بیمه معمولاً زودتر از بقیه agent رو به production میرسونن، در حالی که سلامت و بخش دولتی خیلی کندتر جلو میرن. این تفاوت به بودجه ربطی نداره. بانک و بیمه از قبل عادت دارن هر تصمیمی رو مستند کنن، امضا بگیرن، و بتونن ردش رو دنبال کنن؛ یه AI agent راحت توی همین فرآیند جا میشه. سلامت و دولت این زیرساخت رو ندارن، پس یه agent که «معمولاً درست میگه» بهجای کمک، تبدیل به یه ریسک میشه.
از طرفی، قوانین شفافیت قانون هوش مصنوعی اتحادیهی اروپا برای چتباتها و محتوای ساختهی AI از دوم اوت ۲۰۲۶ اجرایی شدن، و قوانین سیستمهای پرریسک هم بعد از تعویقی که شورای اروپا ژوئن ۲۰۲۶ تصویب کرد از دسامبر ۲۰۲۷ اجرا میشن. طبق مادهی ۹۹، جریمه برای کاربردهای ممنوع تا ۳۵ میلیون یورو یا ۷ درصد گردش مالی جهانیه و برای بیشتر تخلفهای دیگه تا ۱۵ میلیون یورو یا ۳ درصد. یعنی حالا هر سازمانی، قبل از اینکه یه agent رو راه بندازه، مجبوره یه سؤال ناخوشایند از خودش بپرسه: اگه این جواب اشتباه از آب دراومد، میتونیم دقیقاً نشون بدیم چرا این رو گفته؟
راهحل، مدل باهوشتر نیست؛ مدل محدودتره
هر پروژهای که از مرحلهی پایلوت گذشته و واقعاً به production رسیده، یه ویژگی مشترک داره: کارش خیلی مشخص و محدوده، نه یه دستیار همهکاره. مثلاً agentی که فقط یه نوع گزارش میسازه رو میشه سر تا تهش ممیزی کرد، برای همین اجازهی انتشار میگیره. یه دستیار مستندسازی بالینی هم به همین دلیل واقعاً استفاده میشه: کارش محدوده و ردش روی کاغذ میمونه. دستیار عمومیای که از همهچی یه کم بلده، بهندرت تا اینجا میرسه.
ما دقیقاً همین نگاه رو داشتیم وقتی FanMind رو طراحی کردیم، خیلی قبلتر از اینکه «AI عاملمحور» تیتر امسال بشه. FanMind از حافظه یا حدس جواب نمیده. هر جوابش روی سندهایی که خودِ سازمان آپلود کرده مستنده، با ارجاع دقیق به همون سند و شمارهی صفحهش. اگه جواب سؤال توی سندها نباشه، صادقانه میگه که نمیدونه، و اون سؤال رو یادداشت میکنه تا ادمین محتوا سند لازم رو اضافه کنه — بهجای اینکه مدل بیخیال یه جواب از خودش بسازه. دسترسیها هم دقیقاً همون سطحبندی سازمانی رو رعایت میکنه، نه اینکه هرکسی بتونه هرچی خواست بپرسه. شاید به چشم اول بهاندازهی یه agent همهکاره هیجانانگیز نباشه، ولی همینه که واقعاً میتونه وارد production بشه — چون هر جوابش یه ردپا داره که یه آدم واقعی میتونه چکش کنه.
اگه پروژهی AI شما هم همینجا گیر کرده — جایی بین «پذیرفتیمش» و «اونقدر بهش اعتماد داریم که واقعاً اجراش کنیم» — سؤال اصلی این نیست که کدوم مدل رو آپگرید کنیم. سؤال اینه: آیا این agent میتونه نشون بده چطور به این جواب رسیده؟
در حوزهی کدنویسی هم نوشتهایم که چطور RPI را با سابایجنتهای Claude Code اجرا میکنیم.
بزرگتر کردن مدل هم راهحل این شکاف نیست؛ دلیلش را در مدلهای ۷ و ۲۷ میلیون پارامتری چگونه در ARC-AGI از مدلهای بسیار بزرگتر جلو زدند بررسی کردهایم.