رفتن به محتوا
مدیریت اسناد

۷۹٪ میگن AI Agent رو پذیرفتن؛ چرا بیشترش هیچ‌وقت به Production نمی‌رسه

توی نظرسنجی PwC، ۷۹٪ مدیرها گفتن شرکتشون داره AI agent رو به کار می‌گیره، ولی دوسوم‌شون گفتن کمتر از نصف کارمندها واقعاً باهاش کار می‌کنن. مشکل کیفیت مدل نیست. مسئله‌ی اعتماده.

ت
تیم فنپینو
۲۵ مرداد ۱۴۰۵
۷۹٪ میگن AI Agent رو پذیرفتن؛ چرا بیشترش هیچ‌وقت به Production نمی‌رسه

گارتنر پیش‌بینی کرده که تا پایان ۲۰۲۶، ۴۰ درصد از اپلیکیشن‌های سازمانی AI agentهای مخصوص یک کار مشخص داشته باشن؛ این رقم توی ۲۰۲۵ کمتر از ۵ درصد بود. توی نظرسنجی PwC در مه ۲۰۲۵ از ۳۰۰ مدیر ارشد آمریکایی، ۷۹ درصد گفتن AI agent توی شرکتشون در حال پذیرشه، ولی دوسومشون گفتن کمتر از نصف کارمندهاشون هر روز با agent کار می‌کنن. یعنی بخش بزرگی از این «پذیرش» پایلوته، دموئه، یا یه ابزار داخلیه که هیچ‌کس اونقدر بهش اعتماد نداره که واقعاً بذارتش جلوی کاربر واقعی.

جالبه که این فاصله ربطی به ضعف مدل‌ها نداره. چه مدل‌های بزرگ مثل GPT چه مدل‌های متن‌باز، مدت‌هاست از خط «کافیه دیگه، خوبه» رد شدن — طبق داده‌های Artificial Analysis که WhatLLM جمع‌بندی کرده (ژوئن ۲۰۲۶)، بهترین مدل‌های متن‌باز توی شاخص‌های agentic و کدنویسی فقط چهار تا پنج امتیاز از مدل‌های بسته عقب‌ترن، اون‌هم با قیمت خیلی کمتر برای هر توکن. مشکل جای دیگه‌ایه: وقتی یه agent جلوی چشم یه ممیز، یه نهاد نظارتی، یا یه مشتری واقعی اشتباه می‌کنه، چی می‌شه؟

به‌روزرسانی، مهر ۱۴۰۵ (اکتبر ۲۰۲۶). داده‌های تازه‌تر همین حرف رو با نمونهٔ بزرگ‌تر تکرار می‌کنن. توی پژوهش Wakefield Research برای Teradata (ژوئیه ۲۰۲۶) با ۱٬۰۰۰ مدیر ارشد فناوری و داده در آمریکا، بریتانیا، فرانسه، آلمان، ژاپن و عربستان، فقط ۷٪ سازمان‌ها به مرحله‌ای رسیده بودن که agent فرایندهای چندمرحله‌ای رو با اثر تجاری قابل اندازه‌گیری اجرا کنه؛ ۶۸٪ هنوز توی مرحلهٔ آزمایش یا توسعه بودن. مانعی که اسم می‌بره هم مدل نیست: ۷۷٪ مدیران گفتن ۲۰٪ یا کمتر از دادهٔ سازمانشون اون‌قدر توصیف و زمینه‌دار شده که یه agent بتونه ازش استفاده کنه، و ۶۳٪ گفتن بازده هزینهٔ agentic AI تا حالا حداکثر کم یا تازه در حال شکل‌گیری بوده.

چرا بانک‌ها زودتر از بیمارستان‌ها به production رسیدن

پذیرش این فناوری اصلاً یکدست نیست. بانک‌ها و بیمه معمولاً زودتر از بقیه agent رو به production می‌رسونن، در حالی که سلامت و بخش دولتی خیلی کندتر جلو می‌رن. این تفاوت به بودجه ربطی نداره. بانک و بیمه از قبل عادت دارن هر تصمیمی رو مستند کنن، امضا بگیرن، و بتونن ردش رو دنبال کنن؛ یه AI agent راحت توی همین فرآیند جا می‌شه. سلامت و دولت این زیرساخت رو ندارن، پس یه agent که «معمولاً درست می‌گه» به‌جای کمک، تبدیل به یه ریسک می‌شه.

از طرفی، قوانین شفافیت قانون هوش مصنوعی اتحادیه‌ی اروپا برای چت‌بات‌ها و محتوای ساخته‌ی AI از دوم اوت ۲۰۲۶ اجرایی شدن، و قوانین سیستم‌های پرریسک هم بعد از تعویقی که شورای اروپا ژوئن ۲۰۲۶ تصویب کرد از دسامبر ۲۰۲۷ اجرا می‌شن. طبق ماده‌ی ۹۹، جریمه برای کاربردهای ممنوع تا ۳۵ میلیون یورو یا ۷ درصد گردش مالی جهانیه و برای بیشتر تخلف‌های دیگه تا ۱۵ میلیون یورو یا ۳ درصد. یعنی حالا هر سازمانی، قبل از اینکه یه agent رو راه بندازه، مجبوره یه سؤال ناخوشایند از خودش بپرسه: اگه این جواب اشتباه از آب دراومد، می‌تونیم دقیقاً نشون بدیم چرا این رو گفته؟

راه‌حل، مدل باهوش‌تر نیست؛ مدل محدودتره

هر پروژه‌ای که از مرحله‌ی پایلوت گذشته و واقعاً به production رسیده، یه ویژگی مشترک داره: کارش خیلی مشخص و محدوده، نه یه دستیار همه‌کاره. مثلاً agentی که فقط یه نوع گزارش می‌سازه رو می‌شه سر تا تهش ممیزی کرد، برای همین اجازه‌ی انتشار می‌گیره. یه دستیار مستندسازی بالینی هم به همین دلیل واقعاً استفاده می‌شه: کارش محدوده و ردش روی کاغذ می‌مونه. دستیار عمومی‌ای که از همه‌چی یه کم بلده، به‌ندرت تا اینجا می‌رسه.

ما دقیقاً همین نگاه رو داشتیم وقتی FanMind رو طراحی کردیم، خیلی قبل‌تر از اینکه «AI عامل‌محور» تیتر امسال بشه. FanMind از حافظه یا حدس جواب نمی‌ده. هر جوابش روی سندهایی که خودِ سازمان آپلود کرده مستنده، با ارجاع دقیق به همون سند و شماره‌ی صفحه‌ش. اگه جواب سؤال توی سندها نباشه، صادقانه می‌گه که نمی‌دونه، و اون سؤال رو یادداشت می‌کنه تا ادمین محتوا سند لازم رو اضافه کنه — به‌جای اینکه مدل بی‌خیال یه جواب از خودش بسازه. دسترسی‌ها هم دقیقاً همون سطح‌بندی سازمانی رو رعایت می‌کنه، نه اینکه هرکسی بتونه هرچی خواست بپرسه. شاید به چشم اول به‌اندازه‌ی یه agent همه‌کاره هیجان‌انگیز نباشه، ولی همینه که واقعاً می‌تونه وارد production بشه — چون هر جوابش یه ردپا داره که یه آدم واقعی می‌تونه چکش کنه.

اگه پروژه‌ی AI شما هم همین‌جا گیر کرده — جایی بین «پذیرفتیمش» و «اونقدر بهش اعتماد داریم که واقعاً اجراش کنیم» — سؤال اصلی این نیست که کدوم مدل رو آپگرید کنیم. سؤال اینه: آیا این agent می‌تونه نشون بده چطور به این جواب رسیده؟

در حوزه‌ی کدنویسی هم نوشته‌ایم که چطور RPI را با ساب‌ایجنت‌های Claude Code اجرا می‌کنیم.

بزرگ‌تر کردن مدل هم راه‌حل این شکاف نیست؛ دلیلش را در مدل‌های ۷ و ۲۷ میلیون پارامتری چگونه در ARC-AGI از مدل‌های بسیار بزرگ‌تر جلو زدند بررسی کرده‌ایم.

فن‌مایند را ببینید

دستیار هوش مصنوعی مستندمحور با ارجاع دقیق، طراحی‌شده برای واقعاً رسیدن به production، نه موندن توی پایلوت.

مشاهدهٔ محصول

اشتراک‌گذاری این مقاله