زومیا؛ هوش مصنوعی

چت‌بات‌های لجباز؛ چرا هوش مصنوعی عذرخواهی می‌کند، اما از اشتباهش دست نمی‌کشد؟

هوش مصنوعی در مکالمات طولانی گیج می‌شود و به‌جای اصلاح، اشتباهش را به شیوه‌های مختلف ادامه می‌دهد. ریشه‌ی این لجبازی کجاست؟ ماجرا معمولاً با یک درخواست ساده از دستیار هوش مصنوعی شروع می‌شود: «این یادداشت را برای جلسه‌ی فردا ویرایش کن». درخواست کمی دوپهلوست، ام…

18 دقیقه مطالعه
  • پشتیبانی شبکه
  • هوش مصنوعی
  • مدل
  • جواب
  • هوش
  • مصنوعی
  • می‌کند
  • کاربر
چت‌بات‌های لجباز؛ چرا هوش مصنوعی عذرخواهی می‌کند، اما از اشتباهش دست نمی‌کشد؟

خلاصه تحلیلی خبر

هوش مصنوعی در مکالمات طولانی گیج می‌شود و به‌جای اصلاح، اشتباهش را به شیوه‌های مختلف ادامه می‌دهد. ریشه‌ی این لجبازی کجاست؟ ماجرا معمولاً با یک درخواست ساده از دستیار هوش مصنوعی شروع می‌شود: «این یادداشت را برای جلسه‌ی فردا ویرایش کن». درخواست کمی دوپهلوست، ام…

موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، مدل، جواب، هوش، مصنوعی

هوش مصنوعی در مکالمات طولانی گیج می‌شود و به‌جای اصلاح، اشتباهش را به شیوه‌های مختلف ادامه می‌دهد. ریشه‌ی این لجبازی کجاست؟

ماجرا معمولاً با یک درخواست ساده از دستیار هوش مصنوعی شروع می‌شود: «این یادداشت را برای جلسه‌ی فردا ویرایش کن». درخواست کمی دوپهلوست، اما مدل اصلاً معطل نمی‌کند و با لحنی مطمئن و خوش‌بینانه متنی برای جلسه‌ای با مدیران می‌نویسد.

کمی بعد، کاربر وارد عمل می‌شود تا ابهام را برطرف کند: «نه، جلسه با مهندس‌هاست. پروژه شکست‌خورده و باید بی‌تعارف و صریح درباره‌ی دلایلش حرف بزنیم.»

هوش مصنوعی عذرخواهی می‌کند، اشتباهش را می‌پذیرد و حتی دلایل شکست را هم به متن اضافه می‌کند. اما خروجی جدید، هنوز بوی جلسات هیئت‌مدیره می‌دهد! شکست به «فرصتی شیرین برای یادگیری» تبدیل می‌شود، جزئیات حیاتیِ فنی به حاشیه می‌روند و لحن متن همچنان می‌خواهد مخاطب را تحت‌تأثیر قرار دهد. مدل ظاهراً حرف کاربر را تصدیق می‌کند، اما اسکلت‌بندی متن هنوز حال‌وهوای برداشت اولیه را دارد.

خلاصه صوتی، ساخته‌شده با هوش مصنوعی

پژوهشگران متا با همین مثالِ آشنا، رفتاری را توضیح می‌دهند که اغلب کاربران حرفه‌ای هوش مصنوعی بارها تجربه‌اش کرده‌اند. مدل عذر می‌خواهد، می‌گوید «حق با شماست» و حتی خطایش را درست توضیح می‌دهد. اما در نهایت ردپای برداشت اشتباه اولیه، شاید کمی پنهان‌تر در پاسخ دیده می‌شود.

لجبازی مدل‌های هوش مصنوعی را همیشه در فرم مخالفت آشکار نمی‌بینیم، گاهی آن را پشت موافقتی مؤدبانه تجربه می‌کنیم.

پژوهشگران اصرار پنهان مدل‌ها بر اشتباهشان را با تعبیرهایی مثلسختی استدلالواینرسی باورتوصیف می‌کنند. اینرسی باور یعنی اطلاعات جدیدی به مدل می‌رسد، اما برداشت قبلی هنوز روی جواب یا تصمیم بعدی سنگینی می‌کند.

رسیدن اطلاعات جدید به مدل همیشه به معنای اصلاح مسیر نیست.

وقتی از لجبازی حرف می‌زنیم، منظورمان قصد، غرور یا شخصیتی انسانی در مدل نیست. این اصطلاح را برای الگویی سنجش‌پذیر به کار می‌بریم؛ زیرا شواهد جدید باید نتیجه را عوض کنند، ولی اثر اطلاعات کهنه همچنان ادامه پیدا می‌کند.

مقاله‌ی جدید متا با عنوانشفاف‌سازی به معنای اصلاح نیست؛ مدل‌های زبانی نمی‌توانند رها کنند۲۱ سپتامبر ۲۰۲۶ منتشر شد. نویسندگان درخواست‌هایی مبهم در سه حوزه‌ی نویسندگی، برنامه‌ریزی و کدنویسی نوشتند و سراغ Gemini 2.5 Pro و Gemini 2.5 Flash رفتند.

مدل ابتدا بر پایه‌ی پیام ناقص کاربر دست‌به‌کار می‌شد، پیام بعدی ابهام را صریحاً توضیح می‌داد و مدل باید کارش را با خواسته‌ی تازه هماهنگ می‌کرد.

دو مدل در پایان اطلاعات یکسانی دریافت کردند، اما وقتی توضیح کامل پس از پاسخ اولیه رسید، نرخ موفقیت هر دو کاهش یافت. مسیر گفت‌وگو، حتی با مقصدی یکسان، نتیجه را تغییر داد.

هر دو گفت‌وگو در پایان دقیقاً اطلاعات یکسانی در اختیار مدل می‌گذاشتند و تفاوتشان فقط به ترتیب رسیدن اطلاعات برمی‌گشت. وقتی از همان ابتدا توضیح کامل ارائه می‌شد، Gemini 2.5 Pro پنجاه درصد وظایف را با موفقیت انجام می‌داد.

اما وقتی درخواست اولیه کمی مبهم بود و توضیحات تکمیلی را کمی بعد به مدل می‌دادند، موفقیت به ۴۲٫۸ درصد می‌رسید.امتیاز Gemini 2.5 Flash نیز از ۵۵٫۴ به ۴۵٫۷ درصد کاهش پیدا کرد. مقصد یکی بود، اما راهی که مدل طی می‌کرد نتیجه را تغییر می‌داد.

پژوهشگران ردپای برداشت کنارگذاشته در جواب نهایی راآلودگی به فرضیه‌ی قدیمینامیدند. این ردپا در ۱۲٫۵ درصد وظایف نویسندگی، ۱۴٫۱ درصد وظایف برنامه‌ریزی و ۲۵٫۶ درصد وظایف کدنویسی دیده می‌شد.

شاید در یک متن، فرض غلط با عوض‌کردن چند عبارت از بین برود؛ اما در یک برنامه می‌تواند به امضای تابع، ساختار داده، وابستگی‌ها یا مسیر اجرای کد راه پیدا کند و دیگر با چند وصله‌ی موضعی نمی‌شود همه‌ی این بخش‌ها را یک‌جا اصلاح کرد.

در کدنویسی، فاصله‌ی میان پذیرفتن و تغییر واقعی پررنگ‌تر می‌شد. مدل‌ها در ۹۳٫۵ درصد موارد می‌گفتند توضیح تازه‌ی کاربر را پذیرفته‌اند، اما کدها فقط در ۸۶٫۴ درصد موارد واقعاً اصلاح شد. مدل می‌توانست دقیقاً بگوید چه چیزی را اشتباه فهمیده و در همان حال برداشت غلطش را در برنامه حفظ می‌کرد. عذرخواهی‌اش هم در سطح کلمات خیلی خوب به نظر می‌رسید، ولی جواب نهایی کاملاً بازسازی نمی‌شد.

هوش مصنوعی خیلی زود به اولین برداشتش متعهد می‌شود و توضیحات بعدی شما را فقط یک پیوست بی‌اثر می‌بیند

نویسندگان مقاله این وضعیت راتعهد زودهنگام به یک برداشتمی‌نامند. مدل وقتی با درخواستی مبهم روبه‌رو می‌شود، به‌جای اینکه چند احتمال را باز نگه دارد، خیلی زود یکی را پیش خودش قطعی می‌کند. توضیح بعدی کاربر هم مثل اطلاعاتی تکمیلی وارد گفت‌وگو می‌شود، نه نشانه‌ای که برداشت اول را باطل کند. درنهایت مدل جواب موجود را وصله‌پینه می‌کند، درحالی‌که برای اصلاح واقعی گاهی باید جواب را از صفر تولید کرد.

مطالعه‌ی متا هنوز در مرحله‌ی پیش‌انتشار قرار دارد و فقط دو مدل جمنای را تست می‌کند، پس به‌تنهایی نمی‌شود نتیجه‌اش را به همه‌ی مدل‌ها تعمیم داد. ولی پژوهشگران دیگری نیز تصمیم گرفتند رفتار مدل‌ها را در لحظه‌ای که برداشت اولیه‌شان را باوجود اصلاح کاربر در جواب جدید می‌آورند، بررسی کنند، آن‌هم در گفت‌وگوهای طولانی‌تر.

وقتی تمام جزئیات در یک پیام به مدل داده می‌شد، پاسخ‌ها هم دقیق‌تر و هم باثبات‌تر بودند. پخش‌شدن همان اطلاعات در چند نوبت، مدل‌ها را به فرض‌سازی و تکیه بر جواب‌های قبلی سوق دادarxiv

گروهی از پژوهشگران مایکروسافت و سیلزفورس ریسرچ، بیش از ۲۰۰ هزار گفت‌وگوی شبیه‌سازی‌شده را روی ۱۵ مدل از هشت خانواده اجرا کردند. آن‌ها به‌جای اینکه همه‌ی اطلاعات را همان ابتدا در اختیار مدل بگذارند، درخواست را به چند بخش تقسیم کردند و جزئیات لازم را کم‌کم در طول گفت‌وگو اضافه کردند، شبیه همان چیزی که در استفاده‌ی واقعی اتفاق می‌افتد.

در دنیای واقعی هم کاربر همه‌ی جزئیات پروژه، کد یا محاسبه را آماده ندارد و خواسته‌اش طی چند رفت‌وبرگشت کامل‌تر می‌شود. نتیجه‌ی آزمایش‌ها با عنوان «مدل‌های زبانی در گفت‌وگوهای چندمرحله‌ای گم می‌شوند» منتشر شد و از افت متوسط ۳۹ درصدی عملکرد در شش وظیفه خبر می‌داد.

بخش کوچکی از این افت عملکرد به ضعف توانایی خام مدل‌ها مربوط می‌شد و بخش بزرگ‌تری به بی‌ثباتی‌شان برمی‌گشت. مدلی که مسئله‌ای را در یک گفت‌وگو درست حل کرده بود، ممکن بود در اجرای دوباره‌ی همان گفت‌وگو راهی کاملاً دیگر برود.

در شبیه‌سازی پژوهش، کاربر اطلاعات را بخش‌به‌بخش آشکار می‌کند. پاسخ درست گفت‌وگو را پایان می‌دهد، اما پاسخ اشتباه مدل را به نوبت بعدی می‌فرستد؛ مسیری که مدل گاهی در آن گم می‌شود.arxiv

وقتی پژوهشگران جواب‌ها را زیر ذره‌بین بردند، به چهار الگوی تکرارشونده رسیدند. مدل‌ها پیش از رسیدن همه‌ی جزئیات سراغ پاسخ کامل می‌رفتند، بیش از حد به جواب‌های قبلی خود تکیه می‌کردند، تحت‌تأثیر آخرین پیام کاربر بخشی از اطلاعات میانی گفت‌وگو را از دست می‌دادند و معمولاً بیش از اندازه مفصل پاسخ می‌دادند.

وقتی هوش مصنوعی در یک مکالمه پیچِ اشتباهی را رد کند، دیگر به‌سختی می‌تواند راه برگشت را پیدا کند

پاسخ‌های زودهنگام و طولانی، فرض‌های تازه‌ای وارد تاریخچه‌ی چت می‌کردند و وقتی کاربر بعداً اطلاعات جدیدی می‌داد، مدل به‌جای کنارگذاشتن کامل آن فرض‌ها، اغلب پاسخش را روی همان چیزی بنا می‌کرد که چند مرحله قبل خودش ساخته بود.

پایین‌آوردن «دما» هم چاره‌ی کار نشد. دما میزان تنوع مدل در انتخاب واژه‌های بعدی را تنظیم می‌کند و صفرکردنش معمولاً جواب‌ها را قابل‌پیش‌بینی‌تر می‌کند. بااین‌حال، بی‌ثباتی در گفت‌وگوهای چندمرحله‌ای حدود ۳۰ درصد باقی ماند. تغییری کوچک در چند واژه‌ی اول می‌توانست مدل را به راهی بکشاند که خطاهایش در پیام‌های بعدی روی‌هم تلنبار شوند. مدل وقتی یک‌بار پیچ اشتباه را رد می‌کرد، به‌سختی راه برگشت را می‌یافت.

دو سال قبلمعیار RefuteBenchهمین بازگشت به مسیر قبلی را در حوزه‌های پرسش‌وپاسخ، ترجمه و نوشتن ایمیل سنجیده بود. کاربر با جواب مدل مخالفت می‌کرد یا دستور تازه‌ای می‌داد و پژوهشگران بررسی می‌کردند که اثر اصلاح تا کجای گفت‌وگو دوام می‌آورد.

برخی مدل‌ها اصلاح را اول اجرا می‌کردند، اما هرچه مکالمه طولانی‌تر می‌شد، دوباره به جواب یا ترجیح قبلی‌شان برمی‌گشتند.نسخه‌ی دوم این معیارهم نشان داد پذیرفتن یک اصلاح در همان لحظه تضمین نمی‌کند که در پیام‌های بعدی هم سر جایش بماند.

اگر فکر می‌کنید مشکل فقط از فراموشی مدل‌ها ناشی می‌شود، کمی صبر کنید. گاهی اصلاح، روشن و صریح، درست در آخرین پیام جلوی چشم مدل قرار دارد و باز هم ردپای فرض قبلی در پاسخ جدید دیده می‌شود. پس مشکل از حافظه‌ی هوش مصنوعی نیست.

مشکل از جایی شروع می‌شود که مدل باید برداشت قدیمی‌اش را کنار بگذارد و مسئله را از نو صورت‌بندی کند.

پژوهشگران دانشگاه بیله‌فلداز زاویه‌یترمیمبه گفت‌وگو نگاه کردند، یعنی وقتی یکی از طرفین چیزی را اشتباه می‌فهمد، بعد چطور آن سوءتفاهم را اصلاح می‌کند؟ ما در گفت‌وگوی روزمره، مدام این کار را انجام می‌دهیم؛ سؤال می‌پرسیم، منظور طرف مقابل را روشن می‌کنیم یا برداشت قبلی‌مان را عوض می‌کنیم.

پژوهشگران مسئله‌های ریاضی حل‌شدنی و حل‌نشدنی را به GPT-4o، کلاد Sonnet 4.5، دیپ‌سیک، میسترال و Phi دادند و بعد جواب‌ها را با چند نوع اعتراض به چالش کشیدند. مدل‌ها در دور اول از پس مسئله‌های حل‌شدنی خوب برآمدند، اما مسئله‌های حل‌نشدنی آن‌ها را به حدس‌زدن می‌کشاند.

مدل‌ها در بیش از نیمی از جواب‌ها یک عدد قطعی ارائه می‌کردند، حتی وقتی داده‌های مسئله کافی نبود. مدل به‌جای اینکه توضیح بخواهد، خودش جای خالی را پر می‌کرد. همین حدس به موضعی بدل می‌شد که در دور بعد باید از آن کوتاه می‌آمد.

GPT-4o و Phi-4 در بیشتر آزمایش‌ها همان پاسخ غلط قبلی را پس از اعتراض کاربر تکرار کردند. مدل‌های دیگر بیشتر تغییر موضع دادند، اما پاسخ تازه همیشه درست نبود. بازه‌ها تفاوت رفتار مدل‌ها در سه نوع اعتراض و میان سؤال‌های حل‌شدنی و حل‌نشدنی را نشان می‌دهند.

نکته‌ی جالب اینکه واکنش مدل‌ها به اعتراض کاربر یکسان نبود. اگر GPT پاسخ اول را اشتباه تولید می‌کرد، حدود ۷۲ تا ۷۷ درصد موارد روی همان جواب می‌ماند و فقط در ۵ تا ۱۰ درصد موارد کارش را اصلاح می‌کرد. بااین‌حال همین سرسختی باعث می‌شد مدل پاسخ‌های درستش را هم باوجود اطلاعات گمراه‌کننده‌ی کاربر حفظ کند.

کلاد آمادگی بیشتری برای تجدیدنظر نشان داد و نزدیک به یک‌چهارم جواب‌های غلطش را پس از اعتراض اصلاح کرد. البته همین آمادگی، حساسیتش را به پیشنهادهای گمراه‌کننده هم بالا می‌برد.

ChatGPT روی جوابش پافشاری کرد، درحالی‌که کلاد آمادگی بیشتری برای تجدیدنظر داشت

دیپ‌سیک بارها جواب تازه‌ای ساخت، حتی وقتی پاسخ قبلی‌اش درست بود. میسترال هم بیشتر از بقیه به نحوه‌ی اعتراض کاربر حساس بود؛ بسته به اینکه کاربر چطور ایراد می‌گرفت، مدل ممکن بود روی پاسخ قبلی‌اش بماند یا از آن برگردد.

پژوهشگران در نهایت به چیزی به اسمرفتار معمول مدل‌های زبانینرسیدند، چون هر خانواده الگوی خاص خودش را در مقاومت و عقب‌نشینی داشت.

کنار هم گذاشتن مدل‌ها مرز مهمی را در تعریف لجبازی روشن می‌کند. ماندن روی جواب قبلی، وقتی آن جواب درست باشد، ثبات به‌حساب می‌آید. همان رفتار در برابر اصلاحی معتبر، لجبازی می‌شود. مدل قابل‌اعتماد باید محتوای بازخورد را بسنجد، نه اینکه فقط جلوی کاربر بایستد یا با او هم‌نوا شود. مسئله فقط مقدار مقاومت نیست. مدل باید تشخیص دهد کی دلیل کافی برای رهاکردن جواب قبلی دارد.

مقایسه‌ی مدل‌ها به ما کمک می‌کند لجبازی هوش مصنوعی را بهتر تعریف کنیم، چون اگر جواب قبلی مدل درست باشد و در برابر اصلاح مقاومت کند، ثباتش را نشان می‌دهد. ولی اگر توضیح درستی به مدل می‌دهیم، باید بتواند نظرش را عوض کند. مهم این است که مدل بفهمد چه زمانی باید بماند و چه زمانی باید برگردد.

مدل‌ها لزوماً پس از اعتراض و ایرادگرفتن کاربر لجبازی‌شان را شروع نمی‌کنند. گاهی هم از همان اول به راه‌حلی می‌چسبند که از داده‌های آموزشی خوب می‌شناسند و صورت سؤال جدید را طوری می‌خوانند که همان راه‌حل دوباره جواب بدهد.

گروهی از محققان که بعداً نتایج پژوهششان را با نام «مدل استدلال‌گر لجباز است» منتشر کردند، مسئله‌های مشهور ریاضی و معماهای شناخته‌شده را با تغییری کوچک به مدل‌ها دادند. نسخه‌ی جدید سؤال‌ها ظاهری آشنا داشت، اما یک شرط تعیین‌کننده راه‌حل قدیمی را بی‌اعتبار می‌کرد. مدل برای رسیدن به جواب باید همان شرط روشن را جدی می‌گرفت.

در سه مسئله‌ی دست‌کاری‌شده، پاسخ مستقیم شرط تازه را دنبال کرد؛ اما مدل استدلالی صورت سؤال را به نسخه‌ی آشنای قبلی بازگرداند و به جواب غلط رسید. پژوهشگران این رفتار را «سختی استدلال» نامیده‌اند.

در یکی از معماها، یک جفت خرگوش «برای همیشه نابارور» وارد مزرعه می‌شدند. پس جمعیت خرگوش‌ها با گذشت ماه‌ها ثابت می‌ماند و مدل در حالت بدون استدلال همین جواب ساده را پیدا کرد. اما مدل استدلالی شرط «برای همیشه نابارور» را به «موقتاً نابارور» تبدیل کرد و دوباره سراغ رشد فیبوناچی رفت.

مدل‌های استدلالی گاهی صورت مسئله را تغییر می‌دهند تا با راه‌حل‌های آشنا و از پیش‌آموخته‌شان هماهنگ شود

معمای دیگری شبیه برج هانوی طراحی شده بود، اما متن صریحاً می‌گفت «این مسئله برج هانوی نیست». برخی مدل‌های استدلالی همین جمله را نشانه‌ی اشتباه یا ابهامی احتمالی گرفتند و قواعد همان معمای مشهور را به مسئله برگرداندند. در نمونه‌ای ریاضی هم متغیری که عدد حقیقی مثبت معرفی شده بود، مثل عددی مختلط پردازش شد. صورت آشنای مسئله در داده‌های پیشین چنین راهی را پیش پای مدل گذاشته بود.

پژوهشگران در این مجموعه آزمایش‌ها سه الگوی تکرارشونده دیدند. مدل گاهی شرطی ساده را بیش از اندازه تفسیر می‌کرد و معنایی نانوشته به آن می‌افزود. گاهی ورودی را ناشی از غلط تایپی یا ترجمه‌ی اشتباه می‌دانست. گاهی هم فقط بخشی از دستور را دنبال می‌کرد که با راه‌حل آشنا جور درمی‌آمد.

مدل‌های استدلالی از سه مسیر به پاسخ آشنا برمی‌گشتند: معنایی نانوشته به شرط مسئله اضافه می‌کردند، ورودی غیرعادی را خطای کاربر می‌گرفتند یا فقط بخشی از دستور را می‌دیدندarxiv

در هر سه حالت مدل دستور را گم نکرده بود، سؤال و شروط را می‌دید، اما زیر سایه‌ی جوابی که از قبل می‌شناخت دوباره تفسیرش می‌کرد. یکی از مهم‌ترین نتایج این مطالعات مقایسه‌ی حالت معمولی و استدلالی مدل‌ها بود.

برای مثال Qwen3-235B در حالت بدون تفکر روی معماهای تغییریافته حدود ۷۴ درصد امتیاز گرفت، اما امتیاز حالت استدلالی‌اش به حدود ۳۸٫۵ درصد رسید. امتیاز Qwen3-32B هم از حدود ۷۴ درصد در حالت بدون تفکر به ۳۸ درصد در حالت استدلالی افت کرد. به‌طور مشابه امتیاز دیپ‌سیک هم با تغییر نسخه‌ی V3 به R1 از حدود ۶۶ به نزدیک ۵۲ درصد رسید.

هرچه مدل بیشتر فکر کند، احتمال اینکه در تله‌ی جواب‌های کلیشه‌ای بیفتد بیشتر می‌شود

پژوهشگران دیدند هرچه استدلال طولانی‌تر می‌شود، راه‌حل آشنا فرصت بیشتری برای برگشتن پیدا می‌کند. توجه کنید که آزمایش تله‌ی استدلال زمانی را بررسی می‌کند که ظاهر مسئله آشناست، اما یک شرط جدید راه‌حل قبلی را عوض می‌کند.

پس لزوما فکر بیشتر همیشه مدل را لجبازتر نمی‌کند. مدل پیشرفته‌تر می‌تواند شرط جدید را تشخیص دهد و درباره‌اش حرف بزند، اما آخر سر راه‌حل آشنا را بر متنی که پیش‌ رو دارد ترجیح دهد.

لجبازی در چت را همیشه با جوابی تکراری یا کدی معیوب تجربه نمی‌کنیم. ایجنت هوش مصنوعی یک‌قدم هم جلوتر می‌رود و بر پایه‌ی همان برداشت قدیمی‌اش دست به عمل می‌زند! پژوهشگران دانشگاه پلی‌تکنیک هنگ‌کنگ و دانشگاه سیچوان در مقاله‌ای با عنوان «دیدن به معنای باورکردن نیست» این رفتار را در ایجنت‌ها بررسی کردند.

گزارش محیط حضور چاقو را روی میز اعلام کرده بود، اما ایجنت همچنان تصور می‌کرد باید چاقویی پیدا کند و جست‌وجو را در کشو ادامه دادarxiv

در یکی از تست‌ها ایجنت مأمور می‌شود چاقویی تمیز را روی کانتر بگذارد. به میز قهوه می‌رسد و گزارش محیط اعلام می‌کند میان اشیای روی میز یک چاقو هم پیدا می‌شود. اما فکر بعدی ایجنت همچنان می‌گوید باید چاقویی پیدا کند. پس میز را رها می‌کند و برای جست‌وجو سراغ کشو می‌رود.

مدل در متن دیده بود که چاقویی روی میز قرار دارد، اما باز هم طبق تصور قبلی‌اش رفتار کرد؛ انگار هنوز چاقویی پیدا نشده. پژوهشگران این رفتار را «نادیده‌گرفتن مشاهده» و علت احتمالی‌اش را «اینرسی باور» نامیدند؛ یعنی وقتی تصویر قبلی مدل از محیط، حتی بعد از رسیدن شاهد مخالف همچنان فعال می‌ماند.

برای ایجنت‌ها، دیدن به معنای باور کردن نیست؛ آن‌ها باید یاد بگیرند که جهان را لحظه‌به‌لحظه ارزیابی کنند

آزمایش‌ها در محیط‌های متنی شبیه‌سازی‌شده انجام شدند، ولی باز هم فاصله‌ی چت‌بات و ایجنت را به‌خوبی نشان دادند. جواب اشتباه چت‌بات کاربر را وادار می‌کند پیامش را از نو بنویسد. ولی ایجنت ممکن است با همان اشتباه جست‌وجویی بیهوده راه بیندازد، ابزار نامناسبی به کار بگیرد یا قدم‌های بعدی‌اش را بر اساس وضعیتی منقضی‌شده بردارد.

پژوهشگران برای کاهش خطا، ایجنت را وادار کردند قبل از هر اقدام سه کار انجام دهد، پیش‌بینی کند اقدام قبلی‌اش باید چه نتیجه‌ای داشته باشد، نتیجه‌ی واقعی را بررسی کند و بعد برداشتش از محیط را به‌روز کند. این روش نرخ موفقیت ایجنت‌ها را بالا برد. در واقع ایجنت‌ها باید قبل از قدم بعدی، به‌روشنی می‌پذیرفتند جهان شبیه چیزی نیست که لحظه‌ی قبل می‌شناختند.

اغلب ما وقتی با لجبازی هوش مصنوعی مواجه می‌شویم، از مدل می‌خواهیم دوباره فکر کند. اما پژوهش‌ها نشان می‌دهند این کار همیشه جواب نمی‌دهد و گاهی فقط همان مسیر اشتباه قبلی را با توضیح بیشتری تکرار می‌کند.

در مطالعه‌ی متا زنجیره‌ی استدلال، یعنی متنی که مراحل رسیدن به جواب را باز می‌کند، تعهد آشکار به فرض غلط را کاهش داد، ولی موفقیت نهایی را به‌شکلی قابل‌اتکا بالا نبرد. در تله‌ی استدلال هم فکر طولانی‌تر به راه‌حل آشنا فرصت بیشتری داد.

پژوهش‌ها نشان می‌دهندکه نمی‌توان چندان روی «خوداصلاحی» هوش مصنوعی حساب کرد؛ یعنی این‌طور نیست که به مدل بگوییم «اشتباهات خودت را پیدا و درست کن» و او هم واقعاً از پس این کار بربیاید.

مدل در جریان آموزش یاد می‌گیرد پیشنهاد غلط کاربر را رد کند؛ اما هنگام استنتاج، همین مقاومت را در برابر پیشنهاد درست نیز به کار می‌گیرد و پاسخ خود را بی‌دلیل تغییر می‌دهد.arxiv

هوش مصنوعی زمانی می‌تواند اشتباهش را اصلاح کند که به یک ابزار یا مرجع بیرونی و مطمئن دسترسی داشته باشد. مثلاً بتواند کدی را که نوشته واقعاً اجرا کند تا ببیند کار می‌کند یا نه، یا یک سیستم مستقل دیگر جوابش را آزمایش کند. بدون این ابزارها، هوش مصنوعی معمولاً متوجه غلط‌های خودش نمی‌شود.

درخواست «دوباره فکر کردن» اغلب فقط باعث می‌شود مدل همان مسیر اشتباه را با جزئیات بیشتری توجیه کند

تغییر میزان حرف‌شنوی هوش مصنوعی هم کار راحتی نیست.پژوهشگران دو دانشگاه مطرح هنگ‌کنگدر سال ۲۰۲۵ تلاش کردند با آموزش مستقیم به مدل‌ها یاد بدهند در برابر پیشنهادهای گمراه‌کننده‌ی کاربر مقاومت بیشتری کنند.

وقتی مدل‌ها یاد گرفتند در برابر حرف‌های غلط کاربر مقاومت کنند، در برابر اصلاحات درست هم بیش از حد لجباز شدند. در واقع، آموزشی که قرار بود جلوی بله‌قربان‌گویی بی‌دلیل مدل را بگیرد، از آن طرف بام افتاد و هوش مصنوعی را به یک سیستم لجباز و یک‌دنده تبدیل کرد.

note.com

راهکارهای موفق معمولاً هوش مصنوعی را مجبور می‌کنند تفاوت بیناصلاح‌کردن یک ایراد کوچکواشتباه بودن کل فرض اولیهرا بفهمد. وقتی دانشمندان متا صریحاً به مدل دستور دادند که کل فرض‌های قدیمی‌اش را دور بریزد و پاسخ را از نو بسازد، نرخ موفقیت مدل از ۱۷٫۵ درصد به ۲۷٫۵ درصد رسید و مدل ردپای اشتباهات قبلی‌اش را هم پاک کرد.

پژوهشگران متا در آزمایش کوچک دیگری چهار شیوه‌ی جواب‌دادن را کنار هم گذاشتند؛ جواب مستقیم، فهرست‌کردن فرض‌ها، پرسیدن پیش از جواب و سیاستی دومرحله‌ای. در سیاست دومرحله‌ای، مدل ابتدا ابهام را برطرف می‌کرد و فقط بعد از آن، جواب را بر پایه‌ی برداشت روشن‌شده از نو می‌ساخت.

اگر هوش مصنوعی در چت به بیراهه رفت، اطلاعات را جمع کنید و یک گفت‌وگوی کاملاً جدید بسازید

جواب مستقیم در ۴۰ درصد موارد به برداشت غلط متعهد ماند و فهرست‌کردن فرض‌ها این آمار را تا ۲۷٫۳ درصد پایین آورد. پرسیدن پیش از جواب، تعهد غلط را کاملاً از میان برد، اما ردپای کم‌رنگی از برداشت قدیمی هنوز در جواب نهایی دیده می‌شد. سیاست دومرحله‌ای تنها روشی بود که هم تعهد غلط و هم ردپای آن را به صفر رساند.

پژوهشگران آمازون و دانشگاه مریلند هم در تحقیقاتی جداگانه به سراغ روش خودآموزی هوش مصنوعی رفتند و رویکرد جدیدی (RLAAR) به کار گرفتند که فقط به جواب‌های درست هوش مصنوعی پاداش نمی‌داد، بلکه به مدل می‌آموخت که اگر اطلاعاتش برای پاسخ‌دادن کافی نیست، عجله نکند و فعلاً جواب ندهد.

با روش آموزشی جدید، توانایی هوش مصنوعی در دنبال‌کردن بحث و عقب نماندن از جریان صحبت که به آن معیار گم‌شدن در گفت‌وگو می‌گویند، از ۶۲٫۶ درصد به ۷۵٫۱ درصد رسید و نرخ خودداری درست از پاسخ‌دادن هم از ۳۳٫۵ به ۷۳٫۴ درصد افزایش یافت.

درهرحال پژوهش‌هایی که تا سپتامبر ۲۰۲۶ انجام شده‌اند، هنوز راه‌حلی همه‌جانبه قطعی برای غلبه‌کردن بر لجبازی مدل‌های هوش مصنوعی ارائه نمی‌کنند. جمله‌ی «همه‌ی فرض‌های قبلی را کنار بگذار و از اول بساز» گاهی کمک می‌کند، اما شواهدش به تست‌هایی محدود برمی‌گردد.

تا وقتی که دستیارهای هوش مصنوعی به حد کافی پیشرفت کنند، می‌توانید به توصیه‌ی عملی پژوهش گم‌شدن در گفت‌وگو عمل کنید. وقتی مدل در مسیری اشتباه افتاد، ادامه‌دادن همان چت معمولاً کمک چندانی به بهبود خروجی نمی‌کند. بهتر است همه‌ی اطلاعات و محدودیت‌هایی را که در طول گفت‌وگو روشن شده‌اند در یک پیام جمع کنید و آن را در چتی تازه به مدل بدهید.

آزمایش‌ها نشان می‌دهند که تجمیع اطلاعات پراکنده در یک دستور تازه، هم هوش مدل را بالا می‌برد و هم رفتار او را پایدارتر می‌کند. البته خود دانشمندان هم می‌گویند این کار فقط یک مسکن موقتی است، نه درمان ریشه‌ای.

ما لجبازی هوش مصنوعی را جملاتی مثل «من همیشه درست می‌گویم» تجربه نمی‌کنیم. اغلب اوقات مدل‌ها مؤدبانه حق را به کاربر می‌دهند، گاهی عذرخواهی هم می‌کنند و نشان می‌دهند حرفمان را پذیرفته‌اند و بعد همان راه قبلی‌شان را ادامه می‌دهند.

برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.