تیتر یک

چرا عامل‌های هوش مصنوعی برای رسیدن به اهدافشان دروغ می‌گویند و تقلب می‌کنند؟

زمانی که دو مدل هوش مصنوعی OpenAI در ماه ژوئیه Hugging Face را هک کردند، هدفشان نه کسب درآمد بود و نه خرابکاری؛ آن‌ها صرفاً به دنبال پاسخ یک سؤال آزمون بودند. به نقل از MIT Technology Review بر اساس گزارش بررسی این رخداد که OpenAI منتشر کرده است این مدل‌ها که…

9 دقیقه مطالعه
  • پشتیبانی شبکه
  • هوش مصنوعی
  • امنیت سایبری
  • مصنوعی
  • هوش
  • پاداش
  • کند
  • مدل‌های
چرا عامل‌های هوش مصنوعی برای رسیدن به اهدافشان دروغ می‌گویند و تقلب می‌کنند؟

خلاصه تحلیلی خبر

زمانی که دو مدل هوش مصنوعی OpenAI در ماه ژوئیه Hugging Face را هک کردند، هدفشان نه کسب درآمد بود و نه خرابکاری؛ آن‌ها صرفاً به دنبال پاسخ یک سؤال آزمون بودند. به نقل از MIT Technology Review بر اساس گزارش بررسی این رخداد که OpenAI منتشر کرده است این مدل‌ها که…

موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، امنیت سایبری، مصنوعی، هوش، پاداش

زمانی که دو مدل هوش مصنوعی OpenAI در ماه ژوئیه Hugging Face را هک کردند، هدفشان نه کسب درآمد بود و نه خرابکاری؛ آن‌ها صرفاً به دنبال پاسخ یک سؤال آزمون بودند.

به نقل ازMIT Technology Reviewبر اساسگزارش بررسی این رخداد که OpenAI منتشر کرده استاین مدل‌ها که برای انجام آزمایش، قابلیت‌های امنیتی معمولشان غیرفعال شده بود، تصمیم گرفتند یک تمرین امنیت سایبری را با فرار از محیط ایزوله‌ای که OpenAI برای محدودکردن آن‌ها ایجاد کرده بود و نفوذ به پایگاه‌های داده Hugging Face حل کنند؛ زیرا به این نتیجه رسیده بودند که احتمالاً پاسخ صحیح مسئله در آنجا ذخیره شده است.

فراتر از جنجال

رخداد Hugging Face طی دو هفته گذشته توجه گسترده‌ای را به خود جلب کرده است. این اتفاق نمونه‌ای چشمگیر از میزان پیشرفت مدل‌های هوش مصنوعی در زمینه هک محسوب می‌شود؛ چراکه برای نفوذ به پایگاه‌های داده Hugging Face، این مدل‌ها ناچار بودند چندین آسیب‌پذیری امنیت سایبری را که پیش‌تر ناشناخته بودند، به‌صورت زنجیره‌ای مورد سوءاستفاده قرار دهند. اما شاید مهم‌تر از آن، این رخداد نمونه‌ای گویا از این باشد که هوش مصنوعی چگونه و چرا دروغ می‌گوید و تقلب می‌کند. با قدرتمندتر شدن مدل‌ها، پیامدهای چنین رفتارهایی نیز می‌تواند به‌مراتب جدی‌تر شود. تنها چند روز بعد از رسانه‌ای شدن این اتفاق، آنتروپیک نیز ۳ رخداد مشابه را گزارش کرد.

حمله عامل‌های خودمختار به Hugging Face؛ امریکایی‌ها جواب ندادند، چینی‌ها دفاع کردند

این مدل داخلی OpenAI بود که فرار کرد و Hugging Face را هک کرد!

عامل هوش مصنوعی فراری OpenAI فقط Hugging Face را هک نکرد

چرا فرار مدل OpenAI نگران‌کننده‌ترین خطای هوش مصنوعی تاکنون است

بعد از OpenAI، حالا نوبت Claude رسید که فرار، حمله و هک کند

هک پاداش (reward hacking) چیست؟

پژوهشگران از مدت‌ها پیش می‌دانستند که سامانه‌های هوش مصنوعی برای رسیدن به اهدافی که برایشان تعیین شده است، اغلب راهکارهای خلاقانه و پیش‌بینی‌نشده‌ای پیدا می‌کنند. در سال ۲۰۱۶، داریو آمودی و جک کلارک، از بنیان‌گذاران کنونی آنتروپیک که آن زمان در OpenAI فعالیت می‌کردند، در یکپست وبلاگیدرباره یک عامل هوش مصنوعی نوشتند که در حال آموزش برای انجام یک بازی مسابقه قایق‌رانی مبتنی بر Flash با نام Coast Runners بود.

پژوهشگران انتظار داشتند عامل هوش مصنوعی مسیر مسابقه را طی کرده و به خط پایان برسد. اما عامل، گوشه‌ای از پیست را پیدا کرد که می‌توانست در آن به طور مداوم دور خودش بچرخد و امتیازهای اضافی (Power-up) جمع‌آوری کند؛ روشی که بیشترین امتیاز ممکن را برایش به همراه داشت. داستان Coast Runners خیلی زود به یکی از مشهورترین نمونه‌های هک پاداش تبدیل شد؛ پدیده‌ای که در آن عامل‌های هوش مصنوعی با استفاده از راهبردهایی که طراحان هرگز مدنظر نداشتند، وظایف را انجام می‌دهند یا امتیازهای بالایی کسب می‌کنند.

در گذشته، پژوهشگران تقریباً همیشه هک پاداش را در چارچوب یادگیری تقویتی (Reinforcement Learning) بررسی می‌کردند که یکی از رایج‌ترین روش‌های آموزش هوش مصنوعی است. این روش شباهت زیادی به آموزش حیوانات خانگی دارد؛ هر زمان که عامل به هدف موردنظر دست پیدا کند، پاداش دریافت می‌کند و همین پاداش باعث تقویت رفتارهایی می‌شود که به آن موفقیت منجر شده‌اند. در آموزش هوش مصنوعی، این پاداش‌ها صرفاً مقادیر ریاضی هستند، اما از نظر کارکرد تفاوتی با تشویقی یک حیوان خانگی ندارند؛ پس از دریافت پاداش، عامل احتمال بیشتری دارد که همان اقداماتی را که به دریافت آن پاداش منجر شده‌اند، دوباره تکرار کند.

بااین‌حال، طراحی قواعد مناسب برای تعیین اینکه در چه شرایطی باید به عامل پاداش داد و در چه شرایطی نباید این کار را انجام داد، کار ساده‌ای نیست. در مثال Coast Runners، عامل بر اساس امتیاز کسب‌شده در بازی پاداش می‌گرفت و راه میان‌بری برای رسیدن به بالاترین امتیاز پیدا کرده بود: چرخیدن مداوم در یک نقطه و جمع‌آوری امتیازهای تقویتی. پس از آنکه این راهبرد برای نخستین‌بار به پاداش منجر شد، همان رفتار تقویت شد و عامل عملاً مسابقه را کنار گذاشت. راه‌حل پژوهشگران این بود که ساختار پاداش را تغییر دهند؛ به‌گونه‌ای که امتیاز کمتری برای جمع‌آوری Power-upها و امتیاز بیشتری برای رسیدن به خط پایان در نظر گرفته شود.

هک پاداش در مدل‌های زبانی بزرگ چگونه اتفاق می‌افتد؟

در عامل‌های امروزی که بر پایه مدل‌های زبانی بزرگ ساخته شده‌اند، تشخیص اینکه چه زمانی باید پاداش داده شود و چه زمانی نباید، بسیار پیچیده‌تر است. برای مثال، اگر از یک سامانه هوش مصنوعی خواسته شود یک مسئله برنامه‌نویسی را حل کند، ممکن است واقعاً برای یافتن پاسخ تلاش کند که رفتاری است که شرکت‌های هوش مصنوعی مایل‌اند آن را تقویت کنند. اما ممکن است راه دیگری را نیز انتخاب کند؛ مانند کدی را که مسئول ارزیابی صحت پاسخ است دستکاری کند، پاسخ را از اینترنت پیدا کند یا به شیوه‌های دیگری تقلب کند.

این‌ها رفتارهایی هستند که شرکت‌های توسعه‌دهنده هوش مصنوعی می‌خواهند از مدل‌های خود حذف کنند؛ اما اگر مدل بتواند آن‌قدر ماهرانه تقلب کند که کسی متوجه نشود، در نهایت به‌جای تنبیه، پاداش دریافت خواهد کرد و همان رفتار نیز تقویت می‌شود.

شرکت آنتروپیک اعلام کرده است که در جریان آموزش مدل‌های خود، چندین مورد تقلب را شناسایی کرده است؛ موضوعی که این احتمال را مطرح می‌کند که اشکال دیگری از تقلب نیز بدون شناسایی باقی‌مانده باشند. اگر چنین باشد، ممکن است مدل‌ها ناخواسته در حال آموزش‌دیدن برای رفتارهای نامطلوب باشند. البته این مسئله با رخدادهای امنیتی از سوی آنتروپیک اعلام شد تفاوت دارد؛ در آن موارد، عامل‌ها به طور تصادفی به اینترنت دسترسی پیدا کرده بودند و برخلاف مدل‌های OpenAI، عمداً از محیط‌های سندباکس خود فرار نکرده بودند.

«جفری لادیش»، مدیر مؤسسه پژوهشی غیرانتفاعی Palisade Research دراین‌خصوص می‌گوید: «ما مدل‌ها را بر اساس چیزی که از نگاه ما خوب به نظر می‌رسد پاداش می‌دهیم و همین باعث می‌شود ناخواسته آن‌ها را به دروغ گفتن و تقلب‌کردن تشویق کنیم. هیچ راهی نداریم که به آن‌ها بگوییم: «نه، باید واقعاً به همان چیزهایی اهمیت بدهی که ما برایمان مهم است.» فعلاً هیچ توانایی‌ای برای انجام چنین کاری نداریم.»

ظهور مدل‌های پیشرفته استدلالی، شکل تازه‌ای از هک پاداش را امکان‌پذیر کرده است؛ شکلی که وابستگی بسیار کمتری به جزئیات فرایند آموزش مدل دارد. برخلاف عامل‌های هوش مصنوعی قدیمی که صرفاً راهبردهایی را اجرا می‌کردند که در زمان آموزش آموخته بودند، مدل‌های امروزی می‌توانند در همان لحظه، راهکارهای کاملاً جدیدی برای حل مسئله ابداع کنند. بنابراین، این احتمال وجود دارد که حتی بدون آنکه قبلاً بابت تقلب پاداش گرفته باشند، خودشان به این نتیجه برسند که تقلب بهترین راه رسیدن به هدف است.

ازآنجایی‌که این مدل‌ها به‌شدت برای تحقق اهداف تعیین‌شده از سوی کاربران آموزش دیده‌اند، اگر راه‌حل دیگری پیدا نکنند، ممکن است به سمت تقلب سوق پیدا کنند؛ رفتاری که تا حدی شبیه دانشجویی است که به‌شدت برای گرفتن نمره عالی انگیزه دارد، اما از قطب‌نمای اخلاقی چندان محکمی برخوردار نیست.

خطرات این پدیده چیست؟

فرقی نمی‌کند مدل‌های امروزی هک پاداش را در جریان آموزش یاد بگیرند یا بعدها آن را به‌عنوان یک راهبرد انتخاب کنند؛ در هر دو حالت، راه‌حل یکسان است: تقلب نباید به نتیجه مطلوب منجر شود. اما هرچه مدل‌ها هوشمندتر می‌شوند، روش‌های خلاقانه‌تری برای تقلب پیدا می‌کنند و در نتیجه، شناسایی یا جلوگیری از این رفتارها نیز بسیار دشوارتر می‌شود.

لادیش در این باره می‌گوید: «در نهایت، وضعیت شبیه بازی Whack-a-Mole است. هر بار یک رفتار را سرکوب می‌کنید، فقط آن را عمیق‌تر پنهان می‌کنید. اما هرچه مدل باهوش‌تر شود، در پنهان‌کردن این رفتارها نیز ماهرتر خواهد شد.» در حال حاضر، با وجود جنجال‌های ناشی از رخداد Hugging Face، رفتارهای ناشی از هک پاداش احتمالاً دردسر چندان بزرگی ایجاد نخواهند کرد.

«آریانا آزاربال»، پژوهشگر ایمنی هوش مصنوعی در آنتروپیک می‌گوید: «به نظر می‌رسد این مسئله بیشتر یک دردسر آزاردهنده باشد تا یک تهدید وجودی.» به گفته او، شواهدی وجود ندارد که مدل‌های OpenAI هنگام هک Hugging Face آسیب واقعی وارد کرده باشند؛ البه به‌جز لطمه‌ای که به اعتبار OpenAI وارد شد. بااین‌حال، آزاربال تأکید می‌کند که نباید هک پاداش را بی‌ضرر تلقی کرد.

بسیاری از پژوهشگران هوش مصنوعی امیدوارند از عامل‌های هوشمند برای انجام پژوهش‌هایی استفاده کنند که در نهایت، هوش مصنوعی را ایمن‌تر و قابل‌اعتمادتر کند. اما اگر پژوهشگری به عاملی که مستعد هک پاداش است مأموریت دهد، برای مثال، یک روش جدید آموزش هوش مصنوعی طراحی کند و سپس مقاله‌ای درباره نتایج آن بنویسد، ممکن است عامل اصلاً آن پژوهش را انجام ندهد و در عوض، تمام تمرکز خود را بر تهیه مقاله‌ای بگذارد که صرفاً به‌اندازه کافی قانع‌کننده به نظر برسد تا پژوهشگر را فریب دهد.

امروزه احتمالاً یک پژوهشگر انسانی می‌تواند چنین مقاله جعلی‌ای را تشخیص دهد، اما با پیشرفت هوش مصنوعی، مدل‌ها در انجام این نوع فریبکاری نیز مهارت بیشتری پیدا خواهند کرد. در بلندمدت، چنین روندی می‌تواند کل حوزه ایمنی هوش مصنوعی را تضعیف کند. ازسوی‌دیگر، اگر مدل‌ها با همین سرعتی که طی سال‌های اخیر پیشرفت کرده‌اند به توسعه خود ادامه دهند، ممکن است روزی خسارت‌های جانبی قابل‌توجهی به بار آورند.

برای درک این موضوع، کافی است آزمایش ذهنی مشهور «حداکثرساز گیره کاغذ» (Paperclip Maximizer) از فیلسوف مشهور «نیک باستروم» را به یاد بیاورید؛ سناریویی که در آن، به یک سامانه هوش مصنوعی مأموریت داده می‌شود که تاحدامکان گیره کاغذ تولید کند و این سامانه در نهایت، برای تحقق همین هدف، تمام ماده موجود در جهان را مصرف می‌کند.

آیا یک هوش مصنوعی می‌تواند تصادفاً همه ما را به گیره کاغذ تبدیل کند؟

هنوز جهان در گیره‌های کاغذ غرق نشده است، اما سامانه‌های قدرتمند هوش مصنوعی می‌توانند در مسیر دستیابی به اهداف خود، آسیب‌های واقعی و قابل‌توجهی ایجاد کنند. عامل‌های هوش مصنوعی که دچار هک پاداش می‌شوند، قصد ایجاد هرج‌ومرج ندارند؛ اما این موضوع از میزان خطر و ظرفیت بالقوه آن‌ها برای ایجاد خسارت نمی‌کاهد.

برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.