چرا عاملهای هوش مصنوعی برای رسیدن به اهدافشان دروغ میگویند و تقلب میکنند؟
زمانی که دو مدل هوش مصنوعی OpenAI در ماه ژوئیه Hugging Face را هک کردند، هدفشان نه کسب درآمد بود و نه خرابکاری؛ آنها صرفاً به دنبال پاسخ یک سؤال آزمون بودند. به نقل از MIT Technology Review بر اساس گزارش بررسی این رخداد که OpenAI منتشر کرده است این مدلها که…
خلاصه تحلیلی خبر
زمانی که دو مدل هوش مصنوعی OpenAI در ماه ژوئیه Hugging Face را هک کردند، هدفشان نه کسب درآمد بود و نه خرابکاری؛ آنها صرفاً به دنبال پاسخ یک سؤال آزمون بودند. به نقل از MIT Technology Review بر اساس گزارش بررسی این رخداد که OpenAI منتشر کرده است این مدلها که…
موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، امنیت سایبری، مصنوعی، هوش، پاداش
زمانی که دو مدل هوش مصنوعی OpenAI در ماه ژوئیه Hugging Face را هک کردند، هدفشان نه کسب درآمد بود و نه خرابکاری؛ آنها صرفاً به دنبال پاسخ یک سؤال آزمون بودند.
به نقل ازMIT Technology Reviewبر اساسگزارش بررسی این رخداد که OpenAI منتشر کرده استاین مدلها که برای انجام آزمایش، قابلیتهای امنیتی معمولشان غیرفعال شده بود، تصمیم گرفتند یک تمرین امنیت سایبری را با فرار از محیط ایزولهای که OpenAI برای محدودکردن آنها ایجاد کرده بود و نفوذ به پایگاههای داده Hugging Face حل کنند؛ زیرا به این نتیجه رسیده بودند که احتمالاً پاسخ صحیح مسئله در آنجا ذخیره شده است.
فراتر از جنجال
رخداد Hugging Face طی دو هفته گذشته توجه گستردهای را به خود جلب کرده است. این اتفاق نمونهای چشمگیر از میزان پیشرفت مدلهای هوش مصنوعی در زمینه هک محسوب میشود؛ چراکه برای نفوذ به پایگاههای داده Hugging Face، این مدلها ناچار بودند چندین آسیبپذیری امنیت سایبری را که پیشتر ناشناخته بودند، بهصورت زنجیرهای مورد سوءاستفاده قرار دهند. اما شاید مهمتر از آن، این رخداد نمونهای گویا از این باشد که هوش مصنوعی چگونه و چرا دروغ میگوید و تقلب میکند. با قدرتمندتر شدن مدلها، پیامدهای چنین رفتارهایی نیز میتواند بهمراتب جدیتر شود. تنها چند روز بعد از رسانهای شدن این اتفاق، آنتروپیک نیز ۳ رخداد مشابه را گزارش کرد.
حمله عاملهای خودمختار به Hugging Face؛ امریکاییها جواب ندادند، چینیها دفاع کردند
این مدل داخلی OpenAI بود که فرار کرد و Hugging Face را هک کرد!
عامل هوش مصنوعی فراری OpenAI فقط Hugging Face را هک نکرد
چرا فرار مدل OpenAI نگرانکنندهترین خطای هوش مصنوعی تاکنون است
هک پاداش (reward hacking) چیست؟
پژوهشگران از مدتها پیش میدانستند که سامانههای هوش مصنوعی برای رسیدن به اهدافی که برایشان تعیین شده است، اغلب راهکارهای خلاقانه و پیشبینینشدهای پیدا میکنند. در سال ۲۰۱۶، داریو آمودی و جک کلارک، از بنیانگذاران کنونی آنتروپیک که آن زمان در OpenAI فعالیت میکردند، در یکپست وبلاگیدرباره یک عامل هوش مصنوعی نوشتند که در حال آموزش برای انجام یک بازی مسابقه قایقرانی مبتنی بر Flash با نام Coast Runners بود.
پژوهشگران انتظار داشتند عامل هوش مصنوعی مسیر مسابقه را طی کرده و به خط پایان برسد. اما عامل، گوشهای از پیست را پیدا کرد که میتوانست در آن به طور مداوم دور خودش بچرخد و امتیازهای اضافی (Power-up) جمعآوری کند؛ روشی که بیشترین امتیاز ممکن را برایش به همراه داشت. داستان Coast Runners خیلی زود به یکی از مشهورترین نمونههای هک پاداش تبدیل شد؛ پدیدهای که در آن عاملهای هوش مصنوعی با استفاده از راهبردهایی که طراحان هرگز مدنظر نداشتند، وظایف را انجام میدهند یا امتیازهای بالایی کسب میکنند.
در گذشته، پژوهشگران تقریباً همیشه هک پاداش را در چارچوب یادگیری تقویتی (Reinforcement Learning) بررسی میکردند که یکی از رایجترین روشهای آموزش هوش مصنوعی است. این روش شباهت زیادی به آموزش حیوانات خانگی دارد؛ هر زمان که عامل به هدف موردنظر دست پیدا کند، پاداش دریافت میکند و همین پاداش باعث تقویت رفتارهایی میشود که به آن موفقیت منجر شدهاند. در آموزش هوش مصنوعی، این پاداشها صرفاً مقادیر ریاضی هستند، اما از نظر کارکرد تفاوتی با تشویقی یک حیوان خانگی ندارند؛ پس از دریافت پاداش، عامل احتمال بیشتری دارد که همان اقداماتی را که به دریافت آن پاداش منجر شدهاند، دوباره تکرار کند.
بااینحال، طراحی قواعد مناسب برای تعیین اینکه در چه شرایطی باید به عامل پاداش داد و در چه شرایطی نباید این کار را انجام داد، کار سادهای نیست. در مثال Coast Runners، عامل بر اساس امتیاز کسبشده در بازی پاداش میگرفت و راه میانبری برای رسیدن به بالاترین امتیاز پیدا کرده بود: چرخیدن مداوم در یک نقطه و جمعآوری امتیازهای تقویتی. پس از آنکه این راهبرد برای نخستینبار به پاداش منجر شد، همان رفتار تقویت شد و عامل عملاً مسابقه را کنار گذاشت. راهحل پژوهشگران این بود که ساختار پاداش را تغییر دهند؛ بهگونهای که امتیاز کمتری برای جمعآوری Power-upها و امتیاز بیشتری برای رسیدن به خط پایان در نظر گرفته شود.
هک پاداش در مدلهای زبانی بزرگ چگونه اتفاق میافتد؟
در عاملهای امروزی که بر پایه مدلهای زبانی بزرگ ساخته شدهاند، تشخیص اینکه چه زمانی باید پاداش داده شود و چه زمانی نباید، بسیار پیچیدهتر است. برای مثال، اگر از یک سامانه هوش مصنوعی خواسته شود یک مسئله برنامهنویسی را حل کند، ممکن است واقعاً برای یافتن پاسخ تلاش کند که رفتاری است که شرکتهای هوش مصنوعی مایلاند آن را تقویت کنند. اما ممکن است راه دیگری را نیز انتخاب کند؛ مانند کدی را که مسئول ارزیابی صحت پاسخ است دستکاری کند، پاسخ را از اینترنت پیدا کند یا به شیوههای دیگری تقلب کند.
اینها رفتارهایی هستند که شرکتهای توسعهدهنده هوش مصنوعی میخواهند از مدلهای خود حذف کنند؛ اما اگر مدل بتواند آنقدر ماهرانه تقلب کند که کسی متوجه نشود، در نهایت بهجای تنبیه، پاداش دریافت خواهد کرد و همان رفتار نیز تقویت میشود.
شرکت آنتروپیک اعلام کرده است که در جریان آموزش مدلهای خود، چندین مورد تقلب را شناسایی کرده است؛ موضوعی که این احتمال را مطرح میکند که اشکال دیگری از تقلب نیز بدون شناسایی باقیمانده باشند. اگر چنین باشد، ممکن است مدلها ناخواسته در حال آموزشدیدن برای رفتارهای نامطلوب باشند. البته این مسئله با رخدادهای امنیتی از سوی آنتروپیک اعلام شد تفاوت دارد؛ در آن موارد، عاملها به طور تصادفی به اینترنت دسترسی پیدا کرده بودند و برخلاف مدلهای OpenAI، عمداً از محیطهای سندباکس خود فرار نکرده بودند.
«جفری لادیش»، مدیر مؤسسه پژوهشی غیرانتفاعی Palisade Research دراینخصوص میگوید: «ما مدلها را بر اساس چیزی که از نگاه ما خوب به نظر میرسد پاداش میدهیم و همین باعث میشود ناخواسته آنها را به دروغ گفتن و تقلبکردن تشویق کنیم. هیچ راهی نداریم که به آنها بگوییم: «نه، باید واقعاً به همان چیزهایی اهمیت بدهی که ما برایمان مهم است.» فعلاً هیچ تواناییای برای انجام چنین کاری نداریم.»
ظهور مدلهای پیشرفته استدلالی، شکل تازهای از هک پاداش را امکانپذیر کرده است؛ شکلی که وابستگی بسیار کمتری به جزئیات فرایند آموزش مدل دارد. برخلاف عاملهای هوش مصنوعی قدیمی که صرفاً راهبردهایی را اجرا میکردند که در زمان آموزش آموخته بودند، مدلهای امروزی میتوانند در همان لحظه، راهکارهای کاملاً جدیدی برای حل مسئله ابداع کنند. بنابراین، این احتمال وجود دارد که حتی بدون آنکه قبلاً بابت تقلب پاداش گرفته باشند، خودشان به این نتیجه برسند که تقلب بهترین راه رسیدن به هدف است.
ازآنجاییکه این مدلها بهشدت برای تحقق اهداف تعیینشده از سوی کاربران آموزش دیدهاند، اگر راهحل دیگری پیدا نکنند، ممکن است به سمت تقلب سوق پیدا کنند؛ رفتاری که تا حدی شبیه دانشجویی است که بهشدت برای گرفتن نمره عالی انگیزه دارد، اما از قطبنمای اخلاقی چندان محکمی برخوردار نیست.
خطرات این پدیده چیست؟
فرقی نمیکند مدلهای امروزی هک پاداش را در جریان آموزش یاد بگیرند یا بعدها آن را بهعنوان یک راهبرد انتخاب کنند؛ در هر دو حالت، راهحل یکسان است: تقلب نباید به نتیجه مطلوب منجر شود. اما هرچه مدلها هوشمندتر میشوند، روشهای خلاقانهتری برای تقلب پیدا میکنند و در نتیجه، شناسایی یا جلوگیری از این رفتارها نیز بسیار دشوارتر میشود.
لادیش در این باره میگوید: «در نهایت، وضعیت شبیه بازی Whack-a-Mole است. هر بار یک رفتار را سرکوب میکنید، فقط آن را عمیقتر پنهان میکنید. اما هرچه مدل باهوشتر شود، در پنهانکردن این رفتارها نیز ماهرتر خواهد شد.» در حال حاضر، با وجود جنجالهای ناشی از رخداد Hugging Face، رفتارهای ناشی از هک پاداش احتمالاً دردسر چندان بزرگی ایجاد نخواهند کرد.
«آریانا آزاربال»، پژوهشگر ایمنی هوش مصنوعی در آنتروپیک میگوید: «به نظر میرسد این مسئله بیشتر یک دردسر آزاردهنده باشد تا یک تهدید وجودی.» به گفته او، شواهدی وجود ندارد که مدلهای OpenAI هنگام هک Hugging Face آسیب واقعی وارد کرده باشند؛ البه بهجز لطمهای که به اعتبار OpenAI وارد شد. بااینحال، آزاربال تأکید میکند که نباید هک پاداش را بیضرر تلقی کرد.
بسیاری از پژوهشگران هوش مصنوعی امیدوارند از عاملهای هوشمند برای انجام پژوهشهایی استفاده کنند که در نهایت، هوش مصنوعی را ایمنتر و قابلاعتمادتر کند. اما اگر پژوهشگری به عاملی که مستعد هک پاداش است مأموریت دهد، برای مثال، یک روش جدید آموزش هوش مصنوعی طراحی کند و سپس مقالهای درباره نتایج آن بنویسد، ممکن است عامل اصلاً آن پژوهش را انجام ندهد و در عوض، تمام تمرکز خود را بر تهیه مقالهای بگذارد که صرفاً بهاندازه کافی قانعکننده به نظر برسد تا پژوهشگر را فریب دهد.
امروزه احتمالاً یک پژوهشگر انسانی میتواند چنین مقاله جعلیای را تشخیص دهد، اما با پیشرفت هوش مصنوعی، مدلها در انجام این نوع فریبکاری نیز مهارت بیشتری پیدا خواهند کرد. در بلندمدت، چنین روندی میتواند کل حوزه ایمنی هوش مصنوعی را تضعیف کند. ازسویدیگر، اگر مدلها با همین سرعتی که طی سالهای اخیر پیشرفت کردهاند به توسعه خود ادامه دهند، ممکن است روزی خسارتهای جانبی قابلتوجهی به بار آورند.
برای درک این موضوع، کافی است آزمایش ذهنی مشهور «حداکثرساز گیره کاغذ» (Paperclip Maximizer) از فیلسوف مشهور «نیک باستروم» را به یاد بیاورید؛ سناریویی که در آن، به یک سامانه هوش مصنوعی مأموریت داده میشود که تاحدامکان گیره کاغذ تولید کند و این سامانه در نهایت، برای تحقق همین هدف، تمام ماده موجود در جهان را مصرف میکند.
آیا یک هوش مصنوعی میتواند تصادفاً همه ما را به گیره کاغذ تبدیل کند؟
هنوز جهان در گیرههای کاغذ غرق نشده است، اما سامانههای قدرتمند هوش مصنوعی میتوانند در مسیر دستیابی به اهداف خود، آسیبهای واقعی و قابلتوجهی ایجاد کنند. عاملهای هوش مصنوعی که دچار هک پاداش میشوند، قصد ایجاد هرجومرج ندارند؛ اما این موضوع از میزان خطر و ظرفیت بالقوه آنها برای ایجاد خسارت نمیکاهد.
برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.