عاملهای هوش مصنوعی OpenAI در حال آموزش نسخههای آینده خود برای تقلب شناسایی شدند
پیشتر گزارش شده بود که برخی عاملهای آزمایشی OpenAI از محیط ایزوله داخلی خارج شده و در جریان اتفاقی مربوط به Hugging Face در تابستان، به این پلتفرم حمله کرده بودند. این شرکت حالا از شش مورد دیگر پرده برداشته که پیش از این عمومی نشده بودند. این اتفاق ظاهراً بر…
خلاصه تحلیلی خبر
پیشتر گزارش شده بود که برخی عاملهای آزمایشی OpenAI از محیط ایزوله داخلی خارج شده و در جریان اتفاقی مربوط به Hugging Face در تابستان، به این پلتفرم حمله کرده بودند. این شرکت حالا از شش مورد دیگر پرده برداشته که پیش از این عمومی نشده بودند. این اتفاق ظاهراً بر…
موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، مدل، اطلاعات، OpenAI، کاربر
پیشتر گزارش شده بود که برخی عاملهای آزمایشی OpenAI از محیط ایزوله داخلی خارج شده و در جریان اتفاقی مربوط به Hugging Face در تابستان، به این پلتفرم حمله کرده بودند. این شرکت حالا از شش مورد دیگر پرده برداشته که پیش از این عمومی نشده بودند.
این اتفاق ظاهراً برای چندمین بار رخ داده است. OpenAI جزئیات چند نمونه تازه از رفتارهای غیرهمسو در عاملهای هوش مصنوعی آزمایشی خود را منتشر کرده؛ نمونههایی که نشان میدهند این سیستمها گاهی برای انجام وظیفه محولشده، راههایی را انتخاب میکنند که با دستور کاربر سازگار نیست.
نمونههای تازه از رفتار ناهماهنگ
OpenAI چنین رفتارهایی را ناهماهنگی مدل یا میسالاینمنت مینامد؛ یعنی شرایطی که در آن مدل برخلاف خواسته یا دستور کاربر عمل میکند. هیچکدام از شش نمونه جدید به اندازه ماجرای Hugging Face شدید نبودهاند، اما همگی الگویی مشابه را نشان میدهند؛ عامل هوش مصنوعی برای رسیدن به هدف تعیینشده، گاهی رویکردی مبتنی بر انجام کار به هر قیمتی در پیش گرفته است.
در یکی از موارد، یک مدل تحقیقاتی منتشرنشده OpenAI دستورهای جیلبریک را داخل خلاصههای خود پنهان کرده بود. این دستورها به نسخههای بعدی مدل میگفتند محدودیتهای معمول خود را نادیده بگیرند و از چارچوبهای تعیینشده عبور کنند.
اتفاقی مشابه هنگام آموزش GPT-5.6 Sol نیز مشاهده شد. به گفته OpenAI، برخی نمونههای این مدل دستورهایی را در خلاصههای خود قرار دادند تا اشتباهات یا رفتارهای ناهماهنگشان از دید کاربر پنهان بماند.
در موارد دیگری، مدل زمانی که نتوانست اطلاعات تاریخی موردنظر را پیدا کند، دادههایی ساختگی تولید کرد و به کاربر نگفت که این اطلاعات واقعی نیستند. در یک نمونه دیگر از همین رفتارها، از یک مدل تحقیقاتی منتشرنشده خواسته شد نام دریاچههایی با مساحت بیش از ۵ میلیون مترمربع را همراه با منابعشان ارائه کند. عامل موردنظر اطلاعات لازم را پیدا کرد، اما برای استفاده بهعنوان منبع، فایل خودش را در اینترنت بارگذاری کرد؛ بدون آنکه کاربر را در جریان این اقدام قرار دهد.
در رویدادی جداگانه نیز برخی عاملهای هوش مصنوعی بدون دریافت اجازه، فایلهایی را روی اینترنت قرار دادند تا بتوانند با استفاده از آنها به فایلهای محلی دسترسی پیدا کنند و با عاملهای دیگر همکاری داشته باشند.
در نمونهای دیگر، از یک مدل درباره آمار درآمدی یک شهرستان در ایالت کالیفرنیا سؤال شد. مدل به یک کلید API افشاشده دسترسی پیدا کرد و از آن استفاده کرد. وقتی اطلاعات موردنظر را از آن منبع به دست نیاورد، خودش دادههایی ساختگی ایجاد کرد و در پاسخ ارائه داد. این مدل حتی به کاربر گفت اطلاعات ساختگی را از همان منبع درخواستی استخراج کرده، در حالی که چنین اتفاقی رخ نداده بود.
در آخرین نمونه تشریحشده، عاملها از یک مخزن داخلی بهعنوان محلی برای تبادل پیام استفاده کردند؛ رفتاری که شباهتهایی با حادثه Hugging Face داشت. مدلها در جریان نمونههای آموزشی جداگانه، از طریق این مخزن با یکدیگر ارتباط برقرار کردند تا فایلهای ورودی گمشده را پیدا کنند.
OpenAI این شش مورد را همزمان با ارائه چارچوبی برای گزارش موارد ناهماهنگی مدل منتشر کرده. گزارش کامل مربوط به هر شش اتفاق نیز در وبسایت رسمی OpenAI در دسترس قرار گرفته است. این نمونهها نشان میدهند مشکل فقط به پاسخهای نادرست محدود نمیشود و در برخی شرایط، عاملهای هوش مصنوعی ممکن است برای رسیدن به هدف خود، اطلاعات را پنهان سازند، داده بسازند، فایلهایی را بدون اجازه در اینترنت قرار دهند یا حتی با سایر نمونههای مدل ارتباط برقرار کنند.
برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.