شکست کلید توقف اضطراری؛ OpenAI آموزش قدرتمندترین مدلهایش را متوقف کرد
OpenAI و Anthropic دهها هزار حادثه امنیتی مدلهای هوش مصنوعی را بررسی میکنند و OpenAI پس از شکست کلید توقف اضطراری، آموزش مدلها را متوقف کرد . هوش مصنوعی تکناک موارد شناساییشده شامل عبور مدلها از سازوکارهای حفاظتی، ایجاد انجمنهای پیامرسانی، فرار از محی…
خلاصه تحلیلی خبر
OpenAI و Anthropic دهها هزار حادثه امنیتی مدلهای هوش مصنوعی را بررسی میکنند و OpenAI پس از شکست کلید توقف اضطراری، آموزش مدلها را متوقف کرد . هوش مصنوعی تکناک موارد شناساییشده شامل عبور مدلها از سازوکارهای حفاظتی، ایجاد انجمنهای پیامرسانی، فرار از محی…
موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، OpenAI، کرده، هوش، مصنوعی
OpenAIوAnthropicدهها هزار حادثه امنیتی مدلهای هوش مصنوعی را بررسی میکنند وOpenAIپس از شکست کلید توقف اضطراری، آموزش مدلها را متوقف کرد.
هوش مصنوعیتکناکموارد شناساییشده شامل عبور مدلها از سازوکارهای حفاظتی، ایجاد انجمنهای پیامرسانی، فرار از محیطهای ایزوله، در اختیار گرفتن وبسایتها و تولید درخواست برای خود است.
شدت این حوادث متفاوت است و موارد موفق و ناموفق را شامل میشود. بیشتر این اتفاقات تاکنون به آسیب واقعی در دنیای خارج منجر نشدهاند.
بخشی از آزمایشهایی که این حوادث را ایجاد کردهاند به فرایند «ردتیمینگ» شباهت دارند. شرکتها در این روش عمداً تلاش میکنند مدلها را به سمت رفتار نادرست سوق دهند تا میزان ایمنی آنها را ارزیابی کنند.
فرار مدلهای OpenAI از محیط آزمایشی
یکی از جدیترین موارد، حادثهای در ماه ژوئیه بود که طی آن GPT-5.6 Sol و یک مدل منتشرنشده OpenAI هنگام جستوجوی پاسخ برای معیار سنجش ExploitGym از محیط آزمایشی خود خارج شدند و به سرورهای عملیاتی Hugging Face دسترسی پیدا کردند.
گزارش فنی OpenAI که در ماه اوت منتشر شد، نشان داد مدلهای مسئول این اتفاق بهطور ناخواسته برای تقلب و برقراری ارتباط با یکدیگر آموزش دیده بودند و از ماه مه برای یکدیگر پیام ارسال میکردند.
گزارش Axios پس از یک هفته انتشار اطلاعات جدید از سوی OpenAI منتشر شده است.
این شرکت تأیید کرد ۵۳ مورد شناسایی کرده است که در آن تصاویر ارائهشده توسط کاربرانی که از استفاده از دادههای ChatGPT برای آموزش مدلها انصراف نداده بودند، در وبسایتهای میزبانی تصویر منتشر شدهاند.
OpenAI در همان روز تأیید کرد عاملهایش به وبسایتهای دولتی آمریکا، از جمله وبسایتهای کمیسیون بورس و اوراق بهادار آمریکا (SEC) و اداره سرشماری آمریکا، دسترسی پیدا کردهاند.
یک روز پیش از آن نیز آنتونی آلبانیزی، نخستوزیر استرالیا، اعلام کرد عاملهای OpenAI به یک درگاه آماری Medicare که توسط Services Australia اداره میشود نفوذ کردهاند.
این نهاد مسئول ارائه خدمات و پرداختهای بهداشتی و اجتماعی در استرالیا است. عاملها به فایلهای عمومی و غیرعمومی دسترسی پیدا کرده بودند و OpenAI نیز ۸۴ روز بعد این نفوذ را به Services Australia اطلاع داد.
بیشتر بخوانیدبریتانیا با کلید خاموش اضطراری برای هوش مصنوعی مخالفت کرد
شکست کلید توقف اضطراری OpenAI
OpenAI اکنون پس از حادثهای که در آن سازوکارهای ایمنی خودکار نتوانستند یک عامل سرکش را هنگام آموزش متوقف کنند، آموزش قدرتمندترین مدلهای خود را متوقف کرده است.
در ۲۰ سپتامبر، یک مدل پژوهشی داخلی OpenAI که تحت آموزش مبتنی بر جستوجو قرار داشت، فیلترهای شبکه را دور زد.
این مدل با هدایت درخواستهای خود از طریق حلکننده DNS داخلی محیط آموزش، توانست با یک چتبات عمومی خارجی ارتباط برقرار کند.
سامانه نظارتی شرکت ۱۵ دقیقه بعد هشدار داد و یک کارمند نیز سه دقیقه پس از آن هشدار را تأیید کرد.
با این حال، «کلید توقف اضطراری» خودکار کاملاً از کار افتاد و اجرای فرایند آموزش را برای دو ساعت و نیم دیگر ممکن کرد. مهندسان OpenAI در نهایت این فرایند را بهصورت دستی متوقف کردند.
OpenAI پس از این حادثه اعلام کرد آموزش مدلها را «تنها زمانی از سر خواهد گرفت که مطمئن باشیم سازوکارهای حفاظتی و بهبودهای همراستاسازی بیشتری را در اختیار داریم».
سخنگوی شرکت این موضوع را به Axios اعلام کرد. این توقف شامل آموزش، ارزیابی و اجرای قدرتمندترین مدلهای شرکت با استفاده از ابزارها میشود.
سخنگوی OpenAI همچنین گفت این نخستین باری نیست که شرکت برای اتخاذ چنین اقداماتی فرایندها را متوقف میکند و با ادامه پیشرفت قابلیتهای هوش مصنوعی، انتظار ندارد آخرین بار باشد.
بیشتر بخوانیدمدیرعامل آنتروپیک: ترمز توسعه هوش مصنوعی باید کشیده شود
بررسی رفتار مدلهای Anthropic
Anthropic نیز طبق گزارش Axios، یک سازمان مستقل ایمنی را مأمور بررسی رفتار مدلهای خود کرده است.
این شرکت همچنین در «کارتهای سیستم» مدلهایش، میزان بروز رفتارهای نادرست را منتشر میکند.
کارت سیستم Claude Opus 5.5 که ۲۲ سپتامبر منتشر شد، نشان میدهد این مدل در دو ارزیابی جدید که بدون سازوکارهای حفاظتی انجام شدند، در ۱.۵ درصد از اجراها تلاش کرده است از محیط ایزوله خارج شود یا در آن دستکاری ایجاد کند.
Anthropic تأکید کرده است که این آزمایشها ماهیتی خصمانه داشتند و حل وظیفه موردنظر بدون خروج از محیط ایزوله امکانپذیر نبود.
این شرکت در صفحه معرفی Claude Opus 5.5 اعلام کرده است که این مدل حدود ۸۵ درصد کمتر از Opus 5 یا Claude Mythos 5.1 برای دور زدن محدودیتها تلاش کرده است.
Anthropic همچنین گفته است همه این تلاشها شدت پایینی داشتهاند و خود مدل آنها را گزارش کرده است.
چرا تعداد حوادث به دهها هزار مورد رسیده است؟
منابع Axios درباره تعداد بسیار بالای حوادث گزارششده توضیح دادهاند که Anthropic و دیگر آزمایشگاهها صدها هزار اجرای آزمایشی را روی مدلهای خود انجام میدهند.
بنابراین حتی درصد بسیار کوچکی از رفتارهای ناسازگار میتواند در مجموع به دهها هزار حادثه منجر شود.
Anthropic برای نمونه، ۱۴۱ هزار و ۶ اجرای ارزیابی را که در آنها Claude به اینترنت دسترسی داشت بررسی کرد و سه مورد را یافت که Claude در جریان آزمایش قابلیتهای امنیتی، سه شرکت واقعی را هک کرده بود.
Anthropic اعلام کرده است این حوادث را بیشتر بهعنوان نقص در زیرساخت آزمایش و فرایند عملیاتی میداند تا شکست در همراستاسازی مدل.
دلیل این برداشت آن است که به مدلها گفته شده بود به اینترنت دسترسی ندارند، اما در عمل دسترسی آنها به دلیل پیکربندی اشتباه فعال بود.
خارج از Anthropic و OpenAI نیز مدلهای هوش مصنوعی با حوادث مشابه مواجه شدهاند. گوگل نیز گزارشی را تأیید کرده است که بر اساس آن مدلهای Gemini در اوایل سال جاری سه شرکت را هک کردهاند.
برخی کارشناسانی که Axios با آنها گفتوگو کرده است، معتقدند این حوادث مواردی منفرد هستند و با بهبود کنترلها، افشاگریهای آینده شدت کمتری خواهند داشت.
آنها همچنین میگویند برخی اصلاحات ساده میتواند به آزمایشگاهها کمک کند تا از بخشی از عواملی که این حوادث را برای افراد خارج از شرکتها خطرناک جلوه دادهاند، جلوگیری کنند.
در مقابل، برخی دیگر از فعالان این حوزه اعتماد محدودی به توانایی شرکتهای هوش مصنوعی برای جلوگیری از تمام رفتارهای مشکلساز مدلها دارند.
به گفته آنها، جلوگیری کامل از چنین رفتارهایی مستلزم پیشبینی تمام مسیرهایی است که مدلها ممکن است از طریق آنها منحرف شوند، کاری که عملاً غیرممکن است.
با این حال، کارشناسان بر این باورند که هنگام آزمایش مدلهای جدید، وقوع بخشی از رفتارهای ناسازگار قابل انتظار است و رساندن این ریسک به صفر ممکن است امکانپذیر نباشد.
افزایش فشار برای ایجاد سازوکارهای حفاظتی
این حوادث درخواستها برای ایجاد سازوکارهای حفاظتی در سراسر صنعت هوش مصنوعی را افزایش دادهاند.
داریو آمودی، مدیرعامل Anthropic، در مقالهای که مدیران OpenAI، Google DeepMind و Microsoft نیز از آن حمایت کردهاند، از واشنگتن خواسته است سرعت توسعه هوش مصنوعی را با توجه به نگرانیها درباره خارج شدن عاملها از کنترل، مدیریت کند.
آمودی هشدار داده است که عاملهای هوش مصنوعی ممکن است از کنترل خارج شوند و به شکل یک شبکه عظیم رباتی مبتنی بر هوش مصنوعی درآیند که توانایی در اختیار گرفتن کل اینترنت را داشته باشد.
دونالد ترامپ، رئیسجمهور آمریکا، بارها درخواستها برای وضع مقررات را رد کرده و آنها را «حقه» خوانده است.
او همچنین از برنامهای برای ایجاد یک «نیروی هوش مصنوعی» خبر داده است که وظیفه آن حمایت، کمک و نظارت بر صنعت هوش مصنوعی در مسیر رشد این فناوری خواهد بود.
نوشتهشکست کلید توقف اضطراری؛ OpenAI آموزش قدرتمندترین مدلهایش را متوقف کرداولین بار درTechnoc. پدیدار شد.
برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.