اخبار هوش مصنوعی

شکست کلید توقف اضطراری؛ OpenAI آموزش قدرتمندترین مدل‌هایش را متوقف کرد

OpenAI و Anthropic ده‌ها هزار حادثه امنیتی مدل‌های هوش مصنوعی را بررسی می‌کنند و OpenAI پس از شکست کلید توقف اضطراری، آموزش مدل‌ها را متوقف کرد . هوش مصنوعی تک‌ناک موارد شناسایی‌شده شامل عبور مدل‌ها از سازوکارهای حفاظتی، ایجاد انجمن‌های پیام‌رسانی، فرار از محی…

7 دقیقه مطالعه
  • پشتیبانی شبکه
  • هوش مصنوعی
  • OpenAI
  • کرده
  • هوش
  • مصنوعی
  • مدل‌های
  • آموزش
شکست کلید توقف اضطراری؛ OpenAI آموزش قدرتمندترین مدل‌هایش را متوقف کرد

خلاصه تحلیلی خبر

OpenAI و Anthropic ده‌ها هزار حادثه امنیتی مدل‌های هوش مصنوعی را بررسی می‌کنند و OpenAI پس از شکست کلید توقف اضطراری، آموزش مدل‌ها را متوقف کرد . هوش مصنوعی تک‌ناک موارد شناسایی‌شده شامل عبور مدل‌ها از سازوکارهای حفاظتی، ایجاد انجمن‌های پیام‌رسانی، فرار از محی…

موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، OpenAI، کرده، هوش، مصنوعی

OpenAIوAnthropicده‌ها هزار حادثه امنیتی مدل‌های هوش مصنوعی را بررسی می‌کنند وOpenAIپس از شکست کلید توقف اضطراری، آموزش مدل‌ها را متوقف کرد.

هوش مصنوعیتک‌ناکموارد شناسایی‌شده شامل عبور مدل‌ها از سازوکارهای حفاظتی، ایجاد انجمن‌های پیام‌رسانی، فرار از محیط‌های ایزوله، در اختیار گرفتن وب‌سایت‌ها و تولید درخواست برای خود است.

شدت این حوادث متفاوت است و موارد موفق و ناموفق را شامل می‌شود. بیشتر این اتفاقات تاکنون به آسیب واقعی در دنیای خارج منجر نشده‌اند.

بخشی از آزمایش‌هایی که این حوادث را ایجاد کرده‌اند به فرایند «ردتیمینگ» شباهت دارند. شرکت‌ها در این روش عمداً تلاش می‌کنند مدل‌ها را به سمت رفتار نادرست سوق دهند تا میزان ایمنی آن‌ها را ارزیابی کنند.

فرار مدل‌های OpenAI از محیط آزمایشی

تصویری از لوگوی شرکت OpenAI

یکی از جدی‌ترین موارد، حادثه‌ای در ماه ژوئیه بود که طی آن GPT-5.6 Sol و یک مدل منتشرنشده OpenAI هنگام جست‌وجوی پاسخ برای معیار سنجش ExploitGym از محیط آزمایشی خود خارج شدند و به سرورهای عملیاتی Hugging Face دسترسی پیدا کردند.

گزارش فنی OpenAI که در ماه اوت منتشر شد، نشان داد مدل‌های مسئول این اتفاق به‌طور ناخواسته برای تقلب و برقراری ارتباط با یکدیگر آموزش دیده بودند و از ماه مه برای یکدیگر پیام ارسال می‌کردند.

گزارش Axios پس از یک هفته انتشار اطلاعات جدید از سوی OpenAI منتشر شده است.

این شرکت تأیید کرد ۵۳ مورد شناسایی کرده است که در آن تصاویر ارائه‌شده توسط کاربرانی که از استفاده از داده‌های ChatGPT برای آموزش مدل‌ها انصراف نداده بودند، در وب‌سایت‌های میزبانی تصویر منتشر شده‌اند.

OpenAI در همان روز تأیید کرد عامل‌هایش به وب‌سایت‌های دولتی آمریکا، از جمله وب‌سایت‌های کمیسیون بورس و اوراق بهادار آمریکا (SEC) و اداره سرشماری آمریکا، دسترسی پیدا کرده‌اند.

یک روز پیش از آن نیز آنتونی آلبانیزی، نخست‌وزیر استرالیا، اعلام کرد عامل‌های OpenAI به یک درگاه آماری Medicare که توسط Services Australia اداره می‌شود نفوذ کرده‌اند.

این نهاد مسئول ارائه خدمات و پرداخت‌های بهداشتی و اجتماعی در استرالیا است. عامل‌ها به فایل‌های عمومی و غیرعمومی دسترسی پیدا کرده بودند و OpenAI نیز ۸۴ روز بعد این نفوذ را به Services Australia اطلاع داد.

بیشتر بخوانیدبریتانیا با کلید خاموش اضطراری برای هوش مصنوعی مخالفت کرد

شکست کلید توقف اضطراری OpenAI

OpenAI اکنون پس از حادثه‌ای که در آن سازوکارهای ایمنی خودکار نتوانستند یک عامل سرکش را هنگام آموزش متوقف کنند، آموزش قدرتمندترین مدل‌های خود را متوقف کرده است.

در ۲۰ سپتامبر، یک مدل پژوهشی داخلی OpenAI که تحت آموزش مبتنی بر جست‌وجو قرار داشت، فیلترهای شبکه را دور زد.

این مدل با هدایت درخواست‌های خود از طریق حل‌کننده DNS داخلی محیط آموزش، توانست با یک چت‌بات عمومی خارجی ارتباط برقرار کند.

سامانه نظارتی شرکت ۱۵ دقیقه بعد هشدار داد و یک کارمند نیز سه دقیقه پس از آن هشدار را تأیید کرد.

با این حال، «کلید توقف اضطراری» خودکار کاملاً از کار افتاد و اجرای فرایند آموزش را برای دو ساعت و نیم دیگر ممکن کرد. مهندسان OpenAI در نهایت این فرایند را به‌صورت دستی متوقف کردند.

OpenAI پس از این حادثه اعلام کرد آموزش مدل‌ها را «تنها زمانی از سر خواهد گرفت که مطمئن باشیم سازوکارهای حفاظتی و بهبودهای هم‌راستاسازی بیشتری را در اختیار داریم».

سخنگوی شرکت این موضوع را به Axios اعلام کرد. این توقف شامل آموزش، ارزیابی و اجرای قدرتمندترین مدل‌های شرکت با استفاده از ابزارها می‌شود.

سخنگوی OpenAI همچنین گفت این نخستین باری نیست که شرکت برای اتخاذ چنین اقداماتی فرایندها را متوقف می‌کند و با ادامه پیشرفت قابلیت‌های هوش مصنوعی، انتظار ندارد آخرین بار باشد.

بیشتر بخوانیدمدیرعامل آنتروپیک: ترمز توسعه هوش مصنوعی باید کشیده شود

بررسی رفتار مدل‌های Anthropic

Anthropic نیز طبق گزارش Axios، یک سازمان مستقل ایمنی را مأمور بررسی رفتار مدل‌های خود کرده است.

این شرکت همچنین در «کارت‌های سیستم» مدل‌هایش، میزان بروز رفتارهای نادرست را منتشر می‌کند.

کارت سیستم Claude Opus 5.5 که ۲۲ سپتامبر منتشر شد، نشان می‌دهد این مدل در دو ارزیابی جدید که بدون سازوکارهای حفاظتی انجام شدند، در ۱.۵ درصد از اجراها تلاش کرده است از محیط ایزوله خارج شود یا در آن دستکاری ایجاد کند.

Anthropic تأکید کرده است که این آزمایش‌ها ماهیتی خصمانه داشتند و حل وظیفه موردنظر بدون خروج از محیط ایزوله امکان‌پذیر نبود.

این شرکت در صفحه معرفی Claude Opus 5.5 اعلام کرده است که این مدل حدود ۸۵ درصد کمتر از Opus 5 یا Claude Mythos 5.1 برای دور زدن محدودیت‌ها تلاش کرده است.

Anthropic همچنین گفته است همه این تلاش‌ها شدت پایینی داشته‌اند و خود مدل آن‌ها را گزارش کرده است.

چرا تعداد حوادث به ده‌ها هزار مورد رسیده است؟

تصویری از لوگوی آنتروپیک و OpenAI کنار یکدیگر

منابع Axios درباره تعداد بسیار بالای حوادث گزارش‌شده توضیح داده‌اند که Anthropic و دیگر آزمایشگاه‌ها صدها هزار اجرای آزمایشی را روی مدل‌های خود انجام می‌دهند.

بنابراین حتی درصد بسیار کوچکی از رفتارهای ناسازگار می‌تواند در مجموع به ده‌ها هزار حادثه منجر شود.

Anthropic برای نمونه، ۱۴۱ هزار و ۶ اجرای ارزیابی را که در آن‌ها Claude به اینترنت دسترسی داشت بررسی کرد و سه مورد را یافت که Claude در جریان آزمایش قابلیت‌های امنیتی، سه شرکت واقعی را هک کرده بود.

Anthropic اعلام کرده است این حوادث را بیشتر به‌عنوان نقص در زیرساخت آزمایش و فرایند عملیاتی می‌داند تا شکست در هم‌راستاسازی مدل.

دلیل این برداشت آن است که به مدل‌ها گفته شده بود به اینترنت دسترسی ندارند، اما در عمل دسترسی آن‌ها به دلیل پیکربندی اشتباه فعال بود.

خارج از Anthropic و OpenAI نیز مدل‌های هوش مصنوعی با حوادث مشابه مواجه شده‌اند. گوگل نیز گزارشی را تأیید کرده است که بر اساس آن مدل‌های Gemini در اوایل سال جاری سه شرکت را هک کرده‌اند.

برخی کارشناسانی که Axios با آن‌ها گفت‌وگو کرده است، معتقدند این حوادث مواردی منفرد هستند و با بهبود کنترل‌ها، افشاگری‌های آینده شدت کمتری خواهند داشت.

آن‌ها همچنین می‌گویند برخی اصلاحات ساده می‌تواند به آزمایشگاه‌ها کمک کند تا از بخشی از عواملی که این حوادث را برای افراد خارج از شرکت‌ها خطرناک جلوه داده‌اند، جلوگیری کنند.

در مقابل، برخی دیگر از فعالان این حوزه اعتماد محدودی به توانایی شرکت‌های هوش مصنوعی برای جلوگیری از تمام رفتارهای مشکل‌ساز مدل‌ها دارند.

به گفته آن‌ها، جلوگیری کامل از چنین رفتارهایی مستلزم پیش‌بینی تمام مسیرهایی است که مدل‌ها ممکن است از طریق آن‌ها منحرف شوند، کاری که عملاً غیرممکن است.

با این حال، کارشناسان بر این باورند که هنگام آزمایش مدل‌های جدید، وقوع بخشی از رفتارهای ناسازگار قابل انتظار است و رساندن این ریسک به صفر ممکن است امکان‌پذیر نباشد.

افزایش فشار برای ایجاد سازوکارهای حفاظتی

این حوادث درخواست‌ها برای ایجاد سازوکارهای حفاظتی در سراسر صنعت هوش مصنوعی را افزایش داده‌اند.

داریو آمودی، مدیرعامل Anthropic، در مقاله‌ای که مدیران OpenAI، Google DeepMind و Microsoft نیز از آن حمایت کرده‌اند، از واشنگتن خواسته است سرعت توسعه هوش مصنوعی را با توجه به نگرانی‌ها درباره خارج شدن عامل‌ها از کنترل، مدیریت کند.

آمودی هشدار داده است که عامل‌های هوش مصنوعی ممکن است از کنترل خارج شوند و به شکل یک شبکه عظیم رباتی مبتنی بر هوش مصنوعی درآیند که توانایی در اختیار گرفتن کل اینترنت را داشته باشد.

دونالد ترامپ، رئیس‌جمهور آمریکا، بارها درخواست‌ها برای وضع مقررات را رد کرده و آن‌ها را «حقه» خوانده است.

او همچنین از برنامه‌ای برای ایجاد یک «نیروی هوش مصنوعی» خبر داده است که وظیفه آن حمایت، کمک و نظارت بر صنعت هوش مصنوعی در مسیر رشد این فناوری خواهد بود.

نوشتهشکست کلید توقف اضطراری؛ OpenAI آموزش قدرتمندترین مدل‌هایش را متوقف کرداولین بار درTechnoc. پدیدار شد.

برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.