ايتنا - فناوری جدیدی که رفتارهای خطرناک هوش مصنوعی را پیش از وقوع شناسایی می‌کند

با افزایش توانایی سیستم‌های هوش مصنوعی در انجام وظایف پیچیده و مستقل، نظارت بر رفتار این مدل‌ها به یکی از چالش‌های مهم صنعت فناوری تبدیل شده است. اکنون استارتاپ گودفایر (Goodfire) با توسعه فناوری جدیدی تلاش می‌کند شیوه نظارت بر هوش مصنوعی را تغییر دهد؛ فناوری‌…

4 دقیقه مطالعه
  • پشتیبانی شبکه
  • هوش مصنوعی
  • هوش
  • مصنوعی
  • فناوری
  • مدل
  • بررسی
  • استفاده
ايتنا - فناوری جدیدی که رفتارهای خطرناک هوش مصنوعی را پیش از وقوع شناسایی می‌کند

خلاصه تحلیلی خبر

با افزایش توانایی سیستم‌های هوش مصنوعی در انجام وظایف پیچیده و مستقل، نظارت بر رفتار این مدل‌ها به یکی از چالش‌های مهم صنعت فناوری تبدیل شده است. اکنون استارتاپ گودفایر (Goodfire) با توسعه فناوری جدیدی تلاش می‌کند شیوه نظارت بر هوش مصنوعی را تغییر دهد؛ فناوری‌…

موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، هوش، مصنوعی، فناوری، مدل

با افزایش توانایی سیستم‌های هوش مصنوعی در انجام وظایف پیچیده و مستقل، نظارت بر رفتار این مدل‌ها به یکی از چالش‌های مهم صنعت فناوری تبدیل شده است. اکنون استارتاپ گودفایر (Goodfire) با توسعه فناوری جدیدی تلاش می‌کند شیوه نظارت بر هوش مصنوعی را تغییر دهد؛ فناوری‌ای که به جای بررسی صرف پاسخ‌های تولیدشده، فعالیت‌های داخلی مدل را هنگام انجام وظایف زیر نظر می‌گیرد.

هدف این فناوری، شناسایی نشانه‌های اولیه رفتارهای خطرناک پیش از تبدیل شدن آنها به اقدامات واقعی است؛ رویکردی که می‌تواند به افزایش ایمنی سیستم‌های هوش مصنوعی، به‌ویژه مدل‌هایی که بدون دخالت مستقیم انسان فعالیت می‌کنند، کمک کند.

شناسایی رفتارهای مشکوک با بررسی سیگنال‌های داخلی


گودفایر برای توسعه این سیستم از ابزارهای تحلیلی کوچکی موسوم به «حسگر» استفاده کرده است. این حسگرها هنگام اجرای وظایف، سیگنال‌های داخلی مدل هوش مصنوعی را بررسی می‌کنند و به دنبال الگوهایی می‌گردند که ممکن است با رفتارهای نامطلوب ارتباط داشته باشند.
از جمله رفتارهایی که این فناوری برای شناسایی آنها طراحی شده، می‌توان به تلاش برای انجام حملات سایبری و دور زدن محدودیت‌ها یا سازوکارهای کنترلی سیستم اشاره کرد.

این روش با شیوه‌های متداول نظارت بر هوش مصنوعی تفاوت دارد. در رویکردهای سنتی، معمولاً از یک مدل هوش مصنوعی دیگر برای بررسی خروجی‌ها و مراحل انجام وظایف مدل اصلی استفاده می‌شود. چنین فرایندی، به‌ویژه زمانی که سیستم‌ها برای ساعت‌های طولانی فعالیت می‌کنند و حجم زیادی از اطلاعات را پردازش می‌کنند، می‌تواند هزینه‌های قابل‌توجهی داشته باشد.

اما فناوری گودفایر به جای آنکه تمام مراحل فعالیت مدل را با کمک یک هوش مصنوعی دیگر بررسی کند، سیگنال‌های داخلی را به‌طور مداوم زیر نظر می‌گیرد و تنها موارد مشکوک را برای ارزیابی دقیق‌تر به مدل دیگری ارجاع می‌دهد.

این سیستم همچنین به اپراتورها اجازه می‌دهد نوع خطراتی را که باید شناسایی شوند، مشخص کنند. آنها می‌توانند تعیین کنند که پس از تشخیص فعالیت مشکوک چه اقدامی انجام شود؛ از ثبت رویداد گرفته تا ارجاع آن برای بررسی انسانی یا رد درخواست.

شناسایی ۹۴ درصد از جلسات هک مخرب در آزمایش‌ها


گودفایر اعلام کرده است که فناوری جدید خود را با استفاده از مدل هوش مصنوعی Kimi K3 در حدود ۱۵۰۰ جلسه آزمایش کرده است. بر اساس نتایج اعلام‌شده، این سیستم توانسته است ۹۴ درصد از جلسات مربوط به فعالیت‌های هک مخرب را شناسایی کند. در مقابل، ۸.۷ درصد از جلسات سالم نیز به‌عنوان موارد نیازمند بررسی بیشتر علامت‌گذاری شده‌اند.

این نتایج نشان می‌دهد فناوری جدید در آزمایش‌های انجام‌شده توانسته است بخش بزرگی از فعالیت‌های مخرب را تشخیص دهد، هرچند ارجاع برخی فعالیت‌های سالم برای بررسی بیشتر نشان می‌دهد که احتمال هشدارهای غیرضروری همچنان وجود دارد.

کاهش چشمگیر هزینه نظارت بر هوش مصنوعی


یکی از مهم‌ترین مزیت‌های ادعایی فناوری گودفایر، کاهش هزینه نظارت بر مدل‌های هوش مصنوعی است. بر اساس ارقام منتشرشده از سوی این شرکت، نظارت بر جلسات آزمایشی با استفاده از سیستم جدید تنها حدود ۵۱ دلار هزینه داشته است.

این در حالی است که بررسی تمام مراحل فعالیت مدل با استفاده از یک مدل هوش مصنوعی ارزان‌تر، حدود ۲۳۳ دلار هزینه داشته و استفاده از یک مدل پیشرفته برای انجام همین کار، هزینه‌ای نزدیک به ۱۰ هزار دلار ایجاد کرده است.

به این ترتیب، هزینه استفاده از فناوری گودفایر در این آزمایش‌ها در مقایسه با روش مبتنی بر مدل ارزان‌تر، حدود ۷۸ درصد کمتر بوده است. این شرکت همچنین اعلام کرده است که فعال‌سازی همزمان چهار حسگر، زمان آغاز پاسخ‌دهی مدل را کمتر از ۲ درصد افزایش داده است؛ موضوعی که نشان می‌دهد دست‌کم در شرایط آزمایش‌شده، استفاده از این فناوری تأثیر محدودی بر سرعت پاسخ‌دهی داشته است.

دسترسی شرکت‌ها به فناوری جدید گودفایر


فناوری نظارتی گودفایر اکنون در اختیار مشتریان پلتفرم Baseten قرار گرفته است؛ پلتفرمی که خدمات میزبانی و اجرای مدل‌های هوش مصنوعی را برای شرکت‌ها ارائه می‌دهد.

عرضه این فناوری در شرایطی صورت می‌گیرد که نگرانی‌ها درباره گسترش استفاده از عامل‌های هوش مصنوعی افزایش یافته است. این سیستم‌ها می‌توانند وظایف پیچیده را به‌صورت مستقل انجام دهند، اما همین توانایی نگرانی‌هایی درباره احتمال سوءاستفاده از آسیب‌پذیری‌های امنیتی یا دور زدن محدودیت‌های تعیین‌شده برای آنها ایجاد کرده است.

با وجود نتایج امیدوارکننده، باید توجه داشت که آمار منتشرشده بر اساس آزمایش‌های خود گودفایر است و هنوز شواهد مستقلی ارائه نشده که نشان دهد این فناوری در تمام مدل‌ها و شرایط عملیاتی، عملکرد مشابهی خواهد داشت.

همچنین بررسی سیگنال‌های داخلی مدل‌ها لزوماً به معنای درک کامل اهداف یا فرایندهای تصمیم‌گیری هوش مصنوعی نیست و نمی‌تواند جلوگیری از تمام رفتارهای خطرناک را تضمین کند.
با این حال، رویکرد گودفایر می‌تواند مسیر تازه‌ای برای توسعه ابزارهای نظارتی کم‌هزینه‌تر فراهم کند؛ ابزارهایی که به جای اتکا به بررسی مداوم خروجی‌ها، تلاش می‌کنند نشانه‌های رفتارهای پرخطر را در جریان فعالیت مدل شناسایی کنند.

برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.