تکنولوژی و اینترنت

آنتروپیک هشدار داد هوش مصنوعی چینی GLM-5.3 توانایی هک در سطح Claude Mythos دارد

آنتروپیک در گزارش تازه‌ای مدعی شده مدل هوش مصنوعی GLM-5.3 متعلق به شرکت چینی Zhipu AI می‌تواند برای تولید محتوای مخرب مورد استفاده قرار گیرد و سازوکارهای حفاظتی آن نیز در برابر برخی روش‌ها مقاومت کافی ندارند. این شرکت می‌گوید GLM-5.3 قابلیت استفاده در حملات سا…

7 دقیقه مطالعه
  • پشتیبانی شبکه
  • هوش مصنوعی
  • آنتروپیک
  • GLM-5
  • مدل‌های
  • مصنوعی
  • مدل
  • هوش
آنتروپیک هشدار داد هوش مصنوعی چینی GLM-5.3 توانایی هک در سطح Claude Mythos دارد

خلاصه تحلیلی خبر

آنتروپیک در گزارش تازه‌ای مدعی شده مدل هوش مصنوعی GLM-5.3 متعلق به شرکت چینی Zhipu AI می‌تواند برای تولید محتوای مخرب مورد استفاده قرار گیرد و سازوکارهای حفاظتی آن نیز در برابر برخی روش‌ها مقاومت کافی ندارند. این شرکت می‌گوید GLM-5.3 قابلیت استفاده در حملات سا…

موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، آنتروپیک، GLM-5، مدل‌های، مصنوعی

آنتروپیک در گزارش تازه‌ای مدعی شده مدل هوش مصنوعی GLM-5.3 متعلق به شرکت چینی Zhipu AI می‌تواند برای تولید محتوای مخرب مورد استفاده قرار گیرد و سازوکارهای حفاظتی آن نیز در برابر برخی روش‌ها مقاومت کافی ندارند.

این شرکت می‌گوید GLM-5.3 قابلیت استفاده در حملات سایبری را دارد و می‌توان با چند شیوه از محدودیت‌های ایمنی آن عبور کرد. انتشار این گزارش در شرایطی صورت گرفته که هم‌زمان درخواست‌هایی برای کاهش سرعت توسعه هوش مصنوعی مطرح شده و آنتروپیک نیز بر ضرورت حکمرانی و مقررات‌گذاری در این حوزه تأکید دارد. با وجود هشدارهای داریو آمودی، مدیرعامل آنتروپیک، درباره لزوم کنترل سرعت پیشرفت مرزهای هوش مصنوعی، مدل‌های Claude Opus 5.5 و Claude Sonnet 5.5 تنها چند روز پس از افزایش این نگرانی‌ها عرضه شدند.

آنتروپیک که یک شرکت فعال در حوزه مدل‌های هوش مصنوعی بسته و در حال بررسی عرضه اولیه سهام است، اکنون هشدار می‌دهد مدل‌های چینی با وزن باز می‌توانند مورد سوءاستفاده قرار بگیرند و محتوای زیان‌بار تولید کنند. این شرکت به گزارش مرکز استانداردها و نوآوری هوش مصنوعی نیز استناد کرده که در اواخر سپتامبر منتشر شد. طبق آن ارزیابی، GLM-5.3 توانایی خودکارسازی کامل برخی بهره‌برداری‌های امنیتی را در سطحی مشابه مدل منتشرنشده Claude Mythos آنتروپیک دارد.

همین قابلیت‌های گزارش‌شده در Claude Mythos از جمله عواملی بوده که آنتروپیک را به سمت توسعه Project Glasswing سوق داده است. این پروژه امکان دسترسی توسعه‌دهندگان به یک مدل هوش مصنوعی در سطح Mythos را فراهم می‌کند تا آسیب‌پذیری‌ها پیش از عرضه مدل‌های قدرتمند مشابه، شناسایی و اصلاح شوند.

آنتروپیک همچنین GLM-5.3 را در آزمون Exploitbench بررسی کرده؛ محیطی آزمایشگاهی و ایزوله که در آن مدل‌های هوش مصنوعی برای توسعه اکسپلویت‌های مربوط به Google Chrome ارزیابی می‌شوند. GLM-5.3 در ۴۱۰ اجرا توانست ۵۰ بار اکسپلویت سرتاسری تولید کند، در حالی که Mythos در همان تعداد تلاش به ۵۶ موفقیت رسید.

در یکی دیگر از آزمون‌های داخلی آنتروپیک، توانایی مدل‌ها برای ایجاد دستکاری‌های کامل در جریان اجرای برنامه بررسی شد. GLM-5.3 بار دیگر فاصله کمی با Mythos داشت و نرخ موفقیت آن به ۴ درصد رسید، در حالی که Mythos به نرخ ۶ درصد دست یافت. در همین معیار، مدل‌های وزن‌باز دیگری مانند Kimi K3 و DeepSeek V4.1 Flash هیچ موفقیتی ثبت نکردند.

آنتروپیک همچنین گزارش داده GLM-5.3 توانسته برخی زنجیره‌های اکسپلویت را به صورت خودکار ایجاد کند. نسخه سبک‌تر GLM-5.3-Flash نیز در آزمایش‌های مربوط به آسیب‌پذیری‌های شناخته‌شده، توانایی ایجاد چنین زنجیره‌هایی را نشان داده و هزینه اعلام‌شده برای پردازش مورد آزمایش حدود ۲۰.۴۰ دلار بوده است. بر اساس برآورد آنتروپیک، بسته به نسبت ورودی و خروجی، این قابلیت در آزمایش مورد نظر به پردازش حدود ۱۰۰ تا ۳۰۰ میلیون توکن مربوط می‌شد.

آنتروپیک در ادامه مدعی شده نسخه عادی GLM-5.3 با وجود داشتن سازوکارهای حفاظتی، با چند روش مختلف می‌تواند از محدودیت‌های خود عبور کند. یکی از روش‌های بررسی‌شده استفاده از دستورهای فریبنده برای قرار دادن مدل در نقش یک عامل خودمختار و مهاجم بود که در آزمایش‌ها نرخ موفقیت ۶۴ درصدی داشت. روش دیگری نیز با آماده‌سازی بخشی از فرایند تفکر مدل آزمایش شد و نرخ موفقیت ۹۲ درصدی را نشان داد. آنتروپیک روش دیگری با عنوان حذف هدفمند محافظ‌ها یا Abliteration را نیز بررسی کرده است.

حذف محافظ‌های ایمنی مدل

آنتروپیک معتقد است GLM-5.3 در شکل اولیه خود سازوکارهای حفاظتی ضعیفی دارد و در بسیاری از درخواست‌های مربوط به تولید محتوای زیان‌بار از پاسخ‌گویی خودداری می‌کند. با این حال، تفاوت مهم میان این مدل و محصولات آنتروپیک در ماهیت وزن‌باز GLM-5.3 است؛ زیرا کاربران می‌توانند نسخه قابل دریافت آن را تغییر دهند و لایه‌های محافظتی مدل را دستکاری کنند.

در حالت رسمی و بدون تغییر، GLM-5.3 از نظر نرخ امتناع از پاسخ‌گویی در سطحی مشابه مدل‌های آنتروپیک قرار می‌گیرد. آنتروپیک سپس نسخه‌ای از GLM-5.3 را به شکل عمدی از محافظ‌های ایمنی تهی کرد و دریافت که نرخ امتناع مدل به تنها ۶ درصد کاهش یافت. برای GLM-5.3-Flash نیز این رقم ۱۴ درصد گزارش شد.

نسخه‌های دستکاری‌شده مشابه را می‌توان در مخازنی مانند Hugging Face مشاهده کرد. چنین مدل‌هایی عمدتاً برای محیط‌های شبیه‌سازی‌شده آزمایش امنیتی و ارزیابی تهاجمی ساخته می‌شوند، اما در صورت استفاده نادرست امکان به‌کارگیری آنها در حملات واقعی نیز مطرح است. از این منظر، یافته آنتروپیک درباره امکان حذف محافظ‌های GLM-5.3 چندان دور از انتظار نیست.

اجرای نسخه دستکاری‌شده GLM-5.3 در سطح قابل استفاده، به توان پردازشی بسیار زیادی نیاز دارد. وزن‌های مدل در حالت دقت کامل FP8 حدود ۳۰۶ گیگابایت حافظه ویدئویی یا VRAM مصرف می‌کنند و برای نگهداری زمینه پردازشی در KV cache نیز تقریباً به همین میزان حافظه نیاز خواهد بود.

برای رسیدن به سرعت تخمینی ۱۰۰ توکن در ثانیه، دست‌کم حدود ۴ ترابایت بر ثانیه پهنای باند حافظه لازم خواهد بود. چنین پیکربندی‌ای به سخت‌افزار قدرتمندی مانند مجموعه‌ای متشکل از هشت شتاب‌دهنده هوش مصنوعی Nvidia H200 نیاز دارد. هزینه تهیه چنین زیرساختی نیز به صدها هزار دلار می‌رسد و در نتیجه بازیگران دولتی متخاصم تنها در صورت دسترسی به سخت‌افزار مناسب می‌توانند چنین سامانه‌ای را در اختیار داشته باشند.

برای یک هکر معمولی که بخواهد چنین کاری را در مقیاس شخصی انجام دهد، شرایط بسیار دشوارتر خواهد بود. در چنین سناریویی، اجاره توان پردازشی، دستکاری مدل و سپس اجرای آن هزینه بسیار بالایی ایجاد می‌کند. آنتروپیک می‌گوید آماده‌سازی نسخه دستکاری‌شده GLM-5.3-Flash به ۲۲۰۰ ساعت پردازش GPU نیاز داشت و هزینه آن حدود ۴۴۰۰ دلار برآورد شد؛ یعنی نزدیک به ۲ دلار برای هر ساعت استفاده از GPU.

اجاره توان پردازشی مورد نیاز برای دستکاری نسخه کامل GLM-5.3 نیز بر اساس ارقام Runpod حدود ۳۰ دلار در ساعت هزینه دارد. در این محاسبه، اجاره هر H200 حدود ۳.۷۹ دلار در ساعت اعلام شده و اجرای پیکربندی مورد نیاز به هشت دستگاه از این شتاب‌دهنده‌ها احتیاج دارد.

بر اساس برآوردها، تولید حدود ۱۰۰ میلیون توکن با هشت GPU از نوع H200 NVL و سرعت فرضی ۱۰۰ توکن در ثانیه، حدود ۸۴۲۲ دلار هزینه خواهد داشت و نزدیک به ۱۱.۵ روز زمان می‌برد. در نتیجه، ترکیب فرایند دستکاری مدل، اجرای آن و استفاده از توانایی‌های سایبری می‌تواند به زمان و هزینه بسیار بیشتری نیاز داشته باشد و همین مسئله یکی از مهم‌ترین موانع عملی برای افراد یا گروه‌هایی باشد که قصد سوءاستفاده از چنین مدلی را دارند.

چرا آنتروپیک روی این موضوع تمرکز کرده است؟

در بحبوحه نگرانی‌های فزاینده درباره ایمنی هوش مصنوعی، آنتروپیک تلاش دارد توجه‌ها را به خطرات بالقوه مدل‌های پیشرفته و وزن‌باز جلب کند؛ به‌ویژه مدل‌هایی که توانایی‌های آنها هم‌زمان با پیشرفت فناوری افزایش می‌یابد.

Two men in suits sitting indoors; on the right a man in a navy suit with a red tie smiles at the camera, while the left man looks sideways.

هم‌زمان با این تحولات، دونالد ترامپ با شماری از چهره‌های برجسته صنعت هوش مصنوعی دیدار داشته و موضوع تنظیم داوطلبانه عرضه مدل‌های آینده نیز مطرح شده است. گزارش آنتروپیک را می‌توان تلاشی برای تشویق توسعه‌دهندگان و دولت‌ها به بررسی دقیق‌تر توانایی‌های مدل‌های وزن‌باز دانست.

این رویکرد همچنین ممکن است نشانه افزایش مخالفت برخی آزمایشگاه‌های هوش مصنوعی بسته با مدل‌های وزن‌باز باشد؛ به‌ویژه در شرایطی که مدل‌های ارزان‌تر و نزدیک به سطح عملکرد محصولات بسته، بخشی از کاربران را به سوی خود جذب کرده‌اند. با این حال، این برداشت صرفاً یک گمانه‌زنی محسوب می‌شود و در گزارش حاضر به عنوان واقعیتی قطعی مطرح نشده است.

در شرایط فعلی، مدل‌های وزن‌باز همچنان از نظر توانایی به مدل‌های پیشرفته بسته نزدیک شده‌اند و فاصله آنها در برخی حوزه‌ها تنها چند ماه برآورد می‌شود. با این حال، هزینه سنگین اجرای مدل‌های بزرگ باعث می‌شود استفاده عملی از نسخه‌های دستکاری‌شده برای بازیگران مخرب با موانع جدی روبه‌رو باشد.

خطر احتمالی استفاده از مدل‌های وزن‌باز دستکاری‌شده توسط بازیگران متخاصم یا مخرب واقعی تلقی می‌شود، اما هزینه و نیاز سخت‌افزاری بالا باعث شده دستیابی گسترده به این توانایی‌ها، دست‌کم در شرایط توصیف‌شده در گزارش، آسان نباشد.

برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.