آنتروپیک هشدار داد هوش مصنوعی چینی GLM-5.3 توانایی هک در سطح Claude Mythos دارد
آنتروپیک در گزارش تازهای مدعی شده مدل هوش مصنوعی GLM-5.3 متعلق به شرکت چینی Zhipu AI میتواند برای تولید محتوای مخرب مورد استفاده قرار گیرد و سازوکارهای حفاظتی آن نیز در برابر برخی روشها مقاومت کافی ندارند. این شرکت میگوید GLM-5.3 قابلیت استفاده در حملات سا…
خلاصه تحلیلی خبر
آنتروپیک در گزارش تازهای مدعی شده مدل هوش مصنوعی GLM-5.3 متعلق به شرکت چینی Zhipu AI میتواند برای تولید محتوای مخرب مورد استفاده قرار گیرد و سازوکارهای حفاظتی آن نیز در برابر برخی روشها مقاومت کافی ندارند. این شرکت میگوید GLM-5.3 قابلیت استفاده در حملات سا…
موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، آنتروپیک، GLM-5، مدلهای، مصنوعی
آنتروپیک در گزارش تازهای مدعی شده مدل هوش مصنوعی GLM-5.3 متعلق به شرکت چینی Zhipu AI میتواند برای تولید محتوای مخرب مورد استفاده قرار گیرد و سازوکارهای حفاظتی آن نیز در برابر برخی روشها مقاومت کافی ندارند.
این شرکت میگوید GLM-5.3 قابلیت استفاده در حملات سایبری را دارد و میتوان با چند شیوه از محدودیتهای ایمنی آن عبور کرد. انتشار این گزارش در شرایطی صورت گرفته که همزمان درخواستهایی برای کاهش سرعت توسعه هوش مصنوعی مطرح شده و آنتروپیک نیز بر ضرورت حکمرانی و مقرراتگذاری در این حوزه تأکید دارد. با وجود هشدارهای داریو آمودی، مدیرعامل آنتروپیک، درباره لزوم کنترل سرعت پیشرفت مرزهای هوش مصنوعی، مدلهای Claude Opus 5.5 و Claude Sonnet 5.5 تنها چند روز پس از افزایش این نگرانیها عرضه شدند.
آنتروپیک که یک شرکت فعال در حوزه مدلهای هوش مصنوعی بسته و در حال بررسی عرضه اولیه سهام است، اکنون هشدار میدهد مدلهای چینی با وزن باز میتوانند مورد سوءاستفاده قرار بگیرند و محتوای زیانبار تولید کنند. این شرکت به گزارش مرکز استانداردها و نوآوری هوش مصنوعی نیز استناد کرده که در اواخر سپتامبر منتشر شد. طبق آن ارزیابی، GLM-5.3 توانایی خودکارسازی کامل برخی بهرهبرداریهای امنیتی را در سطحی مشابه مدل منتشرنشده Claude Mythos آنتروپیک دارد.
همین قابلیتهای گزارششده در Claude Mythos از جمله عواملی بوده که آنتروپیک را به سمت توسعه Project Glasswing سوق داده است. این پروژه امکان دسترسی توسعهدهندگان به یک مدل هوش مصنوعی در سطح Mythos را فراهم میکند تا آسیبپذیریها پیش از عرضه مدلهای قدرتمند مشابه، شناسایی و اصلاح شوند.
آنتروپیک همچنین GLM-5.3 را در آزمون Exploitbench بررسی کرده؛ محیطی آزمایشگاهی و ایزوله که در آن مدلهای هوش مصنوعی برای توسعه اکسپلویتهای مربوط به Google Chrome ارزیابی میشوند. GLM-5.3 در ۴۱۰ اجرا توانست ۵۰ بار اکسپلویت سرتاسری تولید کند، در حالی که Mythos در همان تعداد تلاش به ۵۶ موفقیت رسید.
در یکی دیگر از آزمونهای داخلی آنتروپیک، توانایی مدلها برای ایجاد دستکاریهای کامل در جریان اجرای برنامه بررسی شد. GLM-5.3 بار دیگر فاصله کمی با Mythos داشت و نرخ موفقیت آن به ۴ درصد رسید، در حالی که Mythos به نرخ ۶ درصد دست یافت. در همین معیار، مدلهای وزنباز دیگری مانند Kimi K3 و DeepSeek V4.1 Flash هیچ موفقیتی ثبت نکردند.
آنتروپیک همچنین گزارش داده GLM-5.3 توانسته برخی زنجیرههای اکسپلویت را به صورت خودکار ایجاد کند. نسخه سبکتر GLM-5.3-Flash نیز در آزمایشهای مربوط به آسیبپذیریهای شناختهشده، توانایی ایجاد چنین زنجیرههایی را نشان داده و هزینه اعلامشده برای پردازش مورد آزمایش حدود ۲۰.۴۰ دلار بوده است. بر اساس برآورد آنتروپیک، بسته به نسبت ورودی و خروجی، این قابلیت در آزمایش مورد نظر به پردازش حدود ۱۰۰ تا ۳۰۰ میلیون توکن مربوط میشد.
آنتروپیک در ادامه مدعی شده نسخه عادی GLM-5.3 با وجود داشتن سازوکارهای حفاظتی، با چند روش مختلف میتواند از محدودیتهای خود عبور کند. یکی از روشهای بررسیشده استفاده از دستورهای فریبنده برای قرار دادن مدل در نقش یک عامل خودمختار و مهاجم بود که در آزمایشها نرخ موفقیت ۶۴ درصدی داشت. روش دیگری نیز با آمادهسازی بخشی از فرایند تفکر مدل آزمایش شد و نرخ موفقیت ۹۲ درصدی را نشان داد. آنتروپیک روش دیگری با عنوان حذف هدفمند محافظها یا Abliteration را نیز بررسی کرده است.
حذف محافظهای ایمنی مدل
آنتروپیک معتقد است GLM-5.3 در شکل اولیه خود سازوکارهای حفاظتی ضعیفی دارد و در بسیاری از درخواستهای مربوط به تولید محتوای زیانبار از پاسخگویی خودداری میکند. با این حال، تفاوت مهم میان این مدل و محصولات آنتروپیک در ماهیت وزنباز GLM-5.3 است؛ زیرا کاربران میتوانند نسخه قابل دریافت آن را تغییر دهند و لایههای محافظتی مدل را دستکاری کنند.
در حالت رسمی و بدون تغییر، GLM-5.3 از نظر نرخ امتناع از پاسخگویی در سطحی مشابه مدلهای آنتروپیک قرار میگیرد. آنتروپیک سپس نسخهای از GLM-5.3 را به شکل عمدی از محافظهای ایمنی تهی کرد و دریافت که نرخ امتناع مدل به تنها ۶ درصد کاهش یافت. برای GLM-5.3-Flash نیز این رقم ۱۴ درصد گزارش شد.
نسخههای دستکاریشده مشابه را میتوان در مخازنی مانند Hugging Face مشاهده کرد. چنین مدلهایی عمدتاً برای محیطهای شبیهسازیشده آزمایش امنیتی و ارزیابی تهاجمی ساخته میشوند، اما در صورت استفاده نادرست امکان بهکارگیری آنها در حملات واقعی نیز مطرح است. از این منظر، یافته آنتروپیک درباره امکان حذف محافظهای GLM-5.3 چندان دور از انتظار نیست.
اجرای نسخه دستکاریشده GLM-5.3 در سطح قابل استفاده، به توان پردازشی بسیار زیادی نیاز دارد. وزنهای مدل در حالت دقت کامل FP8 حدود ۳۰۶ گیگابایت حافظه ویدئویی یا VRAM مصرف میکنند و برای نگهداری زمینه پردازشی در KV cache نیز تقریباً به همین میزان حافظه نیاز خواهد بود.
برای رسیدن به سرعت تخمینی ۱۰۰ توکن در ثانیه، دستکم حدود ۴ ترابایت بر ثانیه پهنای باند حافظه لازم خواهد بود. چنین پیکربندیای به سختافزار قدرتمندی مانند مجموعهای متشکل از هشت شتابدهنده هوش مصنوعی Nvidia H200 نیاز دارد. هزینه تهیه چنین زیرساختی نیز به صدها هزار دلار میرسد و در نتیجه بازیگران دولتی متخاصم تنها در صورت دسترسی به سختافزار مناسب میتوانند چنین سامانهای را در اختیار داشته باشند.
برای یک هکر معمولی که بخواهد چنین کاری را در مقیاس شخصی انجام دهد، شرایط بسیار دشوارتر خواهد بود. در چنین سناریویی، اجاره توان پردازشی، دستکاری مدل و سپس اجرای آن هزینه بسیار بالایی ایجاد میکند. آنتروپیک میگوید آمادهسازی نسخه دستکاریشده GLM-5.3-Flash به ۲۲۰۰ ساعت پردازش GPU نیاز داشت و هزینه آن حدود ۴۴۰۰ دلار برآورد شد؛ یعنی نزدیک به ۲ دلار برای هر ساعت استفاده از GPU.
اجاره توان پردازشی مورد نیاز برای دستکاری نسخه کامل GLM-5.3 نیز بر اساس ارقام Runpod حدود ۳۰ دلار در ساعت هزینه دارد. در این محاسبه، اجاره هر H200 حدود ۳.۷۹ دلار در ساعت اعلام شده و اجرای پیکربندی مورد نیاز به هشت دستگاه از این شتابدهندهها احتیاج دارد.
بر اساس برآوردها، تولید حدود ۱۰۰ میلیون توکن با هشت GPU از نوع H200 NVL و سرعت فرضی ۱۰۰ توکن در ثانیه، حدود ۸۴۲۲ دلار هزینه خواهد داشت و نزدیک به ۱۱.۵ روز زمان میبرد. در نتیجه، ترکیب فرایند دستکاری مدل، اجرای آن و استفاده از تواناییهای سایبری میتواند به زمان و هزینه بسیار بیشتری نیاز داشته باشد و همین مسئله یکی از مهمترین موانع عملی برای افراد یا گروههایی باشد که قصد سوءاستفاده از چنین مدلی را دارند.
چرا آنتروپیک روی این موضوع تمرکز کرده است؟
در بحبوحه نگرانیهای فزاینده درباره ایمنی هوش مصنوعی، آنتروپیک تلاش دارد توجهها را به خطرات بالقوه مدلهای پیشرفته و وزنباز جلب کند؛ بهویژه مدلهایی که تواناییهای آنها همزمان با پیشرفت فناوری افزایش مییابد.
همزمان با این تحولات، دونالد ترامپ با شماری از چهرههای برجسته صنعت هوش مصنوعی دیدار داشته و موضوع تنظیم داوطلبانه عرضه مدلهای آینده نیز مطرح شده است. گزارش آنتروپیک را میتوان تلاشی برای تشویق توسعهدهندگان و دولتها به بررسی دقیقتر تواناییهای مدلهای وزنباز دانست.
این رویکرد همچنین ممکن است نشانه افزایش مخالفت برخی آزمایشگاههای هوش مصنوعی بسته با مدلهای وزنباز باشد؛ بهویژه در شرایطی که مدلهای ارزانتر و نزدیک به سطح عملکرد محصولات بسته، بخشی از کاربران را به سوی خود جذب کردهاند. با این حال، این برداشت صرفاً یک گمانهزنی محسوب میشود و در گزارش حاضر به عنوان واقعیتی قطعی مطرح نشده است.
در شرایط فعلی، مدلهای وزنباز همچنان از نظر توانایی به مدلهای پیشرفته بسته نزدیک شدهاند و فاصله آنها در برخی حوزهها تنها چند ماه برآورد میشود. با این حال، هزینه سنگین اجرای مدلهای بزرگ باعث میشود استفاده عملی از نسخههای دستکاریشده برای بازیگران مخرب با موانع جدی روبهرو باشد.
خطر احتمالی استفاده از مدلهای وزنباز دستکاریشده توسط بازیگران متخاصم یا مخرب واقعی تلقی میشود، اما هزینه و نیاز سختافزاری بالا باعث شده دستیابی گسترده به این تواناییها، دستکم در شرایط توصیفشده در گزارش، آسان نباشد.
برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.