تکنولوژی

آیا با مدل GPT-6 Astra واقعاً به عصر هوش جامع مصنوعی وارد شدیم؟

اوپن‌ای‌آی مدعی است مدل GPT-6 Astra بشر را به آستانه هوش جامع مصنوعی (AGI) رسانده است؛ بااین‌حال، اختلاف در نتایج آزمون‌ها، استفاده از روش‌های اختصاصی برای ارزیابی مدل و عملکرد نه‌چندان بهتر آن در برخی سنجش‌های مستقل، تردیدهایی درباره میزان پیشرفت واقعی این مد…

9 دقیقه مطالعه
  • پشتیبانی شبکه
  • هوش مصنوعی
  • امنیت سایبری
  • مدل
  • Astra
  • هوش
  • مصنوعی
  • ارزیابی
آیا با مدل GPT-6 Astra واقعاً به عصر هوش جامع مصنوعی وارد شدیم؟

خلاصه تحلیلی خبر

اوپن‌ای‌آی مدعی است مدل GPT-6 Astra بشر را به آستانه هوش جامع مصنوعی (AGI) رسانده است؛ بااین‌حال، اختلاف در نتایج آزمون‌ها، استفاده از روش‌های اختصاصی برای ارزیابی مدل و عملکرد نه‌چندان بهتر آن در برخی سنجش‌های مستقل، تردیدهایی درباره میزان پیشرفت واقعی این مد…

موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، امنیت سایبری، مدل، Astra، هوش

اوپن‌ای‌آی مدعی استمدل GPT-6 Astraبشر را به آستانه هوش جامع مصنوعی (AGI) رسانده است؛ بااین‌حال، اختلاف در نتایج آزمون‌ها، استفاده از روش‌های اختصاصی برای ارزیابی مدل و عملکرد نه‌چندان بهتر آن در برخی سنجش‌های مستقل، تردیدهایی درباره میزان پیشرفت واقعی این مدل ایجاد کرده است. درحالی‌که این مدل در برخی آزمون‌ها امتیازهای بی‌سابقه‌ای به دست آورده، پژوهشگران می‌گویند موفقیت در بنچمارک‌ها لزوماً به معنای دستیابی به هوشی هم‌سطح انسان نیست. در ادامه این موضوع را بیشتر تشریح می‌کنیم.

به اعتقاد اوپن‌ای‌آی، عرضه GPT-6 Astra می‌تواند نقطه عطفی در مسیر توسعه هوش مصنوعی باشد. این ادعا در شرایطی مطرح می‌شود که نگرانی‌ها درباره ایمنی مدل‌های پیشرفته افزایش یافته است. برخی پژوهشگران مستقل و طراحان بنچمارک‌ها نیز می‌گویند امتیازهای بالای Astra تا حد زیادی به بهینه‌سازی‌های ویژه برای آزمون‌ها وابسته است و لزوماً نشان‌دهنده توانایی آن در تعمیم آموخته‌ها به موقعیت‌های جدید نیست.

«گراگ براکمن»، رئیس اوپن‌ای‌آی، هنگام معرفی این مدل در نشست خبری سوم سپتامبر گفت

«اگر چند سال به جلو برویم و به گذشته نگاه کنیم و بپرسیم واقعاً چه زمانی هوش جامع مصنوعی ایجاد شد، فکر می‌کنم این زمان باشد و احتمال می‌دهم این مدل همان نقطه عطف باشد.»

اما آیا نتایج آزمایش‌ها چنین ادعایی را تأیید می‌کنند؟ بررسی عملکرد GPT-6 Astra نشان می‌دهد که برای پاسخ به این پرسش، باید علاوه‌بر امتیازهای چشمگیر آن، روش ارزیابی، هزینه دستیابی به این نتایج و عملکرد مدل در کاربردهای عملی را نیز در نظر گرفت.

GPT-6 Astra در آزمون‌ها چه عملکردی داشت؟

اوپن‌ای‌آی هنگام معرفی GPT-6 Astra، نتایج آن را درمجموعه‌ای از بنچمارک‌هامنتشر کرد که توانایی مدل‌های هوش مصنوعی را در انجام وظایف مختلف می‌سنجند. این شرکت اعلام کرد که مدل جدید در حوزه‌هایی مانند مهندسی نرم‌افزار، استفاده مستقل از برنامه‌های کامپیوتری، حل مسائل ریاضی و پژوهش علمی، عملکردی در سطح پیشرفته‌ترین مدل‌های موجود دارد.

در نمایش‌های معرفی Astra، این مدل توانست کدهای طراحی سه‌بعدی به کمک کامپیوتر (CAD) تولید کند، چیدمان بردهای مدار چاپی را در نرم‌افزارهای طراحی انجام دهد، مدل‌های دیجیتال سه‌بعدی را به محیط‌های تعاملی شبیه بازی‌های ویدیویی تبدیل کند و با دریافت دستور متنی، برنامه‌XNET را روی زیرساخت‌های میزبانی‌شده مستقر کند.

رئیس پژوهش‌های کاربردی شرکت هاروی (Harvey)، توسعه‌دهنده ابزارهای هوش مصنوعی برای خدمات حقوقی، نیز در اطلاعیه اوپن‌ای‌آی به توانایی استرا در انجام کارهای حقوقی اشاره کرد. او گفت: «در آزمایش‌های اولیه ما، Astra در مواجهه با کارهای حقوقی رویکردی شبیه وکیلی نکته‌سنج داشت.»

یکی از مهم‌ترین نتایج منتشرشده به آزمون ARC-AGI-3 مربوط می‌شود. این بنچمارک برای سنجش میزان کارآمدی هوش مصنوعی در یادگیری مهارت‌های جدید در محیط‌های انتزاعی و ناآشنا طراحی شده است.

Astra در این آزمون به امتیاز ۹۹٫۹ درصد رسید. آزمایش مستقل بنیاد غیرانتفاعی ARC Prize، نهاد ناظر بر این بنچمارک، نیز نشان داد که این مدل در ۹۶ درصد مراحل آزمون از معیارهای پایه مربوط به کارآمدی تعداد اقدامات انسان‌ها فراتر رفته است. Astra به‌طور میانگین برای تکمیل هر مرحله، به ۵۱٫۷ درصد اقدام کمتر از حل‌کنندگان انسانی نیاز داشت.

رئیس بنیاد ARC Prize در اطلاعیه اوپن‌ای‌آی گفت: «این نه‌تنها بهترین مدلی است که تاکنون آزمایش کرده‌ایم، بلکه نشان‌دهنده جهشی معنادار در عملکرد مدل‌های پیشرفته است.» بااین‌حال، خود بنیاد ARC Prize تأکید کرده است که رسیدن به امتیاز کامل یا نزدیک به کامل در این آزمون، به‌تنهایی اثبات نمی‌کند که مدلی به هوش جامع مصنوعی دست یافته است.

چرا امتیاز ۹۹٫۹ درصدی به معنای دستیابی به AGI نیست؟

بخشی از انتقادها به عملکرد Astra در ARC-AGI-3 به شیوه اجرای آزمون مربوط می‌شود. براساس گزارش‌ها، بالاترین امتیاز این مدل با استفاده از روشی اختصاصی به نام Provider Adapter به دست آمده است؛ لایه‌ای نرم‌افزاری که چارچوب ارزیابی را برای اجرای مدل آماده می‌کند و در دسترس توسعه‌دهندگان رقیب قرار ندارد.

هنگامی که Astra با چارچوب استاندارد و بی‌طرف این بنچمارک آزمایش شد، امتیاز آن به ۶۲٫۷ درصد کاهش یافت. این اختلاف نشان می‌دهد که انتخاب روش ارزیابی می‌تواند تأثیر قابل‌توجهی بر نتیجه نهایی داشته باشد.

بنیاد ARC Prize همچنین توضیح داده است که محیط‌های معمایی بسته و قطعی این آزمون، پیچیدگی بی‌پایان دنیای واقعی را بازنمایی نمی‌کنند. بنابراین، حتی اگر مدلی بتواند تمام مراحل بنچمارک را با موفقیت پشت سر بگذارد، این نتیجه به‌تنهایی برای اثبات توانایی آن در تعمیم گسترده آموخته‌ها کافی نیست.

کارشناسان این بنیاد می‌گویند

«هنگام راه‌اندازی ARC-AGI-3، تصریح کردیم که رسیدن به سقف امتیاز این بنچمارک به معنای اثبات دستیابی به AGI نیست. بنابراین، با اینکه معتقدیم Astra پیشرفت معناداری در جهت تعمیم‌پذیری نشان می‌دهد، ادعا نمی‌کنیم که این مدل به AGI رسیده است.»

تفاوت میان امتیازهای گزارش‌شده از همان ابتدا نیز مورد توجه قرار گرفتفورچوندر نسخه‌ای از اطلاعات مربوط به Astra که پیش از عرضه رسمی و تحت توافق محرمانگی در اختیار رسانه‌ها قرار گرفته بود، امتیاز این مدل در ARC-AGI-3 برابر با ۹۸٫۶ درصد اعلام شده بود؛ اما این رقم در وب‌سایت رسمی آزمون به ۹۹٫۹ درصد افزایش یافت.

«آنکا رویل» و «مایک هاردی»، پژوهشگران دکتری هوش مصنوعی در دانشگاه استنفورد، نیز به تغییرات بی‌سروصدای برخی معیارهای منتشرشده از سوی اوپن‌ای‌آی پس از عرضه مدل اعتراض کردند. به گفته آن‌ها، شرکت در مقطعی نرخ توهم مدل را از ۴٫۲ درصد به ۲ درصد کاهش داد، اما بعداً دوباره آن را به رقم قبلی بازگرداند.

بنچمارک‌مکسینگ چیست و چرا پژوهشگران را نگران می‌کند؟

رویل و هاردی در گفت‌وگو با فورچون، تغییرات مکرر اعداد را به پدیده‌ای به نام «بنچمارک‌مکسینگ» (Benchmaxxing) نسبت دادند. این اصطلاح به روشی اشاره دارد که در آن توسعه‌دهندگان بارها آزمون‌ها را با تغییرات جزئی در دستورهای متنی، چارچوب‌های نرم‌افزاری یا میزان محاسبات تکرار می‌کنند تا بالاترین امتیاز نظری ممکن را به دست آورند.

چنین رویکردی می‌تواند باعث شود نتایج منتشرشده بیش از آنکه بازتاب‌دهنده عملکرد معمول مدل باشند، توانایی آن را در شرایط آزمایشگاهی بهینه‌شده نشان دهند.

در مقاله‌ای با عنوان «بنچمارک‌گیری خراب است؛ اجازه ندهید هوش مصنوعی داور خودش باشد» که در سال ۲۰۲۵ منتشر شد، گروهی از پژوهشگران درباره پیامدهای این شیوه هشدار دادند. آن‌ها استدلال کردند که چنین روش‌هایی سردرگمی ایجاد می‌کنند و اعتماد به نتایج ارزیابی را کاهش می‌دهند. این مشکل به‌ویژه زمانی جدی می‌شود که مستندات فنی رسمی، اطلاعات پایه درباره روش آزمایش را منتشر نکنند و راستی‌آزمایی مستقل نتایج را تقریباً ناممکن کننند.

از این منظر، امتیازهای حاصل از بنچمارک‌مکسینگ ممکن است سقف عملکرد نظری مدل را در شرایط آزمایشگاهی بهینه نشان دهند، نه میزان اتکاپذیری آن را در استفاده روزمره و بدون تنظیمات ویژه.

در نتیجه، برای ارزیابی ادعای دستیابی به هوش جامع مصنوعی، صرفاً نگاه‌کردن به بالاترین امتیازهای منتشرشده کافی نیست. باید مشخص باشد مدل در چه شرایطی آزمایش شده، چه میزان تنظیمات اختصاصی دریافت کرده و آیا می‌تواند همان عملکرد را در موقعیت‌های متفاوت نیز حفظ کند.

ارزیابی مستقل درباره Astra چه می‌گوید؟

یافته‌های شرکت مستقل ارزیابی هوش مصنوعی Artificial Analysis با بخشی از نتایج منتشرشده از سوی اوپن‌ای‌آی همخوانی ندارد.

در شاخص هوش Artificial Analysis که معیاری ترکیبی برای ارزیابی توانایی استدلال عمومی مدل‌های پیشرفته محسوب می‌شود، امتیاز GPT-6 Astra برابر با ۶۱ باقی ماند؛ دقیقاً همان امتیازی که GPT-5.6 Sol کسب کرده بود. استرا همچنین در این ارزیابی از مدل‌هایی مانند Claude Fable 5.1 متعلق به آنتروپیک و Muse Spark 1.3 متعلق به متا عقب‌تر بود.

بنابراین، دست‌کم بر اساس این شاخص مستقل، عرضه Astra به افزایش امتیاز هوش عمومی آن نسبت به نسل قبلی منجر نشده است؛ هرچند این نتیجه به‌تنهایی به معنای نبود پیشرفت در تمام قابلیت‌های مدل نیست.

در برخی بنچمارک‌ها، Astra نسبت به نسل قبل پیشرفت کرده، اما در آزمون‌های دیگر عملکرد ضعیف‌تری نشان داده است. یکی از این موارد GDPval-AA است که وظایف واقعی محیط کار را در ۴۴ حوزه شغلی ارزیابی می‌کند و بر کاربردهای اقتصادی توانایی‌های هوش مصنوعی تمرکز دارد.

براساسآزمایش‌های Artificial Analysisجایگاه نسبی Astra در رتبه‌بندی این آزمون در مقایسه با GPT-5.6 Sol به‌طور قابل‌توجهی افت کرده است. افت عملکرد در برخی آزمون‌های دیگر نیز مشاهده شد؛ از جمله ارزیابی‌های مربوط به پشتیبانی مشتریان، برنامه‌نویسی علمی با پایتون و استدلال درباره اسناد طولانی و مجموعه‌های بزرگی از اطلاعات.

این تفاوت‌ها نشان می‌دهند که پیشرفت در یک دسته از وظایف الزاماً به معنای بهبود عملکرد در همه زمینه‌ها نیست. مدل ممکن است در برخی کارهای تخصصی بهتر عمل کند، اما در وظایف دیگری که برای استفاده حرفه‌ای اهمیت دارند، نسبت به نسل قبلی پیشرفت نکند یا حتی ضعیف‌تر شود.

آیا رسیدن به هوش جامع مصنوعی مهم‌ترین مسئله است؟

«دیوید وود»، رئیس سازمان غیرانتفاعی London Futurists که نشست‌هایی درباره فناوری‌های نوظهور برگزار می‌کند، معتقد است اهمیت Astra را نباید فقط با امتیازهای آن در آزمون‌ها سنجید. از نظر او، این مدل نشان‌دهنده تغییری اساسی در نحوه تعامل انسان‌ها با هوش مصنوعی است؛ تغییری که در آن سیستم‌ها از پاسخ دادن به پرسش‌ها فراتر می‌روند و می‌توانند در محیط‌های دیجیتال، اهداف پیچیده را به‌صورت مستقل دنبال کنند.

وود می‌گوید: «نتایج چشمگیر بنچمارک‌ها اهمیت دارند، اما آنچه اهمیت بیشتری دارد، ترکیب هوش، خودمختاری، توانایی استفاده از کامپیوتر و قابلیت‌های امنیت سایبری است.» او در ادامه هشدار می‌دهد: «این ترکیب به احتیاط نیز نیاز دارد. هرچه این سیستم‌ها مفیدتر شوند، پیامدهای ناشی از درک نادرست خواسته‌های ما، استفاده نادرست از آن‌ها یا یافتن راه‌هایی برای دور زدن سازوکارهای حفاظتی که برایشان در نظر گرفته‌ایم، جدی‌تر خواهد شد.»

به اعتقاد وود، بحث درباره اینکه آیا Astra را می‌توان نمونه‌ای از هوش جامع مصنوعی دانست، در مقایسه با مسئله کنترل و حکمرانی هوش مصنوعی اهمیت کمتری دارد. از نظر او، سازوکارهای نظارتی و کنترلی باید هم‌پای پیشرفت فنی توسعه پیدا کنند.


مجموع نتایج منتشرشده از GPT-6 Astra تصویری چندوجهی از این مدل ارائه می‌کند: عملکرد بسیار بالا در برخی بنچمارک‌ها، کاهش مصرف توکن در تعدادی از وظایف، بهبود برخی سازوکارهای ایمنی و در مقابل، نبود پیشرفت در یک شاخص مستقل هوش عمومی، افت عملکرد در بعضی آزمون‌های کاربردی و اختلاف قابل‌توجه میان نتایج به‌دست‌آمده با روش‌های ارزیابی متفاوت.

این داده‌ها به‌تنهایی ادعای دستیابی به AGI را اثبات نمی‌کنند و نشان می‌دهند که برای ارزیابی توانایی‌های واقعی مدل، باید فراتر از اعداد تبلیغ‌شده به روش آزمون‌ها و عملکرد آن در شرایط متنوع توجه کرد.

برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.