GPT-6.1 Sol؛ نزدیک به Astra با هزینه کمتر
شرکت OpenAI از GPT-6.1 Sol، نسخه ارتقایافته GPT-6 Sol، رونمایی کرد. مدل GPT-6.1 Sol در زمینههایی مانند کدنویسی عاملمحور، استفاده از رایانه و انجام کارهای حرفهای به سطحی نزدیک به GPT-6 Astra میرسد، اما قیمت توکنهای ورودی و خروجی استاندارد آن حدود یکپنجم A…
خلاصه تحلیلی خبر
شرکت OpenAI از GPT-6.1 Sol، نسخه ارتقایافته GPT-6 Sol، رونمایی کرد. مدل GPT-6.1 Sol در زمینههایی مانند کدنویسی عاملمحور، استفاده از رایانه و انجام کارهای حرفهای به سطحی نزدیک به GPT-6 Astra میرسد، اما قیمت توکنهای ورودی و خروجی استاندارد آن حدود یکپنجم A…
موضوعات اصلی: پشتیبانی شبکه، GPT-6، Sol، درصد، Astra، هزینه
شرکت OpenAI از GPT-6.1 Sol، نسخه ارتقایافته GPT-6 Sol، رونمایی کرد.
مدل GPT-6.1 Sol در زمینههایی مانند کدنویسی عاملمحور، استفاده از رایانه و انجام کارهای حرفهای به سطحی نزدیک به GPT-6 Astra میرسد، اما قیمت توکنهای ورودی و خروجی استاندارد آن حدود یکپنجم Astra است. GPT-6.1 Sol از پنجره زمینه ۱.۰۵ میلیون توکن و حداکثر خروجی ۱۲۸ هزار توکن پشتیبانی میکند و سطوح مختلف استدلال از low تا max را در اختیار توسعهدهندگان قرار میدهد
هزینه
هزینه ورودی کششده نیز تنها ۰.۱۰ دلار بهازای هر یک میلیون توکن است؛ رقمی که ۹۵ درصد کمتر از قیمت ورودی استاندارد و ۵۰ درصد کمتر از ورودی کششده GPT-6 Sol است. این ساختار قیمتگذاری امکان ساخت و اجرای ایجنتهایی را فراهم میکند که میتوانند زمینه و اطلاعات درخواستهای قبلی را مجدداً استفاده کنند.
بنچمارکها
GPT-6.1 Sol در طیفی از وظایف حرفهای نسبت به GPT-6 Sol پیشرفت قابلتوجهی دارد. در بنچمارک DeepSWE v1.1 برای سنجش عملکرد در وظایف پیچیده مهندسی نرمافزار روی کدبیسهای واقعی، GPT-6.1 Sol با هزینهای حدود یکپنجم GPT-6 Astra به سطح عملکرد مشابه میرسد. همچنین در مقایسه با بهترین امتیاز GPT-6 Sol، ۶.۴ واحد درصد عملکرد بهتری ثبت میکند؛ آن هم با سطح تلاش استدلالی و هزینه کمتر.
در ارزیابی GDP.pdf که دقت مدلها را در پاسخگویی به پرسشهای حرفهای بر اساس اسناد PDF پیچیده، شامل جدولها، نمودارها، دیاگرامها و جزئیات ریز میسنجد، GPT-6.1 Sol با هزینهای کمتر از نصف هزینه هر وظیفه، امتیاز بالاتری از Opus 5.5 با fallbackها به دست آورده است. عملکرد آن در این ارزیابی نیز با هزینهای حدود یکپنجم Astra به سطح عملکرد پیشرفته این مدل نزدیک میشود. در AutomationBench برای سنجش توانایی ایجنتها در تکمیل گردشکارهای چندمرحلهای کسبوکار، GPT-6.1 Sol در سطح استدلال متوسط ۲.۲ واحد درصد بالاتر از Opus 5.5 قرار گرفته و هزینه آن حدود یکسوم است. امتیاز آن نسبت به GPT-6 Sol در همین سطح نیز ۴.۸ واحد درصد افزایش یافته است.
در حوزه استفاده از رایانه، GPT-6.1 Sol در مجموعه آفلاین OSWorld 2.0 و در سطح حداکثر تلاش استدلالی، هفت واحد درصد بهتر از GPT-6 Sol عمل کرده و هزینه هر وظیفه آن کمتر از نصف است. عملکرد این مدل تنها ۲.۱ واحد درصد با Astra فاصله دارد، درحالیکه هزینه هر وظیفه حدود یکهفتم Astra است.
کار دانشمحور
در پژوهش علمی نیز GPT-6.1 Sol در Terminal-Bench Science 0.1 که گردشکارهایی مانند تحلیل داده، شبیهسازی و اثبات قضیه را ارزیابی میکند، در حداکثر تلاش استدلالی بیش از دو برابر GPT-6 Sol امتیاز کسب کرده است.
هزینه متوسط هر وظیفه برای GPT-6.1 Sol در حدود ۵.۴۷ دلار است؛ در مقابل، این رقم برای Opus 5.5 برابر با ۲۳.۲۱ دلار و برای Astra برابر با ۲۳.۸۰ دلار است. با وجود این، GPT-6 Astra با امتیاز ۶۸.۱ درصد همچنان بالاترین امتیاز را در میان مدلهای آزمایششده دارد و متن استفاده از آن را برای دشوارترین وظایف پژوهش علمی توصیه میکند.
رونمایی OpenAI از GPT-6 Sol و GPT-6 Luna؛ هوش پیشرفتهتر با هزینه کمتر
GPT-6.1 Sol همچنین از نظر دقت عملی یا factual بهبود یافته است. در سطح پایین تلاش استدلالی، سهم پاسخهای دارای خطای factual از ۱۱.۴ درصد به ۷.۷ درصد کاهش یافته که تقریباً معادل کاهش ۳۲ درصدی است. نرخ خطای آن در سطوح مختلف ارزیابی حداکثر ۱.۹ واحد درصد با Astra فاصله دارد، درحالیکه هزینه هر وظیفه کمتر از یکپنجم است. بااینحال، این آزمونها عمداً بر پرسشهای دشوار و غیرمعمول متمرکز بودهاند و نماینده استفاده معمول نیستند.
ایمنی
در ارزیابیهای همراستایی و ایمنی، GPT-6.1 Sol نسبت به GPT-6 Sol پیشرفت کرده و به GPT-6 Astra نزدیکتر شده است. این مدل محدودیتهای خود را شفافتر بیان میکند و در رعایت قصد کاربر و محدودیتهای ایمنی قابلاعتمادتر است. در آزمونهای چالشبرانگیز، نرخ شکست کمتری در شفافیت درباره خرابی ابزارهای جستوجو، رعایت محدودیتهای صریح و جلوگیری از نتایج غیرمجاز در وظایف عاملمحور نشان داده است و به ادعای OpenAI هیچ تلاشی برای دورزدن ارزیاب خودکار ایمنی مشاهده نشده است.
Claude Opus 5.5؛ جدیدترین عضو آنتروپیک با تمرکز بر عملکرد، بهرهوری و ایمنی
دسترسی
GPT-6.1 Sol از امروز برای کاربران Plus، Pro، Business، Enterprise و Edu در ChatGPT Work و Codex در دسترس است و اما هنوز در چتبات ChatGPT عرضه نشده است. توسعهدهندگان نیز میتوانند از طریق API با نام gpt-6.1-sol به آن دسترسی داشته باشند. قیمت API شامل ۲ دلار برای هر یک میلیون توکن ورودی، ۰.۱۰ دلار برای توکن ورودی کششده و ۱۰ دلار برای هر یک میلیون توکن خروجی است. همچنین نسخه GPT-6.1 Sol Ultrafast با سرعت تولید توکن تا هشت برابر نسخه استاندارد (۳۰۰ توکن بر ثانیه) در Codex و با هزینه اشتراک ماهانه ۵۰۰ دلار عرضه خواهد شد.
برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.