مدل هوشمصنوعی Claude Sonnet 5.5 آنتروپیک با تمرکز بر کدنویسی و کارهای روزمره معرفی شد
مدل هوشمصنوعی Claude Sonnet 5.5 آنتروپیک با تمرکز بر کدنویسی و کارهای روزمره معرفی شد مدل هوشمصنوعی Claude Sonnet 5.5 آنتروپیک با افزایش سرعت و کاهش هزینهها برای کارهای روزمره و بهبود بیسابقه در کدنویسی رونمایی شد. شرکت آنتروپیک (Anthropic)، یکی از پیشروان…
خلاصه تحلیلی خبر
مدل هوشمصنوعی Claude Sonnet 5.5 آنتروپیک با تمرکز بر کدنویسی و کارهای روزمره معرفی شد مدل هوشمصنوعی Claude Sonnet 5.5 آنتروپیک با افزایش سرعت و کاهش هزینهها برای کارهای روزمره و بهبود بیسابقه در کدنویسی رونمایی شد. شرکت آنتروپیک (Anthropic)، یکی از پیشروان…
موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، امنیت سایبری، Sonnet، مدل، Opus
مدل هوشمصنوعی Claude Sonnet 5.5 آنتروپیک با تمرکز بر کدنویسی و کارهای روزمره معرفی شد
مدل هوشمصنوعیClaude Sonnet 5.5آنتروپیک با افزایش سرعت و کاهش هزینهها برای کارهای روزمره و بهبود بیسابقه در کدنویسی رونمایی شد.
شرکتآنتروپیک(Anthropic)، یکی از پیشروان توسعه مدلهای زبانی بزرگ، اخیراً دومین عضو از خانوادهی قدرتمندClaude 5.5خود را معرفی کرده است. این مدل جدید با نام Sonnet 5.5، بهطور خاص برای وظایف روزمره با دامنه مشخص و کارایی بالا طراحی شده است. در حالی که مدل Opus 5.5 برای کارهای پیچیده و نیازمند قضاوت دقیق کاربرد دارد، Sonnet 5.5 تعادلی عالی بین قدرت و کارایی ارائه میدهد. مدل Haiku 5.5 نیز بهزودی برای کاربردهای حجیم و کمهزینه به این خانواده اضافه خواهد شد.
قابلیتهای بهبودیافته Claude Sonnet 5.5
Claude Sonnet 5.5پیشرفتهای چشمگیری نسبت به مدل Sonnet 5 در زمینههای عملکرد، کدنویسی، کار دانشبنیان، وظایف طولانیمدت، درک تصاویر، همکاری، سرعت و کارایی از خود نشان داده است. آنتروپیک نتایج زیر را گزارش کرده است
- Terminal-Bench 4.0امتیاز ۷۰٫۶٪ برای Sonnet 5.5 در مقایسه با ۱۰٫۳٪ برای Sonnet 5.
- GDPval-AASonnet 5.5 تنها دو امتیاز کمتر از Opus 5.5 کسب کرده است.
- وظایف طولانیمدتSonnet 5.5 در کارهای دانشبنیان با افق زمانی طولانی، بهتر از Sonnet 5 و GPT-6 Sol عمل میکند.
- درک تصاویراین اولین مدل Sonnet است که تنها با استفاده از اسکرینشاتها توانسته بازیپوکمون رد (Pokémon Red)را شکست دهد.
Sonnet 5.5میتواند در سطوح تلاش مختلفی عمل کند که تعادل بین هزینه، سرعت و کیفیت خروجی را تغییر میدهد. آنتروپیک اعلام کرده است در چندین ارزیابی، Sonnet 5.5 با حداکثر تلاش (Max effort) عملکردی مشابه Opus 5.5 ارائه داده، در حالی که با تلاش پایین یا متوسط (Low or Medium effort)، میتواند بهترین امتیاز Sonnet 5 را در برخی بنچمارکها با حدود یک دهم هزینه هر وظیفه شکست دهد.
کدنویسی پیشرفته و بهبود بهرهوری
آنتروپیک همچنین نتایج چشمگیری در زمینهی کدنویسی برای Sonnet 5.5 گزارش کرده است
- FrontierCodeدر سطح تلاش بالا (High effort)، این مدل ۱۰ امتیاز بیشتر از Sonnet 5 در همین تنظیمات کسب کرده و هزینه هر وظیفه را به حدود یک پانزدهم کاهش داده است.
- CursorBenchبهترین امتیاز آن در وظایف برگرفته از جلسات کدنویسی واقعی Cursor، تنها حدود دو امتیاز با Opus 5.5 فاصله دارد.
آزمایشکنندگان اولیه گزارش دادند کهSonnet 5.5میتواند به سرعت یک پایگاه کد (codebase) را درک کند. در آزمایشهای مستقیم، این مدل همچنین فراخوانی ابزارها را بیشتر از Sonnet 5 دستهبندی میکرد که منجر به گامهای کمتر و هزینههای پایینتر میشد.
کار دانشبنیان و تواناییهای جدید
Sonnet 5.5در چندین حوزهی کار دانشبنیان نیز بهبود یافته است. آنتروپیک گزارش داد که این مدل در GDPval-AA، که وظایف دنیای واقعی را در ۴۴ شغل و ۹ صنعت اصلی پوشش میدهد، تقریباً همسطح Opus 5.5 عمل کرده و حدود ۴۰۰ امتیاز بالاتر از Sonnet 5 قرار گرفته است. این مدل همچنین در استفاده از کامپیوتر و تشخیص نمودارها به Opus 5.5 نزدیک است و در کارهای دانشبنیان طولانیمدت، عملکردی بهتر از Sonnet 5 و GPT-6 Sol از خود نشان میدهد.
آزمایشکنندگان اولیه نیز تغییراتی را در مکالمات و وظایف مرتبط با طراحی گزارش کردند، از جمله پیروی از قالبهای اسلاید هنگام ساخت ارائهها. در یک آزمایش داخلی، آنتروپیک مواد درآمد فصلی و رونوشتهای تماس یک شرکت عمومی را به همراه یک قالب اسلاید در اختیارSonnet 5.5قرار داد و از آن خواست یک بررسی عملیاتی ۱۰ اسلایدی ایجاد کند؛ دو کارشناس، پیشنویس اولیه را بدون نیاز به ویرایش بیشتر آماده ارسال تشخیص دادند.
بیشتر بخوانیدهزینه و سرعت: ۳۰٪ سریعتر و ارزانتر
Sonnet 5.5از همان قیمتگذاری توکن Sonnet 5 استفاده میکند، اما آنتروپیک اعلام کرده است که معمولاً برای تکمیل همان کار به توکنهای کمتری نیاز دارد. در آزمایشهای این شرکت، این موضوع منجر به کاهش هزینههای وظیفه تا ۳۰٪ نسبت به مدل قبلی شده است. قیمتگذاری توکن به شرح زیر است
| قیمت هر ۱ میلیون توکن | Claude Sonnet 5.5 | Claude Opus 5.5 |
|---|---|---|
| خواندن حافظه پنهان | ۰٫۲۰ دلار | ۰٫۲۹ دلار |
| نوشتن حافظه پنهان | ۲٫۵۰ دلار | ۵ دلار |
| توکن ورودی | ۲ دلار | ۴ دلار |
| توکن خروجی | ۱۰ دلار | ۲۰ دلار |
Sonnet 5.5خروجیها را بیش از ۳۰٪ سریعتر از Sonnet 5 تولید میکند و آنتروپیک آن را سریعترین مدل Sonnet تا به امروز میداند. کاربران میتوانند سطح تلاش را برای ایجاد تعادل بین هزینه، سرعت و کیفیت خروجی تنظیم کنند. تنظیمات پیشفرض تلاش عبارتند از
- Claude Codeمتوسط
- برنامههای آنتروپیکمتوسط
- پلتفرم Claudeبالا
در تنظیمات پایینتر، مدل سریعتر پاسخ میدهد و توکنهای کمتری مصرف میکند. در تنظیمات بالاتر، مدل برای مدت طولانیتری استدلال میکند و کار خود را با دقت بیشتری بررسی میکند.
امنیت و همترازی
آنتروپیک اعلام کرد که Sonnet 5.5 قابلیتهای مدلهای پیشین را فراتر نمیبرد، بنابراین ارزیابی همترازی آن بر روی خطرات مربوط به مدلها در سطوح مختلف توانایی متمرکز بود. این ارزیابی شامل خطراتی مانند: اقدام علیه منافع کاربران، گمراه کردن کاربران و همکاری در سوءاستفادههای پرخطر میشد.
بازرسی خودکار رفتاری آنتروپیک تقریباً ۱۸۵۰ سناریو را پوشش میدهد.Sonnet 5.5در اکثر معیارهای همترازی، مقاومت در برابر سوءاستفاده و صداقت، بهتر از Sonnet 5 عمل میکند یا با آن مطابقت دارد. در ارزیابیهای جدیدتر مهار، Sonnet 5.5 از نظر دفعات تلاش برای فرار از sandbox خود، به Opus 5.5 نزدیک شده است. آنتروپیک همچنین اعلام کرد که Sonnet 5.5 کمترین احتمال را در بین مدلهای آزمایششده برای بررسی محدودیتهای کانتینرهای خود داشت. در مجموع بازرسی، Opus 5.5 کمی بهتر عمل کرد.
حفاظتهای امنیتی قویتر
قابلیتهای امنیت سایبریSonnet 5.5پیشرفت بزرگی نسبت به Sonnet 5 محسوب میشود و با Opus 5 قابل مقایسه است. به همین دلیل، آنتروپیک این مدل را با حفاظتهایی مشابه آنچه برای Opus 5.5 استفاده میشود، مستقر میکند.
برای امنیت سایبری، این حفاظتها شامل موارد زیر است
- توسعه نرمافزار روتین و رفع اشکالات همچنان پشتیبانی میشوند.
- وظایف امنیت سایبری با ریسک بالاتر به Sonnet 5 ارجاع داده میشوند.
- مدافعان سایبری به زودی میتوانند برای برنامه تأیید سایبری (Cyber Verification Program) گسترده درخواست دهند. این برنامه دسترسی چندسطحی به قابلیتهای پیشرفته در مدلهای Sonnet 5.5، Opus 5.5 و Claude Mythos را فراهم میکند.
برای زیستشناسی، Sonnet 5.5 از همان حفاظتهای Sonnet 5 استفاده میکند که درخواستهای مضر را هدف قرار میدهند، در حالی که بیشتر کارهای تحقیقاتی، آموزشی و بالینی تحت تأثیر قرار نمیگیرند. سازمانها میتوانند برای برنامه تأیید علوم زیستی (Life Sciences Verification Program) برای دسترسی به حفاظتهای طراحیشده برای پشتیبانی از طیف کامل کارهای مرتبط با زیستشناسی درخواست دهند.
مقابله با استخراج مدل (Distillation)
آنتروپیک همچنین به خطر استخراج مدل (distillation) پرداخته است؛ روشی که در آن هزاران حساب جعلی میتوانند برای استخراج قابلیتهای یک مدل در مقیاس صنعتی استفاده شوند و به مهاجمان اجازه میدهند مدلهای قدرتمندی را بدون حفاظتهای تعبیهشده در Claude ایجاد کنند.
از آنجا که Sonnet 5.5 بهطور قابل توجهی از مدل قبلی خود توانمندتر است، این اولین مدل Sonnet است که با طبقهبندیکنندههای امنیتی (safety classifiers) عرضه میشود که از استخراج استدلال جلوگیری میکنند. همچنین قابلیت حفظ تفکر (preserved thinking) را گسترش میدهد تا تفکر Claude نتواند از حسابی که آن را ایجاد کرده است، جدا شود. این تدابیر عبارتند از
- طبقهبندیکنندههای امنیتیاز استخراج استدلال از Sonnet 5.5 جلوگیری میکنند.
- تفکر حفظ شدهتفکر Claude نمیتواند از حسابی که آن را ایجاد کرده است، جدا شود.
اکثر توسعهدهندگان متوجه تغییری نخواهند شد، اما انتقال مکالمات بین حسابها ممکن است تحت تأثیر قرار گیرد، از جمله تغییر حسابها در طول یک جلسهClaude Code.
قیمتگذاری و در دسترس بودن
مانند Opus 5.5 و Sonnet 5، مدلClaude Sonnet 5.5با سیاست حفظ صفر داده (zero data retention) در دسترس است. این مدل اکنون در تمام پلتفرمها از جمله آمازون وب سرویسز (Amazon Web Services)، گوگل کلاد (Google Cloud)، مایکروسافت اژور (Microsoft Azure) و پلتفرم Claude در دسترس قرار دارد. توسعهدهندگان میتوانند با شناسه مدلclaude-sonnet-5-5استفاده از Sonnet 5.5 را در پلتفرم Claude آغاز کنند.
برای توسعهدهندگانی که از Sonnet 5 مهاجرت میکنند: اگر قابلیت تفکر خاموش است، باید قبل از انتقال به Sonnet 5.5، به تنظیمات جدیدbetween_toolsسوئیچ کنند. این تنظیم تفکر اولیه را غیرفعال نگه میدارد. آنتروپیک همچنین راهنمای مهاجرتی را برای این انتقال فراهم کرده است. مدل Claude Haiku 5.5 که برای کاربردهای با حجم بالا و حساس به هزینه طراحی شده است، انتظار میرود در هفتههای آینده به خانواده Claude 5.5 بپیوندد.
برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.