Claude Sonnet 5.5؛ سریعتر، ارزانتر و قویتر
آنتروپیک مدل Claude Sonnet 5.5 را بهعنوان دومین مدل خانواده Claude 5.5 معرفی کرد. مدل Claude Sonnet 5.5 در مقایسه با نسل قبلی خود Claude Sonnet 5 بیش از ۳۰ درصد سریعتر است و به دلیل نیاز به مصرف توکنهای کمتر برای انجام یک کار مشابه، هزینه اجرای هر وظیفه نیز…
خلاصه تحلیلی خبر
آنتروپیک مدل Claude Sonnet 5.5 را بهعنوان دومین مدل خانواده Claude 5.5 معرفی کرد. مدل Claude Sonnet 5.5 در مقایسه با نسل قبلی خود Claude Sonnet 5 بیش از ۳۰ درصد سریعتر است و به دلیل نیاز به مصرف توکنهای کمتر برای انجام یک کار مشابه، هزینه اجرای هر وظیفه نیز…
موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، امنیت سایبری، Sonnet، مدل، Opus
آنتروپیک مدل Claude Sonnet 5.5 را بهعنوان دومین مدل خانواده Claude 5.5 معرفی کرد.
مدل Claude Sonnet 5.5 در مقایسه با نسل قبلی خود Claude Sonnet 5 بیش از ۳۰ درصد سریعتر است و به دلیل نیاز به مصرف توکنهای کمتر برای انجام یک کار مشابه، هزینه اجرای هر وظیفه نیز تا ۳۰ درصد کاهش مییابد.
مکمل
Sonnet 5.5 در این خانواده مکمل Claude Opus 5.5 محسوب میشود؛ Opus 5.5 برای کارهای پیچیدهای طراحی شده که به قضاوت دقیق و مستمر نیاز دارند، درحالیکه Sonnet 5.5 بر وظایف روزمره و مشخص، رفع باگ و تولید اسناد، ارائهها و صفحات گسترده با کیفیت بالا تمرکز دارد. آنتروپیک همچنین اعلام کرده است Claude Haiku 5.5، با تمرکز بر کاربردهای پرتعداد و حساس به هزینه، طی هفتههای آینده به این خانواده اضافه خواهد شد.
عملکرد و کدنویسی
Sonnet 5.5 نسبت به نسل قبلی خود در چندین حوزه پیشرفت کرده است. در ارزیابی Terminal-Bench 4.0 که عملکرد عاملهای هوش مصنوعی در کدنویسی را میسنجد، امتیاز Sonnet 5.5 به ۷۰.۶ درصد رسیده، درحالیکه Sonnet 5 امتیاز ۱۰.۳ درصد کسب کرده بود. در GDPval-AA، آزمونی برای سنجش عملکرد در وظایف واقعی طیف متنوعی از مشاغل، Sonnet 5.5 تنها دو امتیاز پایینتر از Opus 5.5 قرار گرفته است. مدل Sonnet 5.5 همچنین در کارهای بلندمدت و درک تصاویر عملکرد قدرتمندی دارد و نخستین مدل خانواده Sonnet است که توانسته بازی Pokémon Red را تنها با استفاده از اسکرینشاتها به پایان برساند.
جهش عملکرد Sonnet 5.5 در کدنویسی قابلتوجه است. Sonnet 5.5 در بنچمارک FrontierCode در سطح تلاش High، ۱۰ امتیاز بیشتر از Sonnet 5 در همان سطح کسب کرد، درحالیکه هزینه هر وظیفه حدود یکپانزدهم آن بود. در CursorBench که وظایفی برگرفته از نشستهای واقعی کدنویسی با Cursor را آزمایش میکند، بهترین امتیاز Sonnet 5.5 حدود دو امتیاز با Opus 5.5 فاصله دارد.
کار دانشمحور و تولید محتوا
Sonnet 5.5 در حوزههای مختلف کار دانشمحور نیز پیشرفت خوبی نشان میدهد. در GDPval-AA که عملکرد مدلها را در وظایف واقعی مربوط به ۴۴ شغل و ۹ صنعت اصلی ارزیابی میکند، امتیاز Sonnet 5.5 تقریباً همسطح Opus 5.5 و حدود ۴۰۰ امتیاز بالاتر از Sonnet 5 بوده است. این مدل در استفاده از رایانه و تشخیص نمودار نیز به Opus 5.5 نزدیک است و در کارهای دانشمحور بلندمدت عملکردی بهتر از Sonnet 5 و GPT-6 Sol داشته است.
آزمایشکنندگان اولیه علاوه بر معیارهای کمی، به بهبودهای کیفی نیز اشاره کردهاند. به گفته آنها، Sonnet 5.5 همراه مکالمهمحور طبیعیتری است و توانایی قابلتوجهی در طراحی دارد. این مدل میتواند به رابطهای کاربری پرداخت بیشتری بدهد و با پیروی از قالبهای آماده اسلاید، ارائههایی تولید کند که به ویرایش بسیار کمی نیاز دارند.
هزینه و سرعت
قیمت Sonnet 5.5 برای هر یک میلیون توکن ورودی ۲ دلار، برای هر یک میلیون توکن خروجی ۱۰ دلار و برای هر یک میلیون توکن خواندهشده از حافظه نهان ۰.۲۰ دلار است؛ یعنی قیمت اسمی آن با Sonnet 5 یکسان است. بااینحال، Sonnet 5.5 برای انجام یک وظیفه معمولاً به توکنهای بسیار کمتری نیاز دارد و در آزمایشهای آنتروپیک هزینه هر وظیفه تا ۳۰ درصد کمتر از نسل قبلی بوده است.
در مقایسه با Opus 5.5، هزینه توکن ورودی و خروجی Sonnet 5.5 نصف شده است؛ Opus 5.5 برای هر میلیون توکن ورودی ۴ دلار و برای خروجی ۲۰ دلار دریافت میکند. هزینه نوشتن در حافظه نهان نیز برای Sonnet 5.5 برابر ۲.۵ دلار و برای Opus 5.5 برابر ۵ دلار است؛ هزینه خواندن از حافظه نهان برای هر دو مدل ۰.۲۰ دلار است.
Sonnet 5.5 بیش از ۳۰ درصد سریعتر از Sonnet 5 خروجی تولید میکند که آن را به سریعترین مدل Sonnet تا امروز تبدیل میکند. سطح effort امکان ایجاد توازن میان هزینه، سرعت و کیفیت را فراهم میکند. در Claude Code و اپلیکیشنهای آنتروپیک، سطح پیشفرض Medium و در پلتفرم Claude سطح پیشفرض High است. در سطوح پایینتر، مدل سریعتر پاسخ میدهد و توکن کمتری مصرف میکند؛ در سطوح بالاتر، مدت بیشتری استدلال کرده و بررسی دقیقتری انجام میدهد.
همکاری، همترازی و ایمنی
Sonnet 5.5 مانند Opus 5.5 نسبت به نسل قبلی، متون شفافتری تولید میکند و آزمایشکنندگان اولیه آن را برای همکاری مناسبتر از Sonnet 5 توصیف کردهاند. سرعت بالاتر آن نیز امکان تکرار سریعتر در وظایف با پیچیدگی کمتر را فراهم میکند.
در ارزیابی رفتاری خودکار آنتروپیک که حدود ۱۸۵۰ سناریو را بررسی میکند، Sonnet 5.5 در بیشتر معیارهای همترازی، مقاومت در برابر سوءاستفاده و صداقت، عملکردی بهتر یا همسطح Sonnet 5 داشته است. در ارزیابیهای جدید containment نیز این مدل از نظر تلاش برای خروج از سندباکس به Opus 5.5 نزدیک بوده و در میان مدلهای آنتروپیک کمترین تمایل را به بررسی محدودیتهای قیدشده نشان داده است. بااینحال، در مجموع Opus 5.5 عملکرد اندکی بهتر داشته است. آنتروپیک اعلام کرده شواهدی پیدا نکرده که Sonnet 5.5 اهدافی برخلاف قصد کاربر را دنبال کند، هرچند تأکید کرده هیچ مجموعهای از ارزیابیها نمیتواند همه خطاهای احتمالی را شناسایی کند.
قابلیتهای امنیت سایبری Sonnet 5.5 نسبت به Sonnet 5 به طور قابلتوجهی افزایش یافته و به همین دلیل این مدل با سازوکارهای ایمنی مشابه Opus 5.5 عرضه شده است. توسعه نرمافزار معمولی و رفع باگ همچنان امکانپذیر است، اما وظایف پرریسکتر امنیت سایبری به Sonnet 5 بازمیگردند. در حوزه زیستشناسی، Sonnet 5.5 همان سازوکارهای حفاظتی مشابه مدل Sonnet 5 را دارد و بیشتر پژوهشها، آموزش و کارهای بالینی تحتتأثیر قرار نمیگیرند.
آنتروپیک همچنین برای مقابله با حملات تقطیر که در آنها مهاجمان با استفاده از هزاران حساب جعلی قابلیتهای مدل را در مقیاس صنعتی استخراج میکنند، برای نخستینبار در یک مدل Sonnet از طبقهبندیکنندههای امنیتی خاصی استفاده کرده است که از استخراج فرایند استدلال جلوگیری میکنند. Sonnet 5.5 همچنین از preserved thinking گستردهتری استفاده میکند تا فرایند تفکر Claude از حسابی که آن را ایجاد کرده جدا نشود.
دسترسی
Claude Sonnet 5.5 اکنون روی همه پلتفرمها از جمله Amazon Web Services، Google Cloud و Microsoft Azure، در دسترس است و توسعهدهندگان میتوانند آن را در پلتفرمClaude با شناسه claude-sonnet-5-5 استفاده کنند. این مدل مانند Opus 5.5 و Sonnet 5 با امکان zero data retention نیز عرضه شده است. کاربرانی که Sonnet را با thinking خاموش اجرا میکردند، پیش از استفاده به Sonnet 5.5 باید از تنظیمات جدید between_tools استفاده کنند تا thinking اولیه همچنان خاموش بماند.
برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.