زومیا؛ هوش مصنوعی

رونمایی آنتروپیک از Claude Sonnet 5.5؛ جهش خیره‌کننده در کدنویسی با سرعت بالاتر و هزینه کمتر

آنتروپیک با معرفی Claude Sonnet 5.5 جهشی بزرگ در سرعت و هوش کدنویسی رقم زد؛ مدلی که با هزینه‌ی کمتر، توانایی‌های بیشتری دارد. آنتروپیک دومین عضو از خانواده‌ی مدل‌های جدید خود را با نام Claude Sonnet 5.5 به نمایش گذاشت . مدل یادشده ارتقای چشمگیری نسبت به Sonnet…

4 دقیقه مطالعه
  • پشتیبانی شبکه
  • هوش مصنوعی
  • Sonnet
  • مدل
  • می‌دهد
  • امتیاز
  • Opus
  • Claude
رونمایی آنتروپیک از Claude Sonnet 5.5؛ جهش خیره‌کننده در کدنویسی با سرعت بالاتر و هزینه کمتر

خلاصه تحلیلی خبر

آنتروپیک با معرفی Claude Sonnet 5.5 جهشی بزرگ در سرعت و هوش کدنویسی رقم زد؛ مدلی که با هزینه‌ی کمتر، توانایی‌های بیشتری دارد. آنتروپیک دومین عضو از خانواده‌ی مدل‌های جدید خود را با نام Claude Sonnet 5.5 به نمایش گذاشت . مدل یادشده ارتقای چشمگیری نسبت به Sonnet…

موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، Sonnet، مدل، می‌دهد، امتیاز

اپلیکیشن هوش مصنوعی کلود آنتروپیک

آنتروپیک با معرفی Claude Sonnet 5.5 جهشی بزرگ در سرعت و هوش کدنویسی رقم زد؛ مدلی که با هزینه‌ی کمتر، توانایی‌های بیشتری دارد.

آنتروپیک دومین عضو از خانواده‌ی مدل‌های جدید خود را با نام Claude Sonnet 5.5به نمایش گذاشت. مدل یادشده ارتقای چشمگیری نسبت به Sonnet 5 به شمار می‌رود و ضمن اجرای بیش از ۳۰ درصد سریع‌تر دستورها، هزینه‌ی پردازش اکثر کارها را تا حدود ۳۰ درصد کاهش می‌دهد.

هوش مصنوعی Claude Sonnet 5.5 به‌عنوان مکملی سریع‌تر و اقتصادی‌تر برای Claude Opus 5.5 طراحی شده است. مدل پرچمدار Opus 5.5 برای وظایف بسیار پیچیده و نیازمند قضاوت عمیق به کار می‌رود، درحالی‌که Sonnet 5.5 بالاترین توان خود را در وظایف روزمره‌ی مشخص، رفع باگ‌های نرم‌افزاری و تولید اسناد، ارائه‌ها و صفحات گسترده‌ی حرفه‌ای نشان می‌دهد.

آنتروپیک همچنین اعلام کرده است که مدل سبک‌تر Claude Haiku 5.5 برای پردازش‌های حجیم و حساس به هزینه طی هفته‌های آینده در دسترس قرار خواهد گرفت.

عملکرد Sonnet 5.5 در آزمون‌های تخصصی برنامه‌نویسی بهبود چشمگیری را ثبت کرده است. مدل جدید در بنچمارک Terminal-Bench 4.0 که توانایی‌های عامل‌محور در محیط ترمینال را می‌سنجد، به امتیاز ۷۰٫۶ درصد دست یافت؛ عددی که در مقایسه با امتیاز ۱۰٫۳ درصدی نسل پیشین یک جهش کامل محسوب می‌شود.

همچنین در آزمون CursorBench که بر اساس نشست‌های واقعی کدنویسی در محیط Cursor طراحی شده، بهترین امتیاز ثبت‌شده با مدل پرچمدار Opus 5.5 تنها حدود دو امتیاز فاصله دارد. در ارزیابی FrontierCode با سطح تلاش بالا، امتیاز به دست آمده ۱۰ واحد فراتر از Sonnet 5 بود، آن هم با هزینه‌ای معادل یک‌پانزدهم پردازش قبلی.

Anthropic

برنامه‌نویسان در آزمایش‌های اولیه متوجه شدند که مدل تازه با درک سریع‌تر ساختار پایگاه کد و تجمیع هوشمندانه‌ی فراخوانی ابزارها، تعداد مراحل اجرای دستور و در نتیجه هزینه‌ها را به حداقل می‌رساند. علاوه بر برنامه‌نویسی، شاخص GDPval-AA که عملکرد مدل‌ها را در ۴۴ شغل و ۹ صنعت بزرگ ارزیابی می‌کند، توانایی Sonnet 5.5 را نزدیک به Opus 5.5 و حدود ۴۰۰ امتیاز بالاتر از Sonnet 5 نشان می‌دهد.

از سوی دیگر، این پردازشگر متنی و بصری نخستین مدل از سری خود به حساب می‌آید که بازی Pokémon Red را صرفا بر اساس تحلیل تصاویر اسکرین‌شات با موفقیت به پایان رساند و در تحلیل کارهای بلندمدت فراتر از GPT-6 Sol عمل کرد.

سرعت تولید خروجی در Sonnet 5.5 بیش از ۳۰ درصد سریع‌تر از مدل گذشته گزارش شده و به دلیل نیاز به تعداد توکن‌های کمتر برای به سرانجام رساندن هر درخواست، استفاده از آن صرفه‌ی اقتصادی قابل توجهی دارد.

توسعه‌دهندگان می‌توانند میزان تلاش و زمان تفکر مدل را بر اساس نیاز خود تنظیم کنند؛ تنظیمات پایین‌تر برای امور روتین به کار می‌رود و تنظیمات بالاتر به مدل اجازه می‌دهد با استدلال عمیق‌تر، خروجی را پیش از نمایش بازبینی کند.

جدول زیر مقایسه‌ی نرخ پردازش هر یک میلیون توکن را میان مدل‌های جدید نشان می‌دهد.

نوع توکن بر اساس یک میلیون

Claude Sonnet 5.5

Claude Opus 5.5

خوانش از کش (Cache reads)

$0.20

$0.20

نوشتن در کش (Cache writes)

$2.50

$5

توکن ورودی (Input tokens)

$2

$4

توکن خروجی (Output tokens)

$10

$20

ممیزیِ رفتاری خودکار آنتروپیک در قالب حدود ۱٬۸۵۰ سناریوی مختلف نشان می‌دهد Sonnet 5.5 از نظر صداقت، مقاومت در برابر سوءاستفاده و هم‌ترازی با اهداف کاربر در سطح بسیار بالایی قرار دارد.

به دلیل ارتقای توان سایبری مدل تا سطحی نزدیک به Opus 5، قابلیت‌های حفاظتی ویژه‌ای به آن اضافه شده است. چنانچه درخواستی دارای ریسک سایبری بالا ارزیابی شود، پردازش به‌صورت خودکار به Sonnet 5 ارجاع داده خواهد شد، هرچند کدنویسی و رفع باگ‌های روزمره‌ی نرم‌افزاری با محدودیتی مواجه نمی‌شود. متخصصان امنیت می‌توانند برای دسترسی به قابلیت‌های پیشرفته‌تر از طریق برنامه‌ی تأیید سایبری اقدام کنند.

نمودار خطی مقایسه امتیاز Elo مدل‌های Sonnet 5.5 و Opus 5.5 و Sonnet 5 و GPT-6 Sol
نمودار مقایسه امتیاز مدل‌های Sonnet 5.5 و Opus 5.5 و Sonnet 5 در بنچمارک CursorBench 4.0
نمودار مقایسه امتیاز و هزینه مدل‌های Sonnet 5.5 و Opus 5.5 و Sonnet 5 و GPT-6 Sol
نمودار مقایسه امتیاز کدنویسی مدل‌های Sonnet 5.5 و Opus 5.5 و سایر مدل‌ها

تمهیدات ایمنی زیستی نیز مشابه نسل قبل حفظ شده تا از خطرات بالقوه جلوگیری شود. افزون بر این، برای جلوگیری از حملات تقطیر داده که طی آن مهاجمان با حساب‌های متعدد تلاش می‌کنند خروجی مدل‌های قدرتمند را استخراج و شبیه‌سازی کنند، طبقه‌بندی‌کننده‌های ایمنی جدیدی مستقر شده‌اند که تفکر حفظ‌شده‌ی مدل را به همان حساب کاربری اولیه متصل نگه می‌دارند.

به نظر شما کاهش هزینه و ارتقای چشمگیر هوش کدنویسی در مدل‌های جدید چقدر فرآیند توسعه نرم‌افزار را دگرگون خواهد کرد؟

برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.