اخبار هوش مصنوعی

رونمایی گوگل از هوش مصنوعی جمینای ۳.۸ لایو و نسخه تفکر عمیق با سرعت صوت و استدلال تحلیلی خارق‌العاده

گوگل رسما از دو مدل هوش مصنوعی Gemini 3.8 Live و Extended Thinking با تمرکز بر مکالمه صوتی بدون درنگ و حل مسائل پیچیده منطقی و برنامه‌نویسی رونمایی کرد. این رونمایی تازه نشان می‌دهد که گوگل استراتژی خود را در سال ۲۰۲۶ بر بازطراحی ارتباط انسان و ماشین متمرکز کر…

6 دقیقه مطالعه
  • پشتیبانی شبکه
  • هوش مصنوعی
  • مدل
  • گوگل
  • صوتی
  • نسخه
  • Extended
  • می‌دهد
رونمایی گوگل از هوش مصنوعی جمینای ۳.۸ لایو و نسخه تفکر عمیق با سرعت صوت و استدلال تحلیلی خارق‌العاده

خلاصه تحلیلی خبر

گوگل رسما از دو مدل هوش مصنوعی Gemini 3.8 Live و Extended Thinking با تمرکز بر مکالمه صوتی بدون درنگ و حل مسائل پیچیده منطقی و برنامه‌نویسی رونمایی کرد. این رونمایی تازه نشان می‌دهد که گوگل استراتژی خود را در سال ۲۰۲۶ بر بازطراحی ارتباط انسان و ماشین متمرکز کر…

موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، مدل، گوگل، صوتی، نسخه


گوگل رسما از دو مدل هوش مصنوعی Gemini 3.8 Live و Extended Thinking با تمرکز بر مکالمه صوتی بدون درنگ و حل مسائل پیچیده منطقی و برنامه‌نویسی رونمایی کرد.

این رونمایی تازه نشان می‌دهد که گوگل استراتژی خود را در سال ۲۰۲۶ بر بازطراحی ارتباط انسان و ماشین متمرکز کرده است. پس از ماه‌ها انتظار و ارزیابی نسخه آزمایشی که در کنارمدل سبک جمینای ۳.۸ فلشمعرفی شده بود، اهالی مانتین ویو اکنون محصولی را به میدان آورده‌اند که ادراک شنیداری و بینایی را به شکلی طبیعی و بدون وقفه درهم می‌آمیزد. کارشناسان ما در رسانه XNET معتقدند این رویکرد، پاسخی روشن به نیاز روزافزون پردازش‌های بلادرنگ در صنایع پیشرفته است.

کالبدشکافی معماری صوتی و جهش استدلال در اکوسیستم گوگل


شایعات و اطلاعات پیشین که پیرامونافشای اطلاعات جمینای ۴ پرودر محافل خبری مطرح شده بود، همگی به چنین جهشی اشاره داشتند. حالا این دو مدل مستقل اما مکمل، برای طیف وسیعی از کاربران، از توسعه‌دهندگان سیستم‌های خودکار تا محققان ریاضیات محض، در دسترس قرار گرفته‌اند تا الگوی نوینی از محاسبات شناختی را به نمایش بگذارند. برای درک بهتر کاربردهای عملی این ابزارها، مطالعهراهنمای جمینای برای دانشجویاننیز می‌تواند نحوه بهره‌برداری آموزشی از این مدل‌ها را آشکار کند.

گوگل با انتشاربیانیه رسمی گوگل در شبکه ایکسبر تعهد خود برای ساخت هوش مصنوعی پاسخگو، ایمن و قابل‌فهم تاکید کرد و جزییات فنی این شاهکار مهندسی را نیز دروبلاگ رسمی گوگلبه اشتراک گذاشت.

نمودار پراکندگی مقایسه نسبت تجربه به دقت (Experience to accuracy) در بنچمارک Eva Bench برای مدل‌های مختلف Gemini و GPT Realtime.


شاهکار تعامل صوتی با Gemini 3.8 Live

بزرگ‌ترین مانع در نسل‌های قبلی دستیارهای صوتی، تاخیر آزاردهنده در پردازش و ناتوانی در درک تنفس و لحن طبیعی انسان بود. مدل Gemini 3.8 Live این محدودیت تاریخی را برای همیشه پشت سر گذاشته است. بر اساس آزمایش‌های آزمایشگاهی گوگل دیپ‌مایند، تاخیر پردازش انتها به انتها در این نسخه به رقم استثنایی ۱۶۰ میلی‌ثانیه کاهش یافته است. این سرعت عملا سریع‌تر از زمان واکنش عصبی طبیعی انسان در مکالمات پرانرژی است.

دیمیس حسابیس، مدیر ارشد گوگل دیپ‌مایند، در این زمینه تصریح کرد که مدل لایو صرفا کلمات را به متن و سپس به پاسخ تبدیل نمی‌کند، بلکه صدا را به عنوان ورودی بومی پردازش کرده و احساسات نهفته، مکث‌ها و لحن کاربر را بدون وقفه تشخیص می‌دهد.

این سیستم می‌تواند سخن کاربر را حین صحبت قطع کند، خنده‌ها و شوخی‌ها را درک کند و حتی تپق‌های کلامی روزمره را اصلاح نماید. قابلیت بینایی همزمان در این مدل به دوربین اجازه می‌دهد تا محیط را بی‌درنگ اسکن کرده و به موازات صحبت صوتی، اطلاعات اشیای روبه‌رو را تحلیل کند.

نمودار مقایسه عملکرد مدل‌های Gemini 3.8 Live در شاخص گفتار به گفتار (Speech to Speech Index) در برابر رقبا


تفکر گام‌به‌گام با Gemini 3.8 Extended Thinking


در نقطه مقابلِ سرعت برق‌آسای مدل صوتی، نسخه Extended Thinking برای صبر، تامل و استدلال سنگین طراحی شده است. این نسخه از معماری جدید درخت جستجوی پویا بهره می‌برد. به جای تولید سریع کلمات بعدی، مدل پیش از ارائه خروجی، شاخه‌های مختلف پاسخ را در ذهن ماشینی خود بررسی کرده و درستی فرضیات را با شبیه‌سازی منطقی می‌سنجد.

آمارهای ثبت‌شده در ارزیابی‌های بین‌المللی نشان می‌دهند این مدل در بنچمارک معتبر ریاضی MATH-500 به دقت باورنکردنی ۹۴.۸ درصد دست یافته و در ارزیابی دشوار حل باگ‌های نرم‌افزاری SWE-bench موفق به حل ۷۲.۴ درصد چالش‌های سطح ارشد شده است. این یعنی سیستم نه فقط کد می‌نویسد، بلکه پیش از تحویل، سناریوهای خرابی و امنیت کد را شبیه‌سازی می‌کند.

ساندار پیچای، مدیرعامل آلفابت، در توصیف توان این ابزار اعلام کرد که قابلیت تفکر ممتد به دانشمندان و مهندسان امکان می‌دهد پیچیده‌ترین مسائل ژنتیک و بهینه‌سازی کوانتومی را که نیازمند ساعت‌ها تفکر تحلیلی بود، در چند دقیقه به راه‌حل‌های عملیاتی برسانند.

نمودار ستونی مقایسه هزینه هر ساعت ورودی صوتی در مدل‌های مختلف Gemini 3.8 Live با مدل‌های Grok Voice و GPT Live-1 Astra


جدول مقایسه مشخصات فنی و عملکردی مدل‌های جدید

شاخص فنی و کاربردیGemini 3.8 LiveGemini 3.8 Extended Thinking
هدف اصلی معماریتعامل بدون تاخیر چندحالته صوتیاستدلال عمیق منطقی و حل مسائل سخت
میانگین زمان تاخیر۱۶۰ میلی‌ثانیهبسته به پیچیدگی بین ۵ تا ۴۰ ثانیه
ورودی‌های بومیصوت، ویدیو زنده، متن و تصویرمتن تحلیلی، کد منبع و داده‌های آماری
امتیاز در آزمون استدلال۸۲.۱ درصد۹۴.۸ درصد
عملکرد در مهندسی نرم‌افزارتولید اسکریپت‌های سریع روزمرهحل ساختاری خطاهای سامانه‌های بزرگ
بستر اجرایی بهینهدستگاه‌های لبه، گوشی هوشمند و وبسرورهای ابری با شتاب‌دهنده‌های TPU v6


تحلیل فنی: تغییر پارادایم از حدس کلمه به تعقل ماشینی


از دیدگاه روزنامه‌نگاری فناوری، رونمایی امروز گوگل تنها یک به‌روزرسانی عددی نیست، بلکه گواهی بر تغییر رویکرد جهان هوش مصنوعی در سال ۲۰۲۶ است. در سال‌های گذشته، شرکت‌ها صرفا ابعاد مدل‌ها را بزرگ‌تر می‌کردند؛ اما مصرف تصاعدی انرژی نشان داد که این مسیر بن‌بست است. راه‌حل جایگزین، مدل‌های شناختی دوگانه است: یکی سریع و شهودی مانند Live برای کارهای روزمره، و دیگری آهسته و متفکر مانند Extended Thinking برای امور راهبردی.

مدل تفکر ممتد گوگل توانایی خوداصلاحی دارد. هنگامی که مسئله‌ای دشوار در ریاضی یا شیمی به آن داده می‌شود، مراحل استدلال را به طور شفاف ثبت می‌کند و اگر در مرحله سوم به تناقض برخورد کند، مسیر را برمی‌گردد و گزینه دیگری را تست می‌کند. این فرآیند شباهت خیره‌کننده‌ای به کارکرد قشر پیش‌پیشانی مغز انسان دارد.

مسیر آینده هوش عمومی با تکیه بر تصمیم‌گیری شناختی


گوگل اعلام کرده است که دسترسی به نسخه صوتی از طریق سرویس‌های ابری و اپلیکیشن اختصاصی با اولویت مشترکان سازمانی آغاز می‌شود. همچنین رابط برنامه‌نویسی هر دو مدل برای توسعه‌دهندگان شخص‌ثالث در گوگل ای‌آی استودیو فعال شده است.

این تحول بی‌شک بازار پشتیبانی مشتریان، آموزش شخصی‌سازی‌شده و مهندسی داده را زیر و رو خواهد کرد. ترکیب مکالمه روان با قدرت استدلال تحلیلی نشان می‌دهد که دستیارهای نسل جدید دیگر صرفا پاسخ‌دهنده نیستند، بلکه به همکارانی کارآمد در کنار انسان بدل شده‌اند.


سوالات متداول

۱.مدل Gemini 3.8 Live چه تفاوتی با دستیارهای صوتی قدیمی دارد؟

این مدل با تاخیر ۱۶۰ میلی‌ثانیه‌ای صدا را بدون نیاز به تبدیل به متن درک کرده و لحن و احساسات را بی‌درنگ تحلیل می‌کند.

۲.کاربرد اصلی نسخه Extended Thinking چیست؟

این مدل برای حل مسائل پیچیده ریاضی، مهندسی نرم‌افزار سنگین و فرآیندهای علمی که نیازمند تامل و بازنگری منطقی هستند کاربرد دارد.

پرسش ۳: آیا امکان قطع صحبت هوش مصنوعی در حین مکالمه زنده وجود دارد؟

پاسخ: بله، این فناوری مکث‌ها و حرف‌های میان‌کلامی کاربر را متوجه می‌شود و بلافاصله مسیر گفت‌وگو را بر اساس فرمان جدید تغییر می‌دهد.

۴.عملکرد نسخه تفکر ممتد در کدنویسی چگونه ارزیابی شده است؟

در آزمون استاندارد چالش‌های مهندسی نرم‌افزار، این نسخه توانسته بیش از ۷۲ درصد مسائل سخت را بدون خطا شبیه‌سازی و حل کند.

۵.کاربران عادی چه زمانی به این دو مدل هوش مصنوعی دسترسی خواهند داشت؟

عرضه این مدل‌ها ابتدا در اپلیکیشن جمینای برای کاربران فعال آغاز شده و به تدریج در سراسر سرویس‌های گوگل گسترش می‌یابد.

برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.