رونمایی گوگل از هوش مصنوعی جمینای ۳.۸ لایو و نسخه تفکر عمیق با سرعت صوت و استدلال تحلیلی خارقالعاده
گوگل رسما از دو مدل هوش مصنوعی Gemini 3.8 Live و Extended Thinking با تمرکز بر مکالمه صوتی بدون درنگ و حل مسائل پیچیده منطقی و برنامهنویسی رونمایی کرد. این رونمایی تازه نشان میدهد که گوگل استراتژی خود را در سال ۲۰۲۶ بر بازطراحی ارتباط انسان و ماشین متمرکز کر…
خلاصه تحلیلی خبر
گوگل رسما از دو مدل هوش مصنوعی Gemini 3.8 Live و Extended Thinking با تمرکز بر مکالمه صوتی بدون درنگ و حل مسائل پیچیده منطقی و برنامهنویسی رونمایی کرد. این رونمایی تازه نشان میدهد که گوگل استراتژی خود را در سال ۲۰۲۶ بر بازطراحی ارتباط انسان و ماشین متمرکز کر…
موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، مدل، گوگل، صوتی، نسخه
گوگل رسما از دو مدل هوش مصنوعی Gemini 3.8 Live و Extended Thinking با تمرکز بر مکالمه صوتی بدون درنگ و حل مسائل پیچیده منطقی و برنامهنویسی رونمایی کرد.
این رونمایی تازه نشان میدهد که گوگل استراتژی خود را در سال ۲۰۲۶ بر بازطراحی ارتباط انسان و ماشین متمرکز کرده است. پس از ماهها انتظار و ارزیابی نسخه آزمایشی که در کنارمدل سبک جمینای ۳.۸ فلشمعرفی شده بود، اهالی مانتین ویو اکنون محصولی را به میدان آوردهاند که ادراک شنیداری و بینایی را به شکلی طبیعی و بدون وقفه درهم میآمیزد. کارشناسان ما در رسانه XNET معتقدند این رویکرد، پاسخی روشن به نیاز روزافزون پردازشهای بلادرنگ در صنایع پیشرفته است.
کالبدشکافی معماری صوتی و جهش استدلال در اکوسیستم گوگل
شایعات و اطلاعات پیشین که پیرامونافشای اطلاعات جمینای ۴ پرودر محافل خبری مطرح شده بود، همگی به چنین جهشی اشاره داشتند. حالا این دو مدل مستقل اما مکمل، برای طیف وسیعی از کاربران، از توسعهدهندگان سیستمهای خودکار تا محققان ریاضیات محض، در دسترس قرار گرفتهاند تا الگوی نوینی از محاسبات شناختی را به نمایش بگذارند. برای درک بهتر کاربردهای عملی این ابزارها، مطالعهراهنمای جمینای برای دانشجویاننیز میتواند نحوه بهرهبرداری آموزشی از این مدلها را آشکار کند.
گوگل با انتشاربیانیه رسمی گوگل در شبکه ایکسبر تعهد خود برای ساخت هوش مصنوعی پاسخگو، ایمن و قابلفهم تاکید کرد و جزییات فنی این شاهکار مهندسی را نیز دروبلاگ رسمی گوگلبه اشتراک گذاشت.
شاهکار تعامل صوتی با Gemini 3.8 Live
بزرگترین مانع در نسلهای قبلی دستیارهای صوتی، تاخیر آزاردهنده در پردازش و ناتوانی در درک تنفس و لحن طبیعی انسان بود. مدل Gemini 3.8 Live این محدودیت تاریخی را برای همیشه پشت سر گذاشته است. بر اساس آزمایشهای آزمایشگاهی گوگل دیپمایند، تاخیر پردازش انتها به انتها در این نسخه به رقم استثنایی ۱۶۰ میلیثانیه کاهش یافته است. این سرعت عملا سریعتر از زمان واکنش عصبی طبیعی انسان در مکالمات پرانرژی است.
دیمیس حسابیس، مدیر ارشد گوگل دیپمایند، در این زمینه تصریح کرد که مدل لایو صرفا کلمات را به متن و سپس به پاسخ تبدیل نمیکند، بلکه صدا را به عنوان ورودی بومی پردازش کرده و احساسات نهفته، مکثها و لحن کاربر را بدون وقفه تشخیص میدهد.
این سیستم میتواند سخن کاربر را حین صحبت قطع کند، خندهها و شوخیها را درک کند و حتی تپقهای کلامی روزمره را اصلاح نماید. قابلیت بینایی همزمان در این مدل به دوربین اجازه میدهد تا محیط را بیدرنگ اسکن کرده و به موازات صحبت صوتی، اطلاعات اشیای روبهرو را تحلیل کند.
تفکر گامبهگام با Gemini 3.8 Extended Thinking
در نقطه مقابلِ سرعت برقآسای مدل صوتی، نسخه Extended Thinking برای صبر، تامل و استدلال سنگین طراحی شده است. این نسخه از معماری جدید درخت جستجوی پویا بهره میبرد. به جای تولید سریع کلمات بعدی، مدل پیش از ارائه خروجی، شاخههای مختلف پاسخ را در ذهن ماشینی خود بررسی کرده و درستی فرضیات را با شبیهسازی منطقی میسنجد.
آمارهای ثبتشده در ارزیابیهای بینالمللی نشان میدهند این مدل در بنچمارک معتبر ریاضی MATH-500 به دقت باورنکردنی ۹۴.۸ درصد دست یافته و در ارزیابی دشوار حل باگهای نرمافزاری SWE-bench موفق به حل ۷۲.۴ درصد چالشهای سطح ارشد شده است. این یعنی سیستم نه فقط کد مینویسد، بلکه پیش از تحویل، سناریوهای خرابی و امنیت کد را شبیهسازی میکند.
ساندار پیچای، مدیرعامل آلفابت، در توصیف توان این ابزار اعلام کرد که قابلیت تفکر ممتد به دانشمندان و مهندسان امکان میدهد پیچیدهترین مسائل ژنتیک و بهینهسازی کوانتومی را که نیازمند ساعتها تفکر تحلیلی بود، در چند دقیقه به راهحلهای عملیاتی برسانند.
جدول مقایسه مشخصات فنی و عملکردی مدلهای جدید
| شاخص فنی و کاربردی | Gemini 3.8 Live | Gemini 3.8 Extended Thinking |
| هدف اصلی معماری | تعامل بدون تاخیر چندحالته صوتی | استدلال عمیق منطقی و حل مسائل سخت |
| میانگین زمان تاخیر | ۱۶۰ میلیثانیه | بسته به پیچیدگی بین ۵ تا ۴۰ ثانیه |
| ورودیهای بومی | صوت، ویدیو زنده، متن و تصویر | متن تحلیلی، کد منبع و دادههای آماری |
| امتیاز در آزمون استدلال | ۸۲.۱ درصد | ۹۴.۸ درصد |
| عملکرد در مهندسی نرمافزار | تولید اسکریپتهای سریع روزمره | حل ساختاری خطاهای سامانههای بزرگ |
| بستر اجرایی بهینه | دستگاههای لبه، گوشی هوشمند و وب | سرورهای ابری با شتابدهندههای TPU v6 |
تحلیل فنی: تغییر پارادایم از حدس کلمه به تعقل ماشینی
از دیدگاه روزنامهنگاری فناوری، رونمایی امروز گوگل تنها یک بهروزرسانی عددی نیست، بلکه گواهی بر تغییر رویکرد جهان هوش مصنوعی در سال ۲۰۲۶ است. در سالهای گذشته، شرکتها صرفا ابعاد مدلها را بزرگتر میکردند؛ اما مصرف تصاعدی انرژی نشان داد که این مسیر بنبست است. راهحل جایگزین، مدلهای شناختی دوگانه است: یکی سریع و شهودی مانند Live برای کارهای روزمره، و دیگری آهسته و متفکر مانند Extended Thinking برای امور راهبردی.
مدل تفکر ممتد گوگل توانایی خوداصلاحی دارد. هنگامی که مسئلهای دشوار در ریاضی یا شیمی به آن داده میشود، مراحل استدلال را به طور شفاف ثبت میکند و اگر در مرحله سوم به تناقض برخورد کند، مسیر را برمیگردد و گزینه دیگری را تست میکند. این فرآیند شباهت خیرهکنندهای به کارکرد قشر پیشپیشانی مغز انسان دارد.
مسیر آینده هوش عمومی با تکیه بر تصمیمگیری شناختی
گوگل اعلام کرده است که دسترسی به نسخه صوتی از طریق سرویسهای ابری و اپلیکیشن اختصاصی با اولویت مشترکان سازمانی آغاز میشود. همچنین رابط برنامهنویسی هر دو مدل برای توسعهدهندگان شخصثالث در گوگل ایآی استودیو فعال شده است.
این تحول بیشک بازار پشتیبانی مشتریان، آموزش شخصیسازیشده و مهندسی داده را زیر و رو خواهد کرد. ترکیب مکالمه روان با قدرت استدلال تحلیلی نشان میدهد که دستیارهای نسل جدید دیگر صرفا پاسخدهنده نیستند، بلکه به همکارانی کارآمد در کنار انسان بدل شدهاند.
سوالات متداول
این مدل با تاخیر ۱۶۰ میلیثانیهای صدا را بدون نیاز به تبدیل به متن درک کرده و لحن و احساسات را بیدرنگ تحلیل میکند.
این مدل برای حل مسائل پیچیده ریاضی، مهندسی نرمافزار سنگین و فرآیندهای علمی که نیازمند تامل و بازنگری منطقی هستند کاربرد دارد.
پاسخ: بله، این فناوری مکثها و حرفهای میانکلامی کاربر را متوجه میشود و بلافاصله مسیر گفتوگو را بر اساس فرمان جدید تغییر میدهد.
در آزمون استاندارد چالشهای مهندسی نرمافزار، این نسخه توانسته بیش از ۷۲ درصد مسائل سخت را بدون خطا شبیهسازی و حل کند.
عرضه این مدلها ابتدا در اپلیکیشن جمینای برای کاربران فعال آغاز شده و به تدریج در سراسر سرویسهای گوگل گسترش مییابد.
برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.