ابزارهای هوش مصنوعی

ترجمه روان و طبیعی صدا با قابلیت ترجمه هم‌زمان Gemini 3.5 Live Translate

مدل Gemini 3.5 Live Translate جدیدترین مدل صوتی گوگل است که امکان ترجمه گفتار به گفتار را در لحظه برای بیش از ۷۰ زبان فراهم می‌کند. بیست سال پیش، پروژه Translate در گوگل به‌عنوان یکی از آزمایش‌های پیشگام در حوزه یادگیری ماشین آغاز شد تا علم زبان را به جادوی ار…

4 دقیقه مطالعه
  • پشتیبانی شبکه
  • هوش مصنوعی
  • Translate
  • می‌کند
  • Live
  • مدل
  • ترجمه
  • گفتار
ترجمه روان و طبیعی صدا با قابلیت ترجمه هم‌زمان Gemini 3.5 Live Translate

خلاصه تحلیلی خبر

مدل Gemini 3.5 Live Translate جدیدترین مدل صوتی گوگل است که امکان ترجمه گفتار به گفتار را در لحظه برای بیش از ۷۰ زبان فراهم می‌کند. بیست سال پیش، پروژه Translate در گوگل به‌عنوان یکی از آزمایش‌های پیشگام در حوزه یادگیری ماشین آغاز شد تا علم زبان را به جادوی ار…

موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، Translate، می‌کند، Live، مدل

مدل Gemini 3.5 Live Translate جدیدترین مدل صوتی گوگل است که امکان ترجمه گفتار به گفتار را در لحظه برای بیش از ۷۰ زبان فراهم می‌کند.

بیست سال پیش، پروژه Translate در گوگل به‌عنوان یکی از آزمایش‌های پیشگام در حوزه یادگیری ماشین آغاز شد تا علم زبان را به جادوی ارتباطات انسانی پیوند بزند. آن آزمایش اکنون مسیر طولانی و موفقی را پیموده است؛ به‌طوری که امروزه ماهانه بیش از یک تریلیون کلمه برای میلیاردها کاربر در سراسر محصولات گوگل ترجمه می‌شود. اکنون گوگل با عرضه Gemini 3.5 Live Translate، جدیدترین مدل صوتی خود برای ترجمه هم‌زمان گفتار به گفتار، گام بعدی را برداشته است.

پوشش بیش از ۷۰ زبان

این مدل به طور خودکار بیش از ۷۰ زبان را تشخیص می‌دهد و گفتار ترجمه‌شده‌ای روان و طبیعی تولید می‌کند که لحن (تکیه صدا)، سرعت کلام و زیروبم صدای گوینده را حفظ می‌کند. برخلاف سیستم‌های نوبتی (Turn-by-Turn) که برای پاسخگویی منتظر می‌مانند تا شخص صحبت خود را تمام کند، مدل 3.5 Live Translate صدا را به‌صورت مداوم و پیوسته تولید می‌کند؛ این مدل توازن دقیقی میان «انتظار برای دریافت زمینه جهت ارتقای کیفیت» و «ترجمه فوری برای همگام ماندن با گوینده» برقرار می‌کند. این فناوری، خروجی صوتی روانی را بدون وقفه‌های ناخوشایند ارائه می‌دهد و در طول تمام مدت جلسه، تنها چند ثانیه عقب‌تر از گوینده حرکت می‌کند.

گفتار هم‌زمان

مدل Gemini 3.5 Live Translate گفتار را به همان صورت که جریان می‌یابد پردازش می‌کند و از این طریق، ارتباطی یکپارچه‌تر را میان زبان‌های مختلف امکان‌پذیر می‌کند. این مدل ورودی‌های چندزبانه را بدون نیاز به پیکربندی دستی تنظیمات مدیریت می‌کند. درعین‌حال، مقاومت این مدل در برابر نویز (Noise Robustness) تضمین می‌کند که برنامه‌ها می‌توانند در محیط‌های شلوغ و غیرقابل‌پیش‌بینی نیز به‌درستی عمل کنند. شما می‌توانید از این قابلیت‌ها برای تسهیل فرایند ترجمه هم‌زمان در تماس‌های چندزبانه، جلسات، کلاس‌های آموزشی، پخش‌های زنده و موارد دیگر استفاده کنید.

نحوه عرضه

عرضه Gemini 3.5 Live Translate از امروز در سراسر محصولات گوگل آغاز شده است

  • برای توسعه‌دهندگاندر قالب نسخه پیش‌نمایش عمومی از طریق Gemini Live API و Google AI Studio.
  • برای سازمان‌هادر قالب نسخه پیش‌نمایش خصوصی از ابتدای این ماه در Google Meet.
  • برای عموم کاربراناز طریق اپلیکیشن Google Translate در سیستم‌عامل‌های اندروید و iOS.

تجربه Gemini 3.5 Live Translate در جلسات

قابلیت ترجمه گفتار در Google Meet به‌زودی از مدل Gemini 3.5 Live Translate استفاده خواهد کرد و تجربه کاربری را از طرق زیر بهبود می‌بخشد

  • پشتیبانی از بیش از ۷۰ زبان که ارتقای چشمگیری نسبت به محدودیت قبلی (تنها ۵ زبان) به شمار می‌رود.
  • امکان برقراری گفتگو در قالب بیش از ۲۰۰۰ ترکیب زبانی در یک جلسه که توسعه‌یافته‌شده از حالت قبلی است که در آن ترجمه صرفاً به زبان انگلیسی یا از زبان انگلیسی انجام می‌شد.
  • به‌روزرسانی رابط کاربر: جهت فراهم‌کردن دسترسی فوری به ترجمه گفتار.

دسترسی در اپلیکیشن Google Translate برای اندروید و iOS

این مدل همچنین در اپلیکیشن Google Translate به‌صورت جهانی هم در سیستم‌عامل اندروید و هم iOS در حال عرضه است. هنگام استفاده از قابلیت ترجمه زنده (Live Translate)، کافی است هر نوع هدفونی را متصل کنید تا ترجمه‌ای یکپارچه‌تر را تجربه کنید که لحن گوینده را در بیش از ۷۰ زبان منعکس می‌کند.

عرضه قابلیت جدید «حالت شنیداری» (Listening Mode) برای کاربران اندروید نیز امکان می‌دهد ترجمه‌ها را به طور مستقیم از طریق بلندگوی گوشی (گوشی تلفن) بشنوید. کافی است تلفن خود را مانند یک تماس معمولی روی گوش خود نگه دارید تا صدای ترجمه‌شده مستقیماً پخش شود. این تجربه جدید می‌تواند در موقعیت‌هایی مفید باشد که می‌خواهید به‌سرعت ترجمه‌ها را بشنوید بدون اینکه دیگران آن را بشنوند و هدفون نیز در دسترس ندارید.

SynthID

تمام صداهای تولیدشده توسط مدل‌های گوگل با فناوری SynthID نشان‌گذاری می‌شوند. این واترمارک غیرقابل‌تشخیص به طور مستقیم در خروجی صوتی بافته می‌شود و این اطمینان را ایجاد می‌کند که محتوای تولیدشده توسط هوش مصنوعی قابل‌شناسایی باقی بماند تا به جلوگیری از انتشار اطلاعات نادرست کمک کند.

برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.