اخبار هوش مصنوعی

مدل‌ صوتی جدید گوگل امکان ساخت صدای اختصاصی را فراهم می‌کند

گوگل از دو مدل تبدیل متن به گفتار جدید با نام‌های Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTS رونمایی کرد و گفت این محصولات، تولید صدا را از مجموعه‌ای از صداهای ثابت و آماده به یک محیط خلاقانه‌تر و پویا تبدیل می‌کنند. گوگل اعلام کرده است که این دو مدل برا…

8 دقیقه مطالعه
  • پشتیبانی شبکه
  • هوش مصنوعی
  • گوگل
  • صوتی
  • Gemini
  • مدل
  • TTS
  • شرکت
مدل‌ صوتی جدید گوگل امکان ساخت صدای اختصاصی را فراهم می‌کند

خلاصه تحلیلی خبر

گوگل از دو مدل تبدیل متن به گفتار جدید با نام‌های Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTS رونمایی کرد و گفت این محصولات، تولید صدا را از مجموعه‌ای از صداهای ثابت و آماده به یک محیط خلاقانه‌تر و پویا تبدیل می‌کنند. گوگل اعلام کرده است که این دو مدل برا…

موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، گوگل، صوتی، Gemini، مدل

گوگل از دو مدل تبدیل متن به گفتار جدید با نام‌های Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTS رونمایی کرد و گفت این محصولات، تولید صدا را از مجموعه‌ای از صداهای ثابت و آماده به یک محیط خلاقانه‌تر و پویا تبدیل می‌کنند.

گوگلاعلام کردهاست که این دو مدل برای گروه‌های متفاوتی از کاربران ساخته شده‌اند. Flash TTS بیشتر بر طراحی شخصیت‌های صوتی و هدایت خلاقانه تمرکز دارد و Flash-Lite TTS برای تولید انبوه، دوبله گسترده و استفاده مقرون‌به‌صرفه در مقیاس بالا در نظر گرفته شده است.

تمرکز بر ساخت صداهای تازه و شخصی‌سازی گسترده

تصویر معرفی مدل‌های Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTS گوگل برای تولید گفتار با هوش مصنوعی

یکی از مهم‌ترین قابلیت‌های Gemini 3.8 Flash TTS، ساخت صدای اختصاصی از ابتدا است. گوگل می‌گوید کاربران می‌توانند با استفاده از دستورهای زبان طبیعی، نقش، لهجه و ویژگی‌های صوتی دلخواه را تعریف کنند و یک شخصیت صوتی تازه بسازند. این قابلیت برای بازی، کتاب صوتی، پادکست و رسانه‌های تعاملی در نظر گرفته شده است.

گوگل می‌گوید این قابلیت در بیش از 100 زبان و گویش کار می‌کند. بر اساس توضیحات این شرکت، کاربر می‌تواند صدایی برای یک شخصیت نمایشی، یک راوی با لحن منطقه‌ای یا حتی یک ربات با صدایی یکنواخت طراحی کند. به گفته گوگل، این ویژگی نشان می‌دهد که تولید صدا دیگر به انتخاب از میان چند گزینه محدود خلاصه نمی‌شود.

در کنار ساخت صدای جدید، گوگل از یک کتابخانه شامل بیش از 2 هزار صدای آماده نیز خبر داده است. این مجموعه، زبان‌ها و گونه‌های منطقه‌ای مختلفی را پوشش می‌دهد و نمونه‌هایی مانند اسپانیایی مکزیکی، فرانسوی کبکی و انگلیسی اسکاتلندی را در بر می‌گیرد. گوگل می‌گوید این تنوع به کاربر اجازه می‌دهد بسته به نیاز پروژه، میان استفاده از صدای آماده یا طراحی یک هویت صوتی تازه انتخاب کند.

یکی دیگر از قابلیت‌های معرفی‌شده، همانندسازی صدا است. گوگل می‌گوید کاربر می‌تواند با یک نمونه 30 ثانیه‌ای از صدای خود یا صدایی که حق استفاده از آن را دارد، یک پروفایل صوتی ثابت بسازد. این شرکت همچنین اعلام کرده است که کاربران می‌توانند صداهای ساخته‌شده را ذخیره و مدیریت کنند تا در پروژه‌های بعدی، همان کیفیت و همان شخصیت صوتی حفظ شود.

کنترل دقیق اجرا و هدایت دیالوگ‌ها

گوگل می‌گوید هر دو مدل تازه، تنها برای ساخت یک صدای جدید نیستند و امکان کنترل اجرای متن را هم فراهم می‌کنند. پس از انتخاب صدا، کاربر می‌تواند برای هر خط از فیلمنامه، نشانه‌ها و دستورهای اجرایی بنویسد تا مدل، لحن و نحوه بیان را مطابق آن تنظیم کند. این قابلیت می‌تواند برای صحنه‌های آرام، دیالوگ‌های پرتعلیق یا گفت‌وگوهای تعاملی به کار رود.

به گفته گوگل، Flash TTS از تولید محتوای طولانی نیز پشتیبانی می‌کند و می‌تواند در چند ساعت صوت پیوسته، کیفیت صدا، سرعت طبیعی گفتار و رنگ صوتی شخصیت را حفظ کند.

یکی دیگر از قابلیت‌های برجسته، صحنه‌پردازی بومی برای دو گوینده است. گوگل می‌گوید کاربران می‌توانند یک گفت‌وگوی چندمرحله‌ای را در قالب یک فیلمنامه واحد تعریف کنند و مدل، نوبت‌های گفت‌وگو را به صورت طبیعی میان دو صدا مدیریت می‌کند.

گوگل همچنین بر امکان افزودن نشانه‌های غیرکلامی و واکنش‌های کوتاه تأکید کرده است. بر اساس توضیحات این شرکت، کاربر می‌تواند نشانه‌هایی مانند خنده، آه یا نفس‌گیری ناگهانی و واکنش‌هایی مانند «هوم» یا «بله» را وارد متن کند تا لایه‌ای طبیعی‌تر به اجرا داده شود.

مدل Lite برای مقیاس بالا و هزینه کمتر

در کنار مدل اصلی، گوگل از Gemini 3.8 Flash-Lite TTS به عنوان گزینه‌ای برای تولید صوت در حجم بالا یاد کرده است. به گفته این شرکت، این مدل برای دوبله گسترده، تولید محتوای صوتی و ساخت عامل‌های صوتی طراحی شده و در عین حال، کاربر همچنان می‌تواند بر لحن، سرعت و ظرافت‌های بیان کنترل داشته باشد.

گوگل می‌گوید تفاوت اصلی Flash-Lite TTS با مدل Flash TTS در تمرکز آن بر هزینه و مقیاس است. به بیان دیگر، این مدل برای شرایطی ساخته شده که سازمان یا توسعه‌دهنده به تولید تعداد زیادی فایل صوتی یا ارائه خدمات صوتی در سطح وسیع نیاز دارد.

این شرکت در معرفی مدل Lite بر کاربردهای عملی آن نیز تأکید کرده است. از نگاه گوگل، دوبله محتوای چندزبانه، تولید محتوای شنیداری در حجم بالا و توسعه عامل‌های صوتی بیان‌محور، از مهم‌ترین حوزه‌هایی هستند که این مدل می‌تواند در آنها مورد استفاده قرار گیرد.

گوگل همچنین این دو مدل را مکمل دیگر محصولات صوتی خود معرفی کرده است. به گفته این شرکت، عرضه آنها در ادامه معرفی 3.5 Live Translate، 3.5 Transcribe، 3.8 Live و 3.8 Live Extended Thinking انجام شده است.

بیشتر بخوانیدگوگل اپلیکیشن تبدیل گفتار به متن هوشمند آفلاین عرضه کرد

نتایج ارزیابی‌ها و پشتیبانی زبانی گسترده

جدول مقایسه کیفیت مدل‌های تبدیل متن به گفتار شامل Gemini 3.8 Flash TTS، Gemini 3.8 Flash-Lite TTS و چند مدل رقیب
مقایسه عملکرد مدل‌های تبدیل متن به گفتار در معیار Hume AI که برتری Gemini 3.8 Flash TTS را در کیفیت کلی، پشتیبانی از چند گوینده و کنترل سبک نشان می‌دهد.

گوگل در بخش دیگری از معرفی این محصولات، به نتایج چند ارزیابی بیرونی اشاره کرده است. بر اساس اعلام این شرکت، Gemini 3.8 Flash TTS در معیار Voice Design Benchmark متعلق به Hume AI با امتیاز 71.4 در جایگاه نخست قرار گرفته است. گوگل همچنین گفته است این مدل در زمینه شبیه‌سازی لهجه نیز با امتیاز 60.8 رتبه اول را به دست آورده است.

این شرکت افزوده است که Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTS در شاخص Overall Quality Index مربوط به Hume AI نیز به ترتیب جایگاه‌های اول و دوم را کسب کرده‌اند. گوگل می‌گوید این نتایج نشان می‌دهد مدل‌های تازه، اجرای بیان‌محور را بدون قربانی کردن پایداری و قابلیت اتکا ارائه می‌کنند.

گوگل همچنین اعلام کرده است که مدل‌های جدید در برخی کاربردها مانند محتوای طولانی و کنترل فیلمنامه دو گوینده، نسبت به Gemini 3.1 Flash TTS پیشرفت داشته‌اند. این شرکت جزئیات فنی بیشتری درباره روش مقایسه ارائه نکرده است.

در ارزیابی‌های انسانی ناشناس در Voice Arena نیز گوگل می‌گوید مدل‌های Flash و Flash-Lite TTS در چند زبان مهم جهانی در میان رقبا جایگاه‌های بالایی کسب کرده‌اند. زبان‌هایی که گوگل به آنها اشاره کرده شامل ژاپنی، پرتغالی برزیلی، ویتنامی، عربی معیار مدرن، اسپانیایی مکزیکی و هندی است.

بیشتر بخوانیدمدل جدید تبدیل گفتار به متن xAI معرفی شد

ایمنی، رضایت و شفافیت در تولید صدا

گوگل بخشی از معرفی این دو مدل را به سازوکارهای ایمنی اختصاص داده است. این شرکت می‌گوید قابلیت‌های ساخت و همانندسازی صدا با مجموعه‌ای از محافظت‌ها همراه شده‌اند تا از صاحبان صدا محافظت شود، هویت افراد مورد احترام قرار گیرد و درباره محتوای تولیدشده با هوش مصنوعی شفافیت بیشتری ایجاد شود.

در موضوع همانندسازی صدا، گوگل می‌گوید از سازوکار تأیید رضایت استفاده می‌کند. بر اساس توضیح این شرکت، کاربر باید یک فایل صوتی حاوی رضایت صاحب صدا ارائه کند و این فایل باید با صدای نمونه مرجع مطابقت داشته باشد. تنها در این صورت، امکان ساخت نسخه شبیه‌سازی‌شده از آن صدا فراهم می‌شود.

گوگل همچنین اعلام کرده است که تمام فایل‌های صوتی تولیدشده با مدل‌های Gemini Audio با واترمارک SynthID نشانه‌گذاری می‌شوند. به گفته این شرکت، این واترمارک نامحسوس به صورت مستقیم در خروجی صوتی قرار می‌گیرد و به شناسایی محتوای تولیدشده با هوش مصنوعی کمک می‌کند. گوگل هدف از این کار را کاهش خطر انتشار اطلاعات نادرست عنوان کرده است.

در کنار این موارد، گوگل به استفاده از اعتبارنامه‌های C2PA نیز اشاره کرده است. این شرکت می‌گوید چنین ابزارهایی برای محافظت از توسعه‌دهندگان و استعدادهای صوتی در نظر گرفته شده‌اند.

زمان عرضه و بسترهای دسترسی

گوگل اعلام کرده است که هر دو مدل جدید از امروز روند عرضه خود را آغاز کرده‌اند. بر این اساس، Gemini 3.8 Flash TTS برای توسعه‌دهندگان از طریق Gemini API و Google AI Studio در دسترس قرار می‌گیرد. این شرکت گفته است دسترسی سازمانی به این مدل از طریق API در Gemini Enterprise به زودی فراهم می‌شود و کاربران عمومی نیز می‌توانند آن را در Gemini Notebook به کار بگیرند.

در مورد Gemini 3.8 Flash-Lite TTS نیز برنامه مشابهی اعلام شده است. گوگل می‌گوید این مدل برای توسعه‌دهندگان از طریق Gemini API و Google AI Studio عرضه می‌شود، دسترسی سازمانی آن از طریق Gemini Enterprise بعدا ارائه خواهد شد و کاربران عمومی می‌توانند از آن در Google Vids استفاده کنند.

گوگل همزمان یک محیط آزمایشی تازه در Google AI Studio معرفی کرده است که آن را به یک فضای کاری طراحی صدا تشبیه می‌کند. این شرکت می‌گوید توسعه‌دهندگان در این محیط می‌توانند صداهای جدید را از ابتدا ایجاد کنند یا صدای خود را همانندسازی کنند و سپس آنها را وارد ویرایشگر فیلمنامه دو گوینده کنند.

علاوه بر این، گوگل به فهرستی از شرکت‌ها و پلتفرم‌های همکار هم اشاره کرده است. بر اساس اعلام این شرکت، پلتفرم‌هایی مانند Agora، LiveKit، Pipecat و Vercel از Gemini API برای ساخت و استقرار تجربه‌های تولید گفتار استفاده می‌کنند. گوگل همچنین گفته است شرکت‌هایی مانند Figma، HeyGen، Linguana، Wondercraft، 99.co و Ollang در حال یکپارچه‌سازی مدل‌های جدید هستند.

در مجموع، معرفی Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTS نشان می‌دهد گوگل می‌خواهد حضور پررنگ‌تری در بازار ابزارهای صوتی هوش مصنوعی در بازار جهانی فناوری صوتی امروز داشته باشد. این شرکت در معرفی این دو مدل، هم بر آزادی عمل در طراحی صدا و هدایت دیالوگ‌ها تأکید کرده و هم بر مقیاس‌پذیری، پوشش زبانی و سازوکارهای ایمنی. در صورت تحقق این وعده‌ها، خانواده Gemini Audio می‌تواند نقش مهم‌تری در دوبله، روایت‌گری دیجیتال، تولید محتوای صوتی و توسعه عامل‌های صوتی ایفا کند.

بیشتر بخوانید10 افزونه تبدیل متن به گفتار در مرورگرها

نوشتهمدل‌ صوتی جدید گوگل امکان ساخت صدای اختصاصی را فراهم می‌کنداولین بار درTechnoc. پدیدار شد.

برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.