ابزارهای هوش مصنوعی

MAI-Voice-2؛ مدل جدید متن به گفتار مایکروسافت

مایکروسافت از جدیدترین طبیعی‌ترین و بیان‌گرترین مدل تبدیل متن به گفتار (Text-to-Speech) خود به نام MAI-Voice-2 رونمایی کرد. این مدل در تمام ابعاد کلیدی که برای تجربه‌های صوتی اهمیت دارند، نسبت به نسل قبلی خود یک جهش معنادار ایجاد کرده است؛ ازجمله وفاداری صوتی…

4 دقیقه مطالعه
  • پشتیبانی شبکه
  • MAI-Voice-2
  • صدای
  • مدل
  • گوینده
  • درصد
  • گفتار
  • صوتی
MAI-Voice-2؛ مدل جدید متن به گفتار مایکروسافت

خلاصه تحلیلی خبر

مایکروسافت از جدیدترین طبیعی‌ترین و بیان‌گرترین مدل تبدیل متن به گفتار (Text-to-Speech) خود به نام MAI-Voice-2 رونمایی کرد. این مدل در تمام ابعاد کلیدی که برای تجربه‌های صوتی اهمیت دارند، نسبت به نسل قبلی خود یک جهش معنادار ایجاد کرده است؛ ازجمله وفاداری صوتی…

موضوعات اصلی: پشتیبانی شبکه، MAI-Voice-2، صدای، مدل، گوینده، درصد

مایکروسافت از جدیدترین طبیعی‌ترین و بیان‌گرترین مدل تبدیل متن به گفتار (Text-to-Speech) خود به نام MAI-Voice-2 رونمایی کرد.

این مدل در تمام ابعاد کلیدی که برای تجربه‌های صوتی اهمیت دارند، نسبت به نسل قبلی خود یک جهش معنادار ایجاد کرده است؛ ازجمله وفاداری صوتی (fidelity)، پوشش زبانی، ثبات گوینده و گستره احساسی. این مدل برای محصولات و سرویس‌هایی طراحی شده است که کیفیت صدا در آن‌ها مستقیماً بر تجربه کاربر اثر می‌گذارد؛ مانند دستیارهایی یا پشتیبانی مشتری که نماینده برند شما هستند، کتاب‌های صوتی که باید برای ساعت‌ها توجه شنونده را حفظ کنند و تجربه‌های دسترس‌پذیری که در آن‌ها صدا تنها رابط کاربری است.

قابلیت‌ها و ویژگی‌ها

  • گسترش از حالت فقط انگلیسی به ۱۵ زبان، درحالی‌که همان سطح طبیعی‌بودن و بیان‌گری زبان انگلیسی حفظ شده است.
  • کنترل جزئی‌نگر احساسات از طریق تگ‌های احساسی؛ غمگین (sad)، نجواگونه (whispered)، هیجان‌زده (excited) و موارد مشابه.
  • پرامپت‌سازی صدای zero-shot با استفاده از ۵ تا ۶۰ ثانیه صوت مرجع در تمام زبان‌های پشتیبانی‌شده همراه با سازوکارهای داخلی کنترل رضایت.
  • MAI-Voice-2 در ۷۲ درصد مواقع نسبت به نسل قبلی خود MAI-Voice-1 ترجیح داده شده است.
  • ثبات هویت گوینده در محتوای بلندمدت؛ شامل کتاب‌های صوتی، پادکست‌ها و سخنرانی‌ها.
  • قابلیت code-switching برای برخی جفت‌زبان‌ها مانند هندی-انگلیسی و اسپانیایی-انگلیسی مطابق با نحوه طبیعی ترکیب زبان‌ها توسط کاربران در گفتار روزمره.

همچنین این مدل با درنظرگرفتن استقرار مسئولانه ساخته شده است؛ با سازوکارهای حفاظتی مبتنی بر رضایت (consent guardrails) که تضمین می‌کنند این فناوری به همان اندازه که طبیعی به نظر می‌رسد، قابل‌اعتماد نیز باشد. MAI-Voice-2 اکنون در Azure Foundry در دسترس است و در حال یکپارچه‌سازی با VSCode و مرکز تماس Dynamics 365 است.

عملکرد

MAI-Voice-2 قادر است گفتار بسیار طبیعی را به شیوه‌ای قابل‌کنترل تولید کند. در آزمون‌های ترجیح مقایسه‌ای، این مدل در ۷۲ درصد مواقع نسبت به نسل‌های قبلی برتری داشته است. در ارزیابی‌های شباهت گوینده، صدای تولیدشده توسط MAI-Voice-2 از صدای ضبط‌شده همان گوینده غیرقابل‌تمایز است.

MAI-Voice-2؛ مدل جدید متن به گفتار مایکروسافت
نمودار میله‌ای نرخ پیروزی MAI-Voice-2 با ۷۲.۱ درصد در ارزیابی کیفیت کلی بر اساس ۲,۵۰۰ آزمون شنیداری

نمودار میله‌ای نشان می‌دهد که به طور میانگین در ۱۱ زبان، ۴۵.۵ درصد از شنوندگان صدای تولیدشده توسط MAI-Voice-2 را ترجیح داده‌اند، ۴۴ درصد صدای ضبط‌شده انسانی را ترجیح داده‌اند، و ۱۰.۵ درصد نیز نتیجه را برابر دانسته‌اند. (بر اساس ۲,۲۲۲ پاسخ)

زبان‌های پشتیبانی‌شده

مایکروسافت تمرکز خود را بر ۱۵ زبان قرار داده‌است و اطمینان حاصل کرده که برای زبان‌های پشتیبانی‌شده، طیفی از قابلیت‌های بیانی شامل سیستم‌های آهنگین (tonal)، لهجه‌دار (pitch accent)، وزن-زمانی (stress-timed) و هجا-زمانی (syllable-timed) پوشش داده شود.

MAI-Voice-2 اکنون از زبان‌ها/لهجه‌های زیر پشتیبانی می‌کند: انگلیسی (آمریکا)، انگلیسی (استرالیا)، ایتالیایی، فرانسوی، آلمانی، هندی، اسپانیایی (اسپانیا)، اسپانیایی (مکزیک)، پرتغالی (برزیل)، پرتغالی (پرتغال)، کره‌ای، چینی (ساده‌شده)، ترکی، روسی، تایلندی، هلندی، رومانیایی و مجارستانی.

در شرایطی که افراد به طور طبیعی زبان‌ها را با هم ترکیب می‌کنند، مایکروسافت از قابلیت کد-سوئیچینگ نیز پشتیبانی می‌کند که بازتاب‌دهنده نحوه واقعی صحبت‌کردن افراد است. در آزمایش‌های داخلی، مدل قادر است بدون ازدست‌دادن طبیعی‌بودن آهنگ گفتار (prosodic naturalness) یا هویت گوینده، به‌صورت روان در میانه جمله بین زبان‌ها جابه‌جا شود.

MAI-Voice-2؛ مدل جدید متن به گفتار مایکروسافت

سنتز صوتی

توسعه‌دهندگان می‌توانند یک صدای سفارشی در Microsoft Foundry در تمام زبان‌های پشتیبانی‌شده ایجاد کنند؛ تنها با استفاده از یک کلیپ مرجع کوتاه بدون نیاز به بازآموزی (retraining) یا تنظیم دقیق (fine-tuning). با تنها چند ثانیه صوت (توصیه‌شده: ۵ تا ۶۰ ثانیه)، MAI Voice 2 می‌تواند گفتار با کیفیت بالا تولید کند که هویت گوینده را بازتولید می‌کند؛ این موضوع باعث می‌شود شرکت‌ها بتوانند به‌سادگی صدای برند خود را در محصولات وارد کنند، بدون آنکه نیاز به نگهداری یک مدل صوتی جداگانه داشته باشند.

رضایت در سطح سیستم اعمال می‌شود. تنها صداهای مجاز و دارای مجوز و لایسنس‌شده می‌توانند در محیط تولید سنتز شوند. هیچ‌گونه شبیه‌سازی و ویس کلونینگ صدای بدون مجوز امکان‌پذیر نیست.

برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.