اخبار هوش مصنوعی

مایکروسافت از MAI-Transcribe-۲ رونمایی کرد؛ ارزان‌ترین هوش مصنوعی تبدیل صوت به متن

مایکروسافت با معرفی هوش مصنوعی MAI-Transcribe-2 سریع‌ترین، دقیق‌ترین و ارزان‌ترین مدل تبدیل صوت به متن دنیا را با پشتیبانی ۶۰ زبان و قیمت ۱۰ سنت به بازار عرضه کرد. تیم هوش مصنوعی ردموند به هدایت مصطفی سلیمان جهش شگفت‌انگیزی را در عرصه پردازش زبان طبیعی رقم زده…

8 دقیقه مطالعه
  • پشتیبانی شبکه
  • هوش مصنوعی
  • مدل
  • صوتی
  • مایکروسافت
  • زبان
  • پردازش
  • می‌کند
مایکروسافت از MAI-Transcribe-۲ رونمایی کرد؛ ارزان‌ترین هوش مصنوعی تبدیل صوت به متن

خلاصه تحلیلی خبر

مایکروسافت با معرفی هوش مصنوعی MAI-Transcribe-2 سریع‌ترین، دقیق‌ترین و ارزان‌ترین مدل تبدیل صوت به متن دنیا را با پشتیبانی ۶۰ زبان و قیمت ۱۰ سنت به بازار عرضه کرد. تیم هوش مصنوعی ردموند به هدایت مصطفی سلیمان جهش شگفت‌انگیزی را در عرصه پردازش زبان طبیعی رقم زده…

موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، مدل، صوتی، مایکروسافت، زبان


مایکروسافت با معرفی هوش مصنوعی MAI-Transcribe-2 سریع‌ترین، دقیق‌ترین و ارزان‌ترین مدل تبدیل صوت به متن دنیا را با پشتیبانی ۶۰ زبان و قیمت ۱۰ سنت به بازار عرضه کرد.

تیم هوش مصنوعی ردموند به هدایت مصطفی سلیمان جهش شگفت‌انگیزی را در عرصه پردازش زبان طبیعی رقم زده است. این شرکت پیش‌تر نیز توانایی‌های مهندسی خود را در ابزارهای چندرسانه‌ای اثبات کرده بود؛ به‌ویژه درمدل فوق سریع تصویری مایکروسافتکه با تمرکز بر مصرف بهینه منابع سخت‌افزاری معرفی شد و توجه کارشناسان حوزه پردازش داده را به خود جلب کرد. حالا نوبت به حوزه پردازش امواج صوتی رسیده و رسانه XNET ابعاد فنی این محصول تازه را بررسی می‌کند.

این دستاورد نخستین بار در قالب بیانیه‌ای از سویاکانت رسمی تیم هوش مصنوعی مایکروسافت در شبکه ایکسمنتشر شد و جامعه متن‌باز و پژوهشگران فناوری را به وجد آورد. کارشناسان معتقدند این مدل جدید موازنه قدرت را در حوزه صوت به متن به‌کلی تغییر می‌دهد؛ بازاری که تا پیش از این تحت سلطه مطلق ویسپر اوپن‌ای‌آی و ابزارهای گران‌قیمت ابری بود.

همچنین بر اساس گزارش تحلیلی درپایگاه خبری تخصصی مایکروسافت هوش مصنوعیمعماری زیرساختی این هوش مصنوعی به‌طور ویژه برای فایل‌های صوتی دنیای واقعی بهینه‌سازی شده است؛ محیط‌هایی که برعکس آزمایشگاه‌ها، سرشار از آلودگی صوتی، اکوی آزاردهنده محیط و قطع کلام افراد توسط یکدیگر هستند.

سونامی ارزان‌سازی در ردموند؛ وقتی هزینه پردازش صوت به خاک کشیده می‌شود

شاید هیجان‌انگیزترین بخش این رونمایی برای استارتاپ‌ها، شرکت‌های رسانه‌ای و مراکز ارتباط با مشتریان، کاهش چشم‌گیر هزینه‌ها باشد. مایکروسافت نرخ پیاده‌سازی صوت را به رقم غیرقابل رقابت ۱۰ سنت برای هر ساعت فایل صوتی کاهش داده است. اگر نسخه نخست این فناوری را به خاطر بیاورید، پنج ماه قبل با نرخ ۳۶ سنت برای هر ساعت رونمایی شده بود. کاهش ۷۲ درصدی هزینه‌ها در کمتر از شش ماه نشان می‌دهد که مهندسان مایکروسافت موفق شده‌اند بار پردازشی ترنسفورمرها را به حداقل برسانند.

یک مرکز تماس پشتیبانی را تصور کنید که در هر ماه ۱۰۰ هزار ساعت صدای ضبط‌شده مکالمات کاربران را ذخیره می‌کند. پیاده‌سازی این حجم بزرگ از صوت تا دیروز بیش از ۳۶ هزار دلار هزینه تراشیده و برای بسیاری از شرکت‌ها غیراقتصادی بود. اما اکنون با MAI-Transcribe-2 این رقم به ۱۰ هزار دلار تقلیل پیدا کرده است. مصطفی سلیمان در خصوص این جهش بزرگ اظهار داشت: هدف ما این بود که صوت را به داده‌ای تبدیل کنیم که پردازش آن برای هر سازمان و برنامه‌نویسی در سراسر جهان ارزان‌تر از نگه‌داری خود فایل‌های صوتی خام باشد. این کاهش قیمت یک مانور تبلیغاتی نیست، بلکه نتیجه بازطراحی رادیکال شیوه ادغام نشانه‌ها در معماری توجه صوتی است.

نمودار افقی مقایسه میزان خطای تبدیل گفتار به متن در حالت زبان تعیین‌شده و استنباطی برای مدل‌های مختلف که MAI-Transcribe-2 با ۵.۲ درصد کمترین خطا را ثبت کرده است.


تشریح قلب تپنده مدل؛ قابلیت‌هایی که رقبا را مات کرد

پیاده‌سازی یک فایل صوتی دیگر به نوشتن ساده جملات خلاصه نمی‌شود. مدل‌های نسل پیشین در مکالمات شلوغ یا اصطلاحات دشوار به‌سرعت شکست می‌خوردند. مایکروسافت با پیاده‌سازی پنج ویژگی محوری، ابزار خود را برای مصارف تجاری و عملیاتی آماده کرده است

  • تفکیک گویندگان و برچسب‌گذاری هوشمندسامانه به کمک الگوریتم‌های کلاسترینگ صوتی مشخص می‌کند چه کسی در کدام ثانیه صحبت کرده است. این ویژگی باعث می‌شود صورت‌جلسات شرکتی و گفت‌وگوهای چندنفره ساختاری خوانا و حرفه‌ای پیدا کنند.
  • ثبت زمان‌بندی در سطح تک‌تک واژه‌هابرای تدوین‌گران ویدیو، ناشران پادکست و تولیدکنندگان محتوا، تراز زمانی خودکار واژه‌ها فراهم شده تا ساخت زیرنویس بدون اتلاف وقت و با بیشترین ظرافت ممکن شود.
  • تزریق واژگان اختصاصی و واژه‌نامه فنیدر حوزه‌های سلامت، مهندسی هوافضا یا سیستم‌های بانکی، اصطلاحات عجیب فراوانی وجود دارند. این مدل قابلیتی در اختیار کاربران قرار می‌دهد که واژگان کلیدی را به حافظه موقت سیستم تزریق کنند تا خطای شنیداری اصطلاحات نادرست صفر شود.
  • تغییر زبان در لحظه یا سوئیچینگ زبانیبسیاری از مکالمات روزمره در کشورهای مختلف به شکل ترکیبی از زبان مادری و زبان انگلیسی بیان می‌شوند. مدل مایکروسافت به‌محض ورود کلمات جدید، زبان را بدون افت سرعت یا هنگ کردن تغییر می‌دهد.
  • انتخاب لحن پیاده‌سازی برای کاربردهای اداری یا حقوقیمدل دو خروجی تمیز بدون تپق و تکرار برای امور اداری، و خروجی مو به مو برای امور دادگاهی و پلیسی ارائه می‌دهد.
نمودار ستونی درصد کلمات پیاده‌سازی‌شده به‌صورت نادرست در بنچمارک AA-WER v2 برای مدل‌های مختلف تبدیل گفتار به متن که نشان‌دهنده عملکرد برتر مدل‌های سری MAI است


جدول مقایسه همه‌جانبه هوش مصنوعی MAI-Transcribe-2 با رقبای بازار

شاخص ارزیابی فنی و اقتصادیمایکروسافت MAI-Transcribe-2اوپن‌ای‌آی ویسپر نسخه ۳ لارججمینای ۳.۵ گوگل مدل صوت
هزینه هر ساعت فایل صوتی۱۰ سنت۳۶ سنت۳۰ سنت
تعداد زبان‌های اصلی تحت پوشش۶۰ زبان با سوئیچینگ آنیحدود ۵۰ زبانحدود ۴۲ زبان
نرخ خطای کلمات در بنچمارک معتبرزیر ۵ درصد میانگین ۶۰ زبان۶.۸ درصد۷.۱ درصد
نیاز به مدل جانبی تفکیک گویندهکاملاً بومی و پیوستهنیازمند پایپ‌لاین جداگانهنیازمند تنظیمات پیشرفته ابری
همگام‌سازی و برچسب زمانی واژگانبرچسب صدم ثانیه‌ای بدون خطابرچسب‌گذاری نسبتاً مطلوبتراز کلی در سطح جملات
توانایی تفکیک نویز در صدای محیطعملکرد بی‌نقص در صداهای محیطیکاهش دقت در محیط‌های بازعملکرد متوسط در مکالمه شلوغ


چالش لهجه‌ها و زبان‌های بومی؛ نگاهی دقیق به بنچمارک‌های جهانی

یکی از بزرگ‌ترین چالش‌های همیشگی الگوریتم‌های صوتی، تسلط بر گویش‌ها و تفاوت‌های آوایی در زبان‌های مختلف است. بیشتر ابزارهای موجود در لهجه‌های استاندارد انگلیسی آمریکایی یا بریتانیایی کارایی مطلوبی ارائه می‌دهند، اما با مواجهه با لهجه‌های مختلف، درصد خطای آن‌ها به‌شدت بالا می‌رود.

طبق تست‌های انجام‌شده روی شاخص معتبر جهانی FLEURS که تلفظ‌ها و لهجه‌های ۶۰ زبان جهان را با تنوع اقلیمی مورد ارزیابی قرار می‌دهد، مدل جدید ردموند به میانگین نرخ خطای واژگان کمتر از ۵ درصد دست یافته است. این نتیجه یعنی کمترین میزان اشتباه شنیداری در میان تمامی مدل‌های پردازش زبان صوتی تاریخ. نکته قابل توجه، درک اصطلاحات محلی و نادیده گرفتن صداهای زائد پس‌زمینه مثل تق‌تق صفحه کلید، بوق خودروها یا صدای جریان هوا در محیط‌های باز است؛ قابلیتی که ارزش استفاده از این ابزار را دوچندان می‌کند.

نمودار پراکندگی مقایسه فاکتور سرعت و میزان خطا (AA-WER) در مدل‌های تبدیل گفتار که قرارگیری مدل MAI-Transcribe-2 را در ناحیه بهینه و پرسرعت نشان می‌دهد


بازی بزرگ استقلال؛ چرا مایکروسافت از اوپن‌ای‌آی فاصله می‌گیرد؟

رونمایی از این سیستم پیشرفته، پیامی آشکار به سرمایه‌گذاران وال‌استریت و فعالان دره سیلیکون مخابره می‌کند. مایکروسافت دیگر مایل نیست صرفاً به عنوان یک سرمایه‌گذار در سایه اوپن‌ای‌آی یا خریدار فناوری‌های ابری شناخته شود. استراتژی ردموند در سال‌های اخیر بر خودکفایی بی‌قیدوشرط در هسته مدل‌های پایه‌ای متمرکز شده است.

آن‌ها ابتدا مدل‌های تولید تصویر را با معماری‌های نوآورانه بهینه‌سازی کردند، سپس پردازش متن را هدف گرفتند و اکنون با MAI-Transcribe-2 رقیب مستقیم مدل متن‌باز ویسپر شده‌اند. اگر شرکتی بتواند سرویس‌های تشخیص گفتار را با هزینه‌ای نزدیک به یک‌چهارم تعرفه‌های جاری بازار و با سرعت سه برابر اجرا کند، هیچ دلیل منطقی برای ماندن روی زیرساخت‌های قدیمی رقبا باقی نمی‌ماند.

پیامدهای این دستاورد برای صنعت فناوری و آینده بازار

ورود چنین مدلی با این بازدهی اقتصادی و کیفی، چندین پیامد محسوس در آینده نزدیک خواهد داشت

اولاینکه خدمات زیرنویس خودکار، تولید فایل‌های متنی از ویدیوها و تبدیل مصاحبه‌های صوتی خبرنگاران دگرگون می‌شود. نرم‌افزارهای یادداشت‌برداری جلسات دیگر نیازی به خرید سرورهای سنگین یا پرداخت مبالغ گزاف اشتراک ماهیانه به سرویس‌های شخص ثالث نخواهند داشت.

دوماینکه کاربردهای دسترسی‌پذیری برای افراد کم‌شنوا و ناشنوا وارد عصری شگفت‌انگیز می‌شود. نمایش آنی گفته‌های مدرس در کلاس‌های درس یا همایش‌های بین‌المللی با دقت نزدیک به صددرصد و تاخیر ناچیز، عدالت آموزشی را وارد سطحی تازه می‌کند.

سوماینکه شرکت‌های ارائه‌دهنده سرویس‌های هوش مصنوعی ناچار خواهند شد تعرفه‌های خود را به شکل چشم‌گیری کاهش دهند تا از میدان این رقابت حذف نشوند؛ اتفاقی که در نهایت به نفع کاربران عادی و توسعه‌دهندگان مستقل رقم می‌خورد.

رقابت سنگین مایکروسافت با ویسپر در بازار جهانی

این مدل در حال حاضر از طریق درگاه‌های Microsoft Foundry و بستر تعاملی MAI Playground در دسترس علاقه‌مندان قرار گرفته و مهندسان نرم‌افزار می‌توانند با فراخوانی وب‌سرویس‌های ابری، آن را در اپلیکیشن‌های خود پیاده‌سازی کنند. این حرکت نشان داد که سال جاری، سال رقابت بر سر کاهش اندازه، ارزان‌سازی و افزایش راندمان پردازش‌های مبتنی بر هوش مصنوعی است. تحریریه XNET به پایش عملکرد این مدل در پردازش زبان‌های خاورمیانه ادامه خواهد داد تا بازخورد کاربران و پژوهشگران را در گزارش‌های آینده بررسی کند.







سوالات متداول

۱.هزینه استفاده از مدل صوتی MAI-Transcribe-2 چقدر است؟

پردازش هر ساعت فایل صوتی تنها ۱۰ سنت است که کاهشی معادل ۷۲ درصد در مقایسه با نسل قبلی خود به همراه دارد.

۲.این مدل صوتی نوین از چند زبان مختلف پشتیبانی می‌کند؟

فناوری جدید مایکروسافت از ۶۰ زبان رسمی و زنده جهان به همراه قابلیت جابه‌جایی آنی میان آن‌ها پشتیبانی می‌کند.

۳.ویژگی تفکیک گوینده در این سیستم چگونه عمل می‌کند؟

این سیستم صدای تک‌تک افراد حاضر در نشست‌ها را به شکل خودکار و دقیق جدا کرده و نام‌گذاری می‌نماید.

۴.نرخ خطای این مدل در مقایسه با مدل ویسپر چگونه ارزیابی می‌شود؟

این مدل در مقیاس‌های استاندارد جهانی با ثبت خطای زیر ۵ درصد، عملکردی مطلوب‌تر و برتر از ویسپر ثبت کرده است.

۵.توسعه‌دهندگان چگونه می‌توانند از این مدل مایکروسافت بهره ببرند؟

علاقه‌مندان می‌توانند با اتصال به درگاه‌های فاندری مایکروسافت و محیط پی‌گراند از این سرویس پردازشی بهره ببرند.

برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.