مایکروسافت از MAI-Transcribe-۲ رونمایی کرد؛ ارزانترین هوش مصنوعی تبدیل صوت به متن
مایکروسافت با معرفی هوش مصنوعی MAI-Transcribe-2 سریعترین، دقیقترین و ارزانترین مدل تبدیل صوت به متن دنیا را با پشتیبانی ۶۰ زبان و قیمت ۱۰ سنت به بازار عرضه کرد. تیم هوش مصنوعی ردموند به هدایت مصطفی سلیمان جهش شگفتانگیزی را در عرصه پردازش زبان طبیعی رقم زده…
خلاصه تحلیلی خبر
مایکروسافت با معرفی هوش مصنوعی MAI-Transcribe-2 سریعترین، دقیقترین و ارزانترین مدل تبدیل صوت به متن دنیا را با پشتیبانی ۶۰ زبان و قیمت ۱۰ سنت به بازار عرضه کرد. تیم هوش مصنوعی ردموند به هدایت مصطفی سلیمان جهش شگفتانگیزی را در عرصه پردازش زبان طبیعی رقم زده…
موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، مدل، صوتی، مایکروسافت، زبان
مایکروسافت با معرفی هوش مصنوعی MAI-Transcribe-2 سریعترین، دقیقترین و ارزانترین مدل تبدیل صوت به متن دنیا را با پشتیبانی ۶۰ زبان و قیمت ۱۰ سنت به بازار عرضه کرد.
تیم هوش مصنوعی ردموند به هدایت مصطفی سلیمان جهش شگفتانگیزی را در عرصه پردازش زبان طبیعی رقم زده است. این شرکت پیشتر نیز تواناییهای مهندسی خود را در ابزارهای چندرسانهای اثبات کرده بود؛ بهویژه درمدل فوق سریع تصویری مایکروسافتکه با تمرکز بر مصرف بهینه منابع سختافزاری معرفی شد و توجه کارشناسان حوزه پردازش داده را به خود جلب کرد. حالا نوبت به حوزه پردازش امواج صوتی رسیده و رسانه XNET ابعاد فنی این محصول تازه را بررسی میکند.
این دستاورد نخستین بار در قالب بیانیهای از سویاکانت رسمی تیم هوش مصنوعی مایکروسافت در شبکه ایکسمنتشر شد و جامعه متنباز و پژوهشگران فناوری را به وجد آورد. کارشناسان معتقدند این مدل جدید موازنه قدرت را در حوزه صوت به متن بهکلی تغییر میدهد؛ بازاری که تا پیش از این تحت سلطه مطلق ویسپر اوپنایآی و ابزارهای گرانقیمت ابری بود.
همچنین بر اساس گزارش تحلیلی درپایگاه خبری تخصصی مایکروسافت هوش مصنوعیمعماری زیرساختی این هوش مصنوعی بهطور ویژه برای فایلهای صوتی دنیای واقعی بهینهسازی شده است؛ محیطهایی که برعکس آزمایشگاهها، سرشار از آلودگی صوتی، اکوی آزاردهنده محیط و قطع کلام افراد توسط یکدیگر هستند.
سونامی ارزانسازی در ردموند؛ وقتی هزینه پردازش صوت به خاک کشیده میشود
شاید هیجانانگیزترین بخش این رونمایی برای استارتاپها، شرکتهای رسانهای و مراکز ارتباط با مشتریان، کاهش چشمگیر هزینهها باشد. مایکروسافت نرخ پیادهسازی صوت را به رقم غیرقابل رقابت ۱۰ سنت برای هر ساعت فایل صوتی کاهش داده است. اگر نسخه نخست این فناوری را به خاطر بیاورید، پنج ماه قبل با نرخ ۳۶ سنت برای هر ساعت رونمایی شده بود. کاهش ۷۲ درصدی هزینهها در کمتر از شش ماه نشان میدهد که مهندسان مایکروسافت موفق شدهاند بار پردازشی ترنسفورمرها را به حداقل برسانند.
یک مرکز تماس پشتیبانی را تصور کنید که در هر ماه ۱۰۰ هزار ساعت صدای ضبطشده مکالمات کاربران را ذخیره میکند. پیادهسازی این حجم بزرگ از صوت تا دیروز بیش از ۳۶ هزار دلار هزینه تراشیده و برای بسیاری از شرکتها غیراقتصادی بود. اما اکنون با MAI-Transcribe-2 این رقم به ۱۰ هزار دلار تقلیل پیدا کرده است. مصطفی سلیمان در خصوص این جهش بزرگ اظهار داشت: هدف ما این بود که صوت را به دادهای تبدیل کنیم که پردازش آن برای هر سازمان و برنامهنویسی در سراسر جهان ارزانتر از نگهداری خود فایلهای صوتی خام باشد. این کاهش قیمت یک مانور تبلیغاتی نیست، بلکه نتیجه بازطراحی رادیکال شیوه ادغام نشانهها در معماری توجه صوتی است.
تشریح قلب تپنده مدل؛ قابلیتهایی که رقبا را مات کرد
پیادهسازی یک فایل صوتی دیگر به نوشتن ساده جملات خلاصه نمیشود. مدلهای نسل پیشین در مکالمات شلوغ یا اصطلاحات دشوار بهسرعت شکست میخوردند. مایکروسافت با پیادهسازی پنج ویژگی محوری، ابزار خود را برای مصارف تجاری و عملیاتی آماده کرده است
- تفکیک گویندگان و برچسبگذاری هوشمندسامانه به کمک الگوریتمهای کلاسترینگ صوتی مشخص میکند چه کسی در کدام ثانیه صحبت کرده است. این ویژگی باعث میشود صورتجلسات شرکتی و گفتوگوهای چندنفره ساختاری خوانا و حرفهای پیدا کنند.
- ثبت زمانبندی در سطح تکتک واژههابرای تدوینگران ویدیو، ناشران پادکست و تولیدکنندگان محتوا، تراز زمانی خودکار واژهها فراهم شده تا ساخت زیرنویس بدون اتلاف وقت و با بیشترین ظرافت ممکن شود.
- تزریق واژگان اختصاصی و واژهنامه فنیدر حوزههای سلامت، مهندسی هوافضا یا سیستمهای بانکی، اصطلاحات عجیب فراوانی وجود دارند. این مدل قابلیتی در اختیار کاربران قرار میدهد که واژگان کلیدی را به حافظه موقت سیستم تزریق کنند تا خطای شنیداری اصطلاحات نادرست صفر شود.
- تغییر زبان در لحظه یا سوئیچینگ زبانیبسیاری از مکالمات روزمره در کشورهای مختلف به شکل ترکیبی از زبان مادری و زبان انگلیسی بیان میشوند. مدل مایکروسافت بهمحض ورود کلمات جدید، زبان را بدون افت سرعت یا هنگ کردن تغییر میدهد.
- انتخاب لحن پیادهسازی برای کاربردهای اداری یا حقوقیمدل دو خروجی تمیز بدون تپق و تکرار برای امور اداری، و خروجی مو به مو برای امور دادگاهی و پلیسی ارائه میدهد.
جدول مقایسه همهجانبه هوش مصنوعی MAI-Transcribe-2 با رقبای بازار
| شاخص ارزیابی فنی و اقتصادی | مایکروسافت MAI-Transcribe-2 | اوپنایآی ویسپر نسخه ۳ لارج | جمینای ۳.۵ گوگل مدل صوت |
| هزینه هر ساعت فایل صوتی | ۱۰ سنت | ۳۶ سنت | ۳۰ سنت |
| تعداد زبانهای اصلی تحت پوشش | ۶۰ زبان با سوئیچینگ آنی | حدود ۵۰ زبان | حدود ۴۲ زبان |
| نرخ خطای کلمات در بنچمارک معتبر | زیر ۵ درصد میانگین ۶۰ زبان | ۶.۸ درصد | ۷.۱ درصد |
| نیاز به مدل جانبی تفکیک گوینده | کاملاً بومی و پیوسته | نیازمند پایپلاین جداگانه | نیازمند تنظیمات پیشرفته ابری |
| همگامسازی و برچسب زمانی واژگان | برچسب صدم ثانیهای بدون خطا | برچسبگذاری نسبتاً مطلوب | تراز کلی در سطح جملات |
| توانایی تفکیک نویز در صدای محیط | عملکرد بینقص در صداهای محیطی | کاهش دقت در محیطهای باز | عملکرد متوسط در مکالمه شلوغ |
چالش لهجهها و زبانهای بومی؛ نگاهی دقیق به بنچمارکهای جهانی
یکی از بزرگترین چالشهای همیشگی الگوریتمهای صوتی، تسلط بر گویشها و تفاوتهای آوایی در زبانهای مختلف است. بیشتر ابزارهای موجود در لهجههای استاندارد انگلیسی آمریکایی یا بریتانیایی کارایی مطلوبی ارائه میدهند، اما با مواجهه با لهجههای مختلف، درصد خطای آنها بهشدت بالا میرود.
طبق تستهای انجامشده روی شاخص معتبر جهانی FLEURS که تلفظها و لهجههای ۶۰ زبان جهان را با تنوع اقلیمی مورد ارزیابی قرار میدهد، مدل جدید ردموند به میانگین نرخ خطای واژگان کمتر از ۵ درصد دست یافته است. این نتیجه یعنی کمترین میزان اشتباه شنیداری در میان تمامی مدلهای پردازش زبان صوتی تاریخ. نکته قابل توجه، درک اصطلاحات محلی و نادیده گرفتن صداهای زائد پسزمینه مثل تقتق صفحه کلید، بوق خودروها یا صدای جریان هوا در محیطهای باز است؛ قابلیتی که ارزش استفاده از این ابزار را دوچندان میکند.
بازی بزرگ استقلال؛ چرا مایکروسافت از اوپنایآی فاصله میگیرد؟
رونمایی از این سیستم پیشرفته، پیامی آشکار به سرمایهگذاران والاستریت و فعالان دره سیلیکون مخابره میکند. مایکروسافت دیگر مایل نیست صرفاً به عنوان یک سرمایهگذار در سایه اوپنایآی یا خریدار فناوریهای ابری شناخته شود. استراتژی ردموند در سالهای اخیر بر خودکفایی بیقیدوشرط در هسته مدلهای پایهای متمرکز شده است.
آنها ابتدا مدلهای تولید تصویر را با معماریهای نوآورانه بهینهسازی کردند، سپس پردازش متن را هدف گرفتند و اکنون با MAI-Transcribe-2 رقیب مستقیم مدل متنباز ویسپر شدهاند. اگر شرکتی بتواند سرویسهای تشخیص گفتار را با هزینهای نزدیک به یکچهارم تعرفههای جاری بازار و با سرعت سه برابر اجرا کند، هیچ دلیل منطقی برای ماندن روی زیرساختهای قدیمی رقبا باقی نمیماند.
پیامدهای این دستاورد برای صنعت فناوری و آینده بازار
ورود چنین مدلی با این بازدهی اقتصادی و کیفی، چندین پیامد محسوس در آینده نزدیک خواهد داشت
اولاینکه خدمات زیرنویس خودکار، تولید فایلهای متنی از ویدیوها و تبدیل مصاحبههای صوتی خبرنگاران دگرگون میشود. نرمافزارهای یادداشتبرداری جلسات دیگر نیازی به خرید سرورهای سنگین یا پرداخت مبالغ گزاف اشتراک ماهیانه به سرویسهای شخص ثالث نخواهند داشت.
دوماینکه کاربردهای دسترسیپذیری برای افراد کمشنوا و ناشنوا وارد عصری شگفتانگیز میشود. نمایش آنی گفتههای مدرس در کلاسهای درس یا همایشهای بینالمللی با دقت نزدیک به صددرصد و تاخیر ناچیز، عدالت آموزشی را وارد سطحی تازه میکند.
سوماینکه شرکتهای ارائهدهنده سرویسهای هوش مصنوعی ناچار خواهند شد تعرفههای خود را به شکل چشمگیری کاهش دهند تا از میدان این رقابت حذف نشوند؛ اتفاقی که در نهایت به نفع کاربران عادی و توسعهدهندگان مستقل رقم میخورد.
رقابت سنگین مایکروسافت با ویسپر در بازار جهانی
این مدل در حال حاضر از طریق درگاههای Microsoft Foundry و بستر تعاملی MAI Playground در دسترس علاقهمندان قرار گرفته و مهندسان نرمافزار میتوانند با فراخوانی وبسرویسهای ابری، آن را در اپلیکیشنهای خود پیادهسازی کنند. این حرکت نشان داد که سال جاری، سال رقابت بر سر کاهش اندازه، ارزانسازی و افزایش راندمان پردازشهای مبتنی بر هوش مصنوعی است. تحریریه XNET به پایش عملکرد این مدل در پردازش زبانهای خاورمیانه ادامه خواهد داد تا بازخورد کاربران و پژوهشگران را در گزارشهای آینده بررسی کند.
سوالات متداول
پردازش هر ساعت فایل صوتی تنها ۱۰ سنت است که کاهشی معادل ۷۲ درصد در مقایسه با نسل قبلی خود به همراه دارد.
فناوری جدید مایکروسافت از ۶۰ زبان رسمی و زنده جهان به همراه قابلیت جابهجایی آنی میان آنها پشتیبانی میکند.
این سیستم صدای تکتک افراد حاضر در نشستها را به شکل خودکار و دقیق جدا کرده و نامگذاری مینماید.
این مدل در مقیاسهای استاندارد جهانی با ثبت خطای زیر ۵ درصد، عملکردی مطلوبتر و برتر از ویسپر ثبت کرده است.
علاقهمندان میتوانند با اتصال به درگاههای فاندری مایکروسافت و محیط پیگراند از این سرویس پردازشی بهره ببرند.
برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.