مایکروسافت دقیقترین مدل تبدیل گفتار به متن را عرضه کرد
مایکروسافت با معرفی سه مدل هوش مصنوعی جدید برای پردازش گفتار بلادرنگ، قابلیتهای دستیارهای صوتی و سیستمهای مکالمهای خود را به شکلی قابل توجه ارتقا داد. هوش مصنوعی تکناک، مایکروسافت سبد محصولات هوش مصنوعی خود را با معرفی سه مدل جدید در حوزه پردازش و تولید گفت…
خلاصه تحلیلی خبر
مایکروسافت با معرفی سه مدل هوش مصنوعی جدید برای پردازش گفتار بلادرنگ، قابلیتهای دستیارهای صوتی و سیستمهای مکالمهای خود را به شکلی قابل توجه ارتقا داد. هوش مصنوعی تکناک، مایکروسافت سبد محصولات هوش مصنوعی خود را با معرفی سه مدل جدید در حوزه پردازش و تولید گفت…
موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، مدل، صوتی، گفتار، مایکروسافت
مایکروسافت با معرفی سه مدل هوش مصنوعی جدید برای پردازش گفتار بلادرنگ، قابلیتهای دستیارهای صوتی و سیستمهای مکالمهای خود را به شکلی قابل توجه ارتقا داد.
هوش مصنوعیتکناک، مایکروسافت سبد محصولات هوش مصنوعی خود را با معرفی سه مدل جدید در حوزه پردازش و تولید گفتار توسعه داد. این شرکت در ادامه مسیر استراتژیک خود برای تقویتمدلهای اختصاصی موسوم به MAIابزارهای تازهای را معرفی کرده است که با هدف ارتقای تجربه دستیارهای صوتی و بهبود عملکرد در سیستمهای مکالمهای بلادرنگ طراحی شدهاند. این اقدام، سبد فعلی شرکت را که پیش از این در حوزههایی نظیر تولید تصویر، استدلال و کدنویسی فعال بود، به شکل قابلتوجهی در بخش پردازش گفتار تقویت میکند.
پیشتر، مدل MAI-Transcribe-2 توانسته بود در آزمایشهای داخلی مایکروسافت، عملکردی فراتر از مدلهای تبدیل گفتار به متن رقبا از جمله OpenAI و گوگل نشان دهد، آن هم در حالی که هزینه استفاده از آن تنها ۰.۱۰ دلار به ازای هر ساعت بود. اکنون، سه مدل جدید MAI-Transcribe-2-Streaming، MAI-Voice-2.1 و MAI-Voice-2.1-Flash برای همکاری با یکدیگر جهت تامین توان پردازشی دستیارهای صوتی پیشرفته عرضه شدهاند.
کاهش تاخیر در تبدیل گفتار
مدل MAI-Transcribe-2-Streaming محصولی کلیدی برای کاربردهای بلادرنگ است. برخلاف نسخه قبلی که صرفاً به پردازش فایلهای صوتی ضبطشده محدود بود، این مدل برای محیطهای زنده طراحی شده است. ویژگی متمایز این فناوری، سرعت بالای آن در ارائه نتایج اولیه است؛ به طوری که تولید خروجیهای متنی تنها کمی بیش از ۱۰۰ میلیثانیه پس از دریافت صدا آغاز میشود. این ابزار با قابلیت بازبینی مداوم نتایج همزمان با دریافت دادههای بیشتر، در نهایت متن دقیقتری ارائه میدهد. پشتیبانی از ۶۰ زبان و تشخیص خودکار و پیوسته زبان، این مدل ازخانواده MAIرا به گزینهای قدرتمند تبدیل کرده است که در حال حاضر در وبسایت Artificial Analysis، رتبه نخست دقت را در میان رقبا در اختیار دارد. قیمت این مدل تا پایان سال ۲۰۲۶، ۰.۵۴ دلار برای هر ساعت صدا تعیین شده است.
در بخش تبدیل متن به گفتار، مایکروسافت مدل MAI-Voice-2.1 را معرفی کرد که توانایی پشتیبانی از ۲۳ زبان را در ۲۶ منطقه جغرافیایی دارد. ویژگی برجسته این مدل، امکان حفظ هویت صوتی گوینده حین جابهجایی میان زبانهای مختلف و اتخاذ لهجه بومی برای هر زبان است. این فناوری با قیمت ۲۲ دلار به ازای هر یک میلیون کاراکتر عرضه میشود.
مزایای سرعت مدل Voice-2.1-Flash
برای سناریوهای حساس به تاخیر و با حجم کار بالا، مدل MAI-Voice-2.1-Flash در نظر گرفته شده است. طبق گزارشنئوویناین نسخه با دستیابی به تاخیر کلی حدود ۱۵۰ میلیثانیه برای تولید ۴۵ ثانیه صدا، ۵۵ درصد استنتاج سریعتر را نسبت به مدلهای استاندارد ارائه میدهد و از نظر اقتصادی نیز حدود ۶۰ درصد ارزانتر از مدلهای مشابه است. هزینه استفاده از این مدل ۱۵ دلار به ازای هر یک میلیون کاراکتر است. نکته مهم در هر دو مدل صوتی جدید، توانایی آنها در شبیهسازی دقیق صدا تنها با چند ثانیه فایل مرجع است که در تمامی زبانهای تحت پشتیبانی عملکردی یکسان دارد.
دسترسی به تمامی این مدلها از طریق Microsoft Foundry، پلتفرم MAI Playground و Vercel فراهم شده است. همچنین توسعهدهندگان میتوانند از طریق OpenRouter و Azure Voice Live از قابلیتهای این ابزارها بهرهمند شوند. پشتیبانی از LiveKit نیز بهزودی به این اکوسیستم افزوده خواهد شد تا ادغام این فناوری در سیستمهای صوتی پیچیده تسهیل شود. با معرفی این محصولات، مایکروسافت زیرساختهای تعاملات صوتی نسل جدید را با ترکیبی از سرعت، دقت و هزینه رقابتی برای کاربران سازمانی و توسعهدهندگان فراهم میکند.
نوشتهمایکروسافت دقیقترین مدل تبدیل گفتار به متن را عرضه کرداولین بار درTechnoc. پدیدار شد.
برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.