اخبار هوش مصنوعی

مایکروسافت دقیق‌ترین مدل تبدیل گفتار به متن را عرضه کرد

مایکروسافت با معرفی سه مدل هوش مصنوعی جدید برای پردازش گفتار بلادرنگ، قابلیت‌های دستیارهای صوتی و سیستم‌های مکالمه‌ای خود را به شکلی قابل توجه ارتقا داد. هوش مصنوعی تکناک، مایکروسافت سبد محصولات هوش مصنوعی خود را با معرفی سه مدل جدید در حوزه پردازش و تولید گفت…

4 دقیقه مطالعه
  • پشتیبانی شبکه
  • هوش مصنوعی
  • مدل
  • صوتی
  • گفتار
  • مایکروسافت
  • پشتیبانی
  • معرفی
مایکروسافت دقیق‌ترین مدل تبدیل گفتار به متن را عرضه کرد

خلاصه تحلیلی خبر

مایکروسافت با معرفی سه مدل هوش مصنوعی جدید برای پردازش گفتار بلادرنگ، قابلیت‌های دستیارهای صوتی و سیستم‌های مکالمه‌ای خود را به شکلی قابل توجه ارتقا داد. هوش مصنوعی تکناک، مایکروسافت سبد محصولات هوش مصنوعی خود را با معرفی سه مدل جدید در حوزه پردازش و تولید گفت…

موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، مدل، صوتی، گفتار، مایکروسافت

مایکروسافت با معرفی سه مدل هوش مصنوعی جدید برای پردازش گفتار بلادرنگ، قابلیت‌های دستیارهای صوتی و سیستم‌های مکالمه‌ای خود را به شکلی قابل توجه ارتقا داد.

هوش مصنوعیتکناک، مایکروسافت سبد محصولات هوش مصنوعی خود را با معرفی سه مدل جدید در حوزه پردازش و تولید گفتار توسعه داد. این شرکت در ادامه مسیر استراتژیک خود برای تقویتمدل‌های اختصاصی موسوم به MAIابزارهای تازه‌ای را معرفی کرده است که با هدف ارتقای تجربه دستیارهای صوتی و بهبود عملکرد در سیستم‌های مکالمه‌ای بلادرنگ طراحی شده‌اند. این اقدام، سبد فعلی شرکت را که پیش از این در حوزه‌هایی نظیر تولید تصویر، استدلال و کدنویسی فعال بود، به شکل قابل‌توجهی در بخش پردازش گفتار تقویت می‌کند.

پیش‌تر، مدل MAI-Transcribe-2 توانسته بود در آزمایش‌های داخلی مایکروسافت، عملکردی فراتر از مدل‌های تبدیل گفتار به متن رقبا از جمله OpenAI و گوگل نشان دهد، آن هم در حالی که هزینه استفاده از آن تنها ۰.۱۰ دلار به ازای هر ساعت بود. اکنون، سه مدل جدید MAI-Transcribe-2-Streaming، MAI-Voice-2.1 و MAI-Voice-2.1-Flash برای همکاری با یکدیگر جهت تامین توان پردازشی دستیارهای صوتی پیشرفته عرضه شده‌اند.

کاهش تاخیر در تبدیل گفتار

مدل MAI-Transcribe-2-Streaming محصولی کلیدی برای کاربردهای بلادرنگ است. برخلاف نسخه قبلی که صرفاً به پردازش فایل‌های صوتی ضبط‌شده محدود بود، این مدل برای محیط‌های زنده طراحی شده است. ویژگی متمایز این فناوری، سرعت بالای آن در ارائه نتایج اولیه است؛ به طوری که تولید خروجی‌های متنی تنها کمی بیش از ۱۰۰ میلی‌ثانیه پس از دریافت صدا آغاز می‌شود. این ابزار با قابلیت بازبینی مداوم نتایج هم‌زمان با دریافت داده‌های بیشتر، در نهایت متن دقیق‌تری ارائه می‌دهد. پشتیبانی از ۶۰ زبان و تشخیص خودکار و پیوسته زبان، این مدل ازخانواده MAIرا به گزینه‌ای قدرتمند تبدیل کرده است که در حال حاضر در وب‌سایت Artificial Analysis، رتبه نخست دقت را در میان رقبا در اختیار دارد. قیمت این مدل تا پایان سال ۲۰۲۶، ۰.۵۴ دلار برای هر ساعت صدا تعیین شده است.

چهار نفر در یک جلسه کاری دور یک میز چوبی در اتاقی با پنجره‌های بزرگ روبه‌نما شهری نشسته‌اند و یک اسپیکر هوشمند دایره‌ای تیره در مرکز میز قرار دارد.

در بخش تبدیل متن به گفتار، مایکروسافت مدل MAI-Voice-2.1 را معرفی کرد که توانایی پشتیبانی از ۲۳ زبان را در ۲۶ منطقه جغرافیایی دارد. ویژگی برجسته این مدل، امکان حفظ هویت صوتی گوینده حین جابه‌جایی میان زبان‌های مختلف و اتخاذ لهجه بومی برای هر زبان است. این فناوری با قیمت ۲۲ دلار به ازای هر یک میلیون کاراکتر عرضه می‌شود.

مزایای سرعت مدل Voice-2.1-Flash

برای سناریوهای حساس به تاخیر و با حجم کار بالا، مدل MAI-Voice-2.1-Flash در نظر گرفته شده است. طبق گزارشنئوویناین نسخه با دستیابی به تاخیر کلی حدود ۱۵۰ میلی‌ثانیه برای تولید ۴۵ ثانیه صدا، ۵۵ درصد استنتاج سریع‌تر را نسبت به مدل‌های استاندارد ارائه می‌دهد و از نظر اقتصادی نیز حدود ۶۰ درصد ارزان‌تر از مدل‌های مشابه است. هزینه استفاده از این مدل ۱۵ دلار به ازای هر یک میلیون کاراکتر است. نکته مهم در هر دو مدل صوتی جدید، توانایی آن‌ها در شبیه‌سازی دقیق صدا تنها با چند ثانیه فایل مرجع است که در تمامی زبان‌های تحت پشتیبانی عملکردی یکسان دارد.

دسترسی به تمامی این مدل‌ها از طریق Microsoft Foundry، پلتفرم MAI Playground و Vercel فراهم شده است. همچنین توسعه‌دهندگان می‌توانند از طریق OpenRouter و Azure Voice Live از قابلیت‌های این ابزارها بهره‌مند شوند. پشتیبانی از LiveKit نیز به‌زودی به این اکوسیستم افزوده خواهد شد تا ادغام این فناوری در سیستم‌های صوتی پیچیده تسهیل شود. با معرفی این محصولات، مایکروسافت زیرساخت‌های تعاملات صوتی نسل جدید را با ترکیبی از سرعت، دقت و هزینه رقابتی برای کاربران سازمانی و توسعه‌دهندگان فراهم می‌کند.

نوشتهمایکروسافت دقیق‌ترین مدل تبدیل گفتار به متن را عرضه کرداولین بار درTechnoc. پدیدار شد.

برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.