زومیا؛ هوش مصنوعی

مایکروسافت با مدل صوتی جدید رکورد سرعت و دقت هوش مصنوعی را شکست

مایکروسافت با رونمایی از MAI-Transcribe-2-Streaming و دستیابی به نرخ خطای ۲٫۵ درصد در ۰٫۱۳ ثانیه، صدر جدول تبدیل بلادرنگ صوت به متن را تصاحب کرد. مایکروسافت در تازه‌ترین گام خود برای تصاحب بازار پردازش صوت، از مدل پیشرفته‌ی MAI-Transcribe-2-Streaming رونمایی ک…

3 دقیقه مطالعه
  • پشتیبانی شبکه
  • هوش مصنوعی
  • خطای
  • مدل
  • ثانیه
  • نرخ
  • درصد
  • مایکروسافت
مایکروسافت با مدل صوتی جدید رکورد سرعت و دقت هوش مصنوعی را شکست

خلاصه تحلیلی خبر

مایکروسافت با رونمایی از MAI-Transcribe-2-Streaming و دستیابی به نرخ خطای ۲٫۵ درصد در ۰٫۱۳ ثانیه، صدر جدول تبدیل بلادرنگ صوت به متن را تصاحب کرد. مایکروسافت در تازه‌ترین گام خود برای تصاحب بازار پردازش صوت، از مدل پیشرفته‌ی MAI-Transcribe-2-Streaming رونمایی ک…

موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، خطای، مدل، ثانیه، نرخ

لوگو مایکروسافت / Microsoft داخل مکعب با پس زمینه آسمان

مایکروسافت با رونمایی از MAI-Transcribe-2-Streaming و دستیابی به نرخ خطای ۲٫۵ درصد در ۰٫۱۳ ثانیه، صدر جدول تبدیل بلادرنگ صوت به متن را تصاحب کرد.

مایکروسافت در تازه‌ترین گام خود برای تصاحب بازار پردازش صوت، از مدل پیشرفته‌ی MAI-Transcribe-2-Streaming رونمایی کرد. مدل جدید ردموندی‌ها در بنچمارک معتبر AA-WER Streaming موفق شد با ثبت نرخ خطای کلمه‌ای (WER) خیره‌کننده‌ی ۲٫۵ درصد در زمان پاسخ‌دهی شگفت‌انگیز ۰٫۱۳ ثانیه پس از پایان صحبتجایگاه نخست دقت و سرعت جهانرا در میان ۳۸ مدل رقیب به دست آورد.

این مدل توانست رقبای سرسختی نظیر Grok Voice Transcribe 2.0 متعلق به اسپیس‌ایکس‌ای‌آی را که پیش‌تر با نرخ خطای ۲٫۷ درصد و تاخیر ۰٫۴۹ ثانیه پیشتاز بود، با فاصله‌ای محسوس پشت سر بگذارد.

پردازش صوت در محیط‌های زنده نیازمند سرعت واکنشی است که با ریتم مکالمات انسانی هم‌خوانی داشته باشد و خروجی جدید مایکروسافت گامی بزرگ در محقق ساختن رونویسی بی‌وقفه و بلادرنگ به شمار می‌رود.

Microsoft

عملکرد مدل‌ها در تبدیل جریان گفتار به متن بر اساس دو مؤلفه‌ی دقت متن نهایی (Final Transcript) و اولین خروجی جزئی (First Partial Transcript) ارزیابی می‌شود. مایکروسافت در هر دو شاخص دست بالا را دارد و موفق شده استانداردهای تازه‌ای ثبت کند.

  • متن نهایی: مدل MAI-Transcribe-2-Streaming با نرخ خطای ۲٫۵ درصد و زمان ۰٫۱۳ ثانیه، عملکردی دقیق‌تر و سریع‌تر نسبت به Muse Voice Transcribe با خطای ۳٫۱ درصد و زمان ۰٫۱۶ ثانیه و ElevenLabs Scribe v2 Realtime با خطای ۳٫۶ درصد و زمان ۰٫۱۴ ثانیه ارائه می‌دهد. مدل Cartesia Ink Preview هرچند با ۰٫۱۱ ثانیه کمی سریع‌تر عمل می‌کند، اما نرخ خطای ۳٫۱ درصدی آن نشان‌دهنده‌ی دقت پایین‌تر است.
  • اولین خروجی جزئی: در تولید نخستین قطعات متنی حین صحبت، نماینده‌ی مایکروسافت به نرخ خطای ۲٫۵ درصد در زمان ۰٫۱۲ ثانیه دست یافته که در مقایسه با خطای ۳٫۴ درصدی مدل Grok Voice Transcribe 2.0 و خطای ۳٫۶ درصدی مدل‌های Muse و ElevenLabs برتری چشمگیری را رقم می‌زند. در این میان تنها مدل Cartesia Ink-2 با زمان ۰٫۰۷ ثانیه سرعتی بالاتر دارد که البته با نرخ خطای ۴٫۰ درصدی، دقت به‌مراتب کمتری به نمایش می‌گذارد.

دسترسی به بالاترین سطح فناوری هزینه‌ی بیشتری نیز طلب می‌کند. مایکروسافت مدل جدید را با نرخ ۰٫۵۴ دلار به ازای هر ساعت صدا یا ۹٫۰۰ دلار برای هر ۱٬۰۰۰ دقیقه ارائه کرده است. چنین اعدادی، سرویس جدید را در بالاترین رده‌ی قیمتی بازار در کنار مدل Gemini 3.5 Transcribe Live با قیمت ۹ دلار قرار می‌دهد.

هزینه‌ی اعلام‌شده برای استفاده‌ی بلادرنگ، بالاتر از نرخ ۶٫۵۰ دلاری مدل‌های ElevenLabs Scribe v2 Realtime و Deepgram Flux است. این مبلغ بیش از دو برابر هزینه‌ی ۴ دلاری Cartesia Ink-2 و سه‌برابر تعرفه‌ی ۳ دلاری Muse Voice Transcribe ارزیابی شده است. در سمت مقابل، نسخه‌ی MAI-Transcribe-2 با قیمت اقتصادی‌ترِ ۰٫۱۰ دلار در هر ساعت معادل ۱٫۶۷ دلار برای هر ۱٬۰۰۰ دقیقه صدا در دسترس توسعه‌دهندگان قرار دارد تا سازمان‌ها بر اساس اولویت خود میان پردازش زنده یا آفلاین دست به انتخاب بزنند.

برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.