اخبار هوش مصنوعی

مدل Muse Voice Transcribe متا چند گوینده و زبان را هم‌زمان تشخیص می دهد

شرکت متا از مدل صوتی جدیدی با نام Muse Voice Transcribe رونمایی کرده است که می‌تواند چند گوینده و زبان را به‌طور هم‌زمان تشخیص دهد. به گزارش سرویس هوش مصنوعی تک‌ناک ، این مدل نخستین مدل صوتی بلادرنگ این شرکت محسوب می‌شود و برای تبدیل سریع گفتار به متن طراحی شد…

5 دقیقه مطالعه
  • پشتیبانی شبکه
  • هوش مصنوعی
  • مدل
  • متا
  • Transcribe
  • Voice
  • Muse
  • صوتی
مدل Muse Voice Transcribe متا چند گوینده و زبان را هم‌زمان تشخیص می دهد

خلاصه تحلیلی خبر

شرکت متا از مدل صوتی جدیدی با نام Muse Voice Transcribe رونمایی کرده است که می‌تواند چند گوینده و زبان را به‌طور هم‌زمان تشخیص دهد. به گزارش سرویس هوش مصنوعی تک‌ناک ، این مدل نخستین مدل صوتی بلادرنگ این شرکت محسوب می‌شود و برای تبدیل سریع گفتار به متن طراحی شد…

موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، مدل، متا، Transcribe، Voice

شرکت متا از مدل صوتی جدیدی با نام Muse Voice Transcribe رونمایی کرده است که می‌تواند چند گوینده و زبان را به‌طور هم‌زمان تشخیص دهد.

به گزارش سرویس هوش مصنوعی تک‌ناک، این مدل نخستین مدل صوتی بلادرنگ این شرکت محسوب می‌شود و برای تبدیل سریع گفتار به متن طراحی شده است.

مدل Muse Voice Transcribe می‌تواند صدای بیش از ۲۰ گوینده را در یک جلسه تشخیص دهد. همچنین توانایی کار با چند زبان را به‌ صورت هم‌زمان دارد. متا بیان کرده است که این مدل حتی می‌تواند تغییر زبان در میانه جمله را نیز تشخیص دهد.

این مدل جدید توسط Meta Superintelligence Lab توسعه پیدا کرده و قرار است در محصولات و ابزارهای مختلف متا مورد استفاده قرار گیرد.

بیشتر بخوانید: گوگل از مدل صوتی جدید Gemini رونمایی کرد؛ حذف خودکار مکث‌ها و کلمات اضافی

مدل Muse Voice Transcribe متا چگونه کار می‌کند؟

یکی از ویژگی‌های مهم این مدل، توانایی تشخیص گویندگان مختلف است. این فناوری می‌تواند در یک مکالمه، صدای افراد مختلف را از یکدیگر جدا کند و متن هر گوینده را به شکل دقیق‌تری ثبت نماید.

همچنین این مدل برای عملکرد بلادرنگ طراحی شده است. به گفته متا، Muse Voice Transcribe هنگام شنیدن کلمات دشوار کمی بیشتر منتظر می‌ماند. در مقابل، برای کلمات ساده سریع‌تر نتیجه را ثبت می‌کند.

این روش به مدل کمک می‌کند میان سرعت و دقت تعادل برقرار کند. همچنین متا اعلام کرده که این مدل برای جلسات طولانی نیز طراحی شده است و می‌تواند مکالماتی با بیش از ۲۰ گوینده را مدیریت کند.

مدل Muse Voice Transcribe متا در حال تشخیص چند گوینده و زبان

پشتیبانی از بیش از ۷۰ زبان و تغییر زبان در یک جمله

یکی از قابلیت‌های جذاب مدل Muse Voice Transcribe متا، پشتیبانی گسترده از زبان‌ها است. متا اعلام کرده که این مدل در فرایند آموزش با بیش از ۷۰ زبان کار کرده و در زمان عرضه، عملکرد آن برای ۲۵ زبان اعتبارسنجی شده است.

این مدل علاوه بر تشخیص زبان‌های مختلف، قابلیت مهم دیگری نیز دارد. Muse Voice Transcribe می‌تواند هنگام صحبت کردن کاربر، تغییر زبان را در میانه جمله تشخیص دهد.

برای مثال، اگر فردی در یک جمله از کلمات متعلق به دو زبان مختلف استفاده کند، مدل می‌تواند این تغییر را تشخیص دهد و متن را مطابق گفتار اصلی ثبت کند.

این قابلیت که به آن Code-Switching گفته می‌شود، می‌تواند برای کاربران چندزبانه کاربرد زیادی داشته باشد.

کاربرد مدل Muse Voice Transcribe در محصولات متا

متا اعلام کرده که این مدلهمین حالا در برخی محصولات جدید این شرکت مورد استفاده قرار گرفته است.

یکی از این محصولات، اپلیکیشن Meta AI برای مک است. این برنامه می‌تواند قابلیت‌های صوتی خود را در سایر اپلیکیشن‌ها نیز فعال کند. در نتیجه، Muse Voice Transcribe اکنون برای قابلیت دیکته صوتی در سرویس‌های دیگر نیز کاربرد دارد.

همچنین این مدل در Muse Code و Meta Model API در دسترس توسعه‌دهندگان قرار گرفته است. قیمت استفاده از API برابر با ۳ دلار برای هر هزار دقیقه صدای پردازش‌شده اعلام شده است.

رقابت متا و گوگل در حوزه مدل‌های صوتی

معرفی Muse Voice Transcribe در شرایطی انجام شده است که شرکت‌های بزرگ فناوری تمرکز بیشتری روی مدل‌های صوتی هوش مصنوعی دارند.

گوگل نیز مدت کوتاهی پیش مدل Gemini 3.5 Transcribe را معرفی کرده بود. این مدل نیز قابلیت‌های پیشرفته‌ای برای تبدیل گفتار به متن ارائه می‌دهد.

با وجود این، رویکرد شرکت‌ها کمی متفاوت است. گوگل قصد دارد مدل صوتی خود را در اندروید و در آینده در مرورگر کروم به کار بگیرد. هنوز مشخص نیست متا چه برنامه‌ای برای استفاده گسترده‌تر از مدل Muse Voice Transcribe در سرویس‌های اصلی خود دارد.

متا مدل صوتی Muse Voice Transcribe را معرفی کرد

بیشتر بخوانید: مدل صوتی Grok Voice Think Fast 2.0 از رقبا پیشی گرفت

متا به توسعه مدل‌های جدید ادامه می‌دهد

مدل Muse Voice Transcribe جدیدترین محصول Meta Superintelligence Lab است. این واحد در هفته‌های اخیر فعالیت زیادی در حوزه هوش مصنوعی داشته است.

متا پیش از این نیز نخستین عامل اختصاصی خود برای برنامه‌نویسی، یک مدل Open-Weight و اپلیکیشن Meta AI برای مک را معرفی کرده بود.

عرضه مدل صوتی جدید نشان می‌دهد متا قصد دارد حضور خود را در بخش‌های مختلف هوش مصنوعی گسترش دهد. قابلیت‌هایی مانند تشخیص چند گوینده، پشتیبانی از زبان‌های مختلف و پردازش بلادرنگ می‌توانند کاربردهای متنوعی برای کاربران و توسعه‌دهندگان داشته باشند.

جمع‌بندی

مدل Muse Voice Transcribe متا یکی از جدیدترین تلاش‌های این شرکت برای توسعه فناوری‌های صوتی هوش مصنوعی است. این مدل می‌تواند بیش از ۲۰ گوینده را در مکالمات طولانی تشخیص دهد و با چند زبان به‌ صورت هم‌زمان کار کند.

پشتیبانی از تغییر زبان در میانه جمله نیز یکی از ویژگی‌های مهم آن است. این قابلیت می‌تواند Muse Voice Transcribe را برای جلسات، دیکته صوتی و مکالمات چندزبانه به گزینه‌ای کاربردی تبدیل کند.

در حال حاضر این مدل از طریق برخی محصولات متا و API در اختیار کاربران و توسعه‌دهندگان قرار گرفته است. باید دید متا در آینده از این فناوری در کدام سرویس‌های اصلی خود استفاده خواهد کرد.

نوشته مدل Muse Voice Transcribe متا چند گوینده و زبان را هم‌زمان تشخیص می دهد اولین بار در Technoc. پدیدار شد.

برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.