اخبار هوش مصنوعی

گوگل از مدل هوش مصنوعی Lyria ۳.۵ رونمایی کرد؛ تحول بزرگ استودیویی در تولید موسیقی جمینای

مدل هوش مصنوعی لیریا ۳.۵ با حذف کامل نویزهای مزاحم صوتی، ادای بی‌نقص گویش‌های محلی و قابلیت اجرای تکنوازی زنده سازها در پلتفرم جمینای رسماً رونمایی شد. صنعت پردازش صوت و مهندسی صدا در نخستین ماه‌های سال ۲۰۲۶ با تحولی شگرف روبه‌رو شده است. آزمایشگاه‌های تخصصی ش…

6 دقیقه مطالعه
  • پشتیبانی شبکه
  • هوش مصنوعی
  • لیریا
  • مصنوعی
  • هوش
  • صوتی
  • مدل
  • موسیقی

خلاصه تحلیلی خبر

مدل هوش مصنوعی لیریا ۳.۵ با حذف کامل نویزهای مزاحم صوتی، ادای بی‌نقص گویش‌های محلی و قابلیت اجرای تکنوازی زنده سازها در پلتفرم جمینای رسماً رونمایی شد. صنعت پردازش صوت و مهندسی صدا در نخستین ماه‌های سال ۲۰۲۶ با تحولی شگرف روبه‌رو شده است. آزمایشگاه‌های تخصصی ش…

موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، لیریا، مصنوعی، هوش، صوتی

مدل هوش مصنوعی لیریا ۳.۵ با حذف کامل نویزهای مزاحم صوتی، ادای بی‌نقص گویش‌های محلی و قابلیت اجرای تکنوازی زنده سازها در پلتفرم جمینای رسماً رونمایی شد.

صنعت پردازش صوت و مهندسی صدا در نخستین ماه‌های سال ۲۰۲۶ با تحولی شگرف روبه‌رو شده است. آزمایشگاه‌های تخصصی شرکت گوگل پس از مدت‌ها آزمایش و توسعه پشت درهای بسته، جدیدترین پرچمدار خود را در دسته موتورهای تولید صوت با عنوان تجاری Lyria 3.5 به صحنه آوردند. این رویداد تنها یک بهبود دوره‌ای ساده نیست؛ بلکه طبق ارزیابی کارشناسان رسانه ، لیریا ۳.۵ راه‌حلی نهایی برای یکی از دیرینه‌ترین چالش‌های تاریخ آهنگسازی با ماشین، یعنی پاکسازی فرکانس‌ها از خش‌های مصنوعی و تداخل‌های پنهان دیجیتالی است.

با در دسترس قرار گرفتن این مدل در ابزارهای ابری برنامه‌نویسان، آهنگسازان، تولیدکنندگان پادکست و فعالان حوزه رسانه اکنون این امکان را دارند که ساختارهای ارکسترال و الگوهای آوازی را با دقتی مشابه استودیوهای فیزیکی بسازند. این پرچمدار با هماهنگی کامل درون رابط کاربری جدید عرضه شده و راه را برای تولیدهای بلادرنگ باز کرده است.

کالبدشکافی تحول فنی؛ پایان دوران نویز و درک عمق فرکانس

اصلی‌ترین دردسر هنرمندان هنگام کار با نسل‌های پیشین سامانه‌های هوش مصنوعی، افت کیفیت خروجی در فرکانس‌های بالا و ایجاد خش‌های آزاردهنده در لایه‌های پس‌زمینه بود. مدل جدید با بازطراحی پایه‌ای روش پردازش تبدیل موج صوتی به عدد، خطاهای رزولوشن را به پایین‌ترین سطح ممکن رسانده است.

طبق مستندات منتشر شده از سویآزمایشگاه هوش مصنوعی دیپ‌مایند گوگلشاخص نسبت سیگنال به نویز در لیریا ۳.۵ با بهبودی خیره‌کننده معادل ۴۲ درصد نسبت به نسخه پیشین روبه‌رو شده است. این دستاورد فنی سبب می‌شود فرکانس‌های زیر مانند صدای برخورد مضراب به سیم‌های سازهای زهی یا ارتعاش سنج‌ها بدون هرگونه تاری فرکانسی ضبط شوند.

علاوه بر کیفیت فرکانس، زمان تاخیر در تولید فایل نیز ۵۰ درصد کاهش یافته و به طور میانگین یک قطعه کامل با کیفیت استودیویی ظرف کمتر از ۱.۸ ثانیه توسط سرورهای گرافیکی پردازش می‌شود. تحلیل‌های تکمیلی نشان می‌دهد که فیلترهای ضد دیستورشن جدید اجازه نمی‌دهند بخش‌های پرتراکم ارکستر باعث خفگی سایر سازها شوند، پدیده‌ای که پیش از این در پروژه‌های موسیقی هوش مصنوعی به وفور دیده می‌شد.

انعطاف‌پذیری شگفت‌انگیز در لهجه‌های محلی و اشعار بومی

بخش دیگری از درخشش فنی این مدل که دروبلاگ رسمی آزمایشگاه نوآوری گوگلبه آن پرداخته شده، درک ظریف لهجه‌ها و سبک‌های خوانش سنتی است. پیش از این، اکثر پلتفرم‌های موجود تنها بر زبان‌های استاندارد بدون لحن متمرکز بودند و ادای کشش‌های آوایی یا ویبراتوهای سنتی را با پرش همراه می‌کردند.

لیریا ۳.۵ با یادگیری داده‌های صوتی بیش از ۳۸ گویش محلی و اقلیمی از سراسر جهان، ساختار دهان، تنفس و توقف‌های زبانی خواننده را بازسازی می‌کند. این یعنی چنانچه ترانه‌سرا متنی با گویش محلی برای سامانه بنویسد، تلفظ‌ها با همان غلظت و شیوه طبیعی ادا می‌شوند. دیگر خبری از تلفظ‌های خشک و مصنوعی نیست؛ کشش کلمات، فرودها در پایان بیت‌ها و تکیه‌های وزنی با شعر تطابق کامل پیدا می‌کنند.

تسلط بی‌سابقه روی چیدمان سازها و فرمان‌های اختصاصی

یکی از ویژگی‌های تحسین‌شده لیریا ۳.۵ در پلتفرم جدید، تبعیت فوق‌العاده از فرامین ساختاری است. کاربر می‌تواند در متن پرامپت خود تعیین کند که در ثانیه بیستم قطعه، تمام سازهای بادی قطع شوند و قطعه با تکنوازی گیتار کلاسیک در گام مینور ادامه یابد.

پیش از این، چنین فرامینی موجب گم شدن ریتم یا به هم ریختن هارمونی اثر می‌شد، اما مهندسان توانسته‌اند با جداسازی لایه‌های سازبندی کاری کنند که هوش مصنوعی رابطه میان نوازنده سولو و گروه نوازندگان را همانند یک رهبر ارکستر زنده مدیریت کند.

برای بررسی این توانمندی‌های تعاملی، توسعه‌دهندگان می‌توانند مستقیماً درپنل استودیو هوش مصنوعی گوگلدست به کار شوند و دستورات لایه‌ای پیچیده را برای خلق انواع ژانرها آزمایش نمایند. از طرفی دیگر، مستندات موجود دربخش تولید موسیقی جمینایگواهی بر این مدعاست که ابزار جدید برای نخستین بار توانسته میان داینامیک صدای کوبه‌ای و زیرایی وکال تعادلی طبیعی برقرار سازد.

جدول مقایسه فنی؛ ارزیابی لیریا ۳.۵ در برابر نسل‌های پیشین و رقبا

برای شناخت ابعاد دقیق‌تر این ارتقا، در ادامه عملکرد این نسخه با استانداردهای جاری سنجیده شده است

شاخص عملکردی و فنیمدل لیریا ۳مدل لیریا ۳.۵رقبای برتر بازار صوتی
میزان نسبت سیگنال به نویز۳۸ دسی‌بل با خش مشهود۶۵ دسی‌بل بسیار شفاف۴۵ دسی‌بل با اعوجاج
تسلط بر ادای لهجه‌های بومیمحدود به گویش‌های اصلی۳۸ گویش بومی مستقلمحدود به زبان انگلیسی
تبعیت از فرامین تفکیک سازضعیف و پراکندهبدون تداخل و میلی‌ثانیه‌ایمتوسط با تداخل فرکانسی
خروجی فرکانسی استاندارد۳۲ کیلوهرتز۴۸ کیلوهرتز استودیویی۴۴.۱ کیلوهرتز فشرده
فناوری ردگیری حق مولفتگ‌های متادیتاواترمارک غیرقابل‌شنود صوتیکدگذاری‌های سطحی
زمان میانگین پردازش قطعه۴.۲ ثانیه۱.۸ ثانیه۳.۵ تا ۶ ثانیه


امنیت داده‌ها، واترمارک و بازتعریف کپی‌رایت با سینت‌آی‌دی

مسئله کپی‌رایت و سوءاستفاده از صدای خوانندگان واقعی همواره کانون نگرانی اهالی موسیقی بوده است. گوگل در این نسخه تدبیری نوین اندیشیده است. کلیه قطعاتی که از درگاه‌های جمینای خروجی گرفته می‌شوند، حامل یک ردپای فرکانسی نامرئی به نام سینت‌آی‌دی هستند.

این شناسه صوتی در دامنه‌ای تزریق می‌شود که توسط گوش انسان یا میکروفون‌های ضبط معمولی قابل شنیدن نیست، اما نرم‌افزارهای پایشگر حق نشر می‌توانند با اسکن آن ظرف چند هزارم ثانیه اعلام کنند که قطعه مورد نظر حاصل خلاقیت هوش مصنوعی است. این راهکار به ناشران و پلتفرم‌های پخش آنلاین اجازه می‌دهد از جعل هویت هنرمندان جلوگیری کنند.


نقشه راه آینده؛ موسیقی در قلمرو مدل‌های زبانی بزرگ

همگرایی صوت، تصویر و متن به نقطه‌ای رسیده که ابزارهای هوش مصنوعی می‌توانند در لحظه برای یک صحنه ویدیویی غم‌انگیز، متناسب با حس بازیگر، تمپو و سازبندی متفاوتی تولید کنند. لیریا ۳.۵ در واقع یکی از چرخ‌دنده‌های حیاتی در راهبرد چندوجهی گوگل به شمار می‌رود.

برنامه‌نویسان با بهره‌گیری از کتابخانه‌های برنامه‌نویسی اختصاصی می‌توانند این موتور صوتی را در بازی‌های ویدیویی تعبیه کنند تا موسیقی پس‌زمینه با بالا رفتن هیجان نبرد به صورت خودکار ریتم‌های درامز تندتری به خود بگیرد. با این چشم‌انداز، ساخت موسیقی دیگر فعالیتی ایستا نیست، بلکه جریانی زنده و واکنشی در متن زیست دیجیتال کاربر خواهد بود.







سوالات متداول

۱. مدل صوتی لیریا ۳.۵ چه تغییر اساسی در آهنگسازی ایجاد کرده است؟

این مدل با حذف نویز زمینه و درک لهجه بومی، صدایی در سطح استودیوهای زنده می‌سازد و به فرمان تفکیک سازها پاسخ می‌دهد.

۲. بهبود شفافیت صدا در نسخه جدید چقدر اندازه‌گیری شده است؟

مطابق اعلام آزمایشگاه گوگل نسبت سیگنال به نویز در لیریا ۳.۵ حدود ۴۲ درصد نسبت به نسل قبل افزایش یافته است.

۳. لیریا ۳.۵ چگونه ترانه‌های دارای لهجه را مدیریت می‌کند؟

این مدل با آموزش روی ۳۸ گویش محلی، هماهنگی دقیقی میان تنفس خواننده و کشش حروف با شعر برقرار می‌سازد.

۴. چگونه می‌توان بدون افت ریتم دستور تک‌نوازی ساز صادر کرد؟

هوش مصنوعی ساختار گام را حفظ کرده و با تفکیک لایه‌های ارکستر، ساز انتخاب‌شده را در مرکز قطعه می‌نشاند.

۵. راهکار گوگل برای پیشگیری از نقض کپی‌رایت چیست؟

تزریق فناوری نامرئی سینت‌آی‌دی در فرکانس صوتی امکان شناسایی ماشینی اثر و حفظ هویت اثر را فراهم می‌کند.

برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.