گوگل از مدل هوش مصنوعی Lyria ۳.۵ رونمایی کرد؛ تحول بزرگ استودیویی در تولید موسیقی جمینای
مدل هوش مصنوعی لیریا ۳.۵ با حذف کامل نویزهای مزاحم صوتی، ادای بینقص گویشهای محلی و قابلیت اجرای تکنوازی زنده سازها در پلتفرم جمینای رسماً رونمایی شد. صنعت پردازش صوت و مهندسی صدا در نخستین ماههای سال ۲۰۲۶ با تحولی شگرف روبهرو شده است. آزمایشگاههای تخصصی ش…
خلاصه تحلیلی خبر
مدل هوش مصنوعی لیریا ۳.۵ با حذف کامل نویزهای مزاحم صوتی، ادای بینقص گویشهای محلی و قابلیت اجرای تکنوازی زنده سازها در پلتفرم جمینای رسماً رونمایی شد. صنعت پردازش صوت و مهندسی صدا در نخستین ماههای سال ۲۰۲۶ با تحولی شگرف روبهرو شده است. آزمایشگاههای تخصصی ش…
موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، لیریا، مصنوعی، هوش، صوتی
مدل هوش مصنوعی لیریا ۳.۵ با حذف کامل نویزهای مزاحم صوتی، ادای بینقص گویشهای محلی و قابلیت اجرای تکنوازی زنده سازها در پلتفرم جمینای رسماً رونمایی شد.
صنعت پردازش صوت و مهندسی صدا در نخستین ماههای سال ۲۰۲۶ با تحولی شگرف روبهرو شده است. آزمایشگاههای تخصصی شرکت گوگل پس از مدتها آزمایش و توسعه پشت درهای بسته، جدیدترین پرچمدار خود را در دسته موتورهای تولید صوت با عنوان تجاری Lyria 3.5 به صحنه آوردند. این رویداد تنها یک بهبود دورهای ساده نیست؛ بلکه طبق ارزیابی کارشناسان رسانه ، لیریا ۳.۵ راهحلی نهایی برای یکی از دیرینهترین چالشهای تاریخ آهنگسازی با ماشین، یعنی پاکسازی فرکانسها از خشهای مصنوعی و تداخلهای پنهان دیجیتالی است.
با در دسترس قرار گرفتن این مدل در ابزارهای ابری برنامهنویسان، آهنگسازان، تولیدکنندگان پادکست و فعالان حوزه رسانه اکنون این امکان را دارند که ساختارهای ارکسترال و الگوهای آوازی را با دقتی مشابه استودیوهای فیزیکی بسازند. این پرچمدار با هماهنگی کامل درون رابط کاربری جدید عرضه شده و راه را برای تولیدهای بلادرنگ باز کرده است.
کالبدشکافی تحول فنی؛ پایان دوران نویز و درک عمق فرکانس
اصلیترین دردسر هنرمندان هنگام کار با نسلهای پیشین سامانههای هوش مصنوعی، افت کیفیت خروجی در فرکانسهای بالا و ایجاد خشهای آزاردهنده در لایههای پسزمینه بود. مدل جدید با بازطراحی پایهای روش پردازش تبدیل موج صوتی به عدد، خطاهای رزولوشن را به پایینترین سطح ممکن رسانده است.
طبق مستندات منتشر شده از سویآزمایشگاه هوش مصنوعی دیپمایند گوگلشاخص نسبت سیگنال به نویز در لیریا ۳.۵ با بهبودی خیرهکننده معادل ۴۲ درصد نسبت به نسخه پیشین روبهرو شده است. این دستاورد فنی سبب میشود فرکانسهای زیر مانند صدای برخورد مضراب به سیمهای سازهای زهی یا ارتعاش سنجها بدون هرگونه تاری فرکانسی ضبط شوند.
علاوه بر کیفیت فرکانس، زمان تاخیر در تولید فایل نیز ۵۰ درصد کاهش یافته و به طور میانگین یک قطعه کامل با کیفیت استودیویی ظرف کمتر از ۱.۸ ثانیه توسط سرورهای گرافیکی پردازش میشود. تحلیلهای تکمیلی نشان میدهد که فیلترهای ضد دیستورشن جدید اجازه نمیدهند بخشهای پرتراکم ارکستر باعث خفگی سایر سازها شوند، پدیدهای که پیش از این در پروژههای موسیقی هوش مصنوعی به وفور دیده میشد.
انعطافپذیری شگفتانگیز در لهجههای محلی و اشعار بومی
بخش دیگری از درخشش فنی این مدل که دروبلاگ رسمی آزمایشگاه نوآوری گوگلبه آن پرداخته شده، درک ظریف لهجهها و سبکهای خوانش سنتی است. پیش از این، اکثر پلتفرمهای موجود تنها بر زبانهای استاندارد بدون لحن متمرکز بودند و ادای کششهای آوایی یا ویبراتوهای سنتی را با پرش همراه میکردند.
لیریا ۳.۵ با یادگیری دادههای صوتی بیش از ۳۸ گویش محلی و اقلیمی از سراسر جهان، ساختار دهان، تنفس و توقفهای زبانی خواننده را بازسازی میکند. این یعنی چنانچه ترانهسرا متنی با گویش محلی برای سامانه بنویسد، تلفظها با همان غلظت و شیوه طبیعی ادا میشوند. دیگر خبری از تلفظهای خشک و مصنوعی نیست؛ کشش کلمات، فرودها در پایان بیتها و تکیههای وزنی با شعر تطابق کامل پیدا میکنند.
تسلط بیسابقه روی چیدمان سازها و فرمانهای اختصاصی
یکی از ویژگیهای تحسینشده لیریا ۳.۵ در پلتفرم جدید، تبعیت فوقالعاده از فرامین ساختاری است. کاربر میتواند در متن پرامپت خود تعیین کند که در ثانیه بیستم قطعه، تمام سازهای بادی قطع شوند و قطعه با تکنوازی گیتار کلاسیک در گام مینور ادامه یابد.
پیش از این، چنین فرامینی موجب گم شدن ریتم یا به هم ریختن هارمونی اثر میشد، اما مهندسان توانستهاند با جداسازی لایههای سازبندی کاری کنند که هوش مصنوعی رابطه میان نوازنده سولو و گروه نوازندگان را همانند یک رهبر ارکستر زنده مدیریت کند.
برای بررسی این توانمندیهای تعاملی، توسعهدهندگان میتوانند مستقیماً درپنل استودیو هوش مصنوعی گوگلدست به کار شوند و دستورات لایهای پیچیده را برای خلق انواع ژانرها آزمایش نمایند. از طرفی دیگر، مستندات موجود دربخش تولید موسیقی جمینایگواهی بر این مدعاست که ابزار جدید برای نخستین بار توانسته میان داینامیک صدای کوبهای و زیرایی وکال تعادلی طبیعی برقرار سازد.
جدول مقایسه فنی؛ ارزیابی لیریا ۳.۵ در برابر نسلهای پیشین و رقبا
برای شناخت ابعاد دقیقتر این ارتقا، در ادامه عملکرد این نسخه با استانداردهای جاری سنجیده شده است
| شاخص عملکردی و فنی | مدل لیریا ۳ | مدل لیریا ۳.۵ | رقبای برتر بازار صوتی |
| میزان نسبت سیگنال به نویز | ۳۸ دسیبل با خش مشهود | ۶۵ دسیبل بسیار شفاف | ۴۵ دسیبل با اعوجاج |
| تسلط بر ادای لهجههای بومی | محدود به گویشهای اصلی | ۳۸ گویش بومی مستقل | محدود به زبان انگلیسی |
| تبعیت از فرامین تفکیک ساز | ضعیف و پراکنده | بدون تداخل و میلیثانیهای | متوسط با تداخل فرکانسی |
| خروجی فرکانسی استاندارد | ۳۲ کیلوهرتز | ۴۸ کیلوهرتز استودیویی | ۴۴.۱ کیلوهرتز فشرده |
| فناوری ردگیری حق مولف | تگهای متادیتا | واترمارک غیرقابلشنود صوتی | کدگذاریهای سطحی |
| زمان میانگین پردازش قطعه | ۴.۲ ثانیه | ۱.۸ ثانیه | ۳.۵ تا ۶ ثانیه |
امنیت دادهها، واترمارک و بازتعریف کپیرایت با سینتآیدی
مسئله کپیرایت و سوءاستفاده از صدای خوانندگان واقعی همواره کانون نگرانی اهالی موسیقی بوده است. گوگل در این نسخه تدبیری نوین اندیشیده است. کلیه قطعاتی که از درگاههای جمینای خروجی گرفته میشوند، حامل یک ردپای فرکانسی نامرئی به نام سینتآیدی هستند.
این شناسه صوتی در دامنهای تزریق میشود که توسط گوش انسان یا میکروفونهای ضبط معمولی قابل شنیدن نیست، اما نرمافزارهای پایشگر حق نشر میتوانند با اسکن آن ظرف چند هزارم ثانیه اعلام کنند که قطعه مورد نظر حاصل خلاقیت هوش مصنوعی است. این راهکار به ناشران و پلتفرمهای پخش آنلاین اجازه میدهد از جعل هویت هنرمندان جلوگیری کنند.
نقشه راه آینده؛ موسیقی در قلمرو مدلهای زبانی بزرگ
همگرایی صوت، تصویر و متن به نقطهای رسیده که ابزارهای هوش مصنوعی میتوانند در لحظه برای یک صحنه ویدیویی غمانگیز، متناسب با حس بازیگر، تمپو و سازبندی متفاوتی تولید کنند. لیریا ۳.۵ در واقع یکی از چرخدندههای حیاتی در راهبرد چندوجهی گوگل به شمار میرود.
برنامهنویسان با بهرهگیری از کتابخانههای برنامهنویسی اختصاصی میتوانند این موتور صوتی را در بازیهای ویدیویی تعبیه کنند تا موسیقی پسزمینه با بالا رفتن هیجان نبرد به صورت خودکار ریتمهای درامز تندتری به خود بگیرد. با این چشمانداز، ساخت موسیقی دیگر فعالیتی ایستا نیست، بلکه جریانی زنده و واکنشی در متن زیست دیجیتال کاربر خواهد بود.
سوالات متداول
این مدل با حذف نویز زمینه و درک لهجه بومی، صدایی در سطح استودیوهای زنده میسازد و به فرمان تفکیک سازها پاسخ میدهد.
مطابق اعلام آزمایشگاه گوگل نسبت سیگنال به نویز در لیریا ۳.۵ حدود ۴۲ درصد نسبت به نسل قبل افزایش یافته است.
این مدل با آموزش روی ۳۸ گویش محلی، هماهنگی دقیقی میان تنفس خواننده و کشش حروف با شعر برقرار میسازد.
هوش مصنوعی ساختار گام را حفظ کرده و با تفکیک لایههای ارکستر، ساز انتخابشده را در مرکز قطعه مینشاند.
تزریق فناوری نامرئی سینتآیدی در فرکانس صوتی امکان شناسایی ماشینی اثر و حفظ هویت اثر را فراهم میکند.
برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.