آموزش‌های پایه‌ای هوش مصنوعی

متا با مدل Muse Image، تولد تصویر با هوش مصنوعی را به استوری اینستاگرام و چت واتس‌اپ می‌آورد

متا از مدل مولد تصویر اختصاصی خود به نام Muse Image رونمایی کرد؛ نخستین مدل مولد تصویر این شرکت که توسط آزمایشگاه‌های ابرهوش متا (Meta Superintelligence Labs) توسعه یافته و اکنون در Meta AI در دسترس قرار گرفته است. Muse Image در نقش یک دستیار خلاق ظاهر می‌شود…

7 دقیقه مطالعه
  • پشتیبانی شبکه
  • هوش مصنوعی
  • Muse
  • Image
  • تصویر
  • می‌کند
  • مدل
  • تولید
متا با مدل Muse Image، تولد تصویر با هوش مصنوعی را به استوری اینستاگرام و چت واتس‌اپ می‌آورد

خلاصه تحلیلی خبر

متا از مدل مولد تصویر اختصاصی خود به نام Muse Image رونمایی کرد؛ نخستین مدل مولد تصویر این شرکت که توسط آزمایشگاه‌های ابرهوش متا (Meta Superintelligence Labs) توسعه یافته و اکنون در Meta AI در دسترس قرار گرفته است. Muse Image در نقش یک دستیار خلاق ظاهر می‌شود…

موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، Muse، Image، تصویر، می‌کند

متا از مدل مولد تصویر اختصاصی خود به نام Muse Image رونمایی کرد؛ نخستین مدل مولد تصویر این شرکت که توسط آزمایشگاه‌های ابرهوش متا (Meta Superintelligence Labs) توسعه یافته و اکنون در Meta AI در دسترس قرار گرفته است. Muse Image در نقش یک دستیار خلاق ظاهر می‌شود که زمینه کاربر را می‌شناسد و تبدیل ایده‌ها به تصاویر باکیفیت را آسان می‌کند.

این مدل همچنین زیربنای مجموعه‌ای از ابزارهای خلاقانه جدید در اپلیکیشن‌های متا است. کاربران می‌توانند از بیش از ۳۰ افکت جدید مبتنی بر هوش مصنوعی برای استوری‌های اینستاگرام استفاده کنند و همچنین در چت ، با کمک Meta AI تصویر تولید کنند. این قابلیت در ابتدا در تعداد محدودی از کشورها عرضه می‌شود و به‌تدریج در کشورهای بیشتری در دسترس قرار خواهد گرفت.

واتس‌اپ و اینستاگرام

چه بخواهید از نقطه صفر شروع کنید و چه روی یک تصویر موجود کار کنید، کافی است خواسته خود را با زبانی ساده و محاوره‌ای توصیف کنید تا Meta AI به لطف Muse Image باقی مراحل را انجام دهد. این مدل همچنین متن را با کیفیت بالا و به‌صورت خوانا درون تصاویر رندر می‌کند. بنابراین می‌توانید از آن بخواهید یک راهنمای آموزشی یا یک اینفوگرافیک تخصصی درباره موضوعی مشخص تولید کند؛ در این صورت، متن نه‌تنها خوانا خواهد بود، بلکه از نظر سبک طراحی نیز با تصویر هماهنگ خواهد شد. همچنین Meta AI برای ساده‌سازی تجربه کاربری، پنلی از پیش‌تنظیم‌ها (Presets) شامل مجموعه‌ای از راهنماهای پیشنهادی را برای کمک به کاربران ارائه کرده است.

Muse Image صرفاً یک تصویر تولید نمی‌کند؛ بلکه ابتدا درباره درخواست فکر می‌کند. این مدل با کمک Muse Spark، در پشت‌صحنه چندین مرحله را طی می‌کند؛ از برنامه‌ریزی برای چیدمان تصویر گرفته تا جست‌وجوی اطلاعات به‌روز در وب و ترکیب هوشمندانه چندین مرجع تصویری به‌صورت هم‌زمان.

متا با مدل Muse Image، تولد تصویر با هوش مصنوعی را به استوری اینستاگرام و چت واتس‌اپ می‌آورد

کاربران همچنین می‌توانند در اپلیکیشن Meta AI حساب‌های اینستاگرام را با استفاده از @ منشن کنند تا آن پروفایل‌ها مستقیماً در فرایند تولید تصویر وارد شود؛ کافی است نام کاربری موردنظر را منشن کنید تا Meta AI از تصاویر عمومی آن حساب برای ساخت تصویری آماده انتشار استفاده کند. درعین‌حال، کاربران کنترل کاملی بر این قابلیت دارند و می‌توانند از طریق یک تنظیم ساده، امکان استفاده از محتوای خود برای تولید تصاویر مبتنی بر هوش مصنوعی را در هر زمان غیرفعال کنند.

متا با مدل Muse Image، تولد تصویر با هوش مصنوعی را به استوری اینستاگرام و چت واتس‌اپ می‌آورد

تولید عامل‌محور تصویر

برخلاف مدل‌هایی که مستقیماً پرامپت را به تصویر تبدیل می‌کنند، Muse Image به‌صورت یک عامل هوشمند عمل می‌کند. این مدل برای افزایش دقت، از ابزارهای جست‌وجو و کدنویسی استفاده می‌کند، خروجی‌های خود را به‌صورت خودکار بازبینی و اصلاح می‌کند و با افزایش توان محاسباتی در زمان استنتاج، عملکرد خود را بهبود می‌بخشد. همچنین، Muse Image با Muse Spark یکپارچه شده است؛ به‌گونه‌ای که این دو مدل می‌توانند ابزارهای مشترک را به کار بگیرند و به‌صورت هماهنگ برنامه‌ریزی کنند تا قابلیت‌های قدرتمندی در تولید عامل‌محور محتوای چندرسانه‌ای ارائه دهند.

استفاده از ابزارها

برای تقویت قابلیت‌های عامل‌محور Muse Image، دسترسی این مدل به مجموعه‌ای از ابزارها فراهم شده است.

متا با مدل Muse Image، تولد تصویر با هوش مصنوعی را به استوری اینستاگرام و چت واتس‌اپ می‌آورد

کدنویسیدر طول فرایند یادگیری تقویتی، Muse Image می‌آموزد کدی بنویسد و اجرا کند که نمودارها و کدهای QR دقیق تولید می‌کند و سپس با اتکا به این تصاویر رندرشده، دقت تصاویر نهایی خود را افزایش می‌دهد. افزون بر این، Muse Spark و Muse Image به‌گونه‌ای یکپارچه شده‌اند که با ترکیب قابلیت‌های کدنویسی و تولید مدیا، می‌توانند فایل‌های GIF متحرک، وب‌سایت‌های دارای تصاویر تعبیه‌شده و بازی‌های تعاملی بصری ایجاد کنند.

متا با مدل Muse Image، تولد تصویر با هوش مصنوعی را به استوری اینستاگرام و چت واتس‌اپ می‌آورد

جست‌وجوMuse Image می‌آموزد با جست‌وجو در وب، از اطلاعات واقعی، به‌روز و همچنین منابع تصویری برای تولید تصویر استفاده کند. فعال‌سازی قابلیت جست‌وجو، دقت واقعی مدل را در درخواست‌های دانش‌محور بهبود می‌بخشد.

خوداصلاحی (Self-Refinement)

Muse Image می‌تواند در زنجیره استدلال (Chain of Thought) خود، خروجی‌هایش را ارزیابی کرده و آن‌ها را بهبود دهد. این رفتار خوداصلاحی می‌تواند به شکل‌های مختلفی بروز کند؛ گاهی تنها یک ویرایش جزئی روی پیش‌نویس فعلی تصویر انجام می‌دهد، زمانی که فقط یک جزئیات کوچک نادرست باشد؛ در موارد دیگر، اگر بخش‌های بزرگ‌تری از تصویر اشتباه باشند، تصویر را از ابتدا دوباره تولید می‌کند یا حتی راهبرد متفاوتی مانند استفاده از ابزارها را برای دستیابی به تصویری با دقت واقعی بیشتر در پیش می‌گیرد. این رفتار به‌صورت مستقیم طراحی نشده است؛ بلکه در جریان آموزش مبتنی بر یادگیری تقویتی، به طور طبیعی پدیدار شد، زیرا خوداصلاحی تصاویر باکیفیت‌تری تولید می‌کرد و در نتیجه پاداش بیشتری دریافت می‌کرد.

متا با مدل Muse Image، تولد تصویر با هوش مصنوعی را به استوری اینستاگرام و چت واتس‌اپ می‌آورد

مقیاس‌پذیری توان محاسباتی در زمان استنتاج (Test-Time Compute Scaling)

همانند مدل‌های زبانی، عملکرد Muse Image نیز هرچه در زمان استنتاج فرصت بیشتری برای «فکرکردن» داشته باشد، بهتر می‌شود. با افزایش توان محاسباتی در زمان استنتاج، مدل استدلال بیشتری انجام می‌دهد، دفعات بیشتری از ابزارها استفاده می‌کند و مراحل خوداصلاحی بیشتری را برای ارتقای کیفیت خروجی طی می‌کند.

افزایش قدرت استدلال و در نتیجه افزایش توان محاسباتی در زمان استنتاج، Elo score مبتنی بر ترجیح کاربران را بهبود می‌بخشد و تقریباً از یک رابطه لگاریتمی-خطی (Log-Linear) پیروی می‌کند. نکته قابل‌توجه این است که این توان محاسباتی، دو نوع کاملاً متفاوت از پردازش را در بر می‌گیرد، توکن‌های متنی برای استدلال و توکن‌های بصری برای تولید تصویر. بااین‌حال، کیفیت نهایی تابعی از مجموع توان محاسباتی صرف‌شده در هر دو بخش است.

نتایج متا نشان می‌دهد که نحوه تخصیص هوشمندانه بودجه توکن‌ها، به همان اندازه افزایش توان محاسباتی در مقیاس‌پذیری مؤثر زمان استنتاج اهمیت دارد. روش Best-of-N (BoN) که در آن مدل چندین تصویر تولید می‌کند و بهترین آن‌ها را نگه می‌دارد، در مراحل اولیه کیفیت را افزایش می‌دهد؛ اما این بهبود به‌سرعت به نقطه اشباع می‌رسد. در مقابل، صرف همین میزان توان محاسباتی برای استدلال هدفمند، مقیاس‌پذیری بسیار بهتری دارد. همچنین، زمانی که استدلال و استفاده از ابزارها با یکدیگر ترکیب شوند، اثر آن‌ها تقویت می‌شود. ابزارها به مدل اجازه می‌دهند فراتر از دانسته‌های پیشین خود عمل کند؛ چه با جست‌وجوی منابعی که در اختیار ندارد و چه با نوشتن کد برای ثبت دقیق جزئیات، شکاف‌هایی را پر می‌کنند که صرفاً از طریق استدلال قابل‌جبران نیستند.

متا با مدل Muse Image، تولد تصویر با هوش مصنوعی را به استوری اینستاگرام و چت واتس‌اپ می‌آورد

ویرایش تصویر

Muse Image تصاویر را با دقت بسیار بالا ویرایش می‌کند و دقیقاً همان تغییراتی را اعمال می‌کند که کاربر درخواست کرده است. همچنین، Muse Image انسجام تصویر را در چندین مرحله ویرایش حفظ می‌کند و از اصلاح تدریجی و ایده‌پردازی باز برای رسیدن به نتیجه مطلوب پشتیبانی می‌کند.

ترکیب چندین تصویر مرجع (Multi-Reference Image Composition)

Muse Image می‌تواند عناصر موجود در تعداد زیادی از تصاویر مرجع ورودی را در قالب یک درخواست با یکدیگر ترکیب کند؛ از جمله افراد، اشیا، پوشاک، سبک‌های هنری و محیط‌ها. همچنین، این مدل از ترکیب هم‌زمان متن و تصویر درون یک درخواست (Inline) برای ایجاد ترکیب‌های تصویری پیچیده پشتیبانی می‌کند.

متا با مدل Muse Image، تولد تصویر با هوش مصنوعی را به استوری اینستاگرام و چت واتس‌اپ می‌آورد

بنچمارک‌ها

طبق رده‌بندی بنچمارک Arena Elo، مدل Muse Image در هر سه شاخص متن به تصور، ادیت تک تصویر و چندتصویره، پس از GPT Image 2 در رتبه دوم قرار دارد.

متا با مدل Muse Image، تولد تصویر با هوش مصنوعی را به استوری اینستاگرام و چت واتس‌اپ می‌آورد
متا با مدل Muse Image، تولد تصویر با هوش مصنوعی را به استوری اینستاگرام و چت واتس‌اپ می‌آورد
متا با مدل Muse Image، تولد تصویر با هوش مصنوعی را به استوری اینستاگرام و چت واتس‌اپ می‌آورد

پیش‌نمایش Muse Video

هم‌زمان با معرفی Muse Image، نسخه اولیه‌ای از Muse Video نیز معرفی شده است. این مدل از نظر پایبندی به درخواست کاربر (Prompt Adherence)، کیفیت بصری و انسجام زمانی (Temporal Consistency) عملکردی رقابتی ارائه می‌دهد. درعین‌حال، تمرکز توسعه‌دهندگان بر بهبود حوزه‌هایی است که هنوز با محدودیت عملکرد مواجه هستند؛ از جمله همگام‌سازی صدا و تصویر و شبیه‌سازی دقیق حرکات سریع بر اساس قوانین فیزیکی. Muse Video به‌زودی در اختیار تولیدکنندگان محتوا و همچنین کاربران Meta AI قرار گیرد.

متا با مدل Muse Image، تولد تصویر با هوش مصنوعی را به استوری اینستاگرام و چت واتس‌اپ می‌آورد
در رتبه‌بندی Arena نیز، Muse Video در حوزه تبدیل متن به ویدئو (Text-to-Video)، رتبه سوم را در اختیار دارد.

دسترسی

متا به‌زودی Muse Image را در کشورهای بیشتری و همچنین در سایر محیط‌هایی که کاربران از Meta AI استفاده می‌کنند، از جمله فیس‌بوک، مسنجر و بخش‌های بیشتری از اینستاگرام و واتس‌اپ عرضه خواهد کرد. همچنین طی هفته‌های آینده، تبلیغ‌دهندگان و آژانس‌های تبلیغاتی خواهند توانست از طریق Advantage+ Creative به قابلیت‌های Muse Image دسترسی پیدا کنند.

برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.