ابزارهای هوش مصنوعی

رونمایی گوگل از خانواده مدل‌های Gemini Omni

Gemini Omni Flash، مدلی که می‌تواند هر چیزی را از هر نوع ورودی تولید کند و این کار را با ویدئو آغاز می‌کند. سال گذشته، نانو بنانا (Nano Banana) هوش Gemini را به حوزه تولید و ویرایش تصویر آورد. از آن زمان، این ابزار به میلیون‌ها نفر کمک کرده است تا عکس‌های قدیم…

5 دقیقه مطالعه
  • پشتیبانی شبکه
  • هوش مصنوعی
  • Gemini
  • Omni
  • کنید
  • ویدئو
  • شما
  • می‌کند
رونمایی گوگل از خانواده مدل‌های Gemini Omni

خلاصه تحلیلی خبر

Gemini Omni Flash، مدلی که می‌تواند هر چیزی را از هر نوع ورودی تولید کند و این کار را با ویدئو آغاز می‌کند. سال گذشته، نانو بنانا (Nano Banana) هوش Gemini را به حوزه تولید و ویرایش تصویر آورد. از آن زمان، این ابزار به میلیون‌ها نفر کمک کرده است تا عکس‌های قدیم…

موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، Gemini، Omni، کنید، ویدئو

Gemini Omni Flash، مدلی که می‌تواند هر چیزی را از هر نوع ورودی تولید کند و این کار را با ویدئو آغاز می‌کند.

سال گذشته، نانو بنانا (Nano Banana) هوش Gemini را به حوزه تولید و ویرایش تصویر آورد. از آن زمان، این ابزار به میلیون‌ها نفر کمک کرده است تا عکس‌های قدیمی را بازیابی کنند، از روی طرح‌های اولیه طراحی کنند و ایده‌ها را به روش‌هایی که پیش‌تر ممکن نبود، مصورسازی نمایند. گوگل از همان ابتدا Gemini را به‌گونه‌ای ساخته که از پایه به‌صورت بومی چندوجهی (Natively Multimodal) باشد و اکنون در حال برداشتن گام بعدی است.

در همین راستان گوگل، سریGemini Omniرا توسعه داد و منتشر کرد؛ جایی که توانایی استدلال Gemini با توانمندی در خلق‌کردن تلاقی پیدا می‌کند. Omni مدل جدید گوگل است که می‌تواند از هر نوع ورودی، هر چیزی را خلق کند و این کار با ویدئو شروع می‌کند. با Omni، می‌توانید تصاویر، صدا، ویدئو و متن را به‌عنوان ورودی ترکیب کرده و ویدئوهایی با کیفیت بالا و مبتنی بر دانشِ Gemini از دنیای واقعی تولید کنید. همچنین می‌توانید ویدئوهای خود را به‌سادگی از طریق مکالمه به زبان طبیعی ویرایش نمایید.

گوگل اولین مدل از خانواده Omni به نام Gemini Omni Flash برای اپلیکیشن Gemini، Google Flow و YouTube Shorts عرضه کرده است. به‌مرورزمان، از مدالیته‌های خروجی مانند تصویر و صدا نیز پشتیبانی خواهد کرد.

در ادامه به برخی از ویژگی‌هایی که Omni را متمایز می‌کند، اشاره شده است

ویرایش ویدئوها از طریق مکالمه

Gemini Omni روشی آسان‌تر برای ویرایش ویدئو با استفاده از زبان طبیعی در اختیار شما قرار می‌دهد. هر دستور بر پایه دستور قبلی بنا می‌شود. شخصیت‌های شما ثابت می‌مانند، قوانین فیزیک پابرجا می‌مانند و صحنه آنچه را که پیش‌تر اتفاق افتاده است، به‌خاطر می‌سپارد.

  • تبدیل دنیای پیرامون خود.چیزهای خاصی را تغییر دهید، یا همه چیز را دگرگون کنید. ویدئوی شما به نقطه شروعی برای چیزی تبدیل می‌شود که هرگز خودتان قادر به فیلم‌برداری از آن نبودید.
  • بازآفرینی کنش (Action).ویدئویی که گرفته‌اید را در نظر بگیرید و فقط از Omni بخواهید اتفاقاتی که در حال رخ‌دادن است را تغییر دهد. کنش را ویرایش کنید، شخصیت‌ها یا اشیا جدیدی اضافه کنید، یا یک لحظه را به چیزی غیرمنتظره تبدیل نمایید.
  • بهبود ویدئوها در طی چند نوبت (Multiple turns).محیط، زاویه، سبک یا حتی جزئیات خاص را بدون ازدست‌دادن رشته صحنه اصلی خود تغییر دهید.

جان‌بخشی به ایده‌ها، مبتنی بر دانش Gemini از جهان

Gemini Omni فقط صحنه‌هایی را که واقعی به نظر می‌رسند تولید نمی‌کند، بلکه در مورد آنچه باید در ادامه اتفاق بیفتد استدلال می‌کند. این مدل یک درک شهودی از فیزیک را با دانش Gemini از تاریخ، علم و زمینه ترکیب کرده و فاصله میان واقع‌گرایی عکس‌گونه (Photorealism) و داستان‌سرایی معنادار را پر می‌کند.

  • خلق جلوه‌های بصری با فیزیک دقیق‌ترOmni دارای درک شهودیِ بهبودیافته‌ای از نیروهایی مانند گرانش، انرژی جنبشی و دینامیک سیالات است که به شما اجازه می‌دهد صحنه‌های واقع‌گرایانه‌تری خلق کنید.
  • ترکیب دانش و خلاقیتOmni از دانش Gemini بهره می‌برد تا زبان، تصاویر و معنا را به روش‌هایی که بسیار فراتر از تطبیق الگو است، به یکدیگر متصل کند.
  • بصری‌سازی ایده‌های پیچیدهOmni می‌تواند از طریق پرامپت‌های کوتاه، ویدئوهای توضیحی جذابی خلق کند و جلوه‌های بصری‌ای تولید کند که ایده‌های پیچیده‌تر را تجزیه‌وتحلیل می‌کنند.

خلق ویدئو از هر ترکیب ورودی

  • ارجاع به هر چیزیOmni هر مرجعی از تصویر، متن، ویدئو یا صدا را به یک خروجی یکپارچه و منسجم تبدیل می‌کند. اگرچه در ابتدا برای بخش صدا فقط ارجاع‌های گفتاری (Voice references) پشتیبانی می‌شوند، به‌زودی سایر انواع ورودی‌های صوتی نیز عرضه خواهد کرد.
  • شروع از آنچه در اختیار داریدبا منابع ورودی، می‌توانید از تصاویر شخصیت‌ها، صحنه‌ها یا نقاشی‌ها استفاده کنید تا به روشی که دقیقاً با چشم‌انداز شما مطابقت دارد، به خلق محتوا بپردازید.
  • اعمال سبک‌ها، حرکت یا افکت‌هازبان بصری را با استفاده از ارجاع‌های ورودی تعریف کنید یا فقط آن را با زبان طبیعی توصیف نمایید. Omni ارجاع‌های ورودی را با هم ترکیب می‌کند تا یک کلیپ منسجم بسازد.

خلق ویدئو با آواتار دیجیتال شخصی شما

گوگل به توسعه مسئولانه هوش مصنوعی متعهد است و سیاست‌های روشنی برای محافظت از کاربران در برابر آسیب‌ها و حاکمیت بر استفاده از ابزارهای هوش مصنوعی خود دارد. برای شروع، شما می‌توانید با استفاده ازآواتارهاویدئوهایی با صدای خود ایجاد کنید؛ این قابلیت یک نسخه دیجیتال از شما می‌سازد تا بتوانید ویدئوهایی تولید کنید که ظاهر و صدای شما را داشته باشند. فراتر از ویژگی آواتار، در خصوص ویرایش ویدئوها برای تغییر صدا و گفتار، همچنان در حال کار برای آزمایش این موضوع و درک بهتر نحوه ارائه مسئولانه این قابلیت به کاربران است.

تمامی ویدئوهای تولید شده با Omni شامل واترمارک دیجیتال و نامحسوس گوگل به نامSynthIDهستند. شما می‌توانید به‌سادگی از طریق اپلیکیشن Gemini، Gemini در مرورگر کروم و جست‌وجوی گوگل، تأیید کنید که ویدئوها با Gemini Omni تولید شده‌اند.

دسترسی

Gemini Omni Flash از امروز برای تمامی مشترکین Google AI Plus، Pro و Ultra به‌صورت جهانی از طریق اپلیکیشن Gemini و Google Flow در حال عرضه است. همچنین این مدل از همین هفته بدون هیچ هزینه‌ای برای کاربران در YouTube Shorts و اپلیکیشن YouTube Create در دسترس قرار می‌گیرد. در هفته‌های آینده، این مدل از طریق APIها برای توسعه‌دهندگان و مشتریان سازمانی نیز عرضه خواهد شد.

برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.