Nano Banana 2.1؛ بهینهسازیشده برای تولید اینفوگرافیک با هزینه نصف و کیفیت بالاتر
مدل هوش مصنوعی مولد تصویر Nano Banana 2.1 جدیدترین عضو خانواده مدلهای سری Gemini 3 است که با تمرکز بر روی تولید تصویر و ویرایش تعاملی با بهرهوری بالا از سوی گوگل دیپمایند (Google DeepMind) روانه بازار شده است. مدل مولد تصویر Nano Banana 2.1 که بر پایه معمار…
خلاصه تحلیلی خبر
مدل هوش مصنوعی مولد تصویر Nano Banana 2.1 جدیدترین عضو خانواده مدلهای سری Gemini 3 است که با تمرکز بر روی تولید تصویر و ویرایش تعاملی با بهرهوری بالا از سوی گوگل دیپمایند (Google DeepMind) روانه بازار شده است. مدل مولد تصویر Nano Banana 2.1 که بر پایه معمار…
موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، مدل، تصویر، Banana، Nano
مدل هوش مصنوعی مولد تصویر Nano Banana 2.1 جدیدترین عضو خانواده مدلهای سری Gemini 3 است که با تمرکز بر روی تولید تصویر و ویرایش تعاملی با بهرهوری بالا از سوی گوگل دیپمایند (Google DeepMind) روانه بازار شده است.
مدل مولد تصویر Nano Banana 2.1 که بر پایه معماری قدرتمند Gemini 3.6 Flash توسعه یافته، آمده است تا سرعت و مقرونبهصرفه بودن مدلهای Flash را با کیفیت بصری خیرهکنندهای ترکیب کند. در ادامه، بررسی کاملی بر ویژگیها و قابلیتهای این مدل خواهیم داشت.
معماری پایه و جایگاه مدل Nano Banana 2.1
مدل Nano Banana 2.1 یک مدل چندوجهی (Multimodal) با قابلیت استدلال بالا است که بهعنوان نسخه جایگزین و ارتقایافتهی مدل Gemini 3.1 Flash Image (که پیشتر با نام Nano Banana 2 شناخته میشد) در دسترس قرار گرفته است. رسالت اصلی این مدل، حفظ سرعت فوقالعاده و کارایی اقتصادی معماری Flash است، درحالیکه در زمینه کیفیت بصری، وفاداری به پرامپت ثبات کاراکتر و رندر متون، عملکردی همتراز یا حتی بهتر از مدلهای سنگینتری مانند Gemini 3 Pro Image یا همان Nano Banana Pro ارائه میدهد.
- ورودیها و خروجیهااین مدل انعطافپذیری بالایی دارد و میتواند دادههای متنی، تصویری، ویدئویی و فایلهای PDF را بهعنوان ورودی دریافت کند. در بخش خروجی، توانایی تولید تصویر (با خروجی تا ۴ هزار توکن) و متن (تا ۶۴ هزار توکن) را داراست.
- پنجره زمینه (Context Window)معماری پایه این مدل از یک پنجره زمینه متنی و تصویری با ظرفیت پردازش چشمگیر تا ۱ میلیون توکن پشتیبانی میکند. بااینحال، در مستندات توسعهدهندگان (API)، محدودیت پردازش برای توکنهای ورودی ۱۳۱,۰۷۲ توکن و برای توکنهای خروجی ۳۲,۷۶۸ توکن قید شده است.
مهمترین ویژگیها و قابلیتهای فنی
گوگل در این نسخه تمرکز خود را بر روی چالشهای بنیادین تولید تصویر و ادغام ابزارهای هوش مصنوعی سازمانی گذاشتهاند
- سطوح تفکر قابلتنظیمیکی از برجستهترین نوآوریهای این نسخه، امکان کنترل میزان پردازش یا «تفکر» مدل پیش از تولید خروجی است. کاربران و مهندسان پرامپت میتوانند این پارامتر را در سه سطح حداقل (Minimal)، متوسط (Medium که حالت پیشفرض است) و بالا (High) تنظیم کنند. این ویژگی اجازه میدهد تا بین سرعت پاسخگویی و پیچیدگی استدلال تعادل ایجاد شود.
- ترکیب پیشرفته چندین تصویر (Multi-image Fusion)حفظ ثبات بصری همیشه یکی از بزرگترین چالشها در طراحیهای گرافیکی و روایتهای تصویری بوده است. Nano Banana 2.1 اکنون از ترکیب حداکثر ۱۴ تصویر مرجع پشتیبانی میکند. این سیستم خارقالعاده میتواند ثبات چهره و ویژگیهای ظاهری را برای حداکثر ۴ کاراکتر مختلف و وفاداری به جزئیات را برای حداکثر ۱۰ شیء در یک صحنه به طور همزمان تضمین کند.
- اتصال به اطلاعات واقعی (Grounding)مدل از طریق جستجوی وب گوگل و جستجوی تصاویر گوگل (Google Image Search) قادر به پردازش مبتنی بر Grounding است. این یعنی خروجیها میتوانند مستقیماً به اطلاعات لحظهای متصل شوند و تصاویری از صحنههای دقیق و دادههای روزمره دنیای واقعی تولید کنند.
رندر پیشرفته متن و اینفوگرافیک
یکی از نقاط قوت Nano Banana 2.1، توانایی آن در تولید متنهای خوانا برای پوسترها و دیاگرامهای پیچیده و چیدمان دقیق اینفوگرافیکها است.
- این مدل به طور ویژه برای تولید پوسترهای حاوی متن خوانا و دیاگرامهای پیچیده و پرجزئیات بهینهسازی شده است.
- رندر متون بومیسازیشده (Localized) در زبانهای مختلف، از دیگر تواناییهای کلیدی آن محسوب میشود.
- کیفیت بصری و واقعگرایی تصاویر در رزولوشنهای 1K (رزولوشن پیشفرض مدل)، 2K و 4K بهبود یافته است.
- مشکلات آزاردهندهی تکرار الگو و بافت (Tiling artifacts) در تولید تصاویر با نسبتهای عریض و پانوراما (مانند ۱:۴، ۴:۱، ۱:۸ و ۸:۱) در رزولوشنهای 2K و 4K برطرف شده است.
بنچمارکها
بر اساس ارزیابیهای انجامشده در اکتبر ۲۰۲۶، مدل Nano Banana 2.1 (در حالت روشن بودن ابزار Thinking) رکوردهای جدیدی را در بنچمارکهای تبدیل متن به تصویر (T2I) و ویرایش به ثبت رسانده است
- ترجیح کلی (Overall Preference)این مدل توانست امتیاز Elo معادل ۱۰۵۰ را کسب کند، درحالیکه مدل پیشین (Nano Banana 2) امتیاز ۹۹۰ و حتی نسخه بسیار پیشرفته پرو (Gemini 3 Pro Image) امتیاز ۹۳۵ را ثبت کرده بودند.
- طراحی اینفوگرافیککسب امتیاز ۱۰۴۸ (در برابر امتیاز ۹۱۲ مدل پرو) که نشانگر قدرت آن در درک دادهها و تصویرسازی گرافیکی است.
- ثبات چند-کاراکتری (Multi-Character Consistency)با ثبت امتیاز ۱۱۰۶ (در مقایسه با امتیاز ۱۰۱۱ در نسخه پرو)، این مدل جهشی بزرگ در حفظ انسجام صحنههای شلوغ با حضور چند انسان داشته است.
- ویرایش پیشرفتهدر زمینههایی مانند تغییر استایل (Stylization) مدل توانست امتیاز ۱۰۶۲ و در ویرایشهای مبتنی بر ماسک و خطخطی (Ink/Mask-based Editing) امتیاز ۱۰۴۹ را به دست آورد.
محدودیتها و چالشهای فعلی
با وجود تمامی این پیشرفتها، مدل Nano Banana 2.1 بهعنوان یک مدل پایهای همچنان دارای محدودیتهایی است که طراحان باید آنها را در نظر داشته باشند
- احتمال بروز پدیده توهم همچنان وجود دارد و گاهی ممکن است درخواستها با کندی مقطعی یا توقف (Timeout) مواجه شوند.
- در زمینه رندر متن، متون بسیار ریز (که در خروجی 1K معمولاً تار میشوند) و پردازش پاراگرافهای متنی طولانی (در حد یک صفحه)، هنوز به کیفیت مطلوب و ایدهآل نرسیدهاند.
- با وجود بهبودهای فراوان، ثبات کاراکتر بین تصویر اصلی ورودی و تصویر تولیدشده در خروجی همیشه ۱۰۰ درصد بینقص نیست.
- در ویرایشهای بر پایه ماسک (Doodle-based editing)، گاهی مدل دستورالعملها را بهصورت ناقص اجرا میکند و اثر خطخطی اولیه کاربر روی خروجی نهایی باقی میماند.
- در موارد نادری مشاهده شده که هنگام ویرایش تصویر، حالت و پوزیشن فیزیکی سوژه (Pose) از تصویر مرجع به طور ناخواسته به تصویر جدید منتقل و در آنجا قفل میشود.
- گاهی مدل در درک موقعیتهای فضایی هندسی و جهتها (مانند تفاوت چپ و راست در تصویر) دچار سردرگمی میشود.
- تاریخ پایه دانش (Knowledge Cutoff) این مدل در بسیاری از حوزهها روی مارس ۲۰۲۶ تنظیم شده است، هرچند در برخی دامنههای علمی اطلاعات آن محدود به ژانویه ۲۰۲۵ است.
دسترسی، امنیت و چشمانداز آینده
از منظر ایمنی، Nano Banana 2.1 ارزیابیهای مربوط به سیاستهای ایمنی کودکان را با موفقیت گذرانده و آستانههای سختگیرانه تعیینشده توسط گوگل را برآورده کرده است. در حوزه ارزیابی ایمنی مرزی، بررسیها نشان داد که این مدل به هیچیک از سطوح قابلیتهای بحرانی (T/CCLs) دست نیافته است که این امر حکایت از امنیت بالای آن برای استقرار در سیستمهای عمومی و سازمانی دارد.
برنامهنویسان و تولیدکنندگان محتوا میتوانند از طریق شبکهای از پلتفرمها به این هوش مصنوعی دسترسی داشته باشند؛ از جمله Gemini App، Google AI Studio، Gemini API، سیستم هوش مصنوعی جستجوی گوگل (Search AI Mode)، Google Ads، پلتفرم Google Flow و Google Stitch. برای توسعهدهندگانی که نیازمند پردازش در مقیاس بالا هستند، این مدل از طریق Batch API در دسترس است، اما در حال حاضر گزینههای Flex Inference برای آن فعال نشده است.
آلبوم تصاویر تولیدشده با مدل مولد تصویر Nano Banana 2.1
برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.