نانوبنانا ۲.۱ (Nano Banana 2.1) نسخهٔ تازهٔ مدل ساخت و ویرایش تصویر گوگل است که در تاریخ ۶ اکتبر ۲۰۲۶ (۱۴ مهر ۱۴۰۵) رونمایی شد. طبق معرفی رسمی نانوبنانا ۲.۱، این نسخه کیفیت تصویر، اجرای دستورها، نوشتن متن داخل تصویر و ثبات شخصیتها در ویرایشهای متوالی را بهبود میدهد. همزمان، نام اسپایسی مایو (Spicy Mayo) هم مطرح شده است؛ اما آیا با دو مدل متفاوت روبهرو هستیم؟ در ادامه، اطلاعات تأییدشده و موارد نامشخص را بررسی میکنیم.
Nano Banana 2.1 نانوبنانا ۲.۱ چیست؟
طبق معرفی رسمی نانوبنانا ۲.۱ یک مدل تولید تصویر (Image Generation) و ویرایش گفتوگویی (Conversational Editing) است؛ یعنی میتوانید تصویر بسازید و سپس با دستورهای متنی آن را تغییر دهید.
گوگل در راهنمای انتخاب مدلهای تصویری این نسخه را برای ساخت تصویر با سرعت بالا و استفادهٔ پرتعداد معرفی کرده و آن را برای پروژههای جدید بهجای نانوبنانا ۲ پیشنهاد میکند. نانوبنانا پرو (Nano Banana Pro) نیز همچنان گزینهٔ این خانواده برای کارهای بصری پیچیدهتر است.
Spicy Mayo اسپایسی مایو چیست؛ آیا همان نانوبنانا ۲.۱ است؟
در منابع رسمی بررسیشده، تأییدی پیدا نکردیم که اسپایسی مایو مدل مستقلی باشد یا نام آزمایشی نانوبنانا ۲.۱. نام رسمی نسخهٔ جدید در مستندات گوگل، نانوبنانا ۲.۱ است. همچنین در نسخهٔ بررسیشدهٔ جدول رتبهبندی تولید تصویر آرنا، نام اسپایسی مایو دیده نمیشود.
بنابراین، نمیتوان قابلیتها، قیمت یا امتیازهای نانوبنانا ۲.۱ را به اسپایسی مایو نسبت داد. برای معرفی قطعی این نام، باید منتظر اعلام سازنده یا تأیید رسمی ارتباط آن با یک مدل مشخص ماند.
قابلیتهای جدید Nano Banana 2.1 نانوبنانا ۲.۱
۱. کیفیت بهتر و اجرای دقیقتر دستورها
گوگل از بهبود واقعگرایی (Realism) و پیروی از دستور (Prompt Adherence) خبر داده است. همچنین نمایش متن (Text Rendering) و چیدمان اینفوگرافیکها دقیقتر شدهاند. مشکل ایجاد بخشهای تکراری یا کاشیمانند (Tiling Artifacts) در تصاویر بسیار کشیده، با کیفیت ۲K و ۴K، نیز برطرف شده است. این تغییرات در صفحهٔ رسمی مشخصات مدل آمدهاند.
برای نمونه، در طراحی یک بنر تبلیغاتی، میتوانید جای محصول، رنگ پسزمینه و متن روی تصویر را مشخص کنید. برای ارزیابی نتیجه، بهتر است بررسی کنید که مدل همهٔ این خواستهها را همزمان اجرا کرده باشد.
۲. ترکیب تصاویر مرجع و حفظ شخصیتها
این نسخه از ترکیب چند تصویر (Multi-image Fusion) با حداکثر ۱۴ تصویر مرجع پشتیبانی میکند. گوگل حفظ ثبات حداکثر ۴ شخصیت و وفاداری به جزئیات حداکثر ۱۰ شیء را نیز ذکر کرده است. سطح تفکر (Thinking Level) سه حالت حداقلی، متوسط و بالا دارد؛ حالت متوسط، تنظیم پیشفرض است.
یک سناریوی کاربردی برای بررسی این قابلیت هوش مصنوعی، ساخت چند تصویر از یک محصول است: عکس مرجع را ثابت نگه دارید و در هر مرحله فقط محیط یا نور را تغییر دهید. سپس شکل محصول، برچسب و رنگ آن را در خروجیها مقایسه کنید.
۳. ویرایش مرحلهبهمرحله و استفاده از جستوجوی گوگل
در راهنمای رسمی تولید تصویر، ویرایش چندمرحلهای (Multi-turn Editing)، استفاده از جستوجوی وب و تصویر گوگل برای اتکا به منابع (Search Grounding)، و ساخت تصویر با استفاده از محتوای ویدئو (Video-to-image) توضیح داده شدهاند. این قابلیتها امکان اصلاح تدریجی تصویر و ساخت خروجیهایی مانند تصویر بندانگشتی ویدئو را فراهم میکنند.
برای ویرایش مرحلهای، مثلاً ابتدا تصویر محصول را بسازید، سپس بگویید «فقط پسزمینه را روشنتر کن» و در مرحلهٔ بعد بخواهید نوشتهٔ روی تصویر تغییر کند. در هر مرحله، مشخصکردن عناصر ثابت به ارزیابی دقیقتر خروجی کمک میکند.
تفاوت نانوبنانا ۲.۱ با نانوبنانا ۲
نانوبنانا ۲ پیشتر هم ساخت تصویر ۴K، جستوجوی تصویری، ویرایش گفتوگویی و نسبتهای بسیار کشیده را ارائه میکرد. بنابراین این قابلیتها همگی برای اولین بار در نسخهٔ ۲.۱ اضافه نشدهاند؛ تمرکز نسخهٔ تازه بیشتر بر بهبود کیفیت و دقت است. مشخصات رسمی نانوبنانا ۲ قابلیتهای نسخهٔ قبلی را توضیح میدهد.
| موضوع | نانوبنانا ۲ | نانوبنانا ۲.۱ |
|---|---|---|
| شناسهٔ مدل | gemini-3.1-flash-image | gemini-nano-banana-2.1 |
| وضوح خروجی (Resolution) | ۰٫۵K، ۱K، ۲K و ۴K | ۱K، ۲K و ۴K |
| نوشتن متن داخل تصویر | پشتیبانی میشود | طبق اعلام گوگل بهبود یافته |
| ثبات در ویرایشهای متوالی | پشتیبانی میشود | طبق اعلام گوگل بهبود یافته |
| تصاویر بسیار کشیده | پشتیبانی میشود | مشکل تکرار بافت در ۲K و ۴K برطرف شده |
این مقایسه بر اساس صفحات رسمی دو مدل و راهنمای تولید تصویر تنظیم شده است. خروجی ۰٫۵K نسخهٔ قبلی در نانوبنانا ۲.۱ پشتیبانی نمیشود.
بنچمارک نانوبنانا ۲.۱؛ چه عددهایی منتشر شدهاند؟
در منابع رسمی بررسیشده، بنچمارک (Benchmark) عددی برای نانوبنانا ۲.۱ پیدا نکردیم. گوگل بهبودها را توصیف کرده، اما درصد افزایش کیفیت، زمان دقیق تولید یا میزان برتری نسبت به نسخهٔ قبل را اعلام نکرده است. در جدولهای عمومی آرنا با تاریخ ۵ اکتبر ۲۰۲۶ نیز این نسخه ثبت نشده است.
برای شناخت جایگاه نسخهٔ قبلی، امتیازهای زیر در دو جدول آرنا ثبت شدهاند:
| مدل | امتیاز تولید تصویر از متن | امتیاز ویرایش تکتصویر |
|---|---|---|
| نانوبنانا ۲ با جستوجوی وب | ۱۲۶۱ ± ۴ | ۱۳۸۷ ± ۳ |
| نانوبنانا پرو، نسخهٔ ۲K | ۱۲۴۸ ± ۳ | ۱۳۹۰ ± ۳ |
منبع این اعداد، رتبهبندی تولید تصویر آرنا و رتبهبندی ویرایش تصویر آرنا است. این امتیازها به نانوبنانا ۲.۱ تعلق ندارند و امتیاز دو جدول متفاوت را هم نباید مستقیماً با یکدیگر مقایسه کرد.
مشخصات فنی و دسترسی به نانوبنانا ۲.۱
طبق مستندات رسمی مدل، ورودیها شامل متن، تصویر، ویدئو و فایل پیدیاف هستند و خروجی میتواند تصویر و متن باشد. ظرفیت ورودی ۱۳۱٬۰۷۲ توکن و ظرفیت خروجی ۳۲٬۷۶۸ توکن است. نسخهٔ پایدار در مستندات ثبت شده و لینک آزمایش در گوگل ایآی استودیو (Google AI Studio) نیز ارائه شده است.
پشتیبانی از ورودی ویدئو به معنی تولید ویدئو نیست؛ خروجی این مدل همچنان تصویر و متن است.
قیمت نسخهٔ جدید چقدر است؟
در صفحهٔ قیمتگذاری رسمی رابط برنامهنویسی جمنای، هنگام بررسی، ردیف مستقلی برای نانوبنانا ۲.۱ پیدا نکردیم. بنابراین نمیتوان قیمت نسخهٔ قبلی را قیمت قطعی نسخهٔ تازه دانست.
چه محدودیتهایی دارد؟
طبق راهنمای محدودیتهای تولید تصویر گوگل، تعداد تصاویر خروجی همیشه دقیقاً مطابق درخواست نیست و استفاده از تصاویر واقعی افراد از نتایج جستوجوی وب پشتیبانی نمیشود. همهٔ تصاویر تولیدشده نیز واترمارک سینثآیدی (SynthID) دارند. فارسی در فهرست زبانهای پیشنهادی گوگل برای بهترین عملکرد ذکر نشده است؛ این موضوع به معنی پشتیبانینکردن از فارسی نیست.
برای انتشار محتوای فارسی، بهتر است املای نوشتههای داخل تصویر، ترتیب حروف و جزئیات خروجی را جداگانه بررسی کنید.
نانوبنانا ۲.۱ بهزودی در هوشا در دسترس خواهد بود
مدل نانوبنانا ۲.۱ بهزودی در پلتفرم هوش مصنوعی هوشا در دسترس خواهد بود. در هوشا میتوانید از مدلها مانند چت جی پی تی و… و سرویسهای متنوع برای تولید محتوا، ساخت و ویرایش تصویر، تولید ویدئو، موسیقی و صدا استفاده کنید و ابزار مناسب کارتان را انتخاب کنید. با اضافهشدن این نسخه، امکان تجربهٔ قابلیتهای تازهٔ نانوبنانا برای کاربران هوشا فراهم خواهد شد.
نانوبنانا ۲.۱ معرفی شد؛ تصاویر دقیقتر با Spicy Mayo
مدل Beam معرفی شد؛ رقیب آمریکایی GLM و Kimi با ۵۰۱ میلیارد پارامتر
تبلیغات تصویری ChatGPT هنگام ساخت عکس نمایش داده میشود!
واترمارک نامرئی و متنی ChatGPT و Codex معرفی شد؛ فناوری textGrain چیست؟
هوش مصنوعی لئوناردو چیست؟ قیمت و امکانات + آموزش عملی در ۴ گام