اخبار هوش مصنوعی

گوگل از مدل انقلابی امبدینگ جما ۲ رونمایی کرد؛ پردازش چندوجهی آفلاین روی موبایل بدون نیاز به اینترنت

مدل جدید امبدینگ جما ۲ گوگل یک هوش مصنوعی سبک و چندوجهی است که امکان جستجوی هوشمند میان متن، عکس، فیلم و صدا را کاملا آفلاین روی گوشی ممکن می‌کند. شرکت گوگل با معرفی این مدل تازه نشان داد که دوران وابستگی کامل به اینترنت در حال تمام شدن است. حالا دیگر لازم نیس…

11 دقیقه مطالعه
  • پشتیبانی شبکه
  • هوش مصنوعی
  • مدل
  • گوشی
  • بدون
  • کار
  • می‌کند
  • عکس
گوگل از مدل انقلابی امبدینگ جما ۲ رونمایی کرد؛ پردازش چندوجهی آفلاین روی موبایل بدون نیاز به اینترنت

خلاصه تحلیلی خبر

مدل جدید امبدینگ جما ۲ گوگل یک هوش مصنوعی سبک و چندوجهی است که امکان جستجوی هوشمند میان متن، عکس، فیلم و صدا را کاملا آفلاین روی گوشی ممکن می‌کند. شرکت گوگل با معرفی این مدل تازه نشان داد که دوران وابستگی کامل به اینترنت در حال تمام شدن است. حالا دیگر لازم نیس…

موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، مدل، گوشی، بدون، کار

مدل جدید امبدینگ جما ۲ گوگل یک هوش مصنوعی سبک و چندوجهی است که امکان جستجوی هوشمند میان متن، عکس، فیلم و صدا را کاملا آفلاین روی گوشی ممکن می‌کند.

شرکت گوگل با معرفی این مدل تازه نشان داد که دوران وابستگی کامل به اینترنت در حال تمام شدن است. حالا دیگر لازم نیست برای پیدا کردن یک تصویر یا فایل صوتی در گوشی، مدام نگران قطع و وصل شدن نت یا لو رفتن عکس‌های خانوادگی باشید.

رونمایی گوگل از امبدینگ جما ۲ برای پردازش داده‌ها در دستگاه

تا پیش از این، بیشتر مدل‌های سبک فقط زبان و متن را می‌فهمیدند و اگر می‌خواستید یک عکس یا آهنگ را تحلیل کنید، دستگاه کم می‌آورد و باید کار را به سرورهای ابری می‌سپرد. اما طبق گزارش منتشر شده دروبلاگ رسمی توسعه‌دهندگان گوگلاین مرزها شکسته شده است. این مدل متن‌باز تازه می‌تواند هر فایلی را که درون دستگاه دارید، از صدا و ویدیو گرفته تا عکس و تکه‌های کد برنامه‌نویسی، یکجا بفهمد و به هم ربط دهد. این یعنی گوشی شما بدون نیاز به اتصال به وب، متوجه منظور شما می‌شود.

چرا هوش مصنوعی باید مستقیم روی گوشی کار کند؟

وقتی یک برنامه برای پردازش سوالات شما به سرور وصل می‌شود، چند ثانیه طول می‌کشد تا پیام برود و جواب برگردد. این تاخیر کوچک در کارهای روزمره واقعاً آزاردهنده است. علاوه بر این، حجم بسته‌های اینترنتی و قطعی‌های گاه‌وبیگاه باعث می‌شود سرویس‌های ابری همیشه در دسترس نباشند.

وقتی موتور پردازش داخل خود چیپست گوشی قرار بگیرد، سرعت پاسخ دادن به چند میلی‌ثانیه می‌رسد. شما دکمه را می‌زنید و همان لحظه جواب را روی صفحه می‌بینید. هیچ افت سرعتی به خاطر شلوغی شبکه رخ نمی‌دهد و مهم‌تر از همه، اگر در سفر یا جایی بدون آنتن باشید، باز هم تمام قابلیت‌های هوشمند گوشی مثل ساعت کار می‌کنند. این استقلال کاری، حس مالکیت واقعی به گجت‌ها را به کاربران بازمی‌گرداند.

حل مشکل وابستگی به اینترنت در استفاده روزمره

خیلی وقت‌ها برای همه پیش آمده که در مترو، هواپیما یا جاهایی با پوشش ضعیف آنتن، دنبال یک سند مهم یا یک عکس قدیمی در گوشی خود گشته‌اند. در حالت عادی، هوش گوشی بدون نت از کار می‌افتد و سیستم جستجوی ساده هم اگر اسم فایل را دقیق یادتان نباشد، چیزی پیدا نمی‌کند.

مدل جدید گوگل این گره را باز می‌کند. چون کل شبکه تحلیل داده درون حافظه دستگاه مستقر است، گوشی شما حتی در حالت پرواز هم مثل یک کارآگاه باهوش فایل‌ها را بررسی می‌کند. کاربر با خیال راحت می‌تواند کارهایش را پیش ببرد و مطمئن باشد که خاموش بودن اینترنت، هوش گوشی را از کار نمی‌اندازد.

نمودار مقایسه عملکرد و اندازه مدل EmbeddingGemma 2 در بنچمارک امبدینگ متنی و کدنویسی (MTEB Code) در برابر مدل‌های رقیب

بررسی ساختار ماژولار و فضای برداری چندوجهی مشترک

شاید بپرسید فضای برداری مشترک یعنی چه؟ خیلی ساده بگوییم: این مدل برای تمام فایل‌ها یک زبان مشترک می‌سازد. در این روش، صدا، عکس، متن و فیلم همگی تبدیل به کدهای عددی ریاضی می‌شوند و در کنار هم قرار می‌گیرند.

فرض کنید چند سال پیش یک فایل صوتی ضبط کرده‌اید که در آن صدای بارش باران می‌آید و هم‌زمان چند عکس هم از آن روز بارانی در گالری دارید. با این مدل کافی است تایپ کنید هوای بارانی یا حتی یک وویس از صدای شرشر آب پخش کنید؛ هوش گوشی بلافاصله عکس‌های آن روز و حتی فریم‌های ویدیوی باران را پیدا می‌کند و جلویتان می‌گذارد، چون فهمیده که معنی صدای آب با تصویر چتر و واژه باران یکی است.

چطور عکس و صدا در یک فضای مشترک پیدا می‌شوند؟

روش کار به این صورت است که مدل، ویژگی‌های مفهومی محتوا را بیرون می‌کشد. مثلا وقتی به یک تصویر نگاه می‌کند، فقط رنگ پیکسل‌ها را نمی‌بیند؛ بلکه حس و حال، اجسام داخل کادر و رابطه بین آن‌ها را درک می‌کند.

همین اتفاق برای فایل‌های صوتی هم می‌افتد. مدل فرکانس صدا، ریتم صحبت کردن و اصوات محیطی را مثل یک نقشه کدگذاری می‌کند. چون همه این کدها در یک جدول مفهومی کنار هم می‌نشینند، فاصله بین مفاهیم شبیه به هم بسیار کم می‌شود. در نتیجه، برای پیدا کردن یک تصویر خاص، دیگر نیازی به نوشتن اسم دقیق آن فایل ندارید و فقط کافی است توصیفی از حس یا صدای آن را وارد کنید.

معماری ماژولار بر پایه مدل جما ۴ چگونه کار می‌کند؟

گوگل برای اینکه رم گوشی زیر بار پردازش له نشود، از روش قطعه‌قطعه یا ماژولار استفاده کرده است. این مدل در مجموع ۷۴۰ میلیون پارامتر دارد که روی پایه‌های نسخه جما ۴ سوار شده است، اما همه این بخش‌ها لازم نیست همیشه با هم روشن باشند.

اگر برنامه‌ای فقط بخواهد با متن و پیام‌های متنی کار کند، تنها هسته متنی مدل با ۲۷۰ میلیون پارامتر روشن می‌شود. اگر کاربری خواست داخل گالری عکس جستجو کند، بخش تصویر با ۱۷۰ میلیون پارامتر به کمک می‌آید. برای فایل‌های صوتی و پادکست‌ها هم یک بخش جداگانه با ۳۰۰ میلیون پارامتر آماده کار است. این چیدمان پازلی باعث می‌شود که پردازنده گوشی بی‌جهت داغ نکند و فقط همان بخشی که نیاز است از باتری برق بکشد.

ظرفیت پردازش پنجره زمینه هشت هزار توکنی

یکی از جهش‌های بزرگ این نسخه، ظرفیت درک داده‌ها در یک نگاه است که به آن پنجره زمینه می‌گویند. این ظرفیت حالا به هشت هزار توکن رسیده که در مقایسه با نسخه‌های قبلی چهار برابر شده است.

این عدد بزرگ در عمل به چه معناست؟ یعنی شما می‌توانید یک فایل صوتی پنج و نیم دقیقه‌ای را یکجا به مدل بدهید تا آن را بشنود و بفهمد. همچنین مدل می‌تواند بیست و نه عکس باکیفیت یا پنجاه و هشت فریم پیوسته از یک ویدیو را پشت سر هم تحلیل کند بدون اینکه رشته ماجرا از دستش در برود. این یعنی مدل دیگر بخش‌های یک ویدیو را جدا از هم نمی‌بیند، بلکه روند داستان و اتفاقات را مثل چشم انسان دنبال می‌کند.

نمودار ارزیابی میانگین امتیاز مدل EmbeddingGemma 2 بر اساس اندازه مدل در بنچمارک امبدینگ تصویر (MIEB Lite)

کار با روش ماتریوشکا برای کم کردن حجم و مدیریت رم

یکی از مشکلات بزرگ مدل‌های برداری، پر شدن سریع حافظه ذخیره‌سازی دستگاه است. اگر قرار باشد برای هر عکس یا یادداشت یک بردار طولانی در گوشی ذخیره شود، بعد از چند ماه حافظه پر می‌شود و سرعت سیستم افت می‌کند.

گوگل برای حل این معضل سراغ ترفندی به اسم بازنمایی ماتریوشکا رفته است؛ درست شبیه همان عروسک‌های چوبی تو در توی روسی. در این روش، مهم‌ترین معنی‌ها در لایه‌های اول جا می‌گیرند و جزئیات ریزتر در لایه‌های بعدی می‌نشینند. این کار به برنامه‌نویس اجازه می‌دهد بدون اینکه هوش مدل افت شدیدی پیدا کند، بردارها را به اندازه دلخواه کوتاه کند.

اندازه بردار ذخیرهمقدار صرفه‌جویی در دیسکحفظ کیفیت جستجوبهترین مورد مصرف
۷۶۸ بعد کاملبدون کاهش حجمصد در صدسیستم‌های کاری و پردازش سنگین
۵۱۲ بعدحدود سی و سه درصدنود و نه درصدلپ‌تاپ‌ها و کارهای روزمره
۲۵۶ بعدحدود شصت و شش درصدنود و هفت درصداپلیکیشن‌های عمومی روی گوشی
۱۲۸ بعد فشردهشش برابر خلوت‌ترحدود نود و پنج درصدساعت‌های هوشمند و گجت‌های ساده

تکنیک ماتریوشکا چطور فضای ذخیره را نجات می‌دهد؟

وقتی ابعاد بردار از عدد ۷۶۸ به ۱۲۸ می‌رسد، فضای لازم برای ذخیره اطلاعات تا ۶ برابر کم می‌شود. فکر کنید قبلا برای ذخیره بردار ده هزار تصویر در گالری به چند گیگابایت حافظه احتیاج داشتید، اما حالا همان اطلاعات با چند صد مگابایت سر و سامان می‌گیرد.

خوبی این روش در این است که نیازی نیست مدل را دوباره از اول آموزش دهند. خود مدل طوری طراحی شده که لایه‌های انتهایی را می‌توان به راحتی قیچی کرد. حتی روی کوچک‌ترین حالت هم دقت پیدا کردن فایل‌ها بالای ۹۴ درصد باقی می‌ماند که برای استفاده‌های روزانه روی گوشی کاملا کافی و عالی است.

مصرف رم روی گوشی‌های پیکسل و تراشه‌های

همه می‌دانیم که رم گوشی‌های موبایل محدود است و سیستم‌عامل نمی‌گذارد یک برنامه کل رم را تصاحب کند. مهندسان گوگل با فشرده‌سازی عددی کاری کرده‌اند که این مدل فوق‌العاده سبک رفتار کند.

روی گوشی‌هایی مثل سری پیکسل، بخش متنی این مدل تنها حدود ۱۹۱ مگابایت از رم را اشغال می‌کند که واقعا شگفت‌انگیز است. این عدد حتی از رم مصرفی خیلی از برنامه‌های پیام‌رسان هم کمتر است. اگر تمام بخش‌های چندوجهی شامل صوت و تصویر هم هم‌زمان بالا بیایند، کل رم درگیر به ۵۶۷ مگابایت می‌رسد. این عدد نشان می‌دهد که حتی روی گوشی‌های اقتصادی با رم پایین هم می‌توان این هوش را به راحتی اجرا کرد.

جف دین از مدیران ارشد تیم هوش مصنوعی گوگل درباره این دستاورد گفته است که آینده پردازش داده‌ها در اجرای ابزارهای کم‌حجم روی دستگاه‌های شخصی است تا بدون ارسال اطلاعات و بدون افت سرعت به مردم خدمت کنند.

امنیت داده‌ها و توسعه سیستم‌های جستجوی محلی راگ

یکی از اصطلاحات داغ این روزها سیستم راگ یا بازیابی اطلاعات شخصی برای هوش مصنوعی است. به کمک مدل تازه گوگل، توسعه‌دهندگان می‌توانند موتورهای جستجوی خصوصی بسازند.

فرض کنید تمام اسناد پی‌دی‌اف، نسخه‌های پزشکی، چت‌ها و یادداشت‌های صوتی شما در یک پایگاه داده کوچک داخل گوشی ذخیره شده باشد. هر بار سوالی بپرسید، این مدل مثل یک دستیار دانا فایل‌های مربوطه را از حافظه بیرون می‌کشد و جواب می‌دهد، بدون اینکه حتی یک بایت از این اطلاعات روی اینترنت فرستاده شود. این سیستم به خاطر داشتن لایسنس آزاد آپاچی ۲ کاملا رایگان است و هر سازنده برنامه‌ای می‌تواند آن را بدون پرداخت هزینه در اپ خود بگنجاند.

نمودار مقایسه عملکرد مدل EmbeddingGemma 2 با سایر مدل‌های هوش مصنوعی در بنچمارک امبدینگ صوتی (MAEB)

بررسی تفاوت‌های اساسی نسل‌های مدل برداری سبک گوگل

برای اینکه ببینیم چقدر همه چیز نسبت به نسخه‌های قبلی بهتر شده، کافی است به مشخصات فنی و تغییرات کاربری نگاهی بیندازیم. نسل گذشته فقط با کلمات کار می‌کرد، اما نسخه تازه دنیای رسانه‌ها را هم متوجه می‌شود.

جدول زیر به روشنی تغییرات و تفاوت‌های میان این دو نسخه را خلاصه کرده تا ببینید چطور سیستم‌های پردازشی در مدت کوتاهی سبک‌تر و در عین حال تواناتر شده‌اند.

ویژگی مدلنسخه اول مدلنسخه دوم مدل
پشتیبانی از فایل‌هافقط فایل‌های متنیمتن، کد برنامه، عکس، فیلم و صدا
تعداد پارامتر کلسیصد میلیون یک‌تکههفتصد و چهل میلیون قطعه‌ای
کمترین رم مورد نیازنزدیک چهارصد مگابایتصد و نود و یک مگابایت
اندازه پنجره بررسیدو هزار توکنهشت هزار توکن کامل
قابلیت کوچک کردن بعدندارد و ثابت استدارد با روش ماتریوشکا
نوع مجوز انتشارآپاچی نسخه دوآپاچی نسخه دو کاملا آزاد

عمر باتری و مصرف انرژی در پردازش‌های سنگین

یکی دیگر از مواردی که کاربران همیشه نگرانش هستند، خالی شدن سریع باتری گوشی هنگام استفاده از هوش مصنوعی است. وقتی یک مدل سنگین روی گوشی کار کند، پردازنده داغ می‌شود و درصد باتری مثل ثانیه‌شمار پایین می‌آید.

در این نسخه با کم کردن تعداد محاسبات ریاضی پیچیده و استفاده از داده‌های ساده‌تر، فشار کاری پردازنده به شدت مهار شده است. تست‌ها روی پردازنده‌های امروزی نشان می‌دهد که صدها جستجوی معنایی پشت سر هم حتی یک درصد هم از شارژ باتری کم نمی‌کند. این یعنی سازندگان گوشی‌ها می‌توانند این قابلیت را همیشه در پس‌زمینه سیستم‌عامل فعال نگه دارند بدون اینکه صدای اعتراض کاربران بابت زود خالی شدن شارژ دربیاید.

باز شدن دست برنامه‌نویسان مستقل و استارتاپ‌ها

برای شرکت‌های کوچک همیشه اجاره سرورهای ابری و خرید سرویس‌های گران قیمت دردسر بزرگی بود. اگر یک برنامه می‌خواست به صد هزار کاربر سرویس جستجوی هوشمند بدهد، باید هزینه‌های دلاری سنگینی به شرکت‌های بزرگ می‌پرداخت.

حالا با وجود این مدل منبع‌باز، برنامه‌نویسان می‌توانند پردازش را به چیپست گوشی خود کاربران منتقل کنند. این تغییر مسیر باعث می‌شود هزینه‌های نگهداری سرور برای تیم‌های نرم‌افزاری تا نود درصد کاهش پیدا کند. در نتیجه در ماه‌های آینده شاهد برنامه‌های رایگان و متنوع‌تری برای یادداشت‌برداری، مدیریت عکس و ابزارهای صوتی خواهیم بود که بدون اشتراک ماهانه بهترین امکانات را ارائه می‌دهند.

جستجوی هوشمند در گوشی‌های شخصی بدون اینترنت

مدل امبدینگ جما ۲ نشان داد که مسیر هوش مصنوعی دیگر فقط به سرورهای غول‌پیکر ختم نمی‌شود. گوگل با طراحی یک ساختار ماژولار که کمتر از ۶۰۰ مگابایت رم می‌خواهد و فایل‌های صوتی و تصویری را با هم پیوند می‌دهد، تعریف جدیدی از کار با گوشی هوشمند ارائه کرده است.

این رویکرد به کاربران قدرت می‌دهد تا بدون نگرانی از دست رفتن حریم شخصی، فایل‌های چندرسانه‌ای خود را راحت‌تر از همیشه سر و سامان دهند. گجت‌های ما حالا دارند به وسایلی واقعا باهوش تبدیل می‌شوند؛ ابزارهایی که با چشمان تیزبین و گوش‌های شنوای خود، اطلاعات دنیای واقعی را حتی در دل کویر و بدون اتصال به نت، بدون معطلی می‌فهمند.

سوالات متداول

۱. مدل امبدینگ جما ۲ گوگل چه مزیتی نسبت به نسخه قبلی دارد؟

این مدل علاوه بر متن از عکس و فیلم و فایل‌های صوتی هم پشتیبانی می‌کند و جستجوی آفلاین را ممکن می‌سازد.

۲. آیا این مدل هوش مصنوعی برای کار کردن به اینترنت احتیاج دارد؟

خیر تمام مراحل خواندن داده‌ها و پیدا کردن فایل‌ها به شکل صد در صد آفلاین درون خود گوشی انجام می‌شود.

۳. این ابزار چه مقدار از حافظه رم گوشی را به خودش اختصاص می‌دهد؟

برای کارهای متنی حدود صد و نود و یک مگابایت و در حالت چندوجهی کامل نزدیک پانصد و شصت و هفت مگابایت رم می‌خواهد.

۴. طول پنجره زمینه مدل چقدر است و چه کمکی به کاربر می‌کند؟

ظرفیت هشت هزار توکنی این مدل اجازه می‌دهد پنج دقیقه صدا یا پنجاه و هشت فریم ویدیو پیوسته پردازش شود.

۵. آیا استفاده از این مدل برای ساخت نرم‌افزار رایگان است؟

بله این مدل تحت لایسنس متن‌باز آپاچی ۲ منتشر شده و همه می‌توانند در پروژه‌های تجاری رایگان از آن بهره ببرند.

برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.