ابزارهای هوش مصنوعی

EmbeddingGemma 2؛ مدل متن‌باز چندوجهی گوگل که حتی روی موبایل اجرا می‌شود

گوگل EmbeddingGemma 2 را به‌عنوان یک مدل سبک و متن‌باز برای تولید امبدینگ‌های چندوجهی برای اجرای لوکال روی دستگاه معرفی کرد. این مدل می‌تواند ترکیبی از متن، تصویر، صوت و ویدئو را به‌صورت لوکال در یک فضای embedding مشترک نگاشت کند. EmbeddingGemma 2 بر پایه معما…

4 دقیقه مطالعه
  • پشتیبانی شبکه
  • هوش مصنوعی
  • مدل
  • EmbeddingGemma
  • میلیون
  • چندوجهی
  • مدل‌های
  • دستگاه
EmbeddingGemma 2؛ مدل متن‌باز چندوجهی گوگل که حتی روی موبایل اجرا می‌شود

خلاصه تحلیلی خبر

گوگل EmbeddingGemma 2 را به‌عنوان یک مدل سبک و متن‌باز برای تولید امبدینگ‌های چندوجهی برای اجرای لوکال روی دستگاه معرفی کرد. این مدل می‌تواند ترکیبی از متن، تصویر، صوت و ویدئو را به‌صورت لوکال در یک فضای embedding مشترک نگاشت کند. EmbeddingGemma 2 بر پایه معما…

موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، مدل، EmbeddingGemma، میلیون، چندوجهی

گوگل EmbeddingGemma 2 را به‌عنوان یک مدل سبک و متن‌باز برای تولید امبدینگ‌های چندوجهی برای اجرای لوکال روی دستگاه معرفی کرد.

این مدل می‌تواند ترکیبی از متن، تصویر، صوت و ویدئو را به‌صورت لوکال در یک فضای embedding مشترک نگاشت کند. EmbeddingGemma 2 بر پایه معماری Gemma 4 ساخته شده و با مجوز تجاری Apache 2.0 عرضه می‌شود. این مدل ۷۴۰ میلیون پارامتر دارد و برای اجرای استنتاج روی دستگاه به‌صورت لوکال طراحی شده است.

موفقیت با ۲۰ میلیون دانلود

نسخه نخستEmbeddingGemmaکه سال گذشته معرفی شد، گزینه‌ای سبک برای تولید جاسازی‌های باکیفیت متنی بود و برای سازمان‌دهی، جست‌وجو و ارتباط میان اطلاعات روی سخت‌افزارهای مصرفی استفاده می‌شد. به گفته گوگل، این مدل بیش از ۲۰ میلیون بار دانلود شده و در ابزارهای جست‌وجوی روی دستگاه و خطوط لوله تولید تقویت‌شده با بازیابی (RAG) با تمرکز بر حفظ حریم خصوصی به‌کاررفته است.

سطح جدید عملکرد با EmbeddingGemma 2

EmbeddingGemma 2 دامنه این قابلیت‌ها را از متن فراتر می‌برد و کد، تصویر، ویدئو و صوت را نیز در یک فضای امبدینگ مشترک قرار می‌دهد. در نتیجه، یک مدل چندوجهی می‌تواند برای نمونه، یک کلیپ ویدئویی مشخص را بر اساس یک یادداشت صوتی پیدا کند یا ساعت‌ها فایل صوتی را با استفاده از یک پرس‌وجوی متنی جست‌وجو کند.

EmbeddingGemma 2 model card

این مدل در میان مدل‌های چندوجهی با کمتر از یک میلیارد پارامتر، عملکرد بالایی ارائه می‌کند و در معیارهایی مانند MTEB Code و MAEB امتیازهای پیشرو به دست آورده است. EmbeddingGemma 2 همچنین از نظر عملکرد در وظایف متنی، بینایی و صوتی با بسیاری از مدل‌های بزرگ‌تر رقابت می‌کند یا از آن‌ها بهتر است.

گوگل EmbeddingGemma 2 را به‌عنوان یک مدل سبک و متن‌باز برای تولید امبدینگ‌های چندوجهی برای اجرای لوکال روی دستگاه معرفی کرد.
گوگل EmbeddingGemma 2 را به‌عنوان یک مدل سبک و متن‌باز برای تولید امبدینگ‌های چندوجهی برای اجرای لوکال روی دستگاه معرفی کرد.
گوگل EmbeddingGemma 2 را به‌عنوان یک مدل سبک و متن‌باز برای تولید امبدینگ‌های چندوجهی برای اجرای لوکال روی دستگاه معرفی کرد.

یکی از ویژگی‌های مدل، طراحی ماژولار آن است. برای پردازش صرفاً متنی، می‌توان از نسخه‌ای با حداقل ۲۷۰ میلیون پارامتر استفاده کرد و برای پشتیبانی کامل چندوجهی، انکودرهای اختیاری بینایی با ۱۷۰ میلیون و صوت با ۳۰۰ میلیون پارامتر به آن افزود.

EmbeddingGemma 2 همچنین برای کاهش هزینه ذخیره‌سازی بهینه شده است. با استفاده از Matryoshka Representation Learning (MRL)، بردارهای خروجی ۷۶۸بعدی را می‌توان به‌صورت پویا به ۵۱۲، ۲۵۶ یا ۱۲۸ بعد کاهش داد. گوگل می‌گوید این قابلیت می‌تواند فضای موردنیاز پایگاه‌های داده برداری محلی و حافظه را تا ۶ برابر کاهش دهد.

اجرا حتی روی

این مدل برای اجرا با محدودیت‌های منابع سخت‌افزاری نیز بهینه شده است. پس از quantization، روی Google Pixel 11 Pro، مصرف RAM فعال برای وزن‌های متنی به حدود ۱۹۱ مگابایت و برای مدل کاملاً چندوجهی به حدود ۵۶۷ مگابایت می‌رسد.

EmbeddingGemma 2 یک پنجره زمینه هشت‌هزار توکنی دارد؛ ظرفیتی که چهار برابر EmbeddingGemma 1 است. این مدل می‌تواند روی سخت‌افزار لوکال تا ۵.۵ دقیقه صوت، ۲۹ تصویر، ۵۸ فریم ویدئو یا ترکیبی از این ورودی‌ها را پردازش کند.

در حوزه کدنویسی، EmbeddingGemma 2 نسبت به نسخه قبلی ۹.۹۲ امتیاز پیشرفت در MTEB Code داشته و امتیاز آن از ۶۸.۷۶ به ۷۸.۶۸ رسیده است. این قابلیت برای نمایه‌سازی محلی کدبیس، جست‌وجوی معنایی کد و بازیابی اطلاعات برای عامل‌های کدنویسی مناسب است. مدل EmbeddingGemma 2 در حوزه‌های تصویر، ویدئو، اسناد و صوت نیز نسبت کیفیت به تعداد پارامتر بالایی ارائه می‌کند و از برخی مدل‌های تخصصی بیش از دو برابر بزرگ‌تر عملکرد بهتری دارد.

اجرای امبدینگ‌ها به‌صورت لوکال می‌تواند به حفظ حریم خصوصی داده‌ها، کاهش تأخیر فرایندها و ساخت سیستم‌های جست‌وجو و بازیابی چندوجهی کاملاً آفلاین کمک کند. در ترکیب با مدل‌های مولد مانند Gemma 4، EmbeddingGemma 2 امکان ساخت جریان‌های کاری RAG روی دستگاه را فراهم می‌کند. این دو مدل توکنایزر متنی و انکودر صوتی مشترکی دارند که به کاهش مجموع حافظه موردنیاز در یک جریان کاری یکپارچه کمک می‌کند. از منظر فناوری، مدل مذکور بر پایه‌ی همان فناوری مدل‌های Gemini Embedding توسعه یافته است.

خانواده Gemma 4؛ کارآمدترین مدل‌های متن‌باز به‌ازای هر بایت

شتاب‌دهی به Gemma 4: استنتاج سریع‌تر با پیش‌نویس‌های پیش‌بینی چندتوکنی

گوگل یک دستگاه مترجم هوش مصنوعی قابل‌حمل و آفلاین توسعه داده که شما هم می‌توانید نمونه‌ای از آن را بسازید

انتشار مدل Gemini Embedding 2

دسترسی و دانلود رایگان مدل متن‌باز EmbeddingGemma 2

مدل‌های EmbeddingGemma 2 از طریقGitHubHugging FaceوKaggleدر دسترس هستند.

برای استقرار روی دستگاه می‌توان ازGoogle AI Edge MediaPipeوLiteRTاستفاده کرد و برای اجرای مدل در مرورگر نیز ابزارهایی مانند transformers.js وWebGPUارائه شده‌اند.

همچنین ابزارهایی مانند transformers، sentence-transformersMLXvLLMllama.cppSGLangOllamaو LMStudio برای سرویس‌دهی مدل پشتیبانی می‌شوند.

گوگل همچنینمستدات فنیمدل EmbeddingGemma 2 وراهنمای توسعه‌دهندگانرا به همراه راهنمای فاین‌تیونینگ مدل برایاستنتاجرا از طریقUnslothارائه کرده است.

برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.