گوگل از EmbeddingGemma 2 رونمایی کرد؛ تحول در هوش مصنوعی چندوجهی آفلاین
گوگل با معرفی مدل ۷۴۰ میلیون پارامتری EmbeddingGemma 2، امکان جستوجوی معنایی چندوجهی و اجرای آفلاین هوش مصنوعی را ارتقاء داد. دنیای مدلهای زبانی کوچک با سرعتی باورنکردنی در حال حرکت بهسمت پردازش محلی دادهها است. پس از استقبال چشمگیر توسعهدهندگان از نسل او…
خلاصه تحلیلی خبر
گوگل با معرفی مدل ۷۴۰ میلیون پارامتری EmbeddingGemma 2، امکان جستوجوی معنایی چندوجهی و اجرای آفلاین هوش مصنوعی را ارتقاء داد. دنیای مدلهای زبانی کوچک با سرعتی باورنکردنی در حال حرکت بهسمت پردازش محلی دادهها است. پس از استقبال چشمگیر توسعهدهندگان از نسل او…
موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، میلیون، پردازش، پارامتر، EmbeddingGemma
گوگل با معرفی مدل ۷۴۰ میلیون پارامتری EmbeddingGemma 2، امکان جستوجوی معنایی چندوجهی و اجرای آفلاین هوش مصنوعی را ارتقاء داد.
دنیای مدلهای زبانی کوچک با سرعتی باورنکردنی در حال حرکت بهسمت پردازش محلی دادهها است. پس از استقبال چشمگیر توسعهدهندگان از نسل اول EmbeddingGemma و ثبت بیش از ۲۰ میلیون دانلود، نسل تازهی این فناوری با هدف پوشش همزمان چندین نوع محتوا پا به میدان میگذارد تا مرزهای پردازش هوشمند روی دستگاههای قابلحمل را جابهجا کند.
بر اساسبیانیهی گوگلمدل متنباز EmbeddingGemma 2 با بهرهگیری از معماری Gemma 4 و تحت مجوز تجاری Apache 2.0 معرفی شده است.
بهلطف ۷۴۰ میلیون پارامتر، امکان پردازش یکپارچهی متن، کد، تصویر، ویدیو و صوت در یک فضای تعبیهسازی مشترک فراهم میشود تا کاربر بتواند بدون وابستگی به سرورهای ابری، ویدیوها و فایلهای صوتی خود را از طریق دستورهای متنی جستوجو کند.
مهندسان گوگل با الگوبرداری از فناوری تعبیهساز جمنای، ساختاری کاملا ماژولار برای نسخهی جدید تدارک دیدهاند. توسعهدهندگان میتوانند متناسب با نیاز خود از بخش متنی با ۲۷۰ میلیون پارامتر استفاده کنند یا در صورت نیاز، رمزگذارهای تصویری با ۱۷۰ میلیون پارامتر و صوتی با ۳۰۰ میلیون پارامتر را برای دستیابی به ظرفیت کامل چندوجهی فعال سازند.
پشتیبانی از فناوری یادگیری بازنمایی ماتریوشکا (MRL) به توسعهدهندگان اجازه میدهد بردارهای خروجی را از ۷۶۸ بعد به ۵۱۲، ۲۵۶ یا حتی ۱۲۸ بعد کاهش دهند. قابلیت یادشده حجم ذخیرهسازی پایگاههای دادهی برداری را تا ۶ برابر کوچکتر میکند.
پنجرهی زمینهی مدل به ۸ هزار توکن افزایش یافته که چهار برابر بیشتر از نسل نخست بهشمار میرود. گستردگی ابعاد پردازش به سیستم امکان میدهد تا حداکثر ۵٫۵ دقیقه صوت پیوسته، ۲۹ تصویر، ۵۸ فریم ویدیو یا ترکیبی منعطف از آنها را بهشکل محلی تحلیل کند.
- ارتقای امتیاز در بنچمارک MTEB Code از ۶۸٫۷۶ به ۷۸٫۶۸ با رشدی معادل ۹٫۹۲ امتیاز
- کسب رتبهی برتر در بنچمارک صوتی MAEB در ردهی مدلهای زیر یک میلیارد پارامتر
- عملکرد فراتر از مدلهای تخصصی با ابعاد دو برابر بزرگتر در پردازش اسناد و ویدیو
توسعهدهندگان هماکنون میتوانند وزنهای مدل را از پایگاههای Hugging Face و Kaggle دریافت کنند. ابزارهای پرکاربردی همچون MediaPipe و LiteRT و کتابخانهی transformers.js بر بستر WebGPU، فریمورکهای MLX و vLLM و llama.cpp و SGLang و Ollama و پایگاه برداری Qdrant از روز نخست آمادهی استقرار این تعبیهساز هستند.
برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.