زومیا؛ هوش مصنوعی

گوگل از EmbeddingGemma 2 رونمایی کرد؛ تحول در هوش مصنوعی چندوجهی آفلاین

گوگل با معرفی مدل ۷۴۰ میلیون پارامتری EmbeddingGemma 2، امکان جست‌وجوی معنایی چندوجهی و اجرای آفلاین هوش مصنوعی را ارتقاء داد. دنیای مدل‌های زبانی کوچک با سرعتی باورنکردنی در حال حرکت به‌سمت پردازش محلی داده‌ها است. پس از استقبال چشمگیر توسعه‌دهندگان از نسل او…

2 دقیقه مطالعه
  • پشتیبانی شبکه
  • هوش مصنوعی
  • میلیون
  • پردازش
  • پارامتر
  • EmbeddingGemma
  • توسعه‌دهندگان
  • مدل‌های
گوگل از EmbeddingGemma 2 رونمایی کرد؛ تحول در هوش مصنوعی چندوجهی آفلاین

خلاصه تحلیلی خبر

گوگل با معرفی مدل ۷۴۰ میلیون پارامتری EmbeddingGemma 2، امکان جست‌وجوی معنایی چندوجهی و اجرای آفلاین هوش مصنوعی را ارتقاء داد. دنیای مدل‌های زبانی کوچک با سرعتی باورنکردنی در حال حرکت به‌سمت پردازش محلی داده‌ها است. پس از استقبال چشمگیر توسعه‌دهندگان از نسل او…

موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، میلیون، پردازش، پارامتر، EmbeddingGemma

لوگوی مدل هوش مصنوعی EmbeddingGemma 2 (EmbeddingGemma 2) روی پس‌زمینه دیجیتال آبی

گوگل با معرفی مدل ۷۴۰ میلیون پارامتری EmbeddingGemma 2، امکان جست‌وجوی معنایی چندوجهی و اجرای آفلاین هوش مصنوعی را ارتقاء داد.

دنیای مدل‌های زبانی کوچک با سرعتی باورنکردنی در حال حرکت به‌سمت پردازش محلی داده‌ها است. پس از استقبال چشمگیر توسعه‌دهندگان از نسل اول EmbeddingGemma و ثبت بیش از ۲۰ میلیون دانلود، نسل تازه‌ی این فناوری با هدف پوشش همزمان چندین نوع محتوا پا به میدان می‌گذارد تا مرزهای پردازش هوشمند روی دستگاه‌های قابل‌حمل را جابه‌جا کند.

بر اساسبیانیه‌ی گوگلمدل متن‌باز EmbeddingGemma 2 با بهره‌گیری از معماری Gemma 4 و تحت مجوز تجاری Apache 2.0 معرفی شده است.

به‌لطف ۷۴۰ میلیون پارامتر، امکان پردازش یکپارچه‌ی متن، کد، تصویر، ویدیو و صوت در یک فضای تعبیه‌سازی مشترک فراهم می‌شود تا کاربر بتواند بدون وابستگی به سرورهای ابری، ویدیوها و فایل‌های صوتی خود را از طریق دستورهای متنی جست‌وجو کند.

۰:۰۰ / ۰:۰۰

مهندسان گوگل با الگوبرداری از فناوری تعبیه‌ساز جمنای، ساختاری کاملا ماژولار برای نسخه‌ی جدید تدارک دیده‌اند. توسعه‌دهندگان می‌توانند متناسب با نیاز خود از بخش متنی با ۲۷۰ میلیون پارامتر استفاده کنند یا در صورت نیاز، رمزگذارهای تصویری با ۱۷۰ میلیون پارامتر و صوتی با ۳۰۰ میلیون پارامتر را برای دستیابی به ظرفیت کامل چندوجهی فعال سازند.

پشتیبانی از فناوری یادگیری بازنمایی ماتریوشکا (MRL) به توسعه‌دهندگان اجازه می‌دهد بردارهای خروجی را از ۷۶۸ بعد به ۵۱۲، ۲۵۶ یا حتی ۱۲۸ بعد کاهش دهند. قابلیت یادشده حجم ذخیره‌سازی پایگاه‌های داده‌ی برداری را تا ۶ برابر کوچک‌تر می‌کند.

۰:۰۰ / ۰:۰۰

پنجره‌ی زمینه‌ی مدل به ۸ هزار توکن افزایش یافته که چهار برابر بیشتر از نسل نخست به‌شمار می‌رود. گستردگی ابعاد پردازش به سیستم امکان می‌دهد تا حداکثر ۵٫۵ دقیقه صوت پیوسته، ۲۹ تصویر، ۵۸ فریم ویدیو یا ترکیبی منعطف از آن‌ها را به‌شکل محلی تحلیل کند.

  • ارتقای امتیاز در بنچمارک MTEB Code از ۶۸٫۷۶ به ۷۸٫۶۸ با رشدی معادل ۹٫۹۲ امتیاز
  • کسب رتبه‌ی برتر در بنچمارک صوتی MAEB در رده‌ی مدل‌های زیر یک میلیارد پارامتر
  • عملکرد فراتر از مدل‌های تخصصی با ابعاد دو برابر بزرگ‌تر در پردازش اسناد و ویدیو

توسعه‌دهندگان هم‌اکنون می‌توانند وزن‌های مدل را از پایگاه‌های Hugging Face و Kaggle دریافت کنند. ابزارهای پرکاربردی همچون MediaPipe و LiteRT و کتابخانه‌ی transformers.js بر بستر WebGPU، فریم‌ورک‌های MLX و vLLM و llama.cpp و SGLang و Ollama و پایگاه برداری Qdrant از روز نخست آماده‌ی استقرار این تعبیه‌ساز هستند.

برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.