ابزارهای هوش مصنوعی

خانواده Gemma 4؛ کارآمدترین مدل‌های متن‌باز به‌ازای هر بایت

گوگل DeepMind چهار مدل زبانی بزرگ استنتاجی جدید با قابلیت پردازش بینایی و تحت لایسنس Apache 2.0 را در اندازه‌های ۲، ۴ و ۳۱ میلیارد پارامتری به همراه یک مدل با معماری «ترکیب متخصصان» یا MoE (Mixture-of-Experts) با پیکربندی 26B-A4B معرفی کرده است. گوگل دسترسی AP…

2 دقیقه مطالعه
  • پشتیبانی شبکه
  • هوش مصنوعی
  • پردازش
  • مدل
  • Gemma
  • مانند
  • هستند
  • گوگل
خانواده Gemma 4؛ کارآمدترین مدل‌های متن‌باز به‌ازای هر بایت

خلاصه تحلیلی خبر

گوگل DeepMind چهار مدل زبانی بزرگ استنتاجی جدید با قابلیت پردازش بینایی و تحت لایسنس Apache 2.0 را در اندازه‌های ۲، ۴ و ۳۱ میلیارد پارامتری به همراه یک مدل با معماری «ترکیب متخصصان» یا MoE (Mixture-of-Experts) با پیکربندی 26B-A4B معرفی کرده است. گوگل دسترسی AP…

موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، پردازش، مدل، Gemma، مانند

گوگل DeepMind چهار مدل زبانی بزرگ استنتاجی جدید با قابلیت پردازش بینایی و تحت لایسنس Apache 2.0 را در اندازه‌های ۲، ۴ و ۳۱ میلیارد پارامتری به همراه یک مدل با معماری «ترکیب متخصصان» یا MoE (Mixture-of-Experts) با پیکربندی 26B-A4B معرفی کرده است.

گوگل دسترسی API به دو مدل بزرگ‌تر Gemma را از طریق پلتفرم AI Studio خود فراهم کرده است و همچنین وزن‌های آن در پلتفرم‌هایی مانند Kaggle، Ollama و HuggingFace در دسترس و قابل‌دانلود هستند و می‌توان آن‌ها به‌صورت آفلاین و بدون نیاز به اینترنت به کمک ابزارهای اجرای لوکال LLM مانند Ollama و LM Studio اجرا کرد.

این پیکربندی سبب شده تا نسخه‌های مخصوص مویابل و سبک این خانواده دارای پنجره زمینه ۱۲۸ هزار توکنی و نسخه‌های سنگین آن پنجره زمینه ۲۵۶ هزار توکنی داشته باشند که این امکان را به Gemma 4 می‌دهد که درخواست‌های بسیار طولانی را در یک مرتبه پردازش کند.

گوگل به سطح بی‌سابقه‌ای از «هوش به‌ازای هر پارامتر» (Intelligence-per-parameter) دست یافته نشان می‌دهد توسعه مدل‌های کوچک و کاربردی در حال حاضر یکی از داغ‌ترین حوزه‌های پژوهشی در هوش مصنوعی است. DeepMind بر پایه تحقیقات و مطالعات Gemini، در واقع دو مدل کوچک‌تر را با عناوین E2B و E4B نام‌گذاری کرده‌اند که حرف E مخفف اندازه پارامتر «مؤثر» (Effective) است.

علاوه بر اینکه Gemma 4 توانایی درک بیش از ۱۴۰ زبان را دارد، یکی از ویژگی‌های جالب این مدل‌ها این است که آن‌ها فراتر از صرفاً پردازش تصاویر، چندوجهی (Multi-modal) هستند. تمامی مدل‌ها به‌صورت بومی ویدئو و تصاویر را پردازش می‌کنند، از وضوح‌های متغیر پشتیبانی می‌کنند و در وظایف بصری مانند تشخیص نوری نویسه‌ها (OCR) و درک نمودارها عملکردی عالی دارند. علاوه بر این، مدل‌های E2B و E4B دارای قابلیت دریافت ورودی صوتی بومی برای تشخیص و درک گفتار هستند.»

برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.