آموزش‌های پایه‌ای هوش مصنوعی

شتاب‌دهی به Gemma 4: استنتاج سریع‌تر با پیش‌نویس‌های پیش‌بینی چندتوکنی

با استفاده از پیش‌نویس‌های پیش‌بینی چندتوکنی (MTP)، مدل‌های Gemma 4 گلوگاه‌های تأخیر را کاهش داده و پاسخ‌دهی بهبودیافته‌ای را برای توسعه‌دهندگان به ارمغان می‌آورند. گوگل چندی پیش Gemma 4، توانمندترین مدل‌های باز خود را معرفی کردیم. با بیش از ۶۰ میلیون دانلود ت…

5 دقیقه مطالعه
  • پشتیبانی شبکه
  • هوش مصنوعی
  • Gemma
  • مدل
  • MTP
  • گمانه‌زن
  • استفاده
  • مدل‌های
شتاب‌دهی به Gemma 4: استنتاج سریع‌تر با پیش‌نویس‌های پیش‌بینی چندتوکنی

خلاصه تحلیلی خبر

با استفاده از پیش‌نویس‌های پیش‌بینی چندتوکنی (MTP)، مدل‌های Gemma 4 گلوگاه‌های تأخیر را کاهش داده و پاسخ‌دهی بهبودیافته‌ای را برای توسعه‌دهندگان به ارمغان می‌آورند. گوگل چندی پیش Gemma 4، توانمندترین مدل‌های باز خود را معرفی کردیم. با بیش از ۶۰ میلیون دانلود ت…

موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، Gemma، مدل، MTP، گمانه‌زن

با استفاده از پیش‌نویس‌های پیش‌بینی چندتوکنی (MTP)، مدل‌های Gemma 4 گلوگاه‌های تأخیر را کاهش داده و پاسخ‌دهی بهبودیافته‌ای را برای توسعه‌دهندگان به ارمغان می‌آورند.

گوگل چندی پیش Gemma 4، توانمندترین مدل‌های باز خود را معرفی کردیم. با بیش از ۶۰ میلیون دانلود تنها در چند هفته نخست، Gemma 4 در حال ارائه ظرفیت بی‌نظری از هوش به‌ازای هر پارامتر (Intelligence-per-parameter) به توسعه‌دهندگان، دستگاه‌های موبایل و فضای ابری است.

گام بعدی توسعه

گوگل در گام بعدی توسعه خانواده Gemma 4، پیش‌نویس‌گرهای پیش‌بینی چندتوکنی (Multi-Token Prediction drafters) را معرفی کرد. با استفاده از یک معماری تخصصی رمزگشایی گمانه‌زن (Speculative Decoding)، این پیش‌نویس‌گرها تا ۳ برابر افزایش سرعت را بدون هیچ‌گونه افت در کیفیت خروجی یا منطق استدلال ارائه می‌دهند.

شتاب‌دهی به Gemma 4: استنتاج سریع‌تر با پیش‌نویس‌های پیش‌بینی چندتوکنی
افزایش سرعت توکن‌بر‌ثانیه، آزمایش‌شده روی سخت‌افزار با استفاده ازLiteRT-LMMLX، Hugging Face Transformers و vLLM.

چرا رمزگشایی گمانه‌زن؟

واقعیت فنی این است که استنتاج استاندارد مدل‌های زبانی بزرگ محدود به پهنای باند حافظه (Memory-bandwidth bound) است که یک گلوگاه تأخیر قابل‌توجه ایجاد می‌کند. پردازنده بیشترِ زمان خود را صرف انتقال میلیاردها پارامتر از VRAM به واحدهای محاسباتی می‌کند، تنها برای اینکه یک تک‌توکن تولید کند. این امر منجر به عدم استفاده کامل از توان محاسباتی و تأخیر بالا، به‌ویژه در سخت‌افزارهای رده‌مصرف‌کننده (Consumer-grade hardware) می‌شود.

رمزگشایی گمانه‌زن، تولید توکن را از راستی‌آزمایی (Verification) جدا می‌کند. با جفت‌کردن یک مدل هدفِ سنگین (مانند Gemma 4 31B) با یک پیش‌نویس‌گرِ سبک‌وزن (مدل MTP)، می‌توان از توان محاسباتیِ بیکار استفاده کرد تا چندین توکن آینده را به طور هم‌زمان توسط پیش‌نویس‌گر در زمانی کمتر از آنچه مدل هدف برای پردازش تنها یک توکن نیاز دارد، «پیش‌بینی» کرد. سپس، مدل هدف تمامی این توکن‌های پیشنهادی را به‌صورت موازی راستی‌آزمایی می‌کند.

رمزگشایی گمانه‌زن چگونه کار می‌کند

مدل‌های زبانی بزرگ استاندارد، متن را به‌صورت خودهمبسته (Autoregressively) تولید می‌کنند و در هر زمان دقیقاً یک توکن می‌سازند. اگرچه این فرایند مؤثر است، اما همان مقدار از محاسبات را که برای حل یک معمای منطقی پیچیده اختصاص می‌دهد، صرفِ پیش‌بینی یک ادامه بدیهی نیز می‌کند.

رویکرد MTP این ناکارآمدی را از طریق رمزگشایی گمانه‌زن کاهش می‌دهد؛ تکنیکی که توسط پژوهشگران گوگل در مقالهFast Inference from Transformers via Speculative Decodingمعرفی شد. اگر مدل هدف با پیش‌نویس (Draft) موافق باشد، کل توالی را در یک گذرِ روبه‌جلو می‌پذیرد و حتی در این فرایند یک توکن اضافی از خود تولید می‌کند. این بدان معناست که برنامه شما می‌تواند کل توالی پیش‌نویس‌شده به‌علاوه یک توکن را در همان زمانی که معمولاً برای تولید یک تک‌توکن صرف می‌شود، در خروجی ارائه دهد.

گشودن قفل هوش مصنوعی سریع‌تر، از دستگاه‌های لبه تا ایستگاه‌های کاری

برای توسعه‌دهندگان، سرعت استنتاج اغلب گلوگاه اصلی برای استقرار در محیط تولید است. چه در حال ساخت دستیارهای کدنویسی باشید، چه عامل‌های خودمختار که نیازمند برنامه‌ریزی سریعِ چندمرحله‌ای هستند یا برنامه‌های موبایل واکنش‌گرا که کاملاً روی دستگاه اجرا می‌شوند، هر میلی‌ثانیه اهمیت دارد.

با جفت‌کردن یک مدل Gemma 4 با پیش‌نویس‌گر متناظر آن، توسعه‌دهندگان می‌توانند به دستاوردهای زیر برسند

  • پاسخ‌دهی بهبودیافتهتأخیر را برای چت‌های نزدیک به بلادرنگ، برنامه‌های صوتی فراگیر و جریان‌های کاری مبتنی بر عامل به‌شدت کاهش دهید.
  • تقویت توسعه محلیمدل‌های 26B MoE و 31B Dense را روی رایانه‌های شخصی و پردازنده‌های گرافیکی مصرف‌کننده با سرعتی بی‌سابقه اجرا کنید که به جریان‌های کاری پیچیده و بدون‌وقفه کدنویسی آفلاین و مبتنی بر عامل قدرت می‌بخشد.
  • عملکرد بهبودیافته روی دستگاه (On-device)با تولید سریع‌تر خروجی‌ها، کاربرد مدل‌های لبه‌ای یعنی E2B و E4B را روی دستگاه‌های لبه‌ای به حداکثر برسانید که به نوبه خود عمر ارزشمند باتری را حفظ می‌کند.
  • بدون هیچ‌گونه افت کیفیتازآنجایی‌که مدل اصلی Gemma 4 وظیفه راستی‌آزمایی نهایی را بر عهده دارد، شما همان استدلال و دقت در سطح مدل‌های پیشرو را دریافت می‌کنید، با این تفاوت که به طور قابل‌توجهی سریع‌تر ارائه می‌شود.

کجا می‌توانید عمیق‌تر به پیش‌نویس‌گرهای MTP بپردازید

برای اینکه این پیش‌نویس‌گرهای MTP سریع و دقیق باشند، گوگل چندین بهبود معماری را در لایه‌های زیرین معرفی کرده است. مدل‌های پیش‌نویس به طور یکپارچه از فعال‌سازی‌های مدل هدف استفاده کرده و حافظه نهان (KV cache) آن را به اشتراک می‌گذارند، به این معنی که مجبور نیستند زمان خود را برای محاسبه مجدد زمینه‌ای که مدل بزرگ‌تر قبلاً کشف کرده است، هدر دهند. برای مدل‌های لبه‌ای E2B و E4B، جایی که محاسبه نهایی لاجیت (Logit) به یک گلوگاه بزرگ تبدیل می‌شود، یک تکنیک خوشه‌بندی کارآمد در ادغام‌گر (Embedder) پیاده‌سازی شده تا سرعت را افزایش دهد.

شروع به کار

پیش‌نویس‌گرهای MTP برای خانواده Gemma 4 تحت همان مجوز متن‌باز Apache 2.0 مربوط به Gemma 4 در دسترس هستند.مستنداترا بخوانید تا یاد بگیرید چگونه از MTP همراه با Gemma 4 استفاده کنید. می‌توانید وزن‌های مدل (Model weights) را درHugging FaceوKaggleدانلود کرده و آزمایش استنتاج سریع‌تر را با TransformersMLXVLLMSGLangوOllamaآغاز کنید یا آن‌ها را مستقیماً در گالری Google AI Edge برایاندرویدیاiOSامتحان کنید.

برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.