اخبار هوش مصنوعی

سیستم خانگی ۴۰ هزار دلاری DeepSeek V4.1-Flash را با سرعت بالا اجرا کرد

مدل ۵۵۲ میلیارد پارامتری DeepSeek V4.1-Flash روی چهار NVIDIA DGX Spark با سرعت ۴۹۴ توکن بر ثانیه اجرا شد . هوش مصنوعی تک‌ناک در همین راستا، مدل DeepSeek V4.1-Flash با ۵۵۲ میلیارد پارامتر اخیراً هنگام اجرا روی یک سیستم خانگی متشکل از چهار دستگاه NVIDIA DGX Spar…

5 دقیقه مطالعه
  • پشتیبانی شبکه
  • هوش مصنوعی
  • Spark
  • DGX
  • استفاده
  • دستگاه
  • ثانیه
  • سیستم
سیستم خانگی ۴۰ هزار دلاری DeepSeek V4.1-Flash را با سرعت بالا اجرا کرد

خلاصه تحلیلی خبر

مدل ۵۵۲ میلیارد پارامتری DeepSeek V4.1-Flash روی چهار NVIDIA DGX Spark با سرعت ۴۹۴ توکن بر ثانیه اجرا شد . هوش مصنوعی تک‌ناک در همین راستا، مدل DeepSeek V4.1-Flash با ۵۵۲ میلیارد پارامتر اخیراً هنگام اجرا روی یک سیستم خانگی متشکل از چهار دستگاه NVIDIA DGX Spar…

موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، Spark، DGX، استفاده، دستگاه

مدل۵۵۲میلیارد پارامتریDeepSeek V4.1-Flashروی چهارNVIDIA DGX Sparkبا سرعت۴۹۴توکن بر ثانیه اجرا شد.

هوش مصنوعیتک‌ناکدر همین راستا، مدل DeepSeek V4.1-Flash با ۵۵۲ میلیارد پارامتر اخیراً هنگام اجرا روی یک سیستم خانگی متشکل از چهار دستگاه NVIDIA DGX Spark، به سرعت استنتاجی نزدیک به سطح سیستم‌های Cerebras دست پیدا کرده است.

خوشه چهارگرهی NVIDIA DGX Spark بدون استفاده از روتر نوری یا سوئیچ اترنت توانست به حداکثر سرعت خروجی نزدیک به ۵۰۰ توکن بر ثانیه دست پیدا کند.

پاتریک مورهد، کارشناس فناوری و متخصص باسابقه صنعت AMD، اخیراً از سیستم هوش مصنوعی خانگی خود رونمایی کرده است.

این سیستم از چهار دستگاه NVIDIA DGX Spark تشکیل شده که در مجموع حدود ۵۱۲ گیگابایت حافظه یکپارچه در اختیار دارند.

مورهد این چهار دستگاه را درون یک رک کامپکت tec MOJO روی هم قرار داده و در قسمت زیرین آن نیز فن‌های خنک‌کننده اضافی نصب کرده است.

مشخصات سخت‌افزاری چهار دستگاه DGX Spark

تصویری از DeepSeek V4.1-Flash

هر دستگاه NVIDIA DGX Spark مورد استفاده در این سیستم شامل اجزای زیر است

  • پردازنده ۲۰ هسته‌ای Arm شامل ۱۰ هسته قدرتمند Cortex-X925 و ۱۰ هسته کم‌مصرف Cortex-A725. هر هسته حافظه کش L2 اختصاصی دارد و هر خوشه نیز به ۱۶ مگابایت کش L3 مجهز است که در مجموع ۳۲ مگابایت کش L3 را فراهم می‌کند.
  • پردازنده گرافیکی مجتمع GB10 مجهز به هسته‌های Tensor نسل پنجم، پشتیبانی از DLSS 4 و هسته‌های RTX برای رهگیری پرتو. این تراشه حداکثر ۳۱ ترافلاپس توان پردازشی FP32 و ۱۰۰۰ تریلیون عملیات بر ثانیه یا TOPS در محاسبات NVFP4 یا FP4 ارائه می‌دهد.
  • حافظه یکپارچه و منسجم ۱۲۸ گیگابایتی LPDDR5X که میان پردازنده و پردازنده گرافیکی به اشتراک گذاشته می‌شود و پهنای باند حدود ۲۷۳ گیگابایت بر ثانیه دارد. این حافظه از رابط ۲۵۶ بیتی استفاده می‌کند.
  • شبکه‌ساز هوشمند ConnectX-7 با دو درگاه QSFP با سرعت ۲۰۰ گیگابیت بر ثانیه برای ایجاد خوشه‌های پرسرعت، به‌همراه اترنت ۱۰ گیگابیتی، Wi-Fi 7، بلوتوث، HDMI 2.1a و چند درگاه USB-C.
  • حافظه ذخیره‌سازی NVMe SSD با ظرفیت معمول ۱ تا ۴ ترابایت.
  • مصرف برق حدود ۱۴۰ تا ۲۴۰ وات با آداپتور .
  • سیستم‌عامل NVIDIA DGX OS مبتنی بر Ubuntu و مجموعه کامل نرم‌افزارهای هوش مصنوعی CUDA.

نکته مهم درباره این سیستم، نحوه اتصال چهار دستگاه DGX Spark به یکدیگر است. این دستگاه‌ها بدون استفاده از سوئیچ و از طریق کابل‌های QSFP در قالب یک توپولوژی حلقه‌ای به یکدیگر متصل شده‌اند.

در این ساختار، Spark 1 به Spark 2 و Spark 4 متصل است. Spark 2 به Spark 1 و Spark 3 متصل می‌شود. Spark 3 نیز به Spark 2 و Spark 4 متصل است و Spark 4 به Spark 3 و Spark 1 ارتباط دارد.

البته NVIDIA برای اتصال چهار دستگاه DGX Spark استفاده از یک سوئیچ ۲۰۰ گیگابیتی اترنت و توپولوژی ستاره‌ای را توصیه می‌کند. استفاده از سوئیچ، هزینه نهایی چنین سیستمی را افزایش می‌دهد.

بیشتر بخوانیدنتایج یک آزمایش فنی ادعای ارزان‌تر بودن دیپ‌سیک را رد کرد

DeepSeek V4.1-Flashچگونه روی این سیستم اجرا شد؟

مورهد برای این خوشه چهارگرهی، مدل کم‌مصرف DeepSeek V4.1-Flash را انتخاب کرده است. این مدل ۵۵۲ میلیارد پارامتر دارد، اما در مرحله پیش‌پردازش فقط ۸ میلیارد پارامتر و در مرحله رمزگشایی ۱۶ میلیارد پارامتر فعال هستند.

این مدل همچنین یک متخصص اشتراکی و ۳۸۴ متخصص مسیریابی‌شده دارد که از میان آن‌ها ۶ متخصص فعال می‌شوند.

دیپ‌سیک در معماری جدید خود از چند فناوری مختلف مانند رمزگذار-رمزگشای علّی (CED)، توجه تنک فشرده ۲ (CSA2)، کوانتیزه‌سازی FP4 و SWA Bounded Replay استفاده کرده است. این فناوری‌ها اندازه حافظه کش KV را به تنها ۸۹۰ بایت برای هر توکن کاهش می‌دهند.

ترکیب مدل DeepSeek V4.1-Flash با خوشه چهارگرهی NVIDIA DGX Spark نتایج قابل‌توجهی به همراه داشته است

  • حداکثر سرعت خروجی: ۴۹۴ توکن بر ثانیه در کدنویسی با ۳۲ درخواست هم‌زمان
  • حداکثر سرعت تولید متن: ۲۸۰ توکن بر ثانیه با ۳۲ درخواست هم‌زمان
  • سرعت در یک درخواست: حدود ۵۸ توکن بر ثانیه برای متن و ۹۶ توکن بر ثانیه برای کد
  • سرعت پردازش پرامپت: حدود ۴۷۶۴ توکن بر ثانیه
  • زمان تولید نخستین توکن: حدود ۰.۲ ثانیه در حالت بیکار
  • حجم استفاده از حافظه: ۴۷۶ گیگابایت

بیشتر بخوانید‌هشدار مهندس دیپ‌سیک درباره آینده هوش مصنوعی

هزینه ساخت سیستم خانگیDeepSeek

از نظر هزینه، قیمت هر دستگاه NVIDIA DGX Spark با ۱۲۸ گیگابایت حافظه در حال حاضر بسته به ظرفیت ذخیره‌سازی و میزان موجودی، بین ۵۵۰۰ تا بیش از ۹۰۰۰ دلار است.

بنابراین هزینه بخش اصلی این سیستم برای چهار دستگاه حدود ۲۲ تا ۳۶ هزار دلار خواهد بود.

کابل‌های QSFP برای ایجاد توپولوژی حلقه‌ای چند صد دلار هزینه دارند. رک یا قفسه، فن‌های اضافی، تجهیزات توزیع برق و سایر تجهیزات جانبی نیز چند صد دلار دیگر به هزینه اضافه می‌کنند.

در مجموع، هزینه ساخت چنین سیستمی حدود ۲۵ تا ۴۰ هزار دلار خواهد بود. اگرچه این رقم بالا است، چنین سیستمی می‌تواند به‌صورت شبانه‌روزی مورد استفاده قرار گیرد و هزینه برق آن نسبتاً محدود باشد.

طبق متن، هر دستگاه هنگام بار کاری حدود ۴۰۰ تا ۶۰۰ وات مصرف می‌کند. در مقابل، استفاده از این سیستم کاربر را از هزینه‌های API و محدودیت‌های بار پردازشی سرویس‌هایی مانند OpenAI یا آنتروپیک مستقل می‌کند.

نوشتهسیستم خانگی ۴۰ هزار دلاری DeepSeek V4.1-Flash را با سرعت بالا اجرا کرداولین بار درTechnoc. پدیدار شد.

برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.