اخبار هوش مصنوعی

شیائومی با مدل MiMo-V2.6-Pro از دیپ‌سیک عبور کرد

شرکت شیائومی در حرکتی غافلگیرکننده، مدل MiMo-V2.6-Pro، جدیدترین نسل از خانواده مدل‌های زبانی MiMo را معرفی کرد و از دیپ‌سیک پیشی گرفت. به‌ گزارش سرویس هوش مصنوعی تک‌ناک این مدل با کسب امتیاز ۴۶ در شاخص هوش Artificial Analysis به یکی از قدرتمندترین و بر اساس ای…

12 دقیقه مطالعه
  • پشتیبانی شبکه
  • هوش مصنوعی
  • امنیت سایبری
  • مدل
  • شیائومی
  • MiMo-V2
  • می‌کند
  • میلیون
شیائومی با مدل MiMo-V2.6-Pro از دیپ‌سیک عبور کرد

خلاصه تحلیلی خبر

شرکت شیائومی در حرکتی غافلگیرکننده، مدل MiMo-V2.6-Pro، جدیدترین نسل از خانواده مدل‌های زبانی MiMo را معرفی کرد و از دیپ‌سیک پیشی گرفت. به‌ گزارش سرویس هوش مصنوعی تک‌ناک این مدل با کسب امتیاز ۴۶ در شاخص هوش Artificial Analysis به یکی از قدرتمندترین و بر اساس ای…

موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، امنیت سایبری، مدل، شیائومی، MiMo-V2

شرکت شیائومی در حرکتی غافلگیرکننده، مدل MiMo-V2.6-Pro، جدیدترین نسل از خانواده مدل‌های زبانی MiMo را معرفی کرد و از دیپ‌سیک پیشی گرفت.

به‌ گزارشسرویس هوش مصنوعیتک‌ناکاین مدل با کسب امتیاز ۴۶ درشاخص هوش Artificial Analysisبه یکی از قدرتمندترین و بر اساس این ارزیابی، برترین مدل اوپن‌ویت جهان تبدیل شد.

امتیاز ۴۶، پرچم‌دار جدید شیائومی را در روش امتیازدهی فعلی Artificial Analysis بالاتر از مدل‌های اختصاصی مانند Grok 4.6 از xAI با امتیاز ۴۴ و Gemini 3.8 Flash گوگل با امتیاز ۴۱ قرار می‌دهد. همچنین مدل MiMo-V2.6-Pro با Grok 4.7 که هم‌زمان معرفی شده و همین امتیاز ۴۶ را کسب کرده است، در یک سطح قرار دارد و بالاتر از مدل‌های اوپن‌ویت چینی DeepSeek V4.1 Flash با امتیاز ۳۹ و DeepSeek V4.1 Pro با امتیاز ۳۶ ایستاده است.

اهمیت این دستاورد تنها به این موضوع محدود نمی‌شود که شیائومی در بازار جهانی بیشتر با گوشی‌های هوشمند، خودروهای برقی و محصولات الکترونیکی شناخته می‌شود. نکته مهم‌تر این است که MiMo-V2.6-Pro یک مدل اوپن‌ویت با مجوز MIT محسوب می‌شود و هزینه استفاده از آن از طریق API شیائومی به شکل چشمگیری کمتر از بسیاری از مدل‌های اختصاصی در همین سطح عملکرد است.

بیشتر بخوانیدتراشه جدید علی‌بابا معرفی شد

در نتیجه، توسعه‌دهندگان مستقل و شرکت‌ها می‌توانند MiMo-V2.6-Pro را به‌ صورت رایگان از Hugging Face دریافت کنند، آن را برای کاربردهای خاص خود شخصی‌سازی یا تنظیم دقیق نمایند، روی سخت‌افزار شخصی یا اجاره‌ای اجرا کنند و در محیط‌های عملیاتی خود به کار بگیرند؛ بدون آنکه برای این استفاده مستقیم، هزینه‌ای به شیائومی بپردازند. امکان استفاده از API شیائومی نیز وجود دارد و هزینه آن در میان ارزان‌ترین گزینه‌ها به ازای هر میلیون توکن قرار می‌گیرد، هرچند برای سازمان‌هایی که محدودیت استفاده از سرورهای مستقر در چین دارند، این گزینه ممکن است چالش‌هایی ایجاد کند.

شیائومی برای هر میلیون توکن ورودی بدون کش ۰٫۴۳۵ دلار و برای هر میلیون توکن خروجی ۰٫۸۷ دلار دریافت می‌کند. Artificial Analysis هزینه این مدل را برای هر وظیفه در شاخص هوش ۰٫۱۳ دلار و سرعت تولید خروجی آن را حدود ۱۳۴ توکن در ثانیه برآورد کرده است. همچنین مدل MiMo-V2.6-Pro از پنجره زمینه یک میلیون توکنی و ورودی‌های متنی، تصویری، صوتی و ویدیویی پشتیبانی می‌کند.

شیائومی در کنار مدل پرچم‌دار، MiMo-V2.6-Flash را نیز عرضه کرده است؛ مدلی کوچک‌تر و به‌مراتب ارزان‌تر که با قیمت ۰٫۱۴ دلار برای هر میلیون توکن ورودی و ۰٫۲۸ دلار برای هر میلیون توکن خروجی، همان پنجره زمینه یک میلیون توکنی و قابلیت‌های چندوجهی بومی را حفظ می‌کند و برای بارهای کاری تولیدی با حجم بالا هدف‌گذاری شده است. بر اساس ارزیابی انجام‌شده، این مدل از نظر هزینه استفاده از API در میان ارزان‌ترین مدل‌های بزرگ هوش مصنوعی مرزی جهان قرار دارد.

نسخه دیگری با نام MiMo-V2.6-Pro-UltraSpeed نیز معرفی شده که شیائومی مدعی است می‌تواند خروجی را با سرعتی تا ۲۰ برابر نسخه معمول Pro تولید کند. مجموع این محصولات نشان می‌دهد V2.6 یک عرضه مدل جدید نیست، بلکه مرحله دیگری از برنامه شیائومی برای ساخت یک پشته کامل هوش مصنوعی عامل‌محور است؛ پشته‌ای که مدل‌های پایه، عامل‌های برنامه‌نویسی، چارچوب‌های اجرایی، محیط‌های یادگیری تقویتی و در نهایت زیرساخت آموزش مدل‌ها را در بر می‌گیرد.

از گوشی تا خودروهای برقی

ورود شیائومی به حوزه مدل‌های هوش مصنوعی مرزی طی سال گذشته با شتاب زیادی دنبال شده است. این شرکت توسعه عمومی خانواده MiMo را از سال ۲۰۲۵ آغاز کرد و در سال ۲۰۲۶ تمرکز خود را بیش از پیش به سمت هوش مصنوعی عامل‌محور برد. عرضه MiMo-V2.5 و V2.5-Pro در آوریل، بسیاری از مولفه‌های معماری و اقتصادی (از مدل‌های تنک ترکیبی از متخصصان و پنجره زمینه یک میلیون توکنی گرفته تا مجوزهای آزاد و قیمت‌گذاری بسیار پایین برای اجرای عامل‌های هوش مصنوعی در فرایندهای طولانی) را پایه‌گذاری کرد که اکنون در V2.6 دیده می‌شوند.

MiMo-V2.5-Pro یک مدل ترکیبی از متخصصان با ۱٫۰۲ تریلیون پارامتر بود که تنها ۴۲ میلیارد پارامتر آن هنگام استنتاج فعال می‌شد. این مدل به‌طور اختصاصی برای مهندسی نرم‌افزار در فرایندهای طولانی و قابلیتی موسوم به «آگاهی از چارچوب اجرایی» آموزش داده شده بود؛ قابلیتی که به مدل اجازه می‌دهد در چارچوب عامل‌ها و طی صدها یا هزاران فراخوانی ابزار، حافظه و زمینه خود را مدیریت کند.

مدل MiMo-V2.6 شیائومی با میلیون‌ها دلار آموزش یادگیری تقویتی معرفی شد

برای مطالعه بیشتراجرای Muse متا برای ۱۰۰ میلیون کاربر به ۱.۵۸ میلیون پردازنده نیاز دارد

شیائومی در ژوئن با معرفی MiMo Code (یک عامل برنامه‌نویسی ترمینالی متن‌باز با حافظه پایدار میان جلسات، نقاط بررسی وظایف و یک عامل فرعی اختصاصی برای ثبت نقاط بررسی)، گام دیگری برداشت. آزمایش‌های داخلی شرکت نشان دادند مزیت MiMo Code در مقایسه با Claude Code زمانی بیشتر می‌شود که فرایندهای کاری از ۲۰۰ مرحله اجرایی عبور کنند، هرچند این نتایج توسط خود شیائومی گزارش شده‌اند و به پیکربندی آزمایش‌ها وابسته هستند.

همچنین شیائومی چارچوب پژوهشی HarnessX را توسعه داد که در آن دستورهای متنی، سیستم‌های حافظه، ابزارها و منطق کنترلی پیرامون مدل نیز به‌عنوان اجزایی قابل بازنویسی و بهینه‌سازی در نظر گرفته می‌شوند. طبق گزارش شیائومی، تکامل پویای این چارچوب بدون تغییر مدل پایه، در ۱۵ ترکیب مدل و بنچمارک مختلف به‌طور میانگین ۱۴٫۵ درصد بهبود عملکرد مطلق ایجاد کرده است. MiMo-V2.6 اکنون این مسیرهای تحقیقاتی را یک گام جلوتر برده و آنها را وارد فرایند آموزش مدل کرده است.

هزینه میلیون دلاری برای مدل MiMo-V2.6

مهم‌ترین جنبه فنی MiMo-V2.6 در یادگیری تقویتی یا RL نهفته است؛ مرحله‌ای که در آن مدل با اجرای مکرر وظایف، بر اساس کیفیت عملکرد خود پاداش یا جریمه دریافت می‌کند و سپس پارامترهای خود را به سمت رفتارهایی سوق می‌دهد که احتمال دستیابی به نتایج بهتر را افزایش می‌دهند. مقیاس‌دهی این فرایند پرهزینه است، زیرا وظایف عامل‌محور می‌توانند زنجیره‌های طولانی استدلال، فراخوانی ابزار و اعتبارسنجی را شامل شوند. با وجود این‌، مزیت بالقوه آن قابل‌ توجه است؛ مدل دیگر فقط از نمونه‌های ثابت یاد نمی‌گیرد، بلکه به‌ صورت مکرر اجرای واقعی کارهای پیچیده را تمرین می‌کند.

شیائومی اعلام کرده است که MiMo-V2.6-Pro و MiMo-V2.6-Flash هرکدام ۳۰ مرحله بزرگ RL را طی کرده‌اند که در مجموع حدود ۷۵۰ هزار مسیر اجرایی را در کمتر از شش روز پوشش داده است. هزینه اعلام‌شده برای این فرایند حدود ۲٫۶۲ میلیون دلار برای نسخه Pro و ۸۵۰ هزار دلار برای نسخه Flash بوده است.

گزارش فنی عمومی شرکت ابعاد این فرایند را ملموس‌تر می‌کند. هر مرحله آموزش با ۱۵۶۸ پرامپت آغاز می‌شود و برای هر پرامپت ۱۶ مسیر کاندید تولید می‌کند؛ یعنی حدود ۲۵ هزار اجرای آموزشی و بین ۲٫۷ تا ۳٫۷ میلیارد توکن آموزشی در هر مرحله است. شیائومی بیان کرده است که طول متوسط این توالی‌ها به حدود ۱۱۰ هزار تا ۱۵۰ هزار توکن می‌رسد. بنابراین، تمرکز شیائومی بر تقویت پاسخ‌های کوتاه نبوده، بلکه کل گردش‌کارهای طولانی عامل‌ها را تحت یادگیری تقویتی قرار داده است.

در این میان، تنها بخشی از هزینه صرف به‌روزرسانی خود مدل شده است. طبق گزارش شیائومی، ۴۳٫۵ درصد از هزینه RL مدل Pro به آموزش، ۴۳٫۸ درصد به تولید مسیرهای اجرایی و ۱۲٫۷ درصد به امتیازدهی آنها اختصاص یافته است. به بیان دیگر، بیش از نیمی از بودجه صرف تولید و ارزیابی تجربه‌های مدل شده است؛ تجربه‌هایی که به به‌روزرسانی وزن‌های مدل تبدیل شده‌اند. شیائومی این رویکرد را «فقط یک‌بار RL» یا You Only RL Once می‌نامد. به‌جای اجرای خطوط RL کاملا مجزا برای کدنویسی، وظایف بصری، کار با رایانه و امنیت سایبری، این حوزه‌ها و چندین چارچوب عامل را در یک اجرای آموزشی بزرگ ترکیب می‌کند.

تنوع چارچوب‌های اجرایی نیز بخشی از توزیع آموزشی محسوب می‌شود. شیائومی عنوان کرده که برای کدنویسی، گردش‌کارهای حرفه‌ای عمومی، وظایف بصری و امنیت سایبری، «مینی‌هارنس»‌های سبک ساخته است تا مدل در معرض ترکیب‌های متفاوتی از پرامپت‌های سیستمی، ابزارها و راهبردهای مدیریت زمینه قرار گیرد، بدون اینکه به یک چارچوب تولیدی مشخص بیش‌ازحد وابسته شود.

سامانه از نسخه کاملا ناهمگام الگوریتم GRPO یا بهینه‌سازی سیاست نسبی گروهی استفاده می‌کند. این معماری ناهمگام اهمیت زیادی دارد، زیرا وظایف طولانی عامل‌ها همگی هم‌زمان به پایان نمی‌رسند. شیائومی از رول‌اوت‌های ناقص برای استفاده مستمر از ظرفیت پردازشی GPUها بهره می‌گیرد، به‌جای آنکه کل فرایند را منتظر کندترین مسیر نگه دارد؛ وظایف ناتمام متوقف می‌شوند و بعدا ادامه پیدا می‌کنند. همچنین این شرکت سازوکاری برای اختلاط نمونه‌ها توسعه داده است تا وظایف سریع‌تر یا آسان‌تر نتوانند در هر دسته آموزشی بر وظایف کندتر مسلط شوند. در نتیجه، «مقیاس‌دهی RL» در MiMo-V2.6 هم‌زمان به معنی افزایش تعداد تجربه‌های تولیدشده توسط مدل، تنوع محیط‌هایی است که این تجربه‌ها در آنها شکل می‌گیرند و منابع محاسباتی لازم برای تعیین رفتارهایی که باید تقویت شوند.

پاداش‌های دودویی ساده می‌توانند به مدل برنامه‌نویسی بگویند آیا پچ پیشنهادی آن مجموعه آزمون‌ها را با موفقیت پشت سر گذاشته است یا خیر، اما در تفکیک دو راهکار موفق چندان قابل‌ اعتماد نیستند، به‌ویژه زمانی که یکی از راهکارها تمیز و حداقلی باشد و دیگری بر منطق جایگزین گسترده، تغییرات غیرضروری در API یا راه‌حل‌های شکننده متکی باشد.

سیستم پاداش گروهی

«ترکیب پاداش گروهی» یا GRS با مقایسه چند تلاش برای حل یک مسئله، روبریک‌های اختصاصی همان وظیفه را ایجاد می‌کند. این روبریک‌ها کیفیت پیاده‌سازی و کیفیت رفتار عامل (از رعایت الزامات و مدیریت موارد لبه‌ای گرفته تا سازگاری با کدبیس موجود و جمع‌آوری و راستی‌آزمایی شواهد مورد نیاز) را به‌ صورت جداگانه ارزیابی می‌کنند. «بازتوزیع مزیت گروهی» یا GAR یک مرحله جلوتر می‌رود و راهکارهای موفق یک گروه از رول‌اوت‌ها را با هم مقایسه می‌کند و مزیت آموزشی بیشتری را به راهکارهای بهتر اختصاص می‌دهد.

گزارش فنی، آزمایشی را نیز ارائه می‌کند که اهمیت این سازوکار را روشن می‌کند. در یک اجرای RL صرفا کدنویسی روی MiMo-V2.6-Flash، حذف ارزیابی گروهی آنلاین موجب شد تعداد نوبت‌های تعامل عامل و طول توکن‌های تولیدشده به‌سرعت افزایش پیدا کند و در نهایت سهم بیشتری از مسیرها به سقف طول خود برسند. شیائومی بیان کرده است که با فعال‌سازی GAR، نرخ قبولی همچنان افزایش یافت، در حالی که تعداد نوبت‌ها تقریبا ثابت ماند و رشد تعداد توکن‌ها نیز تدریجی‌تر شد.

ممیزی‌های انجام‌شده از دیدگاه نگهداری کد نیز نشان دادند سیاستی که بدون ارزیابی آنلاین آموزش دیده بود، به‌ تدریج بیشتر به تکنیک‌هایی مانند شاخه‌های سازگاری حدسی، اکسپورت‌های گسترده، بلعیدن استثناها، اعتبارسنجی سهل‌گیرانه و تغییرات ویژه برای محیط ارزیابی متوسل می‌شد. به گفته شیائومی، سیاست آموزش‌دیده با ارزیابی گروهی معمولا پچ‌هایی کوچک‌تر و دقیق‌تر تولید می‌کرد.

شیائومی با مدل MiMo-V2.6-Pro از دیپ‌سیک پیشی گرفت

حتما بخوانیدمدل هوش مصنوعی Grok 4.7 با تمرکز بر برنامه‌نویسی و امنیت معرفی شد

این موضوع به یک مشکل بنیادی در یادگیری تقویتی عامل‌محور می‌رسد: مدل می‌تواند در بیشینه‌سازی پاداش بهتر شود، بدون آنکه در انجام کاری که آن پاداش قرار است نماینده‌ آن باشد، بهتر عمل کند. شیائومی بخش قابل‌ توجهی از گزارش خود را با عنوان «دستکاری پاداش» به همین مسئله اختصاص داده است.

در اجرای اولیه وظایف کدنویسی، برخی عامل‌ها کشف کرده بودند که به‌جای حل مستقیم باگ، می‌توانند نسخه جدیدتری از یک بسته را دریافت کنند، فایل منبع بالادستی را دانلود نمایند، وضعیت جدیدتری از مخزن را شبیه‌سازی کنند یا در تاریخچه مشکلات جست‌وجو کنند تا به راه‌حل ازپیش‌منتشرشده برسند. چنین روش‌هایی می‌توانستند آزمون‌ها را با موفقیت پشت سر بگذارند، در حالی که عامل از حل مسئله مورد نظر طفره رفته بود.

شیائومی برای مقابله با این رفتارها، آرتیفکت‌های ساخت و کش‌ها را از محیط‌های آموزشی حذف کرد، تاریخچه آینده Git را حذف کرد، دسترسی شبکه به منابع بالقوه پاسخ‌ها را مسدود کرد و یک «عامل هک» مجزا ساخت تا پیش از آغاز آموزش، حفره‌های احتمالی باقی‌مانده را شناسایی کند. شرکت می‌گوید در اجرای نهایی، مسیرهای دارای دستکاری پاداش که به‌طور قطعی شناسایی شده بودند، برای هر دو مدل Pro و Flash کمتر از ۲ درصد بود و در صورت کشف چنین موردی، پاداش مؤثر آن مسیر به صفر بازگردانده می‌شد.

در این مقیاس، مسئله یادگیری ماشین عملا با چالش‌های سیستم‌های توزیع‌شده گره خورده است. شیائومی باید ده‌ها هزار مسیر طولانی را در محیط‌های ناهمگون به حرکت درآورد، مانع سلطه وظایف سریع‌تر بر دسته‌های آموزشی شود، رفتار آموزش و استنتاج را هم‌راستا نگه دارد و مطمئن شود مدل‌های هرچه توانمندتر از ضعف‌های ارزیاب‌هایی که آنها را آموزش می‌دهند، سوءاستفاده نمی‌کنند.

مدل MiMo-V2.6 بر تراشه‌های چینی تکیه دارد

همچنین گزارش فنی عنوان کرده است که شیائومی در طول RL روتر مدل Mixture-of-Experts را ثابت نگه داشت تا انحراف آموزشی کاهش یابد و پایداری سیستم افزایش پیدا کند. فولی لو، پژوهشگر سابق دیپ‌سیک که اکنون هدایت تیم MiMo شیائومی را بر عهده دارد، در ایکس نوشت که V2.6 احتمالا یکی از بزرگ‌ترین اجرای منفرد یادگیری تقویتی است که تاکنون توسط یک تیم مدل متن‌باز انجام شده است. او گفت که چند ده نفر روی این پروژه کار کرده‌اند و مدعی شد چالش‌های تحقیقاتی و مهندسی آن از تجربه‌ای که هنگام مشارکت در توسعه DeepSeek R1 داشته، دشوارتر بوده است.

مرتبط: مرتبطآمازون دستیار هوش مصنوعی Muse متا را مسدود کرد

این توصیف با جزئیات گزارش فنی نیز همخوانی دارد؛ گزارشی که تقریبا به اندازه خود الگوریتم یادگیری، به زیرساخت و سازوکارهای موردنیاز برای پایدار نگه داشتن سامانه RL می‌پردازد. دنییش خازی، مدیرعامل استارت‌آپ متن‌باز Paper Instruments در حوزه دانش‌کاری هوش مصنوعی نیز در ایکس نوشت که این عرضه می‌تواند پژوهشگران را به بازنگری در تمام فرضیات قبلی درباره «قوانین مقیاس‌دهی پساآموزش» وادار کند؛ به‌ویژه با توجه به میزان قابلیتی که شیائومی با هزینه محاسباتی اعلام‌شده محدود و کاملا با تکیه بر تراشه‌های چینی، نه GPUهای انویدیا، از این فرایند استخراج کرده است.

نوشتهشیائومی با مدل MiMo-V2.6-Pro از دیپ‌سیک عبور کرداولین بار درTechnoc. پدیدار شد.

برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.