سخت افزار

یک مدل هوش مصنوعی کوچک روی RTX 3080 Ti بازی Pokémon Red را یاد گرفت

یک مدل هوش مصنوعی با ۱۲.۵ میلیون پارامتر، با استفاده از کارت گرافیک RTX 3080 Ti، بازی پوکمون رد را یاد گرفت و توانست Squirtle را به عنوان پوکمون آغازین انتخاب کند. سخت افزار تکناک، تکناک، توسعه‌دهنده‌ای با نام مستعار stmonty، مدلی کوچک از هوش مصنوعی را روی یک…

5 دقیقه مطالعه
  • پشتیبانی شبکه
  • هوش مصنوعی
  • مدل
  • بازی
  • انتخاب
  • آموزش
  • پروژه
  • stmonty
یک مدل هوش مصنوعی کوچک روی RTX 3080 Ti بازی Pokémon Red را یاد گرفت

خلاصه تحلیلی خبر

یک مدل هوش مصنوعی با ۱۲.۵ میلیون پارامتر، با استفاده از کارت گرافیک RTX 3080 Ti، بازی پوکمون رد را یاد گرفت و توانست Squirtle را به عنوان پوکمون آغازین انتخاب کند. سخت افزار تکناک، تکناک، توسعه‌دهنده‌ای با نام مستعار stmonty، مدلی کوچک از هوش مصنوعی را روی یک…

موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، مدل، بازی، انتخاب، آموزش

یک مدل هوش مصنوعی با ۱۲.۵ میلیون پارامتر، با استفاده از کارت گرافیک RTX 3080 Ti، بازی پوکمون رد را یاد گرفت و توانست Squirtle را به عنوان پوکمون آغازین انتخاب کند.

سخت افزارتکناک، تکناک، توسعه‌دهنده‌ای با نام مستعار stmonty، مدلی کوچک از هوش مصنوعی را روی یککارت گرافیک RTX 3080 Tiآموزش داده تا در بازی Pokémon Red یک پوکمون آغازین انتخاب کند. این مدل در نهایت توانست از یک فایل ذخیره بازی، Squirtle را انتخاب کند. هرچند هنوز نمی‌تواند بازی را از ابتدا آغاز کند یا تا پایان پیش ببرد، نتیجه نشان می‌دهد که حتی مدل‌های نسبتاً کوچک نیز می‌توانند برای انجام وظایفی مشخص آموزش ببینند.

stmonty در نوشته‌ای با عنوان «Teaching a World Model to Play Pokémon» روند این پروژه را شرح داده است. مدل مورد استفاده از نوع مدل جهانی است و بر پایه پژوهش LeWorldModel ساخته شده؛ پژوهشی که Yann LeCun، دانشمند شناخته‌شده حوزه هوش مصنوعی، در نگارش آن مشارکت داشته است. LeCun سال گذشته از Meta جدا شد تا از طریق شرکت AMI Labs روی توسعه مدل‌های جهانی کار کند.

انتشار کد پروژه به‌صورت متن‌باز

مدل stmonty حدود ۱۲.۵ میلیون پارامتر دارد و در ۲۰ سپتامبر معرفی شد. انتخاب مدلی کوچک بخشی از هدف پروژه بود، زیرا توسعه‌دهنده می‌خواست آن را به‌صورت محلی و روی یک کارت گرافیک مصرف‌کننده آموزش دهد. او این کار را راهی برای یادگیری و سرگرمی توصیف کرده است. کد پروژه نیز به‌صورت متن‌باز با نام lePokeRed در GitHub منتشر شده و برای اجرای آن استفاده از پردازنده گرافیکی سازگار با CUDA توصیه می‌شود.

مدل باید از راه مشاهده صفحهبازی Pokémon Redیاد می‌گرفت که فشردن هر دکمه چه نتیجه‌ای دارد. برای این کار، به جای پیش‌بینی کامل تصویر بعدی، از خلاصه‌ای فشرده شامل ۱۹۲ عدد استفاده می‌کند. در مرحله نخست آموزش، مدل هیچ پاداشی دریافت نمی‌کند و از شرایط پیروزی یا هدف نهایی آگاه نیست. اهداف زمانی وارد فرایند می‌شوند که مدل شروع به برنامه‌ریزی می‌کند.

یک کارت گرافیک NVIDIA RTX 3080 Ti Engineering Sample داخل جعبه مشکی و روی پس‌زمینه تیره نمایش داده شده است.

این ساختار با پژوهشی منتشرشده در مارس ۲۰۲۶ هم‌راستا است. آن پژوهش یک مدل JEPA با حدود ۱۵ میلیون پارامتر را شرح می‌دهد که می‌توان آن را روی یک پردازنده گرافیکی آموزش داد. اندازه و شیوه اجرای آن نیز تفاوت زیادی با پروژه stmonty ندارد.

فرآیند آموزش با فریم‌های سیاه‌وسفید

آموزش مدل با ۴۲۳۸۲ فریم سیاه‌وسفید انجام شد که در بیش از هزار اجرای کوتاه گردآوری شده بودند. نقطه آغاز همه این اجراها، فایلی ذخیره‌شده در آزمایشگاه Professor Oak بود. داده‌های آموزشی تنها شامل مسیرهای از پیش تعیین‌شده نبودند و مسیرهای مشابه با فشردن تصادفی دکمه‌ها و همچنین گشت‌وگذار بی‌هدف را هم در بر می‌گرفتند.

افزودن داده‌های تصادفی اهمیت داشت، چون مدلی که فقط مسیرهای تمیز و تکرارشونده را ببیند، ممکن است ارتباطی نادرست میان دکمه‌ها و اتفاقات بازی برقرار کند. برای نمونه، اگر هر بار با نمایش یک کادر گفتگو دکمه A فشرده شود، مدل ممکن است هرگز یاد نگیرد که دکمه B در همان موقعیت چه کاری انجام می‌دهد. مدل پروژه نیز از ابتدا و بدون استفاده از مدلی آماده آموزش داده شد.

در مرحله برنامه‌ریزی، مدل دنباله‌ای شامل ۱۴ بار فشردن دکمه را می‌سازد و آن را در خود مدل امتحان می‌کند، نه در بازی اصلی. در هر دور، ۵۱۲ برنامه احتمالی بررسی می‌شوند. فرایند جست‌وجو از هر هشت برنامه یکی را نگه می‌دارد و در نتیجه، ۶۴ گزینه برای ادامه باقی می‌ماند. این روند تا انتخاب برنامه نهایی ادامه پیدا می‌کند و سپس همان برنامه در شبیه‌ساز بازی اجرا می‌شود.

نخستین تلاش موفق نبود و شخصیت بازی بدون پوکمون باقی ماند. stmonty احتمال می‌دهد بخشی از مشکل به انباشته شدن خطاها مربوط باشد: مدل پیش‌بینی‌های خود را مبنای پیش‌بینی‌های بعدی قرار می‌دهد و اشتباه‌های کوچک ممکن است در ادامه بزرگ‌تر شوند. پس از تنظیم دقیق‌تر مدل، تلاش بعدی نتیجه داد و Squirtle انتخاب شد.

اهمیت داده‌های آموزشی تصادفی

به‌نوشتهتامز هاردوردر بیش از ۱۰۰ اجرای بعدی که همگی از همان فایل ذخیره شروع شدند، ۵۲ برنامه توانستند یک پوکمون آغازین انتخاب کنند. در مقایسه، فشردن تصادفی دکمه‌ها هیچ‌بار به انتخاب پوکمون منجر نشد و مدل آموزش‌ندیده فقط یک‌بار موفق شد. با این حال، فشردن مکرر دکمه A از همان فایل ذخیره نیز از قبل نتیجه می‌داد. هدف اصلی پروژه، رسیدن مدل به راه‌حل به‌صورت مستقل بود، نه صرفاً انجام دادن یک دستور ساده و از پیش معلوم.

گام بعدی می‌تواند آموزش مدل برای شروع از آزمایشگاه، رفتن به سمت Professor Oak، پیش بردن گفتگو و سپس انتخاب پوکمون باشد. stmonty معتقد است دشواری کار با طول برنامه‌ها به‌صورت تصاعدی افزایش می‌یابد. او همچنین بعید می‌داند که بزرگ‌تر کردن مدل فعلی به‌تنهایی برای شکست دادن بازی کافی باشد.

این پروژه در کنار تلاش‌های اخیر دیگری قرار می‌گیرد که با استفاده از مدل تصمیم‌گیری Jev و ابزارهای کمکی یا کدهای سفارشی توانسته‌اند Pokémon Red را به پایان برسانند. آن روش‌ها پیچیده‌تر هستند، اما تجربه stmonty نشان می‌دهد مدل‌های کوچک نیز می‌توانند گزینه‌ای عملی برای علاقه‌مندان باشند؛ به‌ویژه زمانی که هدف، آموزش هوش مصنوعی برای یک کار محدود و مشخص باشد.

نوشتهیک مدل هوش مصنوعی کوچک روی RTX 3080 Ti بازی Pokémon Red را یاد گرفتاولین بار درTechnoc. پدیدار شد.

برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.