یک مدل هوش مصنوعی کوچک روی RTX 3080 Ti بازی Pokémon Red را یاد گرفت
یک مدل هوش مصنوعی با ۱۲.۵ میلیون پارامتر، با استفاده از کارت گرافیک RTX 3080 Ti، بازی پوکمون رد را یاد گرفت و توانست Squirtle را به عنوان پوکمون آغازین انتخاب کند. سخت افزار تکناک، تکناک، توسعهدهندهای با نام مستعار stmonty، مدلی کوچک از هوش مصنوعی را روی یک…
خلاصه تحلیلی خبر
یک مدل هوش مصنوعی با ۱۲.۵ میلیون پارامتر، با استفاده از کارت گرافیک RTX 3080 Ti، بازی پوکمون رد را یاد گرفت و توانست Squirtle را به عنوان پوکمون آغازین انتخاب کند. سخت افزار تکناک، تکناک، توسعهدهندهای با نام مستعار stmonty، مدلی کوچک از هوش مصنوعی را روی یک…
موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، مدل، بازی، انتخاب، آموزش
یک مدل هوش مصنوعی با ۱۲.۵ میلیون پارامتر، با استفاده از کارت گرافیک RTX 3080 Ti، بازی پوکمون رد را یاد گرفت و توانست Squirtle را به عنوان پوکمون آغازین انتخاب کند.
سخت افزارتکناک، تکناک، توسعهدهندهای با نام مستعار stmonty، مدلی کوچک از هوش مصنوعی را روی یککارت گرافیک RTX 3080 Tiآموزش داده تا در بازی Pokémon Red یک پوکمون آغازین انتخاب کند. این مدل در نهایت توانست از یک فایل ذخیره بازی، Squirtle را انتخاب کند. هرچند هنوز نمیتواند بازی را از ابتدا آغاز کند یا تا پایان پیش ببرد، نتیجه نشان میدهد که حتی مدلهای نسبتاً کوچک نیز میتوانند برای انجام وظایفی مشخص آموزش ببینند.
stmonty در نوشتهای با عنوان «Teaching a World Model to Play Pokémon» روند این پروژه را شرح داده است. مدل مورد استفاده از نوع مدل جهانی است و بر پایه پژوهش LeWorldModel ساخته شده؛ پژوهشی که Yann LeCun، دانشمند شناختهشده حوزه هوش مصنوعی، در نگارش آن مشارکت داشته است. LeCun سال گذشته از Meta جدا شد تا از طریق شرکت AMI Labs روی توسعه مدلهای جهانی کار کند.
انتشار کد پروژه بهصورت متنباز
مدل stmonty حدود ۱۲.۵ میلیون پارامتر دارد و در ۲۰ سپتامبر معرفی شد. انتخاب مدلی کوچک بخشی از هدف پروژه بود، زیرا توسعهدهنده میخواست آن را بهصورت محلی و روی یک کارت گرافیک مصرفکننده آموزش دهد. او این کار را راهی برای یادگیری و سرگرمی توصیف کرده است. کد پروژه نیز بهصورت متنباز با نام lePokeRed در GitHub منتشر شده و برای اجرای آن استفاده از پردازنده گرافیکی سازگار با CUDA توصیه میشود.
مدل باید از راه مشاهده صفحهبازی Pokémon Redیاد میگرفت که فشردن هر دکمه چه نتیجهای دارد. برای این کار، به جای پیشبینی کامل تصویر بعدی، از خلاصهای فشرده شامل ۱۹۲ عدد استفاده میکند. در مرحله نخست آموزش، مدل هیچ پاداشی دریافت نمیکند و از شرایط پیروزی یا هدف نهایی آگاه نیست. اهداف زمانی وارد فرایند میشوند که مدل شروع به برنامهریزی میکند.
این ساختار با پژوهشی منتشرشده در مارس ۲۰۲۶ همراستا است. آن پژوهش یک مدل JEPA با حدود ۱۵ میلیون پارامتر را شرح میدهد که میتوان آن را روی یک پردازنده گرافیکی آموزش داد. اندازه و شیوه اجرای آن نیز تفاوت زیادی با پروژه stmonty ندارد.
فرآیند آموزش با فریمهای سیاهوسفید
آموزش مدل با ۴۲۳۸۲ فریم سیاهوسفید انجام شد که در بیش از هزار اجرای کوتاه گردآوری شده بودند. نقطه آغاز همه این اجراها، فایلی ذخیرهشده در آزمایشگاه Professor Oak بود. دادههای آموزشی تنها شامل مسیرهای از پیش تعیینشده نبودند و مسیرهای مشابه با فشردن تصادفی دکمهها و همچنین گشتوگذار بیهدف را هم در بر میگرفتند.
افزودن دادههای تصادفی اهمیت داشت، چون مدلی که فقط مسیرهای تمیز و تکرارشونده را ببیند، ممکن است ارتباطی نادرست میان دکمهها و اتفاقات بازی برقرار کند. برای نمونه، اگر هر بار با نمایش یک کادر گفتگو دکمه A فشرده شود، مدل ممکن است هرگز یاد نگیرد که دکمه B در همان موقعیت چه کاری انجام میدهد. مدل پروژه نیز از ابتدا و بدون استفاده از مدلی آماده آموزش داده شد.
در مرحله برنامهریزی، مدل دنبالهای شامل ۱۴ بار فشردن دکمه را میسازد و آن را در خود مدل امتحان میکند، نه در بازی اصلی. در هر دور، ۵۱۲ برنامه احتمالی بررسی میشوند. فرایند جستوجو از هر هشت برنامه یکی را نگه میدارد و در نتیجه، ۶۴ گزینه برای ادامه باقی میماند. این روند تا انتخاب برنامه نهایی ادامه پیدا میکند و سپس همان برنامه در شبیهساز بازی اجرا میشود.
نخستین تلاش موفق نبود و شخصیت بازی بدون پوکمون باقی ماند. stmonty احتمال میدهد بخشی از مشکل به انباشته شدن خطاها مربوط باشد: مدل پیشبینیهای خود را مبنای پیشبینیهای بعدی قرار میدهد و اشتباههای کوچک ممکن است در ادامه بزرگتر شوند. پس از تنظیم دقیقتر مدل، تلاش بعدی نتیجه داد و Squirtle انتخاب شد.
اهمیت دادههای آموزشی تصادفی
بهنوشتهتامز هاردوردر بیش از ۱۰۰ اجرای بعدی که همگی از همان فایل ذخیره شروع شدند، ۵۲ برنامه توانستند یک پوکمون آغازین انتخاب کنند. در مقایسه، فشردن تصادفی دکمهها هیچبار به انتخاب پوکمون منجر نشد و مدل آموزشندیده فقط یکبار موفق شد. با این حال، فشردن مکرر دکمه A از همان فایل ذخیره نیز از قبل نتیجه میداد. هدف اصلی پروژه، رسیدن مدل به راهحل بهصورت مستقل بود، نه صرفاً انجام دادن یک دستور ساده و از پیش معلوم.
گام بعدی میتواند آموزش مدل برای شروع از آزمایشگاه، رفتن به سمت Professor Oak، پیش بردن گفتگو و سپس انتخاب پوکمون باشد. stmonty معتقد است دشواری کار با طول برنامهها بهصورت تصاعدی افزایش مییابد. او همچنین بعید میداند که بزرگتر کردن مدل فعلی بهتنهایی برای شکست دادن بازی کافی باشد.
این پروژه در کنار تلاشهای اخیر دیگری قرار میگیرد که با استفاده از مدل تصمیمگیری Jev و ابزارهای کمکی یا کدهای سفارشی توانستهاند Pokémon Red را به پایان برسانند. آن روشها پیچیدهتر هستند، اما تجربه stmonty نشان میدهد مدلهای کوچک نیز میتوانند گزینهای عملی برای علاقهمندان باشند؛ بهویژه زمانی که هدف، آموزش هوش مصنوعی برای یک کار محدود و مشخص باشد.
نوشتهیک مدل هوش مصنوعی کوچک روی RTX 3080 Ti بازی Pokémon Red را یاد گرفتاولین بار درTechnoc. پدیدار شد.
برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.