تجربه تعامل یا جهانهایی که هوش مصنوعی میسازد
مدل آزمایشی هوش مصنوعی Genie که گوگل در ژانویه ۲۰۲۶ معرفی کرد، دستاوردی فنی است که واقعاً حیرتانگیز به نظر میرسد. کافی است یک پرامپت به ابزار Genie بدهید، مثلاً یک تصویر یا چند خط متن کوتاه تا برای شما جهانی تعاملی بسازد که بتوانید در آن کاوش کنید. اگر درخوا…
خلاصه تحلیلی خبر
مدل آزمایشی هوش مصنوعی Genie که گوگل در ژانویه ۲۰۲۶ معرفی کرد، دستاوردی فنی است که واقعاً حیرتانگیز به نظر میرسد. کافی است یک پرامپت به ابزار Genie بدهید، مثلاً یک تصویر یا چند خط متن کوتاه تا برای شما جهانی تعاملی بسازد که بتوانید در آن کاوش کنید. اگر درخوا…
موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، جهان، مدل، هوش، مدلهای
مدل آزمایشی هوش مصنوعی Genie که گوگل در ژانویه ۲۰۲۶ معرفی کرد، دستاوردی فنی است که واقعاً حیرتانگیز به نظر میرسد.
کافی است یک پرامپت به ابزار Genie بدهید، مثلاً یک تصویر یا چند خط متن کوتاه تا برای شما جهانی تعاملی بسازد که بتوانید در آن کاوش کنید. اگر درخواست سادهای تایپ کنید، خروجی یک شبیهسازی واقعگرایانه خواهد بود. اگر نقطه شروع، مثلاً یکی از نقاشیهای «ژرژ سورا» باشد، میتوانید در دل «یکشنبه در پارک» قدم بزنید؛ آن هم با همان سبک Pointillist دقیق و وفادار به اثر اصلی.
پروژه Genie
پروژه Genieممکن است در نگاه اول شبیه یک بازی ویدئویی به نظر برسد، اما سازندگانش میگویند که اهمیت آن بسیار فراتر از این است. آنها این سامانه را یک «مدل جهان» (World Model) مینامند؛ ابزاری بنیادی که به سیستمهای هوش مصنوعی کمک میکند فضاهای فیزیکی پیچیده و پیشبینیناپذیری را که قرار است در آنها فعالیت کنند، درک کنند. به گفته گوگل، آیندهای که در آن رباتهای انساننما برای خرید مواد غذایی به فروشگاه میروند یا خودروهای خودران در جادههای روستایی حرکت میکنند، بدون چنین مدلهایی از جهان ممکن نخواهد بود.
ایده «مدل جهان» به سال ۱۹۴۳ بازمیگردد؛ زمانی که «کنت کراک» روانشناس اسکاتلندی در کتابی پیشنهاد کرد که موجودات زنده در ذهن خود «مدلی کوچک از جهان» دارند تا پیش از انجام یک عمل در واقعیت، فرضیههایشان را در آن آزمایش کنند. داشتن درکی حتی ابتدایی از نحوه کار جهان، پیششرط برنامهریزی برای تغییر آن است. بدون چنین مدلی، هر موجود زندهای ناچار خواهد بود زندگیای صرفاً واکنشی داشته باشد؛ یعنی دوری از درد، تلاش برای یافتن غذا و نه چندان بیشتر.
پیش از آنکه مدلهای زبانی بزرگ توجه جهان را به خود معطوف کنند؛ تلاش برای دادن چنین قابلیتی به سامانههای هوش مصنوعی از دهه ۱۹۹۰ حوزهای امیدوارکننده در پژوهش بود و اکنون این توجه دوباره به همان موضوع بازگشته است.
مولد ویدئو
امروزه سه رویکرد اصلی برای ساخت «مدلهای جهان» دنبال میشود. نخستین نقطه شروع طبیعی، مولدهای ویدئویی مبتنی بر هوش مصنوعی هستند. تولید یک ویدئوی منسجم مستلزم شبیهسازی جهانی منسجم است؛ زیرا اگر قوانین واقعیت بین فریمها تغییر کند، خروجی بیمعنا خواهد شد. چنین مدلهای ابتدایی میتوانند جزئیاتی از جهان را که مستقیماً به آنها داده نشده نیز استنتاج کنند. مثلاً اگر تصویری از یک هزارتو به آنها بدهید، میتوانند مسیر عبور از آن را ترسیم کنند؛ یا اگر عکس دستانی را ببینند که یک شیشه دربسته را نگه داشتهاند، حرکات لازم برای باز کردن آن را بهدرستی مدلسازی میکنند.
پروژه Genie اوج این رویکرد به شمار میرود. کاربرد واقعی آن زمانی روشن میشود که تصور کنیم در کنار یک سامانه هوش مصنوعی دیگر مثلاً یک ربات فروشنده در فروشگاه قرار گیرد که در حال یادگیری نحوه کار در دنیای فیزیکی است. میلیاردها ساعت داده آموزشی که برای چنین کاری لازم است، در دنیای واقعی بهمراتب سختتر به دست میآید تا در یک محیط شبیهسازیشده و اگر این شبیهسازیها به اندازه کافی دقیق باشند، سیستم میتواند با استفاده از همان دادهها خودش را آموزش دهد.
هوش فضایی
با این حال حتی واقعگرایانهترین ویدئوها هم نمیتوانند همه جزئیاتی را که یک انسان درک میکند ثبت کنند. مثلاً فریزر خرابِ پشت فروشگاه که باعث فاسد شدن ماهی تازه شده است در تصویر دیده نمیشود و البته بوی آن هم قابلثبت نیست. حتی اشیایی که مستقیماً در میدان دید قرار ندارند نیز خارج از دسترس این مدلها هستند. برای نمونه اگر محتویات یک راهروی فروشگاه تولید شود، راهروهای کناری تا زمانی که کاربر وارد آنها نشود، اصلاً برای مدل وجود ندارند. همین موضوع شبیهسازی محیطهای پیچیده یا حضور همزمان چند کاربر در یک جهان را دشوار میکند.
به همین دلیل رویکرد دیگری تلاش میکند به جای شبیهسازیهای دوبعدی، محیطهای کامل سهبعدی بسازد. «فیفی لی» دانشمند علوم رایانه در دانشگاه استنفورد رویکردی را مطرح میکند که آن را «هوش فضایی» (Spatial Intelligence) مینامد. از نظر او، مدلهای جهان باید سه ویژگی داشته باشند: تعاملی بودن، چندوجهی بودن (توانایی درک انواع ورودیها) و سازگاری درونی. سیستمهای مبتنی بر ویدئو دو شرط اول را دارند اما در مورد سوم دچار مشکل میشوند. برای مثال پروژه Genie حداکثر ۶۰ ثانیه اجرا میشود و پس از آن شبیهسازیهایش بهتدریج از انسجام میافتند.
استارتاپ World Labs که توسط لی تأسیس شده، مدلی به نام Marble ساخته است که میتواند نسخههای دیجیتالی از جهانهای سهبعدی ایجاد کند؛ جهانهایی که کامل و از نظر درونی سازگار هستند. در چنین محیطی چندین کاربر میتوانند همزمان حضور داشته باشند. علاوه بر این، فضاها هر بار که کاربر به اطراف نگاه میکند از نو ساخته نمیشوند؛ بلکه از همان ابتدا به طور کامل ساخته شدهاند. World Labs این فناوری را به معماران پیشنهاد میکند تا بتوانند فضایی را تصور کرده و پیش از چاپ سهبعدی، آن را بهصورت مجازی کاوش کنند.
پیشبینی مبتنی بر تعبیه مشترک
اما «یان لوکان» دانشمند ارشد پیشین هوش مصنوعی متا، معتقد است مدلهای جهان میتوانند به شکلی متفاوت و کمتر تحتاللفظی ساخته شوند. از دید او تمرکز بر فضاهای واقعی نوعی انحراف از مسئله اصلی است. بسیاری از سامانههای هوش مصنوعی باید در هزارتوهای مجازی مانند سیستمهای منابع انسانی یا اسناد حقوقی حرکت کنند، نه فقط در فضاهای فیزیکی مانند فروشگاهها. او باور دارد ایجاد توانایی مدلسازی سازگار با هر دو نوع محیط در هوش مصنوعی گامی مهم در پیشرفت و کاربردیسازی آن است. در این چارچوب، یک مدل زبانی بزرگ میتواند برای تعامل با این مدل جهان به کار گرفته شود تا در انجام وظایف چه در دنیای واقعی و چه در رایانه به سیستم کمک کند.
این رویکرد که معماری «پیشبینی مبتنی بر تعبیه مشترک» (Joint-Embed-ding Predictive Architecture) نام دارد به یک سامانه هوش مصنوعی اجازه میدهد ویژگیهای پیچیده جهان واقعی را شبیهسازی کند. مدلهای جهان کنونی عمدتاً بر آنچه در آستانه وقوع است تمرکز دارند، نه بر رویدادهایی که ممکن است در آینده دور رخ بدهند یا رخ ندهند. در مقابل، انسانها دائماً آینده را پیشبینی میکنند؛ مثلاً پیش از خروج از خانه وضعیت هوا را میسنجند تا تصمیم بگیرند چتر بردارند یا نه. نکته مهم این است که چنین تصمیمهایی بدون تصورکردن تکتک ثانیههای روز گرفته میشوند و مدلهای جهان فعلی چنین میانبری ندارند.
لوکان از سال ۲۰۲۲ در حال بررسی ظرفیتهای سامانه JEPA است و در نوامبر ۲۰۲۵ شرکت متا را ترک کرد تا بهطور تماموقت روی این مسئله کار کند. استارتاپ او با نام Advanced Machine Intelligence قصد دارد این ایدهها را عملی کند و کار خود را با همکاری با استارتاپ سلامت دیجیتال Nabla آغاز کرده است. به گفته او هدفش ساخت سامانهای است که با استفاده از مدل جهان خود بتواند تشخیص دهد «کدام توالی از اقدامات بهترین راه برای انجام کاری است که من به آن سپردهام.»
راههای آینده
اما اگر همه این رویکردهای پیچیده در نهایت غیرضروری باشند چه؟ اگر سامانههای مولد کنونی از همین حالا بتوانند در دنیای واقعی کارهای مفیدی انجام دهند، شاید نوعی مدل جهان درونی از پیش در آنها وجود داشته باشد. این دیدگاه «ایلیا سوتسکِور» یکی از بنیانگذاران OpenAI و بسیاری از همکاران سابق او در این آزمایشگاه است. او در سال ۲۰۲۳ گفت آموزش یک مدل زبانی بزرگ چیزی بیش از «یاد گرفتن یک مدل از جهان» نیست. فشردهسازی همه اطلاعات اینترنت در چندصد گیگابایت عدد فقط زمانی ممکن است که یک سیستم اصول بنیادین نهفته در آن اطلاعات را یاد بگیرد.
شواهدی وجود دارد که شاید این دیدگاه درست باشد. در سال ۲۰۲۳ نشان داده شد یک مدل زبانی که تنها بر فهرستی از حرکات بازی اتلو آموزش دیده بود، درون شبکه عصبی خود وضعیت صفحه بازی را بازنمایی کرده است؛ درحالیکه هرگز صفحه بازی اتلو را ندیده و قوانین بازی نیز به آن آموزش داده نشده بود. این بازنمایی آنقدر دقیق بود که پژوهشگران توانستند بخشهای مشخصی از شبکه عصبی را که رنگ مهرههای خاص را ذخیره میکردند شناسایی کنند. در نتیجه توانستند با دستکاریهای دقیق، برداشت مدل از بازی را تغییر دهند؛ این کاری سطحی بیسابقه از کنترل بر محاسبات یک مدل زبانی بود.
احتمالاً مدلهای زبانی بزرگتر مدلهای جهان پیچیدهتری در درون خود دارند؛ البته اگر پژوهشگران بتوانند آنها را پیدا کنند. آزمایشگاه Anthropic در پژوهش درباره «تفسیرپذیری» مدلهای Claude پیشگام بوده و خوشههایی از نورونهای مصنوعی را شناسایی کرده که به مفاهیمی از احساس گناه گرفته تا پل گلدنگیت مربوط میشوند. دستکاری این خوشهها همانند مثال اتلو، رفتار بعدی مدل را نیز تغییر میدهد. این موضوع نشان میدهد این سامانهها صرفاً کلمات را پشت سر هم نمیچینند؛ بلکه درکی نسبتاً منسجم از ویژگیهای فیزیکی جهان دارند که برای پاسخ دادن به پرسشها از آن استفاده میکنند. چیزی که بهطرز مشکوکی شبیه همان مدل جهان درونی است.
البته همه با این نظر موافق نیستند. لی معتقد است مدلهای زبانی بزرگ صرفاً «کلمهپردازانی در تاریکی» هستند. به گفته او توانایی استفاده از زبان برای توصیف جهان لزوماً به معنای درک واقعی و ریشهدار آن نیست. او این وضعیت را به دانشجویی تشبیه میکند که فقط درباره کشوری خارجی مطالعه کرده است؛ دانشی وجود دارد که صرفاً با خواندن کتابها به دست نمیآید. با این حال، هر کدام از این رویکردها که در نهایت موفقتر از آب درآید، یک چیز تقریباً قطعی است: هوش مصنوعی بهزودی قدم به جهان واقعی خواهد گذاشت.
گزارش حاضر در نسخه February 28th2026 نشریه The Economist منتشر شده است.
برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.