چرا هوش مصنوعی نمیتواند اسم «گوگل» را درست بنویسد؟ (راز توکنها) XNET | اخبار و تحلیل هوش مصنوعی
هوش مصنوعی به جای حروف الفبا، متنها را به صورت «توکن» (تکههای کلمات) میبیند. بنابراین، مدلهای تصویرساز مفهوم و شکل کلی یک کلمه را نقاشی میکنند، اما چون درک حرفبهحرف ندارند، املای کلمات را (حتی کلمه گوگل را) غلط مینویسند. سلام! من آرمان فاضلی هستم، خبرن…
خلاصه تحلیلی خبر
هوش مصنوعی به جای حروف الفبا، متنها را به صورت «توکن» (تکههای کلمات) میبیند. بنابراین، مدلهای تصویرساز مفهوم و شکل کلی یک کلمه را نقاشی میکنند، اما چون درک حرفبهحرف ندارند، املای کلمات را (حتی کلمه گوگل را) غلط مینویسند. سلام! من آرمان فاضلی هستم، خبرن…
موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، هوش، مصنوعی، متن، کلمات
هوش مصنوعی به جای حروف الفبا، متنها را به صورت «توکن» (تکههای کلمات) میبیند. بنابراین، مدلهای تصویرساز مفهوم و شکل کلی یک کلمه را نقاشی میکنند، اما چون درک حرفبهحرف ندارند، املای کلمات را (حتی کلمه گوگل را) غلط مینویسند.
سلام! من آرمان فاضلی هستم، خبرنگار AI و فناوری در. اگر شما هم از ابزارهای تولید عکس استفاده کرده باشید، حتماً دیدهاید که وقتی از آنها میخواهید یک متن ساده روی تابلو بنویسند، نتیجه یک زبان فضایی و عجیبوغریب است! در میاناخبار هوش مصنوعی امروزمیخواهیم پرونده این باگ اعصابخردکن را درببندیم.
معمای توکنها: چرا هوش مصنوعی بیسواد است؟
هوش مصنوعی با حروف الفبا کار نمیکند. سیستمهای زبانی (LLMs) متن را به قطعاتی به نام «توکن» میشکنند. به عنوان مثال، کلمه “Google” ممکن است برای ما ۶ حرف باشد، اما برای هوش مصنوعی یک کد عددی مانند1456است.
طبق تجربه من و تستهایی که درانجام دادیم، وقتی به ابزاری مثل Imagen گوگل میگویید کلمه “Google” را روی یک لیوان بنویسد، او میداند که باید مجموعهای از خطوط منحنی و دایرهها (شکل ظاهری حروف) را بکشد، اما ترتیب دقیق حروف را درک نمیکند. نتیجه؟ کلماتی مثل “Googel” یا “Gogle” چاپ میشود.
یکی از محققان ارشد تیم گوگل دیپمایند (DeepMind) به تازگی در مقالهای اشاره کرده است
“مدلهای انتشار (Diffusion) برای نقاشی کردن آموزش دیدهاند، نه تایپ کردن. رمزگذارهای متنی (مثل CLIP) معنای کلمات را به تصویر ترجمه میکنند و به ساختار تایپوگرافی و املای دقیق کلمات بیتوجهاند.”
مقایسه عملکرد ابزارها در نوشتن متن
به عنوان یک خبرنگار فناوری ۲۰۲۴، ابزارهای مختلف را بررسی کردم تا ببینم کدام یک در نوشتن متن بهتر عمل میکند. این جدول را ببینید
| نام هوش مصنوعی | توانایی نوشتن متن | درصد خطای املایی | تکنولوژی استفاده شده |
| Google Imagen 3 | متوسط رو به بالا | حدود ۳۰٪ | Text-to-Image Diffusion |
| DALL-E 3 (OpenAI) | بسیار خوب | حدود ۱۵٪ | ChatGPT Text Encoders |
| Midjourney V6 | خوب (بهتر از قبل) | حدود ۲۰٪ | Custom Diffusion Model |
| Stable Diffusion 3 | عالی (رهبر فعلی) | کمتر از ۱۰٪ | Multimodal Transformer |
آیا این مشکل حل میشود؟
نظر شخصی من این است که ما در حال گذر از این محدودیت هستیم. برای کسانی کهاخبار جدید هوش مصنوعیرا دنبال میکنند، مدلهای جدیدتر معماری خود را تغییر دادهاند. آنها حالا از شبکههای ترانسفورمر (Transformers) به صورت ترکیبی استفاده میکنند تا علاوه بر نقاشی، توانایی «تایپ پیکسلبهپیکسل» را هم یاد بگیرند.
نقاش، نه خوشنویس!
توقع ما از هوش مصنوعی بالا رفته است، اما یادمان نرود که این مدلها اساساً «نقاش» هستند نه «خوشنویس». تا زمان رفع کامل این مشکل، پیشنهاد میکنم برای پیگیری آخرین آپدیتها و ترفندهای نوشتن متن در تصاویر، همیشه بهسایت اخبار هوش مصنوعیما سر بزنید.
سوالات متداول
۱.چرا هوش مصنوعی کلمات را در عکسها اشتباه مینویسد؟
زیرا هوش مصنوعی حروف را نمیشناسد، بلکه متن را به کدهای عددی (توکن) تبدیل کرده و فقط شکل کلی کلمه را نقاشی میکند.
۲.کدام هوش مصنوعی در نوشتن متن روی عکس بهتر است؟
در حال حاضر مدلهای DALL-E ۳ و Stable Diffusion ۳ کمترین خطای املایی را در تولید متن روی تصاویر دارند.
۳.آیا گوگل قصد دارد مشکل املایی تصویرساز خود را حل کند؟
بله، گوگل در مدل Imagen ۳ با بهبود معماری ترانسفورمرها توانسته دقت نوشتن کلمات را به شکل چشمگیری افزایش دهد.
۴.منظور از توکن در پردازش زبان هوش مصنوعی چیست؟
توکنها قطعاتی از کلمات هستند. هوش مصنوعی متن را به توکنهای عددی میشکند تا بتواند معنای آنها را سریعتر پردازش کند.
برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.