تحلیل بازارهای هوش مصنوعی

داده‌های کشور در مسیر یکپارچه‌سازی؛ آزمایشگاه مرجع ارزیابی مدل‌های زبان فارسی افتتاح شد

اپراتور ملی داده قرار است شکاف میان سازمان‌های دارنده داده و مصرف‌کنندگان این منابع را پر کند. حامد منکرسی جزئیات مأموریت این اپراتور در تبادل امن داده و توسعه هوش مصنوعی فارسی را تشریح می‌کند. داده به یکی از مهم‌ترین زیرساخت‌های توسعه هوش مصنوعی تبدیل شده است…

8 دقیقه مطالعه
  • پشتیبانی شبکه
  • هوش مصنوعی
  • داده
  • مدل‌های
  • داده‌های
  • ملی
  • داده‌ها
  • اپراتور
داده‌های کشور در مسیر یکپارچه‌سازی؛ آزمایشگاه مرجع ارزیابی مدل‌های زبان فارسی افتتاح شد

خلاصه تحلیلی خبر

اپراتور ملی داده قرار است شکاف میان سازمان‌های دارنده داده و مصرف‌کنندگان این منابع را پر کند. حامد منکرسی جزئیات مأموریت این اپراتور در تبادل امن داده و توسعه هوش مصنوعی فارسی را تشریح می‌کند. داده به یکی از مهم‌ترین زیرساخت‌های توسعه هوش مصنوعی تبدیل شده است…

موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، داده، مدل‌های، داده‌های، ملی

اپراتور ملی داده قرار است شکاف میان سازمان‌های دارنده داده و مصرف‌کنندگان این منابع را پر کند. حامد منکرسی جزئیات مأموریت این اپراتور در تبادل امن داده و توسعه هوش مصنوعی فارسی را تشریح می‌کند.

داده به یکی از مهم‌ترین زیرساخت‌های توسعه هوش مصنوعی تبدیل شده است؛ با این حال، پراکندگی منابع، ضعف در استانداردسازی و نگرانی‌های امنیتی و حریم خصوصی، دسترسی به داده‌های قابل استفاده را دشوار کرده است. در همین راستا، اپراتور ملی داده با هدف ایجاد ارتباط میان دارندگان و مصرف‌کنندگان داده و فراهم‌کردن بستر امن برای تبادل و استفاده از این منابع فعالیت خود را آغاز کرده است. در گفت‌وگو با«دکتر حامد منکرسی»درباره مأموریت و سازوکار این اپراتور، امنیت داده‌ها و نقش آن در تأمین داده مورد نیاز مدل‌های هوش مصنوعی فارسی گفت‌وگو کرده‌ایم.

فهرست مقالهپنهان

اپراتور ملی داده چگونه شکاف میان دارندگان و مصرف‌کنندگان داده را پر می‌کند؟

حامد منکرسیاپراتور ملی داده در راستای برنامه تقسیم کار ملی هوش مصنوعی که سال گذشته در دولت به تصویب رسید، مجوز فعالیت خود را دریافت کرد و آغاز به کار کرد. وظیفه اصلی این اپراتور، پر کردن شکاف میان افراد و سازمان‌های دارنده داده و شرکت‌ها و سازمان‌هایی است که می‌توانند از این داده‌ها استفاده کنند.

البته مأموریت اپراتور ملی داده صرفاً به تبادل داده محدود نمی‌شود. داده‌ها پیش از تبادل باید پردازش، ارزیابی و از نظر کیفیت بررسی شوند. نقص‌های آنها باید برطرف و بر اساس استانداردها و پروتکل‌های مشخص آماده تبادل شوند. همچنین با استفاده از داده‌های مرجع، صحت داده‌ها بررسی می‌شود تا از درستی آنها اطمینان حاصل کنیم.

موضوع حریم خصوصی افراد و اسرار تجاری شرکت‌ها نیز باید بررسی شود تا اطلاعات محرمانه در فرآیند تبادل داده افشا نشود. مجموعه این فرآیندها در چارچوب حکمرانی داده در اپراتور ملی داده مدیریت می‌شود و با استفاده از ابزارهای فنی و حقوقی، داده‌ها به محصولاتی قابل تبادل برای سازمان‌ها و شرکت‌های مصرف‌کننده تبدیل می‌شوند.

یکی از چالش‌های اصلی، عدم اعتماد دستگاه‌ها به مصرف‌کنندگان داده است؛ چگونه این مشکل را حل می‌کنید؟

منکرسییکی از چالش‌های سازمان‌ها همین موضوع عدم اعتماد به دستگاه‌ها یا شرکت‌هایی است که مصرف‌کننده داده هستند. بنابراین لازم است یک نهاد سوم وجود داشته باشد که به دارنده داده تضمین دهد محرمانگی اطلاعات حفظ می‌شود و داده به شکل گمنام و امن در اختیار مصرف‌کننده قرار می‌گیرد.

ما می‌توانیم این موضوع را از نظر حقوقی تضمین کنیم و از نظر فنی نیز پروتکل‌ها را به شکلی تنظیم کنیم که این الزامات رعایت شود. برخی سازمان‌ها به بلوغ کافی رسیده‌اند و خودشان داده‌ها را گمنام و رمزگذاری می‌کنند، اما سازمان‌هایی که این توانمندی را ندارند یا نمی‌توانند هزینه آن را پرداخت کنند، می‌توانند از خدمات اپراتور داده برای گمنام‌سازی اطلاعات استفاده کنند.

با مشکل پراکندگی یا قدیمی بودن داده‌های سازمان‌ها هم مواجه هستید؟

منکرسیبله. در بسیاری از سازمان‌ها داده‌های قدیمی حتی دیجیتال نشده‌اند و به شکل سنتی روی کاغذ نگهداری می‌شوند. دیجیتال‌سازی این اطلاعات هزینه زیادی دارد. ما در پلتفرم داده، خدماتی برای جمع‌آوری و یکپارچه‌سازی داده ارائه می‌کنیم.

از طرف دیگر ممکن است داده‌ای برای یک سازمان ارزش چندانی نداشته باشد، اما برای سازمان دیگری بسیار ارزشمند باشد و بتواند با استفاده از آن پایگاه داده خود را تکمیل کند. اپراتور ملی داده می‌تواند این شکاف‌ها را برطرف و به یکپارچه‌سازی داده‌ها کمک کند.

با توجه به افزایش حملات سایبری، آیا تجمیع داده‌ها در یک بستر، خطر امنیتی ایجاد نمی‌کند؟

منکرسیاساساً هدف ما جمع‌آوری تمام داده‌ها در یک نقطه نیست. معماری‌های توزیع‌شده‌ای که امروز استفاده می‌شوند، امکان می‌دهند منابع داده روی بسترهای ابری و در محل‌های مختلف نگهداری شوند.

همچنین برای مراکز داده، برنامه‌های تداوم کسب‌وکار و بازیابی پس از بحران پیش‌بینی می‌شود. ما حتی پلتفرم نرم‌افزاری را در اختیار دارندگان داده قرار می‌دهیم تا بتوانند آن را در مجموعه خودشان مستقر کنند. این پلتفرم فرآیند مدیریت داده را استاندارد و پروتکل‌های لازم را در اختیار آنها قرار می‌دهد.

پس آیا خود داده‌ها به پلتفرم مرکزی منتقل نمی‌شوند؟

منکرسیلزوماً نه. یکی از مواردی که سازمان‌ها می‌توانند به پلتفرم اصلی منتقل کنند، «کاتالوگ داده» است. کاتالوگ در واقع فهرستی از داده‌های موجود است و خود داده را شامل نمی‌شود؛ بلکه مشخص می‌کند چه نوع داده‌ای در دسترس است.

برای مثال اگر به دنبال اطلاعات مربوط به خسارت‌های بیمه‌ای باشم، ابتدا کاتالوگ را بررسی می‌کنم تا ببینم داده مورد نیازم وجود دارد یا خیر. سپس درخواست خود را بر اساس آن ثبت می‌کنم و دارنده داده می‌تواند اطلاعات را در اختیار مصرف‌کننده قرار دهد. در این فرآیند، اپراتور ملی داده می‌تواند نقش واسطه را ایفا کند.

یکی از حوزه‌هایی که روی آن کار می‌کنید، تأمین داده برای مدل‌های هوش مصنوعی است؛ چرا این موضوع اهمیت دارد؟

منکرسیداده حوزه بسیار گسترده‌ای است و کاربردهای متعددی دارد. امروز مدل‌های بزرگ زبانی بر اساس حجم و کیفیت داده‌ای که به آن دسترسی دارند، توسعه پیدا کرده‌اند.

شرکت‌های بزرگ فناوری نیز به دلیل دسترسی به منابع عظیم داده توانسته‌اند مدل‌های قدرتمندی ایجاد کنند. برای مثال گوگل از داده‌های حاصل از موتور جست‌وجوی خود استفاده می‌کند و متا نیز به دلیل در اختیار داشتن داده‌های شبکه‌های اجتماعی خود، منابع گسترده‌ای برای توسعه مدل‌های هوش مصنوعی دارد.

ما در کشور چنین منابع متمرکزی را در این مقیاس در اختیار نداریم. از سوی دیگر، برخی مجموعه‌هایی که داده‌های ارزشمند دارند، هنوز به‌صورت جدی وارد این حوزه نشده‌اند.

برای تأمین داده مورد نیاز مدل‌های فارسی چه اقدامی انجام داده‌اید؟

منکرسیما وظیفه حاکمیتی خودمان می‌دانیم منابع اصلی و معتبر داده در کشور را شناسایی کنیم و با آنها تفاهم‌نامه همکاری داشته باشیم. برای نمونه، اخیراً با کتابخانه ملی تفاهم‌نامه‌ای امضا کردیم.

کتابخانه ملی حجم بسیار زیادی از داده‌های مربوط به منابع مکتوب را از سال‌های گذشته در اختیار دارد که می‌تواند برای توسعه مدل‌های بزرگ زبانی فارسی بسیار ارزشمند باشد. ما برای آموزش مدل‌هایی متناسب با فرهنگ و رویکرد ایرانی-اسلامی به چنین داده‌های معتبر و مستندی نیاز داریم.

مدل‌هایی که صرفاً بر اساس داده‌های عمومی اینترنت آموزش می‌بینند ممکن است با داده‌های نادرست، غیرمستند یا دارای سوگیری فرهنگی مواجه باشند. بنابراین تلاش می‌کنیم منابع معتبر داده را شناسایی و آنها را برای استفاده مدل‌های هوش مصنوعی آماده کنیم.

آیا این مدل‌ها داخل کشور میزبانی خواهند شد؟

منکرسیبله. تلاش می‌کنیم مدل‌های معتبر را داخل کشور میزبانی کنیم تا حاکمیت داده حفظ شود و اطلاعات برای پردازش به خارج از کشور منتقل نشود. با توجه به محدودیت‌های ناشی از تحریم‌ها، این موضوع اهمیت بیشتری پیدا می‌کند.

در حال حاضر نیز برخی مدل‌های متن‌باز را در مراکز داده داخل کشور مستقر کرده‌ایم. سکوهای ملی هوش مصنوعی نیز با حمایت معاونت علمی توسعه پیدا کرده‌اند و برخی مدل‌ها در آنها مستقر شده‌اند.

البته از نظر کیفیت هنوز با مدل‌های جهانی مانند محصولات OpenAI فاصله داریم و استقبال کاربران نیز به اندازه نمونه‌های جهانی نیست. امیدواریم با فاین‌تیون‌کردن مدل‌ها و در اختیار قرار دادن داده‌های معتبر، کیفیت محصولات داخلی افزایش پیدا کند.

آزمایشگاه مرجع ارزیابی مدل‌های زبان فارسی که اخیراً افتتاح شد، چه نقشی دارد؟

منکرسیامروز شرکت‌ها و استارتاپ‌های مختلف ادعا می‌کنند مدل بومی توسعه داده‌اند، اما معیار مشخص و مستقلی برای مقایسه کیفیت این مدل‌ها وجود نداشت.

ما با همکاری دانشگاه امیرکبیر آزمایشگاه مرجع ارزیابی مدل‌های زبان فارسی را راه‌اندازی کردیم تا این مدل‌ها به‌صورت دوره‌ای و از ابعاد مختلف ارزیابی شوند.

برای مثال، توانایی مدل در فهم مسائل ریاضی، مسائل حقوقی، زبان فارسی، ضرب‌المثل‌ها و ادبیات فارسی بررسی می‌شود و در نهایت نتایج در قالب یک رتبه‌بندی و لیدربرد منتشر خواهد شد.

این کار از یک سو به شرکت‌ها و فعالان این حوزه کمک می‌کند دائماً کیفیت محصولات خود را ارتقا دهند و از سوی دیگر، مصرف‌کنندگان می‌توانند هنگام انتخاب یک مدل، به جای تکیه بر چند جلسه دمو، عملکرد واقعی مدل را بر اساس یک ارزیابی مستقل مقایسه کنند.

در این آزمایشگاه چند هزار پرسش و پاسخ استاندارد برای ارزیابی مدل‌ها در نظر گرفته شده و پاسخ مدل‌ها بر اساس معیارهای مشخص بررسی می‌شود.

آیا نخستین نتایج این ارزیابی‌ها منتشر شده است؟

منکرسیبله. در حال حاضر رتبه‌بندی مدل‌های متن‌باز انجام شده و نتایج آن در سایت «سینا اسمارت» منتشر شده است و علاقه‌مندان می‌توانند برای مشاهده نتایج به آن مراجعه کنند.

برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.