آموزش‌های پایه‌ای هوش مصنوعی

معرفی معیار جدید OpenAI برای ارزیابی توانایی‌های تحقیقاتی عوامل هوش مصنوعی

OpenAI معیار جدیدی به نام PaperBench معرفی کرده است که هدف آن اندازه‌گیری توانایی عوامل هوش مصنوعی در بازتولید تحقیقات پیشرفته هوش مصنوعی است. این آزمون بررسی می‌کند که آیا یک هوش مصنوعی می‌تواند مقالات علمی را درک کند، کدهای مرتبط را بنویسد و آن‌ها را اجرا کن…

2 دقیقه مطالعه
  • پشتیبانی شبکه
  • هوش مصنوعی
  • هوش
  • مصنوعی
  • ارزیابی
  • قاضی
  • می‌کند
  • مقاله
معرفی معیار جدید OpenAI برای ارزیابی توانایی‌های تحقیقاتی عوامل هوش مصنوعی

خلاصه تحلیلی خبر

OpenAI معیار جدیدی به نام PaperBench معرفی کرده است که هدف آن اندازه‌گیری توانایی عوامل هوش مصنوعی در بازتولید تحقیقات پیشرفته هوش مصنوعی است. این آزمون بررسی می‌کند که آیا یک هوش مصنوعی می‌تواند مقالات علمی را درک کند، کدهای مرتبط را بنویسد و آن‌ها را اجرا کن…

موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، هوش، مصنوعی، ارزیابی، قاضی

OpenAI معیار جدیدی به نامPaperBenchمعرفی کرده است که هدف آن اندازه‌گیری توانایی عوامل هوش مصنوعی در بازتولید تحقیقات پیشرفته هوش مصنوعی است. این آزمون بررسی می‌کند که آیا یک هوش مصنوعی می‌تواند مقالات علمی را درک کند، کدهای مرتبط را بنویسد و آن‌ها را اجرا کند تا نتایج ذکرشده در مقاله را بازتولید کند.

PaperBenchچیست؟

این معیار از ۲۰ مقاله برتر کنفرانس بین‌المللی یادگیری ماشین (ICML) سال ۲۰۲۴ استفاده می‌کند که شامل ۱۲ موضوع مختلف است. این مقالات تحقیقاتی شامل ۸,۳۱۶ وظیفه قابل ارزیابی به‌صورت جداگانه هستند. برای ارزیابی دقیق‌تر، سیستم ارزیابیRubricتوسعه داده شده است که هر وظیفه را به‌صورت سلسله‌مراتبی به زیر‌وظایف کوچک‌تر تقسیم می‌کند و معیارهای ارزیابی مشخصی برای آن‌ها ارائه می‌دهد. این سیستم با همکاری نویسندگان هر مقاله ICML برای حفظ دقت و واقع‌گرایی توسعه داده شده است.

در این آزمون، هوش مصنوعی باید جزئیات لازم را از مقاله استخراج کرده و تمام کدهای مورد نیاز برای بازتولید مقاله را در یک مخزن (repository) ارائه دهد. همچنین، هوش مصنوعی باید اسکریپتی به نامreproduce.shایجاد کند که به اجرای کدها کمک کرده و نتایج مقاله را بازتولید کند.

ارزیابی توسط قاضی هوش مصنوعی

تمام این فرایند توسط یک قاضی هوش مصنوعی ارزیابی می‌شود. OpenAI ادعا می‌کند که این قاضی به اندازه یک انسان دقیق عمل می‌کند. درمقاله تحقیقاتیذکر شده است: «بهترین قاضی مبتنی بر مدل LLM ما که از o3-mini-high با ساختار سفارشی استفاده می‌کند، در ارزیابی کمکی به امتیاز F1 معادل ۰.۸۳ دست یافته است، که نشان می‌دهد این قاضی جایگزین مناسبی برای یک قاضی انسانی است.»

نتایج اولیه

چندین مدل هوش مصنوعی در PaperBench مورد آزمایش قرار گرفتند. بهترین عملکرد متعلق به مدلClaude 3.5 Sonnetاز شرکتAnthropicبود که توانست امتیاز بازتولید ۲۱.۰٪ را کسب کند. سایر مدل‌ها، از جملهo1وGPT-4oاز OpenAIGemini 2.0 FlashوDeepSeek-R1امتیازهای پایین‌تری کسب کردند.

معرفی معیار جدید OpenAI برای ارزیابی توانایی‌های تحقیقاتی عوامل هوش مصنوعی


در مقایسه، دانشجویان دکتری (PhD) در حوزه یادگیری ماشین به طور میانگین امتیاز ۴۱.۴٪ کسب کردند، که نشان‌دهنده فاصله قابل‌توجه بین توانایی‌های فعلی هوش مصنوعی و تخصص انسانی است.

معرفی معیار جدید OpenAI برای ارزیابی توانایی‌های تحقیقاتی عوامل هوش مصنوعی

آزمون طولانی‌مدت

یک آزمون جداگانه نیز با مدلo1از OpenAI برای مدت زمان طولانی‌تری انجام شد، اما این مدل همچنان نتوانست به سطح تلاش انسانی برسد.

دسترسی عمومی

کدPaperBenchاکنون برای عموم درGitHubدر دسترس است. نسخه سبک‌تر این معیار، به نامPaperBench Code-Devنیز منتشر شده است تا افراد بیشتری بتوانند از آن استفاده کنند.

برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.