ابزارهای هوش مصنوعی

OpenAI از ۳ مدل هوش مصنوعی صوتی رونمایی کرد

نسل جدیدی از مدل‌های صوتی بلادرنگ که می‌توانند هم‌زمان با صحبت‌کردن افراد، به استدلال، ترجمه و رونویسی بپردازند. OpenAI سه مدل صوتی قابل‌دسترسی در API را معرفی کرد. با استفاده از این مدل‌ها، توسعه‌دهندگان می‌توانند تجربیات صوتی بسازند که طبیعی‌تر جلوه کنند، هو…

8 دقیقه مطالعه
  • پشتیبانی شبکه
  • هوش مصنوعی
  • صوتی
  • Realtime
  • کند
  • GPT
  • می‌کند
  • مدل
OpenAI از ۳ مدل هوش مصنوعی صوتی رونمایی کرد

خلاصه تحلیلی خبر

نسل جدیدی از مدل‌های صوتی بلادرنگ که می‌توانند هم‌زمان با صحبت‌کردن افراد، به استدلال، ترجمه و رونویسی بپردازند. OpenAI سه مدل صوتی قابل‌دسترسی در API را معرفی کرد. با استفاده از این مدل‌ها، توسعه‌دهندگان می‌توانند تجربیات صوتی بسازند که طبیعی‌تر جلوه کنند، هو…

موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، صوتی، Realtime، کند، GPT

نسل جدیدی از مدل‌های صوتی بلادرنگ که می‌توانند هم‌زمان با صحبت‌کردن افراد، به استدلال، ترجمه و رونویسی بپردازند.

OpenAI سه مدل صوتی قابل‌دسترسی در API را معرفی کرد. با استفاده از این مدل‌ها، توسعه‌دهندگان می‌توانند تجربیات صوتی بسازند که طبیعی‌تر جلوه کنند، هوشمندانه‌تر پاسخ دهند و به‌صورت بلادرنگ اقدام کنند.

GPTهای صوتی

صدا در حال تبدیل‌شدن به یکی از طبیعی‌ترین راه‌ها برای استفاده افراد از نرم‌افزار است. این امکان را به کاربر می‌دهد تا هنگام رانندگی درخواست کمک کند، برنامه سفر خود را در حین راه‌رفتن در فرودگاه تغییر دهد، پشتیبانی را به زبان دلخواه خود دریافت کند یا بدون توقف برای تایپ‌کردن کارهای خود را پیش ببرد.

اما ساخت محصولات صوتی کاربردی، نیازمند چیزی بیش از نوبت‌گیری سریع در مکالمه یا صدای طبیعی است. یک عامل صوتی (Voice Agent) باید منظور فرد را درک کند، زمینه را حفظ کند، در صورت تغییر درخواست خود را بازیابی کند، ابزارها را در حین ادامه مکالمه به کار گیرد و به‌گونه‌ای پاسخ دهد که متناسب با لحظه باشد.

در مجموع، مدل‌های جدید OpenAI، پردازش صوت را از پرسش‌وپاسخ ساده به سمت رابط‌های صوتی می‌برند که واقعاً می‌توانند کاربردی باشند و وظایفی مانند گوش‌دادن، استدلال‌کردن، ترجمه، رونویسی و اقدام‌کردن هم‌زمان با پیشرفت مکالمه را انجام دهند. این ۳ مدل شامل

  • GPT Realtime 2اولین مدل صوتی OpenAI با سطح استدلال در کلاس GPT 5 که می‌تواند درخواست‌های دشوارتر را پردازش کرده و مکالمه را به شکلی کاملاً طبیعی به‌پیش ببرد.
  • GPT Realtime Translateیک مدل جدید ترجمه زنده که گفتار را از بیش از ۷۰ زبان ورودی به ۱۳ زبان خروجی و همگام با سرعت گوینده ترجمه می‌کند.
  • GPT Realtime Whisperیک مدل جدید تبدیل گفتار به متن که گفتار را هم‌زمان با صحبت گوینده به‌صورت زنده رونویسی می‌کند.

«چیزی که در مورد GPT-Realtime-2 برجسته بود، هوش و قابلیت اطمینان در فراخوانی ابزار است که به تعاملات صوتی پیچیده می‌آورد. در سخت‌ترین بنچمارک تخاصمی ما، این امر پس از بهینه‌سازی پرامپت، به معنای ارتقای ۲۶ امتیازی در نرخ موفقیت تماس است (۹۵ درصد در برابر ۶۹ درصد). ترکیب قابلیت‌های عامل‌محور و قدرت سازوکارهای حافظتی چیزی است که آن را برای تولید صوت در Zillow قابل‌دوام می‌سازد.»
«جاش وایزبرگ»، معاون ارشد و رئیس بخش هوش مصنوعی Zillow

صدا به‌عنوان یک رابط بین افراد و محصولات

همان‌طور که صدا به روشی رایج برای استفاده از نرم‌افزار تبدیل می‌شود، شاهد این هستیم که توسعه‌دهندگان محصولات خود را حول سه الگوی نوظهور در هوش مصنوعی صوتی بنا می‌کنند

  • صدا به اقدام (Voice-to-action)جایی که افراد می‌توانند نیازهای خود را شرح دهند و سیستم می‌تواند درخواست را استدلال کند، از ابزارها استفاده کند و وظیفه را تکمیل کند. برای مثال، پلتفرم Zillow در حال ساخت دستیاری است که می‌تواند درخواست‌هایی مانند: «خانه‌هایی در محدوده توان خرید من پیدا کن، از خیابان‌های شلوغ دوری کن و یک برنامه تفریحی برای روز شنبه زمان‌بندی کن» را بشنود، استدلال کند و بر اساس آن‌ها اقدام کند.
  • سیستم‌ها به صدا (Systems-to-voice)جایی که نرم‌افزار می‌تواند بستر و زمینه را به راهنمایی گفتاری زنده تبدیل کند. به‌عنوان‌مثال، یک برنامه سفر می‌تواند به مسافر بگوید: «پرواز ورودی تأخیر دارد، اما هنوز هم می‌توانید به پرواز بعدی خود برسید. من گیت جدید را پیدا کردم، سریع‌ترین مسیر را از طریق ترمینال نقشه‌برداری کردم و چمدان شما نیز همچنان طبق برنامه منتقل خواهد شد.»
  • صدا به صدا (Voice-to-voice)جایی که هوش مصنوعی می‌تواند به تداوم مکالمات زنده در میان زبان‌ها، وظایف یا زمینه‌های در حال تغییر کمک کند. برای مثال، Deutsche Telekom در حال ساخت تجربیات پشتیبانی صوتی است که در آن مشتریان می‌توانند به زبانی که با آن راحت‌تر هستند صحبت کنند، درحالی‌که مدل، مکالمه را به‌صورت لحظه‌ای ترجمه می‌کند.
OpenAI از ۳ مدل هوش مصنوعی صوتی رونمایی کرد

تقویت مدل‌های صوتی برای استدلال و اقدام

مدل GPT Realtime 2 برای تعاملات صوتی زنده ساخته شده است؛ جایی که مدل درحالی‌که روی یک درخواست استدلال می‌کند، ابزارها را فراخوانی می‌کند، اصلاحات یا وقفه‌ها را مدیریت می‌کند و پاسخی متناسب با شرایط ارائه می‌دهد، مکالمه را نیز در جریان نگه می‌دارد.

  • مقدمه‌ها (Preambles)توسعه‌دهندگان می‌توانند عبارات کوتاهی را قبل از پاسخ اصلی فعال کنند، مانند «اجازه بدهید آن را بررسی کنم» یا «یک‌لحظه صبر کنید تا به آن نگاهی بیندازم»، تا کاربران بدانند عامل در حال پردازش درخواست است.
  • فراخوانی موازی ابزارها و شفافیت ابزارمدل می‌تواند چندین ابزار را به طور هم‌زمان فراخوانی کند و این اقدامات را با عباراتی مانند «در حال بررسی تقویم» یا «اکنون در حال جستجوی آن هستم» اعلام کند که به عامل‌ها کمک می‌کند در حین انجام وظایف، پاسخ‌گو باقی بمانند.
  • رفتار بازیابی قوی‌ترمدل می‌تواند به‌جای خاموش‌شدن یا قطع مکالمه، با گفتن جملاتی مانند «در حال حاضر با این موضوع مشکل دارم»، به شکلی مناسب‌تر وضعیت خود را بازیابی کند.
  • پنجره زمینه طولانی‌تر برای گردش‌کارهای عامل‌محورپنجره زمینه GPT Realtime 2 از ۳۲ هزار به ۱۲۸ هزار توکن افزایش یافته تا از جلسات طولانی‌تر و منسجم‌تر و جریان‌های کاری پیچیده‌تر پشتیبانی کند.
  • درک عمیق‌تر از دامنه تخصصیGPT Realtime 2 اصطلاحات تخصصی، اسامی خاص، اصطلاحات مراقبت‌های بهداشتی و سایر واژگانی که در محیط‌های تولید اهمیت دارند را بهتر حفظ می‌کند.
  • لحن و بیان قابل‌کنترل‌ترمدل می‌تواند لحن خود را بهتر تنظیم کند؛ صحبت‌کردن با آرامش هنگام حل یک مشکل، همدلی زمانی که کاربر ناامید است یا با خوش‌بینی هنگام تأیید یک اقدام موفقیت‌آمیز.
  • استدلال قابل‌تنظیمتوسعه‌دهندگان اکنون می‌توانند سطوح استدلال حداقل (minimal)، کم (low)، متوسط (medium)، زیاد (high) و بسیار زیاد (xhigh) را انتخاب کنند (با پیش‌فرض سطح کم)، تا بین تأخیر کمتر برای تعاملات ساده و استدلال سنجیده‌تر برای درخواست‌های پیچیده تعادل ایجاد کنند.

این پیشرفت‌ها در ارزیابی‌های صوتی که تطابق نزدیکی با عامل‌های صوتی در محیط تولید دارند، نمایان می‌شوند. GPT Realtime 2 (high) در بنچمارک Big Bench Audio برای هوش صوتی، ۱۵.۲ درصد بالاتر از GPT Realtime 1.5 امتیاز می‌گیرد. مدل GPT Realtime 2 (xhigh) در بنچمارک Audio MultiChallenge برای پیروی از دستورالعمل‌ها، ۱۳.۸ درصد امتیاز بالاتر کسب می‌کند که نشان‌دهنده بهبود نسبت به GPT Realtime 1.5 و نمایش استدلال، مدیریت زمینه و کنترل قوی‌تر در مکالمات زنده است.

OpenAI از ۳ مدل هوش مصنوعی صوتی رونمایی کرد
OpenAI از ۳ مدل هوش مصنوعی صوتی رونمایی کرد

بنچمارکBig Bench Audioقابلیت‌های استدلالی چالش‌برانگیز را در مدل‌هایی که از ورودی صوتی پشتیبانی می‌کنند، ارزیابی می‌کند. معیارAudio MultiChallengeهوش محاوره‌ای چند نوبته را در سیستم‌های گفت‌وگوی صوتی از جمله پیروی از دستورالعمل، یکپارچه‌سازی زمینه، خودسازگاری و مدیریت اصلاحات گفتار طبیعی ارزیابی می‌کند.

تجربیات صوتی چندزبانه زنده

مدل GPT Realtime Translate به توسعه‌دهندگان کمک می‌کند تجربیات صوتی چندزبانه زنده‌ای بسازند که در آن هر فرد می‌تواند به زبان دلخواه خود صحبت کند و ترجمه مکالمه را به‌صورت بلادرنگ بشنود و رونویسی‌های زنده را بخواند. این مدل از بیش از ۷۰ زبان ورودی و ۱۳ زبان خروجی پشتیبانی می‌کند و کاربران سازمانی آن را برای پشتیبانی مشتری، فروش برون‌مرزی، آموزش، رویدادها، رسانه‌ها و پلتفرم‌های تولید محتوا که به مخاطبان جهانی خدمات می‌دهند استفاده می‌کنند.

برای توسعه‌دهندگان، ترجمه زنده باید معنی را حفظ کند درحالی‌که همگام با گوینده پیش می‌رود، حتی زمانی که افراد به طور طبیعی صحبت می‌کنند، زمینه بحث را تغییر می‌دهند یا از تلفظ‌های بومی و زبان خاص در یک حوزه خاص استفاده می‌کنند.

«ساخت هوش صوتی برای هند به معنای مدیریت آواشناسی متنوع منطقه‌ای است. در ارزیابی‌های ما در زبان‌های هندی، تامیلی و تلوگو، GPT-Realtime-Translate نسبت به هر مدل دیگری که آزمایش کردیم، ۱۲.۵ درصد نرخ خطای کلمه (WER) پایین‌تری را ارائه داد، به همراه نرخ‌های بازگشت (Fallback) پایین‌تر، نرخ تکمیل وظایف بالاتر و تأخیری که مکالمه طبیعی را حفظ می‌کرد. این مدل استاندارد جدیدی را برای هوش مصنوعی صوتی چندزبانه تعیین می‌کند.»
«پراتیک ساچان» هم‌بنیان‌گذار و مدیر ارشد فناوری در BolnaAI

تجربیات رونویسی با تأخیر کم

مدل GPT Realtime Whisper یک مدل رونویسی جریانی جدید است که برای تبدیل گفتار به متن با تأخیر بسیار کم ساخته شده است. این مدل هم‌زمان با صحبت‌کردن افراد، صدا را رونویسی می‌کند، بنابراین محصولات زنده می‌توانند سریع‌تر، پاسخ‌گوتر و طبیعی‌تر احساس شوند؛ از زیرنویس‌هایی که در لحظه ظاهر می‌شوند تا یادداشت‌های جلسات که همگام با مکالمه پیش می‌روند.

این مدل، گفتار زنده را هم‌زمان با وقوع در داخل گردش‌کارهای سازمانی قابل‌استفاده می‌کند. تیم‌ها می‌توانند زیرنویس‌های جلسات، کلاس‌های درس، پخش‌های رسانه‌ای و رویدادها را تولید کنند؛ یادداشت‌ها و خلاصه‌ها را درحالی‌که مکالمات هنوز در جریان هستند تولید کنند؛ عامل‌های صوتی بسازند که باید به طور مداوم کاربران را درک کنند و گردش‌کارهای پیگیری سریع‌تری را برای پشتیبانی مشتری، مراقبت‌های بهداشتی، فروش، استخدام و سایر تعاملات گفتاری با حجم بالا ایجاد کنند.

ایمنی

رابط کاربری Realtime API شامل لایه‌های متعددی از نرده‌های محافظ و کاهش‌دهنده‌های ریسک برای کمک به جلوگیری از سوءاستفاده است. OpenAI طبقه‌بندی‌کننده‌های فعال را روی جلسات Realtime API به کار می‌گیرد، به این معنی که اگر مکالمات خاصی به‌عنوان نقض‌کننده دستورالعمل‌های محتوای مضر شناسایی شوند، می‌توانند متوقف شوند. توسعه‌دهندگان همچنین می‌توانند با استفاده از کیت توسعه نرم‌افزار عامل‌ها (Agents SDK)، به‌راحتی نرده‌های محافظ ایمنی اضافی خود را اضافه کنند.

قیمت‌گذاریو دسترسی

مدل‌های GPT Realtime 2، GPT Realtime Translate و GPT Realtime Whisper در Realtime API در دسترس هستند. قیمت‌گذاری GPT Realtime 2 به‌صورت ۳۲ دلار به‌ازای هر ۱ میلیون توکن صوتی ورودی و ۶۴ دلار به‌ازای هر ۱ میلیون توکن صوتی خروجی است (۴۰ سنت به‌ازای توکن‌های ورودی کش‌شده). قیمت‌گذاری GPT Realtime Translate برابر با ۳.۴ سنت بر دقیقه و GPT Realtime Whisper نیز ۱.۷ سنت بر دقیقه تعیین شده است.

شروع کار

می‌توانید مدل‌های صوتی بلادرنگ جدید را در بستر آزمایشی (Playground) تست کنید. برای توسعه نیز می‌توانیداین پرامپت را در Codex باز کنیدتا GPT Realtime 2 را به یک برنامه موجود اضافه کنید یا یک برنامه جدید بسازید.

برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.