زومیا؛ هوش مصنوعی

تعمیر وسایل و ترجمه همزمان با هوش مصنوعی؛ «پردازش زنده تصویر» به گوگل جمنای آمد

گوگل با افزودن قابلیت «بینایی هدایت‌شده» به جمنای لایو، امکان پردازش زنده‌ی ویدیو و راهنمایی گام‌به‌گام بصری را برای کاربران فراهم کرد. دستیارهای هوشمند با سرعتی باورنکردنی از ابزارهای متنی ساده به همراهانی چندوجهی تبدیل شده‌اند و روند پیشرفت‌شان همچنان ادامه…

2 دقیقه مطالعه
  • پشتیبانی شبکه
  • هوش مصنوعی
  • گوگل
  • کاربران
  • دوربین
  • بصری
  • هدایت‌شده
  • بینایی
تعمیر وسایل و ترجمه همزمان با هوش مصنوعی؛ «پردازش زنده تصویر» به گوگل جمنای آمد

خلاصه تحلیلی خبر

گوگل با افزودن قابلیت «بینایی هدایت‌شده» به جمنای لایو، امکان پردازش زنده‌ی ویدیو و راهنمایی گام‌به‌گام بصری را برای کاربران فراهم کرد. دستیارهای هوشمند با سرعتی باورنکردنی از ابزارهای متنی ساده به همراهانی چندوجهی تبدیل شده‌اند و روند پیشرفت‌شان همچنان ادامه…

موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، گوگل، کاربران، دوربین، بصری

هوش مصنوعی گوگل جمنای / Google Gemini در داخل صفحه موبایل

گوگل با افزودن قابلیت «بینایی هدایت‌شده» به جمنای لایو، امکان پردازش زنده‌ی ویدیو و راهنمایی گام‌به‌گام بصری را برای کاربران فراهم کرد.

دستیارهای هوشمند با سرعتی باورنکردنی از ابزارهای متنی ساده به همراهانی چندوجهی تبدیل شده‌اند و روند پیشرفت‌شان همچنان ادامه دارد. گوگل در همین راستا قابلیت بینایی هدایت‌شده (Guided Vision) را در بستر دستیار تعاملی Gemini Live معرفی کرده است تا کاربران بتوانند از طریق دوربین گوشی، جهان پیرامون خود را به‌صورت زنده با هوش مصنوعی به اشتراک بگذارند و راهنمایی‌های لحظه‌ای دریافت کنند.

ویژگی تازه به کاربران اجازه می‌دهد در حین مکالمه‌ی صوتی روان با جمنای، دوربین دستگاه را فعال کنند و درباره‌ی اشیا، متن‌ها یا فعالیت‌های در حال انجام بازخورد آنی بگیرند.

پیش از اضافه شدن چنین امکانی، تعامل با سرویس تنها به صوت محدود بود، اما اکنون پردازش پیوسته‌ی تصویر، درک محیط را به سطحی کاملا تازه می‌رساند.

۰:۰۰ / ۰:۰۰

فناوری جدید ریشه در پروژه‌ی Astra دارد که گوگل در کنفرانس توسعه‌دهندگان به نمایش گذاشت. کاربر با گرفتن دوربین به سمت اجزای یک وسیله‌ی معیوب، قفسه‌های نامرتب یا حتی یک مسئله‌ی ریاضی، بدون نیاز به ثبت تک‌عکس‌های پیاپی، مکالمه‌ای طبیعی را پیش می‌برد. هوش مصنوعی حرکات را می‌بیند، موقعیت اشیا را دنبال می‌کند و دستورالعمل‌های بصری و صوتی را در لحظه تطبیق می‌دهد.

مهندسان گوگل برای دستیابی به کمترین میزان تأخیر زمانی، زیرساخت چندوجهی مدل‌های خانواده‌ی جمنای را بهینه‌سازی کرده‌اند. قابلیت‌های کلیدی سیستم در جریان تعاملات روزمره شامل موارد زیر می‌شود

  • راهنمایی بصری گام‌به‌گام برای تعمیر لوازم خانگی یا اتصال کابل‌ها
  • بررسی و ترجمه‌ی هم‌زمان متون موجود در محیط فیزیکی بدون نیاز به تغییر حالت برنامه
  • تحلیل چیدمان وسایل و ارائه‌ی پیشنهادهای کاربردی برای سازمان‌دهی فضا
  • درک پیوسته‌ی موقعیت مکانی اجسام در قاب دوربین حین گفت‌و‌گو

عرضه‌ی بینایی هدایت‌شده پاسخی مستقیم به قابلیت‌های ویدیویی پیشرفته‌ی مدل GPT-4o به‌شمار می‌رود. گوگل و اوپن‌ای‌آی تلاش می‌کنند فاصله‌ی میان ورودی‌های چندرسانه‌ای و خروجی‌های انسانی را به صفر برسانند. کاربران می‌توانند به جای توصیف طولانی مشکلات با کلمات، به سادگی به جسم مدنظر اشاره کنند و پاسخ دقیق بشنوند.

دسترسی به ویژگی‌های بصری جدید از طریق به‌روزرسانی اپلیکیشن گوگل روی سیستم‌عامل‌های اندروید و iOS امکان‌پذیر می‌شود و تجربه‌ی کاربری دستیارهای مجازی را وارد عصری تازه خواهد کرد.

برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.