ابزارهای هوش مصنوعی

انتشار مدل Gemini Embedding 2

مدل Gemini Embedding 2، اولین مدل تعبیه‌سازی ذاتاً چندوجهی گوگل است که متن، تصاویر، ویدئو، صدا و اسناد را به یک فضای تعبیه‌شده واحد نگاشت می‌کند و امکان بازیابی و طبقه‌بندی چندوجهی در میان انواع مختلف رسانه را فراهم می‌کند. مدل Gemini Embedding 2 ابتدا به‌صورت…

3 دقیقه مطالعه
  • پشتیبانی شبکه
  • هوش مصنوعی
  • Gemini
  • Embedding
  • مدل
  • چندوجهی
  • می‌کند
  • client
انتشار مدل Gemini Embedding 2

خلاصه تحلیلی خبر

مدل Gemini Embedding 2، اولین مدل تعبیه‌سازی ذاتاً چندوجهی گوگل است که متن، تصاویر، ویدئو، صدا و اسناد را به یک فضای تعبیه‌شده واحد نگاشت می‌کند و امکان بازیابی و طبقه‌بندی چندوجهی در میان انواع مختلف رسانه را فراهم می‌کند. مدل Gemini Embedding 2 ابتدا به‌صورت…

موضوعات اصلی: پشتیبانی شبکه، هوش مصنوعی، Gemini، Embedding، مدل، چندوجهی

مدل Gemini Embedding 2، اولین مدل تعبیه‌سازی ذاتاً چندوجهی گوگل است که متن، تصاویر، ویدئو، صدا و اسناد را به یک فضای تعبیه‌شده واحد نگاشت می‌کند و امکان بازیابی و طبقه‌بندی چندوجهی در میان انواع مختلف رسانه را فراهم می‌کند. مدل Gemini Embedding 2 ابتدا به‌صورت نسخه پیش‌نمایش عمومی و اکنون به‌صورت دسترسی عمومی در دسترس است.

با توسعه پایه قبلی که تنها مبتنی بر متن بود، Gemini Embedding 2 متن، تصاویر، ویدئوها، صدا و اسناد را به یک فضای امبدینگ واحد و یکپارچه نگاشت می‌کند و قابلیت درک قصد معنایی (Semantic Intent) در بیش از ۱۰۰ زبان را دارد. این امر خطوط لوله پیچیده را ساده‌سازی کرده و طیف گسترده‌ای از وظایف پایین‌دستی را بهبود می‌بخشد؛ از تولید تقویت‌شده با بازیابی (RAG) و جستجوی معنایی گرفته تا تحلیل احساسات و خوشه‌بندی داده‌ها.

مدالیته‌های جدید و ابعاد خروجی انعطاف‌پذیر

این مدل مبتنی بر Gemini است و از بهترین قابلیت‌های درک چندوجهی در کلاس خود بهره می‌برد تا ادغام باکیفیتی را در موارد زیر ایجاد کند

  • متنپشتیبانی از زمینه گسترده تا ۸۱۹۲ توکن ورودی
  • تصویرقابلیت پردازش تا ۶ تصویر در هر درخواست، با پشتیبانی از فرمت‌های PNG و JPEG
  • ویدئوپشتیبانی از حداکثر ۱۲۰ ثانیه ورودی ویدئو در فرمت‌های MP4 و MOV
  • صدادریافت و ادغام داده‌های صوتی بدون نیاز به رونوشت‌های متنی به‌صورت بوکی
  • اسنادادغام مستقیم فایل‌های PDF تا طول ۶ صفحه

فراتر از پردازش یک مدالیته در هر زمان، این مدل ذاتاً ورودی‌های درهم‌تنیده را درک می‌کند، بنابراین کاربر می‌تواند چندین مدل ورودی (مانند تصویر + متن) را در یک درخواست واحد ارسال کند. این ویژگی به مدل اجازه می‌دهد تا روابط پیچیده و ظریف بین انواع مختلف رسانه را درک کرده و فهم دقیق‌تری از داده‌های پیچیده دنیای واقعی را ممکن سازد.

مشابه مدل‌های امبدینگ قبلی گوگل، Gemini Embedding 2 از یادگیری بازنمایی ماتریوشکا (Matryoshka Representation Learning – MRL) استفاده می‌کند؛ تکنیکی که اطلاعات را با کاهش پویای ابعاد درون هم «لانه‌گزینی» (Nest) می‌کند. این امر ابعاد خروجی انعطاف‌پذیری را با کاهش مقیاس از مقدار پیش‌فرض ۳۰۷۲ فراهم می‌آورد تا توسعه‌دهندگان بتوانند بین عملکرد و هزینه‌های ذخیره‌سازی تعادل ایجاد کنند.

برای مشاهده عملکرد امبدینگ، نسخه نمایشی سبک‌وزن جست‌وجوی معنایی چندوجهی گوگل را امتحان کنید

عملکرد پیشرو

مدل Gemini Embedding 2 تنها مدل‌های قدیمی را بهبود نمی‌بخشد؛ بلکه استاندارد عملکردی جدیدی را برای عمق چندوجهی ایجاد می‌کند، قابلیت‌های گفتاری قدرتمندی را معرفی کرده و از مدل‌های پیشرو در وظایف مبتنی بر متن، تصویر و ویدئو پیشی می‌گیرد. این بهبود قابل‌اندازه‌گیری و پوشش منحصربه‌فرد چندوجهی، دقیقاً همان چیزی را به توسعه‌دهندگان ارائه می‌دهد که برای نیازهای متنوع تعبیه‌سازی خود به آن احتیاج دارند.

مدل Gemini Embedding 2 با معنی بخشیدن به داده‌های متنوع، پایه و اساس درک چندوجهی لازم و ضروری برای عصر بعدی تجربیات پیشرفته هوش مصنوعی فراهم می‌آورد.

انتشار مدل Gemini Embedding 2

شروع کار با Gemini Embedding 2

مدل Gemini Embedding 2 از طریقGemini APIوVertex AIدر دسترس است.

نحوه استفاده از این مدل را می توانید در Colab‌های تعاملیGemini APIوVertex AIو همچنینLangChainLlamaIndexHaystackWeaviateQDrantChromaDBوVector Searchبیاموزید.

قطعه کد زیر نمونه‌ای از فراخوانی Gemini Embedding 2 است که گوگل پیشنهاد می‌کند

from google import genai from google.genai import types # For Vertex AI: # PROJECT_ID='' # client = genai.Client(vertexai=True, project=PROJECT_ID, location='us-central1') client = genai.Client() with open("example.png", "rb") as f: image_bytes = f.read() with open("sample.mp3", "rb") as f: audio_bytes = f.read() # Embed text, image, and audio result = client.models.embed_content( model="gemini-embedding-2-preview", contents=[ "What is the meaning of life?", types.Part.from_bytes( data=image_bytes, mime_type="image/png", ), types.Part.from_bytes( data=audio_bytes, mime_type="audio/mpeg", ), ], ) print(result.embeddings)

برای ارزیابی پایداری، امنیت و نگهداری این زیرساخت، راهنمای پشتیبانی شبکه را نیز مطالعه کنید.