التضمينات متعددة الوسائط: اختبر كل وسيط قبل الإنتاج
تقنية
AI
Multimodal Embeddings
Information Retrieval
RAG

التضمينات متعددة الوسائط: اختبر كل وسيط قبل الإنتاج

قد تخفي درجة استرجاع واحدة متعددة الوسائط فشل مسار الفيديو أو الصور أو المستندات. قيّم كل وسيط قبل الإنتاج.

Uygar DuzgunUUygar Duzgun
Aug 4, 2026
تم التحديث 16 أغسطس 2026
15 min read

التضمينات متعددة الوسائط: اختبر كل وسيط قبل الإنتاج

الجمهور: الممارسون المتقدمون الذين يبنون أنظمة بحث أو RAG أو توصية أو وكلاء تعمل على النصوص والصور والفيديو والمستندات المرئية.

يمكن للتضمينات متعددة الوسائط تقليص عدة مسارات لاسترجاع المعلومات إلى مساحة متجهية واحدة. لكنها لا تختزل التقييم إلى درجة واحدة. فقد يتصدر نموذج ما معيارًا إجماليًا، بينما يفشل في التقاط أحداث فيديو قصيرة، أو مصطلحات دقيقة، أو تسميات المخططات، أو الأدلة المحلية داخل الصفحة التي يحتاج إليها نظام الإنتاج.

قاعدة الإنتاج بسيطة: أبقِ نتائج النص والصور والفيديو والمستندات المرئية منفصلة؛ وقارن بين الاسترجاع الكثيف والمتناثر والهجين حيث يكون كل منها مناسبًا؛ وقِس ما لم يره المُرمِّز قط؛ وتعامل مع كل تغيير في النموذج على أنه ترحيل للفهرس.

توضح ثلاث أوراق بحثية صدرت خلال خمسة أيام هذا الحد بوضوح غير معتاد. ينشئ UEmbed تمثيلات كثيفة ومتناثرة في تمريرة واحدة. ويدرّب DME من Douyin متجهًا مضغوطًا للحفاظ على أدلة الاسترجاع. ويضيف ReLoop-UME عمقًا تكراريًا من دون توليد رموز تفسيرية. وتُبلغ جميعها عن استرجاع أقوى، لكن أنماط فشلها تشير إلى مخاطر تشغيلية مختلفة.

ما التضمينات متعددة الوسائط؟

تربط التضمينات متعددة الوسائط أنواعًا مختلفة من المدخلات بمتجهات يمكن مقارنتها في مساحة مشتركة. ويمكن لاستعلام نصي أن يسترجع صورة فوتوغرافية، أو لفيديو أن يطابق وصفًا نصيًا، أو للقطة شاشة أن تسترجع صفحة مستند مشابهة بصريًا.

تُعد هذه الواجهة المشتركة مفيدة لأن نظام الاسترجاع يستطيع استخدام البحث التقريبي عن أقرب الجيران بدلًا من تشغيل نموذج توليدي على كل مرشح. لكنها تخفي أيضًا اختلافات مهمة. يحتوي النص على إشارات معجمية دقيقة. وتحتوي الصور على كائنات وعلاقات محلية. ويضيف الفيديو توقيت الأحداث واختيار الإطارات. أما المستندات المرئية فتجمع بين التخطيط وOCR والجداول والمخططات وسياق الصفحة.

تكشف الأنظمة الحالية هذه الاختلافات في حدودها الخاصة. توثّق Gemini Embedding 2 من Google ربط النصوص والصور والفيديو والصوت وملفات PDF في مساحة واحدة، لكنها تعالج 32 إطارًا كحد أقصى لكل فيديو ولا تعالج المسار الصوتي للفيديو. كما تقتصر ملفات PDF على ست صفحات لكل طلب. وتدعم بطاقة نموذج Qwen3-VL-Embedding-2B النصوص والصور ولقطات الشاشة والفيديو والمدخلات المختلطة، مع سياق يبلغ 32K وأبعاد قابلة للضبط من 64 إلى 2,048.

هذه القدرات مدخلات لخطة تقييم، وليست دليلًا على أن كل وسيط يعمل بالكفاءة نفسها مع مجموعة بيانات محددة.

ما الذي قاستْه الأوراق البحثية الثلاث فعلًا؟

تحسّن الأوراق البحثية أجزاء مختلفة من قيد الاسترجاع نفسه: الاحتفاظ بقدر كافٍ من الأدلة للتمييز، من دون تحويل كل استعلام إلى مهمة توليد بطيئة.

النظامالآليةالنتيجة المُبلغ عنهاالحد المهم
------------
UEmbedتنتج تمريرة سببية واحدة متجهات كثيفة ومتناثرة متعلَّمةيبلّغ UEmbed-9B عن 71.8 للاسترجاع الكثيف و71.0 للاسترجاع المتناثر على MMEB-V2جودة التمثيل المتناثر أضعف عبر اللغات؛ والفيديو لديه فجوة أكبر بين الكثيف والمتناثر
DMEتدريب تبايني مسبق مع استدلال كامن وإعادة بناء أثناء التدريب فقطيبلّغ DME-2B عن 74.8 وDME-9B عن 78.4 على MMEB-V2بيانات الإنتاج الداخلية ومجموعة التقييم ومقياس Lifetime بنسبة 0.1% غير متاحة للعامة
ReLoop-UMEإعادة استخدام كتلة مشتركة من المنتصف إلى المراحل المتأخرة مع سجلات استرجاعيبلّغ ReLoop-UME عن زمن استجابة أقل بـ 44.9 مرة من UME-R1 في إعداد H20 الخاص بهيضيف تكلفة تدريب ولا يستطيع استعادة أدلة الفيديو التي حُذفت أثناء أخذ عينات الإطارات

تأتي هذه الأرقام من تجارب المؤلفين. وهي ليست نتائج من بيئة إنتاج مشتركة، ولا ينبغي مقارنتها كما لو أن العتاد والبيانات وحجم النموذج وحزم الخدمة كانت مضبوطة.

UEmbed: الاسترجاع الكثيف والمتناثر في تمريرة واحدة

يضيف UEmbed 16 رمزًا خاصًا قابلًا للتعلم إلى نموذج متعدد الوسائط لا يعتمد على التشفير إلا من جهة فك الترميز. يتنبأ كل رمز بأوزان متناثرة فوق قسم منفصل من المفردات؛ بينما توفر حالة نهاية التسلسل النهائية المتجه الكثيف. ويصدر المؤلفون نسخًا بحجوم 2B و4B و9B مدرَّبة على بيانات عامة.

يبلّغ UEmbed-9B عن 71.8 للاسترجاع الكثيف و71.0 للاسترجاع المتناثر على MMEB-V2. وتضيف النتيجة الهجينة 0.3 نقطة للنص و0.5 نقطة للمستندات المرئية مقارنة بالاسترجاع الكثيف، مع تغير طفيف للصور والفيديو. وتدعم هذه النتيجة استنتاجًا محدودًا: يمكن للإشارات المتناثرة المتعلَّمة أن تكمل الاسترجاع الكثيف عندما تكون المصطلحات الدقيقة أو نص المستند مهمين. لكنها لا تُظهر أن البحث الهجين يحسن كل وسيط.

القيود عملية. تنحاز بيانات التدريب إلى الإنجليزية والصينية، وتُبلغ الورقة عن تعميم متناثر أضعف عبر اللغات. كما يحتفظ التمثيل المتناثر بآثار مرتبطة بالمفردات. ويُظهر الفيديو فجوة أكبر بين الأداء الكثيف والمتناثر، ولا تقدم الورقة دراسة كاملة لكفاءة الفهرس المعكوس.

كان مستودع UEmbed لا يزال حديثًا ببضعة أيام فقط عند التحقق منه في 4 أغسطس 2026. وكان يضم التزامين، وست نجوم، ولا تفرعات، ولا إصدارات. تصف هذه الأرقام مستوى النضج، لا جودة النموذج. والتنفيذ في مرحلة مبكرة بما يكفي لتتوقع فرق الإنتاج تغييرات في الواجهات والخدمة.

DME: درّب المتجه للاحتفاظ بأدلة الاسترجاع

يقسم التقرير التقني لـ Douyin Multimodal Embedding التعلم إلى مرحلتين. ينشئ التدريب التبايني المسبق واسع النطاق أولًا مساحة مشتركة واسعة. ثم يضغط الاستدلال الكامن وإعادة البناء الشرطي المتقاطع، المستخدمان أثناء التدريب فقط، على التضمين المضغوط للاحتفاظ بأدلة دقيقة حول النظير المقابل.

ترتفع نتيجة MMEB-V2 المُبلغ عنها من خط أساس قدره 70.9 إلى 72.5 بعد التدريب المسبق في المرحلة الأولى، ثم إلى 73.8 بعد الاستدلال الكامن المرتكز إلى الأدلة، ثم إلى 74.8 بعد إعادة البناء لنموذج 2B. ويبلّغ نموذج 9B عن 78.4. كما تُبلغ الورقة عن مكسب نسبي قدره 2.92% على مجموعة داخلية غير متصلة، ومكسب قدره 0.1% على مقياس Lifetime داخلي في اختبار A/B عبر الإنترنت.

قاس المؤلفون نتائج الإنتاج هذه داخل Douyin. وتستنتج الورقة أن التدريب الحافظ للأدلة يحسن الاسترجاع الصناعي من دون تكلفة خدمة توليدية. ولا يستطيع القارئ إعادة إنتاج مجموعة البيانات الداخلية أو تعريف المقياس أو مزيج الزيارات أو ظروف النشر بصورة مستقلة من التقرير. لذلك يظل التفسير العملي محدودًا: قد تكون إعادة البناء هدفًا تدريبيًا مفيدًا، لكن الرقم عبر الإنترنت ليس توقعًا قابلًا للنقل.

ReLoop-UME: أضف الحساب عبر العمق

يسأل ReLoop-UME عما إذا كان بإمكان النموذج إجراء مزيد من الحساب المخصص للاسترجاع من دون توليد رموز وسيطة. ويحدد منطقة من المنتصف إلى المراحل المتأخرة تنفصل فيها الأمثلة الإيجابية والسلبية، ثم يعيد استخدام تلك الكتلة ذات المعلمات المشتركة أربع مرات، ويحمل الأدلة عبر خمسة سجلات استرجاع قابلة للتعلم.

على MMEB-V2، يبلّغ نموذج 2B عن 63.2 إجمالًا مقابل 58.0 لـ VLM2Vec-V2 و60.1 لـ UME-R1 في مقارنة الورقة. ويبلّغ نموذج 7B عن 65.9. وعلى وحدة معالجة رسومات H20 واحدة، يقيس المؤلفون 201 مللي ثانية لكل عينة: أسرع بـ 44.9 مرة من UME-R1 وبـ 1.5 مرة من PLUME، لكنه أبطأ بـ 1.3 مرة من خط أساس VLM2Vec-V2 غير التكراري.

يخفي التحسن الإجمالي تحذيرًا. يسجل ReLoop-UME-2B درجة 40.5 في شريحة الفيديو الخاصة بالورقة، وهي أقل من 44.1 التي سجلها PLUME؛ كما تتخلف نتيجة 7B عن UME-R1 في الفيديو. وتستخدم الطريقة ثمانية إطارات. وتذكر قيودها أن التكرار لا يستطيع استعادة الأدلة التي حُذفت أثناء أخذ العينات، وأن تنعيم الحدود الزمنية قد يفوّت الأحداث القصيرة.

لماذا لا يكفي متوسط معيار واحد؟

قُدّم MMEB-V2 مع VLM2Vec-V2 ليغطي 78 مجموعة بيانات: 36 للصور، و18 للفيديو، و24 للمستندات المرئية. ويجعل هذا الاتساع المعيار مفيدًا لتطوير النماذج. لكن المتوسط عبر هذه المهام لا يزال يطبق أوزانًا قد لا تكون لها صلة كبيرة بحجم عمل الإنتاج.

تخيل ثلاثة أنظمة تحصل على الدرجة الإجمالية نفسها:

مساعد دعم يسترجع لقطات الشاشة ورموز الأخطاء الدقيقة.
أرشيف وسائط يسترجع أحداثًا مدتها خمس ثوانٍ داخل مقاطع فيديو طويلة.
نظام RAG مالي يسترجع مخططًا وحاشيته السفلية وفترة التقرير الصحيحة من ملف PDF.

يحتاج الأول إلى دقة معجمية وفهم لقطات الشاشة. ويعتمد الثاني كليًا على التغطية الزمنية. أما الثالث فيحتاج إلى OCR محلي للصفحة، وتخطيطها، ودقة المعدِّلات. ويؤدي حساب متوسط إخفاقاتها إلى رقم نظيف وقرار سيئ.

قراءة مقترحة

ينطبق المبدأ نفسه على قياس النماذج العامة. يجب أن تمثل مجموعة المهام القابلة لإعادة الإنتاج العمل الذي سيؤديه النظام، كما هو موضح في كيفية قياس نماذج AI للعمل الحقيقي. وبالنسبة للاسترجاع، يجب أن تحافظ مجموعة المهام هذه على الوسيط ونوع الفشل الخاصين بكل استعلام.

تقييم قابل لإعادة الإنتاج للتضمينات متعددة الوسائط

ابدأ بلقطة ثابتة من مجموعة البيانات ومجموعة استعلامات تحتوي على أدلة ذات صلة معروفة. احتفظ بالكائن المصدر الأصلي ومدخل التضمين وحكم الصلة معًا. وإلا فسيصبح فشل المُرمِّز وفشل الإدخال غير قابلين للتمييز.

1. أنشئ شرائح الوسائط قبل اختيار المقاييس

أنشئ شرائح منفصلة للنصوص والصور والفيديو والمستندات المرئية. ثم قسّمها مرة أخرى حسب السلوك المهم:

النص: المعرّفات الدقيقة، وإعادة الصياغة، والاستعلامات متعددة اللغات، والنفي، والسلبيات الصعبة.
الصور: هوية الكائن، والتفاصيل المحلية، والعدد، واللون، والموضع، والنص داخل الصورة.
الفيديو: وجود الحدث، والحد الزمني، وقطع الكاميرا، والحدث المتناثر، والأدلة المعتمدة على الصوت.
المستندات المرئية: OCR، وخلايا الجداول، وتسميات المخططات، والحواشي السفلية، والتخطيط متعدد الأعمدة، والمعدِّلات المحلية للصفحة.

أضف حقل تغطية لكل مثال. وسجّل ما إذا كانت أدلة المصدر قد وصلت إلى المُرمِّز. يجب ألا تُسجّل الإطارات المفقودة أو وسيلة إيضاح المخطط المقصوصة أو صفحة PDF المحذوفة على أنها خطأ في التضمين.

2. قارن مسارات الاسترجاع الكاملة

اختبر المرشحين التاليين على الأقل مقابل أحكام الصلة نفسها:

خط أساس معجمي أو نصي فقط، مثل BM25 مع نموذج نصي كثيف.
نموذج متعدد الوسائط ذي متجه واحد.
مسار هجين يدمج الدرجات المتناثرة والكثيفة.
أفضل مرشح مع مُعيد ترتيب، إذا كان إعادة الترتيب ميسورة التكلفة.

يهم خط الأساس الهجين لأن نتيجة UEmbed تُظهر مكاسب تتركز في النصوص والمستندات المرئية، لا في كل وسيط. كما يهم خط الأساس النصي لأن التسميات التوضيحية وOCR والبيانات الوصفية المنظمة قد تكون أرخص للفهرسة، وأسهل في التصحيح، وأفضل للمصطلحات الدقيقة من متجه متعدد الوسائط أصلي.

قراءة مقترحة

إذا كان النظام يملك بالفعل حزام اختبار لـ RAG، فأعد استخدام بنية الاستعلام والصلة والانحدار الخاصة به. ويفصل سير عمل تقييم RAG بين إخفاقات الاسترجاع وإخفاقات توليد الإجابة.

3. قِس الجودة والتغطية والتكلفة معًا

أبلغ عن المقاييس لكل شريحة وعلى شكل توزيعات، لا كمتوسط واحد فقط.

البعدالحد الأدنى للقياس
------
جودة الاسترجاعRecall@k وnDCG@k ومعدل إصابة الأدلة لكل شريحة
الدقة الدقيقةفحوص المعرّف الدقيق والمعدِّل وخلية الجدول وتسمية المخطط وحدود الحدث
تغطية المدخلاتالإطارات والصفحات والمناطق والصوت والبيانات الوصفية المقدمة إلى المُرمِّز
زمن التشغيلزمن استجابة الاستعلام p50 وp95، ومعدل إنتاج التضمينات، وزمن استجابة مُعيد الترتيب
التخزينأبعاد المتجهات، والمنشورات المتناثرة، وعدد بايتات الفهرس لكل كائن
الترحيلزمن إعادة التضمين الكامل، وتضخيم الكتابة، ومدة الفهرسين المتوازيين
الموثوقيةمعدلات المخرجات الفارغة، وانتهاء المهلة، والوسائط غير الصالحة، وفشل إصدار النموذج

يُبقي الملخص الصحيح أسوأ شريحة مهمة ظاهرة. فعلى سبيل المثال، روّج لمرشح فقط عندما يتحسن الإجمالي الموزون ولا تتجاوز أي شريحة محمية ميزانية الانحدار الخاصة بها.

text promote = aggregate_gain > 0 and text_regression <= budget.text and image_regression <= budget.image and video_regression <= budget.video and visual_doc_regression <= budget.visual_doc and p95_latency <= budget.latency

الميزانيات قرارات خاصة بالمنتج. ويمنع هذا الهيكل معيارًا مثقلًا بالصور من تعويض فشل الفيديو في منتج للبحث داخل الفيديو.

مصفوفة تقييم تفصل اختبارات استرجاع النصوص والصور والفيديو والمستندات المرئية قبل الإنتاج
مصفوفة تقييم تفصل اختبارات استرجاع النصوص والصور والفيديو والمستندات المرئية قبل الإنتاج

*قيّم كل مسار استرجاع أولًا، ثم طبّق بوابات التشغيل والترحيل والإصدار المشتركة.*

4. أدر إصدارات مساحة التضمين

يُعد إصدار نموذج التضمين جزءًا من تنسيق البيانات المخزنة. يوضح دليل الترحيل من Google أن `gemini-embedding-001` و`gemini-embedding-2` ينتجان مساحتين غير متوافقتين، ولذلك يتطلب التحديث إعادة تضمين جميع البيانات الموجودة. ولا يمكن مقارنة متجهات الاستعلام من إحدى المساحتين مباشرة بمتجهات المستندات من الأخرى.

قراءة مقترحة

استخدم إصدارات فهارس غير قابلة للتغيير مثل `corpus-model-dimension-preprocess-date`. أنشئ الفهرس الجديد بجانب القديم، وأعد تشغيل مجموعة استعلامات ثابتة، وراقب حركة المرور الحقيقية، وأبقِ إمكانية التراجع متاحة حتى تستقر الجودة وزمن الاستجابة. وسجّل المُرمِّز والأبعاد والتعليمات أو المطالبات ومُخذ عينات الإطارات ومُصيّر PDF وإصدار OCR ومنطق دمج الدرجات في قائمة مواد AI.

5. راقب استعلامات الإنتاج قبل التبديل

يضبط التقييم غير المتصل الحالات المعروفة. أما حركة المرور المراقبة فتختبر التوزيع الفعلي من دون تغيير النتائج الظاهرة للمستخدم. سجّل قوائم المرشحين كلتيهما، وزمن الاستجابة، والنتائج الفارغة، ونوع الشريحة أو المدخل المرتبط بكل اختلاف. وراجع الاختلافات قبل الإطلاق الجزئي.

لا تستخدم النقرات وحدها كحقيقة للصلة. إذ يؤثر انحياز الموضع وأداة الترتيب الحالية في ما يستطيع المستخدمون النقر عليه. ادمج بين أحكام بشرية مأخوذة من عينات، ونجاح المهمة اللاحقة، والإشارات السلوكية.

إطار لاتخاذ القرار في الإنتاج

استخدم نموذج تضمين متعدد الوسائط عندما تغير الأدلة البصرية أو الزمنية الخام الصلة، وعندما يفقد التمثيل النصي تلك الأدلة. واحتفظ بمسار نصي أو هجين أبسط عندما تكون مجموعة البيانات في معظمها نثرًا، أو تهيمن المعرّفات الدقيقة، أو تلتقط التسميات التوضيحية وOCR الموثوقان الإشارة المفيدة بالفعل.

عبء العملالمرشح الأول القويالسبب
---------
بحث المنتجات مع الأسماء وSKU والصوردمج متعدد الوسائط كثيف + معجميالتشابه البصري والمصطلحات الدقيقة مهمان معًا
RAG للقطات الشاشة أو المستندات المرئيةمتعدد الوسائط كثيف + OCR/BM25 + مُعيد ترتيبيحتاج التخطيط والنص المحلي إلى إشارات منفصلة
البحث في الفيديو طويل المدةفهرس على مستوى المقاطع مع تغطية صريحة للإطارات والصوتيخفي متجه واحد للفيديو الكامل الأحداث القصيرة
مستندات نصية في معظمها مع صور عرضيةنموذج نصي كثيف + خط أساس BM25 أولًاتعقيد أقل للفهرس والترحيل
ذاكرة وكيل متعددة الوسائطفهرس متعدد الوسائط بإصدارات مع مصدر صارميحتاج الاسترجاع إلى حدود المصدر والوقت والوسيط

لا تختر نموذجًا أكبر قبل اختبار المعالجة المسبقة. فقد يهيمن اختيار الإطارات وتقسيم الصفحات وOCR وتعليمات الاستعلام والأمثلة السلبية على النتيجة. ويمكن لنشاط المصادر المفتوحة أن يكشف صعوبات التنفيذ، لكنه ليس معيارًا للجودة. في 4 أغسطس 2026، كان مستودع Qwen3-VL-Embedding يضم 32 التزامًا و55 مشكلة مفتوحة؛ وشملت المشكلات الحديثة نقاط نهاية الخدمة وعدم تطابق التمثيلات. هذه إشارات هندسية تستحق التحقيق، وليست أسبابًا لقبول النموذج أو رفضه.

ما الذي تدعمه الأدلة؟

تدعم الأوراق البحثية ثلاث نتائج ملموسة.

أولًا، يمكن لمتجه متعدد الوسائط مضغوط أن يحتفظ بقدر أكبر من الحساب المخصص للاسترجاع مقارنة بتمريرة أمامية واحدة غير معدلة. يضيف DME أهدافًا أثناء التدريب فقط؛ ويضيف ReLoop-UME عمقًا تكراريًا؛ ويستخرج UEmbed وجهتين كثيفة ومتناثرة معًا.

ثانيًا، تغير آلية التمثيل نمط الفشل. يحمل الاسترجاع المتناثر مخاطر معجمية وعابرة للغات. ويحمل العمق التكراري تكاليف التدريب وزمن الاستجابة. ويظل الفيديو عرضة لأخذ العينات قبل تشغيل نموذج التضمين.

ثالثًا، يجب أن تكون أدلة الإنتاج محلية. قاس المؤلفون نتائج مفيدة للمعيار والنظام، لكن لم تقس أي ورقة مجموعة بياناتك أو مزيج استعلاماتك أو ميزانية زمن الاستجابة أو ترحيل الفهرس أو تكلفة الاسترجاع الخاطئ.

الاستنتاج المفيد تشغيلي: لا تعتمد التضمينات متعددة الوسائط إلا بعد اجتياز كل وسيط لاختبارات الاسترجاع والتغطية الخاصة به. قد تبسط مساحة المتجه المشتركة الخدمة. لكن ينبغي أن يظل التقييم غير متساوٍ عمدًا.

الأسئلة الشائعة

هل ينبغي أن تستخدم تضمينات النص والصورة الفهرس نفسه؟

يمكنها مشاركة فهرس عندما يكون النموذج مدرَّبًا لوضع هذه الوسائط في مساحة واحدة متوافقة، ويكون الاسترجاع عبر الوسائط جزءًا من المهمة. احتفظ بالحقول أو الفهارس منفصلة عندما يكون الاسترجاع المعجمي أو المرشحات الخاصة بالوسيط أو معدلات التحديث المختلفة أو التراجع المستقل أمورًا مهمة. اختبر دمج الدرجات على أحكام صلة حقيقية بدل افتراض أن تخطيطًا واحدًا أفضل.

هل أحتاج إلى إعادة تضمين البيانات عند تغيير النماذج؟

عادةً نعم. لا يمكن مقارنة مساحات التضمين من نماذج مختلفة أو إصدارات غير متوافقة بأمان. أنشئ فهرسًا بديلًا بإصدار، وأعد تضمين مجموعة البيانات، وراقب الاستعلامات مقابل الفهرسين، وأبقِ الفهرس القديم حتى يجتاز الجديد بوابات الجودة وزمن الاستجابة لكل شريحة.

فحوص الادعاءات

الادعاءالحالةحدود الدليل
---------
يبلّغ UEmbed-9B عن 71.8 للاسترجاع الكثيف و71.0 للاسترجاع المتناثر على MMEB-V2.تم التحققورقة UEmbed، الإصدار 1، 3 أغسطس 2026.
تتركز مكاسب UEmbed الهجينة في النصوص والمستندات المرئية.تم التحققتُبلغ الورقة عن +0.3 للنص و+0.5 للمستندات المرئية، مع تغير طفيف في غيرها.
يبلّغ DME-2B عن ارتفاع تراكمي من 70.9 إلى 74.8 عبر مراحل التدريب.تم التحققجدول الاستئصال في DME؛ النتيجة تخص إعداد المؤلفين.
يتنبأ مكسب DME عبر الإنترنت البالغ 0.1% بتأثير عملية نشر أخرى.مرفوضالمقياس الداخلي وحركة المرور والبيانات وظروف النشر غير متاحة للعامة.
ReLoop-UME أسرع بـ 44.9 مرة من UME-R1.مؤهلقيس ذلك في إعداد H20 واحد خاص بالورقة؛ وليس نسبة خدمة عامة.
يستطيع العمق التكراري استعادة حدث فيديو حُذف أثناء أخذ عينات الإطارات.مرفوضتذكر الورقة أنه لا يمكن استعادة الأدلة غير المرئية.
يكفي متوسط MMEB-V2 واحد لاتخاذ قرار إنتاجي.مرفوضيغطي المعيار 78 مجموعة بيانات ووسائط مختلفة؛ وتختلف أوزان الإنتاج وتكاليف الفشل.
يعالج Gemini Embedding 2 كل إطار فيديو ومساره الصوتي.مرفوضتحد الوثائق الرسمية المعالجة بـ 32 إطارًا وتستبعد صوت الفيديو.
يتطلب التحديث من Gemini Embedding 001 إلى 2 إعادة تضمين البيانات الموجودة.تم التحققتوثق Google أن المساحتين غير متوافقتين.
تثبت نجوم المستودع أو المشكلات المفتوحة جودة الاسترجاع.مرفوضإنها إشارات إلى التبني والصيانة، وليست قياسات جودة مضبوطة.

المصادر

UEmbed: Unified Sparse and Dense Multimodal Embeddings — بحث أساسي؛ البنية، والتدريب على البيانات العامة، ونتائج MMEB-V2، والاسترجاع الهجين، والقيود.
Douyin Multimodal Embedding Model Technical Report — بحث أساسي؛ التدريب على مرحلتين، ودراسات الاستئصال، ونتائج الإنتاج المُبلغ عنها، وحدود الخدمة.
ReLoop-UME: Recurrent Depth with Learnable Retrieval Registers for Universal Multimodal Embedding — بحث أساسي؛ البنية التكرارية، ونتائج الوسائط، ومقارنة زمن الاستجابة على H20، والقيود.
VLM2Vec-V2: Advancing Multimodal Embedding for Videos, Images, and Visual Documents — بحث أساسي؛ نطاق معيار MMEB-V2 وتصميم مهمة الاسترجاع متعددة الوسائط.
Gemini API embeddings guide — وثائق رسمية؛ الوسائط المدعومة، وحدود المعالجة، وتعليمات المهام، والتجميع، والأبعاد، ومتطلبات الترحيل.
Gemini Embedding 2 model page — وثائق النموذج الرسمية وحالات الاستخدام المقصودة.
Qwen3-VL-Embedding-2B model card — بطاقة النموذج الرسمية؛ المدخلات والسياق والأبعاد والتعليمات وجدول المعيار.
UEmbed repository — التنفيذ الرسمي مفتوح المصدر؛ جرى التحقق من الإصدارات والالتزامات والمشكلات والتفرعات والنشاط الحديث في 4 أغسطس 2026.
Qwen3-VL-Embedding repository — التنفيذ الرسمي مفتوح المصدر؛ جرى التحقق من الالتزامات والمشكلات والإصدارات والتفرعات وإشارات التنفيذ في 4 أغسطس 2026.