Multimodal Embeddings: Production Öncesinde Her Modaliteyi Test Edin
Tech
AI
Multimodal Embeddings
Information Retrieval
RAG

Multimodal Embeddings: Production Öncesinde Her Modaliteyi Test Edin

Tek bir multimodal retrieval skoru, başarısız olan video, görsel veya doküman hattını gizleyebilir. Production öncesinde her modaliteyi değerlendirin.

Uygar DuzgunUUygar Duzgun
Aug 4, 2026
Güncellendi 16 Ağu 2026
15 min read

Multimodal Embeddings: Production Öncesinde Her Modaliteyi Test Edin

Hedef kitle: Metin, görseller, video ve görsel dokümanlar üzerinde search, RAG, recommendation veya agent sistemleri geliştiren ileri düzey uygulayıcılar.

Multimodal embeddings, çeşitli retrieval pipeline'larını tek bir vector space'te birleştirebilir. Ancak evaluation sürecini tek bir skora indirgemez. Bir model aggregate benchmark'ta öne çıkarken production sisteminin ihtiyaç duyduğu kısa video olaylarını, kesin terimleri, chart etiketlerini veya sayfaya özgü kanıtları kaçırabilir.

Production kuralı basittir: text, image, video ve visual-document sonuçlarını ayrı tutun; her birinin ilgili olduğu yerde dense, sparse ve hybrid retrieval'ı karşılaştırın; encoder'ın hiç görmediği şeyleri ölçün; her model değişikliğini bir index migration olarak ele alın.

Beş gün içinde yayımlanan üç paper bu sınırı alışılmadık derecede net gösteriyor. UEmbed, tek geçişte dense ve sparse representation'lar üretir. Douyin'in DME'si, retrieval kanıtını koruyan kompakt bir vector eğitir. ReLoop-UME ise rationale token'ları üretmeden recurrent depth ekler. Üçü de daha güçlü retrieval bildiriyor, ancak failure pattern'leri farklı operational risk'lere işaret ediyor.

Multimodal embeddings nedir?

Multimodal embeddings, farklı input türlerini ortak bir space'te karşılaştırılabilen vector'lere dönüştürür. Bir text query bir photograph'ı retrieve edebilir, bir video bir text description ile eşleşebilir veya bir screenshot görsel olarak benzer bir document page'i retrieve edebilir.

Bu ortak interface kullanışlıdır; çünkü retrieval sistemi her candidate üzerinde generative model çalıştırmak yerine approximate nearest-neighbor search kullanabilir. Ancak anlamlı farklılıkları da gizler. Text, kesin lexical sinyaller içerir. Images, yerel nesneler ve ilişkiler içerir. Video, event timing ve frame selection ekler. Visual documents ise layout, OCR, tables, charts ve page context'i birleştirir.

Güncel sistemler bu farklılıkları kendi sınırlarında ortaya koyuyor. Google'ın Gemini Embedding 2 documentation text, images, video, audio ve PDFs'i tek bir space'e map eder; ancak video başına en fazla 32 frame işler ve videonun audio track'ini işlemez. PDFs, request başına altı sayfa ile sınırlıdır. Qwen3-VL-Embedding-2B model card, 32K context ve 64 ile 2.048 arasında configurable dimensions ile text, images, screenshots, video ve mixed inputs'ı destekler.

Bu yetenekler bir evaluation planının girdileridir; belirli bir corpus için her modalitenin eşit derecede iyi çalıştığına dair kanıt değildir.

Üç yeni paper gerçekte neyi ölçtü?

Paper'lar aynı retrieval kısıtının farklı bölümlerini optimize ediyor: her query'yi yavaş bir generation task'ına dönüştürmeden discrimination için yeterli kanıtı korumak.

SistemMekanizmaBildirilen sonuçÖnemli sınır
------------
UEmbedTek bir causal pass, dense ve learned sparse vector'ler üretirUEmbed-9B, MMEB-V2'de 71.8 dense ve 71.0 sparse bildiriyorSparse quality cross-lingually daha zayıf; video'da dense-sparse farkı daha büyük
DMEContrastive pretraining ile yalnızca training sırasında kullanılan latent reasoning ve reconstructionDME-2B, MMEB-V2'de 74.8; DME-9B ise 78.4 bildiriyorInternal production data, evaluation set ve 0.1% Lifetime metriği public değil
ReLoop-UMERetrieval registers ile shared middle-to-late block'u yeniden kullanırReLoop-UME, kendi H20 setup'ında UME-R1'e göre 44.9× daha düşük latency bildiriyorTraining cost ekler ve frame sampling sırasında atlanan video kanıtını geri getiremez

Bu sayılar authors' experiments'tan geliyor. Ortak bir production environment'ın sonuçları değiller ve hardware, data, model scale ve serving stack'leri kontrol edilmiş gibi karşılaştırılmamalılar.

UEmbed: tek geçişte dense ve sparse retrieval

UEmbed, decoder-only multimodal model'e 16 learnable special token ekler. Her token, ayrı bir vocabulary partition üzerinde sparse weight'ler tahmin eder; final end-of-sequence state ise dense vector'ü sağlar. Authors, public data ile eğitilmiş 2B, 4B ve 9B varyantlarını yayımlar.

UEmbed-9B, MMEB-V2'de dense retrieval için 71.8 ve sparse retrieval için 71.0 bildiriyor. Hybrid result, dense retrieval'a kıyasla text için 0.3, visual documents için 0.5 puan ekliyor; images ve video için ise çok az değişiklik gösteriyor. Bu sonuç dar kapsamlı bir çıkarımı destekliyor: learned sparse signals, exact terms veya document text'in önemli olduğu yerlerde dense retrieval'ı tamamlayabilir. Hybrid search'ün her modaliteyi iyileştirdiğini göstermiyor.

Sınırlamalar pratik nitelikte. Training data English ve Chinese'a eğilimli ve paper daha zayıf cross-lingual sparse generalization bildiriyor. Sparse representation ayrıca vocabulary artifact'larını koruyor. Video, dense ve sparse performance arasında daha büyük bir fark gösteriyor ve paper tam bir inverted-index efficiency study sunmuyor.

UEmbed repository, 4 Ağustos 2026'da kontrol edildiğinde yalnızca birkaç günlük durumdaydı. İki commit, altı star, hiç fork ve hiç release yoktu. Bu sayılar model quality'yi değil, maturity'yi tanımlar. Implementation yeterince erken aşamada olduğundan production ekipleri interface ve serving değişiklikleri beklemelidir.

DME: vector'ü retrieval kanıtını koruyacak şekilde eğitmek

Douyin Multimodal Embedding technical report, learning sürecini iki aşamaya ayırır. Large-scale contrastive pretraining önce geniş bir shared space oluşturur. Training-only latent reasoning ve cross-conditional reconstruction ise compact embedding'i counterpart'ı hakkındaki fine-grained kanıtı korumaya zorlar.

Bildirilen MMEB-V2 skoru, 2B model için stage-one pretraining sonrasında 70.9 baseline'dan 72.5'e, evidence-grounded latent reasoning sonrasında 73.8'e ve reconstruction sonrasında 74.8'e yükseliyor. 9B model 78.4 bildiriyor. Paper ayrıca internal offline set'te %2.92 relative gain ve online A/B test'te internal Lifetime metriğinde %0.1 gain bildiriyor.

Authors bu production sonuçlarını Douyin içinde ölçtü. Paper, evidence-preserving training'in generative serving overhead olmadan industrial retrieval'ı iyileştirdiği sonucuna varıyor. Bir reader, report'tan internal dataset'i, metric definition'ı, traffic mix'i veya deployment conditions'ı bağımsız olarak yeniden üretemez. Bu nedenle pratik yorum sınırlıdır: reconstruction yararlı bir training objective olabilir, ancak online sayı transferable bir forecast değildir.

ReLoop-UME: depth boyunca computation eklemek

ReLoop-UME, intermediate token'lar üretmeden bir modelin retrieval-specific computation'ı artırıp artıramayacağını sorar. Positive ve negative example'ların ayrıldığı middle-to-late region'ı belirler, parameter-shared block'u dört kez yeniden kullanır ve kanıtı beş learnable retrieval register üzerinden taşır.

MMEB-V2'de 2B model, paper'ın comparison'ında VLM2Vec-V2'nin 58.0 ve UME-R1'in 60.1 sonucuna karşılık overall 63.2 bildiriyor. 7B model 65.9 bildiriyor. Tek bir H20 GPU'da authors sample başına 201 milliseconds ölçüyor: UME-R1'den 44.9×, PLUME'dan 1.5× daha hızlı; ancak non-recurrent VLM2Vec-V2 baseline'dan 1.3× daha yavaş.

Aggregate improvement bir uyarıyı gizliyor. ReLoop-UME-2B, paper'ın video slice'ında 40.5 skor alıyor; bu, PLUME'ın 44.1 sonucunun altında. 7B result da video'da UME-R1'in gerisinde kalıyor. Method sekiz frame sample ediyor. Kendi limitations bölümü, recurrence'in sampling sırasında atlanan kanıtı geri getiremeyeceğini ve temporal-boundary smoothing'in kısa olayları kaçırabileceğini belirtiyor.

Tek bir benchmark average neden yeterli değildir?

MMEB-V2, 78 dataset'i kapsamak üzere VLM2Vec-V2 ile tanıtıldı: 36 image, 18 video ve 24 visual-document dataset'i. Bu kapsam model development için onu kullanışlı kılar. Ancak bu task'ler üzerindeki mean, production workload ile çok az ilişkisi olabilecek ağırlıklar uygular.

Aynı aggregate score'u alan üç sistem düşünün:

Bir support assistant screenshot'ları ve exact error code'ları retrieve eder.
Bir media archive, uzun videolar içindeki beş saniyelik event'leri retrieve eder.
Bir financial RAG system, bir PDF'ten chart'ı, dipnotunu ve doğru reporting period'ı retrieve eder.

İlki lexical precision ve screenshot understanding gerektirir. İkincisi temporal coverage'a bağlıdır. Üçüncüsü page-local OCR, layout ve modifier accuracy gerektirir. Bu failure'ları average etmek temiz bir sayı ve kötü bir karar üretir.

Sizin için önerilenler

Aynı ilke general model benchmarking için de geçerlidir. Reproducible bir task set, How to Benchmark AI Models for Real Work içinde açıklandığı gibi bir sistemin yapacağı işi temsil etmelidir. Retrieval için bu task set, her query'nin modality'sini ve failure type'ını korumalıdır.

Reproducible bir multimodal embedding evaluation

Bilinen relevant evidence içeren frozen bir corpus snapshot ve query set ile başlayın. Original source object'i, embedding input'unu ve relevance judgment'ı birlikte tutun. Aksi takdirde encoder failure ile ingestion failure birbirinden ayırt edilemez.

1. Metric seçmeden önce modality slice'ları oluşturun

Text, images, video ve visual documents için ayrı slice'lar oluşturun. Bunları önem taşıyan davranışa göre yeniden bölün:

Text: exact identifiers, paraphrases, multilingual queries, negation ve hard negatives.
Images: object identity, local detail, count, color, position ve image içindeki text.
Video: event presence, temporal boundary, camera cut, sparse event ve audio-dependent evidence.
Visual documents: OCR, table cells, chart labels, footnotes, multi-column layout ve page-local modifiers.

Her example için bir coverage field ekleyin. Source evidence'ın encoder'a ulaşıp ulaşmadığını kaydedin. Kaçırılmış bir frame, crop edilmiş chart legend veya dahil edilmemiş PDF page'i embedding error olarak skorlanmamalıdır.

2. Complete retrieval pipeline'larını karşılaştırın

Aynı relevance judgment'lara karşı en az şu candidate'ları test edin:

BM25 ve bir text dense model gibi lexical veya text-only baseline.
Single-vector multimodal model.
Sparse ve dense score'ları birleştiren hybrid pipeline.
Reranking karşılanabilir durumdaysa, reranker içeren en iyi candidate.

Hybrid baseline önemlidir; çünkü UEmbed sonucu gain'lerin her modalitede değil, text ve visual documents'ta yoğunlaştığını gösteriyor. Text baseline da önemlidir; çünkü captions, OCR ve structured metadata, native multimodal vector'den daha ucuz index'lenebilir, debug edilmesi daha kolay olabilir ve exact terms için daha iyi sonuç verebilir.

Sizin için önerilenler

Sistem zaten bir RAG test harness kullanıyorsa query, relevance ve regression yapısını yeniden kullanın. RAG evaluation workflow, retrieval miss'lerini answer-generation failure'larından ayırır.

3. Quality, coverage ve cost'u birlikte ölçün

Metric'leri yalnızca tek bir mean olarak değil, slice başına ve distribution olarak raporlayın.

BoyutMinimum ölçüm
------
Retrieval qualitySlice başına Recall@k, nDCG@k ve evidence hit rate
Fine-grained accuracyExact identifier, modifier, table cell, chart label ve event-boundary kontrolleri
Input coverageEncoder'a sunulan frames, pages, regions, audio ve metadata
Runtimep50 ve p95 query latency, encoding throughput, reranker latency
StorageVector dimensions, sparse postings, object başına index bytes
MigrationFull re-embedding time, write amplification, dual-index duration
ReliabilityEmpty output, timeout, malformed media ve model-version failure rate'leri

Geçerli bir summary, önemli en kötü slice'ı görünür tutar. Örneğin bir candidate'ı yalnızca weighted aggregate iyileştiğinde ve hiçbir protected slice regression budget'ını aşmadığında promote edin.

text promote = aggregate_gain > 0 and text_regression <= budget.text and image_regression <= budget.image and video_regression <= budget.video and visual_doc_regression <= budget.visual_doc and p95_latency <= budget.latency

Budget'lar product kararlarıdır. Bu yapı, image ağırlıklı bir benchmark'ın video-search product'ındaki video failure'ını telafi etmesini önler.

Production öncesinde text, image, video ve visual-document retrieval testlerini ayıran evaluation matrix
Production öncesinde text, image, video ve visual-document retrieval testlerini ayıran evaluation matrix

*Önce her retrieval lane'i değerlendirin, ardından ortak runtime, migration ve release gate'lerini uygulayın.*

4. Embedding space'i version'layın

Bir embedding model version'ı, stored data format'ın bir parçasıdır. Google'ın migration guide'ı `gemini-embedding-001` ve `gemini-embedding-2`'nin incompatible space'ler ürettiğini, dolayısıyla upgrade için mevcut tüm data'nın yeniden embed edilmesi gerektiğini belirtir. Bir space'ten gelen query vector'ler, diğer space'teki document vector'leriyle doğrudan karşılaştırılamaz.

Sizin için önerilenler

`corpus-model-dimension-preprocess-date` gibi immutable index version'ları kullanın. New index'i old index'in yanında oluşturun, fixed query set'i yeniden oynatın, gerçek traffic'i shadow'layın ve quality ile latency stabilize olana kadar rollback'i mümkün tutun. Encoder'ı, dimension'ı, prompts veya task instructions'ı, frame sampler'ı, PDF renderer'ı, OCR version'ını ve score-fusion logic'ini bir AI bill of materials içinde kaydedin.

5. Switch etmeden önce production query'lerini shadow'layın

Offline evaluation bilinen case'leri kontrol eder. Shadow traffic, user-visible result'ları değiştirmeden gerçek distribution'ı test eder. Her disagreement ile ilişkili iki candidate list'i, latency'yi, empty result'ları ve slice veya input type'ı loglayın. Partial rollout'dan önce disagreement'ları inceleyin.

Click'leri tek başına relevance truth olarak kullanmayın. Position bias ve mevcut ranker, kullanıcıların neye tıklayabileceğini şekillendirir. Sample edilmiş human judgment'ları, downstream task success'i ve behavioral signal'ları birleştirin.

Production için bir decision framework

Raw visual veya temporal evidence relevance'i değiştirdiğinde ve bir text representation bu evidence'ı kaybettiğinde multimodal embedding model kullanın. Corpus çoğunlukla prose'dan oluşuyorsa, exact identifier'lar baskınsa veya güvenilir captions ve OCR yararlı sinyali zaten yakalıyorsa daha basit bir text veya hybrid pipeline'ı koruyun.

WorkloadGüçlü ilk candidateNeden
---------
Names, SKUs ve images içeren product searchDense multimodal + lexical fusionVisual similarity ve exact terms birlikte önemlidir
Screenshot veya visual-document RAGMultimodal dense + OCR/BM25 + rerankerLayout ve local text ayrı sinyallere ihtiyaç duyar
Long-form video searchExplicit frame ve audio coverage içeren segment-level indexFull video için tek vector kısa event'leri gizler
Ara sıra images içeren çoğunlukla text documentsÖnce text dense + BM25 baselineDaha düşük index ve migration complexity
Cross-modal agent memoryStrict provenance içeren versioned multimodal indexRetrieval source, time ve modality boundaries gerektirir

Preprocessing'i test etmeden daha büyük bir model seçmeyin. Frame selection, page segmentation, OCR, query instructions ve negative examples sonucu domine edebilir. Open-source activity implementation friction'ı gösterebilir, ancak quality benchmark'ı değildir. 4 Ağustos 2026 itibarıyla Qwen3-VL-Embedding repository'sinde 32 commit ve 55 open issue vardı; recent issue'lar arasında serving endpoints ve representation mismatches bulunuyordu. Bunlar araştırılması gereken engineering signal'larıdır; modeli kabul veya reddetme nedenleri değildir.

Kanıt neyi destekliyor?

Paper'lar üç somut sonucu destekliyor.

İlk olarak, compact bir multimodal vector, tek ve değiştirilmemiş bir forward pass'ten daha fazla retrieval-specific computation koruyabilir. DME training-only objective'ler ekler; ReLoop-UME recurrent depth ekler; UEmbed dense ve sparse view'ları birlikte türetir.

İkinci olarak, representation mechanism failure pattern'ini değiştirir. Sparse retrieval lexical ve cross-lingual riskler taşır. Recurrent depth training ve latency cost'ları taşır. Video, embedding model çalışmadan önce sampling'e karşı savunmasız kalmaya devam eder.

Üçüncü olarak, production evidence local olmalıdır. Authors yararlı benchmark ve system sonuçlarını ölçtü, ancak hiçbir paper sizin corpus'unuzu, query mix'inizi, latency budget'ınızı, index migration'ınızı veya yanlış retrieval'ın cost'unu ölçmedi.

Yararlı sonuç operational'dır: multimodal embeddings'i ancak her modalite kendi retrieval ve coverage test'lerini geçtikten sonra benimseyin. Shared vector space serving'i basitleştirebilir. Evaluation ise bilinçli olarak uneven kalmalıdır.

FAQ

Text ve image embeddings aynı index'i kullanmalı mı?

Model bu modality'leri compatible tek bir space'e yerleştirmek üzere eğitildiyse ve cross-modal retrieval task'ın parçasıysa aynı index'i paylaşabilirler. Lexical retrieval, modality-specific filters, farklı update rate'leri veya bağımsız rollback önemliyse ayrı field'lar veya index'ler tutun. Bir layout'un daha iyi olduğunu varsaymak yerine score fusion'ı gerçek relevance judgment'lar üzerinde test edin.

Model değiştirirken data'yı yeniden embed etmem gerekir mi?

Genellikle evet. Farklı model'lerden veya incompatible version'lar'dan gelen embedding space'ler güvenli biçimde karşılaştırılamaz. Versioned replacement index oluşturun, corpus'u yeniden embed edin, query'leri her iki index'e karşı shadow'layın ve yeni index per-slice quality ve latency gate'lerini geçene kadar eski index'i tutun.

Claim checks

ClaimDurumKanıt sınırı
---------
UEmbed-9B, MMEB-V2'de 71.8 dense ve 71.0 sparse bildiriyor.DoğrulandıUEmbed paper, version 1, 3 Ağustos 2026.
UEmbed hybrid gain'leri text ve visual documents'ta yoğunlaşıyor.DoğrulandıPaper text için +0.3 ve visual documents için +0.5 bildiriyor; diğer yerlerde çok az değişiklik var.
DME-2B, training stage'leri boyunca 70.9'dan 74.8'e cumulative rise bildiriyor.DoğrulandıDME ablation table; sonuç authors' setup'ına aittir.
DME'nin %0.1 online gain'i başka bir deployment'ın impact'ini öngörür.ReddedildiInternal metric, traffic, data ve deployment conditions public değil.
ReLoop-UME, UME-R1'den 44.9× daha hızlıdır.NitelendirildiPaper'ın single-H20 setup'ında ölçülmüştür; universal serving ratio değildir.
Recurrent depth, frame sampling'in atladığı bir video event'ini geri getirebilir.ReddedildiPaper, görülmeyen evidence'ın geri getirilemeyeceğini belirtiyor.
Tek bir MMEB-V2 average production kararı için yeterlidir.ReddedildiBenchmark 78 dataset'i ve farklı modality'leri kapsar; production weights ve failure cost'ları farklıdır.
Gemini Embedding 2 her video frame'ini ve audio track'ini işler.ReddedildiOfficial docs processing'i 32 frame ile sınırlar ve video audio'sunu hariç tutar.
Gemini Embedding 001'den 2'ye upgrade mevcut data'nın yeniden embed edilmesini gerektirir.DoğrulandıGoogle space'leri incompatible olarak belgeler.
Repository star'ları veya open issue'lar retrieval quality'yi kanıtlar.ReddedildiBunlar controlled quality measurement değil, adoption ve maintenance signal'larıdır.

Sources

UEmbed: Unified Sparse and Dense Multimodal Embeddings — primary research; architecture, public-data training, MMEB-V2 results, hybrid retrieval ve limitations.
Douyin Multimodal Embedding Model Technical Report — primary research; two-stage training, ablations, reported production results ve serving boundary.
ReLoop-UME: Recurrent Depth with Learnable Retrieval Registers for Universal Multimodal Embedding — primary research; recurrent architecture, modality results, H20 latency comparison ve limitations.
VLM2Vec-V2: Advancing Multimodal Embedding for Videos, Images, and Visual Documents — primary research; MMEB-V2 benchmark scope ve multimodal retrieval task design.
Gemini API embeddings guide — official documentation; supported modalities, processing limits, task instructions, aggregation, dimensions ve migration requirements.
Gemini Embedding 2 model page — official model documentation ve intended use cases.
Qwen3-VL-Embedding-2B model card — official model card; inputs, context, dimensions, instructions ve benchmark table.
UEmbed repository — official open-source implementation; 4 Ağustos 2026'da releases, commits, issues, forks ve recent activity için kontrol edildi.
Qwen3-VL-Embedding repository — official open-source implementation; 4 Ağustos 2026'da commits, issues, releases, forks ve implementation signals için kontrol edildi.