Embeddings multimodais: teste cada modalidade antes da produção
Tech
AI
Multimodal Embeddings
Information Retrieval
RAG

Embeddings multimodais: teste cada modalidade antes da produção

Uma única pontuação de recuperação multimodal pode ocultar uma falha na camada de vídeo, imagem ou documento. Avalie cada modalidade antes da produção.

Uygar DuzgunUUygar Duzgun
Aug 4, 2026
Atualizado 16 de ago. de 2026
15 min read

Embeddings multimodais: teste cada modalidade antes da produção

Público: profissionais avançados que desenvolvem sistemas de busca, RAG, recomendação ou agentes para texto, imagens, vídeo e documentos visuais.

Embeddings multimodais podem reduzir vários pipelines de recuperação a um único espaço vetorial. Eles não reduzem a avaliação a uma única pontuação. Um modelo pode liderar um benchmark agregado enquanto não encontra eventos curtos em vídeos, termos exatos, rótulos de gráficos ou evidências locais da página de que um sistema de produção precisa.

A regra para produção é simples: mantenha separados os resultados de texto, imagem, vídeo e documentos visuais; compare a recuperação densa, esparsa e híbrida onde cada uma for relevante; meça o que o encoder nunca viu; e trate toda mudança de modelo como uma migração de índice.

Três artigos publicados em um intervalo de cinco dias deixam esse limite especialmente claro. UEmbed gera representações densas e esparsas em uma única passagem. O DME, da Douyin, treina um vetor compacto para preservar evidências de recuperação. O ReLoop-UME adiciona profundidade recorrente sem gerar tokens de justificativa. Todos relatam uma recuperação mais forte, mas seus padrões de falha apontam para riscos operacionais diferentes.

O que são embeddings multimodais?

Embeddings multimodais mapeiam diferentes tipos de entrada em vetores que podem ser comparados em um espaço compartilhado. Uma consulta de texto pode recuperar uma fotografia, um vídeo pode corresponder a uma descrição textual ou uma captura de tela pode recuperar uma página de documento visualmente semelhante.

Essa interface compartilhada é útil porque o sistema de recuperação pode usar busca aproximada de vizinhos mais próximos em vez de executar um modelo generativo em todos os candidatos. Ela também oculta diferenças importantes. O texto contém sinais lexicais exatos. As imagens contêm objetos e relações locais. O vídeo adiciona o tempo dos eventos e a seleção de quadros. Os documentos visuais combinam layout, OCR, tabelas, gráficos e contexto da página.

Os sistemas atuais expõem essas diferenças em suas próprias limitações. A documentação do Gemini Embedding 2 do Google mapeia texto, imagens, vídeo, áudio e PDFs para um único espaço, mas processa no máximo 32 quadros por vídeo e não processa a faixa de áudio de um vídeo. Os PDFs são limitados a seis páginas por solicitação. O cartão do modelo Qwen3-VL-Embedding-2B oferece suporte a texto, imagens, capturas de tela, vídeo e entradas mistas com um contexto de 32K e dimensões configuráveis de 64 a 2.048.

Esses recursos são entradas para um plano de avaliação, não evidências de que todas as modalidades funcionem igualmente bem para um corpus específico.

O que os três novos artigos realmente mediram

Os artigos otimizam partes diferentes da mesma restrição de recuperação: preservar evidências suficientes para a discriminação sem transformar cada consulta em uma tarefa lenta de geração.

SistemaMecanismoResultado relatadoLimite importante
------------
UEmbedUma passagem causal produz vetores densos e esparsos aprendidosUEmbed-9B relata 71,8 denso e 71,0 esparso no MMEB-V2A qualidade esparsa é mais fraca entre idiomas; o vídeo tem uma diferença maior entre denso e esparso
DMEPré-treinamento contrastivo mais raciocínio latente e reconstrução usados apenas no treinamentoDME-2B relata 74,8 e DME-9B 78,4 no MMEB-V2Os dados internos de produção, o conjunto de avaliação e a métrica Lifetime de 0,1% não são públicos
ReLoop-UMEReutiliza um bloco compartilhado de médio a tardio com registros de recuperaçãoReLoop-UME relata latência 44,9× menor que UME-R1 em sua configuração com H20Adiciona custo de treinamento e não pode recuperar evidências de vídeo omitidas durante a amostragem de quadros

Esses números vêm dos experimentos dos autores. Eles não são resultados de um ambiente de produção comum e não devem ser comparados como se hardware, dados, escala do modelo e stacks de serving estivessem controlados.

UEmbed: recuperação densa e esparsa em uma única passagem

O UEmbed adiciona 16 tokens especiais aprendíveis a um modelo multimodal somente decodificador. Cada token prevê pesos esparsos sobre uma partição de vocabulário separada; o estado final de fim de sequência fornece o vetor denso. Os autores disponibilizam variantes de 2B, 4B e 9B treinadas com dados públicos.

O UEmbed-9B relata 71,8 para recuperação densa e 71,0 para recuperação esparsa no MMEB-V2. O resultado híbrido adiciona 0,3 ponto para texto e 0,5 para documentos visuais em relação à recuperação densa, com pouca mudança para imagens e vídeo. Esse resultado sustenta uma inferência restrita: sinais esparsos aprendidos podem complementar a recuperação densa quando termos exatos ou texto de documentos são importantes. Ele não mostra que a busca híbrida melhora todas as modalidades.

As limitações são práticas. Os dados de treinamento são concentrados em inglês e chinês, e o artigo relata uma generalização esparsa entre idiomas mais fraca. Sua representação esparsa também mantém artefatos de vocabulário. O vídeo mostra uma diferença maior entre o desempenho denso e esparso, e o artigo não fornece um estudo completo de eficiência de índice invertido.

O repositório do UEmbed tinha apenas alguns dias quando foi verificado em 4 de agosto de 2026. Ele tinha dois commits, seis estrelas, nenhum fork e nenhum release. Esses números descrevem maturidade, não qualidade do modelo. A implementação é recente o suficiente para que as equipes de produção devam esperar mudanças de interface e serving.

DME: treinar o vetor para preservar evidências de recuperação

O relatório técnico do Douyin Multimodal Embedding separa o aprendizado em duas etapas. Primeiro, o pré-treinamento contrastivo em larga escala cria um espaço compartilhado amplo. Em seguida, o raciocínio latente e a reconstrução cross-conditional usados apenas no treinamento pressionam o embedding compacto a preservar evidências detalhadas sobre seu correspondente.

A pontuação relatada no MMEB-V2 sobe de uma linha de base de 70,9 para 72,5 após o pré-treinamento da primeira etapa, 73,8 após o raciocínio latente fundamentado em evidências e 74,8 após a reconstrução para o modelo 2B. O modelo 9B relata 78,4. O artigo também relata um ganho relativo de 2,92% em um conjunto offline interno e um ganho de 0,1% em uma métrica Lifetime interna em um teste A/B online.

Os autores mediram esses resultados de produção dentro da Douyin. O artigo infere que o treinamento que preserva evidências melhora a recuperação industrial sem o overhead de serving generativo. Um leitor não pode reproduzir independentemente o conjunto de dados interno, a definição da métrica, a composição do tráfego ou as condições de implantação a partir do relatório. A interpretação prática é, portanto, limitada: a reconstrução pode ser um objetivo de treinamento útil, mas o número online não é uma previsão transferível.

ReLoop-UME: adicionar computação ao longo da profundidade

O ReLoop-UME pergunta se um modelo pode realizar mais computação específica para recuperação sem gerar tokens intermediários. Ele identifica uma região de médio a tardio estágio na qual exemplos positivos e negativos se separam, reutiliza esse bloco com parâmetros compartilhados quatro vezes e transporta evidências por meio de cinco registros de recuperação aprendíveis.

No MMEB-V2, o modelo 2B relata 63,2 no total, contra 58,0 para VLM2Vec-V2 e 60,1 para UME-R1 na comparação do artigo. O modelo 7B relata 65,9. Em uma única GPU H20, os autores medem 201 milissegundos por amostra: 44,9× mais rápido que UME-R1 e 1,5× mais rápido que PLUME, mas 1,3× mais lento que a linha de base VLM2Vec-V2 não recorrente.

A melhoria agregada oculta um alerta. O ReLoop-UME-2B marca 40,5 na fatia de vídeo do artigo, abaixo dos 44,1 do PLUME; o resultado do 7B também fica atrás do UME-R1 em vídeo. O método amostra oito quadros. Suas próprias limitações afirmam que a recorrência não pode recuperar evidências que a amostragem omitiu e que o suavizamento dos limites temporais pode não detectar eventos curtos.

Por que uma única média de benchmark é insuficiente

O MMEB-V2 foi apresentado com o VLM2Vec-V2 para abranger 78 conjuntos de dados: 36 de imagem, 18 de vídeo e 24 de documentos visuais. Essa amplitude o torna útil para o desenvolvimento de modelos. Uma média dessas tarefas ainda aplica pesos que podem ter pouca relação com uma carga de trabalho de produção.

Considere três sistemas que recebem a mesma pontuação agregada:

Um assistente de suporte recupera capturas de tela e códigos de erro exatos.
Um arquivo de mídia recupera eventos de cinco segundos dentro de vídeos longos.
Um sistema de RAG financeiro recupera um gráfico, sua nota de rodapé e o período de referência correto de um PDF.

O primeiro precisa de precisão lexical e compreensão de capturas de tela. O segundo depende da cobertura temporal. O terceiro precisa de OCR local da página, layout e precisão dos modificadores. Tirar a média de suas falhas produz um número limpo e uma decisão ruim.

Recomendado para você

O mesmo princípio se aplica ao benchmarking geral de modelos. Um conjunto de tarefas reproduzível deve representar o trabalho que um sistema realizará, conforme descrito em Como fazer benchmark de modelos de AI para trabalho real. Para recuperação, esse conjunto de tarefas deve preservar a modalidade e o tipo de falha de cada consulta.

Uma avaliação reproduzível de embeddings multimodais

Comece com um snapshot congelado do corpus e um conjunto de consultas que contenha evidências relevantes conhecidas. Mantenha juntos o objeto de origem, a entrada do embedding e o julgamento de relevância. Caso contrário, uma falha do encoder e uma falha de ingestão se tornam indistinguíveis.

1. Crie fatias por modalidade antes de escolher as métricas

Crie fatias separadas para texto, imagens, vídeo e documentos visuais. Divida-as novamente de acordo com o comportamento importante:

Texto: identificadores exatos, paráfrases, consultas multilíngues, negação e negativos difíceis.
Imagens: identidade do objeto, detalhe local, contagem, cor, posição e texto dentro da imagem.
Vídeo: presença do evento, limite temporal, corte de câmera, evento esparso e evidência dependente de áudio.
Documentos visuais: OCR, células de tabela, rótulos de gráficos, notas de rodapé, layout de múltiplas colunas e modificadores locais da página.

Adicione um campo de cobertura para cada exemplo. Registre se a evidência de origem chegou ao encoder. Um quadro perdido, uma legenda de gráfico cortada ou uma página de PDF omitida não deve ser pontuado como um erro de embedding.

2. Compare pipelines completos de recuperação

Teste pelo menos estes candidatos contra os mesmos julgamentos de relevância:

Uma linha de base lexical ou somente textual, como BM25 mais um modelo denso de texto.
Um modelo multimodal de vetor único.
Um pipeline híbrido que combine pontuações esparsas e densas.
O melhor candidato com um reranker, se o reranking for viável.

A linha de base híbrida é importante porque o resultado do UEmbed mostra ganhos concentrados em texto e documentos visuais, e não em todas as modalidades. A linha de base textual é importante porque legendas, OCR e metadados estruturados podem ser mais baratos de indexar, mais fáceis de depurar e melhores para termos exatos do que um vetor multimodal nativo.

Recomendado para você

Se o sistema já tiver um harness de testes de RAG, reutilize sua estrutura de consultas, relevância e regressão. O fluxo de avaliação de RAG separa falhas de recuperação de falhas na geração da resposta.

3. Meça qualidade, cobertura e custo em conjunto

Relate métricas por fatia e como distribuições, não apenas como uma única média.

DimensãoMedição mínima
------
Qualidade da recuperaçãoRecall@k, nDCG@k e taxa de acerto de evidências por fatia
Precisão detalhadaVerificações de identificador exato, modificador, célula de tabela, rótulo de gráfico e limite de evento
Cobertura da entradaQuadros, páginas, regiões, áudio e metadados apresentados ao encoder
RuntimeLatência de consulta p50 e p95, throughput de codificação, latência do reranker
ArmazenamentoDimensões dos vetores, postings esparsos, bytes de índice por objeto
MigraçãoTempo total de re-embedding, amplificação de escrita, duração do índice duplo
ConfiabilidadeTaxas de saída vazia, timeout, mídia malformada e falhas por versão do modelo

Um resumo válido mantém visível a pior fatia importante. Por exemplo, promova um candidato somente quando o agregado ponderado melhorar e nenhuma fatia protegida exceder seu orçamento de regressão.

text promote = aggregate_gain > 0 and text_regression <= budget.text and image_regression <= budget.image and video_regression <= budget.video and visual_doc_regression <= budget.visual_doc and p95_latency <= budget.latency

Os orçamentos são decisões de produto. A estrutura impede que um benchmark com muitas imagens compense uma falha de vídeo em um produto de busca de vídeo.

Matriz de avaliação que separa testes de recuperação de texto, imagem, vídeo e documentos visuais antes da produção
Matriz de avaliação que separa testes de recuperação de texto, imagem, vídeo e documentos visuais antes da produção

*Avalie primeiro cada camada de recuperação e, em seguida, aplique gates compartilhados de runtime, migração e release.*

4. Versione o espaço de embeddings

A versão de um modelo de embedding faz parte do formato dos dados armazenados. O guia de migração do Google afirma que `gemini-embedding-001` e `gemini-embedding-2` produzem espaços incompatíveis, portanto a atualização exige gerar novamente os embeddings de todos os dados existentes. Vetores de consulta de um espaço não podem ser comparados diretamente com vetores de documentos do outro.

Recomendado para você

Use versões imutáveis de índice, como `corpus-model-dimension-preprocess-date`. Crie o novo índice ao lado do antigo, reproduza um conjunto fixo de consultas, faça shadow traffic real e mantenha o rollback possível até que a qualidade e a latência se estabilizem. Registre o encoder, a dimensão, os prompts ou instruções de tarefa, o amostrador de quadros, o renderizador de PDF, a versão do OCR e a lógica de fusão de pontuações em uma lista de materiais de AI.

5. Faça shadow das consultas de produção antes da troca

A avaliação offline controla os casos conhecidos. O tráfego em shadow testa a distribuição real sem alterar os resultados visíveis para o usuário. Registre ambas as listas de candidatos, a latência, os resultados vazios e a fatia ou o tipo de entrada associado a cada divergência. Analise as divergências antes de um rollout parcial.

Não use apenas cliques como verdade de relevância. O viés de posição e o ranker atual moldam aquilo em que os usuários podem clicar. Combine julgamentos humanos amostrados, sucesso da tarefa downstream e sinais comportamentais.

Uma estrutura de decisão para produção

Use um modelo de embedding multimodal quando a evidência visual ou temporal bruta alterar a relevância e uma representação textual perder essa evidência. Mantenha um pipeline textual ou híbrido mais simples quando o corpus for composto principalmente por prosa, identificadores exatos dominarem ou legendas e OCR confiáveis já capturarem o sinal útil.

Carga de trabalhoPrimeiro candidato forteMotivo
---------
Busca de produtos com nomes, SKUs e imagensMultimodal denso + fusão lexicalSimilaridade visual e termos exatos são importantes
RAG de capturas de tela ou documentos visuaisMultimodal denso + OCR/BM25 + rerankerLayout e texto local precisam de sinais separados
Busca em vídeos longosÍndice em nível de segmento com cobertura explícita de quadros e áudioUm vetor para o vídeo inteiro oculta eventos curtos
Documentos principalmente textuais com imagens ocasionaisModelo denso de texto + linha de base BM25 primeiroMenor complexidade de índice e migração
Memória multimodal de agentesÍndice multimodal versionado com proveniência rigorosaA recuperação precisa de limites de origem, tempo e modalidade

Não escolha um modelo maior antes de testar o pré-processamento. Seleção de quadros, segmentação de páginas, OCR, instruções de consulta e exemplos negativos podem dominar o resultado. A atividade de projetos open source pode revelar dificuldades de implementação, mas não é um benchmark de qualidade. Em 4 de agosto de 2026, o repositório Qwen3-VL-Embedding tinha 32 commits e 55 issues abertas; as issues recentes incluíam endpoints de serving e incompatibilidades de representação. Esses são sinais de engenharia a investigar, não motivos para aceitar ou rejeitar o modelo.

O que as evidências sustentam

Os artigos sustentam três conclusões concretas.

Primeiro, um vetor multimodal compacto pode preservar mais computação específica de recuperação do que uma única passagem direta não modificada. O DME adiciona objetivos usados apenas no treinamento; o ReLoop-UME adiciona profundidade recorrente; o UEmbed deriva visões densas e esparsas em conjunto.

Segundo, o mecanismo de representação altera o padrão de falhas. A recuperação esparsa traz riscos lexicais e entre idiomas. A profundidade recorrente traz custos de treinamento e latência. O vídeo continua vulnerável à amostragem antes da execução do modelo de embedding.

Terceiro, as evidências de produção precisam ser locais. Os autores mediram resultados úteis de benchmark e sistema, mas nenhum artigo mediu seu corpus, sua composição de consultas, seu orçamento de latência, sua migração de índice ou o custo de uma recuperação incorreta.

A conclusão útil é operacional: adote embeddings multimodais somente depois que cada modalidade passar por seus próprios testes de recuperação e cobertura. O espaço vetorial compartilhado pode simplificar o serving. A avaliação deve permanecer deliberadamente desigual.

FAQ

Os embeddings de texto e imagem devem usar o mesmo índice?

Eles podem compartilhar um índice quando o modelo foi treinado para posicionar essas modalidades em um espaço compatível e a recuperação cross-modal fizer parte da tarefa. Mantenha campos ou índices separados quando a recuperação lexical, os filtros específicos por modalidade, as diferentes taxas de atualização ou o rollback independente forem importantes. Teste a fusão de pontuações com julgamentos de relevância reais em vez de presumir que um único layout é melhor.

Preciso gerar novamente os embeddings ao mudar de modelo?

Geralmente, sim. Os espaços de embedding de modelos diferentes ou versões incompatíveis não podem ser comparados com segurança. Crie um índice substituto versionado, gere novamente os embeddings do corpus, faça shadow das consultas contra ambos os índices e mantenha o índice antigo até que o novo passe pelos gates de qualidade e latência por fatia.

Verificações de afirmações

AfirmaçãoStatusLimite da evidência
---------
O UEmbed-9B relata 71,8 denso e 71,0 esparso no MMEB-V2.VerificadaArtigo do UEmbed, versão 1, 3 de agosto de 2026.
Os ganhos híbridos do UEmbed estão concentrados em texto e documentos visuais.VerificadaO artigo relata +0,3 para texto e +0,5 para documentos visuais, com pouca mudança nas demais modalidades.
O DME-2B relata um aumento acumulado de 70,9 para 74,8 ao longo de suas etapas de treinamento.VerificadaTabela de ablação do DME; o resultado pertence à configuração dos autores.
O ganho online de 0,1% do DME prevê o impacto de outra implantação.RejeitadaA métrica, o tráfego, os dados e as condições de implantação internas não são públicos.
O ReLoop-UME é 44,9× mais rápido que o UME-R1.QualificadaMedido na configuração do artigo com uma única H20; não é uma proporção universal de serving.
A profundidade recorrente pode recuperar um evento de vídeo omitido pela amostragem de quadros.RejeitadaO artigo afirma que evidências não observadas não podem ser recuperadas.
Uma única média do MMEB-V2 é suficiente para uma decisão de produção.RejeitadaO benchmark abrange 78 conjuntos de dados e diferentes modalidades; os pesos de produção e os custos das falhas diferem.
O Gemini Embedding 2 processa todos os quadros de um vídeo e sua faixa de áudio.RejeitadaA documentação oficial limita o processamento a 32 quadros e exclui o áudio do vídeo.
A atualização do Gemini Embedding 001 para o 2 exige gerar novamente os embeddings dos dados existentes.VerificadaO Google documenta os espaços como incompatíveis.
Estrelas de repositórios ou issues abertas comprovam a qualidade da recuperação.RejeitadaSão sinais de adoção e manutenção, não medições de qualidade controladas.

Fontes

UEmbed: Unified Sparse and Dense Multimodal Embeddings — pesquisa primária; arquitetura, treinamento com dados públicos, resultados no MMEB-V2, recuperação híbrida e limitações.
Douyin Multimodal Embedding Model Technical Report — pesquisa primária; treinamento em duas etapas, ablações, resultados de produção relatados e limite de serving.
ReLoop-UME: Recurrent Depth with Learnable Retrieval Registers for Universal Multimodal Embedding — pesquisa primária; arquitetura recorrente, resultados por modalidade, comparação de latência em H20 e limitações.
VLM2Vec-V2: Advancing Multimodal Embedding for Videos, Images, and Visual Documents — pesquisa primária; escopo do benchmark MMEB-V2 e design da tarefa de recuperação multimodal.
Gemini API embeddings guide — documentação oficial; modalidades compatíveis, limites de processamento, instruções de tarefa, agregação, dimensões e requisitos de migração.
Gemini Embedding 2 model page — documentação oficial do modelo e casos de uso pretendidos.
Qwen3-VL-Embedding-2B model card — cartão oficial do modelo; entradas, contexto, dimensões, instruções e tabela de benchmark.
UEmbed repository — implementação oficial open source; verificada quanto a releases, commits, issues, forks e atividade recente em 4 de agosto de 2026.
Qwen3-VL-Embedding repository — implementação oficial open source; verificada quanto a commits, issues, releases, forks e sinais de implementação em 4 de agosto de 2026.