Roboflow Supervision: Benchmarks para Apps
Tech
AI
Computer Vision
Roboflow
Benchmarks

Roboflow Supervision: Benchmarks para Apps

Supervision não é outro modelo. É a camada de ferramentas que transforma resultados de computer vision em algo que os apps podem usar.

Uygar DuzgunUUygar Duzgun
Jul 3, 2026
Atualizado 24 de ago. de 2026
8 min read

Gosto de ferramentas que eliminam código de integração entediante. Computer vision tem código demais desse tipo: um modelo retorna caixas, outro retorna máscaras, um terceiro retorna keypoints, e então você começa a reescrever conversão de formatos, cores, rótulos, tracking, zonas, exportação e avaliação.

Roboflow Supervision é interessante porque ataca essa camada. Não é outro modelo. É uma camada Python ao redor do trabalho de computer vision: `Detections`, annotators, carregadores de datasets, tracking, métricas e os utilitários necessários para transformar inferência bruta em lógica de produto.

Tenho algumas ideias de apps que planejo construir com isso. Ainda não posso revelar nada sobre os apps, mas o padrão é claro: entrada de vídeo ou imagem, saída de uma observação estruturada e, depois, uma decisão, timeline ou alerta que faça parte de um produto real.

Onde o Supervision está agora

Verifiquei as fontes em 3 de julho de 2026. O repositório `roboflow/supervision` no GitHub mostra `0.29.1` como a versão mais recente, publicada em 23 de junho de 2026. O PyPI mostra a mesma versão. O repositório está em torno de 46.000 estrelas, mais de 4.000 forks e uma licença MIT.

Esses números não provam que a biblioteca resolve todos os problemas. Eles mostram que muitos desenvolvedores enfrentam a mesma dificuldade: o modelo é apenas uma parte do trabalho. Ao redor do modelo, você ainda precisa:

converter as saídas dos modelos para um formato comum
desenhar caixas, máscaras, rótulos, traces e zonas em imagens e vídeos
ler, dividir, mesclar e exportar datasets
rastrear objetos entre frames
medir resultados com mAP, F1, matrizes de confusão e pontuações por classe
criar pequenas etapas de pipeline sem prender o app inteiro a um único formato de modelo

O último ponto é o que mais importa para mim. Quero trocar de modelos sem destruir a lógica do app. Se o app funciona internamente com `sv.Detections`, o modelo pode ser RF-DETR, YOLO, Roboflow Inference, Ultralytics ou qualquer outra coisa que o Supervision consiga ler.

Benchmarks: o que os números dizem

A Roboflow mantém um Computer Vision Model Leaderboard público criado com Supervision. O método é fácil de inspecionar: a Roboflow compara modelos com o Microsoft COCO 2017, executa o benchmarking de forma independente e segue as instruções públicas de cada provedor de modelo. A Roboflow também afirma que o COCO é um benchmark padrão para objetos comuns, mas não é suficiente para trabalhos específicos de domínio. Domínios especiais precisam de seus próprios dados ou de benchmarks mais amplos.

Esta amostra vem do arquivo bruto `aggregate_results.json` em `roboflow/model-leaderboard`, ordenado por `mAP 50:95`. As porcentagens foram arredondadas.

ModeloArquiteturaParâmetrosmAP 50:95mAP 50Small APMedium APLarge APLicença
------:---:---:---:---:---:---:---
RF-DETR-XXLRF-DETR126.9M59.9%78.2%43.2%64.8%76.0%PML-1.0
RF-DETR-XLRF-DETR126.4M58.5%77.1%40.1%63.8%76.1%PML-1.0
DEIM-D-FINE-XDEIM-D-FINE61.7M56.5%74.0%38.8%61.4%74.2%Apache-2.0
YOLO26xYOLO2655.7M56.3%73.4%40.5%60.6%72.4%AGPL-3.0
RF-DETR-LRF-DETR33.9M56.3%74.8%37.4%60.8%73.8%Apache-2.0
DEIM-RT-DETRv2-XDEIM-RT-DETRv274.9M55.5%73.5%37.9%59.9%72.9%Apache-2.0
RF-DETR-MRF-DETR33.7M54.8%73.6%36.0%59.8%73.7%Apache-2.0
YOLOv12xYOLOv1259.1M54.0%70.3%38.2%59.6%69.8%AGPL-3.0

Minha leitura: RF-DETR domina o topo da tabela de qualidade do COCO, especialmente nas variantes maiores. Isso não torna automaticamente o RF-DETR-XXL o modelo certo para um app. Tamanho, licença, latência, destino de deployment e o custo dos erros importam tanto quanto o mAP.

Modelos pequenos contam uma história diferente:

ModeloParâmetrosmAP 50:95mAP 50Small APLicença
------:---:---:---:---
YOLO26n2.4M39.9%55.2%19.2%AGPL-3.0
YOLOv13n2.5M40.4%56.2%19.4%AGPL-3.0
YOLOv12n2.6M39.7%55.0%19.1%AGPL-3.0
YOLO11n2.6M38.6%53.9%18.9%AGPL-3.0
YOLOv8n3.2M36.5%51.4%17.4%AGPL-3.0

Para apps, essa tabela muitas vezes importa mais do que a primeira linha do leaderboard. Um app local para Mac, um protótipo mobile, um dispositivo edge para varejo ou uma ferramenta de vídeo raramente precisa começar com o maior modelo. Precisa de uma boa primeira resposta, tempo de resposta rápido, comportamento previsível e um perfil de erros conhecido.

O próprio guia da Roboflow sobre modelos de object detection acrescenta um contexto útil de latência: ele lista o RF-DETR-M com 54,7% de mAP no COCO e latência de 4,52 ms em uma NVIDIA T4, enquanto o YOLOv12-X aparece com 55,2% de mAP e latência de 11,79 ms. Esses números vêm de um artigo da Roboflow, não do arquivo bruto do leaderboard, então trato-os como contexto complementar, e não como parte da mesma execução de benchmark.

A parte útil é maior do que o mAP

O Supervision se torna útil quando o benchmarking sai de uma tabela e entra em uma decisão de app.

Um produto precisa de respostas que o leaderboard não consegue fornecer sozinho:

Quantos falsos positivos obtenho por minuto de vídeo?
O tracker perde objetos quando pessoas passam umas atrás das outras?
O modelo consegue lidar com objetos pequenos em condições de pouca luz?
Quanta memória as máscaras consomem em clipes longos?
Qual licença posso usar em um produto comercial?
Posso armazenar metadados em vez de frames sensíveis?
Com que rapidez posso trocar de modelos sem reescrever a UX?

O Supervision se encaixa nessa fase. Você pode executar vários modelos no mesmo dataset, normalizar as saídas para a mesma estrutura, desenhar resultados comparáveis e medi-los com as mesmas métricas. Também pode criar regras de produto sobre objetos detectados: zonas, cruzamentos de linhas, tempo de permanência, velocidade, contagens, exportação para CSV/JSON e revisão visual.

Muitos apps de computer vision param na demo em que o modelo desenha uma caixa. O produto começa quando você sabe o que essa caixa significa ao longo do tempo.

Pequenos detalhes de release que importam

O changelog é prático. Na versão `0.26.0`, a Roboflow escreveu que o `sv.HeatMapAnnotator` ficou aproximadamente 28 vezes mais rápido no mapeamento de cores HSV em frames de 1920x1080. A mesma release tornou o `sv.MeanAveragePrecision` totalmente alinhado ao `pycocotools`, o que importa se você quer confiar em medições no estilo COCO.

Na versão `0.28.0`, a Roboflow adicionou o `sv.CompactMask`, que armazena máscaras esparsas como caixas delimitadoras de recorte mais RLE, em vez de bitmaps na resolução completa. A Roboflow informa uma redução de até 240 vezes no uso de memória para máscaras esparsas. Essa mudança não parece dramática em uma demo, mas pode decidir se um app de vídeo sobrevive a sessões mais longas.

Eles também corrigiram problemas práticos: FPS com ponto flutuante em `VideoInfo`, muxing de áudio em `process_video`, logging por meio do `logging` do Python e proteção contra path traversal ao carregar anotações COCO. Isso não é marketing. É manutenção de biblioteca que você percebe quando constrói algo que precisa continuar funcionando.

Como eu faria o benchmark das minhas próprias ideias

Eu começaria em três níveis.

Primeiro, benchmarks de modelos: mAP 50:95, mAP 50, AP de objetos pequenos/médios/grandes, F1 e matriz de confusão em um dataset que corresponda ao ambiente real do app. O COCO dá uma direção, não a decisão final.

Segundo, benchmarks de runtime: latência por frame, pico de memória, uso de CPU/GPU, impacto na bateria e comportamento em vídeos mais longos. Quero números depois de 5 minutos, não apenas uma imagem limpa.

Terceiro, benchmarks de produto: com que frequência o usuário precisa corrigir o sistema, quantos eventos são salvos incorretamente, quantos dados precisam ser armazenados e se a UX lida com a incerteza. Um app de computer vision que esconde a incerteza pode gerar decisões ruins mesmo quando o modelo parece bom em uma tabela.

É por isso que estou analisando o Supervision agora. Ele me oferece uma camada neutra em que o modelo pode continuar substituível, enquanto annotation, tracking, medição e exportação mantêm a mesma estrutura.

Minha conclusão

Roboflow Supervision não torna computer vision fácil. Torna tudo menos confuso.

Essa é a diferença que importa para mim. Quando eu construir as ideias de apps que ainda não posso discutir, não quero ficar preso a conversões de formato personalizadas e a uma pilha de scripts parcialmente mantidos. Quero testar o modelo A contra o modelo B, inspecionar os resultados visualmente, medi-los com as mesmas métricas e construir a lógica do produto sobre uma estrutura em que possa confiar.

O Supervision parece uma camada forte para esse trabalho.

Fontes verificadas em 3 de julho de 2026

roboflow/supervision no GitHub
Documentação do Supervision
Benchmark a Model - Supervision
Computer Vision Model Leaderboard
Metodologia do leaderboard
roboflow/model-leaderboard
Dados brutos do benchmark: aggregate_results.json
Changelog do Supervision
Best Object Detection Models in 2026 - Roboflow