Roboflow Supervision : benchmarks pour les applications
Tech
AI
Computer Vision
Roboflow
Benchmarks

Roboflow Supervision : benchmarks pour les applications

Supervision n’est pas un autre modèle. C’est la couche d’outils qui transforme les résultats de vision par ordinateur en éléments utilisables par les applications.

Uygar DuzgunUUygar Duzgun
Jul 3, 2026
Mis à jour 24 août 2026
8 min read

J’aime les outils qui suppriment le code de liaison ennuyeux. La vision par ordinateur en contient beaucoup trop : un modèle renvoie des boîtes, un autre des masques, un troisième des points clés, puis vous commencez à réécrire la conversion des formats, les couleurs, les étiquettes, le suivi, les zones, l’exportation et l’évaluation.

Roboflow Supervision est intéressant parce qu’il s’attaque à cette couche. Ce n’est pas un autre modèle. C’est une couche Python autour du travail de vision par ordinateur : `Detections`, des annotateurs, des chargeurs de jeux de données, du suivi, des métriques et les utilitaires nécessaires pour transformer une inférence brute en logique produit.

J’ai quelques idées d’applications que je prévois de construire avec cet outil. Je ne peux encore rien révéler à leur sujet, mais le schéma est clair : une vidéo ou une image en entrée, une observation structurée en sortie, puis une décision, une chronologie ou une alerte qui trouve sa place dans un véritable produit.

Où en est Supervision aujourd’hui

J’ai vérifié les sources le 3 juillet 2026. Le dépôt GitHub `roboflow/supervision` affiche `0.29.1` comme dernière version, publiée le 23 juin 2026. PyPI affiche la même version. Le dépôt compte environ 46 000 étoiles, plus de 4 000 forks et utilise une licence MIT.

Ces chiffres ne prouvent pas que la bibliothèque résout tous les problèmes. Ils montrent que beaucoup de développeurs rencontrent la même difficulté : le modèle n’est qu’une partie du travail. Autour du modèle, il faut encore :

convertir les sorties des modèles dans un format commun
dessiner des boîtes, des masques, des étiquettes, des traces et des zones sur des images et des vidéos
lire, diviser, fusionner et exporter des jeux de données
suivre les objets d’une image à l’autre
mesurer les résultats avec la mAP, le F1, les matrices de confusion et les scores par classe
construire de petites étapes de pipeline sans verrouiller toute l’application sur un seul format de modèle

Le dernier point est le plus important pour moi. Je veux pouvoir changer de modèle sans devoir refaire la logique de l’application. Si l’application utilise `sv.Detections` en interne, le modèle peut être RF-DETR, YOLO, Roboflow Inference, Ultralytics ou tout autre modèle lisible par Supervision.

Benchmarks : ce que disent les chiffres

Roboflow gère un classement public des modèles de vision par ordinateur construit avec Supervision. La méthode est facile à examiner : Roboflow compare les modèles à Microsoft COCO 2017, exécute le benchmarking de manière indépendante et suit les instructions publiques de chaque fournisseur de modèles. Roboflow précise également que COCO est un benchmark standard pour les objets courants, mais qu’il ne suffit pas pour les travaux propres à un domaine. Les domaines spécialisés ont besoin de leurs propres données ou de benchmarks plus larges.

Cet échantillon provient du fichier brut `aggregate_results.json` de `roboflow/model-leaderboard`, trié par `mAP 50:95`. Les pourcentages sont arrondis.

ModèleArchitectureParamètresmAP 50:95mAP 50AP petits objetsAP objets moyensAP grands objetsLicence
------:---:---:---:---:---:---:---
RF-DETR-XXLRF-DETR126.9M59.9%78.2%43.2%64.8%76.0%PML-1.0
RF-DETR-XLRF-DETR126.4M58.5%77.1%40.1%63.8%76.1%PML-1.0
DEIM-D-FINE-XDEIM-D-FINE61.7M56.5%74.0%38.8%61.4%74.2%Apache-2.0
YOLO26xYOLO2655.7M56.3%73.4%40.5%60.6%72.4%AGPL-3.0
RF-DETR-LRF-DETR33.9M56.3%74.8%37.4%60.8%73.8%Apache-2.0
DEIM-RT-DETRv2-XDEIM-RT-DETRv274.9M55.5%73.5%37.9%59.9%72.9%Apache-2.0
RF-DETR-MRF-DETR33.7M54.8%73.6%36.0%59.8%73.7%Apache-2.0
YOLOv12xYOLOv1259.1M54.0%70.3%38.2%59.6%69.8%AGPL-3.0

Mon interprétation : RF-DETR domine le haut du classement COCO en matière de qualité, en particulier dans les variantes les plus grandes. Cela ne fait pas automatiquement de RF-DETR-XXL le bon modèle pour une application. La taille, la licence, la latence, la cible de déploiement et le coût des erreurs comptent autant que la mAP.

Les petits modèles racontent une autre histoire :

ModèleParamètresmAP 50:95mAP 50AP petits objetsLicence
------:---:---:---:---
YOLO26n2.4M39.9%55.2%19.2%AGPL-3.0
YOLOv13n2.5M40.4%56.2%19.4%AGPL-3.0
YOLOv12n2.6M39.7%55.0%19.1%AGPL-3.0
YOLO11n2.6M38.6%53.9%18.9%AGPL-3.0
YOLOv8n3.2M36.5%51.4%17.4%AGPL-3.0

Pour les applications, ce tableau compte souvent davantage que la première ligne du classement. Une application locale sur Mac, un prototype mobile, un boîtier edge pour le commerce ou un outil vidéo n’a généralement pas besoin de commencer par le plus grand modèle. Elle a besoin d’une première réponse correcte, d’un temps de réponse rapide, d’un comportement prévisible et d’un profil d’erreur connu.

Le guide de Roboflow consacré aux modèles de détection d’objets apporte un contexte utile sur la latence : il indique pour RF-DETR-M une mAP de 54.7% sur COCO avec une latence de 4.52 ms sur un NVIDIA T4, tandis que YOLOv12-X est indiqué à 55.2% de mAP avec une latence de 11.79 ms. Ces chiffres proviennent d’un article de Roboflow et non du fichier brut du classement ; je les considère donc comme un contexte complémentaire plutôt que comme les résultats de la même exécution de benchmark.

La partie utile dépasse largement la mAP

Supervision devient utile lorsque le benchmarking passe d’un tableau à une décision produit.

Un produit a besoin de réponses que le classement ne peut pas fournir à lui seul :

Combien de faux positifs obtiens-je par minute de vidéo ?
Le tracker perd-il les objets lorsque des personnes passent les unes derrière les autres ?
Le modèle peut-il gérer de petits objets dans de mauvaises conditions d’éclairage ?
Quelle quantité de mémoire les masques consomment-ils sur de longues séquences ?
Quelle licence puis-je utiliser dans un produit commercial ?
Puis-je stocker les métadonnées plutôt que des images sensibles ?
À quelle vitesse puis-je changer de modèle sans réécrire l’UX ?

Supervision s’intègre bien à cette phase. Vous pouvez exécuter plusieurs modèles sur le même jeu de données, normaliser les sorties dans la même structure, dessiner des résultats comparables et les mesurer avec les mêmes métriques. Vous pouvez également construire des règles produit au-dessus des objets détectés : zones, franchissements de lignes, temps de présence, vitesse, comptages, exportation CSV/JSON et revue visuelle.

De nombreuses applications de vision par ordinateur s’arrêtent au stade de la démonstration, lorsque le modèle dessine une boîte. Le produit commence lorsque vous savez ce que cette boîte signifie au fil du temps.

De petits détails de version qui comptent

Le journal des modifications est concret. Dans `0.26.0`, Roboflow indiquait que `sv.HeatMapAnnotator` avait obtenu une conversion des couleurs HSV environ 28 fois plus rapide sur des images en 1920x1080. La même version rendait `sv.MeanAveragePrecision` entièrement aligné sur `pycocotools`, ce qui compte si vous voulez pouvoir faire confiance à une mesure de type COCO.

Dans `0.28.0`, Roboflow a ajouté `sv.CompactMask`, qui stocke les masques clairsemés sous forme de boîtes englobantes recadrées accompagnées de RLE, plutôt que sous forme de bitmaps en pleine résolution. Roboflow annonce une réduction de l’utilisation mémoire pouvant atteindre 240x pour les masques clairsemés. Ce changement ne semble pas spectaculaire dans une démonstration, mais il peut déterminer si une application vidéo tient pendant des sessions plus longues.

L’équipe a également corrigé des problèmes pratiques : les FPS flottants dans `VideoInfo`, le multiplexage audio dans `process_video`, la journalisation via `logging` de Python et la protection contre la traversée de chemins lors du chargement d’annotations COCO. Ce n’est pas du marketing. C’est de la maintenance de bibliothèque que l’on remarque lorsqu’on construit quelque chose qui doit continuer à fonctionner.

Comment je benchmarkerais mes propres idées

Je commencerais par trois niveaux.

Premièrement, les benchmarks des modèles : mAP 50:95, mAP 50, AP pour les petits/moyens/grands objets, F1 et matrice de confusion sur un jeu de données correspondant à l’environnement réel de l’application. COCO donne une direction, pas la décision finale.

Deuxièmement, les benchmarks d’exécution : latence par image, pic de mémoire, charge CPU/GPU, impact sur la batterie et comportement sur des vidéos plus longues. Je veux des chiffres après 5 minutes, pas seulement sur une image parfaite.

Troisièmement, les benchmarks produit : fréquence à laquelle l’utilisateur doit corriger le système, nombre d’événements enregistrés incorrectement, quantité de données à stocker et capacité de l’UX à gérer l’incertitude. Une application de vision par ordinateur qui masque l’incertitude peut entraîner de mauvaises décisions, même lorsque le modèle semble performant dans un tableau.

C’est pourquoi je m’intéresse maintenant à Supervision. Il me fournit une couche neutre où le modèle peut rester interchangeable, tandis que l’annotation, le suivi, la mesure et l’exportation conservent la même structure.

Ce que j’en retiens

Roboflow Supervision ne rend pas la vision par ordinateur facile. Il la rend moins désordonnée.

C’est cette différence qui m’importe. Lorsque je construirai les idées d’applications dont je ne peux pas encore parler, je ne veux pas rester bloqué dans une conversion de formats personnalisée et un amas de scripts à moitié maintenus. Je veux tester le modèle A contre le modèle B, examiner visuellement les résultats, les mesurer avec les mêmes métriques et construire la logique produit sur une structure à laquelle je peux faire confiance.

Supervision semble être une couche solide pour ce travail.

Sources vérifiées le 3 juillet 2026

roboflow/supervision sur GitHub
Documentation de Supervision
Benchmark a Model - Supervision
Computer Vision Model Leaderboard
Leaderboard methodology
roboflow/model-leaderboard
Données brutes du benchmark : aggregate_results.json
Journal des modifications de Supervision
Best Object Detection Models in 2026 - Roboflow