Ich mag Tools, die langweiligen Glue-Code entfernen. Computer Vision hat davon zu viel: Ein Modell liefert Boxen zurück, ein anderes Masken, ein drittes Keypoints, und dann beginnt man, Formatkonvertierung, Farben, Labels, Tracking, Zonen, Export und Evaluierung immer wieder neu zu schreiben.
Roboflow Supervision ist interessant, weil es genau diese Ebene angreift. Es ist kein weiteres Modell. Es ist eine Python-Ebene rund um Computer-Vision-Arbeit: `Detections`, Annotatoren, Dataset-Loader, Tracking, Metriken und die Utilities, die man braucht, um rohe Inferenz in Produktlogik zu verwandeln.
Ich habe einige App-Ideen, die ich damit umsetzen möchte. Ich kann noch nichts über die Apps verraten, aber das Muster ist klar: Video oder Bild hinein, strukturierte Beobachtung heraus, danach eine Entscheidung, Zeitleiste oder Warnung, die in ein echtes Produkt gehört.
Wo Supervision derzeit steht
Ich habe die Quellen am 3. Juli 2026 geprüft. Das GitHub-Repo `roboflow/supervision` zeigt `0.29.1` als neueste Version, veröffentlicht am 23. Juni 2026. PyPI zeigt dieselbe Version. Das Repo hat rund 46.000 Sterne, mehr als 4.000 Forks und eine MIT-Lizenz.
Diese Zahlen beweisen nicht, dass die Bibliothek jedes Problem löst. Sie zeigen, dass viele Entwickler auf denselben Schmerzpunkt stoßen: Das Modell ist nur ein Teil der Aufgabe. Rund um das Modell muss man weiterhin:
Der letzte Punkt ist für mich am wichtigsten. Ich möchte Modelle austauschen können, ohne die App-Logik aufzureißen. Wenn die App intern mit `sv.Detections` arbeitet, kann das Modell RF-DETR, YOLO, Roboflow Inference, Ultralytics oder alles andere sein, was Supervision lesen kann.
Benchmarks: Was die Zahlen sagen
Roboflow betreibt eine öffentliche Computer-Vision-Model-Leaderboard, die mit Supervision erstellt wurde. Die Methode lässt sich leicht prüfen: Roboflow vergleicht Modelle mit Microsoft COCO 2017, führt das Benchmarking unabhängig durch und folgt den öffentlichen Anweisungen jedes Modellanbieters. Roboflow weist außerdem darauf hin, dass COCO ein Standardbenchmark für häufige Objekte ist, aber für domänenspezifische Arbeit nicht ausreicht. Spezielle Domänen benötigen eigene Daten oder umfassendere Benchmarks.
Dieses Beispiel stammt aus der rohen Datei `aggregate_results.json` in `roboflow/model-leaderboard`, sortiert nach `mAP 50:95`. Prozentangaben sind gerundet.
| Modell | Architektur | Parameter | mAP 50:95 | mAP 50 | Small AP | Medium AP | Large AP | Lizenz |
|---|---|---|---|---|---|---|---|---|
| --- | ---: | ---: | ---: | ---: | ---: | ---: | ---: | --- |
| RF-DETR-XXL | RF-DETR | 126.9M | 59.9% | 78.2% | 43.2% | 64.8% | 76.0% | PML-1.0 |
| RF-DETR-XL | RF-DETR | 126.4M | 58.5% | 77.1% | 40.1% | 63.8% | 76.1% | PML-1.0 |
| DEIM-D-FINE-X | DEIM-D-FINE | 61.7M | 56.5% | 74.0% | 38.8% | 61.4% | 74.2% | Apache-2.0 |
| YOLO26x | YOLO26 | 55.7M | 56.3% | 73.4% | 40.5% | 60.6% | 72.4% | AGPL-3.0 |
| RF-DETR-L | RF-DETR | 33.9M | 56.3% | 74.8% | 37.4% | 60.8% | 73.8% | Apache-2.0 |
| DEIM-RT-DETRv2-X | DEIM-RT-DETRv2 | 74.9M | 55.5% | 73.5% | 37.9% | 59.9% | 72.9% | Apache-2.0 |
| RF-DETR-M | RF-DETR | 33.7M | 54.8% | 73.6% | 36.0% | 59.8% | 73.7% | Apache-2.0 |
| YOLOv12x | YOLOv12 | 59.1M | 54.0% | 70.3% | 38.2% | 59.6% | 69.8% | AGPL-3.0 |
Meine Einschätzung: RF-DETR dominiert den oberen Bereich der COCO-Qualitätstabelle, besonders bei den größeren Varianten. Das macht RF-DETR-XXL jedoch nicht automatisch zum richtigen App-Modell. Größe, Lizenz, Latenz, Deployment-Ziel und die Kosten von Fehlern sind mindestens ebenso wichtig wie mAP.
Kleine Modelle erzählen eine andere Geschichte:
| Modell | Parameter | mAP 50:95 | mAP 50 | Small AP | Lizenz |
|---|---|---|---|---|---|
| --- | ---: | ---: | ---: | ---: | --- |
| YOLO26n | 2.4M | 39.9% | 55.2% | 19.2% | AGPL-3.0 |
| YOLOv13n | 2.5M | 40.4% | 56.2% | 19.4% | AGPL-3.0 |
| YOLOv12n | 2.6M | 39.7% | 55.0% | 19.1% | AGPL-3.0 |
| YOLO11n | 2.6M | 38.6% | 53.9% | 18.9% | AGPL-3.0 |
| YOLOv8n | 3.2M | 36.5% | 51.4% | 17.4% | AGPL-3.0 |
Für Apps ist diese Tabelle oft wichtiger als die oberste Zeile der Leaderboard. Eine lokale Mac-App, ein mobiler Prototyp, eine Edge-Box im Einzelhandel oder ein Video-Tool benötigt selten zuerst das größte Modell. Es braucht eine gute erste Antwort, schnelle Reaktionszeit, vorhersehbares Verhalten und ein bekanntes Fehlerprofil.
Roboflows eigener Leitfaden zu Object-Detection-Modellen liefert zusätzlichen Kontext zur Latenz: Dort wird RF-DETR-M mit 54.7% mAP auf COCO und 4.52 ms Latenz auf einer NVIDIA T4 aufgeführt, während YOLOv12-X mit 55.2% mAP und 11.79 ms Latenz angegeben wird. Diese Zahlen stammen aus einem Roboflow-Artikel und nicht aus der rohen Leaderboard-Datei, daher behandle ich sie als ergänzenden Kontext und nicht als Teil desselben Benchmark-Laufs.
Der nützliche Teil ist größer als mAP
Supervision wird dann nützlich, wenn Benchmarking von einer Tabelle zu einer App-Entscheidung übergeht.
Ein Produkt braucht Antworten, die die Leaderboard allein nicht liefern kann:
Supervision passt in diese Phase. Man kann mehrere Modelle auf demselben Dataset ausführen, die Ausgaben in dieselbe Struktur normalisieren, vergleichbare Ergebnisse zeichnen und sie mit denselben Metriken messen. Außerdem kann man Produktregeln auf Erkennungsobjekten aufbauen: Zonen, Linienüberquerungen, Verweildauer, Geschwindigkeit, Zählungen, CSV/JSON-Export und visuelle Prüfung.
Viele Computer-Vision-Apps bleiben bei der Demo stehen, in der das Modell eine Box zeichnet. Das Produkt beginnt, wenn man weiß, was diese Box im Zeitverlauf bedeutet.
Kleine Release-Details, die wichtig sind
Das Changelog ist praxisnah. In `0.26.0` schrieb Roboflow, dass `sv.HeatMapAnnotator` eine etwa 28-mal schnellere HSV-Farbzuordnung auf 1920x1080-Frames erhielt. Dieselbe Version machte `sv.MeanAveragePrecision` vollständig kompatibel mit `pycocotools`, was wichtig ist, wenn man COCO-artigen Messungen vertrauen möchte.
In `0.28.0` fügte Roboflow `sv.CompactMask` hinzu, das Sparse-Masken als Crop-Bounding-Boxes plus RLE statt als Bitmaps in voller Auflösung speichert. Roboflow nennt eine bis zu 240-fach geringere Speichernutzung für Sparse-Masken. Diese Änderung klingt in einer Demo nicht dramatisch, kann aber darüber entscheiden, ob eine Video-App längere Sitzungen übersteht.
Außerdem wurden praktische Probleme behoben: Float-FPS in `VideoInfo`, Audio-Muxing in `process_video`, Logging über Pythons `logging` und der Schutz vor Path Traversal beim Laden von COCO-Annotationen. Das ist kein Marketing. Das ist Bibliothekswartung, die man bemerkt, wenn man etwas baut, das dauerhaft laufen muss.
Wie ich meine eigenen Ideen benchmarken würde
Ich würde mit drei Ebenen beginnen.
Erstens Modell-Benchmarks: mAP 50:95, mAP 50, Small/Medium/Large AP, F1 und Konfusionsmatrix auf einem Dataset, das der realen Umgebung der App entspricht. COCO gibt eine Richtung vor, nicht die endgültige Entscheidung.
Zweitens Laufzeit-Benchmarks: Latenz pro Frame, maximaler Speicherverbrauch, CPU/GPU-Auslastung, Auswirkungen auf den Akku und Verhalten bei längeren Videos. Ich möchte Zahlen nach 5 Minuten sehen, nicht nur bei einem sauberen Einzelbild.
Drittens Produkt-Benchmarks: Wie oft muss der Nutzer das System korrigieren, wie viele Ereignisse werden falsch gespeichert, wie viele Daten müssen gespeichert werden und ob die UX mit Unsicherheit umgehen kann. Eine Computer-Vision-App, die Unsicherheit verbirgt, kann schlechte Entscheidungen verursachen, selbst wenn das Modell in einer Tabelle gut aussieht.
Deshalb schaue ich mir Supervision jetzt an. Es bietet mir eine neutrale Ebene, auf der das Modell austauschbar bleiben kann, während Annotation, Tracking, Messung und Export dieselbe Form behalten.
Mein Fazit
Roboflow Supervision macht Computer Vision nicht einfach. Es macht sie weniger chaotisch.
Das ist der Unterschied, der mir wichtig ist. Wenn ich die App-Ideen umsetze, über die ich noch nicht sprechen kann, möchte ich nicht in individueller Formatkonvertierung und einem halb gewarteten Haufen von Scripts stecken bleiben. Ich möchte Modell A gegen Modell B testen, die Ergebnisse visuell prüfen, sie mit denselben Metriken messen und Produktlogik auf einer Struktur aufbauen, der ich vertrauen kann.
Supervision wirkt wie eine starke Ebene für diese Arbeit.
