Sıkıcı glue code'u ortadan kaldıran araçları seviyorum. Computer vision'da bunun fazlası var: bir model kutular, başka bir model maskeler, üçüncü bir model keypoint'ler döndürüyor; ardından format dönüştürme, renkler, etiketler, tracking, bölgeler, dışa aktarma ve değerlendirme için kodu yeniden yazmaya başlıyorsunuz.
Roboflow Supervision ilginç, çünkü bu katmana odaklanıyor. Başka bir model değil. Computer vision çalışmaları etrafında oluşturulmuş bir Python katmanı: `Detections`, annotator'lar, dataset yükleyicileri, tracking, metrikler ve ham inference'ı ürün mantığına dönüştürmek için ihtiyaç duyduğunuz yardımcı araçlar.
Bununla geliştirmeyi planladığım birkaç uygulama fikrim var. Henüz uygulamalar hakkında hiçbir şey açıklayamam, ancak kalıp net: içeri video veya görüntü giriyor, yapılandırılmış bir gözlem çıkıyor; ardından gerçek bir ürüne ait karar, zaman çizelgesi veya uyarı geliyor.
Supervision şu anda nerede duruyor
Kaynakları 3 Temmuz 2026'da kontrol ettim. `roboflow/supervision` GitHub repo'su, 23 Haziran 2026'da yayımlanan `0.29.1` sürümünü en son sürüm olarak gösteriyor. PyPI da aynı sürümü gösteriyor. Repo yaklaşık 46.000 yıldız, 4.000'den fazla fork ve MIT lisansına sahip.
Bu sayılar kütüphanenin her sorunu çözdüğünü kanıtlamıyor. Birçok geliştiricinin aynı sorunla karşılaştığını gösteriyor: model işin yalnızca bir parçası. Modelin çevresinde hâlâ şunlara ihtiyacınız var:
Son nokta benim için en önemlisi. Uygulama mantığını baştan yazmadan modelleri değiştirmek istiyorum. Uygulama dahili olarak `sv.Detections` ile çalışıyorsa model RF-DETR, YOLO, Roboflow Inference, Ultralytics veya Supervision'ın okuyabildiği başka herhangi bir şey olabilir.
Benchmarks: sayıların söyledikleri
Roboflow, Supervision ile oluşturulmuş herkese açık bir Computer Vision Model Leaderboard işletiyor. Yöntemi incelemek kolay: Roboflow modelleri Microsoft COCO 2017 ile karşılaştırıyor, benchmarking işlemini bağımsız olarak yürütüyor ve her model sağlayıcısının herkese açık talimatlarını izliyor. Roboflow ayrıca COCO'nun yaygın nesneler için standart bir benchmark olduğunu, ancak domain'e özgü çalışmalar için yeterli olmadığını belirtiyor. Özel domain'ler kendi verilerine veya daha kapsamlı benchmark'lara ihtiyaç duyuyor.
Bu örnek, `roboflow/model-leaderboard` içindeki ham `aggregate_results.json` dosyasından alınmış ve `mAP 50:95` değerine göre sıralanmıştır. Yüzdeler yuvarlanmıştır.
| Model | Architecture | Parameters | mAP 50:95 | mAP 50 | Small AP | Medium AP | Large AP | License |
|---|---|---|---|---|---|---|---|---|
| --- | ---: | ---: | ---: | ---: | ---: | ---: | ---: | --- |
| RF-DETR-XXL | RF-DETR | 126.9M | 59.9% | 78.2% | 43.2% | 64.8% | 76.0% | PML-1.0 |
| RF-DETR-XL | RF-DETR | 126.4M | 58.5% | 77.1% | 40.1% | 63.8% | 76.1% | PML-1.0 |
| DEIM-D-FINE-X | DEIM-D-FINE | 61.7M | 56.5% | 74.0% | 38.8% | 61.4% | 74.2% | Apache-2.0 |
| YOLO26x | YOLO26 | 55.7M | 56.3% | 73.4% | 40.5% | 60.6% | 72.4% | AGPL-3.0 |
| RF-DETR-L | RF-DETR | 33.9M | 56.3% | 74.8% | 37.4% | 60.8% | 73.8% | Apache-2.0 |
| DEIM-RT-DETRv2-X | DEIM-RT-DETRv2 | 74.9M | 55.5% | 73.5% | 37.9% | 59.9% | 72.9% | Apache-2.0 |
| RF-DETR-M | RF-DETR | 33.7M | 54.8% | 73.6% | 36.0% | 59.8% | 73.7% | Apache-2.0 |
| YOLOv12x | YOLOv12 | 59.1M | 54.0% | 70.3% | 38.2% | 59.6% | 69.8% | AGPL-3.0 |
Benim yorumum: RF-DETR, özellikle büyük varyantlarda, COCO kalite tablosunun üst sıralarına hâkim. Bu, RF-DETR-XXL'i otomatik olarak doğru uygulama modeli yapmaz. Boyut, lisans, latency, deployment hedefi ve hataların maliyeti mAP kadar önemlidir.
Küçük modeller farklı bir hikâye anlatıyor:
| Model | Parameters | mAP 50:95 | mAP 50 | Small AP | License |
|---|---|---|---|---|---|
| --- | ---: | ---: | ---: | ---: | --- |
| YOLO26n | 2.4M | 39.9% | 55.2% | 19.2% | AGPL-3.0 |
| YOLOv13n | 2.5M | 40.4% | 56.2% | 19.4% | AGPL-3.0 |
| YOLOv12n | 2.6M | 39.7% | 55.0% | 19.1% | AGPL-3.0 |
| YOLO11n | 2.6M | 38.6% | 53.9% | 18.9% | AGPL-3.0 |
| YOLOv8n | 3.2M | 36.5% | 51.4% | 17.4% | AGPL-3.0 |
Uygulamalar için bu tablo çoğu zaman leaderboard'ın ilk satırından daha önemlidir. Yerel bir Mac uygulaması, mobil prototip, retail edge box veya video aracı genellikle ilk aşamada en büyük modele ihtiyaç duymaz. İyi bir ilk yanıt, hızlı response time, öngörülebilir davranış ve bilinen bir hata profiline ihtiyaç duyar.
Roboflow'un object detection modelleri rehberi de yararlı latency bağlamı ekliyor: RF-DETR-M'i NVIDIA T4 üzerinde 4.52 ms latency ile COCO'da %54.7 mAP olarak listelerken, YOLOv12-X'i 11.79 ms latency ile %55.2 mAP olarak listeliyor. Bu sayılar leaderboard'ın ham dosyasından değil, bir Roboflow makalesinden geliyor; bu nedenle onları aynı benchmark çalışmasının parçası olarak değil, destekleyici bağlam olarak değerlendiriyorum.
Yararlı kısım mAP'ten daha büyük
Supervision, benchmarking bir tablodan uygulama kararına dönüştüğünde yararlı hâle geliyor.
Bir ürünün leaderboard'ın tek başına yanıtlayamayacağı sorulara ihtiyacı vardır:
Supervision bu aşamaya uyuyor. Birkaç modeli aynı dataset üzerinde çalıştırabilir, çıktıları aynı yapı içinde normalize edebilir, karşılaştırılabilir çıktılar çizebilir ve aynı metriklerle ölçebilirsiniz. Ayrıca detection nesnelerinin üzerine ürün kuralları da oluşturabilirsiniz: bölgeler, çizgi geçişleri, dwell time, hız, sayımlar, CSV/JSON dışa aktarma ve görsel inceleme.
Birçok computer vision uygulaması modelin bir kutu çizdiği demo aşamasında kalıyor. Ürün, kutunun zaman içinde ne anlama geldiğini bildiğinizde başlıyor.
Önem taşıyan küçük sürüm ayrıntıları
Changelog pratik bilgiler içeriyor. `0.26.0` sürümünde Roboflow, `sv.HeatMapAnnotator` için 1920x1080 karelerde HSV color mapping işleminin yaklaşık 28 kat hızlandığını yazdı. Aynı sürüm, `sv.MeanAveragePrecision`'ı `pycocotools` ile tamamen uyumlu hâle getirdi; COCO tarzı ölçümlere güvenmek istiyorsanız bu önemli.
`0.28.0` sürümünde Roboflow, tam çözünürlüklü bitmap'ler yerine sparse mask'leri crop bounding box'ları ve RLE olarak saklayan `sv.CompactMask`'i ekledi. Roboflow, sparse mask'ler için 240 kata kadar daha düşük memory kullanımı listeliyor. Bu değişiklik bir demoda dramatik görünmeyebilir, ancak bir video uygulamasının daha uzun oturumları kaldırıp kaldıramayacağını belirleyebilir.
Ayrıca pratik sorunları da düzelttiler: `VideoInfo` içinde float FPS, `process_video` içinde audio muxing, Python'ın `logging` modülü üzerinden logging ve COCO annotation'ları yüklenirken path traversal koruması. Bu marketing değil. Çalışmaya devam etmesi gereken bir şey geliştirdiğinizde fark edeceğiniz kütüphane bakımı bu.
Kendi fikirlerimi nasıl benchmark ederdim
Üç seviyeden başlardım.
İlk olarak model benchmark'ları: uygulamanın gerçek ortamıyla eşleşen bir dataset üzerinde mAP 50:95, mAP 50, small/medium/large AP, F1 ve confusion matrix. COCO yön gösterir, nihai kararı vermez.
İkinci olarak runtime benchmark'ları: kare başına latency, memory peak, CPU/GPU kullanımı, battery etkisi ve daha uzun videolardaki davranış. Tek bir temiz görüntüden sonra değil, 5 dakikanın ardından da sayılar istiyorum.
Üçüncü olarak ürün benchmark'ları: kullanıcının sistemi ne sıklıkla düzeltmek zorunda kaldığı, kaç event'in yanlış kaydedildiği, ne kadar veri saklanması gerektiği ve UX'in belirsizliği yönetip yönetemediği. Belirsizliği gizleyen bir computer vision uygulaması, model tabloda iyi görünse bile kötü kararlara yol açabilir.
Bu yüzden şu anda Supervision'a bakıyorum. Model değiştirilebilir kalırken annotation, tracking, ölçüm ve dışa aktarmanın aynı yapıyı koruyabildiği tarafsız bir katman sağlıyor.
Benim çıkarımım
Roboflow Supervision computer vision'ı kolaylaştırmıyor. Onu daha az karmaşık hâle getiriyor.
Benim için önemli olan fark bu. Henüz hakkında konuşamadığım uygulama fikirlerini geliştirirken custom format conversion ve yarı bakımsız script yığınında takılıp kalmak istemiyorum. Model A'yı model B'ye karşı test etmek, sonuçları görsel olarak incelemek, aynı metriklerle ölçmek ve güvenebileceğim bir yapı üzerinde ürün mantığı oluşturmak istiyorum.
Supervision bu çalışma için güçlü bir katman gibi görünüyor.
