Roboflow Supervision: Uygulamalar için Karşılaştırmalı Testler
Tech
AI
Computer Vision
Roboflow
Benchmarks

Roboflow Supervision: Uygulamalar için Karşılaştırmalı Testler

Supervision başka bir model değildir. Computer vision çıktılarını uygulamaların kullanabileceği bir şeye dönüştüren araç katmanıdır.

Uygar DuzgunUUygar Duzgun
Jul 3, 2026
Güncellendi 24 Ağu 2026
8 min read

Sıkıcı glue code'u ortadan kaldıran araçları seviyorum. Computer vision'da bunun fazlası var: bir model kutular, başka bir model maskeler, üçüncü bir model keypoint'ler döndürüyor; ardından format dönüştürme, renkler, etiketler, tracking, bölgeler, dışa aktarma ve değerlendirme için kodu yeniden yazmaya başlıyorsunuz.

Roboflow Supervision ilginç, çünkü bu katmana odaklanıyor. Başka bir model değil. Computer vision çalışmaları etrafında oluşturulmuş bir Python katmanı: `Detections`, annotator'lar, dataset yükleyicileri, tracking, metrikler ve ham inference'ı ürün mantığına dönüştürmek için ihtiyaç duyduğunuz yardımcı araçlar.

Bununla geliştirmeyi planladığım birkaç uygulama fikrim var. Henüz uygulamalar hakkında hiçbir şey açıklayamam, ancak kalıp net: içeri video veya görüntü giriyor, yapılandırılmış bir gözlem çıkıyor; ardından gerçek bir ürüne ait karar, zaman çizelgesi veya uyarı geliyor.

Supervision şu anda nerede duruyor

Kaynakları 3 Temmuz 2026'da kontrol ettim. `roboflow/supervision` GitHub repo'su, 23 Haziran 2026'da yayımlanan `0.29.1` sürümünü en son sürüm olarak gösteriyor. PyPI da aynı sürümü gösteriyor. Repo yaklaşık 46.000 yıldız, 4.000'den fazla fork ve MIT lisansına sahip.

Bu sayılar kütüphanenin her sorunu çözdüğünü kanıtlamıyor. Birçok geliştiricinin aynı sorunla karşılaştığını gösteriyor: model işin yalnızca bir parçası. Modelin çevresinde hâlâ şunlara ihtiyacınız var:

model çıktılarını ortak bir formata dönüştürmek
görüntü ve video üzerine kutular, maskeler, etiketler, izler ve bölgeler çizmek
dataset'leri okumak, bölmek, birleştirmek ve dışa aktarmak
nesneleri kareler arasında takip etmek
sonuçları mAP, F1, confusion matrix'ler ve sınıf başına skorlarla ölçmek
tüm uygulamayı tek bir model formatına kilitlemeden küçük pipeline adımları oluşturmak

Son nokta benim için en önemlisi. Uygulama mantığını baştan yazmadan modelleri değiştirmek istiyorum. Uygulama dahili olarak `sv.Detections` ile çalışıyorsa model RF-DETR, YOLO, Roboflow Inference, Ultralytics veya Supervision'ın okuyabildiği başka herhangi bir şey olabilir.

Benchmarks: sayıların söyledikleri

Roboflow, Supervision ile oluşturulmuş herkese açık bir Computer Vision Model Leaderboard işletiyor. Yöntemi incelemek kolay: Roboflow modelleri Microsoft COCO 2017 ile karşılaştırıyor, benchmarking işlemini bağımsız olarak yürütüyor ve her model sağlayıcısının herkese açık talimatlarını izliyor. Roboflow ayrıca COCO'nun yaygın nesneler için standart bir benchmark olduğunu, ancak domain'e özgü çalışmalar için yeterli olmadığını belirtiyor. Özel domain'ler kendi verilerine veya daha kapsamlı benchmark'lara ihtiyaç duyuyor.

Bu örnek, `roboflow/model-leaderboard` içindeki ham `aggregate_results.json` dosyasından alınmış ve `mAP 50:95` değerine göre sıralanmıştır. Yüzdeler yuvarlanmıştır.

ModelArchitectureParametersmAP 50:95mAP 50Small APMedium APLarge APLicense
------:---:---:---:---:---:---:---
RF-DETR-XXLRF-DETR126.9M59.9%78.2%43.2%64.8%76.0%PML-1.0
RF-DETR-XLRF-DETR126.4M58.5%77.1%40.1%63.8%76.1%PML-1.0
DEIM-D-FINE-XDEIM-D-FINE61.7M56.5%74.0%38.8%61.4%74.2%Apache-2.0
YOLO26xYOLO2655.7M56.3%73.4%40.5%60.6%72.4%AGPL-3.0
RF-DETR-LRF-DETR33.9M56.3%74.8%37.4%60.8%73.8%Apache-2.0
DEIM-RT-DETRv2-XDEIM-RT-DETRv274.9M55.5%73.5%37.9%59.9%72.9%Apache-2.0
RF-DETR-MRF-DETR33.7M54.8%73.6%36.0%59.8%73.7%Apache-2.0
YOLOv12xYOLOv1259.1M54.0%70.3%38.2%59.6%69.8%AGPL-3.0

Benim yorumum: RF-DETR, özellikle büyük varyantlarda, COCO kalite tablosunun üst sıralarına hâkim. Bu, RF-DETR-XXL'i otomatik olarak doğru uygulama modeli yapmaz. Boyut, lisans, latency, deployment hedefi ve hataların maliyeti mAP kadar önemlidir.

Küçük modeller farklı bir hikâye anlatıyor:

ModelParametersmAP 50:95mAP 50Small APLicense
------:---:---:---:---
YOLO26n2.4M39.9%55.2%19.2%AGPL-3.0
YOLOv13n2.5M40.4%56.2%19.4%AGPL-3.0
YOLOv12n2.6M39.7%55.0%19.1%AGPL-3.0
YOLO11n2.6M38.6%53.9%18.9%AGPL-3.0
YOLOv8n3.2M36.5%51.4%17.4%AGPL-3.0

Uygulamalar için bu tablo çoğu zaman leaderboard'ın ilk satırından daha önemlidir. Yerel bir Mac uygulaması, mobil prototip, retail edge box veya video aracı genellikle ilk aşamada en büyük modele ihtiyaç duymaz. İyi bir ilk yanıt, hızlı response time, öngörülebilir davranış ve bilinen bir hata profiline ihtiyaç duyar.

Roboflow'un object detection modelleri rehberi de yararlı latency bağlamı ekliyor: RF-DETR-M'i NVIDIA T4 üzerinde 4.52 ms latency ile COCO'da %54.7 mAP olarak listelerken, YOLOv12-X'i 11.79 ms latency ile %55.2 mAP olarak listeliyor. Bu sayılar leaderboard'ın ham dosyasından değil, bir Roboflow makalesinden geliyor; bu nedenle onları aynı benchmark çalışmasının parçası olarak değil, destekleyici bağlam olarak değerlendiriyorum.

Yararlı kısım mAP'ten daha büyük

Supervision, benchmarking bir tablodan uygulama kararına dönüştüğünde yararlı hâle geliyor.

Bir ürünün leaderboard'ın tek başına yanıtlayamayacağı sorulara ihtiyacı vardır:

Video dakikası başına kaç false positive alıyorum?
İnsanlar birbirlerinin arkasından geçtiğinde tracker nesneleri kaybediyor mu?
Model düşük ışıkta küçük nesnelerle başa çıkabiliyor mu?
Uzun kliplerde maskeler ne kadar memory tüketiyor?
Ticari bir üründe hangi lisansı kullanabilirim?
Hassas kareler yerine metadata saklayabilir miyim?
UX'i yeniden yazmadan modelleri ne kadar hızlı değiştirebilirim?

Supervision bu aşamaya uyuyor. Birkaç modeli aynı dataset üzerinde çalıştırabilir, çıktıları aynı yapı içinde normalize edebilir, karşılaştırılabilir çıktılar çizebilir ve aynı metriklerle ölçebilirsiniz. Ayrıca detection nesnelerinin üzerine ürün kuralları da oluşturabilirsiniz: bölgeler, çizgi geçişleri, dwell time, hız, sayımlar, CSV/JSON dışa aktarma ve görsel inceleme.

Birçok computer vision uygulaması modelin bir kutu çizdiği demo aşamasında kalıyor. Ürün, kutunun zaman içinde ne anlama geldiğini bildiğinizde başlıyor.

Önem taşıyan küçük sürüm ayrıntıları

Changelog pratik bilgiler içeriyor. `0.26.0` sürümünde Roboflow, `sv.HeatMapAnnotator` için 1920x1080 karelerde HSV color mapping işleminin yaklaşık 28 kat hızlandığını yazdı. Aynı sürüm, `sv.MeanAveragePrecision`'ı `pycocotools` ile tamamen uyumlu hâle getirdi; COCO tarzı ölçümlere güvenmek istiyorsanız bu önemli.

`0.28.0` sürümünde Roboflow, tam çözünürlüklü bitmap'ler yerine sparse mask'leri crop bounding box'ları ve RLE olarak saklayan `sv.CompactMask`'i ekledi. Roboflow, sparse mask'ler için 240 kata kadar daha düşük memory kullanımı listeliyor. Bu değişiklik bir demoda dramatik görünmeyebilir, ancak bir video uygulamasının daha uzun oturumları kaldırıp kaldıramayacağını belirleyebilir.

Ayrıca pratik sorunları da düzelttiler: `VideoInfo` içinde float FPS, `process_video` içinde audio muxing, Python'ın `logging` modülü üzerinden logging ve COCO annotation'ları yüklenirken path traversal koruması. Bu marketing değil. Çalışmaya devam etmesi gereken bir şey geliştirdiğinizde fark edeceğiniz kütüphane bakımı bu.

Kendi fikirlerimi nasıl benchmark ederdim

Üç seviyeden başlardım.

İlk olarak model benchmark'ları: uygulamanın gerçek ortamıyla eşleşen bir dataset üzerinde mAP 50:95, mAP 50, small/medium/large AP, F1 ve confusion matrix. COCO yön gösterir, nihai kararı vermez.

İkinci olarak runtime benchmark'ları: kare başına latency, memory peak, CPU/GPU kullanımı, battery etkisi ve daha uzun videolardaki davranış. Tek bir temiz görüntüden sonra değil, 5 dakikanın ardından da sayılar istiyorum.

Üçüncü olarak ürün benchmark'ları: kullanıcının sistemi ne sıklıkla düzeltmek zorunda kaldığı, kaç event'in yanlış kaydedildiği, ne kadar veri saklanması gerektiği ve UX'in belirsizliği yönetip yönetemediği. Belirsizliği gizleyen bir computer vision uygulaması, model tabloda iyi görünse bile kötü kararlara yol açabilir.

Bu yüzden şu anda Supervision'a bakıyorum. Model değiştirilebilir kalırken annotation, tracking, ölçüm ve dışa aktarmanın aynı yapıyı koruyabildiği tarafsız bir katman sağlıyor.

Benim çıkarımım

Roboflow Supervision computer vision'ı kolaylaştırmıyor. Onu daha az karmaşık hâle getiriyor.

Benim için önemli olan fark bu. Henüz hakkında konuşamadığım uygulama fikirlerini geliştirirken custom format conversion ve yarı bakımsız script yığınında takılıp kalmak istemiyorum. Model A'yı model B'ye karşı test etmek, sonuçları görsel olarak incelemek, aynı metriklerle ölçmek ve güvenebileceğim bir yapı üzerinde ürün mantığı oluşturmak istiyorum.

Supervision bu çalışma için güçlü bir katman gibi görünüyor.

3 Temmuz 2026'da kontrol edilen kaynaklar

roboflow/supervision on GitHub
Supervision documentation
Benchmark a Model - Supervision
Computer Vision Model Leaderboard
Leaderboard methodology
roboflow/model-leaderboard
Raw benchmark data: aggregate_results.json
Supervision changelog
Best Object Detection Models in 2026 - Roboflow