Birisi sizden verilerini bir AI sisteminden silmenizi isterse, bir veritabanından tek bir satırı kaldırmak işin tamamı değildir. Machine unlearning, bir modelin belirli eğitim örneklerine verdiği yanıtı azaltabilir veya yönlendirebilir; ancak yığının geri kalanını otomatik olarak temizlemez: vektör dizinleri, fine-tuned adapter'lar, önbelleğe alınmış prompt'lar, checkpoint'ler, replikalar, yedekler ve dışa aktarımlar. NIST, machine unlearning'i belirli eğitim noktalarının eğitilmiş bir model üzerindeki etkisini seçici olarak kaldırma işlemi olarak tanımlar ve verimli yaklaşık tekniklerin sıfırdan tam yeniden eğitimi önleyebileceğini açıkça belirtir. Bu, "tüm sistemin veriyi unutması" ifadesinden daha dar bir kavramdır. NIST
Çoğu ekip için pratik yanıt katmanlıdır. Önce verinin nereye gittiğini izleyin. Ardından yeniden kullanımını durdurun. Sonra türetilmiş yapıları silin veya kısıtlayın. Ancak bundan sonra model ağırlıklarının yeniden eğitilmesi ya da yaklaşık unlearning gerekip gerekmediğine karar verin. Google'ın 2023 Machine Unlearning Challenge'ı tam olarak bu model merkezli çerçeveyi kullandı: unlearned bir model, forget set olmadan yeniden eğitilmiş bir modelden ayırt edilmesi zor hâle gelmeli ve aynı zamanda retained set üzerindeki performansını korumalıdır. Google Research
İçindekiler
Machine unlearning gerçekte ne anlama gelir
Machine unlearning, model düzeyinde gerçekleştirilen bir işlemdir. Seçilen verilerin eğitilmiş bir modelin davranışı üzerindeki etkisini azaltmayı amaçlar. Bu, retained set üzerinde tam yeniden eğitim anlamına gelebilir veya tam yeniden eğitimin maliyetine katlanmadan yeterince yakın bir sonuç elde etmeyi hedefleyen yaklaşık bir yöntem olabilir. NIST sözlük girdisinde her iki fikri de kullanır ve Google'ın challenge sayfası altın standardı, unutulan örnekler olmadan sıfırdan yeniden eğitilmiş bir modele benzerlik olarak tanımlar. NIST Google Research
Bu tanım önemlidir; çünkü AI sistemleri nadiren yalnızca model ağırlıklarından oluşur. Üretim ortamındaki bir yığın genellikle şunları içerir:
Bu katmanlardan yalnızca birini silmek, verinin başka bir yerde hâlâ erişilebilir kalmasına neden olabilir. Pratikte "bu veriyi AI'dan kaldır" talebi, model düzenleme problemine dönüşmeden önce bir lineage problemidir.
Normal bir silme akışı neden yeterli değildir
Birçok AI ürünü, silinmesi istenen veriler üzerinde hiçbir zaman training gerçekleştirmemiştir. Bu ürünler veriyi yalnızca inference sırasında retrieval yoluyla kullanmıştır. Böyle bir durumda yapılması gereken, kaynak kayıtlarını, türetilmiş embedding'leri, önbellekleri ve erişim yollarını kaldırmaktır. Model unlearning burada ilgisizdir; çünkü model ağırlıkları hiç değiştirilmemiştir.
Daha zor durumlar, verinin ağırlıkları, adapter'ları veya kalıcı memory'leri etkilediği zaman başlar. Bu nedenle her silme talebine aynı şekilde yaklaşmak yerine dört durumu birbirinden ayırmanız gerekir.
| Durum | İlk yapılacak kaldırma işlemleri | Model unlearning gerekli mi? | Hangi kanıt saklanmalı |
|---|---|---|---|
| --- | --- | --- | --- |
| Veri yalnızca kaynak sistemlerde ve log'larda bulunuyordu | Kaynak kaydı, dışa aktarımlar, log'lar ve önbellekleri silin veya kısıtlayın | Hayır | Kayıt ID'leri, silme zaman damgası, retention yolu |
| Veri ayrıca RAG veya search sistemine girdi | Kaynak dosyaları, chunk'ları, embedding'leri, vektör satırlarını, cache key'lerini ve reindex job'larını kaldırın | Genellikle hayır; ancak bu belgeler daha sonra training için kullanıldıysa gerekir | Reindex tamamlanması, retrieval testleri, chunk sayıları |
| Veri fine-tuned bir modeli veya adapter'ı etkiledi | Kaynak yapıları kaldırın ve yeniden training, adapter değişimi veya yaklaşık unlearning arasında karar verin | Evet | Forget set tanımı, retained set kontrolleri, eski modelin kullanımdan kaldırılması |
| Veri üçüncü taraf bir foundation modelinin içinde bulunabilir | Kendi kopyalarınızı kaldırın ve provider düzeyinde bir süreç başlatın | Belki; ancak bunu yalnızca provider gerçekleştirebilir | Ticket, vendor açıklaması, sözleşme/policy yolu |
Bu tablo, "silme düğmesi"nin neden yanlış bir zihinsel model olduğunu gösterir. Doğru model, kapsamı belirlenmiş kaldırma işlemi ve kanıttır.
Pratik yedi adımlı iş akışı
1. Talebin kapsamını belirleyin ve yeniden kullanımı dondurun
Kesin tanımlayıcılarla başlayın: user ID, file hash, document ID'leri, vector collection adları, training batch ID'leri veya ticket referansları. Ardından yeni yeniden kullanımı durdurun. Temizlik sırasında aynı veriyi yeniden oluşturabilecek ingestion, retraining, export job'larını veya sync işlemlerini duraklatın.
Talep privacy kaynaklıysa hukuki çerçeveyi dar tutun. GDPR Article 17, belirli koşullarda silme hakkı oluşturur; ancak önce hangi teknik katmana müdahale etmeniz gerektiğini söylemez. European Data Protection Board'un 18 Aralık 2024 tarihli AI modelleri hakkındaki görüşü de personal data ile eğitilen modellerin her durumda anonymous kabul edilemeyeceğini belirtir. Modelin kapsam dışında olduğunu varsaymak yerine açık bir silme iş akışını koruyun. EUR-Lex EDPB
2. Herhangi bir şeyi silmeden önce lineage'ı izleyin
Tam yolu haritalayın:
Bu noktada bir AI bill of materials→ faydalı hâle gelir. Kaydı hangi modelin, adapter'ın veya index'in kullandığını bilmiyorsanız, daha sonra kaldırıldığını kanıtlayamazsınız.
3. Kaynak ve türetilmiş yapıları silin veya kısıtlayın
Şimdi deterministik olarak temizleyebileceğiniz unsurları kaldırın:
Retrieval ağırlıklı sistemlerde bu adım çoğu zaman model düzenlemesinden daha önemlidir. Aynı mantık RAG evaluation→ için de geçerlidir: kötü içeriği yeniden sisteme sokan yol retrieval ise, modeli suçlamadan önce retrieval'ı düzeltirsiniz.
Herkese açık bir AnythingLLM issue, bir Weaviate destekli kurulumda silinen belgelerin embedding'lerinin görünüşe göre retrieval edilebilir durumda kaldığını bildirdi. Tek bir issue, platform genelinde geçerli bir bulgu değil, anekdot niteliğinde bir kanıttır. Yine de her silme akışının document ID'leri, ayırt edici ifadeler ve paraphrase'ler için negatif retrieval testi gerektirdiğini gösterir.
4. Model ağırlıklarının gerçekten değişip değişmediğine karar verin
Ekiplerin sıklıkla atladığı karar noktası budur.
Google'ın 2023 challenge'ı model tarafındaki hedefi tanımlar: unlearned model, unutulan örnekler olmadan yeniden eğitilmiş bir modele benzemeli ve verinin geri kalanından öğrenilen faydalı davranışı korumalıdır. Google Research
5. Ağırlıkları değiştirmeden önce evaluation set'leri oluşturun
En az üç dilime ihtiyacınız vardır:
Bu, AI agent permissions→ sistemlerini denetlenebilir kılan disiplinin aynısıdır: neyin durması, neyin kalması ve hangi kanıtın geçerli sayılması gerektiğini tanımlayın.

*Başlık: Silme çalışması data lineage ve türetilmiş yapılarla başlar. Model unlearning, ancak ağırlıkların etkilenip etkilenmediğini kanıtladıktan sonra başlar.*
6. Unutmayı ve retained utility'yi birlikte test edin
Güncel araştırmalar trade-off'u açıkça ortaya koyuyor.
*Behavioral Audit of Machine Unlearning Has a Privacy Cost* makalesi, convex modeller için black-box behavioral audit'in hem yetersiz unlearning'i tespit edemeyeceğini hem de retained set üyeliği bilgisini honest-but-curious bir auditor'a sızdırmaktan kaçınamayacağını savunur. Yazarlar ayrıca bu gerilimin non-convex ortamlarda da sürdüğüne dair ampirik kanıt gösterir. Bu, tek bir temiz audit skorunun güvenli unutmanın evrensel kanıtı olmadığı anlamına gelir. arXiv
Google Research'ün 10 Haziran 2026 tarihli audit framework'ü probleme başka bir yönden yaklaşır. Auditing'i daha hassas hâle getirmek ve farklı sample size'larda false positive'leri daha güvenilir biçimde kontrol etmek için Regularized f-Divergence Kernel Tests önerir. Sonuç, complete deletion kanıtı değil, istatistiksel bir testtir. Google Research
PrivUn üç recovery seviyesini birbirinden ayırır: direct retrieval, in-context recovery ve fine-tuning yoluyla restoration. Model erişiminize uygun tier'ları kullanın. Orijinal prompt'a verilen bir refusal ilk kontrolü geçebilir; ancak daha güçlü bir recovery yolu hedefi hâlâ açığa çıkarabilir.
7. Eski yapıları kullanımdan kaldırın ve kanıtları saklayın
Model tarafındaki çalışmadan sonra eski replikaları, checkpoint'leri, adapter'ları ve önbellekleri kaldırın veya karantinaya alın. Ardından bir kanıt paketi saklayın:
Bu kanıt, silme iş akışını support, security, legal ve engineering ekiplerinin birlikte doğrulayabileceği bir yapıya dönüştürür.
Güncel unlearning araştırmaları gerçekte neyi destekliyor
Burada üç güncel makale faydalıdır; ancak farklı iddiaları desteklerler.
Behavioral audit ücretsiz değildir
Behavioral auditing hakkındaki Haziran 2026 tarihli makale, aşırı iddialara karşı en güçlü uyarıdır. Temel sonucu "unlearning imkânsızdır" değildir. Daha dar ve daha kullanışlı sonuç şudur: dishonest owner ve honest-but-curious auditor koşullarında behavioral audit, privacy-audit trade-off'u yaratabilir. Compliance anlatınız yalnızca black-box probing'e dayanıyorsa, unutmayı doğrulamaya çalışırken retained data hakkında bilgi sızdırabilirsiniz. arXiv
Hedefli düzenleme seçili benchmark'larda işe yarayabilir
*ZeroUnlearn* daha iyimser bir sonuç sunar. Machine unlearning'i bir model-editing problemi olarak yeniden çerçeveler, Llama-3.2, Llama-3.1 ve Qwen-3 üzerinde güçlü benchmark sonuçları bildirir ve closed-form few-shot update yaklaşımının MCF ve ZsRE üzerinde SVD adımını 0.3 saniyenin altında tuttuğunu söyler. End-to-end editing ise 10 sample'da yaklaşık 0.04 saatten 1000 sample'da 3.35 ila 3.82 saate çıkarken toplam memory yaklaşık 14.9 ila 17.4 GB arasındadır. Bu sayılar önemlidir; çünkü approximate unlearning'in test edilemeyecek kadar pahalı olmadığını gösterir. arXiv
Ancak sınırlamalar başlıktan daha önemlidir. Makale, MCF, ZsRE ve MQUAKE'in uyarlanmış single-hop sürümü gibi seçili open model'leri ve benchmark dataset'lerini değerlendirir. Ayrıca genel yeteneğe zarar vermemek için targeted layer selection kullanır. Bu, umut vadeden benchmark ölçeğinde fact removal için kanıttır; hassas bilgilerin her kopyasının production sisteminden tamamen silindiğinin kanıtı değildir. arXiv
Multimodal sistemlerde sürekli silme hâlâ zayıf
*ICU-Bench* ayıltıcı karşı ağırlıktır. Benchmark; medical report'lar ve labor contract'larından alınan 1.000 privacy-sensitive profile, 9.500 image, 16.000 question-answer pair ve 100 sequential forget task içerir. Sonucu basittir: mevcut multimodal unlearning yöntemleri continual setting'lerde zorlanır ve forgetting quality, retained utility ve long-sequence stability'yi aynı anda koruyamaz. Ürününüz zaman içinde tekrarlanan silme talepleri alıyorsa, temiz otomasyon sözü vermeden önce okumanız gereken makale budur. arXiv
Birlikte ele alındığında bu makaleler pratik bir görüşü destekler:
Kullanıcılara ve paydaşlara ne vaat edilmeli
Daha az vaat edin. Daha çok doğrulayın.
İyi ifadeler şuna benzer:
Kötü ifadeler şuna benzer:
Kısa bir kurala ihtiyacınız varsa şunu kullanın: machine unlearning, daha geniş bir AI veri kaldırma iş akışının içindeki tek bir katmandır.
SSS
Bir vector database satırını silmek LLM'in unutmasını sağlar mı?
Hayır. Bu işlem, verinin yeniden sisteme sokulmasını sağlayan bir retrieval yolunu durdurabilir ve RAG sistemleri için çoğu zaman doğru ilk düzeltmedir. Ancak aynı içerik fine-tuning, continual training veya persistent model memory için kullanıldıysa yalnızca vector satırını silmek ağırlıkları değiştirmez.
Machine unlearning verilerimin her model kopyasından silindiğini kanıtlayabilir mi?
Tek başına kanıtlayamaz. Güncel auditing araştırmaları black-box audit'lerin sınırları olduğunu gösterir ve production sistemleri çoğu zaman denetlenen model yüzeyinin dışında cache'ler, adapter'lar, checkpoint'ler, replikalar ve yedekler içerir. Yalnızca model düzeyinde bir skora değil, sistem düzeyinde kanıta ihtiyacınız vardır. arXiv Google Research
İddia kontrolleri
| İddia | Kontrol | Kaynak |
|---|---|---|
| --- | --- | --- |
| Machine unlearning, belirli eğitim noktalarının etkisini kaldırmak anlamına gelir ve yaklaşık yöntemler tam yeniden eğitimi önleyebilir. | NIST sözlüğündeki ifade ve kapsamla uyumludur. | NIST machine unlearning glossary |
| Google'ın challenge'ı, forget set olmadan yeniden eğitimi model tarafındaki referans noktası olarak ele alır. | Resmî challenge duyurusunda açıklanmıştır. | Google Research challenge announcement |
| Behavioral black-box audit'ler bir privacy-audit trade-off'u yaratabilir. | Haziran 2026 tarihli teorik ve ampirik makaleyle desteklenir. | Behavioral Audit of Machine Unlearning Has a Privacy Cost |
| Tek bir refusal yanıtı kalıcı unutmayı kanıtlar. | Reddedilmiştir; PrivUn direct output kontrollerini in-context ve fine-tuning recovery'den ayırır. | PrivUn |
| ZeroUnlearn, pratik runtime ve memory aralıklarıyla güçlü benchmark sonuçları bildirir; ancak seçili open model'ler ve dataset'ler üzerinde. | Makalenin experiment ve complexity bölümleriyle desteklenir. | ZeroUnlearn |
| Continual multimodal deletion, mevcut yöntemler için hâlâ zordur. | ICU-Bench dataset ölçeği ve temel bulgularla desteklenir. | ICU-Bench |
| Personal data ile eğitilen AI modelleri her zaman anonymous kabul edilemez. | EDPB görüş özetinde ve görüş metninde belirtilmiştir. | EDPB Opinion 28/2024 |
| Tek bir GitHub issue'su platform genelinde bir silme kusurunu kanıtlar. | Reddedilmiştir; yalnızca negatif retrieval testini gerekçelendiren anekdot niteliğinde bir integration raporudur. | AnythingLLM issue #3958 |
