Machine Unlearning: Pratik Bir AI Veri Kaldırma İş Akışı
Tech
AI
AI Engineering
Privacy
Machine Learning

Machine Unlearning: Pratik Bir AI Veri Kaldırma İş Akışı

Retrieval, model düzenlemeleri, replikalar ve denetim kanıtları genelinde AI verilerini silmek için kaynaklarla desteklenen bir iş akışı.

Uygar DuzgunUUygar Duzgun
Jul 29, 2026
Güncellendi 14 Ağu 2026
13 min read

Birisi sizden verilerini bir AI sisteminden silmenizi isterse, bir veritabanından tek bir satırı kaldırmak işin tamamı değildir. Machine unlearning, bir modelin belirli eğitim örneklerine verdiği yanıtı azaltabilir veya yönlendirebilir; ancak yığının geri kalanını otomatik olarak temizlemez: vektör dizinleri, fine-tuned adapter'lar, önbelleğe alınmış prompt'lar, checkpoint'ler, replikalar, yedekler ve dışa aktarımlar. NIST, machine unlearning'i belirli eğitim noktalarının eğitilmiş bir model üzerindeki etkisini seçici olarak kaldırma işlemi olarak tanımlar ve verimli yaklaşık tekniklerin sıfırdan tam yeniden eğitimi önleyebileceğini açıkça belirtir. Bu, "tüm sistemin veriyi unutması" ifadesinden daha dar bir kavramdır. NIST

Çoğu ekip için pratik yanıt katmanlıdır. Önce verinin nereye gittiğini izleyin. Ardından yeniden kullanımını durdurun. Sonra türetilmiş yapıları silin veya kısıtlayın. Ancak bundan sonra model ağırlıklarının yeniden eğitilmesi ya da yaklaşık unlearning gerekip gerekmediğine karar verin. Google'ın 2023 Machine Unlearning Challenge'ı tam olarak bu model merkezli çerçeveyi kullandı: unlearned bir model, forget set olmadan yeniden eğitilmiş bir modelden ayırt edilmesi zor hâle gelmeli ve aynı zamanda retained set üzerindeki performansını korumalıdır. Google Research

Prompt — Copy & Paste
Hedef kitle: Orta düzey Aşağıdaki tüm sayısal sonuçlar, atıf yapılan makalelerden veya resmî belgelerden alınmıştır. Buraya yayımlanmamış benchmark iddiaları eklenmemiştir.

İçindekiler

Machine unlearning gerçekte ne anlama gelir

Machine unlearning, model düzeyinde gerçekleştirilen bir işlemdir. Seçilen verilerin eğitilmiş bir modelin davranışı üzerindeki etkisini azaltmayı amaçlar. Bu, retained set üzerinde tam yeniden eğitim anlamına gelebilir veya tam yeniden eğitimin maliyetine katlanmadan yeterince yakın bir sonuç elde etmeyi hedefleyen yaklaşık bir yöntem olabilir. NIST sözlük girdisinde her iki fikri de kullanır ve Google'ın challenge sayfası altın standardı, unutulan örnekler olmadan sıfırdan yeniden eğitilmiş bir modele benzerlik olarak tanımlar. NIST Google Research

Bu tanım önemlidir; çünkü AI sistemleri nadiren yalnızca model ağırlıklarından oluşur. Üretim ortamındaki bir yığın genellikle şunları içerir:

kaynak veritabanları ve object storage
embedding'ler ve vektör dizinleri
prompt log'ları, trace'ler, önbellekler ve analytics
fine-tuned adapter'lar veya checkpoint'ler
model replikaları, evaluation set'leri, dışa aktarımlar ve yedekler

Bu katmanlardan yalnızca birini silmek, verinin başka bir yerde hâlâ erişilebilir kalmasına neden olabilir. Pratikte "bu veriyi AI'dan kaldır" talebi, model düzenleme problemine dönüşmeden önce bir lineage problemidir.

Normal bir silme akışı neden yeterli değildir

Birçok AI ürünü, silinmesi istenen veriler üzerinde hiçbir zaman training gerçekleştirmemiştir. Bu ürünler veriyi yalnızca inference sırasında retrieval yoluyla kullanmıştır. Böyle bir durumda yapılması gereken, kaynak kayıtlarını, türetilmiş embedding'leri, önbellekleri ve erişim yollarını kaldırmaktır. Model unlearning burada ilgisizdir; çünkü model ağırlıkları hiç değiştirilmemiştir.

Daha zor durumlar, verinin ağırlıkları, adapter'ları veya kalıcı memory'leri etkilediği zaman başlar. Bu nedenle her silme talebine aynı şekilde yaklaşmak yerine dört durumu birbirinden ayırmanız gerekir.

Durumİlk yapılacak kaldırma işlemleriModel unlearning gerekli mi?Hangi kanıt saklanmalı
------------
Veri yalnızca kaynak sistemlerde ve log'larda bulunuyorduKaynak kaydı, dışa aktarımlar, log'lar ve önbellekleri silin veya kısıtlayınHayırKayıt ID'leri, silme zaman damgası, retention yolu
Veri ayrıca RAG veya search sistemine girdiKaynak dosyaları, chunk'ları, embedding'leri, vektör satırlarını, cache key'lerini ve reindex job'larını kaldırınGenellikle hayır; ancak bu belgeler daha sonra training için kullanıldıysa gerekirReindex tamamlanması, retrieval testleri, chunk sayıları
Veri fine-tuned bir modeli veya adapter'ı etkilediKaynak yapıları kaldırın ve yeniden training, adapter değişimi veya yaklaşık unlearning arasında karar verinEvetForget set tanımı, retained set kontrolleri, eski modelin kullanımdan kaldırılması
Veri üçüncü taraf bir foundation modelinin içinde bulunabilirKendi kopyalarınızı kaldırın ve provider düzeyinde bir süreç başlatınBelki; ancak bunu yalnızca provider gerçekleştirebilirTicket, vendor açıklaması, sözleşme/policy yolu

Bu tablo, "silme düğmesi"nin neden yanlış bir zihinsel model olduğunu gösterir. Doğru model, kapsamı belirlenmiş kaldırma işlemi ve kanıttır.

Pratik yedi adımlı iş akışı

1. Talebin kapsamını belirleyin ve yeniden kullanımı dondurun

Kesin tanımlayıcılarla başlayın: user ID, file hash, document ID'leri, vector collection adları, training batch ID'leri veya ticket referansları. Ardından yeni yeniden kullanımı durdurun. Temizlik sırasında aynı veriyi yeniden oluşturabilecek ingestion, retraining, export job'larını veya sync işlemlerini duraklatın.

Talep privacy kaynaklıysa hukuki çerçeveyi dar tutun. GDPR Article 17, belirli koşullarda silme hakkı oluşturur; ancak önce hangi teknik katmana müdahale etmeniz gerektiğini söylemez. European Data Protection Board'un 18 Aralık 2024 tarihli AI modelleri hakkındaki görüşü de personal data ile eğitilen modellerin her durumda anonymous kabul edilemeyeceğini belirtir. Modelin kapsam dışında olduğunu varsaymak yerine açık bir silme iş akışını koruyun. EUR-Lex EDPB

2. Herhangi bir şeyi silmeden önce lineage'ı izleyin

Tam yolu haritalayın:

kaynak sistemi
preprocessing veya chunking job'ı
vector index veya retrieval store
fine-tuning veya continual-training dataset'i
adapter, checkpoint veya merged model
serving replikaları, önbellekler ve yedekler
Sizin için önerilenler

Bu noktada bir AI bill of materials faydalı hâle gelir. Kaydı hangi modelin, adapter'ın veya index'in kullandığını bilmiyorsanız, daha sonra kaldırıldığını kanıtlayamazsınız.

3. Kaynak ve türetilmiş yapıları silin veya kısıtlayın

Şimdi deterministik olarak temizleyebileceğiniz unsurları kaldırın:

kaynak kaydı ve doğrudan dışa aktarımlar
document chunk'ları ve embedding'ler
vector index girdileri
kayıtla ilişkili prompt/session memory
önbelleğe alınmış generation'lar veya search snippet'leri
hassas içeriği kopyalayan evaluation fixture'ları
Sizin için önerilenler

Retrieval ağırlıklı sistemlerde bu adım çoğu zaman model düzenlemesinden daha önemlidir. Aynı mantık RAG evaluation için de geçerlidir: kötü içeriği yeniden sisteme sokan yol retrieval ise, modeli suçlamadan önce retrieval'ı düzeltirsiniz.

Herkese açık bir AnythingLLM issue, bir Weaviate destekli kurulumda silinen belgelerin embedding'lerinin görünüşe göre retrieval edilebilir durumda kaldığını bildirdi. Tek bir issue, platform genelinde geçerli bir bulgu değil, anekdot niteliğinde bir kanıttır. Yine de her silme akışının document ID'leri, ayırt edici ifadeler ve paraphrase'ler için negatif retrieval testi gerektirdiğini gösterir.

4. Model ağırlıklarının gerçekten değişip değişmediğine karar verin

Ekiplerin sıklıkla atladığı karar noktası budur.

Sistem yalnızca prompt-time retrieval kullandıysa weight unlearning gereksizdir.
Veri fine-tuned bir adapter'a veya domain modeline girdiyse exact retraining ile approximate unlearning arasında seçim yapın.
Veri kontrolünüz dışındaki bir provider modelinde bulunabiliyorsa teknik çalışmanız kendi sınırınızda sona erer ve süreç provider escalation'a dönüşür.

Google'ın 2023 challenge'ı model tarafındaki hedefi tanımlar: unlearned model, unutulan örnekler olmadan yeniden eğitilmiş bir modele benzemeli ve verinin geri kalanından öğrenilen faydalı davranışı korumalıdır. Google Research

5. Ağırlıkları değiştirmeden önce evaluation set'leri oluşturun

En az üç dilime ihtiyacınız vardır:

forget set: hassas davranışı artık yeniden üretmemesi gereken prompt'lar veya örnekler
retain set: çalışmaya devam etmesi gereken komşu görevler
utility set: çökmemesi gereken normal ürün görevleri
Sizin için önerilenler

Bu, AI agent permissions sistemlerini denetlenebilir kılan disiplinin aynısıdır: neyin durması, neyin kalması ve hangi kanıtın geçerli sayılması gerektiğini tanımlayın.

Kapsam tanımından lineage izleme, artifact temizliği, model kararı, evaluation ve kanıta kadar AI veri kaldırma iş akışını gösteren diyagram
Kapsam tanımından lineage izleme, artifact temizliği, model kararı, evaluation ve kanıta kadar AI veri kaldırma iş akışını gösteren diyagram

*Başlık: Silme çalışması data lineage ve türetilmiş yapılarla başlar. Model unlearning, ancak ağırlıkların etkilenip etkilenmediğini kanıtladıktan sonra başlar.*

6. Unutmayı ve retained utility'yi birlikte test edin

Güncel araştırmalar trade-off'u açıkça ortaya koyuyor.

*Behavioral Audit of Machine Unlearning Has a Privacy Cost* makalesi, convex modeller için black-box behavioral audit'in hem yetersiz unlearning'i tespit edemeyeceğini hem de retained set üyeliği bilgisini honest-but-curious bir auditor'a sızdırmaktan kaçınamayacağını savunur. Yazarlar ayrıca bu gerilimin non-convex ortamlarda da sürdüğüne dair ampirik kanıt gösterir. Bu, tek bir temiz audit skorunun güvenli unutmanın evrensel kanıtı olmadığı anlamına gelir. arXiv

Google Research'ün 10 Haziran 2026 tarihli audit framework'ü probleme başka bir yönden yaklaşır. Auditing'i daha hassas hâle getirmek ve farklı sample size'larda false positive'leri daha güvenilir biçimde kontrol etmek için Regularized f-Divergence Kernel Tests önerir. Sonuç, complete deletion kanıtı değil, istatistiksel bir testtir. Google Research

PrivUn üç recovery seviyesini birbirinden ayırır: direct retrieval, in-context recovery ve fine-tuning yoluyla restoration. Model erişiminize uygun tier'ları kullanın. Orijinal prompt'a verilen bir refusal ilk kontrolü geçebilir; ancak daha güçlü bir recovery yolu hedefi hâlâ açığa çıkarabilir.

7. Eski yapıları kullanımdan kaldırın ve kanıtları saklayın

Model tarafındaki çalışmadan sonra eski replikaları, checkpoint'leri, adapter'ları ve önbellekleri kaldırın veya karantinaya alın. Ardından bir kanıt paketi saklayın:

talebin kapsamı
etkilenen sistemler
silme işlemleri
kullanımdan kaldırılan model sürümü
yayına alınan replacement sürümü
forget set ve retain set sonuçları
backup expiry veya retention işlemleri

Bu kanıt, silme iş akışını support, security, legal ve engineering ekiplerinin birlikte doğrulayabileceği bir yapıya dönüştürür.

Güncel unlearning araştırmaları gerçekte neyi destekliyor

Burada üç güncel makale faydalıdır; ancak farklı iddiaları desteklerler.

Behavioral audit ücretsiz değildir

Behavioral auditing hakkındaki Haziran 2026 tarihli makale, aşırı iddialara karşı en güçlü uyarıdır. Temel sonucu "unlearning imkânsızdır" değildir. Daha dar ve daha kullanışlı sonuç şudur: dishonest owner ve honest-but-curious auditor koşullarında behavioral audit, privacy-audit trade-off'u yaratabilir. Compliance anlatınız yalnızca black-box probing'e dayanıyorsa, unutmayı doğrulamaya çalışırken retained data hakkında bilgi sızdırabilirsiniz. arXiv

Hedefli düzenleme seçili benchmark'larda işe yarayabilir

*ZeroUnlearn* daha iyimser bir sonuç sunar. Machine unlearning'i bir model-editing problemi olarak yeniden çerçeveler, Llama-3.2, Llama-3.1 ve Qwen-3 üzerinde güçlü benchmark sonuçları bildirir ve closed-form few-shot update yaklaşımının MCF ve ZsRE üzerinde SVD adımını 0.3 saniyenin altında tuttuğunu söyler. End-to-end editing ise 10 sample'da yaklaşık 0.04 saatten 1000 sample'da 3.35 ila 3.82 saate çıkarken toplam memory yaklaşık 14.9 ila 17.4 GB arasındadır. Bu sayılar önemlidir; çünkü approximate unlearning'in test edilemeyecek kadar pahalı olmadığını gösterir. arXiv

Ancak sınırlamalar başlıktan daha önemlidir. Makale, MCF, ZsRE ve MQUAKE'in uyarlanmış single-hop sürümü gibi seçili open model'leri ve benchmark dataset'lerini değerlendirir. Ayrıca genel yeteneğe zarar vermemek için targeted layer selection kullanır. Bu, umut vadeden benchmark ölçeğinde fact removal için kanıttır; hassas bilgilerin her kopyasının production sisteminden tamamen silindiğinin kanıtı değildir. arXiv

Multimodal sistemlerde sürekli silme hâlâ zayıf

*ICU-Bench* ayıltıcı karşı ağırlıktır. Benchmark; medical report'lar ve labor contract'larından alınan 1.000 privacy-sensitive profile, 9.500 image, 16.000 question-answer pair ve 100 sequential forget task içerir. Sonucu basittir: mevcut multimodal unlearning yöntemleri continual setting'lerde zorlanır ve forgetting quality, retained utility ve long-sequence stability'yi aynı anda koruyamaz. Ürününüz zaman içinde tekrarlanan silme talepleri alıyorsa, temiz otomasyon sözü vermeden önce okumanız gereken makale budur. arXiv

Birlikte ele alındığında bu makaleler pratik bir görüşü destekler:

unlearning, mühendislik çalışması yapılabilecek kadar gerçektir
audit'ler istatistikseldir ve bilgi sızdırabilir
continual, tekrarlanan ve multimodal silme, tek bir benchmark düzenlemesinden çok daha zordur

Kullanıcılara ve paydaşlara ne vaat edilmeli

Daha az vaat edin. Daha çok doğrulayın.

İyi ifadeler şuna benzer:

"Kaynak verilerinizi ve türetilmiş retrieval yapılarını kaldırdık."
"Etkilenen adapter'ı kullanımdan kaldırdık ve kaldırılan set olmadan eğitilmiş bir sürümle değiştirdik."
"Replacement sürümünü forget, retain ve utility kontrolleriyle test ettik."

Kötü ifadeler şuna benzer:

"AI sizi tamamen unuttu."
"Vector store'dan silmek model sorununu çözdü."
"Tek bir audit skoru, verinin her yerde yok olduğunu kanıtlar."

Kısa bir kurala ihtiyacınız varsa şunu kullanın: machine unlearning, daha geniş bir AI veri kaldırma iş akışının içindeki tek bir katmandır.

SSS

Bir vector database satırını silmek LLM'in unutmasını sağlar mı?

Hayır. Bu işlem, verinin yeniden sisteme sokulmasını sağlayan bir retrieval yolunu durdurabilir ve RAG sistemleri için çoğu zaman doğru ilk düzeltmedir. Ancak aynı içerik fine-tuning, continual training veya persistent model memory için kullanıldıysa yalnızca vector satırını silmek ağırlıkları değiştirmez.

Machine unlearning verilerimin her model kopyasından silindiğini kanıtlayabilir mi?

Tek başına kanıtlayamaz. Güncel auditing araştırmaları black-box audit'lerin sınırları olduğunu gösterir ve production sistemleri çoğu zaman denetlenen model yüzeyinin dışında cache'ler, adapter'lar, checkpoint'ler, replikalar ve yedekler içerir. Yalnızca model düzeyinde bir skora değil, sistem düzeyinde kanıta ihtiyacınız vardır. arXiv Google Research

İddia kontrolleri

İddiaKontrolKaynak
---------
Machine unlearning, belirli eğitim noktalarının etkisini kaldırmak anlamına gelir ve yaklaşık yöntemler tam yeniden eğitimi önleyebilir.NIST sözlüğündeki ifade ve kapsamla uyumludur.NIST machine unlearning glossary
Google'ın challenge'ı, forget set olmadan yeniden eğitimi model tarafındaki referans noktası olarak ele alır.Resmî challenge duyurusunda açıklanmıştır.Google Research challenge announcement
Behavioral black-box audit'ler bir privacy-audit trade-off'u yaratabilir.Haziran 2026 tarihli teorik ve ampirik makaleyle desteklenir.Behavioral Audit of Machine Unlearning Has a Privacy Cost
Tek bir refusal yanıtı kalıcı unutmayı kanıtlar.Reddedilmiştir; PrivUn direct output kontrollerini in-context ve fine-tuning recovery'den ayırır.PrivUn
ZeroUnlearn, pratik runtime ve memory aralıklarıyla güçlü benchmark sonuçları bildirir; ancak seçili open model'ler ve dataset'ler üzerinde.Makalenin experiment ve complexity bölümleriyle desteklenir.ZeroUnlearn
Continual multimodal deletion, mevcut yöntemler için hâlâ zordur.ICU-Bench dataset ölçeği ve temel bulgularla desteklenir.ICU-Bench
Personal data ile eğitilen AI modelleri her zaman anonymous kabul edilemez.EDPB görüş özetinde ve görüş metninde belirtilmiştir.EDPB Opinion 28/2024
Tek bir GitHub issue'su platform genelinde bir silme kusurunu kanıtlar.Reddedilmiştir; yalnızca negatif retrieval testini gerekçelendiren anekdot niteliğinde bir integration raporudur.AnythingLLM issue #3958

Kaynaklar

NIST glossary: machine unlearning — approximate unlearning'in temel tanımı ve kapsamı.
Google Research: Announcing the first Machine Unlearning Challenge — forget ve retain davranışı için resmî çerçeve.
Google Research: New framework for auditing machine unlearning — 10 Haziran 2026 tarihli güncel resmî audit framework güncellemesi.
Behavioral Audit of Machine Unlearning Has a Privacy Cost — teorik ve ampirik privacy-audit trade-off sonucu.
ZeroUnlearn: Few-Shot Knowledge Unlearning in Large Language Models — bildirilen runtime, memory ve benchmark sonuçlarıyla targeted editing yaklaşımı.
ICU-Bench: Benchmarking Continual Unlearning in Multimodal Large Language Models — continual multimodal deletion benchmark'ı ve sınırlamaları.
PrivUn: A Privacy-Focused Evaluation Framework for Machine Unlearning in Large Language Models — direct, in-context ve fine-tuning attack tier'larıyla recovery odaklı evaluation.
OpenUnlearning repository — LLM unlearning deneyleri için güncel open benchmarking ve implementation yüzeyi.
GDPR Article 17 on EUR-Lex — silme hakkının hukuki metni.
EDPB Opinion 28/2024 on AI models and personal data — AI modelleri için vaka bazında anonymity ve lawful-processing bağlamı.
AnythingLLM issue #3958 — yalnızca bir integration-test örneği olarak kullanılan anekdot niteliğinde practitioner raporu.