Kimi K3 vs GPT-5.6 Sol o kadar yakın ki yönlendirme testlerimi yeniden çalıştırmamı sağladı. Moonshot'un modeli hala yığıınımda OpenAI veya Anthropic'in yerini almıyor.
Bu sonuç, lansman manşetlerinden daha az dramatik olsa da, sayılar bunu destekliyor. Moonshot AI'nın yeni amiral gemisi, bağımsız bir zeka endeksinde üçüncü sırada yer alıyor, kör ön uç kodlama arenasında liderliği ele geçiriyor ve uzun vadeli bir bilgi işi testinde GPT-5.6 Sol'u geride bırakıyor. Ayrıca, en geniş ölçütlerde Claude Fable 5 ve Sol'un gerisinde kalıyor ve indirilebilir ağırlıkları hala gelecekteki bir tarih için vaat ediliyor.
18 Temmuz 2026 itibarıyla, Kimi K3'ü üretim işlerini geçirmek için bir neden olarak değil, ciddi bir değerlendirme adayı olarak görüyorum. K3'ü henüz kendi üretim kıyaslamamdan geçirmediğim için, aşağıdaki yönlendirme kararım için üçüncü taraf sonuçlarını kendi sonuçlarımdan ayırıyorum.
Kısa karar
Sonuç, göreve göre farklı kazananları olan üç modeller arası bir yarış. Tek bir liderlik tablosu, hangi modelin işinizi en az tekrar denemesiyle tamamlayacağını söyleyemez.
Kimi K3 nedir?
Moonshot AI, Kimi K3'ü 16 Temmuz'da 2,8 trilyon parametreli bir Uzmanlar Karışımı (Mixture-of-Experts) modeli olarak tanıttı. Yönlendiricisi her token için 896 uzmandan 16'sını seçer. K3 ayrıca yerel görüntü girişi, bir milyon tokenlik bağlam penceresi ve metin çıktısına sahiptir.
Moonshot, K2'den bu sıçramayı iki mimari değişikliğe bağlıyor: Kimi Delta Attention ve Attention Residuals. Şirket, K2'ye kıyasla yaklaşık 2,5 kat daha iyi ölçekleme verimliliği bildirdi, ancak henüz bir teknik rapor yayınlanmadı. Bu sayı hala bir satıcı iddiasıdır.
API şu anda canlı. Moonshot, tam ağırlıkların 27 Temmuz'a kadar geleceğini söylüyor. Bu dosyalar gelene kadar, K3 duyurulmuş açık ağırlıklı bir model olup, kendi altyapınızda indirip doğrulayabileceğiniz bir model değildir.
Kimi K3 vs GPT-5.6 Sol vs Claude Fable 5
En temiz karşılaştırma, bağımsız testleri resmi ürün özellikleriyle birleştirir. Aşağıdaki ilk dört satır Artificial Analysis ve Arena'dan gelmektedir; bağlam ve fiyatlandırma her sağlayıcının belgelerinden alınmıştır.
| Ölçü | Kimi K3 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| --- | ---: | ---: | ---: |
| Artificial Analysis Zeka Endeksi | 57 | 59 | 60 |
| GDPval-AA v2 | 1.668 Elo | 1.748 Elo | 1.760 Elo |
| AA-Briefcase bilgi işi | 1.547 Elo | 1.495 Elo | 1.583 Elo |
| Frontend Code Arena | 1.679 Elo | 1.618 Elo | 1.631 Elo |
| Bağlam penceresi | 1M token | 1.05M token | 1M token |
| 1M token başına API giriş/çıkış | 3$ / 15$ | 5$ / 30$ | 10$ / 50$ |
| Ağırlıklar | 27 Temmuz vaat edildi | Kapalı | Kapalı |

*Kaynak: Artificial Analysis, 17 Temmuz 2026. v4.1 endeksi, dokuz kodlama, akıl yürütme, bilgi ve ajan değerlendirmesini birleştirir.*
K3 ve Sol arasındaki iki puanlık fark, harness kalitesi, gecikme, token kullanımı ve hata kurtarma kadar önemli olmayacak kadar küçüktür. Fable 5'e olan üç puanlık fark hala gerçek. K3 sınır grubuna ulaştı; ancak grubu kazanmadı.
Kimi K3 nerede kazanıyor?
Ön uç kodlama ve görsel yineleme
K3'ün en güçlü bağımsız sonucu Frontend Code Arena'dır. İnsan değerlendiriciler anonim, çalıştırılabilir ön uç çıktılarını karşılaştırır ve daha iyi sonuç için oy verir. K3, Fable 5'in 48 puan ve Sol'un 61 puan üzerinde 1.679 Elo'ya ulaştı. Arena ayrıca onu yedi ön uç kategorisinden altısında birinci sıraya yerleştirdi.
Bu sonuç, açılış sayfaları, paneller, tasarım yeniden oluşturmaları ve görsel araçlar oluşturan ekipler için önemlidir. Bu, yalnızca bir birim testinin geçip geçmediğini değil, çalışan çıktı için tercihi ölçer.
Moonshot'un daha geniş kodlama tablosu karışıktır. K3, Program Bench'te 77.8 ve SWE Marathon'da 42.0 ile lider. Sol, DeepSWE'de 73.0 ve Terminal-Bench 2.1'de 88.8 ile lider. Fable 5 ise FrontierSWE'de 86.6 ve Moonshot'un dahili Kimi Code Bench karşılaştırmasında 76.9 ile lider.

*Kaynak: Moonshot AI'nin Kimi K3 lansman gönderisi. Bunlar satıcı tarafından birleştirilmiş sonuçlardır ve modeller bazen farklı ajan harness'leri kullanır.*
Harness seçimi skoru değiştirir. K3 genellikle Kimi Code'da, Sol Codex'te ve Fable ise Claude Code'da çalışır. Bir kıyaslama, modeli, harness'i veya ikisi arasındaki etkileşimi ölçebilir. Dağıtmayı planladığım araç içinde temsilci bir depo görevini yeniden çalıştırırdım.
Otomasyon ve bilgi işi
Artificial Analysis, K3'e AutomationBench-AA'da %53 skor ve birincilik veriyor. Özel, uzun vadeli bir bilgi işi değerlendirmesi olan AA-Briefcase'de K3 1.547 Elo skor alıyor. Bu, Sol'un 1.495'ini geçiyor ve Fable 5'in 1.583'ünün gerisinde kalıyor.
Moonshot'un değerlendirmesi ayrıca K3'ü BrowseComp ve SpreadsheetBench 2'de dar bir farkla öne geçiriyor. Fable, GDPval-AA, JobBench ve genel AA-Briefcase skorunda lider. Sol, AA-Briefcase dökümünde sunum kalitesi konusunda en güçlü olmaya devam ediyor.

*Kaynak: Moonshot AI. Grafik bağımsız skorları, genel liderlik tablolarını ve Moonshot tarafından yürütülen testleri içerir; çubukları tek bir kontrollü deney olarak kabul etmeden önce dipnotlarını okuyun.*
K3, araştırma ajanları, elektronik tablo çalışmaları ve tarayıcı otomasyonu için kullanışlı görünüyor. Fable, analitik kalitenin fiyattan daha önemli olduğu durumlarda daha güvenli bir bahis olmaya devam ediyor. Sol ise zaten Codex, Responses API, barındırılan araçlar ve programatik araç çağrısı kullanan ekiplere uygun.
Kimi K3 nerede hala geride?
Genel akıl yürütme ve uzman bilgisi
Fable 5, Humanity's Last Exam'da net bir liderliği koruyor. Moonshot, araçsız Fable için 53.3, Sol için 44.5 ve K3 için 43.5 bildiriyor. Araçlarla birlikte skorlar sırasıyla 63, 58 ve 56'ya yükseliyor. Bu, genel endeksin önerdiğinden daha büyük bir boşluktur.
Sol, OpenAI'nin lansman tablosunda birkaç bilim, bilgisayar kullanımı ve uzun bağlam testinde en güçlü yayınlanmış skorları yayınlıyor. Fable, GDPval-AA ve genel AA-Briefcase'de lider. K3 seçili görevleri kazanıyor, ancak kategoriler genelinde aynı tutarlılığı göstermiyor.
Bilgi güvenilirliği
K3, K2.6 ile karşılaştırıldığında AA-Omniscience doğruluğunu %33'ten %46'ya çıkardı. Halüsinasyon oranı da %39'dan %51'e yükseldi. Birleşik Omniscience skoru, K3 daha fazla soruyu doğru yanıtladığı için 6'dan 18'e iyileşiyor, ancak desteklenmeyen yanıtlardaki bu gerileme, atıf ağırlıklı çalışmalarda test edilmeyi hak ediyor.

*Kaynak: Artificial Analysis. Halüsinasyon oranı AA-Omniscience'a aittir ve her prompt türüne genelleştirilmemelidir.*
Bu modellerden herhangi birini gerçek yayıncılık için kullanmadan önce kaynak getirimi, alıntılanmış kanıt ve deterministik doğrulama talep ederdim. K3'ün sonucu bu kuralı değiştirmiyor.
Kimi K3 pratikte daha ucuz mu?
Liste fiyatları K3'ü belirleyici gösteriyor:
Artificial Analysis, K3 için zeka-endeksi görevi başına 0,94$, Sol için 1,04$ ve Fable 5 için 2,75$ tahmin ediyor. K3'ün token kullanımı, bu iş yükünde Sol üzerindeki liste fiyatı avantajını on sente daraltıyor. Fable çok daha pahalıya mal oluyor, ancak genel endekste ve en zor bilgi işi testlerinde de birinci bitiriyor.
Token başına fiyat eksik bir bütçedir. Üretim maliyeti; yeniden denemeleri, araç çağrılarını, inceleme süresini, gecikmeyi ve yanlış bir yanıttan kurtulmak için gereken işi içerir. Yarısı kadar ücret alan ve iki kat fazla onarım döngüsüne ihtiyaç duyan bir model para tasarrufu sağlamamıştır.
Yığınım neden OpenAI ve Anthropic olarak kalıyor?
Kodlama, araştırma ve ajan iş akışları için zaten OpenAI ve Anthropic kullanıyorum. K3, henüz üçüncü bir üretim sağlayıcısını bünyeme almam için bana yeterli kanıt vermedi.
OpenAI, ajan kodlaması için varsayılanım olarak kalıyor çünkü Sol, bağımsız Coding Agent Index'te 80 ile lider, Codex ve Responses API ile entegre ve işim için en geniş araç yüzeyine sahip. GPT-5.6 Sol ve Fable 5 karşılaştırmam→ bu yönlendirme kararını daha ayrıntılı olarak ele alıyor.
Anthropic, uzun, zor analizler ve karmaşık kod tabanı çalışmaları için ikinci rotam olarak kalıyor. Fable 5, genel zeka endeksi, GDPval-AA, AA-Briefcase ve Humanity's Last Exam'da lider. 10$/50$ fiyatı ve 30 günlük veri saklama gerekliliği, onu kalite kazancının bu kısıtlamaları karşıladığı işler için ayırmam gerektiği anlamına geliyor.
Standartım gerçekten çalışan AI ajanları oluşturmaktan→ geliyor: bitmiş görevler, gözlemlenen araç hataları ve inceleme maliyeti, bir manşet skorundan daha önemlidir.
K3, üç işle bir test şeridine giriyor:
Moonshot ağırlıkları ve teknik raporu yayınladıktan, son lisansı inceledikten ve K3 bu testlerden geçtikten sonra üretim yönlendirmesini yeniden değerlendireceğim. Ağır ön uç veya otomasyon iş yüklerine sahip ekipler bu noktaya daha erken ulaşabilir.
Pratik bir model seçimi
İş yükünde ön uç kalitesi, tarayıcı otomasyonu veya daha düşük API liste fiyatları baskın olduğunda kontrollü bir değerlendirme için Kimi K3'ü seçin.
Olgun bir kodlama-ajan ortamına, geniş araç desteğine, güçlü sunum kalitesine ve teknik görevler genelinde tutarlı sonuçlara ihtiyacınız olduğunda GPT-5.6 Sol'u seçin.
İş uzun, belirsiz ve daha yüksek maliyeti ile veri saklama kısıtlamalarını haklı çıkaracak kadar analitik olarak zor olduğunda Claude Fable 5'i seçin.
Bugünkü cevabım, test altında olan K3 ile OpenAI artı Anthropic. Moonshot bu testi hak etti. Otomatik bir geçişi henüz hak etmedi.
Kaynaklar ve metodoloji
Moonshot'un Kimi K3 lansman gönderisini ve API fiyatlandırmasını, Artificial Analysis'in bağımsız K3 değerlendirmesini, AP tarafından bildirilen Arena'nın kör ön uç sıralamasını, OpenAI'nin GPT-5.6 sürümünü ve Sol model belgelerini, ayrıca Anthropic'in Fable 5 lansmanını ve Claude Fable 5 API kılavuzunu kontrol ettim.
Tüm skorlar ve fiyatlar 18 Temmuz 2026 itibarıyla günceldir. Model sağlayıcıları, model adını değiştirmeden fiyatlandırma, yönlendirme, güvenlik önlemleri ve sunum davranışını değiştirebilir.