Grok 4.5 vs GPT-5.6 Sol, bu sürüm döngüsündeki maliyetin başka bir sağlayıcıyı test etmek için ciddi bir neden haline geldiği ilk karşılaştırmadır. Yine de, OpenAI veya Anthropic'i değiştirmemi sağlamıyor.
SpaceXAI'nın en son modeli sınırı aşıyor, hızlı çalışıyor ve milyon başına 2 $ giriş tokeni ve milyon başına 6 $ çıkış tokeni ücreti alıyor. Bağımsız testler, onu önde gelen kodlama ajanlarına yakın bir konuma yerleştiriyor. Aynı test, genel zeka açısından Sol'un beş puan gerisinde ve Claude Fable 5'in altı puan gerisinde olduğunu gösteriyor.
18 Temmuz 2026 itibarıyla, benim yolum OpenAI birinci ve Anthropic ikinci olarak kalıyor. Grok 4.5, kodlama ajanları, otomasyon ve yüksek hacimli iş yükleri için kontrollü bir test alanına giriyor. Henüz üretimde kullanmadım, bu nedenle bu karşılaştırma yayımlanan ölçümleri kendi yönlendirme kararlarımdan ayırıyor.
Kısa karar
Grok 4.5'in net bir rolü var. Yeni bir kalite lideri değil, maliyet etkin bir sınır modeli.
Grok 4.5 Nedir?
SpaceXAI, Grok 4.5'i 8 Temmuz'da kodlama, ajans görevleri ve bilgi çalışmaları için amiral gemisi olarak yayımladı. Şirket, bunu Cursor ile birlikte eğitti ve xAI API, Grok Build ve Cursor aracılığıyla erişilebilir hale getirdi.
Model, metin ve görüntüleri kabul eder, metin döndürür ve işlev çağrısını, yapılandırılmış çıktıları ve yapılandırılabilir akıl yürütmeyi destekler. Bağlam penceresi 500.000 token'dır. Yayınlanan bilgi kesimi 1 Şubat 2026'dır, bu nedenle güncel bilgiler xAI'nin web veya X arama araçlarını gerektirir.
Grok Build açık kaynaklıdır, bu da ekiplerin ajan döngüsünü, bağlam derlemesini, araç dağıtımını, kancaları, becerileri, eklentileri ve MCP entegrasyonunu incelemesine olanak tanır. Grok 4.5 modeli kendisi özel kalır; SpaceXAI ağırlıklarını yayımlamamıştır.
Grok 4.5 vs GPT-5.6 Sol vs Claude Fable 5
Geniş karşılaştırma, kalite açısından Anthropic ve OpenAI'yi, ardından maliyet açısından Grok'u destekliyor. Bu değerler, bağımsız Yapay Analiz testlerini her sağlayıcının mevcut API belgeleriyle birleştiriyor.
| Ölçüm | Grok 4.5 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| --- | ---: | ---: | ---: |
| Yapay Analiz Zeka İndeksi | 54 | 59 | 60 |
| Kodlama Ajanı İndeksi | Grok Build'de 76 | Codex'te 80 | Yedekleme ile Claude Code'da 77 |
| Zeka İndeksi görevi başına maliyet | 0.31 $ | 1.04 $ | 2.75 $ |
| Bağlam penceresi | 500k token | 1.05M token | 1M token |
| API girişi/çıkışı 1M token başına | 2 $ / 6 $ | 5 $ / 30 $ | 10 $ / 50 $ |
| Ağırlıklar | Kapalı | Kapalı | Kapalı |

*Kaynak: Yapay Analiz, 17 Temmuz 2026. V4.1 indeksi, dokuz ajans, kodlama, akıl yürütme, bilgi ve uzun bağlam değerlendirmesini birleştirir.*
Grok ile Sol arasında beş puan, Fable ile altı puan fark var. Bu fark, zor görevlerde belirgin bir şekilde ortaya çıkacak kadar büyük, ancak maliyet, gecikme ve araç güvenilirliği yüksek hacimli işlerde pratik sonucu tersine çevirecek kadar küçüktür.
Grok 4.5 nerede iyi performans gösteriyor?
Kodlama ajanları ve terminal çalışmaları
Grok 4.5, Yapay Analiz Kodlama Ajanı İndeksi'nde Grok Build'de 76 puan alıyor. Sol, Codex'te 80 puanla önde. Fable 5, Claude Code'da 77 puan alıyor, ancak bu yapılandırma Opus 4.8'e geri dönebilir.
Grok ile test edilen Fable yapılandırması arasında bir puan farkı var. Sol ile arasında dört puan fark var. Bu, bir ajanın yüzlerce araç çağrısı ve çıktı tokeni maliyetini topladığı durumlarda depo düzeyinde denemeleri haklı çıkarmak için yeterince yakındır.

*Kaynak: Yapay Analiz. İndeks, DeepSWE, Terminal-Bench v2 ve SWE-Atlas-QnA'nın ortalamasını alır. Araçlar farklılık gösterir, bu nedenle grafik model-ajan kombinasyonunu ölçer.*
SpaceXAI'nın lansman tablosu benzer ama daha güncel bir hikaye anlatıyor. Grok, SWE Marathon'da %29.0 ile önde, Terminal-Bench 2.1'de %83.3 puan alıyor ve SWE-Bench Pro'da %64.7'ye ulaşıyor. Fable 5, gösterilen beş kodlama testinin dördünde önde. SpaceXAI, Grok'u GPT-5.5 ile karşılaştırdı, bu nedenle o sağlayıcı tablosunu doğrudan bir Sol kararı için kullanmam.
Hız ve token verimliliği
Yapay Analiz, Grok 4.5'i saniyede yaklaşık 112 çıktı tokeni ile ölçtü. SpaceXAI, modelin her çözümlenen SWE-Bench Pro görevi için 15.954 çıktı tokeni kullandığını ve Claude Opus 4.8 ile karşılaştırıldığında 4.2 kat daha az token kullandığını bildiriyor.
Bu rakamlar farklı test kurulumlarını tanımlıyor, ancak aynı yöne işaret ediyor: Grok, ajans çalışmalarını daha az çıktı ile tamamlamak için tasarlanmıştır. Tasarruf, bir kodlama ajanı dosyaları okuduğunda, komutlar çalıştırdığında, hataları onardığında ve döngüyü tekrar ettiğinde önemlidir.
Grok 4.5 maliyet kazananı mı?
200.000 token'in altındaki istemler için, xAI milyon başına 2 $ giriş tokeni, önbelleklenmiş giriş için 0.50 $ ve çıkış için 6 $ alıyor. Bir istem 200.000 token'i geçtiğinde, oranlar tüm istekte 4 $, 1 $ ve 12 $'ya iki katına çıkıyor.
Kısa bağlam liste fiyatı, girişte Sol'un %60 altında ve çıkışta %80 altında. Fable 5, giriş için beş kat daha pahalı ve çıkış için sekiz kat daha pahalıdır.

*Kaynak: Yapay Analiz. Görev başına maliyet, her modelin kullandığı tokenleri içerir, yalnızca fiyat kartlarını karşılaştırmak yerine.*
Bağımsız görev maliyeti, fiyat kartından daha kullanışlıdır: Grok için 0.31 $, Sol için 1.04 $ ve Fable için 2.75 $. Grok, bu test maliyetini yaklaşık %70 oranında azaltırken, Sol'a beş zeka puanı kaybediyor.
Üretim maliyeti, başarısız araç çağrıları, tekrar eden yamanmalar, inceleme süresi ve gerilemeleri de içerir. Sonucu onarmak için kıdemli bir geliştiriciye ihtiyaç duyan ucuz bir çalışma, pahalı bir temiz çalışmadan daha fazla maliyetli olabilir.
Grok 4.5 nerede geride kalıyor?
Genel kalite ve uzun bağlam
Sol ve Fable, geniş bağımsız indekslerde önde. Her ikisi de Grok'un bağlam penceresinin yaklaşık iki katını sunuyor. Bu fark, büyük depoları, uzun araştırma paketlerini ve tarihlerini kaybetmeden geçmişlerini sıkıştırmak zorunda kalan ajan oturumlarını etkiliyor.
Grok'un lansman benchmark'ları bu farkı pekiştiriyor. Fable, SpaceXAI'nın kendi grafiğinde DeepSWE 1.0, DeepSWE 1.1, Terminal-Bench 2.1 ve SWE-Bench Pro'da önde. Grok, daha uzun yazılım mühendisliği görevlerini test eden SWE Marathon'da kazanıyor, ancak bir zafer, tutarlı bir liderlik sağlamıyor.
Bilgi güvenilirliği
Grok 4.5, AA-Omniscience doğruluğunu Grok 4.3 için %35'ten %52'ye yükseltti. Halüsinasyon oranı %25'ten %54'e yükseldi. Birleşik Omniscience puanı, Grok'un daha fazla soruyu doğru yanıtlaması nedeniyle 18'den 26'ya yükseldi, ancak aynı zamanda daha fazla desteklenmeyen yanıt verdi.

*Kaynak: Yapay Analiz'in Grok 4.5 değerlendirmesi. Halüsinasyon oranı AA-Omniscience'a aittir ve her istem türüne genelleştirilmemelidir.*
Grok ile gerçek yayıncılık için bilgi edinme, alıntılanmış kanıt ve dış doğrulama gerektiririm. Aynı kural Sol ve Fable için de geçerlidir, ancak Grok'un doğruluk-halısinasyon kayması, özel bir test gerektirir.
Grok 4.5 benim mevcut yığımı neden engelliyor?
Bu dağıtım için AB uyumlu erişime ihtiyacım var. xAI'nın Grok 4.5 belgeleri, API konsol erişiminin AB kullanıcıları için mevcut olmadığını ve Temmuz'un ilerleyen günlerinde beklenildiğini söylüyor. Bu durum yakında değişebilir, ancak bugün için kararlı bir üretim yolunu engelliyor.
xAI, varsayılan olarak API girişlerini ve çıkışlarını 30 gün boyunca saklar ve açık izin olmadan bunlar üzerinde eğitim yapmadığını belirtir. Sıfır Veri Saklama, uygun ekipler için mevcuttur, ancak etkinleştirildiğinde durum bilgisi olan Yanıtlar API özelliklerini, Dosyaları ve Koleksiyonları ve Batch API desteğini kaldırır. Herhangi bir üretim denemesi, kod veya müşteri materyali hizmete ulaşmadan önce bir veri işleme incelemesi gerektirir.
OpenAI, mevcut kodlama ajanı indeksinde önde olduğu, 1.05 milyon token bağlam penceresine sahip olduğu ve zaten kullandığım Codex ve Yanıtlar API iş akışlarına uyduğu için varsayılanım olmaya devam ediyor. GPT-5.6 Sol ve Fable 5 karşılaştırmam→ bu yolu daha ayrıntılı olarak açıklar.
Anthropic, Fable'ın kalite avantajının daha yüksek fiyatını karşılayabileceği uzun, belirsiz analizler için ikinci yolum olmaya devam ediyor. Grok, tamamlanmış görev maliyetinde bu yolların birini geçmek zorunda, yalnızca token fiyatı değil.
Standartım, gerçekten çalışan AI ajanları inşa etmekten→ geliyor: tamamlanan işleri, araç hatalarını, inceleme sürelerini ve kötü bir eylemden sonraki iyileşmeyi ölçmek.
Grok 4.5'i nasıl test ederim
AB erişimi açıldığında ve Grok bu testleri geçtiğinde yönlendirmeyi yeniden gözden geçiririm. O zamana kadar, Grok 4.5, üretim bağımlılığı yerine benchmark değeri olan bir adaydır.
Pratik bir model seçimi
Grok 4.5'i, yüksek hacimli ajan çalışmaları, hızlı çıktı ve tamamlanan görev başına maliyetin karar üzerinde baskın olduğu durumlarda seçin—ve 500.000 token bağlamı ve bölgesel erişiminiz dağıtımınıza uyduğunda.
GPT-5.6 Sol'u, en güçlü mevcut kodlama ajanı sonucunu, olgun bir araç yüzeyini ve OpenAI ekosisteminde daha büyük bir bağlam penceresini istediğinizde seçin.
Claude Fable 5'i, görev analitik olarak yeterince zor olduğunda, en yüksek token fiyatını haklı çıkarmak için ve geniş zeka benchmark'ındaki liderliğini değerli bulduğunuzda seçin.
Yolum OpenAI artı Anthropic olarak kalıyor, Grok test aşamasında. Grok 4.5, bu testi ekonomik olarak ilginç kılıyor. Yayınlanan sonuçlar henüz bir geçişi haklı çıkarmıyor.
Kaynaklar ve metodoloji
SpaceXAI'nın Grok 4.5 duyurusunu, model belgelerini, canlı fiyat tablosunu, güvenlik SSS'lerini ve Grok Build açık kaynak duyurusunu kontrol ettim. Bağımsız sonuçlar, Yapay Analiz'in Grok 4.5 değerlendirmesinden ve 17 Temmuz sınır karşılaştırmasından gelmektedir. Rekabetçi spesifikasyonlar ve fiyatlar için OpenAI'nın GPT-5.6 Sol ve Anthropic'ın Claude Fable 5 belgelerini kullandım.
Puanlar, fiyatlar, erişim notları ve ürün davranışları 18 Temmuz 2026 itibarıyla günceldir. Sağlayıcılar, makalenin değiştirilmeden sunum davranışını, fiyatlandırmayı, bölgesel erişimi ve model takma adlarını değiştirebilir.