Grok 4.5 vs GPT-5.6 Sol e Claude Fable 5: Veredicto do Benchmark
Tech
Grok 4.5
SpaceXAI
xAI
GPT-5.6 Sol

Grok 4.5 vs GPT-5.6 Sol e Claude Fable 5: Veredicto do Benchmark

Grok 4.5 alcança a fronteira a um custo menor. Veja onde ele supera o GPT-5.6 Sol e o Claude Fable 5 — e por que estou mantendo minha pilha atual.

Uygar DuzgunUUygar Duzgun
Jul 18, 2026
Atualizado 23 de jul. de 2026
9 min read

Grok 4.5 vs GPT-5.6 Sol é a primeira comparação neste ciclo de lançamento que torna o custo uma razão séria para testar outro provedor. Isso ainda não me faz substituir a OpenAI ou a Anthropic.

O modelo mais recente da SpaceXAI alcança a fronteira, funciona rapidamente e cobra $2 por milhão de tokens de entrada e $6 por milhão de tokens de saída. Testes independentes o colocam próximo aos principais agentes de codificação. Os mesmos testes o colocam cinco pontos atrás do Sol e seis atrás do Claude Fable 5 em inteligência geral.

A partir de 18 de julho de 2026, meu caminho continua sendo OpenAI em primeiro lugar e Anthropic em segundo. Grok 4.5 entra em uma pista de teste controlada para agentes de codificação, automação e cargas de trabalho de alto volume. Eu ainda não o usei em produção, então esta comparação separa as medições publicadas da minha própria decisão de roteamento.

O veredicto curto

Melhor inteligência geral: Claude Fable 5 pontua 60 no Índice de Inteligência de Análise Artificial. GPT-5.6 Sol pontua 59, enquanto Grok 4.5 pontua 54.
Melhor resultado de agente de codificação: Sol no Codex lidera com 80. Fable 5 com fallback pontua 77, e Grok 4.5 no Grok Build pontua 76.
Melhor custo: Grok 4.5 custa $0.31 por tarefa do Índice de Inteligência de Análise Artificial, comparado a $1.04 para Sol e $2.75 para Fable 5.
Minha escolha: Vou manter a OpenAI como minha plataforma principal de codificação e agente, usar a Anthropic para o trabalho analítico mais difícil e testar o Grok onde sua velocidade e custo mais baixo podem mudar a economia.

Grok 4.5 tem um papel claro. É um modelo de fronteira eficiente em termos de custo, não o novo líder de qualidade.

O que é Grok 4.5?

SpaceXAI lançou o Grok 4.5 em 8 de julho como seu carro-chefe para codificação, tarefas agentivas e trabalho de conhecimento. A empresa o treinou ao lado do Cursor e o disponibilizou através da API xAI, Grok Build e Cursor.

O modelo aceita texto e imagens, retorna texto e suporta chamadas de função, saídas estruturadas e raciocínio configurável. Sua janela de contexto é de 500.000 tokens. O corte de conhecimento publicado é em 1º de fevereiro de 2026, então informações atuais requerem as ferramentas de busca web ou X da xAI.

Grok Build é de código aberto, o que dá às equipes uma maneira de inspecionar o loop do agente, montagem de contexto, despacho de ferramentas, ganchos, habilidades, plugins e integração MCP. O modelo Grok 4.5 em si permanece proprietário; a SpaceXAI não divulgou seus pesos.

Grok 4.5 vs GPT-5.6 Sol vs Claude Fable 5

A comparação ampla favorece a Anthropic e a OpenAI em qualidade, depois o Grok em custo. Esses valores combinam testes independentes de Análise Artificial com a documentação atual da API de cada provedor.

MedidaGrok 4.5GPT-5.6 SolClaude Fable 5
------:---:---:
Índice de Inteligência de Análise Artificial545960
Índice de Agente de Codificação76 no Grok Build80 no Codex77 no Claude Code com fallback
Custo por tarefa do Índice de Inteligência$0.31$1.04$2.75
Janela de contexto500k tokens1.05M tokens1M tokens
API entrada/saída por 1M tokens$2 / $6$5 / $30$10 / $50
PesosFechadoFechadoFechado
Grok 4.5, GPT-5.6 Sol, Claude Fable 5 e outros modelos de fronteira no Índice de Inteligência de Análise Artificial
Grok 4.5, GPT-5.6 Sol, Claude Fable 5 e outros modelos de fronteira no Índice de Inteligência de Análise Artificial

*Fonte: Análise Artificial, 17 de julho de 2026. Seu índice v4.1 combina nove avaliações agentivas, de codificação, raciocínio, conhecimento e de longo contexto.*

Cinco pontos separam Grok do Sol, e seis o separam do Fable. Essa diferença é grande o suficiente para aparecer em tarefas difíceis, mas pequena o suficiente para que custo, latência e confiabilidade da ferramenta possam reverter o resultado prático em trabalhos de alto volume.

Onde o Grok 4.5 se destaca?

Agentes de codificação e trabalho terminal

Grok 4.5 pontua 76 no Grok Build no Índice de Agente de Codificação de Análise Artificial. Sol lidera com 80 no Codex. Fable 5 pontua 77 no Claude Code, embora essa configuração possa voltar para o Opus 4.8.

Um ponto separa Grok da configuração testada do Fable. Quatro pontos o separam do Sol. Isso é próximo o suficiente para justificar testes em nível de repositório, especialmente quando um agente executa centenas de chamadas de ferramentas e os custos de tokens de saída se acumulam.

Grok 4.5 no Grok Build comparado com GPT-5.6 Sol no Codex e Claude Fable 5 no Claude Code no Índice de Agente de Codificação
Grok 4.5 no Grok Build comparado com GPT-5.6 Sol no Codex e Claude Fable 5 no Claude Code no Índice de Agente de Codificação

*Fonte: Análise Artificial. O índice é uma média de DeepSWE, Terminal-Bench v2 e SWE-Atlas-QnA. Os harnesses diferem, então o gráfico mede a combinação modelo-agente.*

A tabela de lançamentos da SpaceXAI conta uma história semelhante, mas menos atual. Grok lidera o SWE Marathon com 29,0%, pontua 83,3% no Terminal-Bench 2.1 e alcança 64,7% no SWE-Bench Pro. Fable 5 lidera quatro dos cinco testes de codificação mostrados. A SpaceXAI comparou Grok com o GPT-5.5 em vez do GPT-5.6 Sol, então eu não usaria essa tabela de fornecedores para um veredicto direto sobre o Sol.

Velocidade e eficiência de tokens

A Análise Artificial mediu o Grok 4.5 em aproximadamente 112 tokens de saída por segundo. A SpaceXAI relata 80 tokens por segundo e diz que o modelo usou 15.954 tokens de saída por tarefa resolvida do SWE-Bench Pro, 4,2 vezes menos do que o Claude Opus 4.8 em sua comparação.

Esses números descrevem diferentes configurações de teste, mas apontam na mesma direção: Grok é projetado para concluir o trabalho agentivo com menos saída. A economia importa quando um agente de codificação lê arquivos, executa comandos, corrige falhas e repete o loop.

Grok 4.5 é o vencedor em custo?

Para prompts abaixo de 200.000 tokens, a xAI cobra $2 por milhão de tokens de entrada, $0,50 por entrada em cache e $6 por saída. Uma vez que um prompt ultrapassa 200.000 tokens, as taxas dobram para $4, $1 e $12 em toda a solicitação.

O preço de lista de contexto curto é 60% abaixo do Sol na entrada e 80% abaixo dele na saída. Fable 5 custa cinco vezes mais pela entrada e mais de oito vezes mais pela saída.

Gráfico de Análise Artificial comparando a inteligência do modelo com o custo por tarefa de benchmark, incluindo Grok 4.5, GPT-5.6 Sol e Claude Fable 5
Gráfico de Análise Artificial comparando a inteligência do modelo com o custo por tarefa de benchmark, incluindo Grok 4.5, GPT-5.6 Sol e Claude Fable 5

*Fonte: Análise Artificial. O custo por tarefa inclui os tokens que cada modelo usou, em vez de comparar apenas os cartões de preço.*

O custo de tarefa independente é mais útil do que o cartão de preço: $0.31 para Grok, $1.04 para Sol e $2.75 para Fable. Grok cede cinco pontos de inteligência para o Sol enquanto reduz esse custo de teste em cerca de 70%.

O custo de produção ainda inclui chamadas de ferramentas falhadas, patches repetidos, tempo de revisão e regressões. Uma execução barata que precisa de um desenvolvedor sênior para corrigir o resultado pode custar mais do que uma execução limpa cara.

Onde o Grok 4.5 fica atrás?

Qualidade geral e longo contexto

Sol e Fable lideram o amplo índice independente. Ambos também oferecem aproximadamente o dobro da janela de contexto do Grok. Essa diferença afeta grandes repositórios, pacotes de pesquisa longos e sessões de agentes que não podem compactar seu histórico sem perder evidências úteis.

Os benchmarks de lançamento do Grok reforçam a lacuna. Fable lidera o DeepSWE 1.0, DeepSWE 1.1, Terminal-Bench 2.1 e SWE-Bench Pro no próprio gráfico da SpaceXAI. Grok vence o SWE Marathon, que testa tarefas de engenharia de software mais longas, mas uma vitória não estabelece uma liderança consistente.

Confiabilidade do conhecimento

Grok 4.5 melhorou a precisão da AA-Omniscience de 35% para Grok 4.3 para 52%. Sua taxa de alucinação subiu de 25% para 54%. A pontuação combinada de Omniscience aumentou de 18 para 26 porque Grok respondeu mais perguntas corretamente, mas também deu mais respostas não suportadas em vez de declinar.

Precisão do conhecimento do Grok 4.5, taxa de alucinação e pontuação de AA-Omniscience comparadas com modelos de IA líderes
Precisão do conhecimento do Grok 4.5, taxa de alucinação e pontuação de AA-Omniscience comparadas com modelos de IA líderes

*Fonte: Avaliação do Grok 4.5 pela Análise Artificial. A taxa de alucinação pertence à AA-Omniscience e não deve ser generalizada para todos os tipos de prompt.*

Eu exigiria recuperação, evidência citada e verificação externa para publicação factual com o Grok. A mesma regra se aplica ao Sol e ao Fable, mas a mudança de precisão em relação à alucinação do Grok merece um teste dedicado.

O que bloqueia o Grok 4.5 para minha pilha atual?

Eu preciso de acesso compatível com a UE para essa implantação. A documentação do Grok 4.5 da xAI ainda diz que o acesso à console da API não está disponível para usuários da UE e é esperado para mais tarde em julho. Isso pode mudar em breve, mas bloqueia uma rota de produção estável hoje.

A xAI armazena entradas e saídas da API por 30 dias por padrão e diz que não treina com elas sem permissão explícita. A Zero Data Retention está disponível para equipes elegíveis, embora ativá-la remova os recursos da API de Respostas com estado, Arquivos e Coleções, e suporte à API em Lote. Qualquer teste de produção precisa de uma revisão de manuseio de dados antes que o código ou material do cliente chegue ao serviço.

Recomendado para você

A OpenAI continua sendo meu padrão porque o Sol lidera o índice atual de agentes de codificação, tem uma janela de contexto de 1,05 milhão de tokens e se encaixa nos fluxos de trabalho da API Codex e Respostas que já uso. Minha comparação entre GPT-5.6 Sol e Fable 5 explica essa rota em mais detalhes.

A Anthropic continua sendo meu segundo caminho para análises longas e ambíguas, onde a liderança de qualidade do Fable pode cobrir seu preço mais alto. Grok precisa superar uma dessas rotas em custo de tarefa finalizada, não apenas no preço do token.

Recomendado para você

Meu padrão vem de construir agentes de IA que realmente funcionam: medir trabalho concluído, falhas de ferramentas, tempo de revisão e recuperação após uma ação ruim.

Como eu testaria o Grok 4.5

Execute o mesmo problema de repositório no Grok Build, Codex e Claude Code. Registre as alterações aceitas, tokens, comandos, testes falhados e minutos de revisão.
Dê a cada modelo um longo pacote de pesquisa com fontes conflitantes. Meça a cobertura de citação, alegações não suportadas e correções após feedback.
Repita um fluxo de trabalho de navegador e planilha dez vezes. Compare a taxa de conclusão, latência e custo total da API em vez da melhor execução única.

Eu reconsideraria o roteamento após a abertura do acesso à UE e o Grok passar nesses testes. Até lá, o Grok 4.5 é um candidato digno de benchmark em vez de uma dependência de produção.

Uma escolha prática de modelo

Escolha Grok 4.5 quando o trabalho de agente de alto volume, saída rápida e custo por tarefa concluída dominarem a decisão — e quando sua janela de contexto de 500.000 tokens e disponibilidade regional se encaixarem na sua implantação.

Escolha GPT-5.6 Sol quando você quiser o resultado mais forte de agente de codificação atual, uma superfície de ferramenta madura e uma janela de contexto maior dentro do ecossistema da OpenAI.

Escolha Claude Fable 5 quando a tarefa for analiticamente difícil o suficiente para justificar o preço mais alto por token e você valorizar sua liderança no benchmark de inteligência amplo.

Meu caminho continua sendo OpenAI mais Anthropic, com Grok em teste. Grok 4.5 torna esse teste economicamente interessante. Os resultados publicados ainda não justificam uma migração.