Kimi K3 vs GPT-5.6 Sol e Claude Fable 5: Veredito do Benchmark
Tech
Kimi K3
Moonshot AI
GPT-5.6 Sol
Claude Fable 5

Kimi K3 vs GPT-5.6 Sol e Claude Fable 5: Veredito do Benchmark

Kimi K3 alcança a fronteira e vence testes chave de codificação. Meu veredito baseado em benchmarks: teste-o, mas mantenha OpenAI e Anthropic em produção.

Uygar DuzgunUUygar Duzgun
Jul 18, 2026
Atualizado 21 de jul. de 2026
9 min read

Kimi K3 vs GPT-5.6 Sol é próximo o suficiente para me fazer reexecutar meus testes de roteamento. O modelo da Moonshot ainda não substitui OpenAI ou Anthropic na minha stack.

Essa conclusão é menos dramática do que as manchetes de lançamento, mas os números a sustentam. A nova flagship da Moonshot AI ocupa o terceiro lugar em um índice de inteligência independente, lidera uma arena de codificação frontend cega e supera o GPT-5.6 Sol em um teste de trabalho de conhecimento de longo horizonte. Ele também permanece atrás do Claude Fable 5 e do Sol nas medidas mais amplas, e seus pesos baixáveis ainda foram prometidos para uma data futura.

A partir de 18 de julho de 2026, vejo o Kimi K3 como um candidato sério para avaliação, e não como um motivo para migrar o trabalho de produção. Ainda não submeti o K3 ao meu próprio benchmark de produção, então separo os resultados de terceiros da minha decisão de roteamento abaixo.

O veredito curto

Melhor pontuação geral: Claude Fable 5 lidera o Artificial Analysis Intelligence Index com 60. GPT-5.6 Sol pontua 59, e Kimi K3 pontua 57.
Melhor resultado cego de frontend: Kimi K3 lidera o ranking Frontend Code da Arena com 1.679 Elo, à frente do Fable 5 com 1.631 e do Sol com 1.618.
Melhor preço de API: K3 custa $3 por milhão de tokens de entrada e $15 por milhão de tokens de saída. Sol custa $5/$30, enquanto Fable 5 custa $10/$50.
Minha escolha: Manterei a OpenAI como minha plataforma principal de codificação e agentes, com a Anthropic para as análises mais difíceis de longo horizonte. Testarei o K3 em cargas de trabalho de frontend, automação e pesquisa antes de lhe dar tráfego de produção.

O resultado é uma corrida de três modelos com diferentes vencedores por tarefa. Um único leaderboard não pode dizer qual modelo terminará seu trabalho com o menor número de novas tentativas.

O que é Kimi K3?

Moonshot AI apresentou Kimi K3 em 16 de julho como um modelo Mixture-of-Experts de 2,8 trilhões de parâmetros. Seu roteador seleciona 16 de 896 experts para cada token. K3 também possui entrada nativa de imagem, uma janela de contexto de um milhão de tokens e saída de texto.

A Moonshot atribui o salto do K2 a duas mudanças arquiteturais: Kimi Delta Attention e Attention Residuals. A empresa relata aproximadamente 2,5 vezes melhor eficiência de escalonamento do que o K2, mas um relatório técnico ainda não foi publicado. Esse número permanece como uma afirmação do fornecedor.

A API está ativa agora. A Moonshot diz que os pesos completos chegarão até 27 de julho. Até que esses arquivos cheguem, K3 é um modelo de pesos abertos anunciado, não um modelo que você já pode baixar e verificar em sua própria infraestrutura.

Kimi K3 vs GPT-5.6 Sol vs Claude Fable 5

A comparação mais limpa combina testes independentes com especificações oficiais do produto. As primeiras quatro linhas abaixo vêm da Artificial Analysis e da Arena; contexto e preços vêm da documentação de cada provedor.

MedidaKimi K3GPT-5.6 SolClaude Fable 5
------:---:---:
Artificial Analysis Intelligence Index575960
GDPval-AA v21.668 Elo1.748 Elo1.760 Elo
AA-Briefcase trabalho de conhecimento1.547 Elo1.495 Elo1.583 Elo
Frontend Code Arena1.679 Elo1.618 Elo1.631 Elo
Janela de contexto1M tokens1,05M tokens1M tokens
API entrada/saída por 1M tokens$3 / $15$5 / $30$10 / $50
PesosPrometidos para 27 de julhoFechadoFechado
Artificial Analysis Intelligence Index comparando Kimi K3, Claude Fable 5, GPT-5.6 Sol e outros modelos
Artificial Analysis Intelligence Index comparando Kimi K3, Claude Fable 5, GPT-5.6 Sol e outros modelos

*Fonte: Artificial Analysis, 17 de julho de 2026. Seu índice v4.1 combina nove avaliações de codificação, raciocínio, conhecimento e agentes.*

A diferença de dois pontos entre K3 e Sol é pequena o suficiente para importar menos do que a qualidade do harness, latência, uso de tokens e recuperação de falhas. A diferença de três pontos para o Fable 5 ainda é real. K3 alcançou o grupo de fronteira; ele não venceu o grupo.

Onde o Kimi K3 vence?

Codificação frontend e iteração visual

O resultado independente mais forte do K3 é o Frontend Code Arena. Avaliadores humanos comparam saídas frontend anônimas e executáveis e votam no melhor resultado. K3 alcançou 1.679 Elo, 48 pontos acima do Fable 5 e 61 acima do Sol. A Arena também o colocou em primeiro lugar em seis de sete categorias de frontend.

Esse resultado importa para equipes que constroem landing pages, dashboards, recriações de design e ferramentas visuais. Ele mede a preferência por uma saída funcional, não apenas se um teste unitário passa.

A tabela de codificação mais ampla da Moonshot é mista. K3 lidera o Program Bench com 77,8 e o SWE Marathon com 42,0. Sol lidera DeepSWE com 73,0 e Terminal-Bench 2.1 com 88,8. Fable 5 lidera FrontierSWE com 86,6 e a comparação interna Kimi Code Bench da Moonshot com 76,9.

Comparação de benchmarks de codificação da Moonshot AI para Kimi K3, GPT-5.6 Sol, Claude Fable 5 e outros modelos
Comparação de benchmarks de codificação da Moonshot AI para Kimi K3, GPT-5.6 Sol, Claude Fable 5 e outros modelos

*Fonte: Post de lançamento do Kimi K3 da Moonshot AI. Estes são resultados montados pelo fornecedor, e os modelos às vezes usam harnesses de agentes diferentes.*

A escolha do harness altera a pontuação. K3 geralmente roda no Kimi Code, Sol no Codex e Fable no Claude Code. Um benchmark pode medir o modelo, o harness ou a interação entre ambos. Eu reexecutaria uma tarefa representativa de repositório dentro da ferramenta que planejo implantar.

Automação e trabalho de conhecimento

A Artificial Analysis dá ao K3 uma pontuação de 53% e o primeiro lugar no AutomationBench-AA. No AA-Briefcase, uma avaliação privada de trabalho de conhecimento de longo horizonte, K3 pontua 1.547 Elo. Isso supera os 1.495 do Sol e fica atrás dos 1.583 do Fable 5.

A avaliação da Moonshot também coloca o K3 ligeiramente à frente no BrowseComp e no SpreadsheetBench 2. Fable lidera GDPval-AA, JobBench e a pontuação geral do AA-Briefcase. Sol permanece o mais forte na qualidade de apresentação dentro do detalhamento do AA-Briefcase.

Comparação de benchmarks de agente e visão da Moonshot AI para Kimi K3, GPT-5.6 Sol e Claude Fable 5
Comparação de benchmarks de agente e visão da Moonshot AI para Kimi K3, GPT-5.6 Sol e Claude Fable 5

*Fonte: Moonshot AI. O gráfico inclui pontuações independentes, leaderboards públicos e testes executados pela Moonshot; leia suas notas de rodapé antes de tratar as barras como um experimento controlado.*

K3 parece útil para agentes de pesquisa, trabalho com planilhas e automação de navegador. Fable permanece a aposta mais segura quando a qualidade analítica importa mais do que o preço. Sol se encaixa em equipes que já usam Codex, a API Responses, ferramentas hospedadas e chamada de ferramentas programática.

Onde o Kimi K3 ainda fica atrás?

Raciocínio amplo e conhecimento especializado

Fable 5 mantém uma liderança clara no Humanity's Last Exam. A Moonshot relata 53,3 para Fable, 44,5 para Sol e 43,5 para K3 sem ferramentas. Com ferramentas, as pontuações sobem para 63, 58 e 56. Essa é uma lacuna maior do que o índice geral sugere.

Sol registra as pontuações publicadas mais fortes em vários testes de ciência, uso de computador e contexto longo na tabela de lançamento da OpenAI. Fable lidera GDPval-AA e AA-Briefcase geral. K3 vence tarefas selecionadas, mas não mostra a mesma consistência entre categorias.

Confiabilidade do conhecimento

K3 melhorou sua precisão AA-Omniscience de 33% para 46% em comparação com o K2.6. Sua taxa de alucinação também subiu de 39% para 51%. A pontuação combinada de Omniscience melhora de 6 para 18 porque K3 responde mais perguntas corretamente, mas a regressão em respostas não suportadas merece testes em trabalhos com muitas citações.

Testes de precisão de conhecimento e alucinação da Artificial Analysis para Kimi K3 e modelos de IA líderes
Testes de precisão de conhecimento e alucinação da Artificial Analysis para Kimi K3 e modelos de IA líderes

*Fonte: Artificial Analysis. A taxa de alucinação pertence ao AA-Omniscience e não deve ser generalizada para cada tipo de prompt.*

Eu exigiria recuperação de fontes, evidências citadas e verificação determinística antes de usar qualquer um desses modelos para publicação factual. O resultado do K3 não muda essa regra.

O Kimi K3 é mais barato na prática?

Os preços de lista fazem o K3 parecer decisivo:

Kimi K3: $3 entrada, $15 saída e $0,30 entrada em cache por milhão de tokens.
GPT-5.6 Sol: $5 entrada, $30 saída e $0,50 entrada em cache.
Claude Fable 5: $10 entrada e $50 saída, com um desconto de 90% no cache de prompt.

A Artificial Analysis estima $0,94 por tarefa de índice de inteligência para K3, $1,04 para Sol e $2,75 para Fable 5. O uso de tokens do K3 reduz sua vantagem de preço de lista sobre o Sol para dez centavos nessa carga de trabalho. Fable custa muito mais, mas também termina em primeiro no índice geral e nos testes de trabalho de conhecimento mais difíceis.

Preço por token é um orçamento incompleto. O custo de produção inclui novas tentativas, chamadas de ferramentas, tempo de revisão, latência e o trabalho necessário para se recuperar de uma resposta errada. Um modelo que cobra metade do preço e precisa de duas vezes mais loops de reparo não economizou dinheiro.

Por que minha stack permanece OpenAI e Anthropic

Já uso OpenAI e Anthropic para codificação, pesquisa e fluxos de trabalho de agentes. K3 não me deu evidências suficientes para absorver um terceiro provedor de produção ainda.

Recomendado para você

OpenAI permanece meu padrão para codificação agêntica porque Sol lidera o Coding Agent Index independente com 80, integra-se com Codex e a API Responses, e tem a superfície de ferramentas mais ampla para meu trabalho. Minha comparação entre GPT-5.6 Sol e Fable 5 cobre essa decisão de roteamento com mais detalhes.

Anthropic permanece minha segunda rota para análises longas e difíceis e trabalho complexo em codebases. Fable 5 lidera o índice de inteligência geral, GDPval-AA, AA-Briefcase e Humanity's Last Exam. Seu preço de $10/$50 e o requisito de retenção de dados de 30 dias significam que o reservarei para trabalhos onde o ganho de qualidade cobre essas restrições.

Recomendado para você

Meu padrão vem de construir agentes de IA que realmente funcionam: tarefas concluídas, falhas de ferramentas observadas e custo de revisão importam mais do que uma pontuação de manchete.

K3 entra em uma faixa de teste com três trabalhos:

Reconstruir um frontend real a partir de uma imagem de referência e comparar defeitos visuais após uma e três iterações.
Executar a mesma tarefa de repositório no Kimi Code, Codex e Claude Code, e então contar alterações aceitas, tokens, falhas de ferramentas e tempo de revisão.
Dar a cada modelo o mesmo briefing de pesquisa e pontuar alegações não suportadas, cobertura de citações e correções após feedback.

Reconsiderarei o roteamento de produção depois que a Moonshot lançar os pesos e o relatório técnico, depois que eu revisar a licença final e depois que K3 sobreviver a esses testes. Equipes com cargas de trabalho pesadas de frontend ou automação podem chegar a esse ponto mais cedo.

Uma escolha prática de modelo

Escolha Kimi K3 para uma avaliação controlada quando a qualidade do frontend, automação de navegador ou preços de lista de API mais baixos dominarem a carga de trabalho.

Escolha GPT-5.6 Sol quando você precisar de um ambiente maduro de agente de codificação, amplo suporte a ferramentas, forte qualidade de apresentação e resultados consistentes em tarefas técnicas.

Escolha Claude Fable 5 quando o trabalho for longo, ambíguo e analiticamente difícil o suficiente para justificar o custo mais alto e as restrições de retenção de dados.

Minha resposta hoje é OpenAI mais Anthropic, com K3 em teste. A Moonshot ganhou esse teste. Ela não ganhou uma migração automática.

Fontes e metodologia

Verifiquei o post de lançamento do Kimi K3 e os preços da API da Moonshot, a avaliação independente do K3 da Artificial Analysis, o ranking cego de frontend da Arena conforme relatado pela AP, o lançamento do GPT-5.6 e a documentação do modelo Sol da OpenAI, além do lançamento do Fable 5 e do guia da API do Claude Fable 5 da Anthropic.

Todas as pontuações e preços estão atualizados em 18 de julho de 2026. Provedores de modelos podem alterar preços, roteamento, salvaguardas e comportamento de serviço sem alterar o nome do modelo.