API Gratuita GLM-5.2 da NVIDIA: Benchmarks e Limites
Tech
AI
NVIDIA
GLM-5.2
Benchmarks

API Gratuita GLM-5.2 da NVIDIA: Benchmarks e Limites

O GLM-5.2 agora está na API gratuita da NVIDIA. Aqui estão os números de benchmark, o limite de 40 RPM e por que os tokens máximos precisam de testes práticos.

Uygar DuzgunUUygar Duzgun
Jul 3, 2026
Atualizado 5 de jul. de 2026
7 min read

A API gratuita do GLM-5.2 da NVIDIA é interessante por um motivo: a NVIDIA tornou um modelo pesado da Z.ai fácil de testar, mas os limites práticos do endpoint não são a mesma coisa que a capacidade total do modelo.

A versão curta:

Prompt — Copy & Paste
O GLM-5.2 acabou de ser lançado na API gratuita da NVIDIA. max tokens é apenas 32k 40 solicitações por minuto

Eu interpreto isso como uma configuração de avaliação útil. 40 solicitações por minuto são suficientes para protótipos, avaliações de agentes e comparações manuais. Os tokens máximos são a parte irritante, e é a parte que você precisa testar por conta própria, pois as especificações do modelo e os limites do endpoint do provedor podem divergir.

API Gratuita GLM-5.2 da NVIDIA: o que mudou

O GLM-5.2 é o novo modelo principal da Z.ai. A documentação do modelo da NVIDIA o descreve como um modelo Mixture-of-Experts de 753B de parâmetros, construído para tarefas de longo horizonte, agentes, codificação e uso de ferramentas. A própria documentação da Z.ai destaca contexto de 1M e até 128K tokens de saída.

Esse é o posicionamento em nível de modelo.

A página do NVIDIA Build é a camada prática. O GLM-5.2 está listado lá com um endpoint gratuito, endpoint de parceiro e opção de download. A amostra em Python chama o endpoint Integrate API compatível com OpenAI da NVIDIA com o modelo `z-ai/glm-5.2`. A amostra define `max_tokens` para 16.384.

Eu não escreveria "O GLM-5.2 é apenas 32k" como um fato do modelo. Eu escreveria isto em vez disso: no endpoint gratuito da NVIDIA, o espaço máximo de tokens parece ser limitado pelo provedor em comparação com a janela de contexto maior do modelo. Se você vir 32k na prática, trate isso como uma observação do endpoint que precisa ser testada contra sua conta, formato de solicitação e configuração atual da NVIDIA.

Essa distinção importa. Um modelo pode suportar contexto longo enquanto um endpoint gratuito expõe limites de saída menores, menos capacidades e limites de taxa mais rigorosos.

Benchmarks: GLM-5.2 vs GLM-5.1

A NVIDIA publica números de benchmark do GLM-5.2 contra o GLM-5.1 e vários outros modelos de fronteira. A comparação mais limpa começa com o GLM-5.1 porque mostra para onde a Z.ai moveu o modelo.

BenchmarkGLM-5.2GLM-5.1DiferençaPor que importa
------:---:---:---
HLE40.531.0+9.5Tarefas difíceis de conhecimento e raciocínio
HLE com ferramentas54.752.3+2.4Resolução de problemas suportada por ferramentas
AIME 202699.295.3+3.9Matemática de competição e raciocínio estrito
GPQA-Diamond91.286.2+5.0Perguntas de ciência de nível especialista
SWE-bench Pro62.158.4+3.7Correções de código em ambientes semelhantes a repositórios
NL2Repo48.942.7+6.2Construção de código a partir de linguagem natural através do contexto do repositório
Terminal Bench 2.181.063.5+17.5Tarefas de engenharia baseadas em terminal
MCP-Atlas76.871.8+5.0Tarefas de agentes orientadas a MCP e ferramentas
Tool-Decathlon48.240.7+7.5Habilidade ampla de uso de ferramentas

Raciocínio e matemática

AIME 2026 em 99.2 e GPQA-Diamond em 91.2 são números fortes. Eles mostram que o GLM-5.2 não está posicionado apenas como um modelo de codificação. Ele também avança fortemente no raciocínio estrito, perguntas de especialistas e tarefas onde o modelo não pode se safar com correspondência de padrões vagos.

Fluxos de trabalho de codificação e agentes

O número que se destaca para mim é o Terminal Bench 2.1: 81.0 vs 63.5. Isso não é uma melhoria cosmética. Se esse resultado se mantiver em testes práticos, o GLM-5.2 se torna interessante para trabalho em repositórios, fluxos de trabalho de CLI e tarefas de engenharia agêntica onde o modelo precisa inspecionar estado, executar etapas, interpretar erros e continuar.

É aí que eu começaria a testar. Sem prompts poéticos. Sem chat genérico. Eu o colocaria contra fluxos de trabalho de desenvolvimento reais: builds quebrados, pequenas correções de PR, depuração orientada a repositório e trabalho com MCP onde o modelo precisa manter várias ferramentas alinhadas com o objetivo.

40 solicitações por minuto é melhor do que parece

40 RPM soa baixo se você pensar em um sistema de produção com muitos usuários concorrentes. Para avaliações, é uma história diferente.

40 solicitações por minuto são suficientes para:

uma execução de benchmark local com fila e backoff
comparação manual entre GLM-5.2 e outros modelos
um fluxo de agente único que não envia muitas chamadas pequenas
iteração de prompt onde você mede qualidade, latência e falhas
um protótipo inicial de MCP onde cada ação merece uma entrada de log

Não é suficiente para:

vários enxames de agentes concorrentes
fluxos de UI de produção onde os usuários esperam por respostas
scraping de alto volume, classificação ou jobs em lote
pipelines onde cada etapa faz muitas chamadas pequenas de modelo

Para mim, o GLM-5.2 no endpoint gratuito da NVIDIA é uma superfície de avaliação, não uma superfície de produção. É assim que eu o usaria primeiro.

Tenho algumas ideias de aplicativos e agentes que quero testar com modelos como este, mas não vou revelá-los antes de executar testes reais. 40 RPM é suficiente para aprender se o modelo entende o fluxo de trabalho. Não é suficiente para provar que ele se sustenta em produção.

Tokens máximos: 32k é o limite a medir

Se o endpoint lhe der 32k de tokens máximos na prática, isso não é inútil. Ainda é uma restrição real.

Para prompts de codificação normais, 32k de saída é muito. Para fluxos longos de agentes, contexto completo de repositório, logs longos e patches gerados, pode ficar apertado rapidamente. Isso é especialmente verdadeiro quando você quer que o modelo raciocine, planeje, retorne código e preserve a rastreabilidade.

Esta é a lista de testes que eu executaria:

TesteO que eu mediria
------
Prompt longo de repositórioO modelo descarta arquivos ou restrições importantes?
Log grande mais correçãoEle consegue encontrar a causa raiz sem reescrever o módulo errado?
Saída de patchA resposta está completa ou truncada?
Loop de uso de ferramentasEle mantém o estado através de várias etapas?
Carga de 40 RPMQuando os erros 429 começam e quão estável é o retry/backoff?
Teto de tokensO limite é 16k, 32k ou dependente da conta/endpoint?
Modelo de comparaçãoEle supera o modelo atual na mesma tarefa ou apenas em benchmarks publicados?

A última linha é a mais importante. Benchmarks dizem onde o modelo pode ser forte. Suas próprias tarefas dizem se ele é útil.

Uma ressalva da NVIDIA

A documentação da API da NVIDIA descreve o GLM-5.2 com suporte para chat multi-turno, chamada de ferramentas, saída estruturada e traços de raciocínio. Ao mesmo tempo, a página do NVIDIA Build para o modelo gratuito mostra "Function Calling", "Structured Output" e "Reasoning" como "Não suportado" na barra lateral.

Eu não assumiria funcionalidade completa de agente porque o modelo pode suportá-la em algum lugar. Eu testaria o endpoint real da NVIDIA como uma superfície de chat/completions compatível com OpenAI primeiro, depois verificaria cada recurso separadamente.

Esta é uma divisão comum de provedores: o card do modelo descreve o modelo, enquanto o endpoint descreve o produto que você pode usar.

Verificação de alegações

O NVIDIA Build lista o GLM-5.2 com um endpoint gratuito, endpoint de parceiro e modelo baixável.
A documentação do modelo da NVIDIA fornece uma data de lançamento no Build.Nvidia.com de 2 de julho de 2026 e descreve o modelo como um MoE de 753B.
Os docs da Z.ai listam contexto de 1M e 128K de tokens de saída máximos.
As tabelas de benchmark da NVIDIA listam o GLM-5.2 em 62.1 no SWE-bench Pro, 81.0 no Terminal Bench 2.1 e 76.8 no MCP-Atlas.
Um tópico nos Fóruns de Desenvolvedores da NVIDIA sobre limites de taxa NIM/API descreve o limite padrão como 40 solicitações por minuto.

Minha primeira impressão

O GLM-5.2 parece forte nos benchmarks certos. O sinal mais claro para mim não é o número do AIME, embora 99.2 seja extremo. O sinal mais útil é a combinação de Terminal Bench 2.1, NL2Repo, SWE-bench Pro, MCP-Atlas e Tool-Decathlon.

É aí que um modelo começa a importar para fluxos de trabalho reais de desenvolvedores.

O endpoint gratuito da NVIDIA reduz a barreira. 40 RPM o torna útil para testes sérios. O limite de tokens máximos significa que você não deve tratá-lo como uma superfície de produção completa ainda.

Minha opinião: vale a pena fazer benchmark do GLM-5.2 contra seus próprios fluxos de trabalho de agentes agora. Registre cada solicitação, meça o truncamento de saída, execute os mesmos casos contra outros modelos e trate a API gratuita da NVIDIA como um banco de testes até verificar os limites na prática.

O trabalho não é correr atrás de hype. O trabalho é descobrir se o modelo resolve tarefas reais sem forçá-lo a construir todo o sistema em torno de suas fraquezas.

Fontes verificadas em 3 de julho de 2026

NVIDIA Build: Z.ai GLM-5.2
Docs da API da NVIDIA: z-ai/glm-5.2
Docs do GLM-5.2 da Z.ai
Blog do GLM-5.2 da Z.ai
Fóruns de Desenvolvedores da NVIDIA: discussão sobre limite de taxa da API