Português · 8 min de leitura
GLM-5.3: o mesmo modelo base, um programador muito melhor — e um resultado em cibersegurança que ninguém planejou
A Z.ai lançou o GLM-5.3 em 14 de agosto de 2026. Todo o ganho vem do pós-treinamento, não de um modelo maior. O Terminal-Bench 3.0 saiu de 4,6 para 28,3. Veja o que é real, quanto custa e a migração que vai quebrar suas chamadas de API.
A resposta curta: o GLM-5.3 é o modelo base do GLM-5.2 com mais um mês de pós-treinamento em cima — e é um salto grande em programação agêntica. Já está disponível no GLM Coding Plan e na API. Os pesos foram prometidos para daqui a duas semanas. Se o seu código envia thinking.type: "disabled", suas requisições vão falhar no GLM-5.3 — essa migração é a única coisa urgente deste lançamento.
Verificado em 14 de agosto de 2026 contra o post de lançamento da Z.ai, "GLM-5.3: Frontier Coding with Emergent Cyber Capabilities", incluindo sua tabela de benchmarks e as notas de rodapé sobre metodologia. Todos os números abaixo são valores autodeclarados pela própria Z.ai, salvo indicação em contrário. Ainda não existe avaliação independente do GLM-5.3, então ele não está no nosso snapshot do LiveBench — o benchmark do próprio laboratório é uma alegação, não uma nota de terceiros.
O que de fato foi lançado
O mesmo modelo base. Esse é o ponto que a maior parte da cobertura vai deixar passar. A Z.ai afirma claramente que o GLM-5.3 "usa o mesmo modelo base do GLM-5.2 — todo ganho vem do pós-treinamento". Nenhum modelo maior, nenhuma nova rodada de pré-treinamento. Os ganhos vêm de escalar aprendizado por reforço em ambientes de tarefas de longo horizonte.
Esse é um resultado genuinamente interessante, e também explica por que as melhorias são desiguais: são enormes onde se mede trabalho agêntico de longo horizonte, e modestas no resto.
Uma API ativa, com o id de modelo glm-5.3, liberada para todos os assinantes do GLM Coding Plan.
Pesos abertos em duas semanas, assim que "a avaliação de segurança e o endurecimento estiverem concluídos". Um compromisso com prazo definido, não uma trava indefinida.
Os saltos de benchmark que importam
Números autodeclarados pela Z.ai, GLM-5.3 vs GLM-5.2:
| Benchmark | GLM-5.3 | GLM-5.2 |
|---|---|---|
| Terminal-Bench 3.0 | 28.3 | 4.6 |
| SWE-Marathon v1.1 | 42.5 | 19.4 |
| ExploitBench | 54.4 | 24.4 |
| AutomationBench v1.0.6 | 48.2 | 26.2 |
| DeepSWE v1.1 | 66.9 | 46.2 |
| Toolathlon Verified | 73.0 | 59.9 |
| FrontierSWE | 78.1 | 67.5 |
| CyberGym | 84.5 | 77.2 |
| Terminal-Bench 2.1 | 88.2 | 81.0 |
O Terminal-Bench 3.0 indo de 4.6 para 28.3 é o sinal mais claro: nas tarefas agênticas mais difíceis e mais longas, o GLM-5.2 basicamente falhava, e o GLM-5.3 não falha.
Repare no formato disso. O Terminal-Bench 2.1 foi de 81.0 → 88.2, um incremento normal. O Terminal-Bench 3.0 foi de 4.6 → 28.3, um salto de 6×. Quanto mais difícil e mais longa a tarefa, maior o ganho — que é exatamente o que se espera se a melhoria vem de RL de longo horizonte, e não de capacidade bruta.
Onde ele ainda perde. No Terminal-Bench 3.0, a própria tabela da Z.ai coloca o GPT-5.6 Sol em 34.6 e o Fable 5 em 33.7, ambos à frente dos 28.3 do GLM-5.3. No seu benchmark interno Z.ai Code Bench, o GLM-5.3 chega a 34,5% no esforço Max contra 39,5% do Claude Fable 5. A Z.ai diz isso abertamente, o que merece algum crédito.
O resultado de eficiência de tokens é a história de negócio
Escondido debaixo da tabela de benchmarks está o número que de fato afeta a fatura.
No Z.ai Code Bench em esforço Max, o GLM-5.3 chega a 34,5% usando cerca de 75K tokens de saída por tarefa — contra os 23,4% do GLM-5.2 com 96K. Resultados melhores, menos tokens.
Contra um modelo fechado: em esforço High, o GLM-5.3 atinge 31,4% com cerca de 50K tokens de saída, contra o Claude Opus 4.8 com 29,5% e 120K. Pontuação levemente melhor, cerca de 2,4× menos tokens de saída.
Para quem roda agentes de programação em volume, os tokens de saída são a conta. Um modelo que pontua igual gastando uma fração dos tokens é uma história de custo, não de ranking.
O resultado em cibersegurança, e por que ele tem dois gumes
A Z.ai adicionou dados de descoberta de vulnerabilidades à mistura de treinamento esperando ganhos modestos, e relata ter se surpreendido: o GLM-5.3 passou a raciocinar sobre cadeias completas de exploração, e não apenas a identificar falhas isoladas. No ExploitGym ele conclui 105 tarefas em duas horas e 130 em seis, contra 29 e 39 do GLM-5.2.
Rodado contra bases de código reais com equipes de segurança chinesas, o modelo revelou 2.436 vulnerabilidades em 269 projetos de código aberto — 107 críticas e 990 altas. A falha média havia sobrevivido 26,6 anos sem ser descoberta; a mais antiga era de 1981. A Z.ai publicou um Security Disclosure Ledger acompanhando esses casos, com 53 divulgados e 2.383 ainda sob embargo.
Duas ressalvas honestas. Primeiro, as próprias comparações da Z.ai mostram que ele está bem atrás da fronteira fechada aqui — a página cita concorrentes com 181 e 247 tarefas do ExploitGym contra as 105 e 130 do GLM-5.3. O resumo que a Z.ai faz da própria distância é franco: a capacidade cresce mais rápido justamente onde ela está mais atrás.
Segundo, um modelo de pesos abertos capaz de descobrir vulnerabilidades é de uso dual por construção. O atraso de duas semanas nos pesos para "avaliação de segurança e endurecimento" é presumivelmente exatamente sobre isso.
(Uma inconsistência de nomenclatura que vale sinalizar: o texto da Z.ai se refere a "Mythos 5" nas comparações de cibersegurança, enquanto a coluna da própria tabela é intitulada "Fable 5". Citamos os números do próprio GLM-5.3 em vez de adivinhar qual concorrente é o pretendido.)
A migração que vai quebrar suas chamadas
O GLM-5.3 suporta três níveis de esforço de raciocínio — low, high, max. Desativar o raciocínio não é mais suportado.
Se sua aplicação hoje envia thinking.type: "disabled", mude para enabled e defina reasoning_effort como low antes de trocar o id do modelo para glm-5.3. Caso contrário, a requisição falha. A Z.ai recomenda max para tarefas de programação.
Esse é o único item do lançamento com prazo atrelado.
Quanto custa
A Z.ai não publicou preço por token. O GLM Coding Plan passou a usar um sistema de cotas baseado em pontos, com pontos contabilizados separadamente para tokens de entrada, entrada em cache e saída.
O detalhe de preço que mais importa: chamadas fora do horário de pico consomem 50% dos pontos padrão. O pico é das 14:00 às 18:00 no fuso UTC+8, de segunda a sexta. Todo o resto — incluindo o fim de semana inteiro — sai pela metade.
Se você roda trabalho em lote, essa é uma decisão de agendamento que vale tomar deliberadamente. A madrugada na Europa ou nas Américas é fora de pico no UTC+8.
Pelo ZCode, a Z.ai também anuncia uma taxa de acerto de cache acima de 98% em contexto repetido e um aumento de cota de 1,5× por tempo limitado até 31 de agosto.
O que fazer nesta semana
Se você está no GLM Coding Plan. O GLM-5.3 já foi liberado para você. Verifique primeiro se há thinking.type: "disabled" no seu código e então teste — o ganho a medir é o de eficiência de tokens, não o número do benchmark.
Se você hospeda o GLM-5.2 por conta própria. Espere duas semanas pelos pesos. Ainda não há nada para baixar.
Se você usa um harness de programação. O GLM-5.3 funciona no ZCode, Claude Code, OpenCode e outros — você não fica preso ao cliente da própria Z.ai.
Se você estava comparando GLM com Claude ou GPT. O GLM-5.3 encurta bastante a distância em programação agêntica e vence com clareza em tokens por resultado. Ele não assume o topo nem na tabela da própria Z.ai. Decida pelo custo por resultado, não pela colocação.
As ressalvas honestas
Estes são os números do próprio laboratório. Toda cifra aqui é autodeclarada. A Z.ai documenta sua metodologia de forma incomumente detalhada — versões de harness, temperaturas, tamanhos de contexto, timeouts, medidas antifraude — o que é mais do que a maioria dos laboratórios publica, e ainda assim não é uma avaliação independente. O GLM-5.3 está no nosso rastreador de modelos com os números rotulados como sendo da própria Z.ai, e ele não entrará na nossa página de benchmarks até que um terceiro o avalie.
Vários benchmarks são internos. O Z.ai Code Bench é privado e não auditável por design. O argumento de contaminação é razoável; ainda assim é a Z.ai corrigindo a prova da Z.ai.
"Pesos abertos" ainda não aconteceu. Duas semanas é uma intenção declarada. O GLM-5.2 lançou os pesos no primeiro dia; este não lançou.
Dados e jurisdição. Inalterado: saiba para onde vão seus tokens antes de rotear dados de clientes por um endpoint hospedado.
O movimento desta semana
Faça a verificação da migração. Meça tokens de saída, não pontuações. Se você trabalha em lote, mova o trabalho para fora do pico e leve os 50%.
Se você quer a divisão "qual modelo para qual tarefa" decidida contra o seu fluxo de trabalho e a sua fatura reais, um Plano de IA para Negócios (US$ 99 pagamento único, com US$ 29/mês opcional para mantê-lo atualizado) faz isso. O localizador gratuito de plano de IA em 2 minutos é a primeira passagem rápida.
Fontes: Z.ai — GLM-5.3: Frontier Coding with Emergent Cyber Capabilities, documentação para desenvolvedores da Z.ai, ZCode. Consultado em 14 de agosto de 2026.