Pular para o conteúdo principal
Todos os artigos

Português (Brasil) · 8 min de leitura

GLM-5.3: o mesmo modelo base, um programador muito melhor — e um resultado em cibersegurança que ninguém planejou

A Z.ai lançou o GLM-5.3 em 14 de agosto de 2026. Todo o ganho vem do pós-treinamento, não de um modelo maior. O Terminal-Bench 3.0 saiu de 4,6 para 28,3. Veja o que é real, quanto custa e a migração que vai quebrar suas chamadas de API.

Por Dapols ·

A resposta curta: o GLM-5.3 é o modelo base do GLM-5.2 com mais um mês de pós-treinamento em cima — e é um salto grande em programação agêntica. Já está disponível no GLM Coding Plan e na API. Os pesos foram prometidos para daqui a duas semanas. Se o seu código envia thinking.type: "disabled", suas requisições vão falhar no GLM-5.3 — essa migração é a única coisa urgente deste lançamento.

Verificado em 14 de agosto de 2026 contra o post de lançamento da Z.ai, "GLM-5.3: Frontier Coding with Emergent Cyber Capabilities", incluindo sua tabela de benchmarks e as notas de rodapé sobre metodologia. Todos os números abaixo são valores autodeclarados pela própria Z.ai, salvo indicação em contrário. Ainda não existe avaliação independente do GLM-5.3, então ele não está no nosso snapshot do LiveBench — o benchmark do próprio laboratório é uma alegação, não uma nota de terceiros.

O que de fato foi lançado

O mesmo modelo base. Esse é o ponto que a maior parte da cobertura vai deixar passar. A Z.ai afirma claramente que o GLM-5.3 "usa o mesmo modelo base do GLM-5.2 — todo ganho vem do pós-treinamento". Nenhum modelo maior, nenhuma nova rodada de pré-treinamento. Os ganhos vêm de escalar aprendizado por reforço em ambientes de tarefas de longo horizonte.

Esse é um resultado genuinamente interessante, e também explica por que as melhorias são desiguais: são enormes onde se mede trabalho agêntico de longo horizonte, e modestas no resto.

Uma API ativa, com o id de modelo glm-5.3, liberada para todos os assinantes do GLM Coding Plan.

Pesos abertos em duas semanas, assim que "a avaliação de segurança e o endurecimento estiverem concluídos". Um compromisso com prazo definido, não uma trava indefinida.

Os saltos de benchmark que importam

Números autodeclarados pela Z.ai, GLM-5.3 vs GLM-5.2:

BenchmarkGLM-5.3GLM-5.2
Terminal-Bench 3.028.34.6
SWE-Marathon v1.142.519.4
ExploitBench54.424.4
AutomationBench v1.0.648.226.2
DeepSWE v1.166.946.2
Toolathlon Verified73.059.9
FrontierSWE78.167.5
CyberGym84.577.2
Terminal-Bench 2.188.281.0

O Terminal-Bench 3.0 indo de 4.6 para 28.3 é o sinal mais claro: nas tarefas agênticas mais difíceis e mais longas, o GLM-5.2 basicamente falhava, e o GLM-5.3 não falha.

Repare no formato disso. O Terminal-Bench 2.1 foi de 81.0 → 88.2, um incremento normal. O Terminal-Bench 3.0 foi de 4.6 → 28.3, um salto de 6×. Quanto mais difícil e mais longa a tarefa, maior o ganho — que é exatamente o que se espera se a melhoria vem de RL de longo horizonte, e não de capacidade bruta.

Onde ele ainda perde. No Terminal-Bench 3.0, a própria tabela da Z.ai coloca o GPT-5.6 Sol em 34.6 e o Fable 5 em 33.7, ambos à frente dos 28.3 do GLM-5.3. No seu benchmark interno Z.ai Code Bench, o GLM-5.3 chega a 34,5% no esforço Max contra 39,5% do Claude Fable 5. A Z.ai diz isso abertamente, o que merece algum crédito.

O resultado de eficiência de tokens é a história de negócio

Escondido debaixo da tabela de benchmarks está o número que de fato afeta a fatura.

No Z.ai Code Bench em esforço Max, o GLM-5.3 chega a 34,5% usando cerca de 75K tokens de saída por tarefa — contra os 23,4% do GLM-5.2 com 96K. Resultados melhores, menos tokens.

Contra um modelo fechado: em esforço High, o GLM-5.3 atinge 31,4% com cerca de 50K tokens de saída, contra o Claude Opus 4.8 com 29,5% e 120K. Pontuação levemente melhor, cerca de 2,4× menos tokens de saída.

Para quem roda agentes de programação em volume, os tokens de saída são a conta. Um modelo que pontua igual gastando uma fração dos tokens é uma história de custo, não de ranking.

O resultado em cibersegurança, e por que ele tem dois gumes

A Z.ai adicionou dados de descoberta de vulnerabilidades à mistura de treinamento esperando ganhos modestos, e relata ter se surpreendido: o GLM-5.3 passou a raciocinar sobre cadeias completas de exploração, e não apenas a identificar falhas isoladas. No ExploitGym ele conclui 105 tarefas em duas horas e 130 em seis, contra 29 e 39 do GLM-5.2.

Rodado contra bases de código reais com equipes de segurança chinesas, o modelo revelou 2.436 vulnerabilidades em 269 projetos de código aberto — 107 críticas e 990 altas. A falha média havia sobrevivido 26,6 anos sem ser descoberta; a mais antiga era de 1981. A Z.ai publicou um Security Disclosure Ledger acompanhando esses casos, com 53 divulgados e 2.383 ainda sob embargo.

Duas ressalvas honestas. Primeiro, as próprias comparações da Z.ai mostram que ele está bem atrás da fronteira fechada aqui — a página cita concorrentes com 181 e 247 tarefas do ExploitGym contra as 105 e 130 do GLM-5.3. O resumo que a Z.ai faz da própria distância é franco: a capacidade cresce mais rápido justamente onde ela está mais atrás.

Segundo, um modelo de pesos abertos capaz de descobrir vulnerabilidades é de uso dual por construção. O atraso de duas semanas nos pesos para "avaliação de segurança e endurecimento" é presumivelmente exatamente sobre isso.

(Uma inconsistência de nomenclatura que vale sinalizar: o texto da Z.ai se refere a "Mythos 5" nas comparações de cibersegurança, enquanto a coluna da própria tabela é intitulada "Fable 5". Citamos os números do próprio GLM-5.3 em vez de adivinhar qual concorrente é o pretendido.)

A migração que vai quebrar suas chamadas

O GLM-5.3 suporta três níveis de esforço de raciocínio — low, high, max. Desativar o raciocínio não é mais suportado.

Se sua aplicação hoje envia thinking.type: "disabled", mude para enabled e defina reasoning_effort como low antes de trocar o id do modelo para glm-5.3. Caso contrário, a requisição falha. A Z.ai recomenda max para tarefas de programação.

Esse é o único item do lançamento com prazo atrelado.

Quanto custa

A Z.ai não publicou preço por token. O GLM Coding Plan passou a usar um sistema de cotas baseado em pontos, com pontos contabilizados separadamente para tokens de entrada, entrada em cache e saída.

O detalhe de preço que mais importa: chamadas fora do horário de pico consomem 50% dos pontos padrão. O pico é das 14:00 às 18:00 no fuso UTC+8, de segunda a sexta. Todo o resto — incluindo o fim de semana inteiro — sai pela metade.

Se você roda trabalho em lote, essa é uma decisão de agendamento que vale tomar deliberadamente. A madrugada na Europa ou nas Américas é fora de pico no UTC+8.

Pelo ZCode, a Z.ai também anuncia uma taxa de acerto de cache acima de 98% em contexto repetido e um aumento de cota de 1,5× por tempo limitado até 31 de agosto.

O que fazer nesta semana

Se você está no GLM Coding Plan. O GLM-5.3 já foi liberado para você. Verifique primeiro se há thinking.type: "disabled" no seu código e então teste — o ganho a medir é o de eficiência de tokens, não o número do benchmark.

Se você hospeda o GLM-5.2 por conta própria. Espere duas semanas pelos pesos. Ainda não há nada para baixar.

Se você usa um harness de programação. O GLM-5.3 funciona no ZCode, Claude Code, OpenCode e outros — você não fica preso ao cliente da própria Z.ai.

Se você estava comparando GLM com Claude ou GPT. O GLM-5.3 encurta bastante a distância em programação agêntica e vence com clareza em tokens por resultado. Ele não assume o topo nem na tabela da própria Z.ai. Decida pelo custo por resultado, não pela colocação.

As ressalvas honestas

Estes são os números do próprio laboratório. Toda cifra aqui é autodeclarada. A Z.ai documenta sua metodologia de forma incomumente detalhada — versões de harness, temperaturas, tamanhos de contexto, timeouts, medidas antifraude — o que é mais do que a maioria dos laboratórios publica, e ainda assim não é uma avaliação independente. O GLM-5.3 está no nosso rastreador de modelos com os números rotulados como sendo da própria Z.ai, e ele não entrará na nossa página de benchmarks até que um terceiro o avalie.

Vários benchmarks são internos. O Z.ai Code Bench é privado e não auditável por design. O argumento de contaminação é razoável; ainda assim é a Z.ai corrigindo a prova da Z.ai.

"Pesos abertos" ainda não aconteceu. Duas semanas é uma intenção declarada. O GLM-5.2 lançou os pesos no primeiro dia; este não lançou.

Dados e jurisdição. Inalterado: saiba para onde vão seus tokens antes de rotear dados de clientes por um endpoint hospedado.

O movimento desta semana

Faça a verificação da migração. Meça tokens de saída, não pontuações. Se você trabalha em lote, mova o trabalho para fora do pico e leve os 50%.

Se você quer a divisão "qual modelo para qual tarefa" decidida contra o seu fluxo de trabalho e a sua fatura reais, um Plano de IA para Negócios (US$ 99 pagamento único, com US$ 29/mês opcional para mantê-lo atualizado) faz isso. O localizador gratuito de plano de IA em 2 minutos é a primeira passagem rápida.

Fontes: Z.ai — GLM-5.3: Frontier Coding with Emergent Cyber Capabilities, documentação para desenvolvedores da Z.ai, ZCode. Consultado em 14 de agosto de 2026.