Dapols
PlanosIA vs contrataçãoPreçosFerramentasBenchmarksBlog
EntrarEncontrar meu fluxo com IA
Dapols

The job big companies pay a forward-deployed engineer six figures to do — as a tool, for two figures.

Entre na lista de monitoramento de preços

Verificado nas páginas dos fornecedores. Ainda não enviamos e-mails — deixe seu endereço e seja um dos primeiros a saber quando começarmos.

Produto

  • Planos de IA para Negócios
  • Localizador de plano de IA
  • Biblioteca de habilidades de IA
  • Ferramentas de IA
  • Preços

Explorar

  • IA vs contratação
  • Verificador de custo da stack
  • Calculadora de ROI
  • Funciona com suas ferramentas
  • Comparações
  • Alternativas
  • Por setor
  • Por orçamento

Ofertas

  • Planos de implantação de IA
  • Bigger or more complex? Tell us.
  • Algo maior ou mais complexo?

Empresa

  • Blog
  • Rastreador de modelos de IA
  • Enviar uma ferramenta
  • Contato
  • Privacidade
  • Termos de Serviço

Confiança e metodologia

  • Sobre
  • Metodologia
  • Como classificamos ferramentas de IA
  • IA implantada na linha de frente
  • Divulgação de afiliados
  • Atualizações de preços de ferramentas de IA
  • Índice de preços de IA
  • Segurança e privacidade de dados

© 2026 Dapols. Todos os direitos reservados.

support@dapols.comX

Coloque a IA para trabalhar, um fluxo de trabalho mensurável por vez.

Todos os artigos

Português · 8 min de leitura

GLM-5.3: o mesmo modelo base, um programador muito melhor — e um resultado em cibersegurança que ninguém planejou

A Z.ai lançou o GLM-5.3 em 14 de agosto de 2026. Todo o ganho vem do pós-treinamento, não de um modelo maior. O Terminal-Bench 3.0 saiu de 4,6 para 28,3. Veja o que é real, quanto custa e a migração que vai quebrar suas chamadas de API.

Ler em outro idioma:Françaisहिन्दीEspañolDeutschEnglish

A resposta curta: o GLM-5.3 é o modelo base do GLM-5.2 com mais um mês de pós-treinamento em cima — e é um salto grande em programação agêntica. Já está disponível no GLM Coding Plan e na API. Os pesos foram prometidos para daqui a duas semanas. Se o seu código envia thinking.type: "disabled", suas requisições vão falhar no GLM-5.3 — essa migração é a única coisa urgente deste lançamento.

Verificado em 14 de agosto de 2026 contra o post de lançamento da Z.ai, "GLM-5.3: Frontier Coding with Emergent Cyber Capabilities", incluindo sua tabela de benchmarks e as notas de rodapé sobre metodologia. Todos os números abaixo são valores autodeclarados pela própria Z.ai, salvo indicação em contrário. Ainda não existe avaliação independente do GLM-5.3, então ele não está no nosso snapshot do LiveBench — o benchmark do próprio laboratório é uma alegação, não uma nota de terceiros.

O que de fato foi lançado

O mesmo modelo base. Esse é o ponto que a maior parte da cobertura vai deixar passar. A Z.ai afirma claramente que o GLM-5.3 "usa o mesmo modelo base do GLM-5.2 — todo ganho vem do pós-treinamento". Nenhum modelo maior, nenhuma nova rodada de pré-treinamento. Os ganhos vêm de escalar aprendizado por reforço em ambientes de tarefas de longo horizonte.

Esse é um resultado genuinamente interessante, e também explica por que as melhorias são desiguais: são enormes onde se mede trabalho agêntico de longo horizonte, e modestas no resto.

Uma API ativa, com o id de modelo glm-5.3, liberada para todos os assinantes do GLM Coding Plan.

Pesos abertos em duas semanas, assim que "a avaliação de segurança e o endurecimento estiverem concluídos". Um compromisso com prazo definido, não uma trava indefinida.

Os saltos de benchmark que importam

Números autodeclarados pela Z.ai, GLM-5.3 vs GLM-5.2:

BenchmarkGLM-5.3GLM-5.2
Terminal-Bench 3.028.34.6
SWE-Marathon v1.142.519.4
ExploitBench54.424.4
AutomationBench v1.0.648.226.2
DeepSWE v1.166.946.2
Toolathlon Verified73.059.9
FrontierSWE78.167.5
CyberGym84.577.2
Terminal-Bench 2.188.281.0

O Terminal-Bench 3.0 indo de 4.6 para 28.3 é o sinal mais claro: nas tarefas agênticas mais difíceis e mais longas, o GLM-5.2 basicamente falhava, e o GLM-5.3 não falha.

Repare no formato disso. O Terminal-Bench 2.1 foi de 81.0 → 88.2, um incremento normal. O Terminal-Bench 3.0 foi de 4.6 → 28.3, um salto de 6×. Quanto mais difícil e mais longa a tarefa, maior o ganho — que é exatamente o que se espera se a melhoria vem de RL de longo horizonte, e não de capacidade bruta.

Onde ele ainda perde. No Terminal-Bench 3.0, a própria tabela da Z.ai coloca o GPT-5.6 Sol em 34.6 e o Fable 5 em 33.7, ambos à frente dos 28.3 do GLM-5.3. No seu benchmark interno Z.ai Code Bench, o GLM-5.3 chega a 34,5% no esforço Max contra 39,5% do Claude Fable 5. A Z.ai diz isso abertamente, o que merece algum crédito.

O resultado de eficiência de tokens é a história de negócio

Escondido debaixo da tabela de benchmarks está o número que de fato afeta a fatura.

No Z.ai Code Bench em esforço Max, o GLM-5.3 chega a 34,5% usando cerca de 75K tokens de saída por tarefa — contra os 23,4% do GLM-5.2 com 96K. Resultados melhores, menos tokens.

Contra um modelo fechado: em esforço High, o GLM-5.3 atinge 31,4% com cerca de 50K tokens de saída, contra o Claude Opus 4.8 com 29,5% e 120K. Pontuação levemente melhor, cerca de 2,4× menos tokens de saída.

Para quem roda agentes de programação em volume, os tokens de saída são a conta. Um modelo que pontua igual gastando uma fração dos tokens é uma história de custo, não de ranking.

O resultado em cibersegurança, e por que ele tem dois gumes

A Z.ai adicionou dados de descoberta de vulnerabilidades à mistura de treinamento esperando ganhos modestos, e relata ter se surpreendido: o GLM-5.3 passou a raciocinar sobre cadeias completas de exploração, e não apenas a identificar falhas isoladas. No ExploitGym ele conclui 105 tarefas em duas horas e 130 em seis, contra 29 e 39 do GLM-5.2.

Rodado contra bases de código reais com equipes de segurança chinesas, o modelo revelou 2.436 vulnerabilidades em 269 projetos de código aberto — 107 críticas e 990 altas. A falha média havia sobrevivido 26,6 anos sem ser descoberta; a mais antiga era de 1981. A Z.ai publicou um Security Disclosure Ledger acompanhando esses casos, com 53 divulgados e 2.383 ainda sob embargo.

Duas ressalvas honestas. Primeiro, as próprias comparações da Z.ai mostram que ele está bem atrás da fronteira fechada aqui — a página cita concorrentes com 181 e 247 tarefas do ExploitGym contra as 105 e 130 do GLM-5.3. O resumo que a Z.ai faz da própria distância é franco: a capacidade cresce mais rápido justamente onde ela está mais atrás.

Segundo, um modelo de pesos abertos capaz de descobrir vulnerabilidades é de uso dual por construção. O atraso de duas semanas nos pesos para "avaliação de segurança e endurecimento" é presumivelmente exatamente sobre isso.

(Uma inconsistência de nomenclatura que vale sinalizar: o texto da Z.ai se refere a "Mythos 5" nas comparações de cibersegurança, enquanto a coluna da própria tabela é intitulada "Fable 5". Citamos os números do próprio GLM-5.3 em vez de adivinhar qual concorrente é o pretendido.)

A migração que vai quebrar suas chamadas

O GLM-5.3 suporta três níveis de esforço de raciocínio — low, high, max. Desativar o raciocínio não é mais suportado.

Se sua aplicação hoje envia thinking.type: "disabled", mude para enabled e defina reasoning_effort como low antes de trocar o id do modelo para glm-5.3. Caso contrário, a requisição falha. A Z.ai recomenda max para tarefas de programação.

Esse é o único item do lançamento com prazo atrelado.

Quanto custa

A Z.ai não publicou preço por token. O GLM Coding Plan passou a usar um sistema de cotas baseado em pontos, com pontos contabilizados separadamente para tokens de entrada, entrada em cache e saída.

O detalhe de preço que mais importa: chamadas fora do horário de pico consomem 50% dos pontos padrão. O pico é das 14:00 às 18:00 no fuso UTC+8, de segunda a sexta. Todo o resto — incluindo o fim de semana inteiro — sai pela metade.

Se você roda trabalho em lote, essa é uma decisão de agendamento que vale tomar deliberadamente. A madrugada na Europa ou nas Américas é fora de pico no UTC+8.

Pelo ZCode, a Z.ai também anuncia uma taxa de acerto de cache acima de 98% em contexto repetido e um aumento de cota de 1,5× por tempo limitado até 31 de agosto.

O que fazer nesta semana

Se você está no GLM Coding Plan. O GLM-5.3 já foi liberado para você. Verifique primeiro se há thinking.type: "disabled" no seu código e então teste — o ganho a medir é o de eficiência de tokens, não o número do benchmark.

Se você hospeda o GLM-5.2 por conta própria. Espere duas semanas pelos pesos. Ainda não há nada para baixar.

Se você usa um harness de programação. O GLM-5.3 funciona no ZCode, Claude Code, OpenCode e outros — você não fica preso ao cliente da própria Z.ai.

Se você estava comparando GLM com Claude ou GPT. O GLM-5.3 encurta bastante a distância em programação agêntica e vence com clareza em tokens por resultado. Ele não assume o topo nem na tabela da própria Z.ai. Decida pelo custo por resultado, não pela colocação.

As ressalvas honestas

Estes são os números do próprio laboratório. Toda cifra aqui é autodeclarada. A Z.ai documenta sua metodologia de forma incomumente detalhada — versões de harness, temperaturas, tamanhos de contexto, timeouts, medidas antifraude — o que é mais do que a maioria dos laboratórios publica, e ainda assim não é uma avaliação independente. O GLM-5.3 está no nosso rastreador de modelos com os números rotulados como sendo da própria Z.ai, e ele não entrará na nossa página de benchmarks até que um terceiro o avalie.

Vários benchmarks são internos. O Z.ai Code Bench é privado e não auditável por design. O argumento de contaminação é razoável; ainda assim é a Z.ai corrigindo a prova da Z.ai.

"Pesos abertos" ainda não aconteceu. Duas semanas é uma intenção declarada. O GLM-5.2 lançou os pesos no primeiro dia; este não lançou.

Dados e jurisdição. Inalterado: saiba para onde vão seus tokens antes de rotear dados de clientes por um endpoint hospedado.

O movimento desta semana

Faça a verificação da migração. Meça tokens de saída, não pontuações. Se você trabalha em lote, mova o trabalho para fora do pico e leve os 50%.

Se você quer a divisão "qual modelo para qual tarefa" decidida contra o seu fluxo de trabalho e a sua fatura reais, um Plano de IA para Negócios (US$ 99 pagamento único, com US$ 29/mês opcional para mantê-lo atualizado) faz isso. O localizador gratuito de plano de IA em 2 minutos é a primeira passagem rápida.

Fontes: Z.ai — GLM-5.3: Frontier Coding with Emergent Cyber Capabilities, documentação para desenvolvedores da Z.ai, ZCode. Consultado em 14 de agosto de 2026.

Conteúdo9 seções
  1. 01O que de fato foi lançado
  2. 02Os saltos de benchmark que importam
  3. 03O resultado de eficiência de tokens é a história de negócio
  4. 04O resultado em cibersegurança, e por que ele tem dois gumes
  5. 05A migração que vai quebrar suas chamadas
  6. 06Quanto custa
  7. 07O que fazer nesta semana
  8. 08As ressalvas honestas
  9. 09O movimento desta semana

Entre na lista de monitoramento de preços

Verificado nas páginas dos fornecedores. Ainda não enviamos e-mails — deixe seu endereço e seja um dos primeiros a saber quando começarmos.

Receba seu plano de IA

Suas melhores ferramentas, ganhos rápidos e orçamento — em dois minutos.

Fazer o teste