Dapols
PlanesIA vs contrataciónPreciosHerramientasPuntos de referenciaBlog
Iniciar sesiónEncontrar mi flujo con IA
Dapols

The job big companies pay a forward-deployed engineer six figures to do — as a tool, for two figures.

Únete a la lista de vigilancia de precios

Verificado en páginas de proveedores. Todavía no enviamos correos; deja tu dirección y serás de los primeros en enterarte cuando empecemos.

Producto

  • Planes de IA para Negocios
  • Buscador de plan de IA
  • Biblioteca de habilidades de IA
  • Herramientas de IA
  • Precios

Explorar

  • IA vs contratación
  • Comprobador de coste del stack
  • Calculadora de ROI
  • Funciona con tus herramientas
  • Comparativas
  • Alternativas
  • Por industria
  • Por presupuesto

Ofertas

  • Planes de implementación de IA
  • Bigger or more complex? Tell us.
  • ¿Algo más grande o más complejo?

Empresa

  • Blog
  • Rastreador de modelos de IA
  • Enviar una herramienta
  • Contacto
  • Privacidad
  • Términos del servicio

Confianza y metodología

  • Acerca de
  • Metodología
  • Cómo clasificamos las herramientas de IA
  • IA desplegada en primera línea
  • Divulgación de afiliados
  • Actualizaciones de precios de herramientas de IA
  • Índice de precios de IA
  • Seguridad y privacidad de datos

© 2026 Dapols. Todos los derechos reservados.

support@dapols.comX

Pon la IA a trabajar, un flujo de trabajo medible a la vez.

Todos los artículos

Español · 8 min de lectura

GLM-5.3: el mismo modelo base, mucho mejor programando — y un resultado de ciberseguridad que nadie planeó

Z.ai publicó GLM-5.3 el 14 de agosto de 2026. Toda la mejora viene del post-entrenamiento, no de un modelo más grande. Terminal-Bench 3.0 pasó de 4.6 a 28.3. Esto es lo real, lo que cuesta y la migración que romperá tus llamadas a la API.

Leer en otro idioma:Françaisहिन्दीPortuguêsDeutschEnglish

La respuesta corta: GLM-5.3 es el modelo base de GLM-5.2 con un mes extra de post-entrenamiento encima — y supone un salto grande en programación agéntica. Ya está disponible en el GLM Coding Plan y en la API. Los pesos están prometidos para dentro de dos semanas. Si tu código envía thinking.type: "disabled", tus peticiones fallarán en GLM-5.3 — esa migración es lo único urgente de este lanzamiento.

Verificado el 14 de agosto de 2026 contra la publicación de lanzamiento de Z.ai, "GLM-5.3: Frontier Coding with Emergent Cyber Capabilities", incluidas su tabla de benchmarks y las notas metodológicas. Todas las cifras siguientes son datos autoinformados por Z.ai salvo que se indique lo contrario. Todavía no existe ninguna evaluación independiente de GLM-5.3, así que no aparece en nuestra instantánea de LiveBench: el benchmark de un laboratorio sobre sí mismo es una afirmación, no una puntuación de terceros.

Qué se publicó de verdad

El mismo modelo base. Este es el titular que la mayoría de coberturas pasará por alto. Z.ai afirma con claridad que GLM-5.3 "usa el mismo modelo base que GLM-5.2 — toda la mejora viene del post-entrenamiento". Ni modelo más grande, ni nuevo preentrenamiento. Las mejoras vienen de escalar el aprendizaje por refuerzo en entornos de tareas de horizonte largo.

Es un resultado genuinamente interesante, y también explica por qué las mejoras son desiguales: son enormes donde se mide el trabajo agéntico de horizonte largo, y modestas en el resto.

Una API en vivo, con el id de modelo glm-5.3, desplegada para todos los suscriptores del GLM Coding Plan.

Pesos abiertos en dos semanas, una vez que "la evaluación de seguridad y el endurecimiento estén completos". Un compromiso con fecha acotada, no un bloqueo indefinido.

Los saltos de benchmark que importan

Cifras autoinformadas por Z.ai, GLM-5.3 frente a GLM-5.2:

BenchmarkGLM-5.3GLM-5.2
Terminal-Bench 3.028.34.6
SWE-Marathon v1.142.519.4
ExploitBench54.424.4
AutomationBench v1.0.648.226.2
DeepSWE v1.166.946.2
Toolathlon Verified73.059.9
FrontierSWE78.167.5
CyberGym84.577.2
Terminal-Bench 2.188.281.0

Que Terminal-Bench 3.0 pase de 4.6 a 28.3 es la señal más clara: en las tareas agénticas de horizonte largo más difíciles, GLM-5.2 fallaba prácticamente siempre y GLM-5.3 no.

Fíjate en la forma del resultado. Terminal-Bench 2.1 pasó de 81.0 a 88.2, un incremento normal. Terminal-Bench 3.0 pasó de 4.6 a 28.3, un salto de 6×. Cuanto más difícil y más larga es la tarea, mayor es la mejora — que es exactamente lo que cabría esperar si la mejora viene de RL de horizonte largo y no de capacidad bruta.

Dónde sigue perdiendo. En Terminal-Bench 3.0, la propia tabla de Z.ai sitúa a GPT-5.6 Sol en 34.6 y a Fable 5 en 33.7, ambos por delante del 28.3 de GLM-5.3. En su Z.ai Code Bench interno, GLM-5.3 llega al 34.5% con esfuerzo Max frente al 39.5% de Claude Fable 5. Z.ai lo dice directamente, y eso merece cierto crédito.

El resultado de eficiencia en tokens es la historia de negocio

Debajo de la tabla de benchmarks está el número que de verdad afecta a la factura.

En Z.ai Code Bench con esfuerzo Max, GLM-5.3 alcanza el 34.5% usando unos 75K tokens de salida por tarea — frente al 23.4% de GLM-5.2 con 96K. Mejores resultados, menos tokens.

Frente a un modelo cerrado: con esfuerzo High, GLM-5.3 logra un 31.4% con unos 50K tokens de salida, frente a Claude Opus 4.8 con un 29.5% y 120K. Puntuación algo mejor, aproximadamente 2.4× menos tokens de salida.

Para quien ejecuta agentes de programación a volumen, los tokens de salida son la factura. Un modelo que puntúa igual con una fracción de los tokens es una historia de coste, no de ranking.

El resultado de ciberseguridad, y por qué tiene doble filo

Z.ai añadió datos de descubrimiento de vulnerabilidades a la mezcla de entrenamiento esperando mejoras modestas, y dice haberse sorprendido: GLM-5.3 empezó a razonar sobre cadenas completas de explotación, no solo a detectar fallos aislados. En ExploitGym completa 105 tareas en dos horas y 130 en seis, frente a las 29 y 39 de GLM-5.2.

Ejecutado contra bases de código reales con equipos de seguridad chinos, el modelo sacó a la luz 2.436 vulnerabilidades en 269 proyectos de código abierto — 107 críticas y 990 altas. El fallo medio había sobrevivido 26.6 años sin descubrirse; el más antiguo databa de 1981. Z.ai ha publicado un Security Disclosure Ledger que las registra, con 53 divulgadas y 2.383 todavía bajo embargo.

Dos matices honestos. Primero, las comparaciones de la propia Z.ai la sitúan claramente por detrás de la frontera cerrada en este terreno: la página cita competidores con 181 y 247 tareas de ExploitGym frente a las 105 y 130 de GLM-5.3. El resumen que hace Z.ai de su propia brecha es franco: la capacidad crece más deprisa justo donde más atrás va.

Segundo, un modelo de pesos abiertos capaz de descubrir vulnerabilidades es de doble uso por construcción. El retraso de dos semanas en los pesos para "evaluación de seguridad y endurecimiento" tiene presumiblemente que ver precisamente con eso.

(Una inconsistencia de etiquetado que conviene señalar: el texto de Z.ai habla de "Mythos 5" en las comparaciones de ciberseguridad mientras que su propia columna de tabla se titula "Fable 5". Hemos citado las cifras propias de GLM-5.3 en lugar de adivinar a qué competidor se refieren.)

La migración que romperá tus llamadas

GLM-5.3 admite tres niveles de esfuerzo de razonamiento — low, high, max. Ya no se admite desactivar el razonamiento.

Si tu aplicación envía actualmente thinking.type: "disabled", cámbialo a enabled y fija reasoning_effort en low antes de cambiar el id de modelo a glm-5.3. De lo contrario, la petición falla. Z.ai recomienda max para tareas de programación.

Este es el único punto del lanzamiento con una fecha límite asociada.

Qué cuesta

Z.ai no publicó precios por token. El GLM Coding Plan ha pasado a un sistema de cuota por puntos, con puntos contados por separado para tokens de entrada, entrada cacheada y salida.

El detalle de precio que más importa: las llamadas fuera de horas punta consumen el 50% de los puntos estándar. La franja punta es de 14:00 a 18:00 UTC+8, de lunes a viernes. Todo lo demás — incluido el fin de semana entero — está a mitad de precio.

Si ejecutas trabajo por lotes, esa es una decisión de planificación que merece tomarse de forma deliberada. La noche en Europa o América es franja valle en UTC+8.

A través de ZCode, Z.ai también anuncia una tasa de acierto de caché superior al 98% en contexto repetido y un aumento de cuota de 1.5× por tiempo limitado hasta el 31 de agosto.

Qué hacer esta semana

Si tienes un GLM Coding Plan. GLM-5.3 ya se te ha desplegado. Revisa primero tu código en busca de thinking.type: "disabled" y después pruébalo: lo que hay que medir es la ganancia de eficiencia en tokens, no el número del benchmark.

Si autoalojas GLM-5.2. Espera dos semanas a los pesos. Todavía no hay nada que descargar.

Si usas un harness de programación. GLM-5.3 funciona en ZCode, Claude Code, OpenCode y otros — no estás atado al cliente propio de Z.ai.

Si estabas comparando GLM con Claude o GPT. GLM-5.3 recorta la distancia en programación agéntica de forma sustancial y gana con claridad en tokens por resultado. No se lleva el primer puesto ni en la tabla de la propia Z.ai. Decide por coste por resultado, no por posición en el ranking.

Los matices honestos

Estas son las cifras del propio laboratorio. Todos los datos aquí son autoinformados. Z.ai documenta su metodología con un detalle poco habitual — versiones de harness, temperaturas, longitudes de contexto, timeouts, medidas anti-trampa — que es más de lo que publica la mayoría de laboratorios, y aun así no es una evaluación independiente. GLM-5.3 está en nuestro rastreador de modelos con sus cifras etiquetadas como datos de la propia Z.ai, y no entrará en nuestra página de benchmarks hasta que un tercero lo puntúe.

Varios benchmarks son internos. Z.ai Code Bench es privado e inauditable por diseño. Su argumento sobre contaminación es razonable; sigue siendo Z.ai evaluando a Z.ai.

Los "pesos abiertos" todavía no han llegado. Dos semanas es una intención declarada. GLM-5.2 publicó pesos el mismo día del lanzamiento; este no.

Datos y jurisdicción. Sin cambios: sabe adónde van tus tokens antes de enrutar datos de clientes por un endpoint alojado.

El movimiento de esta semana

Haz la comprobación de migración. Mide tokens de salida, no puntuaciones. Si trabajas por lotes, mueve el trabajo a franja valle y quédate con ese 50%.

Si quieres que el reparto de "qué modelo para qué trabajo" se decida contra tu flujo de trabajo y tu factura reales, un Plan de IA para empresas (99 $ pago único, 29 $/mes opcional para mantenerlo al día) hace exactamente eso. El buscador gratuito de plan de IA en 2 minutos es la primera pasada rápida.

Fuentes: Z.ai — GLM-5.3: Frontier Coding with Emergent Cyber Capabilities, documentación para desarrolladores de Z.ai, ZCode. Consultado el 14 de agosto de 2026.

Contenido9 secciones
  1. 01Qué se publicó de verdad
  2. 02Los saltos de benchmark que importan
  3. 03El resultado de eficiencia en tokens es la historia de negocio
  4. 04El resultado de ciberseguridad, y por qué tiene doble filo
  5. 05La migración que romperá tus llamadas
  6. 06Qué cuesta
  7. 07Qué hacer esta semana
  8. 08Los matices honestos
  9. 09El movimiento de esta semana

Únete a la lista de vigilancia de precios

Verificado en páginas de proveedores. Todavía no enviamos correos; deja tu dirección y serás de los primeros en enterarte cuando empecemos.

Obtén tu plan de IA

Tus mejores herramientas, victorias rápidas y presupuesto, en dos minutos.

Hacer el test