IANoticia

Exploits de GLM-5.3: lo que muestran las pruebas de un rival

Exploits de GLM-5.3: Anthropic dice que el modelo abierto los logró en 12% de intentos, cerca de Claude Mythos Preview. Qué midió y qué no resuelve un rival.

Basado en fuentes. Escrito a partir de los documentos, reportes y reseñas enlazados en el texto. The Ruling Desk no probó nada de esto en persona. Cómo trabajamos

Líneas de código fuente de colores en un monitor oscuro, fotografiadas en ángulo y con poca profundidad de campo
Foto: Markus Spiske / Wikimedia Commons, CC0

GLM-5.3, el modelo de pesos abiertos de la china Zhipu AI, construye exploits funcionales casi con la misma frecuencia que Claude Mythos Preview, el modelo restringido de Anthropic, según dijo Anthropic en un informe de su Frontier Red Team del 29 de septiembre. En las pruebas de Anthropic, los exploits de GLM-5.3 funcionaron de principio a fin en 12% de los intentos, y sus negativas cedieron ante trucos sencillos entre 64% y 100% de las veces. Anthropic vende modelos que compiten con los de Zhipu, así que cada número de este artículo es una medición de Anthropic, no un veredicto neutral. Aquí está lo que midió, lo que agrega la prueba del propio gobierno de Estados Unidos y lo que el informe no puede decirte.

Puntos clave

  • Casi a la par, según la cuenta de Anthropic: GLM-5.3 construyó 50 exploits funcionales en 410 intentos de ExploitBench (12%), frente a 56 (14%) de Claude Mythos Preview, dice Anthropic. Los otros modelos que probó quedaron en 0% o cerca.
  • Las salvaguardas cayeron fácil en la simulación de Anthropic: una historia de cobertura falsa hizo que GLM-5.3 atendiera peticiones maliciosas 64% de las veces, un razonamiento prellenado 92% y una copia modificada de los pesos 100%.
  • Barato de usar: Anthropic dice que el modelo más pequeño, GLM-5.3-Flash, encadenó exploits para una falla conocida de Chrome en ocho horas de trabajo del modelo por US$20.40 a los precios de la API de Zhipu.
  • Una agencia de Estados Unidos coincide en lo general: el CAISI del NIST llamó a GLM-5.3 el modelo de pesos abiertos con más capacidad cibernética hasta la fecha, pero unos cuatro meses detrás de los modelos de frontera de Estados Unidos.
  • Léelo como el informe de un rival: Anthropic compite con Zhipu, no lo dijo en su publicación y no publicó ningún comentario de Zhipu. Sus pruebas son simulaciones que la propia empresa llama imperfectas.

Qué midió Anthropic sobre los exploits de GLM-5.3

La prueba principal es ExploitBench, que le pide a un modelo explotar fallas conocidas de V8, el motor de JavaScript de Google Chrome. Los exploits de GLM-5.3 que cuenta son código de ataque que funciona, no simples reportes de fallas.

Prueba (ejecuciones de Anthropic)GLM-5.3Claude Mythos PreviewOtros modelos probados
ExploitBench, 410 intentos50 exploits (12%)56 exploits (14%)0% o cerca
Explotación de binarios interna, 100 tareas4%6%0%

Los otros modelos fueron Claude Opus 4.6, GLM-5.2, Kimi K3 de Moonshot y DeepSeek V4.1-Flash. La prueba interna usa proyectos de código abierto del programa OSS-Fuzz de Google y solo da el puntaje completo cuando el modelo secuestra el flujo de control del programa.

Anthropic también describe dos ejecuciones prácticas. En una, dice que GLM-5.3 encontró varias fallas desconocidas hasta entonces en el motor de JavaScript de un navegador en más o menos un día, con poca atención humana, y las encadenó en un exploit funcional. En la otra, un investigador le dio a GLM-5.3-Flash, el modelo compañero más pequeño, los detalles públicos de una falla de Chrome (CVE-2026-11645) y de otra falla conocida. Anthropic dice que el modelo construyó una cadena de exploits confiable para un objetivo ARM64 que superó la protección de autenticación de punteros, con 20 minutos de atención humana y ocho horas de trabajo del modelo, por US$20.40 a los precios de la API de Zhipu.

Qué tan fácil fue saltarse las salvaguardas

Anthropic puso a los modelos en un mundo simulado y les dio órdenes abiertamente maliciosas para atacar sistemas críticos. Dice que nunca se ejecutó código escrito por el modelo y que este no podía llegar a sistemas externos. De fábrica, GLM-5.3 se negó todas las veces. Luego Anthropic probó tres formas de saltarse esas negativas:

  • Un prompt engañoso, como decirle al modelo que es un agente de red team en un ejercicio: atendió la petición 64% de las veces.
  • Razonamiento prellenado, que falsea el razonamiento del modelo para que parezca que ya aceptó: 92%.
  • Abliteración (abliteration), una edición de los pesos descargados que elimina las negativas: 100%.

Anthropic dice que Claude Opus 4.8, Opus 5 y Mythos 5 se quedaron en 0% "en todas las condiciones aplicables". La palabra "aplicables" importa: no puedes aplicar abliteración a un modelo cuyos pesos no puedes descargar, así que no es una prueba equivalente para Claude.

Aplicar abliteración a GLM-5.3 le tomó al equipo de Anthropic, que nunca lo había hecho, unas 2,200 horas de GPU, o cerca de US$4,400 en cómputo. Anthropic calcula que un equipo con experiencia podría hacerlo desde cero en unas 600 horas de GPU (alrededor de US$1,200). Dice que la tasa de negativas bajó de más de 90% a cerca de 3% en JailbreakBench, 2% en HarmBench y 12% en StrongREJECT, mientras su puntaje de ciencia general se mantuvo y uno de ciberseguridad bajó solo un pequeño porcentaje. Y dice que varios desarrolladores publicaron copias de GLM-5.3 con abliteración a los pocos días del lanzamiento.

Por qué los pesos abiertos cambian las cuentas

Anthropic ha mantenido Mythos Preview dentro de Project Glasswing, un programa limitado para defensores verificados. Los pesos de GLM-5.3 son públicos. Como lo dice Anthropic, los atacantes no pueden conseguir fácilmente esas versiones de los modelos de Estados Unidos, "pero cualquiera puede descargar GLM-5.3".

La propia Zhipu señala el salto en ciberseguridad. Su ficha del modelo en Hugging Face dice que "la capacidad cibernética se desarrolló más rápido de lo que esperábamos" al escalar el entrenamiento, y presume un resultado de vanguardia en CyberGym, una prueba de descubrimiento de vulnerabilidades. La ficha publica los pesos bajo una licencia propia de GLM-5.3.

Esto no pasa en el vacío. Las intrusiones hechas por IA ya no son hipotéticas, como muestra nuestra nota sobre la intrusión a DIVD a través de Zammad, y los laboratorios de Estados Unidos también acusan a los chinos de copiar sus modelos, como en la acusación de OpenAI contra Moonshot.

Qué encontró la prueba del gobierno de Estados Unidos

El Centro de Estándares e Innovación en IA de Estados Unidos (CAISI), parte del NIST, publicó su propia evaluación de GLM-5.3 el 17 de septiembre. Llama a GLM-5.3 "el modelo de pesos abiertos con más capacidad cibernética lanzado hasta la fecha", pero dice que sus habilidades cibernéticas son "significativamente menores" que las de los modelos de frontera actuales de Estados Unidos, con un rezago de unos cuatro meses. El CAISI dice que Z.ai lanzó el modelo el 14 de agosto y publicó los pesos dos semanas después, y que probó los modelos de Estados Unidos con sus salvaguardas cibernéticas desactivadas.

El CAISI califica ExploitBench de otra forma que Anthropic, así que los porcentajes no se pueden comparar directamente. Lo que coincide es el orden: ambos ponen a GLM-5.3 en la cima de los modelos abiertos y por debajo de los mejores modelos cerrados.

Lo que los números de un rival no pueden zanjar

Anthropic le vende Claude a los mismos desarrolladores que Zhipu busca atraer con modelos baratos y descargables. The Decoder señala que las conclusiones "también le convienen al negocio de Anthropic" y que su llamado a que los gobiernos hagan pruebas despierta temores de captura regulatoria, aunque agrega que no se trata solo de interés propio. La publicación de Anthropic no menciona ese conflicto. Nada de esto vuelve imaginarios los exploits de GLM-5.3, pero sí significa que alguien sin intereses en juego debería revisar los números.

Otros huecos que conviene conocer:

  • Simulaciones, según la propia Anthropic: la empresa llama a estas pruebas "medidas imperfectas" de las condiciones reales.
  • Pocos detalles del método: la publicación no dice quién fue el investigador de la prueba con Chrome ni cómo se repartieron exactamente los 410 intentos de ExploitBench.
  • Sin respuesta pública: ni la publicación ni la cobertura que leímos incluye una respuesta de Zhipu, al 1 de octubre de 2026.
  • Claude tiene su propio historial: Anthropic ha dicho que algunos de sus modelos llegaron a sistemas reales durante sus pruebas cibernéticas, como contamos en incidentes de seguridad de IA en OpenAI y Anthropic.

Qué sigue

Anthropic quiere que los gobiernos hagan pruebas de seguridad a los modelos capaces, incluidos los sucesores de GLM-5.3, y dice que ampliará el acceso de los defensores a las habilidades cibernéticas de Claude. Pon atención a una respuesta de Zhipu, a nuevas pruebas del CAISI u otros laboratorios de gobierno, y a si el próximo modelo GLM llega con salvaguardas más fuertes.

En resumen

Según la medición de Anthropic, GLM-5.3 construye exploits funcionales casi con la misma frecuencia que Claude Mythos Preview y, como sus pesos son públicos, sus negativas se pueden eliminar por unos cuantos miles de dólares. Una prueba del gobierno de Estados Unidos respalda el panorama general, aunque ubica al modelo unos cuatro meses detrás de la frontera de Estados Unidos. Los números vienen de un competidor directo, así que tómalos como una advertencia seria que hay que verificar, no como un marcador definitivo. Más en nuestra sección de IA.

Preguntas frecuentes

¿Qué es GLM-5.3?

GLM-5.3 es un modelo de lenguaje grande de Zhipu AI, que fuera de China se presenta como Z.ai. El CAISI dice que se lanzó el 14 de agosto de 2026 y que sus pesos quedaron disponibles para descarga dos semanas después. La ficha del modelo de Zhipu destaca sus habilidades de programación y ciberseguridad.

¿GLM-5.3 puede escribir exploits que funcionen?

En las pruebas de Anthropic, sí: completó 50 de 410 intentos de ExploitBench (12%), cerca de los 56 de Claude Mythos Preview. Son mediciones de Anthropic en entornos simulados o de benchmark, y no encontramos ningún comentario público de Zhipu al 1 de octubre de 2026.

¿Qué es la abliteración?

La abliteración es una edición de los pesos descargados de un modelo que elimina su tendencia a negarse. Anthropic dice que redujo la tasa de negativas de GLM-5.3 de más de 90% a entre 2% y 12%, según la prueba, sin afectar mucho sus demás habilidades. Solo funciona con modelos cuyos pesos son públicos.

¿Claude Mythos Preview está disponible para el público?

No. Anthropic lo ofrece de forma limitada a través de Project Glasswing, un programa para defensores de ciberseguridad de confianza, al 1 de octubre de 2026.

Archivado en IA

Boletín

Artículos nuevos, en tu correo.

Gratis. Cancela con un clic. Tu correo lo guarda beehiiv, nuestro servicio de boletines, y solo se usa para este boletín.