Radar · 05/07/2026 · ocurrido el 28/06/2026 · seguridad

GLM 5.2 supera Claude en los benchmark de Semgrep sobre ciberseguridad

Semgrep ha probado GLM 5.2, un modelo open-weight de Zhipu AI, en su benchmark interno para la detección de vulnerabilidades IDOR (Insecure Direct Object Reference, problemas de control de acceso). El modelo alcanzó un F1 score del 39%, superando a Claude Code (32%) e incluso a Claude Opus 4.8, con un costo de aproximadamente $0,17 por vulnerabilidad encontrada. El test usaba solo un prompt directo, sin la infraestructura (harness) que normalmente acompaña estos sistemas en producción.

Por qué te afecta: esta es la primera vez que un modelo open-weight vence a un modelo frontier propietario en una tarea de seguridad vertical, en condiciones controladas. Si trabajas con IA para análisis de código, automatización de revisiones de seguridad o triage de vulnerabilidades, significa que las opciones open-weight se están volviendo competitivas incluso en tareas especializadas, no solo en benchmark genéricos. Puedes alojarlas localmente, controlarlas y pagarlas menos — sin sacrificar demasiada precisión frente a los modelos cerrados.

La pipeline multimodal de Semgrep (que combina modelo e harness construido a medida) llega en cualquier caso al 53–61% F1, así que el contexto sigue importando. Pero la brecha se está cerrando, y para quien construye herramientas internas de seguridad automatizada, tener un modelo performante que puedas self-hostear cambia las reglas del juego.

Dónde mirar: el post de Semgrep explica cómo estructuraron el benchmark y qué hace su pipeline multimodal. Si quieres replicar el test o entender cómo construir un harness similar para tus tareas de seguridad, esa es la fuente primaria.

Escribe para buscar en curso, playbooks, skills, papers…