Radar · 05/07/2026 · fatto del 28/06/2026 · sicurezza

GLM 5.2 batte Claude nei benchmark di Semgrep sulla cybersecurity

Semgrep ha testato GLM 5.2, un modello open-weight di Zhipu AI, sul proprio benchmark interno per il rilevamento di vulnerabilità IDOR (Insecure Direct Object Reference, problemi di controllo accessi). Il modello ha raggiunto un F1 score del 39%, battendo Claude Code (32%) e anche Claude Opus 4.8, con un costo di circa $0.17 per vulnerabilità trovata. Il test usava solo un prompt diretto, senza l’infrastruttura (harness) che normalmente accompagna questi sistemi in produzione.

Perché ti riguarda: questa è la prima volta che un modello open-weight batte un modello frontier proprietario su un task di sicurezza verticale, in condizioni controllate. Se lavori con l’AI per analisi di codice, automazione di security review o triage di vulnerabilità, significa che le opzioni open-weight stanno diventando competitive anche su compiti specialistici, non solo su benchmark generici. Puoi ospitarle in casa, controllarle, e pagarle meno — senza sacrificare troppo in accuratezza rispetto ai modelli chiusi.

La pipeline multimodale di Semgrep (che combina modello e harness costruito ad hoc) arriva comunque al 53–61% F1, quindi il contorno conta ancora. Ma il gap si sta chiudendo, e per chi costruisce strumenti interni di sicurezza automatizzata, avere un modello performante che puoi self-hostare cambia le carte in tavola.

Dove guardare: il post di Semgrep spiega come hanno strutturato il benchmark e cosa fa la loro pipeline multimodale. Se vuoi replicare il test o capire come costruire un harness simile per i tuoi task di security, quella è la fonte primaria.

Scrivi per cercare fra corso, playbook, skill, paper…