Radar · 05/07/2026 · survenu le 28/06/2026 · sécurité

GLM 5.2 surpasse Claude dans les benchmarks de Semgrep sur la cybersécurité

Semgrep a testé GLM 5.2, un modèle open-weight de Zhipu AI, sur son benchmark interne pour la détection de vulnérabilités IDOR (Insecure Direct Object Reference, problèmes de contrôle d’accès). Le modèle a atteint un score F1 de 39%, surpassant Claude Code (32%) et même Claude Opus 4.8, avec un coût d’environ $0,17 par vulnérabilité trouvée. Le test utilisait uniquement une invite directe, sans l’infrastructure (harness) qui accompagne normalement ces systèmes en production.

Pourquoi c’est important pour toi : c’est la première fois qu’un modèle open-weight dépasse un modèle frontier propriétaire sur une tâche de sécurité verticale, dans des conditions contrôlées. Si tu travailles avec l’IA pour l’analyse de code, l’automatisation des revues de sécurité ou le triage des vulnérabilités, cela signifie que les options open-weight deviennent compétitives même sur des tâches spécialisées, pas seulement sur les benchmarks génériques. Tu peux les héberger en interne, les contrôler, et les payer moins — sans sacrifier trop en précision par rapport aux modèles fermés.

La pipeline multimodale de Semgrep (qui combine le modèle et un harness construit sur mesure) atteint néanmoins 53–61% F1, donc le contexte compte toujours. Mais l’écart se réduit, et pour ceux qui construisent des outils internes d’automatisation de sécurité, disposer d’un modèle performant que tu peux auto-héberger change la donne.

Où chercher : le post de Semgrep explique comment ils ont structuré le benchmark et ce que fait leur pipeline multimodale. Si tu veux reproduire le test ou comprendre comment construire un harness similaire pour tes tâches de sécurité, c’est la source primaire.

Tapez pour chercher dans cours, playbooks, skills, papers…