Opus 5 est le modèle le moins vulnérable à l'injection de prompt : zéro attaques réussies sur 129 scénarios
Boris Cherny d’Anthropic a signalé qu’Opus 5 est le modèle le moins vulnérable à l’injection de prompt jamais produit par Anthropic. Les données se trouvent dans la system card, page 73 : sur 129 scénarios de test pour les agents navigateur, le taux de succès des attaques tombe à zéro avec Auto Mode activé. Sans Auto Mode, il reste à 3,7%.
Pourquoi cela te concerne. Si tu utilises des agents qui lisent du contenu externe, des pages web, des documents, des emails, l’injection de prompt indirecte est le risque qu’un texte manipulé donne des ordres à ton agent sans que tu le saches. C’est la vulnérabilité que nous avons examinée dans le paper sur l’injection de prompt indirecte : un document apparemment anodin contient des instructions cachées qui détournent le comportement du modèle. Jusqu’à présent, aucun modèle n’avait vraiment réussi à y résister de manière fiable.
Les chiffres. Le benchmark Gray Swan IPI montre un taux de succès des attaques de 2,0% après 15 tentatives, contre 5,5% pour Opus 4.8. Auto Mode ajoute deux couches de défense dans Claude Cowork : l’une analyse les données entrantes à la recherche d’instructions cachées, l’autre bloque les actions dangereuses avant leur exécution. Un attaquant doit franchir les deux indépendamment.
OpenAI a admis en décembre que l’injection de prompt pourrait ne jamais être complètement résoluble. Les chiffres d’Opus 5 suggèrent que, au moins avec des défenses logicielles supplémentaires, on peut réduire le risque proche de zéro.
En détail
L’injection de prompt indirecte fonctionne ainsi : un agent IA lit un document ou une page web contenant du texte manipulé. Ce texte, caché dans le corps du contenu, contient des instructions que le modèle interprète comme des commandes légitimes. Le résultat est que l’agent exécute des actions non demandées par l’utilisateur : supprime des fichiers, envoie des emails, télécharge des malwares. Le problème est structurel : le modèle ne peut pas distinguer de manière fiable entre « instructions de l’utilisateur » et « texte que je lis », car ce sont les deux du texte dans la même fenêtre de contexte.
Ce qui change avec Opus 5. L’amélioration a deux composantes. La première se fait au niveau du modèle : Opus 5 résiste mieux à l’injection de prompt même sans défenses externes. Le benchmark Gray Swan IPI, qui mesure le taux de succès des attaques après 15 tentatives, baisse de 5,5% pour Opus 4.8 à 2,0%. Sur 129 scénarios de test pour agents navigateur, le taux baisse à 3,7% sans protections supplémentaires.
La deuxième composante est Auto Mode, disponible dans les produits Anthropic comme Claude Cowork. Auto Mode ajoute deux couches de défense logicielles au-dessus du modèle. La première analyse les données entrantes à la recherche d’instructions cachées avant que le modèle ne les traite. La deuxième bloque les actions dangereuses avant qu’elles ne s’exécutent. Une attaque doit franchir les deux couches indépendamment : si la première intercepte l’instruction cachée, le modèle ne la traite jamais ; si la première échoue, la deuxième peut toujours arrêter l’action avant son lancement. La combinaison du modèle amélioré et des défenses logicielles ramène le taux de succès à zéro dans les 129 scénarios testés.
Les limites de ce qu’on sait. Le taux zéro s’obtient avec Auto Mode activé, qui est une fonction des produits Anthropic, et non du modèle brut. Sans Auto Mode, 3,7% des attaques réussissent. Les 129 scénarios de test concernent les agents navigateur : d’autres types d’agents, comme ceux qui lisent des fichiers locaux ou traitent des emails, pourraient avoir des profils de vulnérabilité différents. Et les tests, si significatifs soient-ils, ne couvrent pas tous les vecteurs d’attaque possibles.
OpenAI a déclaré en décembre 2025 que l’injection de prompt pourrait ne jamais être complètement résoluble au niveau du modèle. Les chiffres d’Opus 5 suggèrent que le problème peut être drastiquement réduit, mais cela nécessite des défenses logicielles supplémentaires au-dessus du modèle. Ceux qui construisent des agents avec des modèles autres qu’Opus 5, ou sans couches de protection équivalentes à Auto Mode, restent exposés. La vulnérabilité que nous avons examinée dans le paper sur l’injection de prompt indirecte reste d’actualité pour la plupart des agents en production aujourd’hui.