Radar · 25/07/2026 · fatto del 24/07/2026 · sicurezza

Opus 5 è il modello meno vulnerabile alla prompt injection: zero attacchi riusciti su 129 scenari

Boris Cherny di Anthropic ha segnalato che Opus 5 è il modello meno vulnerabile alla prompt injection mai prodotto da Anthropic. I dati sono nella system card, a pagina 73: su 129 scenari di test per agenti browser, il tasso di successo degli attacchi scende a zero con Auto Mode attivo. Senza Auto Mode, resta al 3,7%.

Perché ti riguarda. Se usi agenti che leggono contenuti esterni, pagine web, documenti, email, la prompt injection indiretta è il rischio che un testo manipolato dia ordini al tuo agente senza che tu lo sappia. È la vulnerabilità che abbiamo esaminato nel paper sulla prompt injection indiretta: un documento apparentemente innocuo contiene istruzioni nascoste che dirottano il comportamento del modello. Finora nessun modello era riuscito a resistere in modo affidabile.

I numeri. Il benchmark Gray Swan IPI mostra un tasso di successo degli attacchi del 2,0% dopo 15 tentativi, contro il 5,5% di Opus 4.8. Auto Mode aggiunge due strati di difesa in Claude Cowork: uno scansiona i dati in ingresso per istruzioni nascoste, l’altro blocca le azioni pericolose prima dell’esecuzione. Un attaccante deve superare entrambi indipendentemente.

OpenAI ha ammesso a dicembre che la prompt injection potrebbe non essere mai risolvibile del tutto. I numeri di Opus 5 suggeriscono che, almeno con difese software aggiuntive, si può spingere il rischio vicino allo zero.

Nel dettaglio

La prompt injection indiretta funziona così: un agente AI legge un documento o una pagina web che contiene testo manipolato. Quel testo, nascosto nel corpo del contenuto, contiene istruzioni che il modello interpreta come comandi legittimi. Il risultato è che l’agente esegue azioni non richieste dall’utente: cancella file, invia email, scarica malware. Il problema è strutturale: il modello non può distinguere in modo affidabile tra “istruzioni dell’utente” e “testo che sto leggendo”, perché entrambi sono solo testo nella stessa finestra di contesto.

Cosa cambia con Opus 5. Il miglioramento ha due componenti. La prima è a livello di modello: Opus 5 resiste meglio alla prompt injection anche senza difese esterne. Il benchmark Gray Swan IPI, che misura il tasso di successo degli attacchi dopo 15 tentativi, scende dal 5,5% di Opus 4.8 al 2,0%. Su 129 scenari di test per agenti browser, il tasso scende al 3,7% senza protezioni aggiuntive.

La seconda componente è Auto Mode, disponibile nei prodotti Anthropic come Claude Cowork. Auto Mode aggiunge due strati di difesa software sopra il modello. Il primo scansiona i dati in ingresso alla ricerca di istruzioni nascoste prima che il modello li elabori. Il secondo blocca le azioni pericolose prima che vengano eseguite. Un attacco deve superare entrambi gli strati indipendentemente: se il primo intercetta l’istruzione nascosta, il modello non la processa mai; se il primo fallisce, il secondo può ancora fermare l’azione prima che parta. La combinazione di modello migliorato e difese software porta il tasso di successo a zero nei 129 scenari testati.

I limiti di quello che si sa. Il tasso zero si ottiene con Auto Mode attivo, che è una funzione dei prodotti Anthropic, non del modello nudo. Senza Auto Mode, il 3,7% degli attacchi ha successo. I 129 scenari di test riguardano agenti browser: altri tipi di agenti, come quelli che leggono file locali o processano email, potrebbero avere profili di vulnerabilità diversi. E i test, per quanto significativi, non coprono tutti i vettori di attacco possibili.

OpenAI ha dichiarato a dicembre 2025 che la prompt injection potrebbe non essere mai risolvibile del tutto a livello di modello. I numeri di Opus 5 suggeriscono che il problema si può ridurre drasticamente, ma richiede difese software aggiuntive sopra il modello. Chi costruisce agenti con modelli diversi da Opus 5, o senza strati di protezione equivalenti ad Auto Mode, resta esposto. La vulnerabilità che abbiamo esaminato nel paper sulla prompt injection indiretta resta attuale per la maggior parte degli agenti in produzione oggi.

Scrivi per cercare fra corso, playbook, skill, paper…