Opus 5 es el modelo menos vulnerable a inyección de prompts: cero ataques exitosos en 129 escenarios
Boris Cherny de Anthropic ha reportado que Opus 5 es el modelo menos vulnerable a inyección de prompts jamás producido por Anthropic. Los datos están en la system card, página 73: en 129 escenarios de prueba para agentes browser, la tasa de éxito de los ataques cae a cero con Auto Mode activo. Sin Auto Mode, se mantiene en 3,7%.
Por qué te importa. Si usas agentes que leen contenido externo, páginas web, documentos, emails, la inyección de prompts indirecta es el riesgo de que un texto manipulado dé órdenes a tu agente sin que lo sepas. Es la vulnerabilidad que examinamos en el paper sobre inyección de prompts indirecta: un documento aparentemente inofensivo contiene instrucciones ocultas que secuestran el comportamiento del modelo. Hasta ahora ningún modelo había logrado resistir de forma fiable.
Los números. El benchmark Gray Swan IPI muestra una tasa de éxito de ataques del 2,0% tras 15 intentos, frente al 5,5% de Opus 4.8. Auto Mode añade dos capas de defensa en Claude Cowork: una escanea los datos de entrada en busca de instrucciones ocultas, la otra bloquea las acciones peligrosas antes de ejecutarse. Un atacante debe superar ambas independientemente.
OpenAI admitió en diciembre que la inyección de prompts podría nunca resolverse completamente. Los números de Opus 5 sugieren que, al menos con defensas de software adicionales, se puede llevar el riesgo casi a cero.
En detalle
La inyección de prompts indirecta funciona así: un agente IA lee un documento o página web que contiene texto manipulado. Ese texto, oculto en el cuerpo del contenido, contiene instrucciones que el modelo interpreta como comandos legítimos. El resultado es que el agente ejecuta acciones no solicitadas por el usuario: elimina archivos, envía emails, descarga malware. El problema es estructural: el modelo no puede distinguir de forma fiable entre “instrucciones del usuario” y “texto que estoy leyendo”, porque ambos son solo texto en la misma ventana de contexto.
Qué cambia con Opus 5. La mejora tiene dos componentes. El primero es a nivel de modelo: Opus 5 resiste mejor a la inyección de prompts incluso sin defensas externas. El benchmark Gray Swan IPI, que mide la tasa de éxito de ataques tras 15 intentos, cae del 5,5% de Opus 4.8 al 2,0%. En 129 escenarios de prueba para agentes browser, la tasa cae al 3,7% sin protecciones adicionales.
El segundo componente es Auto Mode, disponible en productos Anthropic como Claude Cowork. Auto Mode añade dos capas de defensa de software sobre el modelo. La primera escanea los datos de entrada en busca de instrucciones ocultas antes de que el modelo los procese. La segunda bloquea acciones peligrosas antes de que se ejecuten. Un ataque debe superar ambas capas independientemente: si la primera intercepta la instrucción oculta, el modelo nunca la procesa; si la primera falla, la segunda aún puede detener la acción antes de iniciarse. La combinación de modelo mejorado y defensas de software lleva la tasa de éxito a cero en los 129 escenarios probados.
Los límites de lo que sabemos. La tasa cero se obtiene con Auto Mode activo, que es una función de productos Anthropic, no del modelo desnudo. Sin Auto Mode, el 3,7% de los ataques tiene éxito. Los 129 escenarios de prueba se refieren a agentes browser: otros tipos de agentes, como los que leen archivos locales o procesan emails, podrían tener perfiles de vulnerabilidad diferentes. Y las pruebas, por significativas que sean, no cubren todos los vectores de ataque posibles.
OpenAI declaró en diciembre 2025 que la inyección de prompts podría nunca resolverse completamente a nivel de modelo. Los números de Opus 5 sugieren que el problema puede reducirse drásticamente, pero requiere capas de defensa de software adicionales sobre el modelo. Quienes construyen agentes con modelos distintos a Opus 5, o sin capas de protección equivalentes a Auto Mode, quedan expuestos. La vulnerabilidad que examinamos en el paper sobre inyección de prompts indirecta sigue siendo actual para la mayoría de agentes en producción hoy.