Claude Code Auto Mode se convierte en predeterminado: el clasificador supera al revisor humano
Desde el 14 de agosto Claude Code activa Auto Mode por defecto en los planes Pro, Max y Team. El agente deja de pedir confirmación en cada paso y se detiene solo cuando un clasificador interno evalúa la acción como peligrosa o irreversible. Los clientes Enterprise aún deben activarlo manualmente.
Por qué te afecta. Los números invierten la intuición. En un estudio controlado con 1.053 probadores, los revisores humanos interceptaron el 13,6% de los comandos peligrosos. El clasificador de Auto Mode capturó el 89%. Los equipos con Auto Mode activo produjeron aproximadamente un 25% más de pull requests, porque el agente no se detiene esperando un clic.
Un audit independiente de Trajectory Labs probó 72 escenarios de prompt injection, diez veces cada uno. De 720 intentos contra los modelos Claude en Auto Mode, cero pasaron. En GPT-5.6 Sol en Codex Auto-Review, el 5,83% tuvo éxito.
Anthropic aún recomienda revisión manual para cambios en la infraestructura de producción. El clasificador reduce el riesgo, no lo elimina.
Este es el capítulo con números concretos de un anuncio que anticipamos en julio. Cierra una semana de lanzamientos en Claude Code (credential masking, aislamiento de sesiones, cross-session messaging, spend-limit) que convierte la herramienta de chat versátil a runtime de producción. La gobernanza se traslada de lo manual a lo automático.
En detalle
Auto Mode existe hace tiempo como opción. El agente trabaja solo y un clasificador evalúa cada acción antes de ejecutarla. Si la acción es segura y reversible, procede. Si es peligrosa o irreversible, pide confirmación. Hasta ahora el predeterminado era el enfoque manual: Claude Code se detenía en cada paso y esperaba tu clic.
El cambio de predeterminado desde el 14 de agosto se basa en dos evidencias.
La primera es interna. Anthropic realizó un estudio controlado con 1.053 probadores pagados más red-teaming interno. Los revisores humanos que aprobaban manualmente interceptaron el 13,6% de los comandos peligrosos. El clasificador de Auto Mode interceptó el 89%. Los equipos con Auto Mode activo generaron aproximadamente un 25% más de pull requests, porque el agente no se detiene esperando.
La segunda es externa. Trajectory Labs, una empresa de seguridad independiente, probó 72 escenarios de prompt injection, diez veces cada uno. Los modelos Claude (Fable 5, Opus 5, Sonnet 5) en Auto Mode bloquearon los 720 intentos. GPT-5.6 Sol en Codex Auto-Review dejó pasar el 5,83% de los ataques.
Dos anécdotas operativas de Anthropic: durante una sesión larga, Auto Mode detuvo a Claude de cargar datos confidenciales en una página pública. En otra, terminó aproximadamente 2.000 procesos que habrían interrumpido trabajos de entrenamiento en GPU en curso.
La paradoja que Anthropic reconoce. Cuanto menos interviene el developer, más cuenta su supervisión cuando lo hace. Pero construir una comprensión profunda de un proyecto generado en gran medida por Auto Mode sin participación humana se vuelve más difícil. Anthropic lo escribe explícitamente: para cambios en la infraestructura de producción, la revisión manual sigue siendo la recomendación.
Los límites. Los números provienen de pruebas de Anthropic, con muestra y metodología elegidas por la misma empresa que vende el producto. El audit de Trajectory Labs es independiente pero cubre solo prompt injection, no otros vectores. Auto Mode no está disponible en Amazon Bedrock, Google Cloud Agent Platform o Microsoft Foundry: quienes pasen por esos canales no se benefician. El clasificador consume tokens, pero Anthropic no los cobra.
Qué significa para quienes construyen. La gobernanza efectiva no se obtiene con reglas escritas que el modelo puede ignorar (lo medimos: los modelos frontier siguen las policy documents menos de cuatro veces de diez). Se obtiene con un clasificador que mira la acción antes de que arranque. Es el mismo principio de las temporal policies y los rate limits de AgentCore: un control ejecutable, no una policy document.
Si quieres dar herramientas y límites a tu agente, el curso sobre herramientas y sus límites es el punto de partida: decidir qué puede hacer el agente, qué no, y cómo interceptar el límite antes de cruzarlo.