Radar · 18/07/2026 · ocurrido el 16/07/2026 · seguridad

GPT-5.6 en Codex borra el directorio home: el bug del agente sin sandbox

OpenAI ha confirmado que GPT-5.6, utilizado en Codex sin protecciones de sandbox, puede eliminar archivos de forma inesperada. Thibault Sottiaux reconstruyó el mecanismo: el agente intenta sobrescribir la variable $HOME para crear un directorio temporal, se equivoca de ruta y elimina $HOME. Sucede cuando el modo full access está activo y el sandboxing está deshabilitado.

Te afecta si delegas el coding a un agente en producción. Este es el daño concreto que la falta de aislamiento produce cuando el modelo comete un error de ruta. Como contamos con el data breach de Grok Build, un agente con demasiado acceso puede causar desastres reales en segundos. La diferencia entre un agente útil y uno peligroso no está en el modelo, está en qué le permites tocar. El sandboxing no es un opcional para quien tiene prisa: es lo que separa un error trivial de escritura de la pérdida permanente de tus datos de trabajo.

En detalle

Codex es el agente de coding empresarial de OpenAI, que creció hasta aproximadamente 1M de usuarios diarios después de la integración con GPT-5.6. Cuantos más agentes trabajan en producción sobre bases de código reales, más aumenta el riesgo de incidentes operativos. Esto significa que gestionar la delegación técnica requiere ahora la misma atención que dedicaríamos a un colaborador humano inexperto con demasiados permisos de sistema.

El bug tiene una dinámica simple. El agente necesita un directorio temporal para escribir archivos de trabajo durante su ejecución. En lugar de usar una ruta dedicada y segura, intenta reasignar $HOME (la variable que apunta al directorio personal del usuario) a una ruta temporal para sus propósitos. Si el modo full access está activo y no hay sandbox que detenga el comando, la operación se ejecuta pero elimina todo lo que encuentra en $HOME. El modelo no tiene intenciones maliciosas, solo sigue una lógica incorrecta sin obstáculos.

Sottiaux lo define como un honest mistake: no es malicia, es un error de razonamiento en una operación destructiva. El punto fundamental para quien construye flujos automatizados es que un error honesto es suficiente, si el agente tiene permisos para causar daños irreparables.

OpenAI recomienda dos protecciones: mantener el sandboxing activo y habilitar la auto-review, el paso en el que el sistema verifica las acciones del agente antes de ejecutarlas en el disco. Quienes las deshabilitaron para ganar velocidad de ejecución perdieron sus archivos.

Esto se inserta en una línea que atraviesa todo el sector: Claude Code tuvo un incidente de seguridad el 5 de julio, Grok Build subió directorios enteros sin consentimiento, y la solución converge en todas partes hacia la misma idea, argumentada también por Martin Fowler: limitar el dominio de acción del agente. Cuanto más puede hacer libremente el agente, más un error honesto se convierte en catastrófico rápidamente. Herramientas como Clawk, que aíslan los agentes en máquinas virtuales desechables, existen precisamente por esto.

Cuánto confiar: la confirmación viene de OpenAI a través de Thibault Sottiaux, el 16 de julio de 2026. No es un caso aislado: OpenAI declaró haber investigado “un puñado de reportes”. El bug parece circunscrito a configuraciones específicas (full access sin sandbox), pero quienes usan Codex en producción deberían verificar su configuración ahora, antes del próximo inicio.

Escribe para buscar en curso, playbooks, skills, papers…