Nadella contra OpenAI y Anthropic: «Se entrenan con datos ajenos pero prohíben la destilación»
Satya Nadella ha tomado una posición pública contra OpenAI y Anthropic, precisamente las empresas en las que Microsoft ha invertido miles de millones. En una entrada de blog, el CEO acusa a los laboratorios de IA de aplicar reglas asimétricas: se entrenan libremente con datos públicos invocando el fair use, pero prohíben contractualmente la destilación de sus propios modelos (la práctica de usar los outputs de un modelo para entrenar uno más pequeño o económico). Peor aún: aprenden de las interacciones de los clientes — prompts, correcciones, feedback — acumulando conocimiento propietario de las empresas que usan sus servicios.
Nadella lo llama la «paradoja informativa inversa»: pagas dos veces, con dinero por los tokens y con el conocimiento que revelan cada vez que usas el modelo. «Cada corrección se destila en saber institucional», escribe. Es exactamente el tipo de información que un competidor nunca podría comprar, pero las empresas la están entregando.
Por qué te importa. Si usas modelos propietarios para tareas internas, estás permitiendo implícitamente que los proveedores aprendan de tu trabajo. Nadella sugiere tres movidas: mantener el control de tus propios datos (prompts, feedback, interacciones), construir entornos de aprendizaje propietarios en la nube (sorpresa: Azure es una opción), y adoptar capas de orquestación que te permitan cambiar de proveedor sin reescribir todo. La dirección que se intuye es clara: modelos open source instalados on-premise, donde el ciclo de aprendizaje se mantiene dentro de tus muros. Idit Levine de Solo.io confirma la tendencia: «Los clientes enterprise cada vez preguntan más sobre ejecutar modelos open source on-prem. Hacen el 90% de lo que hace el grande, cuestan menos, y los controlas tú».
En detalle
El contexto: qué había antes
La destilación es una práctica consolidada en ML: usas los outputs de un modelo grande para entrenar uno más pequeño, más rápido o más económico, que imita el comportamiento del primero en una tarea específica. Así nacen muchos modelos open-weight competitivos: parten de outputs de modelos frontier. OpenAI y Anthropic la prohíben explícitamente en los términos de servicio, y en febrero Anthropic acusó públicamente a laboratorios chinos de haber enviado millones de prompts a Claude para mejorar sus propios modelos, pidiendo al gobierno estadounidense controles de exportación más estrictos.
Hasta hoy, la narrativa de los laboratorios era simple: nosotros nos entrenamos con datos públicos por fair use, ustedes no pueden entrenarse con nuestros outputs porque son propiedad intelectual protegida. Nadella lo llama hipocresía: si el fair use vale para raspar la web, debería valer también para aprender de los modelos ajenos.
Qué dice Nadella sobre los datos de los clientes
El punto más duro del post es sobre la «exhaust»: los datos de interacción que las empresas generan usando los modelos. Prompts, correcciones («el modelo falló, la respuesta correcta es esta»), calificaciones, elecciones sobre qué outputs guardar. Nadella sostiene que este es conocimiento empresarial valioso, y que los términos de servicio actuales frecuentemente permiten a los proveedores usarlo para mejorar sus propios modelos, potencialmente construyendo productos competidores con lo que han aprendido de tus casos de uso.
La solución propuesta es predecible para el CEO de un proveedor cloud: mantener los datos y el ciclo de aprendizaje en tu propia nube, con herramientas que permitan cambiar de modelo sin reescribir la integración. Nadella nunca dice «open source», pero el subtexto es claro.
Qué está pasando en el terreno
Los testimonios convergen: muchas empresas ya están migrando hacia modelos open-weight on-premise. Idit Levine, CEO de Solo.io (la tecnología detrás del proyecto Agentgateway de la Linux Foundation), dice que los clientes enterprise — T-Mobile, ADP, SAP — después de la fase de experimentación con modelos propietarios se preguntan: «¿Puedo tomar un modelo open source y ejecutarlo on-prem? Hará el 90% de lo que hace el grande, costará mucho menos, y lo controlaré yo».
Los datos de tráfico lo confirman: Vercel reporta que los modelos open representaron el 29% del tráfico total a través de su gateway el mes pasado. OpenRouter ve el mismo patrón. El impulso no es ideológico: es control de costos, latencia predecible, y sobre todo propiedad del ciclo de aprendizaje.
Los límites de la posición de Nadella
Nadella tiene un conflicto de intereses evidente: Microsoft ha invertido miles de millones en OpenAI, vende Azure como plataforma para IA, y ahora presiona a las empresas para mantener todo en la nube (casualmente, la suya). Su crítica a los laboratorios de IA es genuina, pero la solución propuesta no es neutral: mover todo a Azure sigue siendo delegar a Microsoft parte del control.
Segundo: la destilación no es un derecho simétrico al entrenamiento con datos públicos. Los datos públicos en la web no tienen términos de servicio que los prohíban (el debate es si deberían). Los outputs de un modelo son generados por un sistema que costó miles de millones y que el proveedor vende como servicio pagado. La analogía de Nadella se sostiene en el plano moral («si tú puedes, ¿por qué yo no?»), pero en el plano legal la diferencia existe.
Implicaciones prácticas
Si usas ChatGPT o Claude para trabajo interno, lee los términos sobre qué puede hacer el proveedor con tus interacciones. OpenAI y Anthropic ofrecen opciones enterprise donde los datos no se usan para entrenamiento, pero debes activarlas explícitamente y frecuentemente pagar más.
Si tu caso de uso es repetitivo y bien definido, considera modelos open-weight que puedas ejecutar tú mismo. No por ideología, sino porque el ciclo de aprendizaje se mantiene en casa, los costos son fijos en lugar de por token, y no estás entrenando implícitamente el modelo de otro con tus casos.
Si necesitas la frontera (razonamiento complejo, tareas nunca vistas), los modelos propietarios siguen adelante. Pero usa capas de orquestación (gateway, router) que te permitan cambiar de proveedor sin reescribir todo. Las herramientas existen: Vercel AI SDK, OpenRouter, LangChain con abstracciones sobre proveedores. No te ates a una sola API.