Papers / 073

El espejismo de la personalización: cuando la IA inventa quién eres

lectura: 6 minpara: tutti, builderpdf ↗arXiv ↗
PAPER ORIGINAL“The Personalization Mirage: How LLMs Fabricate User Profiles, and Why Self-Monitoring Misleads”

Abres ChatGPT, le pides un restaurante para esta noche, y te sugiere un lugar vegano. El problema es que nunca le dijiste que eres vegetariano. Infirió, de alguna conversación anterior, que lo eras. Y decidió tratarlo como un hecho.

Te acuerdas de que en marzo le pediste una receta sin carne. Desde entonces el modelo construyó un perfil: eres vegetariano. Quizás lo seas, quizás no. Quizás tenías invitados vegetarianos a cenar. Para el modelo la distinción no importa: acumula atributos y los trata como certeros.

Este fenómeno tiene un nombre en el paper de Yushi Sun y colegas de HKUST: sobre-inferencia, la inferencia más allá de las pruebas. El modelo toma una señal débil y la promueve a hecho establecido.

Por qué te importa

Si usas asistentes con memoria persistente, y ya casi todos la tienen, el problema te afecta directamente. ChatGPT Memory, Claude Projects, Gemini con contexto guardado: todos construyen un perfil tuyo basado en lo que les has dicho con el tiempo.

El perfil es útil. Te evita repetir el contexto cada vez, hace las respuestas más relevantes, acelera el trabajo. Pero si el perfil contiene un 40% de atributos inventados, la personalización se convierte en una fuente de error sistemático. El modelo te sirve respuestas basadas en lo que cree saber, y tú no tienes forma de distinguir la parte real de la inventada.

Para quienes construyen agentes con memoria, la cuestión es aún más concreta. Si tu agente personaliza respuestas en base a un perfil de usuario que se actualiza automáticamente, y ese perfil contiene un 40% de invenciones, estás sirviendo respuestas incorrectas en el 40% de los casos sin que nadie se dé cuenta.

Qué dice el paper

Los investigadores construyeron MirageBench, un banco de prueba con 150 personas ficticias equilibradas en tres grupos: perfiles estereotípicos (un desarrollador que vive de café), contra-estereotípicos (un desarrollador que solo bebe infusiones) y neutrales. Seis tareas de personalización, desde lo concreto (“recomienda un producto basándote en el perfil”) hasta lo especulativo (“imagina qué diría esta persona en cierta situación”), dispuestas a lo largo de un gradiente de imaginación.

Ejecutaron 12 modelos de 7 familias distintas. El juez es un modelo externo independiente, validado contra un anotador humano a ciegas en 400 afirmaciones: kappa de Cohen a cuatro clases de 0,863, binario de 0,900. Se evaluaron 143.616 afirmaciones en total.

Los números clave:

  • Sobre-inferencia generalizada. Cada modelo, sin excepción, sobre-infiere entre el 35% y el 49% de sus afirmaciones sobre el perfil del usuario. El promedio entre modelos es 41,6%.
  • Inversión de la Auto-Monitorización. Los modelos que se autoevalúan diciendo “soy cuidadoso, no invento” son precisamente los que más inventan. La correlación negativa entre autoevaluación y realidad medida por el juez es fuerte (rho = -0,60), aunque los autores la definen como exploratoria dado el tamaño reducido de la muestra.
  • Auto-auditoría interna funciona, comparativa no. Dentro de un modelo individual, la auto-evaluación ordena bastante bien sus propias afirmaciones de más a menos confiables (AUROC entre 0,58 y 0,83). Pero si usas la auto-evaluación para comparar dos modelos y elegir el más confiable, la señal se invierte.
  • Dependencia de la tarea. La sobre-inferencia varía entre el 27% y el 59% según la tarea. Algunos tipos de tarea generan más imaginación que otros.
  • Acumulación lineal. En una prueba multi-turno piloto, los atributos inventados se acumulan de modo aproximadamente lineal, con poca revisión. El modelo no vuelve atrás a corregir una suposición infundada: la agrega al perfil y construye sobre ella.

Cuánta confianza depositar

El paper declara sus limitaciones con honestidad, y algunas son importantes.

La Inversión de la Auto-Monitorización es el resultado más llamativo, pero los autores la etiquetan como exploratoria. La muestra es de 12 modelos, y el intervalo de confianza bootstrap es muy amplio ([-0,90, +0,06]). La correlación negativa existe, pero la certeza estadística no es sólida.

La prueba multi-turno es un piloto, no un estudio completo. La acumulación lineal con poca revisión es una señal preocupante, pero necesita confirmarse a mayor escala.

El juez automático está validado contra un único anotador humano en 400 afirmaciones. El kappa es alto, pero un anotador es una muestra delgada para medir el acuerdo.

Los 12 modelos de 7 familias cubren el panorama actual, pero el abstract no los lista por nombre. Si falta un modelo que uses, el resultado podría no aplicarse a ese.

Trabajo sobre el abstract: el paper se publicó el 5 de agosto en arXiv y Hugging Face, y en este caso pude leer el abstract y metadatos, no el texto completo.

Qué hacer con esto

La lección práctica es directa: no confíes en la auto-evaluación del modelo para elegir qué modelo usar. Si le preguntas a un modelo “qué tan confiable eres construyendo perfiles de usuario?”, la respuesta no te dice lo que necesitas saber. Los modelos más seguros de sí mismos son, en esta prueba, los que más se equivocan.

Para quienes usan asistentes con memoria:

  • Trata el perfil del usuario como un borrador, no como un dossier de hechos. Si el asistente ha guardado un perfil sobre ti, léelo de vez en cuando. ChatGPT te lo muestra: ve a Settings, Memory, y verifica qué ha deducido. Encontrarás atributos correctos, otros no, otros que nunca mencionaste.
  • Verifica la personalización con preguntas de control. Si el modelo te sugiere algo “porque sabes que prefieres X”, pregúntate si alguna vez se lo dijiste de verdad.

Para quienes construyen agentes con memoria:

  • Pon la verificación externa en el flujo. Si tu agente construye perfiles, una verificación externa (un segundo modelo, un conjunto de reglas, una muestra humana) es más confiable que la auto-monitorización. El paper lo deja claro: la verificación externa supera al auto-reporte como base para una personalización en la que se pueda confiar.
  • No des por sentado que la memoria mejora con el tiempo. El piloto multi-turno muestra acumulación lineal sin revisión. Como contábamos el 5 de agosto en el radar sobre benchmarks convergentes en agentes, la pregunta de si un agente que recuerda también aprende encuentra aquí un primer elemento de respuesta: acumula, no corrige.

Qué NO concluir. El paper no dice que la personalización no funciona. No dice que la memoria persistente es inútil. Dice que la confianza en el perfil debe ganarse con verificación, no darse por sentada porque el modelo dice saber hacerlo.

Dónde profundizar

Escribe para buscar en curso, playbooks, skills, papers…