Agentes y retrieval más allá de la relevancia: el documento que importa es el que cambia la respuesta
Un paper publicado en HF Daily Papers aborda un problema concreto del retrieval: cuando un agente IA consume los documentos, lo que determina la calidad de la respuesta es cómo funciona el conjunto de documentos recuperados. Los sistemas de evaluación actuales puntúan cada documento de forma aislada con métricas como nDCG y luego suman los resultados. Ignoran las interacciones entre documentos: dos textos pueden ser relevantes pero redundantes entre sí, pueden contradecirse, o uno puede completar al otro. Una evaluación documento por documento no lo ve.
Por qué te importa
Si construyes sistemas RAG o agentes de búsqueda, la respuesta que obtienes depende del conjunto de documentos que termina en el contexto del modelo. El paper lo mide: 12 rerankers probados en un benchmark de nueve dimensiones y alrededor de 28.000 rúbricas, y el mejor apenas alcanza el 45% de cobertura en las dimensiones de coordinación entre documentos. El método que proponen, Rubric4Setwise, convierte los criterios de evaluación en señales de selección del conjunto y obtiene las mejores respuestas con menos documentos y menos iteraciones de búsqueda.
Esto se conecta con el hilo que venimos siguiendo: como contábamos el 20 de julio, tres papers convergían en la idea de que en sistemas agentivos la arquitectura importa más que el modelo. La calidad del retrieval es una parte de esa arquitectura.
En detalle
El problema es concreto y lo reconoce cualquiera que haya construido un sistema RAG en la vida real. Recuperas diez documentos con una búsqueda semántica, los pasas a un reranker que los ordena por relevancia individual, y se los das al modelo. Tres documentos dicen lo mismo de forma ligeramente diferente, dos se contradicen, y el fragmento de información que realmente necesitabas está en sexto lugar con una puntuación más baja.
La métrica estándar, nDCG, mide cuántos documentos relevantes están en la parte superior de la lista. Trata cada documento como una isla. Si dos documentos son ambos relevantes al 90% y dicen lo mismo, nDCG los premia a ambos. El agente que los recibe tiene un contexto repetitivo sin información nueva.
El paper construye SetwiseEvalKit, un benchmark con tres niveles y nueve dimensiones de evaluación, cubriendo escenarios de corto y largo formato, con alrededor de 28.000 rúbricas. Las dimensiones miden cosas que nDCG ignora: redundancia (cuánto se repiten los documentos), conflicto (cuando se contradicen), complementariedad (cuando se completan mutuamente), cobertura (cuánta información necesaria está presente en el conjunto).
Los resultados de las pruebas en 12 rerankers son claros. El mejor alcanza como máximo el 45% de cobertura en las dimensiones de coordinación entre documentos. Ningún método mantiene el mejor rendimiento en ambos escenarios (corto y largo formato). Las dimensiones cross-documento son débiles en todos lados.
La propuesta operativa se llama Rubric4Setwise. Es un método sin entrenamiento que toma los criterios de evaluación de las rúbricas y los convierte en señales para seleccionar el conjunto de documentos, no el individual. El resultado: las mejores respuestas posteriores con menos documentos y menos iteraciones de búsqueda. Es el único método que mantiene resultados de última generación en ambos escenarios.
Cuánta confianza depositar
El paper se basa en el resumen y la página de Hugging Face: el texto completo no era accesible en el momento de la recopilación. Los números (12 rerankers, 45% de cobertura, 28.000 rúbricas) provienen del resumen y no son verificables de forma independiente. Un comentario señala la ausencia de rerankers pointwise en las pruebas, y los autores responden que los clasificaron bajo “Adhoc Reranking”. Queda abierta la pregunta central: ¿las dimensiones de evaluación (redundancia, conflicto, complementariedad) son estables entre dominios diferentes, o necesitan recalibrarse para cada caso de uso? La definición de “buen conjunto de documentos” cambia mucho entre una auditoría legal y una búsqueda de código.
Para quien quiera profundizar en los fundamentos del retrieval aumentado, el paper original sobre RAG sigue siendo el punto de partida.