FinanceComplexQA: el benchmark que mide agentes en documentos financieros reales
FinanceComplexQA es un benchmark open-ended para evaluar cómo se desempeñan los agentes de IA y los sistemas RAG en documentos financieros industriales. Los investigadores generaron 2.000 documentos profesionales con un sistema llamado Finance-LaTeX SKILL, que produce layouts complejos (tablas anidadas, notas al pie, referencias cruzadas) a partir de conocimiento experto. En esos documentos hay 2.026 tareas de deep research con 6.000 pares pregunta-respuesta.
El ángulo para quien usa IA en su campo es la varianza entre agentes. El paper confirma lo que ya sabe quien intentó hacer que un asistente lea balances o prospectos: algunos agentes fallan en cálculos numéricos, otros pierden el hilo en el razonamiento multi-hop (donde debes conectar información dispersa en páginas diferentes), otros resumen bien pero se pierden el análisis de contexto. El benchmark lo mide de forma sistemática, con un Agent-as-a-Judge que evalúa las respuestas abiertas sobre métricas múltiples en lugar de buscar una coincidencia exacta con una respuesta modelo.
Por qué te importa: si estás pensando en que la IA lea documentos de tu sector, este trabajo te dice dónde mirar para entender si el agente que elegiste aguanta. Los documentos tienen las mismas características que rompen la extracción en la vida real.
Como contábamos el 23 de julio con DocOps, medir agentes en documentos es el vacío que SWE-bench (creado para código) no cubría. FinanceComplexQA desciende en lo vertical: mismo principio, dominio específico.
En detalle
El contexto: los benchmarks para agentes se multiplicaron en el último año, pero la mayoría cubre código (SWE-bench y derivados) o tareas generalistas (GAIA). Los documentos financieros son un dominio particular porque combinan tres dificultades que rara vez coexisten: cálculos numéricos sobre tablas densas, razonamiento multi-hop a través de secciones conectadas por referencias cruzadas, y análisis de contexto que requiere saber en qué escenario industrial se sitúa lo que estás leyendo.
La opción metodológica interesante es la generación sintética de documentos. En lugar de recopilar balances reales (con problemas de licencia, privacidad y variedad insuficiente), los investigadores construyeron un agente, Finance-LaTeX SKILL, que sintetiza documentos con layouts complejos a partir de conocimiento experto. La ventaja es el control: pueden generar casos con cualquier combinación de dificultades y saben cuál es la respuesta esperada porque la construyeron ellos. La desventaja es que los documentos son sintéticos, y un modelo que vio millones de balances reales durante el pre-training podría comportarse diferente en layouts inventados.
La evaluación usa un Agent-as-a-Judge: un modelo evalúa las respuestas abiertas de los agentes bajo prueba sobre métricas múltiples, en lugar de compararlas con una respuesta de referencia. Es el mismo patrón que vimos en otros benchmarks recientes, y trae consigo el mismo problema que contamos en el paper sobre LLM como juez: el juez tiene sus sesgos. Los investigadores declaran que las respuestas de referencia son «relativamente estables y permanentes», pero la evaluación abierta sigue siendo el punto débil metodológico.
Los números clave: 2.000 documentos, 2.026 tareas, 6.000 pares pregunta-respuesta, soporte bilingüe (chino e inglés), seis escenarios mainstream y siete tipos de tareas. Las dimensiones están en el rango medio de los benchmarks de sector.
Qué queda abierto: el paper está disponible como página en Hugging Face, pero el texto completo no se descargó para esta entrada. Las métricas de performance de agentes individuales no se reportan en el resumen, así que no podemos decir quién gana. Los documentos son sintéticos, así que los resultados podrían no transferirse directamente a los balances reales que un profesional encuentra en el trabajo. Y como siempre con benchmarks, la puntuación dice qué pasó en ese conjunto, no qué hará tu agente en tus documentos: para eso necesitas un banco de pruebas construido sobre tus casos, como explican las lecciones sobre cómo evaluar sin benchmarks y construir tu banco de pruebas.