FinanceComplexQA: il benchmark che misura gli agenti su documenti finanziari reali
FinanceComplexQA è un benchmark open-ended per valutare quanto gli agenti AI e i sistemi RAG se la cavano su documenti finanziari industriali. I ricercatori hanno generato 2.000 documenti professionali con un sistema chiamato Finance-LaTeX SKILL, che produce layout complessi (tabelle annidate, note a piè di pagina, riferimenti incrociati) a partire da conoscenza esperta. Su quei documenti, sono presenti 2.026 task di deep research con 6.000 coppie domanda-risposta.
L’angolo per chi usa l’AI nel proprio campo è la varianza fra agenti. Il paper conferma quello che chi ha provato a far leggere bilanci o prospectus a un assistente già sa: alcuni agenti sbagliano sui calcoli numerici, altri perdono il filo nel ragionamento multi-hop (dove devi collegare informazioni sparse in pagine diverse), altri ancora riassumono bene ma saltano l’analisi di contesto. Il benchmark lo misura in modo sistematico, con un Agent-as-a-Judge che valuta le risposte aperte su metriche multiple invece di cercare la corrispondenza esatta con una risposta modello.
Perché ti riguarda: se stai pensando di far leggere all’AI i documenti del tuo campo, questo lavoro ti dice dove guardare per capire se l’agente che hai scelto regge. I documenti hanno le stesse caratteristiche che rompono l’estrazione nella vita vera.
Come raccontavamo il 23 luglio con DocOps, misurare gli agenti sui documenti è il buco che SWE-bench (fatto per il codice) non copriva. FinanceComplexQA scende nel verticale: stesso principio, dominio specifico.
Nel dettaglio
Il contesto: i benchmark per agenti si sono moltiplicati nell’ultimo anno, ma la maggior parte copre il codice (SWE-bench e derivati) o compiti generalisti (GAIA). I documenti finanziari sono un dominio particolare perché combinano tre difficoltà che raramente coesistono: calcoli numerici su tabelle dense, ragionamento multi-hop attraverso sezioni collegate da riferimenti incrociati, e analisi di contesto che richiede di sapere in quale scenario industriale si colloca quello che stai leggendo.
La scelta metodologica interessante è la generazione sintetica dei documenti. Invece di raccogliere bilanci reali (con problemi di licenza, privacy e varietà insufficiente), i ricercatori hanno costruito un agente, Finance-LaTeX SKILL, che sintetizza documenti con layout complessi a partire da conoscenza esperta. Il vantaggio è il controllo: possono generare casi con qualsiasi combinazione di difficoltà e sanno quale risposta attesa è corretta perché l’hanno costruita loro. Lo svantaggio è che i documenti sono sintetici, e un modello che ha visto milioni di bilanci reali durante il pre-training potrebbe comportarsi diversamente su layout inventati.
La valutazione usa un Agent-as-a-Judge: un modello valuta le risposte aperte degli agenti sotto test su metriche multiple, anziché confrontarle con una risposta di riferimento. È lo stesso pattern che abbiamo visto in altri benchmark recenti, e porta con sé lo stesso problema che abbiamo raccontato nel paper su LLM come giudice: il giudice ha le sue storture. I ricercatori dichiarano che le risposte di riferimento sono «relativamente stabili e permanenti», ma la valutazione aperta resta il punto debole metodologico.
I numeri chiave: 2.000 documenti, 2.026 task, 6.000 coppie domanda-risposta, supporto bilingue (cinese e inglese), sei scenari mainstream e sette tipi di task. Le dimensioni sono nella fascia media dei benchmark di settore.
Cosa resta aperto: il paper è disponibile come pagina su Hugging Face, ma il testo completo non è stato scaricato per questa voce. Le metriche di performance dei singoli agenti non sono riportate nell’abstract, quindi non possiamo dire chi vince. I documenti sono sintetici, quindi i risultati potrebbero non trasferirsi direttamente ai bilanci reali che un professionista incontra sul lavoro. E come sempre con i benchmark, il punteggio dice cosa è successo su quel set, non cosa farà il tuo agente sui tuoi documenti: per quello serve un banco di prova costruito sui tuoi casi, come spiegano le lezioni su come valutare senza benchmark e costruire il tuo banco di prova.