Radar · 03/08/2026 · fatto del 30/07/2026 · ricerca

ExtractBench: il benchmark che misura gli agenti sull'estrazione dati vera

ExtractBench è un benchmark per l’estrazione dati guidata da schema: dati un documento e uno schema che definisci tu, l’agente deve restituire i valori corretti con l’indicazione di dove li ha trovati. Copre 4.869 pagine su 370 documenti aziendali, 8 domini business e 67 tipi di documento. Pubblicato su arXiv il 31 luglio 2026, è il primo benchmark a misurare insieme accuratezza dei valori, completezza dei record, tracciabilità delle fonti e costo.

Se usi agenti per estrarre dati da documenti (fatture, contratti, listini, moduli), questo cambia la domanda che ti fai prima di sceglierli. Il paper mostra un pattern chiaro: i VLM commerciali se la cavano bene sui documenti corti ma troncano le liste di record quando il documento si allunga. I coding agent mantengono l’accuratezza, ma a un costo molto più alto. LlamaExtract Agentic Plus vince su tutte e tre le metriche con un’accuratezza paragonabile ai coding agent a una frazione del costo.

È il filo che avevamo seguito con DocOps: SWE-bench misura il codice, ma i documenti restavano scoperti. ExtractBench colma il gap con un banco di prova concreto. Il punto del paper è il metodo: accuratezza valutata come completezza dei record (non come valori singoli azzeccati), e costo misurato accanto alla qualità.

Dataset e codice di valutazione sono pubblici su HuggingFace e GitHub: puoi testare il tuo agente sugli stessi documenti e confrontare.

Nel dettaglio

Cosa c’era prima.

I benchmark per agenti si concentravano sul codice (SWE-bench) o su compiti generali (GAIA). Per i documenti, mancava un banco di prova che misurasse l’estrazione guidata da schema su scala reale. DocOps aveva individuato il vuoto; FinanceComplexQA lo aveva parzialmente riempito per il dominio finanziario. ExtractBench lo affronta su 67 tipi di documento e 8 domini business, con 4.869 pagine totali.

Come funziona la valutazione.

L’estrazione guidata da schema funziona così: definisci la struttura che vuoi ottenere (per esempio un JSON con i campi «fornitore», «data», «voci», «totale»), e l’agente legge il documento e riempie i campi. ExtractBench misura tre cose:

  • Value F1 order-insensitive: quanti valori ha estratto correttamente, senza contare l’ordine in cui appaiono. Penalizza sia i valori inventati sia quelli mancanti.
  • Grounding word-level F1: per ogni valore estratto, l’agente deve indicare le parole esatte del documento da cui lo ha preso. Verifica la provenienza a livello di parola.
  • Grounding page-level F1: stessa cosa a livello di pagina. Per i documenti lunghi, sapere «pagina 14» è già un’informazione operativa.

Il costo è misurato in dollari per documento, riportato accanto alle metriche di qualità.

Come è costruito il ground truth.

La sfida di ogni benchmark è avere le risposte corrette con cui confrontare l’agente. ExtractBench usa tre strategie a seconda del tipo di documento:

  • Documenti reali: due sistemi indipendenti estraggono gli stessi dati. Se concordano, il valore è considerato corretto.
  • Liste sintetiche: i valori sono noti perché generati artificialmente, quindi il confronto è esatto.
  • Moduli: verifica umana, perché i layout irregolari rendono l’accordo fra sistemi insufficiente.

Cosa dicono i numeri.

I VLM commerciali vanno bene sui documenti brevi, ma troncano le liste di record sui documenti lunghi. È un fallimento silenzioso: l’agente non sbaglia i valori che estrae, ne estrae meno di quanti dovrebbe. Se processi un listino di 200 righe e l’agente te ne restituisce 120, hai un output che sembra corretto ma è incompleto.

I coding agent mantengono l’accuratezza sui documenti lunghi, ma spendono molto di più. Il trade-off fra accuratezza e costo è il cuore pratico del paper.

LlamaExtract Agentic Plus, prodotto da LlamaIndex, si piazza primo su tutte e tre le metriche, con un costo paragonabile ai VLM e un’accuratezza paragonabile ai coding agent. È il punto della curva dove spendi poco e ottieni molto, almeno su questo benchmark.

Limiti.

Il paper è uscito da pochi giorni e il dataset è nuovo. I 370 documenti coprono 8 domini e 67 tipi, ma la rappresentatività rispetto al vostro dominio specifico va verificata. Il ground truth per i documenti reali si basa sull’accordo fra due sistemi: se entrambi sbagliano allo stesso modo, il valore «corretto» è sbagliato. Il repo GitHub è run-llama/ExtractBench, l’organizzazione di LlamaIndex: il fatto che il proprio strumento vinca il benchmark va letto con questo in mente, anche se codice e dataset sono aperti e replicabili.

Scrivi per cercare fra corso, playbook, skill, paper…