Radar · 03/08/2026 · ocurrido el 30/07/2026 · investigación

ExtractBench: el benchmark que mide agentes en extracción de datos real

ExtractBench es un benchmark para extracción de datos guiada por esquema: dado un documento y un esquema que defines, el agente debe devolver los valores correctos indicando dónde los encontró. Cubre 4.869 páginas en 370 documentos empresariales, 8 dominios de negocio y 67 tipos de documento. Publicado en arXiv el 31 de julio de 2026, es el primer benchmark en medir juntos precisión de valores, integridad de registros, trazabilidad de fuentes y costo.

Si usas agentes para extraer datos de documentos (facturas, contratos, listas de precios, formularios), esto cambia la pregunta que te haces antes de elegirlos. El paper muestra un patrón claro: los VLM comerciales funcionan bien en documentos cortos pero truncan listas de registros cuando el documento se alarga. Los coding agent mantienen la precisión, pero a un costo mucho más alto. LlamaExtract Agentic Plus gana en las tres métricas con una precisión comparable a los coding agent a una fracción del costo.

Es el hilo que habíamos seguido con DocOps: SWE-bench mide código, pero los documentos quedaban sin cubrir. ExtractBench cierra la brecha con un banco de pruebas concreto. El punto del paper es el método: precisión evaluada como integridad de registros (no como valores individuales correctos), y costo medido junto a la calidad.

Dataset y código de evaluación son públicos en HuggingFace y GitHub: puedes probar tu agente en los mismos documentos y comparar.

En detalle

Qué había antes.

Los benchmarks para agentes se enfocaban en código (SWE-bench) o tareas generales (GAIA). Para documentos, faltaba un banco de pruebas que midiera extracción guiada por esquema a escala real. DocOps había identificado el vacío; FinanceComplexQA lo había llenado parcialmente para el dominio financiero. ExtractBench lo aborda en 67 tipos de documento y 8 dominios de negocio, con 4.869 páginas en total.

Cómo funciona la evaluación.

La extracción guiada por esquema funciona así: defines la estructura que quieres obtener (por ejemplo un JSON con campos «proveedor», «fecha», «items», «total»), y el agente lee el documento y completa los campos. ExtractBench mide tres cosas:

  • Value F1 order-insensitive: cuántos valores extrajo correctamente, sin contar el orden en que aparecen. Penaliza tanto valores inventados como faltantes.
  • Grounding word-level F1: para cada valor extraído, el agente debe indicar las palabras exactas del documento de donde lo tomó. Verifica la procedencia a nivel de palabra.
  • Grounding page-level F1: lo mismo a nivel de página. Para documentos largos, saber «página 14» ya es información operativa.

El costo se mide en dólares por documento, reportado junto a las métricas de calidad.

Cómo se construyó la verdad base.

El desafío de cada benchmark es tener las respuestas correctas para comparar con el agente. ExtractBench usa tres estrategias según el tipo de documento:

  • Documentos reales: dos sistemas independientes extraen los mismos datos. Si coinciden, el valor se considera correcto.
  • Listas sintéticas: los valores son conocidos porque se generaron artificialmente, así que la comparación es exacta.
  • Formularios: verificación humana, porque los layouts irregulares hacen insuficiente el acuerdo entre sistemas.

Qué dicen los números.

Los VLM comerciales funcionan bien en documentos cortos, pero truncan listas de registros en documentos largos. Es un fallo silencioso: el agente no equivoca los valores que extrae, extrae menos de los que debería. Si procesas una lista de precios de 200 líneas y el agente te devuelve 120, tienes un output que parece correcto pero está incompleto.

Los coding agent mantienen la precisión en documentos largos, pero gastan mucho más. El trade-off entre precisión y costo es el corazón práctico del paper.

LlamaExtract Agentic Plus, producto de LlamaIndex, se posiciona primero en las tres métricas, con un costo comparable a los VLM y una precisión comparable a los coding agent. Es el punto de la curva donde gastas poco y obtienes mucho, al menos en este benchmark.

Limitaciones.

El paper acaba de salir y el dataset es nuevo. Los 370 documentos cubren 8 dominios y 67 tipos, pero la representatividad respecto a tu dominio específico debe verificarse. La verdad base para documentos reales se basa en acuerdo entre dos sistemas: si ambos cometen el mismo error, el valor «correcto» es incorrecto. El repo GitHub es run-llama/ExtractBench, la organización de LlamaIndex: el hecho de que su propia herramienta gane el benchmark debe leerse con esto en mente, aunque código y dataset sean abiertos y replicables.

Escribe para buscar en curso, playbooks, skills, papers…