Radar · 14/07/2026 · ocurrido el 13/07/2026 · investigación

AdvancedMathBench: banco de prueba para matemática avanzada con verificación rigurosa

Un equipo de investigación ha lanzado AdvancedMathBench, un benchmark para matemática avanzada que cubre niveles de pregrado y cualificación doctoral. El núcleo es ProverBench: 296 problemas que requieren demostraciones completas, no solo la respuesta final. La novedad está en la verificación: un sistema automático entrenado en anotaciones de expertos produce no solo el veredicto (correcto/incorrecto), sino también evaluaciones granulares de errores en la demostración.

Por qué te importa: si usas IA en problemas cuantitativos, este benchmark muestra dónde los modelos realmente se sostienen más allá del nivel secundario promedio. GPT-5.5-xhigh, el mejor modelo probado, alcanza 75.8% en el conjunto de pregrado y 66.1% en el de doctorado, dejando margen considerable. VerifierBench, la parte dedicada a verificación, contiene 888 demostraciones generadas por modelos con ground truth de experto: aquí el mejor modelo llega a un F1 equilibrado de 65.1%, con tasas de verdadero negativo bajas—los modelos tienen dificultades para reconocer errores críticos.

El benchmark está construido para superar el límite de solo verificar la respuesta final: la granularidad fina en la demostración ayuda a entender dónde falla el razonamiento, no solo si la última línea es incorrecta.

En detalle

El contexto

Los benchmarks matemáticos existentes (GSM8K, MATH, algunos datasets de olimpiadas) cubren bien el nivel secundario e de competencia, pero se detienen ahí. Para matemática universitaria y más allá, las evaluaciones son dispersas y a menudo se limitan a verificar si la respuesta final es correcta, sin mirar el proceso. AdvancedMathBench surge para llenar este vacío: problemas de cursos de pregrado y exámenes de cualificación doctoral, con un pipeline de verificación que va más allá de comparar respuestas.

Qué contiene

ProberBench tiene 296 problemas divididos en dos conjuntos: pregrado (UGD) y examen de cualificación doctoral (QE). Cada problema requiere una demostración completa escrita. El pipeline de verificación automática está entrenado en anotaciones de expertos y produce dos salidas:

  1. Veredicto de corrección (correcto, parcial, incorrecto).
  2. Evaluaciones detalladas de errores: dónde falla la demostración (lógica, álgebra, definiciones mal aplicadas), con alineación fuerte con expertos humanos en trayectorias de prueba excluidas del entrenamiento.

VerifierBench contiene 888 demostraciones generadas por modelos, cada una con ground truth de experto. Sirve para evaluar si los modelos saben reconocer cuándo una demostración es válida y producen razonamientos de verificación correctos.

Los resultados

En el conjunto de pregrado, el mejor modelo (GPT-5.5-xhigh) alcanza 75.8%; en el de doctorado 66.1%. Estos números indican que la matemática avanzada sigue siendo un desafío abierto incluso para los modelos más avanzados. En VerifierBench, el mejor F1 equilibrado es 65.1%, con tasas de verdadero negativo bajas: los modelos tienden a no reconocer demostraciones erróneas como tales. Este es un problema práctico: si usas un modelo para revisar tu trabajo cuantitativo, un verificador débil en falsos negativos te deja pasar errores ocultos.

Implicaciones

Si trabajas en problemas cuantitativos complejos, este benchmark te dice dos cosas:

  1. Los modelos aún no son confiables en matemática universitaria sin supervisión: los márgenes de error son amplios.
  2. La verificación automática aún es inmadura: un modelo que genera una demostración incorrecta tiene buenas probabilidades de no reconocerla como tal si se la devuelves.

Esto no significa que los modelos sean inútiles en estos problemas, sino que deben usarse como borradores que un experto revisa, no como oráculos. La granularidad fina del benchmark ayuda a entender dónde el modelo falla (pasos lógicos, aplicación incorrecta de teoremas, saltos implícitos), información valiosa si estás construyendo un flujo que integra IA en tu trabajo cuantitativo.

Limitaciones

296 problemas son una muestra pequeña comparada con benchmarks de secundaria. La cobertura disciplinaria (pregrado y cualificación doctoral) es amplia, pero no exhaustiva: faltan algunas ramas avanzadas. El pipeline de verificación está entrenado en anotaciones de expertos, pero la concordancia con humanos, aunque es fuerte, no es perfecta: márgenes de error persisten. El paper no especifica cuánto cuesta hacer las anotaciones de experto ni cuánto tiempo toma producirlas, así que escalar el benchmark podría ser costoso.

Escribe para buscar en curso, playbooks, skills, papers…