Radar · 25/07/2026 · ocurrido el 22/07/2026

K12-KGraph: un benchmark para la cognición curricular, no para las respuestas correctas

Un grupo de investigadores ha publicado K12-KGraph, un grafo de conocimiento alineado con el curriculum escolar, para medir una capacidad que los benchmarks actuales ignoran: la curriculum cognition. En lugar de preguntar al modelo si sabe la respuesta a una pregunta aislada, el benchmark verifica si comprende cómo se organiza el conocimiento. Cadenas de requisitos previos (qué debes saber antes de aprender X), taxonomías de conceptos, conexiones entre experimentos y conceptos, el orden pedagógico correcto, y el reconocimiento visual de un concepto a partir de una imagen.

Por qué te afecta. Si construyes agentes que trabajan en dominios estructurados, razonar sobre qué viene primero y qué después es lo que separa un asistente útil de uno que se salta pasos. La diferencia entre un colega que sabe descomponer un problema y uno que empieza por el final. Hoy los modelos se evalúan por las respuestas finales, no por esta capacidad de orientarse en la estructura, y el resultado es que nadie sabe realmente qué tan bien la manejan.

El benchmark (datos en el paper publicado el 22 de julio de 2026 en Hugging Face) cubre 9 tipos de nodos, 14 tipos de relaciones, 23.640 preguntas de prueba y 7.335 ejemplos de entrenamiento, de los cuales 5.068 son multimodales. Los autores demuestran que combinar supervisión textual y visual mejora la comprensión del curriculum. El grafo, benchmark, datos de entrenamiento y pipeline de construcción son código abierto.

En detalle

Lo que había antes.

Los benchmarks para LLM educativos se han enfocado hasta ahora en responder preguntas de examen. Un modelo pasa el test si da la respuesta correcta, pero nadie verifica si ha entendido por qué esa respuesta viene después de otra, o qué concepto es requisito previo de cuál. Es la diferencia entre saber que 3 × 4 = 12 y saber que la multiplicación requiere haber interiorizado primero la suma.

Qué cambia.

K12-KGraph introduce un grafo de conocimiento extraído de libros de texto de People’s Education Press, la editorial escolar oficial china. Un grafo de conocimiento es una red de conceptos conectados por relaciones explícitas: “A es requisito previo de B”, “A es un caso particular de B”, “el experimento E ilustra el concepto C”. El benchmark, en lugar de preguntar ‘cuál es la respuesta?’, pide al modelo reconstruir o verificar estas relaciones.

La novedad es que medir esta capacidad es útil también fuera de la escuela. Cualquier agente que opera en un dominio con estructura de conocimiento, desde la formación empresarial hasta el soporte técnico, debe saber qué explicar primero y qué después. Si un agente de onboarding se salta los requisitos previos e empieza por los detalles avanzados, el resultado es confusión en lugar de aprendizaje.

Los detalles técnicos.

El grafo tiene 9 tipos de nodos (conceptos, experimentos, figuras, capítulos, etc.) y 14 tipos de relaciones. Las 23.640 preguntas de prueba cubren diferentes sub-habilidades: identificar requisitos previos, construir taxonomías, conectar experimentos a conceptos, establecer el orden pedagógico, y reconocer conceptos en imágenes (visual grounding). Los 5.068 ejemplos multimodales son aquellos en los que el modelo debe leer tanto el texto como una imagen para responder.

Los autores entrenaron modelos con los 7.335 ejemplos de entrenamiento y descubrieron que la combinación de texto e imágenes produce una comprensión del curriculum más fuerte que solo texto. Es una señal de que la información visual importa, y que los modelos puramente textuales pierden algo cuando el dominio tiene un componente visual estructurado (esquemas, diagramas, figuras didácticas).

Limitaciones.

El grafo se construyó sobre un curriculum específico, el de la escuela primaria y secundaria china. La estructura de requisitos previos refleja las opciones pedagógicas de un sistema educativo, no una verdad universal. Un modelo que funcione bien en este grafo no es necesariamente bueno reconstruyendo los requisitos previos de, por ejemplo, una regulación técnica o un programa de certificación profesional. El dataset de entrenamiento es además pequeño según los estándares del fine-tuning de LLM.

El punto es que este benchmark, más que resolver el problema de la comprensión estructural, lo nombra y lo hace medible. Hasta ayer, nadie probaba esta cosa de manera sistemática.

Escribe para buscar en curso, playbooks, skills, papers…