GPT-5.6 Sol Ultra demuestra una conjetura abierta desde hace 50 años en menos de una hora
Qué pasó. GPT-5.6 Sol Ultra generó una demostración de la Cycle Double Cover Conjecture, un problema abierto en teoría de grafos desde 1970, en menos de una hora. El modelo trabajó con 64 subagentos en paralelo. Thomas Bloom, matemático de la Universidad de Manchester, verificó el resultado y lo define como «una prueba muy hermosa: breve, elemental, y que habría podido ser descubierta en los años 80». La conjetura preguntaba si es posible encontrar un conjunto de ciclos en cualquier red de vértices y arcos que atraviese cada arco exactamente dos veces.
Por qué te importa. Como contábamos el 10 de julio, GPT-5.6 Sol es el modelo que OpenAI posiciona en razonamiento profundo. Este resultado muestra hasta dónde llega esa capacidad en una tarea verificable: no benchmarks sintéticos, sino una demostración matemática que la comunidad puede revisar línea por línea. Bloom explica que el paso clave requería un pequeño giro contraintuitivo en el razonamiento. Un matemático humano habría probado el enfoque obvio, vería que falla, y concluiría «no se puede hacer tan fácilmente». La IA no se desanima: continúa probando pequeñas variaciones hasta que una funciona. Es un ejemplo de cómo la persistencia mecánica supera la intuición cuando el espacio de soluciones está suficientemente definido.
El límite. Bloom critica duramente la ausencia de citas en el paper de OpenAI: las ideas matemáticas clave que respaldan la demostración se remontan al menos a un trabajo de 1983 de Bermond, Jackson y Jaeger, pero el paper no lo menciona en absoluto. «Este es un problema recurrente con las pruebas generadas por IA: usan ideas y estrategias de demostración de la literatura sin citarlas». Bloom duda que la IA haya inventado la solución sola, «dado que su primer instinto es buscar todos los papers relevantes y leerlos». El desempeño técnico es real, pero la honestidad intelectual en el reconocimiento es otro asunto.
En detalle
El contexto: qué había antes
La Cycle Double Cover Conjecture fue formulada independientemente por varios matemáticos en los años 70. Desde entonces se han encontrado muchas soluciones parciales para casos especiales, pero ninguna demostración general aceptada. Bloom compara este resultado con el de la unit distance conjecture, resuelta también recientemente por OpenAI: ambos son «problemas abiertos importantes que resultaron ser mucho más fáciles de lo esperado — no requerían teorías nuevas importantes, y se puede imaginar muchas historias alternativas en las que estas pruebas se encontraran hace décadas».
Cómo funcionó la IA (y qué dice el prompt)
El prompt escrito por OpenAI para esta tarea es una lección en ingeniería de la persistencia. Primera regla: decir explícitamente al modelo que asuma que existe una demostración completa, eliminando la respuesta más probable y honesta («la conjetura está abierta»). Luego: prohibir al modelo buscar en internet si la conjetura ya fue resuelta, y prohibir responder que está sin resolver. El modelo no tiene salidas: debe resolver el problema.
La verificación es igualmente rigurosa. Resultados parciales, reducciones a otras conjeturas no demostrables, resúmenes del estado de la investigación, explicaciones de por qué el problema es difícil: todo rechazado como insuficiente. El modelo no puede responder hasta que una demostración completa esté lista y pase una prueba adversaria. La mayoría de los 64 agentes se mantiene deliberadamente en la ignorancia del enfoque que parece más prometedor, para alentar un «pensamiento» independiente. Agentes adversarios verifican luego cada candidato contra una lista detallada de errores típicos.
Cuánto confiar: el juicio de Bloom
Bloom escribe que el núcleo matemático de la demostración se remonta al menos al paper de 1983. Asume que estos trabajos previos influyeron fuertemente en la prueba de OpenAI, «y es una lástima que no los mencione en absoluto. […] Este es un problema frecuente con pruebas y papers generados por IA: usan ideas y estrategias de demostración de la literatura sin citarlas correctamente». Bloom sospecha que la IA no inventó la solución sola, dado que su primer instinto al resolver problemas es «generalmente buscar todos los papers relacionados y leerlos».
La verificación completa por parte de la comunidad matemática aún está en curso, pero el juicio inicial de Bloom es el más detallado disponible. La demostración se sostiene técnicamente, pero el problema del reconocimiento intelectual permanece abierto.
Qué significa para los problemas abiertos
Bloom espera que los sistemas de IA resuelvan otros problemas como este: «aquellos cuyas soluciones requieren solo teoría existente y bien desarrollada, más mucha paciencia y convicción». Pero añade: «Es probable que esta sea solo una pequeña proporción de los problemas abiertos, y no sabemos de antemano cuáles son». El punto interesante es otro: «En este extraño mundo nuevo donde grandes empresas de IA gastan mucho tiempo y dinero atacando muchos problemas abiertos simultáneamente (e informando solo de los éxitos, por supuesto), pronto descubriremos más sobre qué estaba a nuestro alcance todo el tiempo».
No sabemos cuántos intentos hizo OpenAI antes de este éxito, ni en cuántos otros problemas Sol Ultra está trabajando sin resultados que anunciar. La persistencia mecánica funciona donde el espacio de soluciones está definido y la verificación es objetiva. Queda por ver cuánto se extiende esto más allá de la matemática pura.