Radar · 05/08/2026 · investigación

LLMs Can't Jump: el position paper que formaliza el límite del salto lógico en los modelos

Un position paper en OpenReview, titulado «LLMs Can’t Jump», alcanza 165 puntos en Hacker News con 116 comentarios. La tesis en el título: los modelos de lenguaje tienen un límite fundamental para hacer saltos lógicos, es decir, para conectar información que no está cerca en el espacio de lo que vieron en el entrenamiento.

Por qué te importa. Si construyes flujos de trabajo que esperan que la IA haga el destello que conecta dos ideas lejanas, este paper dice que el destello no llega solo. Los modelos interpolan bien dentro de sus datos de entrenamiento, pero se esfuerzan por extrapolar más allá. La diferencia importa cuando la tarea requiere un paso que no está ya en el material visto: allí la IA te devuelve la respuesta plausible más cercana; la respuesta correcta requiere un salto lógico.

Es el mismo hilo que seguimos al hablar de cómo la experiencia de quien guía el modelo importa más que los trucos de prompting: el salto lógico lo hace la persona que conoce el dominio, la IA lo articula y lo desarrolla. Un paper que formaliza este límite te dice dónde delegar y dónde mantener el juicio humano en el ciclo.

En detalle

La página OpenReview del paper no era accesible en el momento de la recopilación (requiere verificación del navegador), por lo que lo siguiente se basa en el título, el contexto de la discusión en Hacker News y el hilo de investigación que el sitio ha seguido en las últimas semanas.

Qué son los position papers. En espacios de machine learning como OpenReview, un «position paper» no presenta un experimento nuevo: argumenta un punto de vista, a menudo para estimular el debate sobre una dirección de investigación o sobre un límite que la comunidad subestima. El formato permite decir «detengámonos a pensar» sin necesidad de mostrar curvas de precisión.

El salto que falta. El título usa una metáfora deportiva: el caballo que no salta el obstáculo. En el contexto del razonamiento, un «salto lógico» es ese pasaje que conecta dos ideas o dos datos que no están cerca en el espacio de la información vista en el entrenamiento. Los modelos son buenos interpolando: encontrando la respuesta que está entre dos cosas que conocen. Se esfuerzan más por extrapolar: hacer el paso que va más allá de lo que han visto.

Esto no es un límite nuevo en sí mismo. La literatura sobre el razonamiento de los LLM discute desde hace tiempo la diferencia entre interpolación y extrapolación. El paper parece argumentar que este límite es estructural, no un error a resolver con más datos o más parámetros. El punto importa porque, si es cierto, cambia las expectativas: un modelo más grande responde mejor a las preguntas que se parecen a sus datos de entrenamiento, pero no necesariamente hace la conexión creativa que ve un experto humano.

Dónde encaja en el hilo del sitio. El 4 de agosto contábamos cómo el análisis de Sean Goedecke mostraba que la experiencia de quien guía el modelo importa más que los trucos de prompting: la competencia real en el dominio produce mejores resultados porque quien la tiene sabe dónde buscar el salto lógico. El mismo día, el paper sobre GradCuit mostraba que optimizar los estados internos en el tiempo de prueba mejora el razonamiento sin más tokens. Dos ángulos diferentes del mismo problema: cuánto del razonamiento podemos delegar y cuánto sigue siendo irreduciblemente humano.

Qué aún no sabemos. Sin acceso al texto completo, no podemos verificar si el paper presenta ejemplos concretos de saltos lógicos fallidos, si propone métricas para medirlos, o si se limita a un argumento teórico. Los 116 comentarios en Hacker News sugieren que la tesis ha generado debate, pero no podemos citar los detalles de las objeciones sin haberlas leído. El paper debe leerse antes de sacar conclusiones operativas.

Escribe para buscar en curso, playbooks, skills, papers…