Radar · 11/07/2026 · ocurrido el 10/07/2026 · modelos

GPT-5.6, Grok 4.5, Claude y Muse Spark en el mismo banco de pruebas

TryAI ha puesto doce modelos a prueba en cuatro tareas de coding: un raycaster 3D estilo Doom, un cubo de Rubik con animaciones, una calculadora y Conway’s Game of Life. Cada modelo tuvo cinco intentos por tarea, con costos y tiempos registrados.

Por qué te importa. Cuando necesitas elegir la herramienta para un trabajo real, los benchmarks abstractos no son suficientes: necesitas ejemplos concretos en tareas realistas. Este test muestra que GPT-5.6 Sol es el más consistente en el raycaster (5/5 intentos exitosos), Claude Fable 5 no falla en el cubo de Rubik (5/5), y Grok 4.5 es una opción sólida a un cuarto del precio. Muse Spark 1.1 sorprende cuando funciona, pero falla en tres de cada cinco intentos. Los modelos open-weight (Qwen, DeepSeek, Kimi, GLM) son más económicos pero menos confiables: buenos para experimentar, riesgosos para producción.

Si quieres probarlo. El sitio publica cada intento (veinte por modelo): puedes ejecutarlos en el navegador y ver dónde fallan. Es la forma más directa de entender si un modelo aguanta tu tipo de tarea antes de pagar una clave.

En detalle

Los tests anteriores de TryAI fueron criticados en Hacker News por dar a cada modelo un solo intento. Esta vez respondieron con rigor: doce modelos, cuatro apps, cinco intentos cada uno, con costos y latencia medidos en cada ronda.

Los modelos testeados

La alineación incluye las tres variantes de GPT-5.6 (Sol, Terra, Luna), Grok 4.5, GPT-5.5, Claude Opus 4.8 y Claude Fable 5, Muse Spark 1.1 de Meta, y cuatro modelos open-weight: Qwen 3.7 Plus, DeepSeek V4 Pro, Kimi K2.6 y GLM-5.2, todos servidos vía Fireworks.

Tarea 1: raycaster 3D

Un laberinto en primera persona con movimiento WASD, profundidad de paredes, piso y techo. GPT-5.6 Sol logra cinco intentos de cinco, con más detalle en los resultados que GPT-5.5. Grok 4.5 hace 5/5 a 27 centavos por cinco ejecuciones, un cuarto del costo de Sol. Claude Opus 4.8 hace solo 4/5, menos consistente de lo esperado. Muse Spark 1.1 sorprende: solo dos intentos exitosos, pero los buenos estaban al nivel de Fable y Sol.

Tarea 2: cubo de Rubik

Un cubo 3D de colores con botones Scramble y Solve que animan las rotaciones. Claude Fable 5 no falla: 5/5, sin glitches, animaciones fluidas. GPT-5.6 Sol hace 4/5 (un intento produjo un cubo completamente negro, una elección interesante). GPT-5.6 Luna colapsa: 0/5, el cubo se rompía al primer scramble. Claude Opus 4.8 no logró producir ni un intento perfecto, un resultado inesperado considerando que Fable 5 hizo cinco de cinco.

Tareas 3 y 4: calculadora y Game of Life

Los detalles completos están en el sitio de TryAI, con cada intento ejecutable en la página. La calculadora requería precedencia de operadores correcta; Game of Life debía animar las generaciones con controles play/pause.

Implicaciones prácticas

Los resultados varían mucho entre intentos del mismo modelo en la misma tarea: es la razón por la que un solo intento no es suficiente para juzgar. GPT-5.6 Sol cuesta más pero falla menos; Grok 4.5 es una opción económica sólida; Claude Fable 5 destaca donde importa la precisión visual. Los modelos open-weight (Qwen, DeepSeek) cuestan poco pero la varianza entre intentos es alta: buenos para experimentar, riesgosos donde se necesita confiabilidad.

Los límites del test

Cuatro tareas no son un benchmark completo, y la evaluación («playable», «clean solve») es subjetiva. TryAI lo declara abiertamente: no es una sentencia científica, es una muestra real publicada completa. El valor está en los enlaces a los intentos reales: puedes ejecutarlos y formarte tu propia opinión.

Como contábamos el 5 de julio, los benchmarks genéricos no te dicen si un modelo funciona para ti: necesitas un banco de pruebas con tus casos. Este test te da cuatro casos concretos, cinco intentos por modelo, y los enlaces para ejecutarlos: es el punto de partida para decidir antes de pagar.

Escribe para buscar en curso, playbooks, skills, papers…