TryAI realizó una prueba comparativa entre Grok 4.5, GPT-5.5, Claude Opus 4.8 y Claude Fable 5, solicitándoles la creación de tres aplicaciones HTML autónomas sin librerías externas: un Cubo de Rubik en 3D, un simulador de gravedad de partículas y un juego de Breakout.

Los resultados fueron mixtos. Los modelos de Claude lideraron la tarea del cubo 3D, mientras que GPT-5.5 destacó por la calidad visual de la simulación de gravedad. En el caso del juego Breakout, los cuatro modelos lograron resultados profesionales y funcionales en el primer intento.

En cuanto a eficiencia, Grok 4.5 fue el ganador, registrando un rendimiento de aproximadamente 110 tokens/s, el doble que sus competidores, y el coste más bajo (0,002 $ por respuesta). GPT-5.5 fue el más rápido en respuestas cortas, mientras que Claude Fable 5 resultó ser el modelo más lento y costoso (0,009 $ por respuesta).