TryAI a organisé un test comparatif entre Grok 4.5, GPT-5.5, Claude Opus 4.8 et Claude Fable 5. Chaque modèle devait générer, en une seule tentative et sans bibliothèque externe, trois applications HTML autonomes : un Rubik's Cube en 3D, un bac à sable de gravité à particules et un jeu de type Breakout.

Les performances ont divergé selon les exercices. Les modèles Claude ont dominé la création du Rubik's Cube, tandis que GPT-5.5 s'est distingué par l'esthétique de sa simulation de gravité. Pour le jeu Breakout, les quatre modèles ont produit des résultats équivalents et parfaitement fonctionnels.

Sur le plan technique, Grok 4.5 s'est révélé le plus performant en termes de rapidité et de coût. Avec un débit d'environ 110 tokens/s, il a doublé la vitesse des autres modèles pour un coût de 0,002 $ par réponse. À l'opposé, Claude Fable 5 a été le plus lent et le plus onéreux avec 0,009 $ par réponse.