Grok 4.7 xHigh scored 58% in this benchmark, while Claude Fable 5.1 Max scored 59%. Grok 4.7 xHigh surpassed GPT-6 Astra, GPT-5.6, Gemini, Kimi, GLM, and almost all other frontier models.