context.vn

health Bench Hard

8 models evaluated

#ModelProviderTypeScore
1Muse SparkMetaClosedmuse-spark
2GPT-5.4OpenAIClosedgpt-5-4
3GPT-5.6 SolOpenAIClosedgpt-5-6-sol
4GPT-5.6 TerraOpenAI · Closed32.7%
5GPT-5.6 LunaOpenAI · Closed32.0%
6Gemini 3.1 ProGoogle · Closed20.6%
7Grok 4.20xAI · Closed20.3%
8Claude Opus 4.6Anthropic · Closed14.8%