context.vn
Menu

health Bench Hard

11 models evaluated

#ModelProviderTypeScore
1Muse SparkMetaProprietary42.8%
2GPT-5.4OpenAIProprietary40.1%
3GPT-6 AstraOpenAIProprietary36.6%
4GPT-5.6 SolOpenAI · Closed33.1%
5GPT-5.6 TerraOpenAI · Closed32.7%
6GPT-5.6 LunaOpenAI · Closed32.0%
7GPT-6 LunaOpenAI · Closed31.4%
8GPT-6 SolOpenAI · Closed30.1%
9Gemini 3.1 ProGoogle · Closed20.6%
10Grok 4.20xAI · Closed20.3%
11Claude Opus 4.6Anthropic · Closed14.8%