context.vn

vals Index

40 models evaluated

#ModelProviderTypeScore
1Anthropicanthropic/claude-fable-5Claude Fable 575.14%
2Anthropicanthropic/claude-opus-5Claude Opus 574.82%
3Moonshot AIkimi/kimi-k3Kimi K374.70%
4GPT-5.6 SolOpenAI73.12%
5Claude Opus 4.8Anthropic70.36%
6GPT-5.6 LunaOpenAI69.88%
7Claude Sonnet 5Anthropic68.61%
8Muse Spark 1.1Meta68.41%
9GPT-5.5OpenAI67.95%
10Claude Opus 4.7Anthropic66.10%
11Grok 4.5xAI65.30%
12GPT-5.6 TerraOpenAI65.14%
13GLM 5.2Zhipu AI65.02%
14Gemini 3.5 FlashGoogle62.75%
15Gemini 3.6 FlashGoogle62.43%
16Claude Sonnet 4.6Anthropic60.06%
17MiniMax M3MiniMax58.94%
18Qwen3.7 MaxAlibaba57.49%
19DeepSeek V4 ProDeepSeek55.62%
20Kimi K2.6Moonshot AI55.17%
21Gemini 3.1 Pro PreviewGoogle53.77%
22GLM 5.1Zhipu AI52.45%
23GPT-5.4 MiniOpenAI52.42%
24Qwen3.7 PlusAlibaba52.33%
25Mimo V2.5Xiaomi51.57%
26Gemini 3.5 Flash LiteGoogle51.00%
27Mimo V2.5 ProXiaomi50.74%
28Gemini 3 Flash PreviewGoogle49.55%
29InklingThinkingmachines49.28%
30Qwen3.6 PlusAlibaba48.89%
31GPT-5.4 NanoOpenAI46.63%
32Grok 4.3xAI46.48%
33Nemotron 3 Ultra 550b A55bNvidia43.99%
34MiniMax M2.7MiniMax41.56%
35Claude Haiku 4.5 20251001 ThinkingAnthropic40.90%
36Grok 4.20 0309 ReasoningxAI39.50%
37Mistral Medium 3.5Mistral AI37.81%
38Gemini 3.1 Flash Lite PreviewGoogle36.20%
39Laguna M.1Poolside33.33%
40Laguna Xs.2Poolside30.04%