context.vn

vals Med Code

76 models evaluated

#ModelProviderTypeScore
1Anthropicanthropic/claude-opus-5Claude Opus 563.57%
2Googlegoogle/gemini-3.1-pro-previewGemini 3.1 Pro Preview59.06%
3Anthropicanthropic/claude-fable-5Claude Fable 556.07%
4Gemini 3 Flash PreviewGoogle55.92%
5Gemini 3.5 FlashGoogle55.83%
6Claude Opus 4.7Anthropic54.86%
7Claude Opus 4.8Anthropic53.22%
8Gemini 3.6 FlashGoogle53.15%
9GPT-5.1OpenAI52.73%
10Gemini 3 Pro PreviewGoogle52.20%
11Muse SparkMeta51.31%
12Gemini 2.5 ProGoogle50.59%
13GPT-5.2OpenAI49.75%
14GPT-5OpenAI49.63%
15Claude Opus 4.5 20251101 ThinkingAnthropic49.16%
16Claude Opus 4.6 ThinkingAnthropic49.13%
17GPT-5.5OpenAI49.10%
18Kimi K3Moonshot AI48.88%
19Claude Opus 4.6Anthropic48.24%
20Gemini 3.1 Flash Lite PreviewGoogle47.60%
21O3OpenAI47.29%
22Claude Opus 4.1 20250805 ThinkingAnthropic47.23%
23MiniMax M3MiniMax46.29%
24Claude Opus 4.5Anthropic45.17%
25Claude Sonnet 4.5 20250929 ThinkingAnthropic44.13%
26GPT-5.6 SolOpenAI43.97%
27Gemini 3.5 Flash LiteGoogle43.49%
28GPT-5.6 TerraOpenAI43.41%
29Grok 4.5xAI43.29%
30GPT-5 MiniOpenAI43.05%
31GPT-5.6 LunaOpenAI42.39%
32GLM 5.1Zhipu AI41.60%
33Claude Opus 4.1Anthropic41.37%
34GPT-5.4OpenAI41.29%
35InklingThinkingmachines41.19%
36GPT-5.4 NanoOpenAI41.03%
37GLM 5.2Zhipu AI40.77%
38Claude Sonnet 4.5Anthropic40.57%
39Gemini 2.5 Flash Preview 09 2025Google40.54%
40DeepSeek V4 ProDeepSeek40.45%
41Gemini 2.5 Flash ThinkingGoogle40.36%
42Gemini 2.5 Flash Preview 09 2025 ThinkingGoogle40.33%
43Kimi K2.6Moonshot AI40.14%
44Kimi K2.5 ThinkingMoonshot AI39.32%
45Qwen3.7 MaxAlibaba38.75%
46Nemotron 3 Ultra 550b A55bNvidia38.62%
47Gemini 2.5 FlashGoogle38.42%
48Grok 4 0709xAI38.08%
49Grok 4.3xAI38.07%
50Grok 4 Fast ReasoningxAI37.38%
51Qwen3.6 PlusAlibaba36.89%
52Llama4 Maverick Instruct BasicFireworks AI36.51%
53Claude Sonnet 4 20250514 ThinkingAnthropic34.96%
54MiniMax M2.7MiniMax34.44%
55Gemini 2.5 Flash Lite Preview 09 2025 ThinkingGoogle34.19%
56MiniMax M2.1MiniMax34.08%
57Claude Sonnet 4Anthropic33.94%
58O4 MiniOpenAI33.79%
59Mistral Medium 3.5Mistral AI33.75%
60Qwen3.5 FlashAlibaba33.00%
61GLM 4.7Zhipu AI32.77%
62Claude Haiku 4.5 20251001 ThinkingAnthropic32.68%
63Mimo V2.5 ProXiaomi32.48%
64Grok 4.20 0309 ReasoningxAI32.16%
65Mimo V2.5Xiaomi31.89%
66Qwen3 VL PlusAlibaba31.65%
67Qwen3 MaxAlibaba31.37%
68GPT-5 NanoOpenAI30.44%
69Grok 4 Fast Non ReasoningxAI30.04%
70Grok 4.1 Fast Non ReasoningxAI28.35%
71Grok 4.1 Fast ReasoningxAI28.08%
72Gemini 2.5 Flash LiteGoogle27.11%
73Gemini 2.5 Flash Lite Preview 09 2025Google27.08%
74Laguna M.1Poolside25.24%
75Meta Llama Llama 4 Scout 17B 16E InstructTogether AI23.31%
76Laguna Xs.2Poolside20.70%