context.vn

tau2 Bench

142 models evaluated

#ModelProviderTypeScore
4Step 3.7 FlashStepFun · Open weightArtificial Analysis τ²-bench98.5%
5GLM-5-TurboZ.AI · ClosedArtificial Analysis τ²-bench98.5%
6GLM-5V-TurboZ.AI · ClosedArtificial Analysis τ²-bench98.5%
7GLM-5Z.AI · Open weightArtificial Analysis τ²-bench98.2%
8GLM-5.1Z.AI · Open weightArtificial Analysis τ²-bench97.7%
9Qwen3.6 PlusAlibaba · ClosedArtificial Analysis τ²-bench97.7%
10Grok 4.3xAI · ClosedArtificial Analysis τ²-bench97.7%
11DeepSeek V4 Pro (Max)DeepSeek · Open weightArtificial Analysis τ²-bench96.2%
12Kimi K2.6Moonshot AI · Open weightArtificial Analysis τ²-bench95.9%
13Kimi K2.5Moonshot AI · Open weightArtificial Analysis τ²-bench95.9%
14GLM-4.7Z.AI · Open weightArtificial Analysis τ²-bench95.9%
15Qwen 3.6 Max (preview)Alibaba · ClosedArtificial Analysis τ²-bench95.9%
16Kimi K2.5 (Reasoning)Moonshot AI · ClosedArtificial Analysis τ²-bench95.9%
17Gemini 3.1 ProGoogle · Closedτ²-bench published setup95.6%
18Qwen3.5 397BAlibaba · Open weightArtificial Analysis τ²-bench95.6%
19DeepSeek V4 Flash (High)DeepSeek · Open weightArtificial Analysis τ²-bench95.6%
20Qwen3.5 397B (Reasoning)Alibaba · Open weightArtificial Analysis τ²-bench95.6%
21Gemini 3.5 FlashGoogle · ClosedArtificial Analysis τ²-bench95.3%
22Qwen3.6-35B-A3BAlibaba · Open weightArtificial Analysis τ²-bench95.3%
23MiniMax M2.5MiniMax · ClosedArtificial Analysis τ²-bench95.3%
24DeepSeek V4 Flash (Max)DeepSeek · Open weightArtificial Analysis τ²-bench95%
25MiMo-V2-ProXiaomi · ClosedArtificial Analysis τ²-bench95%
26Qwen3.7 MaxAlibaba · ClosedArtificial Analysis τ²-bench94.7%
27Claude Opus 4.8Anthropic · ClosedArtificial Analysis τ²-bench94.4%
28DeepSeek V4 Pro (High)DeepSeek · Open weightArtificial Analysis τ²-bench94.2%
29Qwen3.6-27BAlibaba · Open weightArtificial Analysis τ²-bench94.2%
30Mistral Medium 3.5 128BMistral · Open weightArtificial Analysis τ²-bench94.2%
31MiMo-V2.5-ProXiaomi · ClosedArtificial Analysis τ²-bench94.2%
32GPT-5.5OpenAI · Closedτ²-bench Telecom93.9%
33Qwen3.5-27BAlibaba · Open weightArtificial Analysis τ²-bench93.9%
34Qwen3.5-122B-A10BAlibaba · Open weightArtificial Analysis τ²-bench93.6%
35Grok 4.1 Fast (Reasoning)xAI · ClosedArtificial Analysis τ²-bench93.3%
36Qwen3.7 PlusAlibaba · ClosedArtificial Analysis τ²-bench93%
37Claude Opus 4.6 (Adaptive)Anthropic · ClosedArtificial Analysis τ²-bench92.1%
38GPT-5.2-CodexOpenAI · ClosedArtificial Analysis τ²-bench92.1%
39Muse SparkMeta · Closedτ²-bench published setup91.5%
40MiMo-V2-OmniXiaomi · ClosedArtificial Analysis τ²-bench91.2%
41Trinity-Large-PreviewArcee AI · Open weightArtificial Analysis τ²-bench90.1%
42Trinity-Large-ThinkingArcee AI · Open weightArtificial Analysis τ²-bench90.1%
43Kimi K2.7 CodeMoonshot AI · Open weightArtificial Analysis τ²-bench90.1%
44Claude Opus 4.5 ThinkingAnthropic · ClosedArtificial Analysis τ²-bench89.5%
45Qwen3.5-35B-A3BAlibaba · Open weightArtificial Analysis τ²-bench89.2%
46MiniMax M3MiniMax · Open weightArtificial Analysis τ²-bench88.9%
47Claude Opus 4.7 (Adaptive)Anthropic · ClosedArtificial Analysis τ²-bench88.6%
48Step 3.5 FlashStepFun · Open weightArtificial Analysis τ²-bench87.4%
49GPT-5.4OpenAI · Closedτ²-bench Telecom87.1%
50Gemini 3 ProGoogle · ClosedArtificial Analysis τ²-bench87.1%
51GPT-5 (medium)OpenAI · ClosedArtificial Analysis τ²-bench86.5%
52GPT-5.6 TerraOpenAI · ClosedArtificial Analysis τ²-bench86.3%
53Claude Opus 4.5Anthropic · ClosedArtificial Analysis τ²-bench86.3%
54GPT-5.3 CodexOpenAI · ClosedArtificial Analysis τ²-bench86%
55Ling 2.6 FlashInclusionAI · Open weightArtificial Analysis τ²-bench86%
56GPT-5.3-Codex-SparkOpenAI · ClosedArtificial Analysis τ²-bench86%
57GPT-5.6 SolOpenAI · ClosedArtificial Analysis τ²-bench85.1%
58Claude Opus 4.6Anthropic · ClosedArtificial Analysis τ²-bench84.8%
59GPT-5.2OpenAI · ClosedArtificial Analysis τ²-bench84.8%
60MiniMax M2.7MiniMax · Open weightArtificial Analysis τ²-bench84.8%
61GPT-5 (high)OpenAI · ClosedArtificial Analysis τ²-bench84.8%
62MiMo-V2-FlashXiaomi · Open weightArtificial Analysis τ²-bench83.9%
63GPT-5.4 miniOpenAI · Closedτ²-bench Telecom83.3%
64Nemotron 3 UltraNVIDIA · Open weightArtificial Analysis τ²-bench83.3%
65GPT-5.1-Codex-MaxOpenAI · ClosedArtificial Analysis τ²-bench83%
66GPT-5.1-CodexOpenAI · ClosedArtificial Analysis τ²-bench83%
67GPT-5.1OpenAI · ClosedArtificial Analysis τ²-bench81.9%
68o3OpenAI · ClosedArtificial Analysis τ²-bench80.7%
69Command A+Cohere · Open weightτ²-bench Telecom80.7%
70Claude Sonnet 4.6Anthropic · ClosedArtificial Analysis τ²-bench79.5%
71DeepSeek V3.2DeepSeek · Open weightArtificial Analysis τ²-bench78.9%
72GLM-4.6Z.AI · Open weightArtificial Analysis τ²-bench76.9%
73GPT-5.4 nanoOpenAI · Closedτ²-bench Telecom76%
74Grok Code Fast 1xAI · ClosedArtificial Analysis τ²-bench75.7%
75Grok 4xAI · ClosedArtificial Analysis τ²-bench74.9%
76Qwen3 MaxAlibaba · ClosedArtificial Analysis τ²-bench74.3%
77K-ExaoneLG AI Research · ClosedArtificial Analysis τ²-bench74.3%
78Claude Opus 4.7Anthropic · ClosedArtificial Analysis τ²-bench74%
79Claude 4.1 Opus ThinkingAnthropic · ClosedArtificial Analysis τ²-bench71.4%
80Mercury 2Inception · ClosedArtificial Analysis τ²-bench70.8%
81GPT-5 miniOpenAI · ClosedArtificial Analysis τ²-bench68.4%
82Nemotron 3 Super 120B A12BNVIDIA · Open weightArtificial Analysis τ²-bench67.8%
83Grok 4 Fast (Reasoning)xAI · ClosedArtificial Analysis τ²-bench65.8%
84GPT-OSS 120BOpenAI · Open weightArtificial Analysis τ²-bench65.8%
85Grok 4.1 FastxAI · ClosedArtificial Analysis τ²-bench63.7%
86o1OpenAI · ClosedArtificial Analysis τ²-bench62.6%
87Kimi K2Moonshot AI · ClosedArtificial Analysis τ²-bench61.1%
88GPT-OSS 20BOpenAI · Open weightArtificial Analysis τ²-bench60.2%
89Gemma 4 31BGoogle · Open weightArtificial Analysis τ²-bench59.9%
90Gemini 2.5 ProGoogle · ClosedArtificial Analysis τ²-bench54.1%
91GPT-4.1 miniOpenAI · ClosedArtificial Analysis τ²-bench52.9%
92Claude 4 SonnetAnthropic · ClosedArtificial Analysis τ²-bench52.3%
93GPT-4.1OpenAI · ClosedArtificial Analysis τ²-bench47.1%
94Sarvam 105BSarvam · Open weightArtificial Analysis τ²-bench46.8%
95GLM-4.5-AirZ.AI · ClosedArtificial Analysis τ²-bench46.5%
96Nemotron 3 Nano Omni 30B A3BNVIDIA · Open weightτ²-bench Telecom45.3%
97Gemma 4 26B A4BGoogle · Open weightArtificial Analysis τ²-bench43.6%
98Gemini 3 FlashGoogle · ClosedArtificial Analysis τ²-bench43.3%
99Mistral Small 4Mistral · Open weightArtificial Analysis τ²-bench41.2%
100Mistral Small 4 (Reasoning)Mistral · Open weightArtificial Analysis τ²-bench41.2%
101Nemotron 3 Nano 30BNVIDIA · Open weightArtificial Analysis τ²-bench40.9%
102DeepSeek V3.1 (Reasoning)DeepSeek · Open weightArtificial Analysis τ²-bench37.4%
103DeepSeek-R1DeepSeek · Open weightArtificial Analysis τ²-bench36.5%
104GPT-5 nanoOpenAI · ClosedArtificial Analysis τ²-bench36.5%
105Gemma 4 12BGoogle · Open weightArtificial Analysis τ²-bench36.3%
106DeepSeek V3.1DeepSeek · Open weightArtificial Analysis τ²-bench34.8%
107Sarvam 30BSarvam · Open weightArtificial Analysis τ²-bench34.5%
108MiniMax M1 80kMiniMax · ClosedArtificial Analysis τ²-bench34.2%
109Solar Pro 2Upstage · ClosedArtificial Analysis τ²-bench31.9%
110Gemini 3.1 Flash-LiteGoogle · ClosedArtificial Analysis τ²-bench31.3%
111Mistral Large 2Mistral · ClosedArtificial Analysis τ²-bench30.7%
112o3-miniOpenAI · ClosedArtificial Analysis τ²-bench28.7%
113Ministral 3 14B (Reasoning)Mistral · Open weightArtificial Analysis τ²-bench27.2%
114Ministral 3 14BMistral · Open weightArtificial Analysis τ²-bench27.2%
115Ministral 3 8B (Reasoning)Mistral · Open weightArtificial Analysis τ²-bench26.6%
116Ministral 3 8BMistral · Open weightArtificial Analysis τ²-bench26.6%
117GPT-4oOpenAI · ClosedArtificial Analysis τ²-bench25.1%
118Ministral 3 3B (Reasoning)Mistral · Open weightArtificial Analysis τ²-bench24.9%
119Ministral 3 3BMistral · Open weightArtificial Analysis τ²-bench24.9%
120Mistral Large 3Mistral · ClosedArtificial Analysis τ²-bench24.6%
121Mistral Medium 3Mistral · ClosedArtificial Analysis τ²-bench24.3%
122DeepSeek V3DeepSeek · Open weightArtificial Analysis τ²-bench22.8%
123Granite-4.0-1BIBM · Open weightArtificial Analysis τ²-bench22.8%
124Claude 3 HaikuAnthropic · ClosedArtificial Analysis τ²-bench21.1%
125Gemma 4 E2BGoogle · Open weightArtificial Analysis τ²-bench20.8%
126Gemma 4 E4BGoogle · Open weightArtificial Analysis τ²-bench20.8%
127Exaone 4.0 1.2BLG AI Research · Open weightArtificial Analysis τ²-bench20.5%
128Granite-4.0-H-1BIBM · Open weightArtificial Analysis τ²-bench19.6%
129LFM2.5-1.2B-ThinkingLiquidAI · ClosedArtificial Analysis τ²-bench19.6%
130Llama 3.1 405BMeta · Open weightArtificial Analysis τ²-bench19%
131Llama 4 MaverickMeta · Open weightArtificial Analysis τ²-bench17.8%
132GPT-4.1 nanoOpenAI · ClosedArtificial Analysis τ²-bench17.3%
133LFM2.5-8B-A1BLiquidAI · Open weightτ²-bench Telecom16.1%
134Llama 4 ScoutMeta · Open weightArtificial Analysis τ²-bench15.5%
135Gemini 2.5 FlashGoogle · ClosedArtificial Analysis τ²-bench14.9%
136Granite-4.0-H-350MIBM · Open weightArtificial Analysis τ²-bench14.6%
137Nova ProAmazon · ClosedArtificial Analysis τ²-bench14%
138Granite-4.0-350MIBM · Open weightArtificial Analysis τ²-bench13.2%
139Nemotron Ultra 253BNVIDIA · Open weightArtificial Analysis τ²-bench11.4%
140LFM2-24B-A2BLiquidAI · ClosedArtificial Analysis τ²-bench11.1%
141LFM2.5-1.2B-InstructLiquidAI · ClosedArtificial Analysis τ²-bench10.8%
142Gemma 3 27BGoogle · Open weightArtificial Analysis τ²-bench10.5%
143LFM2.5-VL-1.6B-ExtractLiquidAI · Open weightArtificial Analysis τ²-bench8.5%
144Exaone 4.0 32BLG AI Research · Open weightArtificial Analysis τ²-bench4.1%
145Phi-4Microsoft · Open weightArtificial Analysis τ²-bench0%