context.vn
Menu

tau2 Bench

148 models evaluated

#ModelProviderTypeScore
2GPT-5.4OpenAIProprietaryτ²-bench Telecom
4Claude Fable 5Anthropic · ClosedArtificial Analysis τ²-bench98.5%
5GLM-5-TurboZ.AI · ClosedArtificial Analysis τ²-bench98.5%
6GLM-5V-TurboZ.AI · ClosedArtificial Analysis τ²-bench98.5%
7Step 3.7 FlashStepFun · Open weightArtificial Analysis τ²-bench98.5%
8GLM-5Z.AI · Open weightArtificial Analysis τ²-bench98.2%
9GPT-5.5OpenAI · Closedτ²-bench Telecom98%
10GLM-5.1Z.AI · Open weightArtificial Analysis τ²-bench97.7%
11Qwen3.6 PlusAlibaba · ClosedArtificial Analysis τ²-bench97.7%
12Grok 4.3xAI · ClosedArtificial Analysis τ²-bench97.7%
13DeepSeek V4 Pro 0813DeepSeek · ClosedArtificial Analysis τ²-bench96.2%
14Kimi K2.6Moonshot AI · Open weightArtificial Analysis τ²-bench95.9%
15Kimi K2.5Moonshot AI · Open weightArtificial Analysis τ²-bench95.9%
16GLM-4.7Z.AI · Open weightArtificial Analysis τ²-bench95.9%
17Qwen 3.6 Max (preview)Alibaba · ClosedArtificial Analysis τ²-bench95.9%
18Kimi K2.5 (Reasoning)Moonshot AI · ClosedArtificial Analysis τ²-bench95.9%
19Gemini 3.1 ProGoogle · Closedτ²-bench published setup95.6%
20Gemini 3.5 FlashGoogle · ClosedArtificial Analysis τ²-bench95.3%
21Qwen3.6-35B-A3BAlibaba · Open weightArtificial Analysis τ²-bench95.3%
22MiniMax M2.5MiniMax · ClosedArtificial Analysis τ²-bench95.3%
23MiMo-V2-ProXiaomi · ClosedArtificial Analysis τ²-bench95%
24Qwen3.7 MaxAlibaba · ClosedArtificial Analysis τ²-bench94.7%
25Claude Opus 4.8Anthropic · ClosedArtificial Analysis τ²-bench94.4%
26Mistral Medium 3.5 128BMistral · Open weightArtificial Analysis τ²-bench94.2%
27Qwen3.6-27BAlibaba · Open weightArtificial Analysis τ²-bench94.2%
28MiMo-V2.5-ProXiaomi · ClosedArtificial Analysis τ²-bench94.2%
30Qwen3.5-27BAlibaba · Open weightArtificial Analysis τ²-bench93.9%
31Qwen3.5-122B-A10BAlibaba · Open weightArtificial Analysis τ²-bench93.6%
32GPT-5.4 miniOpenAI · Closedτ²-bench Telecom93.4%
33Grok 4.1 Fast (Reasoning)xAI · ClosedArtificial Analysis τ²-bench93.3%
34Qwen3.7 PlusAlibaba · ClosedArtificial Analysis τ²-bench93%
35GPT-5.4 nanoOpenAI · Closedτ²-bench Telecom92.5%
36GPT-5.2-CodexOpenAI · ClosedArtificial Analysis τ²-bench92.1%
37Claude Opus 4.6 (Adaptive)Anthropic · ClosedArtificial Analysis τ²-bench92.1%
38Muse SparkMeta · Closedτ²-bench published setup91.5%
39MiMo-V2-OmniXiaomi · ClosedArtificial Analysis τ²-bench91.2%
40Kimi K2.7 CodeMoonshot AI · Open weightArtificial Analysis τ²-bench90.1%
41Trinity-Large-ThinkingArcee AI · Open weightArtificial Analysis τ²-bench90.1%
42Trinity-Large-PreviewArcee AI · Open weightArtificial Analysis τ²-bench90.1%
43Claude Opus 4.5 ThinkingAnthropic · ClosedArtificial Analysis τ²-bench89.5%
44Qwen3.5-35B-A3BAlibaba · Open weightArtificial Analysis τ²-bench89.2%
45MiniMax M3MiniMax · Open weightArtificial Analysis τ²-bench88.9%
46Claude Opus 4.7 (Adaptive)Anthropic · ClosedArtificial Analysis τ²-bench88.6%
47LFM2.5-8B-A1BLiquidAI · Open weightτ²-bench Telecom88.1%
48Step 3.5 FlashStepFun · Open weightArtificial Analysis τ²-bench87.4%
49Gemini 3 ProGoogle · ClosedArtificial Analysis τ²-bench87.1%
50GPT-5 (medium)OpenAI · ClosedArtificial Analysis τ²-bench86.5%
51GPT-5.6 TerraOpenAI · ClosedArtificial Analysis τ²-bench86.3%
52Claude Opus 4.5Anthropic · ClosedArtificial Analysis τ²-bench86.3%
53Solar Pro 3Upstage · ClosedArtificial Analysis τ²-bench86.3%
54GPT-5.3 CodexOpenAI · ClosedArtificial Analysis τ²-bench86%
55Ling 2.6 FlashInclusionAI · Open weightArtificial Analysis τ²-bench86%
56GPT-5.3-Codex-SparkOpenAI · ClosedArtificial Analysis τ²-bench86%
57GPT-5.6 SolOpenAI · ClosedArtificial Analysis τ²-bench85.1%
58Command A+Cohere · Open weightτ²-bench Telecom85%
59Claude Opus 4.6Anthropic · ClosedArtificial Analysis τ²-bench84.8%
60MiniMax M2.7MiniMax · Open weightArtificial Analysis τ²-bench84.8%
61GPT-5.2OpenAI · ClosedArtificial Analysis τ²-bench84.8%
62GPT-5 (high)OpenAI · ClosedArtificial Analysis τ²-bench84.8%
63Qwen3.5 397BAlibaba · Open weightArtificial Analysis τ²-bench83.9%
64MiMo-V2-FlashXiaomi · Open weightArtificial Analysis τ²-bench83.9%
65Qwen3.5 397B (Reasoning)Alibaba · Open weightArtificial Analysis τ²-bench83.9%
66Nemotron 3 UltraNVIDIA · Open weightArtificial Analysis τ²-bench83.3%
67GPT-5.1-CodexOpenAI · ClosedArtificial Analysis τ²-bench83%
68GPT-5.1-Codex-MaxOpenAI · ClosedArtificial Analysis τ²-bench83%
69GPT-5.1OpenAI · ClosedArtificial Analysis τ²-bench81.9%
70o3OpenAI · ClosedArtificial Analysis τ²-bench80.7%
71LLaDA2.2-flashInclusionAI · Open weightτ²-bench published setup80.3%
72Ternary Bonsai 2 27BPrism ML · Open weightτ²-bench Telecom80.2%
73Claude Sonnet 4.6Anthropic · ClosedArtificial Analysis τ²-bench79.5%
74DeepSeek V3.2DeepSeek · Open weightArtificial Analysis τ²-bench78.9%
75Agents-A1-4BInternScience · Open weightτ²-bench published setup78.2%
76GLM-4.6Z.AI · Open weightArtificial Analysis τ²-bench76.9%
77Grok Code Fast 1xAI · ClosedArtificial Analysis τ²-bench75.7%
78Grok 4xAI · ClosedArtificial Analysis τ²-bench74.9%
79K-ExaoneLG AI Research · ClosedArtificial Analysis τ²-bench74.3%
80Qwen3 MaxAlibaba · ClosedArtificial Analysis τ²-bench74.3%
81Claude Opus 4.7Anthropic · ClosedArtificial Analysis τ²-bench74%
82Claude 4.1 Opus ThinkingAnthropic · ClosedArtificial Analysis τ²-bench71.4%
83Mercury 2Inception · ClosedArtificial Analysis τ²-bench70.8%
84GPT-5 miniOpenAI · ClosedArtificial Analysis τ²-bench68.4%
85Nemotron 3 Super 100BNVIDIA · Open weightArtificial Analysis τ²-bench67.8%
86Nemotron 3 Super 120B A12BNVIDIA · Open weightArtificial Analysis τ²-bench67.8%
87Grok 4 Fast (Reasoning)xAI · ClosedArtificial Analysis τ²-bench65.8%
88GPT-OSS 120BOpenAI · Open weightArtificial Analysis τ²-bench65.8%
89Grok 4.1 FastxAI · ClosedArtificial Analysis τ²-bench63.7%
90o1OpenAI · ClosedArtificial Analysis τ²-bench62.6%
91Kimi K2Moonshot AI · ClosedArtificial Analysis τ²-bench61.1%
92GPT-OSS 20BOpenAI · Open weightArtificial Analysis τ²-bench60.2%
93Gemma 4 31BGoogle · Open weightArtificial Analysis τ²-bench59.9%
94LLaDA2.2-miniInclusionAI · Open weightτ²-bench published setup57.5%
95Gemini 2.5 ProGoogle · ClosedArtificial Analysis τ²-bench54.1%
96GPT-4.1 miniOpenAI · ClosedArtificial Analysis τ²-bench52.9%
97Claude 4 SonnetAnthropic · ClosedArtificial Analysis τ²-bench52.3%
98GPT-4.1OpenAI · ClosedArtificial Analysis τ²-bench47.1%
99Sarvam 105BSarvam · Open weightArtificial Analysis τ²-bench46.8%
100GLM-4.5-AirZ.AI · ClosedArtificial Analysis τ²-bench46.5%
101Nemotron 3 Nano Omni 30B A3BNVIDIA · Open weightτ²-bench Telecom45.3%
102Gemma 4 26B A4BGoogle · Open weightArtificial Analysis τ²-bench43.6%
103Gemini 3 FlashGoogle · ClosedArtificial Analysis τ²-bench43.3%
104Mistral Small 4Mistral · Open weightArtificial Analysis τ²-bench41.2%
105Mistral Small 4 (Reasoning)Mistral · Open weightArtificial Analysis τ²-bench41.2%
106Nemotron 3 Nano 30BNVIDIA · Open weightArtificial Analysis τ²-bench40.9%
107DeepSeek V3.1 (Reasoning)DeepSeek · Open weightArtificial Analysis τ²-bench37.4%
108North Mini CodeCohere · Open weightArtificial Analysis τ²-bench37.4%
109DeepSeek-R1DeepSeek · Open weightArtificial Analysis τ²-bench36.5%
110GPT-5 nanoOpenAI · ClosedArtificial Analysis τ²-bench36.5%
111Gemma 4 12BGoogle · Open weightArtificial Analysis τ²-bench36.3%
112DeepSeek V3.1DeepSeek · Open weightArtificial Analysis τ²-bench34.8%
113Sarvam 30BSarvam · Open weightArtificial Analysis τ²-bench34.5%
114MiniMax M1 80kMiniMax · ClosedArtificial Analysis τ²-bench34.2%
115Solar Pro 2Upstage · ClosedArtificial Analysis τ²-bench31.9%
116Mistral Large 2Mistral · ClosedArtificial Analysis τ²-bench30.7%
117o3-miniOpenAI · ClosedArtificial Analysis τ²-bench28.7%
118Ministral 3 14B (Reasoning)Mistral · Open weightArtificial Analysis τ²-bench27.2%
119Ministral 3 14BMistral · Open weightArtificial Analysis τ²-bench27.2%
120Ultravox v0.6 Llama 3.3 70BFixie AI · Open weightArtificial Analysis τ²-bench26.6%
121Ministral 3 8B (Reasoning)Mistral · Open weightArtificial Analysis τ²-bench26.6%
122Ministral 3 8BMistral · Open weightArtificial Analysis τ²-bench26.6%
123GPT-4oOpenAI · ClosedArtificial Analysis τ²-bench25.1%
124Ministral 3 3B (Reasoning)Mistral · Open weightArtificial Analysis τ²-bench24.9%
125Ministral 3 3BMistral · Open weightArtificial Analysis τ²-bench24.9%
126Mistral Large 3Mistral · ClosedArtificial Analysis τ²-bench24.6%
127Mistral Medium 3Mistral · ClosedArtificial Analysis τ²-bench24.3%
128DeepSeek V3DeepSeek · Open weightArtificial Analysis τ²-bench22.8%
129Qwen3-Omni-30B-A3B-ThinkingAlibaba · Open weightArtificial Analysis τ²-bench21.3%
130Claude 3 HaikuAnthropic · ClosedArtificial Analysis τ²-bench21.1%
131Gemma 4 E4BGoogle · Open weightArtificial Analysis τ²-bench20.8%
132Gemma 4 E2BGoogle · Open weightArtificial Analysis τ²-bench20.8%
133Exaone 4.0 1.2BLG AI Research · Open weightArtificial Analysis τ²-bench20.5%
134Granite-4.0-H-1BIBM · Open weightArtificial Analysis τ²-bench19.6%
135LFM2.5-1.2B-ThinkingLiquidAI · ClosedArtificial Analysis τ²-bench19.6%
136Llama 3.1 405BMeta · Open weightArtificial Analysis τ²-bench19%
137Llama 4 MaverickMeta · Open weightArtificial Analysis τ²-bench17.8%
138GPT-4.1 nanoOpenAI · ClosedArtificial Analysis τ²-bench17.3%
139Qwen3-Omni-30B-A3B-InstructAlibaba · Open weightArtificial Analysis τ²-bench16.4%
140Llama 4 ScoutMeta · Open weightArtificial Analysis τ²-bench15.5%
141Gemini 2.5 FlashGoogle · ClosedArtificial Analysis τ²-bench14.9%
142Granite-4.0-H-350MIBM · Open weightArtificial Analysis τ²-bench14.6%
143Nova ProAmazon · ClosedArtificial Analysis τ²-bench14%
144Granite-4.0-350MIBM · Open weightArtificial Analysis τ²-bench13.2%
145Nemotron Ultra 253BNVIDIA · Open weightArtificial Analysis τ²-bench11.4%
146LFM2-24B-A2BLiquidAI · ClosedArtificial Analysis τ²-bench11.1%
147LFM2.5-1.2B-InstructLiquidAI · ClosedArtificial Analysis τ²-bench10.8%
148Gemma 3 27BGoogle · Open weightArtificial Analysis τ²-bench10.5%
149LFM2.5-VL-1.6B-ExtractLiquidAI · Open weightArtificial Analysis τ²-bench8.5%
150Exaone 4.0 32BLG AI Research · Open weightArtificial Analysis τ²-bench4.1%
151Phi-4Microsoft · Open weightArtificial Analysis τ²-bench0%