context.vn
Menu

blueprint Bench2

26 models evaluated

#ModelProviderTypeScore
1GPT-6 AstraOpenAIProprietary49.7%
2Claude Fable 5.1AnthropicProprietary41.9%
3Claude Fable 5AnthropicProprietary38.6%
4Gemini 3.8 FlashGoogle · Closed38.6%
5GPT-5.5OpenAI · Closed36.2%
6Gemini 3.5 FlashGoogle · Closed33.6%
7GPT-5.6 SolOpenAI · Closed33.6%
8Grok 4.6xAI · Closed33.2%
9Gemini 3.6 FlashGoogle · Closed31.2%
10GPT-5.6 TerraOpenAI · Closed30.8%
11Claude Opus 5Anthropic · Closed30.4%
12Kimi K3Moonshot AI · Closed29.5%
13Grok 4.5xAI · Closed27.3%
14GPT-5.4OpenAI · Closed27.1%
15Gemini 3.1 ProGoogle · Closed26.5%
16Claude Sonnet 5Anthropic · Closed24.9%
17Claude Opus 4.7Anthropic · Closed24.5%
18GPT-5.6 LunaOpenAI · Closed22.6%
19Claude Opus 4.8Anthropic · Closed14.5%
20Claude Sonnet 4.6Anthropic · Closed6.7%
21Kimi K2.6Moonshot AI · Open weight3.9%
22Gemini 3 FlashGoogle · Closed0.0%
23Grok 4.3xAI · Closed0.0%
24Gemini Robotics-ER 1.6Google0.0%
25Claude Haiku 4.5Anthropic · Closed0.0%
26Grok 4.20xAI · Closed0.0%