program Bench
17 models evaluated
|
| 1 | Claude Opus 5 | Anthropic | Proprietary | 37.0% | |
| 2 | Claude Opus 4.8 | Anthropic | Proprietary | 16.5% | |
| 3 | GPT-5.6 Sol | OpenAI | Proprietary | 15.5% | |
| 4 | GPT-5.5 | OpenAI · Closed | 13.5% | | |
| 5 | GLM-5.2 | Z.AI · Open weight | 8.5% | | |
| 6 | Gemini 3.7 Flash | Google · Closed | 5.5% | | |
| 8 | Claude Opus 4.7 | Anthropic · Closed | 4.5% | | |
| 9 | Gemini 3.6 Flash | Google · Closed | 4.0% | | |
| 10 | Gemini 3.5 Flash | Google · Closed | 3.0% | | |
| 13 | Claude Opus 4.6 | Anthropic · Closed | 2.5% | | |
| 15 | Claude Sonnet 4.6 | Anthropic · Closed | 1.0% | | |
| 16 | GPT-5.4 | OpenAI · Closed | 0.0% | | |
| 17 | Gemini 3.1 Pro | Google · Closed | 0.0% | | |
| 18 | Gemini 3 Flash | Google · Closed | 0.0% | | |
| 19 | Claude Haiku 4.5 | Anthropic · Closed | 0.0% | | |
| 20 | GPT-5.4 mini | OpenAI · Closed | 0.0% | | |
| 21 | GPT-5 mini | OpenAI · Closed | 0.0% | | |