Leaderboard

Main capability ranking. Our hardest, sealed questions.

BoardHeld-outPracticeReference

Edition v5 · cut 7/28/2026 · 40 models · 109 questions · 63 cells imputed (worst-of-others)

Per-model aggregate

Mean Cramér-log is the ranking metric (lower is better), scored against the verified ground-truth distribution. The Answered column shows real vs imputed; a malformed or unscorable answer counts as unanswered.

#ModelMean CramérAnsweredRan
1anthropic/claude-opus-50.2939109/1097/28/2026
2meta/muse-spark-1.10.3090109/1097/28/2026
3openai/gpt-5.6-sol0.3157109/1097/28/2026
4openai/gpt-5.50.3245109/1097/28/2026
5anthropic/claude-opus-4.80.3309109/1097/28/2026
6openai/gpt-5.6-terra0.3625109/1097/28/2026
7openai/gpt-5.6-terra-pro0.3628109/1097/28/2026
8google/gemini-3.5-flash0.3770109/1097/29/2026
9openai/gpt-5.6-luna0.3785109/1097/28/2026
10openai/gpt-50.3899109/1097/28/2026
11qwen/qwen3.7-max0.3975109/1097/28/2026
12z-ai/glm-5.20.3993109/1097/28/2026
13openai/gpt-5.10.4011109/1097/28/2026
14deepseek/deepseek-v4-pro0.4029109/1097/28/2026
15openai/o30.4033109/1097/28/2026
16moonshotai/kimi-k30.4117108/109 · 1 imp7/28/2026
17x-ai/grok-4.50.4193109/1097/28/2026
18moonshotai/kimi-k2.60.4369108/109 · 1 imp7/28/2026
19moonshotai/kimi-k2-thinking0.4433109/1097/28/2026
20~google/gemini-pro-latest0.4546109/1097/28/2026
21anthropic/claude-sonnet-50.4615109/1097/28/2026
22google/gemini-3.1-pro-preview0.4641109/1097/29/2026
23minimax/minimax-m2.70.4722109/1097/28/2026
24moonshotai/kimi-k20.4895109/1097/28/2026
25qwen/qwen3-235b-a22b-thinking-25070.5475109/1097/28/2026
26mistralai/mistral-medium-3-50.5590109/1097/29/2026
27openai/gpt-5-mini0.5752109/1097/28/2026
28x-ai/grok-4.30.5920109/1097/29/2026
29deepseek/deepseek-r1-05280.6227109/1097/28/2026
30deepseek/deepseek-r10.6284109/1097/28/2026
31mistralai/mistral-large-25120.7004109/1097/28/2026
32openai/gpt-oss-120b0.7169109/1097/29/2026
33deepseek/deepseek-v3.20.7722103/109 · 6 imp7/28/2026
34minimax/minimax-m30.7855109/1097/28/2026
35anthropic/claude-haiku-4.50.8382109/1097/28/2026
36minimax/minimax-m20.9556108/109 · 1 imp7/28/2026
37meta-llama/llama-4-maverick0.9833108/109 · 1 imp7/28/2026
38openai/gpt-oss-20b1.1611109/1097/28/2026
39anthropic/claude-fable-51.918263/109 · 46 imp7/28/2026
40meta-llama/llama-4-scout2.2418102/109 · 7 imp7/28/2026

Scores over time

Mean Cramér vs. release date. No per-question breakdown here — the held-out set stays sealed, so each dot’s hover card shows only its aggregate score.

0.00.51.01.52.02.5Jan 2025Oct 2025Jul 2026release date →↑ better · mean Cramér-logbest so farDeepSeek R1Llama 4 ScoutLlama 4 Mavericko3Deepseek r1 0528Kimi k2qwen3 235b a22b Thinking 2507Gpt Oss 20bGpt Oss 120bGpt 5 MiniGpt 5Claude Haiku 4.5Minimax m2Kimi k2 ThinkingGPT-5.1Deepseek v3.2Mistral Large 2512Gemini 3.1 Pro PreviewMinimax m2.7Kimi k2.6Deepseek v4 ProGpt 5.5Gemini Pro LatestMistral Medium 3 5Grok 4.3Gemini 3.5 Flashqwen3.7 MaxClaude Opus 4.8Minimax m3Claude Fable 5Glm 5.2Claude Sonnet 5Grok 4.5Gpt 5.6 SolGpt 5.6 TerraGpt 5.6 Terra ProGpt 5.6 LunaMuse Spark 1.1Kimi k3Claude Opus 5
  • OpenAI
  • Anthropic
  • Google DeepMind
  • DeepSeek
  • Meta
  • Other