Skip to content

The causal AI
leaderboard.

43 published human studies replicated across 9 domains, failures included. Every research report carries its own confidence grade.

// Read this first

What the scores mean.

Each score compares a reconstructed experiment with the original human study. Rank order, effect direction, parameter distance, and uncertainty measure different parts of the match.

Every research report carries its own confidence grade. The models are checked every week against held-out people and observed outcomes from data partners.

Read the paper
43Published studies passing design filters
WeeklyValidation against real people
GradedConfidence on every report

Live rankings

Swipe to compare

Claude Sonnet (Databricks)56.7840.0782.6319
GPT-4 (Azure OpenAI)55.6246.0278.2119
Claude Sonnet (Databricks)54.6345.7970.9523
Gemini Flash (Google)54.6323.8481.5919
GPT-4 (Azure OpenAI)53.8735.2773.222
Claude Haiku (Databricks)53.6239.9276.6019
GPT-3 Instruct (Azure OpenAI)52.7941.5075.9718
GPT-4 (Azure OpenAI)52.6734.9278.749
Gemini (Google)51.0933.4676.839
Claude Sonnet (Databricks)50.8228.5477.559
Similarity
Parameter proximity
Coverage
Confidence overlap
Match
Effect direction
Rank Corr.
Preference ordering
1 / 4