The design of the set — what it asks, how it is scored, whether it leaked into training — determines what a leaderboard number actually means. A saturated or contaminated benchmark can show progress that does not transfer to real tasks. Held-out private tests exist because public sets get memorized.