现在很多人喜欢用一个大模型去给另一个 AI 的答案打分、当"裁判",省得人工标注。但这篇论文点破一个容易被忽视的真相:裁判其实是个"隐形的解题者"——它判断对错的能力,根本上受限于它自己解这道题的能力。换句话说,它自己都不会做的题,就别指望它能判准。作者还给出一条硬性门槛:如果一道题有 k 种可能答案,裁判的真实水平必须高过 1/k(也就是比瞎猜强),否则它打的分和掷骰子没什么区别。更要警惕的是,模型在公开榜单上的高分,会高估它在实战里真正有用的判断力。为此他们设计了一个不干扰运行、成本很低的"探针",能在正式部署前就给裁判做个体检、预判它会在哪类题上判错。一句话:会给分,不代表判得准——用 AI 当裁判前,先掂量掂量它到底会不会做这道题。