研究者为自己的成果打分是一种广为人知的失效模式,这并非因为人们不诚实,而是因为要看清自己亲手构建、并希望其成功运作的东西中存在的缺陷,确实非常困难。因此,仅凭自我报告从来无法决定任何重大事项。
任何可能影响系统行为的重大研究或工程成果 —— 一个新的模型系列、一份新的评估合约、一次运行环境变更 —— 在获得最终批准之前,都会由未参与构建该成果的人员进行审查。该审查直接核实底层证据:哈希值、数据划分、预测结果与指标,而不仅仅是摘要。一组有限的、按具体情况界定并披露的例外情形,会直接通过一项正式的治理决定来关闭 —— 无论哪种情况,正式批准始终是必需的。
这一流程会定期给出反馈意见,有时甚至是彻底否决。这并非流程的失败 —— 恰恰是流程在正常发挥作用。一项结果之所以在通过独立审查后更值得信赖,正是因为它确实有被否决的真实可能性。
我们将这种纪律视为产品的一部分,而不是内部的官僚程序。这正是我们能够有信心地在本网站上公开研究结论(包括那些不尽如人意的结论)的原因之一。