Um pesquisador avaliando seu próprio trabalho é um modo de falha bem conhecido, não porque as pessoas sejam desonestas, mas porque é genuinamente difícil enxergar as falhas em algo que você construiu e quer que funcione. Por isso, o autorrelato sozinho nunca decide nada material.

A maioria dos resultados de pesquisa ou engenharia que poderiam afetar o que o sistema faz — uma nova família de modelos, um novo contrato de avaliação, uma mudança de runtime — passa por revisão de alguém que não construiu o que está sendo revisado, antes que a aprovação final seja concedida. Essa revisão verifica a evidência subjacente diretamente: hashes, divisões de dados, predições e métricas, não apenas o resumo. Um conjunto limitado de exceções, delimitadas e divulgadas caso a caso, é fechado diretamente por meio de uma decisão formal de governança — a aprovação formal continua sendo exigida de qualquer forma.

Esse processo regularmente traz apontamentos, e às vezes uma rejeição total. Isso não é uma falha do processo — é o processo funcionando. Um resultado que sobrevive à revisão independente é mais confiável precisamente porque teve uma chance real de ser recusado.

Tratamos essa disciplina como parte do produto, não como burocracia interna. É uma das razões pelas quais podemos publicar conclusões de pesquisa neste site com confiança, incluindo aquelas que não saíram como gostaríamos.