Un método que se ve brillante en un único backtest está, la mayoría de las veces, explotando algo que no sobrevivirá al contacto con el futuro: una feature filtrada, una división con suerte, o una regla de evaluación que se dobló silenciosamente hacia el resultado. Hemos aprendido a tratar un primer resultado inusualmente bueno como motivo de mayor escrutinio, no de menor.
Cuando es científicamente apropiado para el método que se está probando, nuestras verificaciones pueden incluir una ejecución de control intencionalmente filtrada: si una versión deliberadamente rota y que permite fugas de un experimento se desempeña sospechosamente cerca de la versión limpia, esa es una señal de que algo en el pipeline limpio podría no estar tan limpio como se suponía. Este es un diagnóstico dirigido, no un paso que ejecutamos en cada ciclo de investigación.
También exigimos evaluación cronológica en todo momento — el entrenamiento solo ve el pasado en relación con aquello contra lo que se está probando — y congelamos las reglas de evaluación antes de ver un resultado, de modo que el listón no pueda moverse para ajustarse a lo que los datos resultaron producir.
Finalmente, un método que sobrevive a todo esto todavía tiene que resistir pruebas de robustez: cambios de nivel y escala, ruido añadido, datos faltantes, y la exigencia de generalizar más allá de las condiciones exactas en las que fue construido. La mayoría de los métodos que pasan las primeras verificaciones pierden aquí parte de su brillo — y ese es precisamente el objetivo.