Метод, который выглядит блестяще в одном-единственном бэктесте, чаще всего эксплуатирует что-то, что не переживёт столкновения с будущим: утёкший признак, удачное разбиение или правило оценки, незаметно подогнанное под результат. Мы научились воспринимать необычно хороший первый результат как повод для более пристального внимания, а не для меньшего.

Там, где это научно оправдано для конкретного тестируемого метода, наши проверки могут включать намеренно «дырявый» контрольный прогон: если специально сломанная, допускающая утечку версия эксперимента показывает результат подозрительно близкий к «чистой» версии — это сигнал, что в чистом конвейере, возможно, не всё так чисто, как предполагалось. Это точечная диагностика, а не шаг, который мы выполняем в каждом исследовательском цикле.

Мы также требуем хронологической оценки на всех этапах — обучение всегда видит только прошлое относительно того, на чём оно тестируется, — и фиксируем правила оценки прежде, чем виден результат, чтобы планку нельзя было подвинуть под то, что случайно получилось из данных.

Наконец, метод, переживший всё это, всё равно должен выдержать тестирование устойчивости: сдвиги уровня и масштаба, добавленный шум, пропуски в данных и требование обобщаться за пределы тех условий, на которых он был построен. Большинство методов, прошедших первые проверки, здесь теряют часть своего блеска — в этом и смысл.