Исследования
Исследование — это продукт, а не маркетинг
Финансовое машинное обучение легко обмануть — и легко обмануться самому. Большая часть того, что выглядит как преимущество в бэктесте, на деле оказывается утечкой данных, везением или незаметно изменившимся правилом оценки. Наш исследовательский процесс существует, чтобы исключить это прежде, чем чему-либо начнут доверять.
Почему финансовому ML нужен строгий контроль утечек
Модель, которая хотя бы косвенно «увидела» информацию из будущего, будет выглядеть лучше, чем есть на самом деле. Поскольку рыночные данные последовательны и автокоррелированы, утечку легко внести случайно — через общий scaler, признак с забегающим вперёд окном или метку, заглядывающую за точку принятия решения. Мы относимся к предотвращению утечек как к требованию первого порядка, а не как к второстепенной задаче.
Хронологическое тестирование
Каждый шаг разбиения, обучения и оценки следует порядку времени. Ничто из более позднего периода не используется для более раннего решения — включая предобработку и подбор гиперпараметров.
Исследование и принятие в Production разделены
Метод, хорошо показавший себя в исследовании, — это исследовательский результат, а не заявление о готовности к Production. Продвижение от исследования к любому более доверенному статусу — отдельное, явное решение, никогда не выводимое автоматически из хорошей метрики.
Отрицательные результаты
Большинство протестированных методов не проходят отбор. Мы фиксируем почему: какая проверка не пройдена, какое допущение нарушилось, каких доказательств не хватило. Понятый отрицательный результат ценнее непонятого положительного.
Сравнение моделей и методов
Модели-кандидаты и методы сравниваются по одним и тем же зафиксированным правилам и одним и тем же границам данных, чтобы различия отражали сам метод, а не несогласованную настройку оценки.
Независимые аудиты
Значимые исследовательские выводы проверяет тот, кто не участвовал в создании проверяемого — с проверкой хэшей, разбиений, предсказаний и метрик, а не с доверием к самоотчёту.
Устойчивость и каузальная реконструкция
Принятые методы проверяются на устойчивость к сдвигам уровня и масштаба, шуму, пропускам данных и временной экстраполяции, а признаки восстанавливаются так, чтобы отражать только каузально доступную на каждый момент времени информацию.
Почему неудачные эксперименты улучшают систему
Отклонённый метод всё равно учит нас чему-то — о данных, о рыночном режиме или о слепом пятне в нашем собственном процессе. Публикация этого урока — часть Build in Public, и часть того, почему нашим принятым результатам можно доверять больше, а не меньше.
Лестница доказательств
Результат не становится заявлением просто потому, что он интересен. Он поднимается по этой лестнице — по одной ступени, по порядку — либо не продвигается вообще.
Гипотеза
Идея-кандидат или метод формализуется по явному, версионированному контракту прежде, чем данные вообще затронуты.
Бэктест
Идея тестируется на исторических данных по зафиксированным, безопасным от утечек правилам оценки, определённым до того, как виден результат.
Безопасная от утечек walk-forward валидация
Хронологическая, каузально реконструированная валидация подтверждает, что результат — не артефакт самой настройки оценки.
Независимый аудит
Рецензент, не создававший метод, проверяет хэши, разбиения, предсказания и метрики — а не самоотчёт.
Финальное одобрение
Отдельное, явное решение принимает, отклоняет или отправляет результат на доработку. Ничто не продвигает себя само.
Live-paper наблюдение
Только после принятия поведение метода наблюдается на живом рынке — по-прежнему виртуально, по-прежнему публично отчитывается.
Наша позиция
Tantoryn AI не пытается заново изобрести машинное обучение. Мы используем сильные существующие исследования и проверенные методы, а затем применяем специфичную для Tantoryn каузальную, безопасную от утечек валидацию и тестирование совместимости, прежде чем чему-либо доверить реальные рыночные решения.
Помимо исследовательской дисциплины — смотрите живые отчёты MAIN/SHADOW →