Последние три недели в Tantoryn AI были посвящены сразу нескольким направлениям: развитию публичной части проекта, подготовке к расширению команды и продолжению большого цикла исследований машинного обучения.
Готовимся к следующему этапу развития проекта
По мере роста Tantoryn AI мы начали приводить внутреннюю организацию проекта в форму, рассчитанную уже не только на работу основателя, но и на подключение новых участников.
Мы систематизировали описание архитектуры и направлений проекта, актуализировали roadmap и начали формировать отдельный контекст для будущих членов команды. В roadmap при этом принципиально разделены порядок развития и ориентировочные даты: последовательность этапов важнее попытки заранее привязать исследовательскую работу к жёсткому календарю.
Параллельно идёт подготовка к расширению команды. В числе первых рассматриваемых направлений — Lead Developer и Community Manager.
Для Community Manager постепенно формируется отдельный публичный контур: сайт, публикации, социальные площадки и обратная связь с аудиторией. В дальнейшем часть этой работы планируется поддерживать через TAICM — Tantoryn AI Community Manager, но публикации и ответы по-прежнему должны проходить через человеческое подтверждение. Сам TAICM пока является направлением развития, а не запущенной системой.
Публичная часть тоже стала больше
За это время мы продолжили развивать модель Public Build with Controlled Disclosure.
Её принцип достаточно простой: рассказывать не только об успешных результатах, но и о ходе исследования, проверках, ошибочных гипотезах и причинах изменения решений — при этом не публиковать торговое ядро, закрытые данные и детали, которые фактически раскрывали бы алгоритм системы.
На сайте были расширены контакты и ссылки на публичные ресурсы проекта. Сейчас исследовательские материалы Tantoryn AI выходят на Дзен и Medium, используются HackerNoon и другие публичные площадки, а новости самого проекта остаются на tantoryn.com.
Это разделение для нас важно. Статья должна объяснять проблему независимо от Tantoryn AI. Новость проекта — показывать, где именно мы встретились с этой проблемой и что изменили в своей работе.
Поэтому мы стараемся не копировать один и тот же материал между площадками, а связывать научно-популярные публикации с практической историей разработки.
В ML (машинное обучение) мы прошли через несколько неудачных гипотез
При этом ML-работа привела нас к важному практическому выводу: сложная модель имеет ценность не потому, что она сложная, а только если её преимущество выдерживает честное сравнение с более простыми решениями.
Основная техническая работа последних недель была связана с ML Evaluator (оценивающий контур проекта на базе ИИ).
Мы последовательно проверяли разные семейства моделей и разные способы постановки задачи. Использовали временно разделённые этапы разработки и проверки, повторные обучения и заранее фиксируемые правила экспериментов.
Часть результатов выглядела перспективно с точки зрения способности моделей ранжировать рыночные состояния. Но дальнейшая проверка показала проблему: хорошее ML-ранжирование ещё не означает, что найдено экономически полезное преимущество.
Мы не стали превращать такой результат в заявление об успешной торговой модели. Вместо этого остановили соответствующее направление настройки и пересмотрели саму постановку задачи. Эта исследовательская ветка была закрыта как исторический эксперимент, без утверждений о прибыльности или готовности к реальной торговле.
Это привело к более фундаментальному изменению. Роль ML Evaluator была возвращена к более узкой задаче: оценивать вероятность успешного развития торгового сценария по состоянию рынка, а экономический результат всей системы проверять уже отдельно. Для этого была сформирована новая классификационная постановка, различающая неудачный, частично успешный и успешный исход.
Новая модель дала сигнал — но появилась следующая проблема
После изменения постановки мы подготовили новый цикл обучения и провели первую полную проверку одной из моделей.
Результат оказался полезным именно потому, что он не дал простого ответа «модель хорошая» или «модель плохая».
Модель действительно показала способность различать более и менее перспективные состояния рынка и прошла предусмотренные для этого этапа проверки.
Но одновременно мы сравнили её с гораздо более простым ориентиром, построенным на небольшой группе базовых характеристик рыночной ситуации.
Простой baseline оказался сильнее сложной ML-модели на ключевой независимой проверке.
Это не делает проведённое обучение бесполезным. Наоборот, такое сравнение показывает, что исследовательский контроль работает: дополнительная сложность пока не доказала, что создаёт дополнительную ценность.
Именно поэтому сейчас для нас важнее не пытаться любой ценой улучшить красивую цифру модели, а понять, какую информацию использует простой baseline и почему более сложная модель не смогла извлечь из данных больше.
Мы отдельно изучили эту проблему
Параллельно мы посмотрели, насколько такая ситуация характерна для современного financial ML. Оказалось, что это далеко не специфическая проблема Tantoryn AI.
Результатами этого исследования мы подробнее поделились в отдельной статье на Дзене: «Когда простой baseline побеждает AI: почему сложная модель не всегда лучше».
Свежие исследования финансовых временных рядов показывают смешанную картину: современные нейронные и Transformer-подходы действительно способны превосходить классические методы, но это происходит не всегда. В отдельных режимах линейные и авторегрессионные baselines остаются конкурентоспособными или оказываются сильнее значительно более сложных архитектур.
Поэтому ключевой вопрос — не в сложности модели, а в том, сохраняется ли её преимущество при одинаковых данных, одинаковом временном разделении и одинаковых правилах оценки.
Этому мы посвятили отдельный материал: «Когда простой baseline побеждает AI: почему сложная модель не всегда лучше».
В статье мы рассматриваем эту проблему независимо от Tantoryn AI: зачем финансовому ML нужны простые baselines, почему победы на одной метрике недостаточно и почему отрицательный результат может быть полезнее ещё одного раунда настройки модели.
Что дальше
Следующий шаг в ML-направлении — не усложнять систему автоматически.
Сначала необходимо разобраться, почему простой ориентир оказался сильнее первой проверенной модели новой серии. Затем остальные подходы должны проходить через тот же принцип сравнения: дополнительная сложность должна доказать дополнительную ценность.
Параллельно продолжится работа над публичной частью Tantoryn AI и подготовкой проекта к расширению команды.
Главный результат последних недель поэтому состоит не в одной новой модели или функции. Проект постепенно становится более структурированным одновременно в трёх направлениях: исследования, публичная прозрачность и организация будущей команды.
А в ML мы снова получили результат, который считаем важным сохранять, даже когда он неудобен: если простой baseline оказывается сильнее сложного AI, правильный следующий шаг — не скрывать baseline, а выяснить почему.