As últimas três semanas na Tantoryn AI cobriram várias frentes ao mesmo tempo: o crescimento do lado público do projeto, a preparação para expandir a equipe, e a continuação de um longo ciclo de pesquisa em machine learning.
Preparando a próxima etapa do projeto
À medida que a Tantoryn AI cresce, começamos a remodelar a forma como o projeto é organizado internamente, para que funcione não apenas para seu fundador, mas também para as novas pessoas que se juntam a ele.
Colocamos a descrição da arquitetura do projeto e suas áreas de trabalho em uma forma sistemática, atualizamos o roadmap e começamos a construir um contexto separado para futuros membros da equipe. O roadmap mantém deliberadamente a ordem de desenvolvimento separada de datas indicativas: a sequência das etapas importa mais do que tentar prender o trabalho de pesquisa a um calendário rígido com antecedência.
Ao mesmo tempo, estamos nos preparando para expandir a equipe. Entre os primeiros cargos em consideração estão um Lead Developer e um Community Manager.
Para o Community Manager, uma área dedicada voltada ao público está gradualmente tomando forma: o site, publicações, plataformas sociais e feedback do nosso público. Mais adiante, planejamos apoiar parte desse trabalho através do TAICM — o Tantoryn AI Community Manager — mas publicações e respostas ainda exigirão aprovação humana. O próprio TAICM é, por enquanto, uma direção de desenvolvimento, não um sistema em operação.
Nosso lado público também cresceu
Durante o mesmo período, continuamos desenvolvendo nosso modelo de Build Público com Divulgação Controlada.
A ideia por trás disso é simples: falar não apenas sobre resultados bem-sucedidos, mas também sobre como a pesquisa está indo — as verificações, as hipóteses que se mostraram erradas e as razões pelas quais as decisões mudaram — sem publicar o núcleo de negociação, dados privados ou detalhes que efetivamente revelariam como o algoritmo do sistema funciona.
No site, expandimos os contatos e os links para os recursos públicos do projeto. As pesquisas da Tantoryn AI agora aparecem no Dzen e no Medium, também usamos o HackerNoon e outras plataformas públicas, e as notícias sobre o próprio projeto permanecem em tantoryn.com.
Essa separação importa para nós. Um artigo deve explicar um problema por seus próprios termos, independentemente da Tantoryn AI. Uma postagem de notícias do projeto deve mostrar exatamente onde encontramos aquele problema e o que mudamos em nosso trabalho como resultado.
É por isso que tentamos não copiar o mesmo material de uma plataforma para outra, e em vez disso conectamos textos de divulgação científica com a história prática de como o projeto está sendo construído.
Em ML, passamos por várias hipóteses que não funcionaram
Ainda assim, o trabalho de ML nos levou a uma conclusão prática importante: um modelo complexo tem valor não porque é complexo, mas apenas se sua vantagem sobrevive a uma comparação justa com soluções mais simples.
A maior parte do trabalho técnico das últimas semanas se concentrou no ML Evaluator — a camada de avaliação baseada em IA do projeto.
Testamos diferentes famílias de modelos e diferentes formas de enquadrar a tarefa, uma após a outra, usando etapas de desenvolvimento e validação separadas no tempo, execuções de treinamento repetidas e regras de experimento fixadas com antecedência.
Alguns dos resultados pareciam promissores em termos de quão bem os modelos conseguiam ranquear estados de mercado. Mas verificações adicionais expuseram um problema: um bom ranqueamento de ML ainda não significa que uma vantagem economicamente útil foi encontrada.
Não transformamos esse resultado em uma afirmação de um modelo de negociação bem-sucedido. Em vez disso, interrompemos essa linha de ajuste e repensamos como a própria tarefa estava enquadrada. O ramo de pesquisa foi fechado como um experimento histórico, sem afirmações de lucratividade ou prontidão para negociação real.
Isso levou a uma mudança mais fundamental. O papel do ML Evaluator foi trazido de volta a uma tarefa mais estreita: estimar quão provável é que um cenário de negociação se desenrole com sucesso dado o estado do mercado, enquanto o resultado econômico de todo o sistema é testado separadamente. Para isso, configuramos uma nova tarefa de classificação que distingue um resultado malsucedido, um parcialmente bem-sucedido e um bem-sucedido.
O novo modelo mostrou um sinal — mas o próximo problema apareceu
Depois de reformular a tarefa, preparamos um novo ciclo de treinamento e realizamos a primeira verificação completa de um dos modelos.
O resultado foi útil precisamente porque não deu uma resposta simples como "o modelo é bom" ou "o modelo é ruim".
O modelo mostrou, de fato, capacidade de distinguir estados de mercado mais promissores de menos promissores, e passou nas verificações definidas para essa etapa.
Ao mesmo tempo, comparamos com um ponto de referência muito mais simples, construído sobre um pequeno grupo de características básicas da situação de mercado.
Na verificação independente principal, o baseline simples se mostrou mais forte do que o modelo de ML complexo.
Isso não torna inútil o treinamento que fizemos. Pelo contrário, uma comparação como essa mostra que nossos controles de pesquisa estão funcionando: a complexidade adicionada ainda não provou que agrega valor.
É por isso que, agora, é mais importante para nós entender em qual informação o baseline simples se apoia, e por que o modelo mais complexo não conseguiu extrair mais dos dados, do que empurrar um número de modelo com boa aparência para cima a qualquer custo.
Analisamos esse problema separadamente
Em paralelo, olhamos para o quão típica é essa situação no ML financeiro moderno — e descobrimos que está longe de ser um problema específico da Tantoryn AI.
Compartilhamos as descobertas dessa pesquisa com mais detalhes em um artigo separado no Medium: "When a Simple Baseline Beats AI: Why More Complex Doesn’t Always Mean Better".
Pesquisas recentes sobre séries temporais financeiras pintam um quadro misto: abordagens modernas baseadas em redes neurais e Transformers podem de fato superar métodos clássicos, mas nem sempre. Em alguns regimes, baselines lineares e autorregressivos permanecem competitivos ou até superam arquiteturas muito mais complexas.
Portanto, a pergunta-chave não é quão complexo um modelo é, mas se sua vantagem se sustenta com os mesmos dados, a mesma divisão temporal e as mesmas regras de avaliação.
Escrevemos um texto separado sobre isso: "When a Simple Baseline Beats AI: Why More Complex Doesn’t Always Mean Better".
Nele, analisamos o problema de forma independente da Tantoryn AI: por que o ML financeiro precisa de baselines simples, por que uma vitória em uma única métrica não é suficiente, e por que um resultado negativo pode ser mais útil do que mais uma rodada de ajuste de modelo.
O que vem a seguir
O próximo passo em ML não é tornar o sistema mais complexo por padrão.
Primeiro, precisamos entender por que o ponto de referência simples se mostrou mais forte do que o primeiro modelo testado da nova série. Depois disso, as outras abordagens terão que passar pelo mesmo princípio de comparação: a complexidade adicionada precisa provar que agrega valor.
Paralelamente a isso, o trabalho continuará no lado público da Tantoryn AI e na preparação do projeto para uma equipe maior.
Assim, o principal resultado das últimas semanas não é um único modelo ou recurso novo. O projeto está gradualmente se tornando mais estruturado em três direções ao mesmo tempo: pesquisa, transparência pública e a organização de uma futura equipe.
E em ML, mais uma vez obtivemos um resultado que acreditamos valer a pena manter, mesmo quando é inconveniente: se um baseline simples se mostra mais forte do que uma IA complexa, o próximo passo correto não é esconder o baseline, mas descobrir por quê.