Las últimas tres semanas en Tantoryn AI cubrieron varios frentes a la vez: el crecimiento del lado público del proyecto, la preparación para ampliar el equipo, y la continuación de un largo ciclo de investigación en machine learning.
Preparándonos para la siguiente etapa del proyecto
A medida que Tantoryn AI crece, hemos comenzado a remodelar cómo se organiza internamente el proyecto, para que funcione no solo para su fundador, sino también para las nuevas personas que se incorporen.
Hemos sistematizado la descripción de la arquitectura del proyecto y sus áreas de trabajo, actualizado el roadmap y comenzado a construir un contexto separado para futuros miembros del equipo. El roadmap mantiene deliberadamente separados el orden de desarrollo y las fechas indicativas: la secuencia de etapas importa más que intentar atar de antemano el trabajo de investigación a un calendario rígido.
Al mismo tiempo, nos estamos preparando para ampliar el equipo. Entre los primeros roles bajo consideración están un Lead Developer y un Community Manager.
Para el Community Manager, está tomando forma gradualmente un área dedicada de cara al público: el sitio web, las publicaciones, las plataformas sociales y la retroalimentación de nuestra audiencia. Más adelante, planeamos apoyar parte de este trabajo a través de TAICM — el Tantoryn AI Community Manager — pero las publicaciones y respuestas seguirán requiriendo aprobación humana. El propio TAICM es, por ahora, una dirección de desarrollo, no un sistema en funcionamiento.
Nuestro lado público también ha crecido
Durante el mismo período, continuamos desarrollando nuestro modelo de Build Público con Divulgación Controlada.
La idea detrás de esto es simple: hablar no solo de resultados exitosos, sino también de cómo va la investigación — las verificaciones, las hipótesis que resultaron erróneas y las razones por las que cambiaron las decisiones — sin publicar el núcleo de trading, datos privados o detalles que efectivamente revelarían cómo funciona el algoritmo del sistema.
En el sitio web, ampliamos los contactos y los enlaces a los recursos públicos del proyecto. Los trabajos de investigación de Tantoryn AI ahora aparecen en Dzen y Medium, también usamos HackerNoon y otras plataformas públicas, y las noticias sobre el propio proyecto permanecen en tantoryn.com.
Esta separación es importante para nosotros. Un artículo debe explicar un problema en sus propios términos, independientemente de Tantoryn AI. Una publicación de noticias del proyecto debe mostrar exactamente dónde nos topamos con ese problema y qué cambiamos en nuestro trabajo como resultado.
Por eso intentamos no copiar el mismo material de una plataforma a otra, y en cambio conectamos piezas de divulgación científica con la historia práctica de cómo se está construyendo el proyecto.
En ML, pasamos por varias hipótesis que no funcionaron
Aun así, el trabajo de ML nos llevó a una conclusión práctica importante: un modelo complejo tiene valor no porque sea complejo, sino solo si su ventaja sobrevive a una comparación justa con soluciones más simples.
La mayor parte del trabajo técnico de las últimas semanas se centró en el ML Evaluator — la capa de evaluación basada en IA del proyecto.
Probamos diferentes familias de modelos y diferentes formas de plantear la tarea, una tras otra, usando etapas de desarrollo y validación separadas en el tiempo, ejecuciones de entrenamiento repetidas y reglas de experimento fijadas de antemano.
Algunos de los resultados parecían prometedores en términos de cuán bien podían los modelos ranquear estados de mercado. Pero verificaciones adicionales expusieron un problema: un buen ranking de ML todavía no significa que se haya encontrado una ventaja económicamente útil.
No convertimos ese resultado en una afirmación de un modelo de trading exitoso. En cambio, detuvimos esa línea de ajuste y repensamos cómo estaba planteada la tarea misma. La rama de investigación se cerró como un experimento histórico, sin afirmaciones de rentabilidad ni de preparación para el trading real.
Eso condujo a un cambio más fundamental. El papel del ML Evaluator se redujo a una tarea más estrecha: estimar qué tan probable es que un escenario de trading se desarrolle con éxito dado el estado del mercado, mientras que el resultado económico de todo el sistema se prueba por separado. Para esto configuramos una nueva tarea de clasificación que distingue un resultado fallido, uno parcialmente exitoso y uno exitoso.
El nuevo modelo mostró una señal — pero apareció el siguiente problema
Después de replantear la tarea, preparamos un nuevo ciclo de entrenamiento y realizamos la primera verificación completa de uno de los modelos.
El resultado fue útil precisamente porque no dio una respuesta simple como "el modelo es bueno" o "el modelo es malo".
El modelo sí mostró capacidad para distinguir estados de mercado más prometedores de otros menos prometedores, y pasó las verificaciones establecidas para esta etapa.
Al mismo tiempo, lo comparamos con un punto de referencia mucho más simple, construido sobre un pequeño grupo de características básicas de la situación de mercado.
En la verificación independiente clave, el baseline simple resultó más fuerte que el modelo de ML complejo.
Eso no hace inútil el entrenamiento que realizamos. Al contrario, una comparación así muestra que nuestros controles de investigación están funcionando: la complejidad añadida todavía no ha demostrado que aporte valor.
Por eso, en este momento, nos importa más entender en qué información se apoya el baseline simple, y por qué el modelo más complejo no pudo extraer más de los datos, que empujar a toda costa un número de modelo de buena apariencia hacia arriba.
Analizamos este problema por separado
En paralelo, observamos cuán típica es esta situación en el ML financiero moderno — y resultó estar lejos de ser un problema específico de Tantoryn AI.
Compartimos los hallazgos de esta investigación con más detalle en un artículo separado en Medium: "When a Simple Baseline Beats AI: Why More Complex Doesn’t Always Mean Better".
Investigaciones recientes sobre series temporales financieras pintan un panorama mixto: los enfoques modernos basados en redes neuronales y Transformers pueden, de hecho, superar a los métodos clásicos, pero no siempre. En algunos regímenes, los baselines lineales y autorregresivos siguen siendo competitivos o incluso superan a arquitecturas mucho más complejas.
Por lo tanto, la pregunta clave no es cuán complejo es un modelo, sino si su ventaja se mantiene con los mismos datos, la misma división temporal y las mismas reglas de evaluación.
Escribimos un texto aparte sobre esto: "When a Simple Baseline Beats AI: Why More Complex Doesn’t Always Mean Better".
En él, examinamos el problema de forma independiente de Tantoryn AI: por qué el ML financiero necesita baselines simples, por qué ganar en una sola métrica no es suficiente, y por qué un resultado negativo puede ser más útil que otra ronda de ajuste de modelo.
Qué sigue
El siguiente paso en ML no es hacer el sistema más complejo por defecto.
Primero, necesitamos entender por qué el punto de referencia simple resultó más fuerte que el primer modelo probado de la nueva serie. Después de eso, los demás enfoques tendrán que pasar por el mismo principio de comparación: la complejidad añadida tiene que demostrar que aporta valor.
Junto con esto, el trabajo continuará en el lado público de Tantoryn AI y en la preparación del proyecto para un equipo más grande.
Así, el resultado principal de las últimas semanas no es un único modelo o función nueva. El proyecto se está volviendo gradualmente más estructurado en tres direcciones a la vez: investigación, transparencia pública y la organización de un futuro equipo.
Y en ML, una vez más obtuvimos un resultado que creemos que vale la pena conservar, incluso cuando es inconveniente: si un baseline simple resulta más fuerte que una IA compleja, el siguiente paso correcto no es ocultar el baseline, sino averiguar por qué.