Finansal piyasalar için makine öğreniminde, çok cazip görünen bir backtest'i bile güvenilmez hale getirebilecek bir sorun var: model, kararın verildiği anda henüz var olmayan bilgiyi yanlışlıkla alabilir.

Bu konuyu genel bir kitle için ayrı olarak ele aldık; zamansal veri sızıntısının ne olduğunu, geçmişi bir eğitim dönemi ve bir test dönemine ayırmanın bazen tek başına neden yeterli olmadığını ve point-in-time verilerin — yani, o tarihsel anda gerçekten mevcut olduğu haliyle verilerin — neden önemli olduğunu sade bir dille açıklayan bir yazıda.

Bu ayrıntılı açıklamanın İngilizce versiyonu olan "Why a Trading AI Bot Can Accidentally “Know the Future” — and How to Prevent It", Medium'da yayımlandı.

Tantoryn AI için bu konunun pratik sonuçları var.

Veri hazırlarken ve ML sistemini doğrularken, bilginin bir modele ne zaman görünür hale geldiğini belirleyen ilkeyi ek olarak yeniden ele aldık. Doğru bir tarihsel deney için önemli olan, yalnızca bir değerin hangi tarihe ait olduğu değil, aynı zamanda o değerin sisteme gerçekten ne zaman bilinebilir hale gelmiş olabileceğidir.

Bu, gecikmeyle yayımlanan, daha sonra revize edilebilen veya henüz kapanmamış bir döneme ait olarak hesaplanan veriler için özellikle önemlidir.

Bu nedenle tarihsel veri hazırlarken basit bir kurala uyuyoruz:

bilgi karar anında henüz mevcut değilse, model bunu tarihsel testte de görmemelidir.

Bu yaklaşım sonuçları kâğıt üzerinde daha az etkileyici gösterebilir, ancak aynı zamanda sistemin doğrulanmasını daha sıkı ve gerçek koşullara daha yakın hale getirir.

Tantoryn AI için bu, daha geniş bir geliştirme ilkesinin parçasıdır: önce deneyin kendisinin doğru kurulduğundan emin olmak, ancak ondan sonra makine öğreniminin kalitesini değerlendirmek.

Verileri hazırlarken ve projenin ML bileşenlerini daha da doğrularken bu yaklaşımı uygulamaya devam ediyoruz.